CosyVoice2 — PT-BR (CML-TTS -> NURC-SP ENTOA, segmentação prosódica)
Fine-tuning do CosyVoice2-0.5B em duas etapas:
- Adaptação de domínio no CML-TTS (subset português) — audiobooks, 24kHz.
- Fine-tuning no NURC-SP ENTOA TTS, config
prosodic(segmentação por fronteiras prosódicas) — fala espontânea, sotaque paulistano.
llm: fine-tuning a partir do checkpoint do CML, melhor checkpoint por perda de validação.
flow: 30 épocas a partir do checkpoint pré-treinado original (não passou pela etapa do CML), melhor checkpoint.
Comparável ao irmão cosyvoice2-cml-nurc-automatic (mesma receita, segmentação automática via WhisperX em vez de prosódica) — comparação de estratégias de segmentação de dados para TTS.
Uso: ver repositório CosyVoice.
Model tree for neocia/cosyvoice2-cml-nurc-prosodic
Base model
FunAudioLLM/CosyVoice2-0.5B