CosyVoice2 — PT-BR (CML-TTS -> NURC-SP ENTOA, segmentação prosódica)

Fine-tuning do CosyVoice2-0.5B em duas etapas:

  1. Adaptação de domínio no CML-TTS (subset português) — audiobooks, 24kHz.
  2. Fine-tuning no NURC-SP ENTOA TTS, config prosodic (segmentação por fronteiras prosódicas) — fala espontânea, sotaque paulistano.

llm: fine-tuning a partir do checkpoint do CML, melhor checkpoint por perda de validação.

flow: 30 épocas a partir do checkpoint pré-treinado original (não passou pela etapa do CML), melhor checkpoint.

Comparável ao irmão cosyvoice2-cml-nurc-automatic (mesma receita, segmentação automática via WhisperX em vez de prosódica) — comparação de estratégias de segmentação de dados para TTS.

Uso: ver repositório CosyVoice.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for neocia/cosyvoice2-cml-nurc-prosodic

Quantized
(12)
this model