ca_ES-ona-high — veu catalana femenina per a Piper

Veu sintètica en català central, de qualitat alta, per al sintetitzador Piper. 22.050 Hz, un sol parlant.

Entrenada per al projecte RVIURE, una plataforma de companyia conversacional per a gent gran a residències. La fem servir perquè l'avatar no depengui de les veus instal·lades a cada telèfon: hi va haver una resident castellanoparlant que es va quedar sense avatar perquè el seu Android no tenia cap veu instal·lada.

Com s'ha fet

  • Gravacions: la locutora «ona» del corpus UPC-FestCat (6,86 h), distribuït per Col·lectivaT: https://collectivat.cat/asr#upc-festcat-tts-corpora
  • Model de partida: en_US-ljspeech-high dels punts de control de Piper, entrenat sobre el corpus LJ Speech, que és de domini públic.
  • Entrenament: 278 passades d'ajust fi sobre les gravacions de l'Ona.

Qualitat

Mesurada fent-li dir 12 frases de conversa, tres vegades cadascuna, i fent-les escoltar per Whisper (model «small», en català):

Veu Errors per cada 100 paraules
ca_ES-upc_ona-medium (la de referència fins ara) 6,5
aquesta 3,0

Amb 30 frases de lectura del mateix corpus, més difícils: 12,9 errors, davant dels 10,5 que fa la locutora real gravada, mesurada igual.

No necessita cap retoc dels fonemes: pronuncia bé la erra forta d'inici de paraula, que amb el model de qualitat mitjana obligava a reforçar-la a mà.

Llicència i atribució

CC BY-SA 3.0, la mateixa que les gravacions originals. Si la feu servir, heu de citar la Universitat Politècnica de Catalunya (corpus UPC-FestCat) i Col·lectivaT, i distribuir qualsevol obra derivada amb la mateixa llicència.

Avís

És una veu sintètica. Qualsevol aplicació que la faci servir hauria de deixar clar a qui l'escolta que no està parlant amb una persona.

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support