Instructions to use zkartamx/sanoTTS-es-mx with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Piper
How to use zkartamx/sanoTTS-es-mx with Piper:
# No code snippets available yet for this library. # To use this model, check the repository files and the library's documentation. # Want to help? PRs adding snippets are welcome at: # https://github.com/huggingface/huggingface.js
- Notebooks
- Google Colab
- Kaggle
sanoTTS — Voz Español Mexicano (es_MX) 🇲🇽
Una voz sanoTTS mexicana, destilada desde el teacher Piper es_MX-ald-medium
(voz espeak es-419 = latinoamericana). ~1.56M parámetros en total
(duración + latente acústico + decoder), entrenada con destilación (Piper → 3
estudiantes), joint finetune y normalización G2P mexicana.
📦 Contenido
| Archivo | Qué es |
|---|---|
duration-student.pt |
modelo de duración |
latent-student.pt |
latente acústico (post-joint) |
decoder-student.pt |
decoder (post-joint) |
mexican_g2p_normalizer.py |
normalización G2P mexicana (topónimos/números) |
muestra1.wav…muestra3.wav |
audios de muestra |
🔊 Muestras
| # | Frase |
|---|---|
| 1 | "Voy a Oaxaca y Tlaxcala con mi familia." |
| 2 | "Cuesta 1,850 pesos, son 1,500,000,000 y mide 1,500 metros cuadrados." |
| 3 | "La celebración comunitaria incluyó danzas folclóricas, mariachi y buñuelos con piloncillo." |
🎧 Cómo usar
Estos son los checkpoints del modelo. Para sintetizar texto arbitrario:
- Cloná el repo
Ampixa/sanoTTSy seguí la receta de language porting (docs/roota-language-porting-recipe.md). - Cargá estos 3 checkpoints (duración, latente, decoder) como los estudiantes.
- Aplicá
mexican_g2p_normalizer.pyantes de fonemizar (espeak es-419 no conoce topónimos nahuatl como Oaxaca/Xalapa/Tlaxcala ni los formatos de números mexicanos).
⚠️ Importante: estos son los pesos del modelo (
.pt). Para usarlos en el runtime (navegador/microcontrolador) hay que exportarlos al formato de inferencia del repo (export_roota_self_contained_package.py), que aún no está en GitHub.
🏗️ Entrenamiento
- Teacher:
es_MX-ald-medium(Piper, MIT,rhasspy/piper-voices). - Corpus: español mexicano depurado/mexicanizado (~9k frases).
- Etapas: packs → duración → latente (15k) → decoder (15k) → joint finetune (6k).
- Normalización:
mexican_g2p_normalizer.pyaplicada al armado de packs y al serve.
🧠 Métricas (held-out)
- Latente acústico cosine: 0.837
- Decoder chunk cosine: 0.955 · oracle lane 0.957 · full-stack 0.105
📄 Licencia
Weights entrenados con datos del teacher Piper es_MX-ald-medium (MIT). El
proyecto sanoTTS es GPLv3 (runtime MIT). Consultá las licencias del repo original.
🙏 Créditos
- Proyecto original: Ampixa/sanoTTS
- Teacher: rhasspy/piper-voices
- Contribución de soporte español: PR en Ampixa/sanoTTS#6