BlueTTS — cinq langues
Finetune de BlueTTS v2 sur cinq langues : anglais, créole mauricien, français, malgache et ngiemboon. Arrêté au pas 9,000.
Trois de ces langues ne sont servies par presque aucun outil de synthèse. C'est la raison d'être de ce modèle.
Ce qui a été mesuré
Les mêmes six phrases à chaque checkpoint, dans les cinq langues, gelées au début de l'entraînement. Une phrase différente d'un checkpoint à l'autre changerait le résultat autant que le modèle.
| Langue | Sifflement médian | Pointe | Débit (car/s) | Écart au timbre |
|---|---|---|---|---|
| Anglais | 0.242 | 0.385 | 17.4 | 0.0125 |
| Francais | 0.251 | 0.275 | 19.7 | 0.0130 |
| Creole mauricien | 0.301 | 0.368 | 18.1 | 0.0090 |
| Ngiemboon | 0.278 | 0.291 | 13.4 | 0.0118 |
| Malgache | 0.295 | 0.541 | 21.1 | 0.0163 |
Sifflement : part d'énergie entre 6,5 et 13 kHz par trame, p90 sur l'extrait. Le seuil de rejet des corpus est 0.50 ; la voix humaine se tient vers 0,36.
Débit : caractères par seconde. Il révèle la diction hachée, dont le spectre est irréprochable.
Écart au timbre : distance cosinus entre l'empreinte MFCC de la voix produite et celle d'un témoin retiré du corpus. Il ne mesure pas une identité, seulement une dérive.
Ce qui ne va pas
Un grésillement métallique en arrière-plan, entendu à l'écoute et confirmé par la mesure. Il suit exactement le classement du sifflement : très marqué en malgache, faible en anglais. Les corpus sont à 24 kHz et le modèle rend du 44,1 kHz — la bande supérieure est inventée par le vocodeur.
La perte a plafonné vers 0,232 à partir du pas 5 000 et n'a plus bougé.
Le corpus ngiemboon contient un défaut connu : soixante-quatre voix prononcent un mot absent du texte, toujours le même pour une voix donnée. La correction est identifiée mais n'a pas été appliquée à cet entraînement.
Réglages
| architecture | BlueTTS v2.0.0, branche main |
| lot effectif | 14 x 4 |
| prédicteur de durée | 25,000 pas |
| voix par langue | au plus 500 |
| échantillonnage | 24 kHz en entrée, 44,1 kHz en sortie |
Les corpus : mimba/multivoice-en, mimba/multivoice-fr, mimba/multivoice-mfe, mimba/multivoice-nnh, mimba/multivoice-plt.
Les mesures complètes sont dans suivi/suivi.json — un objet par checkpoint,
détaillé par langue et par épreuve.
