You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Log in or Sign Up to review the conditions and access this model content.

BlueTTS — cinq langues

Finetune de BlueTTS v2 sur cinq langues : anglais, créole mauricien, français, malgache et ngiemboon. Arrêté au pas 9,000.

Trois de ces langues ne sont servies par presque aucun outil de synthèse. C'est la raison d'être de ce modèle.

Ce qui a été mesuré

Les mêmes six phrases à chaque checkpoint, dans les cinq langues, gelées au début de l'entraînement. Une phrase différente d'un checkpoint à l'autre changerait le résultat autant que le modèle.

évolution

Langue Sifflement médian Pointe Débit (car/s) Écart au timbre
Anglais 0.242 0.385 17.4 0.0125
Francais 0.251 0.275 19.7 0.0130
Creole mauricien 0.301 0.368 18.1 0.0090
Ngiemboon 0.278 0.291 13.4 0.0118
Malgache 0.295 0.541 21.1 0.0163

Sifflement : part d'énergie entre 6,5 et 13 kHz par trame, p90 sur l'extrait. Le seuil de rejet des corpus est 0.50 ; la voix humaine se tient vers 0,36.

Débit : caractères par seconde. Il révèle la diction hachée, dont le spectre est irréprochable.

Écart au timbre : distance cosinus entre l'empreinte MFCC de la voix produite et celle d'un témoin retiré du corpus. Il ne mesure pas une identité, seulement une dérive.

Ce qui ne va pas

Un grésillement métallique en arrière-plan, entendu à l'écoute et confirmé par la mesure. Il suit exactement le classement du sifflement : très marqué en malgache, faible en anglais. Les corpus sont à 24 kHz et le modèle rend du 44,1 kHz — la bande supérieure est inventée par le vocodeur.

La perte a plafonné vers 0,232 à partir du pas 5 000 et n'a plus bougé.

Le corpus ngiemboon contient un défaut connu : soixante-quatre voix prononcent un mot absent du texte, toujours le même pour une voix donnée. La correction est identifiée mais n'a pas été appliquée à cet entraînement.

Réglages

architecture BlueTTS v2.0.0, branche main
lot effectif 14 x 4
prédicteur de durée 25,000 pas
voix par langue au plus 500
échantillonnage 24 kHz en entrée, 44,1 kHz en sortie

Les corpus : mimba/multivoice-en, mimba/multivoice-fr, mimba/multivoice-mfe, mimba/multivoice-nnh, mimba/multivoice-plt.

Les mesures complètes sont dans suivi/suivi.json — un objet par checkpoint, détaillé par langue et par épreuve.

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support