Translation
Transformers
Safetensors
Susu
French
English
m2m_100
text2text-generation
susu
soussou
nllb
low-resource
Instructions to use 2ADT-Consulting/nllb-susu-v2 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use 2ADT-Consulting/nllb-susu-v2 with Transformers:
# Use a pipeline as a high-level helper # Warning: Pipeline type "translation" is no longer supported in transformers v5. # You must load the model directly (see below) or downgrade to v4.x with: # 'pip install "transformers<5.0.0' from transformers import pipeline pipe = pipeline("translation", model="2ADT-Consulting/nllb-susu-v2")# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("2ADT-Consulting/nllb-susu-v2") model = AutoModelForSeq2SeqLM.from_pretrained("2ADT-Consulting/nllb-susu-v2", device_map="auto") - Notebooks
- Google Colab
- Kaggle
NLLB-Susu v2 — Traducteur Soussou ↔ Français / Anglais
Modèle de traduction pour le soussou (susu/sosso, code ISO sus), langue de
Guinée. Version améliorée de nllb-susu-v1 :
fine-tuning de NLLB-200-distilled-600M
avec token de langue sus_Latn.
4 directions dans un seul modèle : fr↔sus, en↔sus.
Nouveau en v2 : comprend l'écriture « à la française » (SMS), vocabulaire du
quotidien enrichi, moins de biais biblique.
Scores (chrF++ sur jeu de dev)
| Direction | v1 | v2 |
|---|---|---|
| fr → sus | 48.9 | 49.5 |
| en → sus | 44.4 | 45.6 |
| sus → fr | 41.2 | 41.4 |
| sus → en | 38.9 | 39.6 |
| sus (écriture SMS) → fr | — | 39.8 |
Utilisation
import torch
from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("2ADT-Consulting/nllb-susu-v2")
model = AutoModelForSeq2SeqLM.from_pretrained("2ADT-Consulting/nllb-susu-v2")
def translate(text, src_lang, tgt_lang):
tok.src_lang = src_lang
inputs = tok(text, return_tensors="pt")
gen = model.generate(
**inputs,
forced_bos_token_id=tok.convert_tokens_to_ids(tgt_lang),
max_length=128, num_beams=4, no_repeat_ngram_size=3,
)
return tok.batch_decode(gen, skip_special_tokens=True)[0]
# codes : sus_Latn (soussou), fra_Latn (français), eng_Latn (anglais)
print(translate("Je vais au marché.", "fra_Latn", "sus_Latn"))
print(translate("I gnèrèma di?", "sus_Latn", "fra_Latn")) # écriture « à la française »
Données d'entraînement
- Corpus parallèle biblique (soussou latin ↔ fr/en), via YouVersion.
- Lexique du quotidien issu d'un dictionnaire soussou-français (~7 000 entrées).
- Dialogues du quotidien extraits d'un manuel d'apprentissage (Corps de la Paix).
- Augmentation orthographique : génération de variantes en écriture « à la française » (x→kh, u→ou, ɛ→è, ɔ→o, ɲ→gn...) pour comprendre l'usage réel.
- Données du quotidien sur-pondérées pour réduire le biais biblique.
Limitations
- Biais de registre biblique réduit mais encore présent.
- Pas encore validé par un locuteur natif.
Licence
CC-BY-NC-4.0 (héritée de NLLB-200). Données dérivées de traductions bibliques, d'un dictionnaire et d'un manuel — usage non commercial ; vérifier les conditions des sources avant redistribution.
- Downloads last month
- 32
Model tree for 2ADT-Consulting/nllb-susu-v2
Base model
facebook/nllb-200-distilled-600M