EN-MN Human Rights Translator

Fine-tune of facebook/nllb-200-distilled-600M for English-to-Mongolian translation, specialized on human rights terminology.

  • Source language code: eng_Latn
  • Target language code: khk_Cyrl (NLLB/FLORES-200 code for Halh Mongolian; note this is not mon_Cyrl, which does not exist in NLLB's vocabulary)

Training data

~4,000 professionally translated EN-MN sentence pairs from human rights reports and legal documents, deduplicated and split 80/10/10 into train/val/test.

Test set results

Metric Score
BLEU (sacrebleu) 17.56
chrF 47.39

Usage

from transformers import AutoModelForSeq2SeqLM
from transformers.models.nllb.tokenization_nllb import NllbTokenizer

model_id = "Oyunbat26/mongolian-en-mn-translator"
tokenizer = NllbTokenizer.from_pretrained(model_id, src_lang="eng_Latn", tgt_lang="khk_Cyrl")
model = AutoModelForSeq2SeqLM.from_pretrained(model_id)
model.generation_config.forced_bos_token_id = tokenizer.convert_tokens_to_ids("khk_Cyrl")

inputs = tokenizer("Human rights are universal.", return_tensors="pt")
output = model.generate(**inputs, max_length=128, num_beams=4)
print(tokenizer.batch_decode(output, skip_special_tokens=True)[0])
Downloads last month
18
Safetensors
Model size
0.6B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Oyunbat26/mongolian-en-mn-translator

Finetuned
(330)
this model