Multilingual-Transfer
Collection
Pretraining models to find what allows multilingual transfer โข 36 items โข Updated โข 3
LLaMA-3 7B pretrained on English-Russian bilingual data, 133,600 total steps (v3 run).
Uses a shared 65k English-Russian tokenizer (65k_en1.0_ru1.0).
Last logged validation: step 132,264 (weights from step-133,500; step-133,600 checkpoint was empty due to async write not completing before job exit)
| Validation set | Cross-entropy loss (nats) | Perplexity |
|---|---|---|
| English (en) | 2.244 | 9.43 |
| Russian (ru) | 2.1955 | 8.98 |
Training and validation loss curves are in training_curves/:
train_en_ru_v3.csv โ step, train_loss (13,361 entries, steps 1โ133,600)val_en_ru_v3.csv โ step, lang, val_loss (100 checkpoints ร 2 languages, steps 1โ132,264)EEE-format evaluation results are stored under eval_results/eee/ in this repository.
Tasks: Global MMLU (EN), Global MMLU (RU), PIQA, ECLeKTic.
The-CoLab/llama3-7b-en-ru-v2 โ v2 run (injection fix)Part of the The-CoLab multilingual-transfer collection.