CSM Clean 1M Multilingual v1 Adapter

Private LoRA adapter trained from sesame/csm-1b.

Run ID: csm_clean_1m_multilingual_v1

Data mix: 1,000,000 rows, 100,000 each for en,de,fr,es,it,pt,nl,pl,ja,tr from filtered YODAS2-Sidon speech.

Training: continued from csm_clean_context_multilingual_v9, 24,000 steps, LR 2e-6, batch 1, grad accumulation 8.

Known caveats:

  • v1 learned Turkish and English better than several other languages.
  • Final wrapper eval used refs in raw order, which over-conditioned many prompts on Italian/Spanish references; use same-language or no-reference eval controls for fair language checks.
  • Dataset rows use role: "0"; no real speaker-id conditioning is present in this adapter.
Downloads last month
4
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Codyfederer/csm-clean-1m-multilingual-v1-adapter

Base model

sesame/csm-1b
Adapter
(4)
this model