AnadilKurmanjiTTS — Kurmancî (Kurdish Kurmanji) Text-to-Speech Modeli

AnadilKurmanjiTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Kurmancî (Kurdish Kurmanji, ISO 639-3: kmr) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 65.102 segmentlik tek konuşmacılı bir veri setiyle eğitilmiştir — bu, "Anadil" ailesindeki (Lazca, Zazaca, Adığece, Kurmancî) en büyük ve en olgun modeldir.

AnadilKurmanjiTTS is an open-source text-to-speech LoRA adapter for Kurmanji Kurdish (kmr), fine-tuned on top of VoxCPM2 on 65,102 single-speaker utterances — the largest and most-trained model in the "Anadil" family of endangered-language TTS adapters (alongside sibling models for Laz, Zaza, and Adyghe). UNESCO classifies Kurdish Kurmanji as a language with significant diaspora communities in Turkey where intergenerational transmission is declining — among younger speakers in the Turkish diaspora, fluency has dropped substantially. This model is part of an effort to keep the language's sound alive in digital tools.

📋 Model Bilgileri

Özellik Detay
Dil Kurmancî (kmr)
Konuşucu spk_tmp_001 (tek konuşmacı)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi 65.102 segment — Anadil ailesinin en büyük veri seti
Eğitim adımı 10.000
Adapter boyutu ~70 MB (384 tensor, ~18,1M parametre, F32)
Sample rate 16 kHz giriş / 48 kHz çıkış
Lisans MIT

🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması

Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:

1. lê min bavê wî Xalê Cemo di nava gund de dîtiye.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

2. Ez dikarim bi hevokekê alîkariya we bikim.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

3. Ne poşman im ji qerarên xwe.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

4. Ev birayê min e.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

5. Heta ez bijîm, ez ê vê civînê bi kêfxweşî bibîr bînim.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

6. Civîna Putin û Erdogan bi dawî bû.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

⚡ Hızlı Başlangıç

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Kurmanji_TTS
cd Anadil_Kurmanji_TTS
python inference.py --text "[speaker:spk_tmp_001 language:kmr] Ez dikarim bi hevokekê alîkariya we bikim."

Python API

from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf

lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})

model = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=False,
    lora_config=lora_cfg,
    lora_weights_path="lora_weights.safetensors",
    device="cuda",  # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")

text = "[speaker:spk_tmp_001 language:kmr] Ez dikarim bi hevokekê alîkariya we bikim."
audio = model.generate(text=text, inference_timesteps=10, cfg_value=2.0)
sf.write("output.wav", audio, 48000)

Gradio arayüzü (yerel)

pip install gradio
python demo.py

Bu proje için barındırılan bir Hugging Face Space bilinçli olarak oluşturulmadı; demo.py yalnızca kendi bilgisayarınızda/sunucunuzda çalıştırmak içindir.

Hızlı doğrulama (smoke test)

python test_smoke.py --weights-only   # sadece ağırlık bütünlüğü, saniyeler sürer
python test_smoke.py                  # tam test (model indirme + gerçek ses üretimi)

🧩 Metin Formatı

Girdi metni şu formatta olmalı: [speaker:spk_tmp_001 language:kmr] <metin>inference.py/demo.py bu etiketi otomatik olarak modelin beklediği forma çevirir.

🖥️ Donanım Gereksinimleri

  • Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
  • RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
  • CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır

🌍 Neden Önemli

Kurmancî, Türkiye, Suriye, Irak ve İran'da milyonlarca konuşucusi olan bir dildir. Türkiye'deki büyük diaspora topluluğuyla birlikte, kuşaklar arası dil aktarımı ciddi biçimde zayıflamaktadır — özellikle genç nesiller arasında anadil akıcılığı kaybolmaktadır. Bu model, Kurmancînin dijital araçlarda (sesli asistanlar, eğitim materyalleri, erişilebilirlik uygulamaları) var olabilmesi için açık kaynak bir temel sunmayı amaçlıyor.

📚 Kaynaklar

📄 Lisans

MIT — bkz. LICENSE

🤝 Katkı ve İletişim

Sorun, geri bildirim veya katkı için lütfen bu deponun Community/Discussions sekmesini kullanın. Anadil.Org adresinden bizimle iletişime geçebilirsiniz.

Citation

@misc{anadilKurmanjiTTS2026,
  title  = {AnadilKurmanjiTTS: An Open-Source Text-to-Speech LoRA Adapter for Kurmanji Kurdish},
  author = {Anadilorg},
  year   = {2026},
  howpublished = {\url{https://huggingface.co/Anadilorg/Anadil_Kurmanji_TTS}}
}
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/Anadil_Kurmanji_TTS

Base model

openbmb/VoxCPM2
Adapter
(21)
this model

Paper for Anadilorg/Anadil_Kurmanji_TTS