AnadilArmenianTTS — Ermenice (Armenian) Text-to-Speech Modeli

AnadilArmenianTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Ermenice (Armenian, ISO 639-3: hye) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 26.008 segmentlik tek konuşmacılı bir veri setiyle eğitilmiştir. Bu model, "Anadil" ailesindeki (Lazca, Zazaca, Adığece, Kurmancî, Ladino) diller arasına katılan, Anadolu'nun tarihi dilsel çeşitliliğini dijital araçlarla yaşatma hedefine hizmet eden en yeni üyedir.

AnadilArmenianTTS is an open-source text-to-speech LoRA adapter for Armenian (hye), fine-tuned on top of VoxCPM2 on 26,008 single-speaker utterances. It joins the "Anadil" family of Anatolia-rooted, mostly low-resource TTS adapters (alongside sibling models for Laz, Zaza, Adyghe, Kurmanji, and Ladino) — an open, transparent step toward keeping the language's sound present in digital tools.

ℹ️ Lehçe notu / Dialect note: Bu model, standart Ermeni alfabesiyle (Mesrobian yazı sistemi) yazılmış genel Ermenice metinlerle eğitilmiştir; eğitim verisinde Doğu Ermenicesi/Batı Ermenicesi (Eastern/Western Armenian) ayrımı ayrıca etiketlenmemiştir. Türkiye'deki Ermeni cemaatinin konuştuğu Batı Ermenicesi, UNESCO tarafından "kesinlikle tehlikede" (definitely endangered) olarak sınıflandırılır; bu model o özel varyantı hedeflemek yerine, genel yazılı Ermenice üzerinde eğitilmiş ilk açık kaynak adımdır. This model was trained on general written Armenian in standard (Mesrobian) orthography, without an explicit Eastern/Western Armenian split in the training labels. Western Armenian — the variety historically spoken by the Armenian community in Turkey — is classified by UNESCO as definitely endangered; this release targets general Armenian as a first open step rather than that specific variety.

📋 Model Bilgileri

Özellik Detay
Dil Ermenice / Armenian (hye)
Konuşucu spk_tmp_001 (tek konuşmacı)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi 26.008 segment — tek konuşmacı
Eğitim adımı 5.000
Adapter boyutu ~70 MB (384 tensor, ~18,1M parametre, F32)
Sample rate 16 kHz giriş / 48 kHz çıkış
Lisans MIT

🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması

Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:

1. Վիրտուալ մեքենայի գլխավոր թերությունը ցածր արագագործությունն է համարվում։

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

2. Քննադատները շոուն ջերմ են ընդունել։

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

3. Սակայն նրա մոտ դիադեմա չկար։

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

4. Այնուամենայնիվ, նկարչին հաջողվեց կերպարներին արտահայտչականություն հաղորդել և ցույց տալ նրանց էմոցիաները։

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

5. Այժմ այս շենքում ևս բացվել է նույնանուն առողջարան։

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

Ses dosyaları yükleme sırasında samples/ klasörüne eklenecektir; depo tamamlanmadan önce oynatıcılar 404 verebilir, bu normaldir.

⚡ Hızlı Başlangıç

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Armenian_TTS
cd Anadil_Armenian_TTS
python inference.py --text "[speaker:spk_tmp_001 language:hye] Բարև ձեզ, ինչպե՞ս եք։"

Python API

from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf

lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})

model = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=False,
    lora_config=lora_cfg,
    lora_weights_path="lora_weights.safetensors",
    device="cuda",  # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")

text = "[speaker:spk_tmp_001 language:hye] Բարև ձեզ, ինչպե՞ս եք։"
audio = model.generate(text=text, inference_timesteps=10, cfg_value=2.0)
sf.write("output.wav", audio, 48000)

Gradio arayüzü (yerel)

pip install gradio
python demo.py

Bu proje için barındırılan bir Hugging Face Space bilinçli olarak oluşturulmadı; demo.py yalnızca kendi bilgisayarınızda/sunucunuzda çalıştırmak içindir.

Hızlı doğrulama (smoke test)

python test_smoke.py --weights-only   # sadece ağırlık bütünlüğü, saniyeler sürer
python test_smoke.py                  # tam test (model indirme + gerçek ses üretimi)

🧩 Metin Formatı

Girdi metni şu formatta olmalı: [speaker:spk_tmp_001 language:hye] <metin>inference.py/demo.py bu etiketi otomatik olarak modelin beklediği forma çevirir. Metin, standart Ermeni alfabesiyle (Mesrobian yazı sistemi) yazılmalıdır.

🖥️ Donanım Gereksinimleri

  • Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
  • RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
  • CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır

⚠️ Sınırlamalar ve Bilinen Sorunlar

  • Lehçe etiketi yok: Eğitim verisi Doğu/Batı Ermenicesi ayrımı yapılmadan derlenmiştir (bkz. yukarıdaki lehçe notu); üretilen telaffuz tek bir konuşmacının kayıtlarına dayanır ve her iki varyantı da temsil etmeyebilir.
  • Tek konuşmacı: Model spk_tmp_001 konuşmacısının ses özelliklerini öğrenmiştir; ses klonlama veya çoklu konuşmacı desteği yoktur.
  • Nicel değerlendirme eksik: Şu an için model kalitesi yalnızca yukarıdaki orijinal/sentez ses karşılaştırmalarıyla niteliksel olarak gösterilmektedir; WER/MOS gibi nesnel ölçümler henüz yayınlanmamıştır.
  • Nadir kelime/özel isim telaffuzu: Eğitim verisinde az geçen yabancı kökenli kelimelerde veya özel isimlerde telaffuz tutarsızlıkları görülebilir.

🌍 Neden Önemli

Ermenice (Armenian), Ermenistan'ın resmî dili olup dünya genelinde milyonlarca konuşucusu bulunan, tehlike altında olmayan bir dildir. Ancak binlerce yıldır Anadolu'nun bir parçası olan Ermeni topluluklarının — özellikle 1915 sonrası büyük nüfus kaybı ve göç dalgalarıyla küçülen İstanbul Ermeni cemaatinin — konuştuğu Batı Ermenicesi (Western Armenian), UNESCO tarafından "kesinlikle tehlikede" olarak sınıflandırılır; kuşaklar arası aktarım ciddi biçimde zayıflamıştır. Bu model, Anadolu'nun tarihi dilsel mirasını dijital araçlarda (sesli asistanlar, eğitim materyalleri, arşivleme ve erişilebilirlik uygulamaları) görünür kılmayı amaçlayan "Anadil" ailesinin bir parçasıdır.

Armenian is the official language of Armenia and is spoken by millions worldwide — it is not an endangered language overall. However, Western Armenian, historically spoken by Armenian communities across Anatolia and still present today mainly in Istanbul, is classified by UNESCO as definitely endangered, following the community's drastic population loss after 1915 and subsequent waves of emigration; intergenerational transmission has weakened considerably. This model is part of the "Anadil" family's effort to make Anatolia's historical linguistic heritage present in digital tools — voice assistants, educational materials, archival and accessibility applications.

🌐 Anadil TTS Ailesi

Aynı VoxCPM2 + LoRA tarifiyle eğitilen, Türkiye'nin dilsel çeşitliliğine odaklanan açık kaynak TTS modelleri:

Model Dil Kod Eğitim verisi Not
Anadil_Kurmanji_TTS Kurmancî (Kurdish) kmr 65.102 Ailenin en büyük veri seti
AnadilAdygheTTS Adığece (Adyghe) ady 54.004
Anadil_Armenian_TTS (bu model) Ermenice (Armenian) hye 26.008
MozilLaz Lazca (Laz) lzz 21.071 Mozilla açık kaynak verisi
Anadil_Ladino_TTS Ladino (Judeo-Spanish) lad 2.283 Tek konuşmacı, temiz stüdyo kaydı
MozilLa_Zazaca_Alpha Zazaca (Zaza) zza ~1.700 Alpha sürüm, çok konuşmacı

📚 Kaynaklar

📄 Lisans

MIT — bkz. LICENSE

🤝 Katkı ve İletişim

Sorun, geri bildirim veya katkı için lütfen bu deponun Community/Discussions sekmesini kullanın. Anadil.Org adresinden bizimle iletişime geçebilirsiniz.

Citation

@misc{anadilArmenianTTS2026,
  title  = {AnadilArmenianTTS: An Open-Source Text-to-Speech LoRA Adapter for Armenian},
  author = {Anadilorg},
  year   = {2026},
  howpublished = {\url{https://huggingface.co/Anadilorg/Anadil_Armenian_TTS}}
}
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/Anadil_Armenian_TTS

Base model

openbmb/VoxCPM2
Adapter
(26)
this model

Paper for Anadilorg/Anadil_Armenian_TTS