AnadilLadinoTTS — Ladino (Judeo-Spanish / Djudeo-Espanyol) Text-to-Speech Modeli

AnadilLadinoTTS, openbmb/VoxCPM2 temel modeli üzerine LoRA (Low-Rank Adaptation) ile ince ayar yapılmış, Ladino (Judeo-Spanish / Judezmo, ISO 639-3: lad) için açık kaynak bir konuşma sentezi (text-to-speech) modelidir. 2.283 segmentlik tek konuşmacılı bir veri setiyle eğitilmiştir. Ladino, Osmanlı topraklarına yerleşen Sefarad Yahudilerinin konuştuğu, Eski İspanyolca temelli, günümüzde UNESCO tarafından kritik derecede tehlikede sınıflandırılan bir dildir — bu model, "Anadil" ailesindeki (Lazca, Zazaca, Adığece, Kurmancî) diller arasına katılan en yeni ve en az kaynağa sahip dil için hazırlanmıştır.

AnadilLadinoTTS is an open-source text-to-speech LoRA adapter for Ladino (Judeo-Spanish, lad), fine-tuned on top of VoxCPM2 on 2,283 single-speaker utterances. Ladino is the Old Spanish-derived language historically spoken by Sephardic Jewish communities across the former Ottoman Empire; UNESCO classifies it as critically endangered, with only a small number of mostly elderly speakers remaining today. This model joins the "Anadil" family of endangered-language TTS adapters (alongside sibling models for Laz, Zaza, Adyghe, and Kurmanji) as an early, transparent step toward keeping Ladino's sound alive in digital tools — the training set is intentionally modest in size, and results should be evaluated with that in mind.

📋 Model Bilgileri

Özellik Detay
Dil Ladino / Judeo-Spanish (lad)
Konuşucu spk_tmp_001 (tek konuşmacı)
Temel model openbmb/VoxCPM2
Yöntem LoRA (r=32, α=32, LM + DiT katmanları)
Eğitim verisi 2.283 segment — tek konuşmacı, temiz kayıt
Eğitim adımı 10.000
Adapter boyutu ~70 MB (384 tensor, ~18,1M parametre, F32)
Sample rate 16 kHz giriş / 48 kHz çıkış
Lisans MIT

⚠️ Veri boyutu notu / Data size note: Bu model, aile içindeki diğer modellere (ör. 65.102 segmentlik Kurmancî modeli) kıyasla çok daha küçük bir veri setiyle (2.283 segment) eğitilmiştir. Tek konuşmacı ve temiz stüdyo kaydı sayesinde ses kalitesi tutarlıdır, ancak kelime/telaffuz çeşitliliği sınırlı olabilir. This model was trained on a considerably smaller dataset (2,283 segments) than other models in the family (e.g. the 65,102-segment Kurmanji model). Voice quality is consistent thanks to a single clean-studio speaker, but lexical/pronunciation coverage may be limited.

🔊 Örnek Sesler — Orijinal ve Sentez Karşılaştırması

Aşağıda orijinal referans ses (gerçek konuşmacı) ile modelin ürettiği sentez (TTS) arasındaki farkları duyabilirsiniz:

1. Sara beve ocho kaves al dia, lo mas kafe turko.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

2. Kuando era chika mos ivamos a Prinkipo (Büyükada) los enveranos.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

3. La populasion de Estambol es tan grande ke no esta podiendo azer inyeve.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

4. El teatro es komo un virus. Kuando entra en la sangre no sa va kolay kolay.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

5. Berta, muestra amiga de Büyükada?

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

6. Eyas estan aziendo muabbet mientras ke estan asperando a los chikos.

Orijinal (Gerçek Konuşmacı) Sentez (Model Çıktısı)

⚡ Hızlı Başlangıç

pip install torch torchaudio soundfile safetensors numpy voxcpm
git clone https://huggingface.co/Anadilorg/Anadil_Ladino_TTS
cd Anadil_Ladino_TTS
python inference.py --text "[speaker:spk_tmp_001 language:lad] Me esto ambezando el Judeo-Espanyol."

Python API

from voxcpm import VoxCPM
from voxcpm.model.voxcpm import LoRAConfig
import json, soundfile as sf

lora_cfg_dict = json.load(open("lora_config.json"))["lora_config"]
lora_cfg = LoRAConfig(**{k: v for k, v in lora_cfg_dict.items() if k in LoRAConfig.model_fields})

model = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=False,
    lora_config=lora_cfg,
    lora_weights_path="lora_weights.safetensors",
    device="cuda",  # veya "mps" / "cpu"
)
model.load_lora("lora_weights.safetensors")

text = "[speaker:spk_tmp_001 language:lad] Me esto ambezando el Judeo-Espanyol."
audio = model.generate(text=text, inference_timesteps=10, cfg_value=2.0)
sf.write("output.wav", audio, 48000)

Gradio arayüzü (yerel)

pip install gradio
python demo.py

Bu proje için barındırılan bir Hugging Face Space bilinçli olarak oluşturulmadı; demo.py yalnızca kendi bilgisayarınızda/sunucunuzda çalıştırmak içindir.

Hızlı doğrulama (smoke test)

python test_smoke.py --weights-only   # sadece ağırlık bütünlüğü, saniyeler sürer
python test_smoke.py                  # tam test (model indirme + gerçek ses üretimi)

🧩 Metin Formatı

Girdi metni şu formatta olmalı: [speaker:spk_tmp_001 language:lad] <metin>inference.py/demo.py bu etiketi otomatik olarak modelin beklediği forma çevirir. Ladino, geleneksel olarak birden fazla yazım biçimiyle (Latin/Aki Yerushalayim, Rashi/İbrani alfabesi) yazılmıştır; bu model Latin alfabesi (Aki Yerushalayim yazım kuralları) ile eğitilmiştir.

🖥️ Donanım Gereksinimleri

  • Disk: ~4,7 GB (VoxCPM2 temel model + LoRA ağırlıkları)
  • RAM/VRAM: float32 çıkarım için ~9 GB; CUDA GPU'da bfloat16 ile daha az
  • CUDA GPU önerilir; Apple Silicon (≥24 GB birleşik bellek) desteklenir ama daha yavaştır

🌍 Neden Önemli

Ladino (Judeo-Spanish), 15. yüzyılda İspanya'dan sürülen Sefarad Yahudilerinin Osmanlı topraklarında geliştirdiği, Eski Kastilya İspanyolcasına dayanan bir dildir — İstanbul, İzmir, Selanik ve Balkanlar'daki Sefarad topluluklarının yüzyıllar boyunca gündelik dili olmuştur. UNESCO, Ladino'yu kritik derecede tehlikede olan diller arasında sınıflandırır; günümüzde konuşucuların büyük çoğunluğu ileri yaştadır ve kuşaklar arası aktarım neredeyse durmuştur. Bu model, Ladino'nun sesini dijital araçlarda (sesli asistanlar, eğitim materyalleri, arşivleme ve erişilebilirlik uygulamaları) yaşatabilmek için açık kaynak bir temel sunmayı amaçlıyor.

Ladino (Judeo-Spanish) descends from Old Castilian Spanish, carried and preserved by Sephardic Jewish communities expelled from Spain in 1492 who settled across the Ottoman Empire — in Istanbul, Izmir, Thessaloniki, and the Balkans. UNESCO classifies it as critically endangered: most remaining speakers are elderly, and intergenerational transmission has largely stopped. This model aims to provide an open-source foundation for keeping Ladino's sound present in digital tools — voice assistants, educational materials, archival and accessibility applications.

📚 Kaynaklar

📄 Lisans

MIT — bkz. LICENSE

🤝 Katkı ve İletişim

Sorun, geri bildirim veya katkı için lütfen bu deponun Community/Discussions sekmesini kullanın. Anadil.Org adresinden bizimle iletişime geçebilirsiniz.

Citation

@misc{anadilLadinoTTS2026,
  title  = {AnadilLadinoTTS: An Open-Source Text-to-Speech LoRA Adapter for Ladino (Judeo-Spanish)},
  author = {Anadilorg},
  year   = {2026},
  howpublished = {\url{https://huggingface.co/Anadilorg/Anadil_Ladino_TTS}}
}
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Anadilorg/Anadil_Ladino_TTS

Base model

openbmb/VoxCPM2
Adapter
(23)
this model

Paper for Anadilorg/Anadil_Ladino_TTS