Diba-STT · دیبا-استیتی
A Persian speech-to-text model by Dibachain — offline and real-time مدل تبدیل گفتار به متن فارسی، ساختهی دیباچین — آفلاین و بلادرنگ
🌐 dibachain.ir · 🤖 Agent · Live demo · Diba-Base · Diba-Embed · Diba-Vision
English
Diba-STT transcribes spoken Persian into text. It runs fully offline — on a CPU, on a phone, or entirely in the browser — with no cloud and no GPU, and it works in real time as you speak. Part of the Diba model family from Dibachain.
Versions
Choose by the trade‑off between size and accuracy:
| Version | Size | Best for | Direct download |
|---|---|---|---|
| fa-small-0.42 | ~53 MB | real‑time, mobile, in‑browser (recommended default) | download |
| fa-0.42 | ~1.6 GB | highest accuracy, server / desktop | download |
| fa-small-0.5 | ~60 MB | small, desktop | download |
| fa-0.5 | ~1 GB | large vocabulary, server | download |
A browser‑ready package of the small model is at browser/diba-stt-fa-small.tar.gz for in‑page real‑time transcription.
What it can do
- Real‑time transcription of Persian speech from a microphone.
- Offline batch transcription of WAV audio (16 kHz, mono).
- On‑device use — desktop, mobile, or browser (WASM) — nothing leaves the device.
Quick start (Python)
Install the Diba-STT package:
pip install diba-stt
from diba_stt import DibaSTT
stt = DibaSTT("fa-small") # or "fa" for the large, more accurate model
print(stt.transcribe("audio.wav")) # 16 kHz mono WAV
Real time, from an audio stream:
stt = DibaSTT("fa-small")
for chunk in pcm_chunks: # 16-bit PCM bytes
print(stt.accept(chunk))
print(stt.final())
Models download automatically on first use. Available: fa-small (default), fa (most accurate), fa-small-0.5, fa-0.5.
In the browser (real-time)
The live demo Space transcribes your microphone in real time, entirely in your browser, using the packaged small model — sign in with your Hugging Face account to use it.
Limitations
Accuracy depends on microphone quality, background noise, and accent; the small models trade some accuracy for speed and size. Audio must be 16 kHz mono for the Python API. Best on clear, conversational Persian.
فارسی
دیبا-استیتی گفتار فارسی را به متن تبدیل میکند. کاملاً آفلاین اجرا میشود — روی CPU، روی گوشی، یا کاملاً داخل مرورگر — بدون ابر و بدون GPU، و بلادرنگ همزمان با صحبت شما کار میکند. بخشی از خانوادهی مدلهای دیبا ساختهی دیباچین.
نسخهها
بر اساس توازن حجم و دقت انتخاب کنید:
| نسخه | حجم | مناسبِ | دانلود مستقیم |
|---|---|---|---|
| fa-small-0.42 | حدود ۵۳ مگابایت | بلادرنگ، موبایل، مرورگر (پیشفرض پیشنهادی) | دانلود |
| fa-0.42 | حدود ۱٫۶ گیگابایت | بالاترین دقت، سرور / دسکتاپ | دانلود |
| fa-small-0.5 | حدود ۶۰ مگابایت | کوچک، دسکتاپ | دانلود |
| fa-0.5 | حدود ۱ گیگابایت | واژگان بزرگ، سرور | دانلود |
نسخهی آمادهی مرورگرِ مدل کوچک در browser/diba-stt-fa-small.tar.gz قرار دارد.
چه کاری انجام میدهد
- رونویسی بلادرنگ گفتار فارسی از میکروفون.
- رونویسی آفلاین فایل صوتی WAV (۱۶ کیلوهرتز، تککاناله).
- اجرای روی دستگاه — دسکتاپ، موبایل یا مرورگر — هیچ دادهای از دستگاه خارج نمیشود.
شروع سریع (پایتون)
pip install diba-stt
from diba_stt import DibaSTT
stt = DibaSTT("fa-small") # یا "fa" برای مدل بزرگ و دقیقتر
print(stt.transcribe("audio.wav")) # فایل WAV، ۱۶ کیلوهرتز، تککاناله
مدلها بار اول خودکار دانلود میشوند. نامها: fa-small (پیشفرض)، fa (دقیقترین)، fa-small-0.5، fa-0.5. صدا باید ۱۶ کیلوهرتز و تککاناله باشد.
داخل مرورگر (بلادرنگ)
صفحهی نمایش زنده میکروفون شما را بلادرنگ و کاملاً داخل مرورگر رونویسی میکند؛ برای استفاده با حساب Hugging Face خود وارد شوید.
محدودیتها
دقت به کیفیت میکروفون، نویز محیط و لهجه بستگی دارد؛ مدلهای کوچک بخشی از دقت را با سرعت و حجم عوض میکنند. برای API پایتون صدا باید ۱۶ کیلوهرتز تککاناله باشد. بهترین نتیجه روی گفتار فارسی واضح و محاورهای.