Diba-STT · دیبا-اس‌تی‌تی

A Persian speech-to-text model by Dibachain — offline and real-time مدل تبدیل گفتار به متن فارسی، ساخته‌ی دیباچین — آفلاین و بلادرنگ

🌐 dibachain.ir · 🤖 Agent · Live demo · Diba-Base · Diba-Embed · Diba-Vision


English

Diba-STT transcribes spoken Persian into text. It runs fully offline — on a CPU, on a phone, or entirely in the browser — with no cloud and no GPU, and it works in real time as you speak. Part of the Diba model family from Dibachain.

Versions

Choose by the trade‑off between size and accuracy:

Version Size Best for Direct download
fa-small-0.42 ~53 MB real‑time, mobile, in‑browser (recommended default) download
fa-0.42 ~1.6 GB highest accuracy, server / desktop download
fa-small-0.5 ~60 MB small, desktop download
fa-0.5 ~1 GB large vocabulary, server download

A browser‑ready package of the small model is at browser/diba-stt-fa-small.tar.gz for in‑page real‑time transcription.

What it can do

  • Real‑time transcription of Persian speech from a microphone.
  • Offline batch transcription of WAV audio (16 kHz, mono).
  • On‑device use — desktop, mobile, or browser (WASM) — nothing leaves the device.

Quick start (Python)

Install the Diba-STT package:

pip install diba-stt
from diba_stt import DibaSTT

stt = DibaSTT("fa-small")            # or "fa" for the large, more accurate model
print(stt.transcribe("audio.wav"))   # 16 kHz mono WAV

Real time, from an audio stream:

stt = DibaSTT("fa-small")
for chunk in pcm_chunks:             # 16-bit PCM bytes
    print(stt.accept(chunk))
print(stt.final())

Models download automatically on first use. Available: fa-small (default), fa (most accurate), fa-small-0.5, fa-0.5.

In the browser (real-time)

The live demo Space transcribes your microphone in real time, entirely in your browser, using the packaged small model — sign in with your Hugging Face account to use it.

Limitations

Accuracy depends on microphone quality, background noise, and accent; the small models trade some accuracy for speed and size. Audio must be 16 kHz mono for the Python API. Best on clear, conversational Persian.


فارسی

دیبا-اس‌تی‌تی گفتار فارسی را به متن تبدیل می‌کند. کاملاً آفلاین اجرا می‌شود — روی CPU، روی گوشی، یا کاملاً داخل مرورگر — بدون ابر و بدون GPU، و بلادرنگ همزمان با صحبت شما کار می‌کند. بخشی از خانواده‌ی مدل‌های دیبا ساخته‌ی دیباچین.

نسخه‌ها

بر اساس توازن حجم و دقت انتخاب کنید:

نسخه حجم مناسبِ دانلود مستقیم
fa-small-0.42 حدود ۵۳ مگابایت بلادرنگ، موبایل، مرورگر (پیش‌فرض پیشنهادی) دانلود
fa-0.42 حدود ۱٫۶ گیگابایت بالاترین دقت، سرور / دسکتاپ دانلود
fa-small-0.5 حدود ۶۰ مگابایت کوچک، دسکتاپ دانلود
fa-0.5 حدود ۱ گیگابایت واژگان بزرگ، سرور دانلود

نسخه‌ی آماده‌ی مرورگرِ مدل کوچک در browser/diba-stt-fa-small.tar.gz قرار دارد.

چه کاری انجام می‌دهد

  • رونویسی بلادرنگ گفتار فارسی از میکروفون.
  • رونویسی آفلاین فایل صوتی WAV (۱۶ کیلوهرتز، تک‌کاناله).
  • اجرای روی دستگاه — دسکتاپ، موبایل یا مرورگر — هیچ داده‌ای از دستگاه خارج نمی‌شود.

شروع سریع (پایتون)

pip install diba-stt
from diba_stt import DibaSTT

stt = DibaSTT("fa-small")            # یا "fa" برای مدل بزرگ و دقیق‌تر
print(stt.transcribe("audio.wav"))   # فایل WAV، ۱۶ کیلوهرتز، تک‌کاناله

مدل‌ها بار اول خودکار دانلود می‌شوند. نام‌ها: fa-small (پیش‌فرض)، fa (دقیق‌ترین)، fa-small-0.5، fa-0.5. صدا باید ۱۶ کیلوهرتز و تک‌کاناله باشد.

داخل مرورگر (بلادرنگ)

صفحه‌ی نمایش زنده میکروفون شما را بلادرنگ و کاملاً داخل مرورگر رونویسی می‌کند؛ برای استفاده با حساب Hugging Face خود وارد شوید.

محدودیت‌ها

دقت به کیفیت میکروفون، نویز محیط و لهجه بستگی دارد؛ مدل‌های کوچک بخشی از دقت را با سرعت و حجم عوض می‌کنند. برای API پایتون صدا باید ۱۶ کیلوهرتز تک‌کاناله باشد. بهترین نتیجه روی گفتار فارسی واضح و محاوره‌ای.


خانواده‌ی دیبا · The Diba family — Diba-Base · Diba-Embed · Diba-Vision · Diba-STT · Diba-Code · Diba-TTS · Diba-Image · Diba-ImageEdit

Built by Dibachain · ساخته‌ی دیباچین

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Space using Dibachain/Diba-STT 1