Instructions to use TilQazyna/tq-small-kaz-1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use TilQazyna/tq-small-kaz-1 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("automatic-speech-recognition", model="TilQazyna/tq-small-kaz-1")# Load model directly from transformers import AutoProcessor, AutoModelForSpeechSeq2Seq processor = AutoProcessor.from_pretrained("TilQazyna/tq-small-kaz-1") model = AutoModelForSpeechSeq2Seq.from_pretrained("TilQazyna/tq-small-kaz-1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.
Log in or Sign Up to review the conditions and access this model content.
tq-small-kaz-1
Қазақ сөзін тануға бейімделген Whisper Small · Whisper Small для распознавания казахской речи · Whisper Small adapted for Kazakh speech recognition
Қазақша
tq-small-kaz-1 — қазақша аудионы мәтінге айналдыруға бейімделген Whisper Small ASR моделі. Репозиторий көлемі — 968.9 МБ; бағалау жиынындағы WER көрсеткіші 12.22%.
Құрылымы
| Сипаттама | Мәні |
|---|---|
| Архитектура | WhisperForConditionalGeneration |
| Негізгі модель | openai/whisper-small |
| Қабат саны | 12 |
| Сөздік көлемі | 51865 |
| Салмақ пішімі | safetensors |
Модель салмағы model.safetensors файлында жарияланған. Tokenizer, normalizer және аудионы алдын ала өңдеу конфигурациялары да осы репозиторийде сақталған. Файлдар Transformers жүктеу тәртібіне сай орналасқан.
Оқыту және бағалау
Модель audio2, audio3 және audio4 деректерінде fine-tune жасалған. Оқыту мен бағалау үлесі 90% және 10% болып бөлінген.
| Параметр | Мәні |
|---|---|
| Batch size | 8 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Warmup қадамы | 500 |
| Max қадам | 4000 |
| Дәлдік | FP16 |
| Бағалау метрикасы | WER 12.22% |
Аудио 16 kHz жиілікке келтірілген, одан кейін Whisper feature extractor log-Mel белгілерін шығарған. Транскрипттер қазақ тілі баптауы бар Whisper tokenizer арқылы өңделген.
Іске қосу
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
Код жергілікті input.wav файлын таниды. Модельді жүктеу үшін Hugging Face жүйесіндегі рұқсат берілген тіркелгі қолданылады.
Қолжетімділік
Карточка мен файлдардың атаулары баршаға көрінеді. Салмақтар «Request access» арқылы берілген өтінімді TilQazyna командасы мақұлдағаннан кейін жүктеледі.
Байланысты репозиторийлер
Үлкен нұсқасы — tq-large-kaz-1. Бағдарламадағы аудио деректер Til-Audio жинағында берілген.
Русский
tq-small-kaz-1 — модель ASR Whisper Small, дообученная для транскрибирования казахской речи. Репозиторий занимает 968.9 МБ; WER на оценочной выборке — 12.22%.
Устройство
| Характеристика | Значение |
|---|---|
| Архитектура | WhisperForConditionalGeneration |
| Базовая модель | openai/whisper-small |
| Слоёв | 12 |
| Размер словаря | 51865 |
| Формат весов | safetensors |
Веса модели опубликованы в model.safetensors. Репозиторий также содержит tokenizer, normalizer и конфигурацию предобработки аудио.
Обучение и оценка
Модель прошла fine-tune на данных audio2, audio3 и audio4. Данные разделили на обучающую и оценочную части в пропорции 90% и 10%.
| Параметр | Значение |
|---|---|
| Batch size | 8 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Шагов warmup | 500 |
| Max steps | 4000 |
| Точность | FP16 |
| Метрика оценки | WER 12.22% |
Аудио приводили к частоте 16 kHz, после чего Whisper feature extractor извлекал log-Mel признаки. Транскрипты обрабатывал Whisper tokenizer с настройкой казахского языка.
Как запустить
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
Код распознаёт локальный файл input.wav. Для загрузки модели используется учётная запись Hugging Face с одобренным доступом.
Доступ
Карточка и имена файлов открыты для просмотра. Веса скачиваются после заявки через «Request access» и решения команды TilQazyna.
Связанные репозитории
Большая версия опубликована как tq-large-kaz-1. Аудиоданные программы находятся в Til-Audio.
English
tq-small-kaz-1 is a Whisper Small ASR model fine-tuned to transcribe Kazakh speech. The repository occupies 968.9 MB, and the reported WER on the evaluation split is 12.22%.
Architecture
| Characteristic | Value |
|---|---|
| Architecture | WhisperForConditionalGeneration |
| Base model | openai/whisper-small |
| Layers | 12 |
| Vocabulary size | 51865 |
| Weight format | safetensors |
The model weights are published in model.safetensors. The repository also provides the tokenizer, normalizer, and audio preprocessing configuration.
Training and evaluation
The model was fine-tuned on the audio2, audio3, and audio4 data sources. The combined data was divided into 90% training and 10% evaluation splits.
| Setting | Value |
|---|---|
| Batch size | 8 |
| Gradient accumulation | 2 |
| Learning rate | 1e-5 |
| Warmup steps | 500 |
| Max steps | 4000 |
| Precision | FP16 |
| Evaluation metric | WER 12.22% |
Audio was resampled to 16 kHz before the Whisper feature extractor produced log-Mel features. Transcripts were processed with the Whisper tokenizer configured for Kazakh.
Inference
from transformers import pipeline
asr = pipeline(
"automatic-speech-recognition",
model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])
The example transcribes a local input.wav file. Loading the model requires a Hugging Face account with approved access.
Access
The repository card and file names are visible for inspection. Weight downloads open after the TilQazyna team approves an application submitted through “Request access.”
Related repositories
The larger model is available as tq-large-kaz-1. Program audio data is published in Til-Audio.
Лицензия · License: mit · TilQazyna
- Downloads last month
- -
Model tree for TilQazyna/tq-small-kaz-1
Base model
openai/whisper-small