You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

tq-small-kaz-1

Қазақ сөзін тануға бейімделген Whisper Small · Whisper Small для распознавания казахской речи · Whisper Small adapted for Kazakh speech recognition

Қазақша · Русский · English


Қазақша

tq-small-kaz-1 — қазақша аудионы мәтінге айналдыруға бейімделген Whisper Small ASR моделі. Репозиторий көлемі — 968.9 МБ; бағалау жиынындағы WER көрсеткіші 12.22%.

Құрылымы

Сипаттама Мәні
Архитектура WhisperForConditionalGeneration
Негізгі модель openai/whisper-small
Қабат саны 12
Сөздік көлемі 51865
Салмақ пішімі safetensors

Модель салмағы model.safetensors файлында жарияланған. Tokenizer, normalizer және аудионы алдын ала өңдеу конфигурациялары да осы репозиторийде сақталған. Файлдар Transformers жүктеу тәртібіне сай орналасқан.

Оқыту және бағалау

Модель audio2, audio3 және audio4 деректерінде fine-tune жасалған. Оқыту мен бағалау үлесі 90% және 10% болып бөлінген.

Параметр Мәні
Batch size 8
Gradient accumulation 2
Learning rate 1e-5
Warmup қадамы 500
Max қадам 4000
Дәлдік FP16
Бағалау метрикасы WER 12.22%

Аудио 16 kHz жиілікке келтірілген, одан кейін Whisper feature extractor log-Mel белгілерін шығарған. Транскрипттер қазақ тілі баптауы бар Whisper tokenizer арқылы өңделген.

Іске қосу

from transformers import pipeline

asr = pipeline(
    "automatic-speech-recognition",
    model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])

Код жергілікті input.wav файлын таниды. Модельді жүктеу үшін Hugging Face жүйесіндегі рұқсат берілген тіркелгі қолданылады.

Қолжетімділік

Карточка мен файлдардың атаулары баршаға көрінеді. Салмақтар «Request access» арқылы берілген өтінімді TilQazyna командасы мақұлдағаннан кейін жүктеледі.

Байланысты репозиторийлер

Үлкен нұсқасы — tq-large-kaz-1. Бағдарламадағы аудио деректер Til-Audio жинағында берілген.


Русский

tq-small-kaz-1 — модель ASR Whisper Small, дообученная для транскрибирования казахской речи. Репозиторий занимает 968.9 МБ; WER на оценочной выборке — 12.22%.

Устройство

Характеристика Значение
Архитектура WhisperForConditionalGeneration
Базовая модель openai/whisper-small
Слоёв 12
Размер словаря 51865
Формат весов safetensors

Веса модели опубликованы в model.safetensors. Репозиторий также содержит tokenizer, normalizer и конфигурацию предобработки аудио.

Обучение и оценка

Модель прошла fine-tune на данных audio2, audio3 и audio4. Данные разделили на обучающую и оценочную части в пропорции 90% и 10%.

Параметр Значение
Batch size 8
Gradient accumulation 2
Learning rate 1e-5
Шагов warmup 500
Max steps 4000
Точность FP16
Метрика оценки WER 12.22%

Аудио приводили к частоте 16 kHz, после чего Whisper feature extractor извлекал log-Mel признаки. Транскрипты обрабатывал Whisper tokenizer с настройкой казахского языка.

Как запустить

from transformers import pipeline

asr = pipeline(
    "automatic-speech-recognition",
    model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])

Код распознаёт локальный файл input.wav. Для загрузки модели используется учётная запись Hugging Face с одобренным доступом.

Доступ

Карточка и имена файлов открыты для просмотра. Веса скачиваются после заявки через «Request access» и решения команды TilQazyna.

Связанные репозитории

Большая версия опубликована как tq-large-kaz-1. Аудиоданные программы находятся в Til-Audio.


English

tq-small-kaz-1 is a Whisper Small ASR model fine-tuned to transcribe Kazakh speech. The repository occupies 968.9 MB, and the reported WER on the evaluation split is 12.22%.

Architecture

Characteristic Value
Architecture WhisperForConditionalGeneration
Base model openai/whisper-small
Layers 12
Vocabulary size 51865
Weight format safetensors

The model weights are published in model.safetensors. The repository also provides the tokenizer, normalizer, and audio preprocessing configuration.

Training and evaluation

The model was fine-tuned on the audio2, audio3, and audio4 data sources. The combined data was divided into 90% training and 10% evaluation splits.

Setting Value
Batch size 8
Gradient accumulation 2
Learning rate 1e-5
Warmup steps 500
Max steps 4000
Precision FP16
Evaluation metric WER 12.22%

Audio was resampled to 16 kHz before the Whisper feature extractor produced log-Mel features. Transcripts were processed with the Whisper tokenizer configured for Kazakh.

Inference

from transformers import pipeline

asr = pipeline(
    "automatic-speech-recognition",
    model="TilQazyna/tq-small-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])

The example transcribes a local input.wav file. Loading the model requires a Hugging Face account with approved access.

Access

The repository card and file names are visible for inspection. Weight downloads open after the TilQazyna team approves an application submitted through “Request access.”

Related repositories

The larger model is available as tq-large-kaz-1. Program audio data is published in Til-Audio.


Лицензия · License: mit · TilQazyna

Downloads last month
-
Safetensors
Model size
0.2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/tq-small-kaz-1

Finetuned
(3703)
this model

Collections including TilQazyna/tq-small-kaz-1