You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

tq-large-kaz-1

Қазақ сөзін тануға бейімделген Whisper Large v3 · Whisper Large v3 для распознавания казахской речи · Whisper Large v3 adapted for Kazakh speech recognition

Қазақша · Русский · English


Қазақша

tq-large-kaz-1 — қазақша аудионы мәтінге айналдыруға бейімделген Whisper Large v3 ASR моделі. Репозиторий көлемі — 6.18 ГБ; бағалау жиынындағы WER көрсеткіші 8.51%.

Құрылымы

Сипаттама Мәні
Архитектура WhisperForConditionalGeneration
Негізгі модель openai/whisper-large-v3
Қабат саны 32
Сөздік көлемі 51866
Салмақ пішімі safetensors

Салмақтар 2 safetensors бөлігіне бөлінген және индекс файлымен бірге жарияланған. Tokenizer, normalizer және аудионы алдын ала өңдеу конфигурациялары сол репозиторийде сақталған. Бұл файлдар Transformers арқылы тікелей жүктеуге жеткілікті.

Оқыту және бағалау

Модель audio2, audio3 және audio4 деректерінде fine-tune жасалған. Оқыту мен бағалау үлесі 97% және 3% болып бөлінген.

Параметр Мәні
Batch size 32
Gradient accumulation 2
Learning rate 1e-5
Warmup қадамы 500
Max қадам 8000
Дәлдік FP16
Бағалау метрикасы WER 8.51%

Аудио 16 kHz жиілікке келтіріліп, log-Mel белгілері Whisper feature extractor арқылы алынған. Транскрипттер қазақ тілі баптауы бар Whisper tokenizer көмегімен өңделген.

Іске қосу

from transformers import pipeline

asr = pipeline(
    "automatic-speech-recognition",
    model="TilQazyna/tq-large-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])

Код жергілікті input.wav файлын таниды; модельді жүктеу үшін алдын ала рұқсат берілген Hugging Face тіркелгісі қажет.

Қолжетімділік

Карточка мен файлдардың тізімі ашық көрінеді. Салмақтарды жүктеу «Request access» өтінімін TilQazyna командасы мақұлдағаннан кейін ашылады.

Байланысты репозиторийлер

Шағын нұсқасы — tq-small-kaz-1. Бағдарламадағы аудио деректер Til-Audio жинағында берілген.


Русский

tq-large-kaz-1 — модель ASR Whisper Large v3, дообученная для транскрибирования казахской речи. Репозиторий занимает 6.18 ГБ; WER на оценочной выборке — 8.51%.

Устройство

Характеристика Значение
Архитектура WhisperForConditionalGeneration
Базовая модель openai/whisper-large-v3
Слоёв 32
Размер словаря 51866
Формат весов safetensors

Веса разделены на 2 файла safetensors и опубликованы вместе с индексом. В репозитории также лежат tokenizer, normalizer и конфигурация предобработки аудио.

Обучение и оценка

Модель прошла fine-tune на данных audio2, audio3 и audio4. Данные разделили на обучающую и оценочную части в пропорции 97% и 3%.

Параметр Значение
Batch size 32
Gradient accumulation 2
Learning rate 1e-5
Шагов warmup 500
Max steps 8000
Точность FP16
Метрика оценки WER 8.51%

Аудио приводили к частоте 16 kHz, затем Whisper feature extractor извлекал log-Mel признаки. Транскрипты обрабатывал Whisper tokenizer с настройкой казахского языка.

Как запустить

from transformers import pipeline

asr = pipeline(
    "automatic-speech-recognition",
    model="TilQazyna/tq-large-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])

Код распознаёт локальный файл input.wav; для загрузки модели нужна учётная запись Hugging Face с одобренным доступом.

Доступ

Карточка и список файлов видны всем. Веса становятся доступны после заявки через «Request access» и её одобрения командой TilQazyna.

Связанные репозитории

Меньшая версия модели опубликована как tq-small-kaz-1. Аудиоданные программы находятся в Til-Audio.


English

tq-large-kaz-1 is a Whisper Large v3 ASR model fine-tuned to transcribe Kazakh speech. The repository occupies 6.18 GB, and the reported WER on the evaluation split is 8.51%.

Architecture

Characteristic Value
Architecture WhisperForConditionalGeneration
Base model openai/whisper-large-v3
Layers 32
Vocabulary size 51866
Weight format safetensors

The weights are split across 2 safetensors files and accompanied by an index. The repository also supplies the tokenizer, normalizer, and audio preprocessing configuration.

Training and evaluation

The model was fine-tuned on the audio2, audio3, and audio4 data sources. The combined data was divided into 97% training and 3% evaluation splits.

Setting Value
Batch size 32
Gradient accumulation 2
Learning rate 1e-5
Warmup steps 500
Max steps 8000
Precision FP16
Evaluation metric WER 8.51%

Audio was resampled to 16 kHz before the Whisper feature extractor produced log-Mel features. Transcripts were processed with the Whisper tokenizer configured for Kazakh.

Inference

from transformers import pipeline

asr = pipeline(
    "automatic-speech-recognition",
    model="TilQazyna/tq-large-kaz-1",
)
result = asr("input.wav", generate_kwargs={"language": "kazakh"})
print(result["text"])

The example transcribes a local input.wav file. Loading the model requires a Hugging Face account with approved access.

Access

The repository card and file listing remain visible to everyone. Weight downloads open after the TilQazyna team approves an application submitted through “Request access.”

Related repositories

The smaller model is available as tq-small-kaz-1. Program audio data is published in Til-Audio.


Лицензия · License: mit · TilQazyna

Downloads last month
-
Safetensors
Model size
2B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for TilQazyna/tq-large-kaz-1

Finetuned
(916)
this model

Collections including TilQazyna/tq-large-kaz-1