Navo โ Uzbek Speech-to-Text
Fine-tuned model for Uzbek automatic speech recognition.
Results
| Metric | Value |
|---|---|
| WER | 9.64% |
| CER | 1.60% |
Usage
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import librosa
model_id = "whiteh4t/navo-uz"
processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(model_id)
audio, sr = librosa.load("audio.wav", sr=16000)
inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
predicted_ids = model.generate(
inputs.input_features,
language="uz",
task="transcribe",
max_new_tokens=225,
)
text = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(text)
Training
- Base model: openai/whisper-medium
- Language: Uzbek (uz)
- Task: Transcribe
- Training samples: 22,432
- Epochs: 3
- Learning rate: 1e-5
- Effective batch size: 32
License
Apache 2.0
- Downloads last month
- 17