Navo โ€” Uzbek Speech-to-Text

Fine-tuned model for Uzbek automatic speech recognition.

Results

Metric Value
WER 9.64%
CER 1.60%

Usage

from transformers import WhisperForConditionalGeneration, WhisperProcessor
import librosa

model_id = "whiteh4t/navo-uz"

processor = WhisperProcessor.from_pretrained(model_id)
model = WhisperForConditionalGeneration.from_pretrained(model_id)

audio, sr = librosa.load("audio.wav", sr=16000)

inputs = processor(audio, sampling_rate=16000, return_tensors="pt")
predicted_ids = model.generate(
    inputs.input_features,
    language="uz",
    task="transcribe",
    max_new_tokens=225,
)

text = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(text)

Training

  • Base model: openai/whisper-medium
  • Language: Uzbek (uz)
  • Task: Transcribe
  • Training samples: 22,432
  • Epochs: 3
  • Learning rate: 1e-5
  • Effective batch size: 32

License

Apache 2.0

Downloads last month
17
Safetensors
Model size
0.8B params
Tensor type
F32
ยท
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support