ethio_w2vbert_amh_orm_waxal

Multilingual CTC ASR for Amharic and Oromo, fine-tuned from facebook/w2v-bert-2.0 on google/WaxalNLP (amh_asr, orm_asr).

Aligned with Ethio-ASR training: frozen encoder, final adapter, custom CTC vocab, language tags [AMH]| / [ORM]|.

  • Best validation WER during training: 0.2789
  • Final eval WER: 0.2789
  • Final eval CER: 0.0941
  • Best checkpoint source: runs/ethio-w2vbert/facebook-w2v-bert-2.0-01062026-054407/checkpoint-47590

Usage

from transformers import AutoModelForCTC, AutoProcessor
import torch
import torchaudio

model_id = "smutuvi/ethio_w2vbert_amh_orm_waxal"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForCTC.from_pretrained(model_id)
model.eval()

waveform, sr = torchaudio.load('path/to/audio.wav')
if sr != 16000:
    waveform = torchaudio.functional.resample(waveform, sr, 16000)
inputs = processor(waveform.squeeze().numpy(), sampling_rate=16000, return_tensors='pt')
with torch.no_grad():
    logits = model(**inputs).logits
pred = processor.batch_decode(logits.argmax(-1))
print(pred[0])

Ndizi eval

./bash_scripts/run_eval_ethio_waxal.sh smutuvi/ethio_w2vbert_amh_orm_waxal
Downloads last month
65
Safetensors
Model size
0.6B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for smutuvi/ethio_w2vbert_amh_orm_waxal

Finetuned
(505)
this model

Dataset used to train smutuvi/ethio_w2vbert_amh_orm_waxal