Whisper Tiny za srpski — fino podešavanje

Whisper Tiny fino podešen na srpskom korpusu od oko 200 sati, pet epoha, stopa učenja 1e-5. Polazna tačka za poređenje sa destilacijom.

Model je nastao u okviru master rada na temu optimizacije malih modela za automatsko prepoznavanje govora na srpskom jeziku.

Rezultati

Svi modeli su mereni istim postupkom nad istim test skupom od 2.239 uzoraka koji nijedan model nije video tokom obučavanja. Tekst se pre poređenja normalizuje: mala slova, bez interpunkcije, pismo svedeno na latinicu.

model podudarnost prosečan WER zbirni WER medijana WER WER > 100 %
whisper-tiny bez treninga 29.01 % 95.25 % 90.21 % 77.8 % 171
whisper-tiny-sr-finetuned 76.14 % 56.80 % 39.62 % 23.1 % 85
whisper-tiny-sr-distilled 74.64 % 39.80 % 36.25 % 26.7 % 39
whisper-tiny-sr-distilled-iterative 76.03 % 35.71 % 33.68 % 24.4 % 38
Sagicc/whisper-large-v3-sr-combined (učitelj) 81.40 % 30.01 % 26.11 % 17.6 % 22

Podudarnost je udeo poklapanja na nivou reči (difflib.SequenceMatcher), veće je bolje. Zbirni WER je ukupan broj grešaka podeljen ukupnim brojem reči i otporniji je na kratke iskaze od proseka po uzorku. Kolona WER > 100 % broji uzorke na kojima je hipoteza duža od reference, što po pravilu znači da je dekodiranje upalo u petlju.

Korišćenje

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="BogdanTomic/whisper-tiny-sr-finetuned")
rezultat = pipe("snimak.wav", generate_kwargs={"language": "serbian",
                                              "task": "transcribe"})
print(rezultat["text"])

Podaci

Korpus od oko 200 sati govora na srpskom jeziku iz javno dostupnih izvora. Priprema obuhvata segmentaciju dugih zapisa, grupisanje uzoraka po boji glasa, stratifikovanu podelu, prisilno poravnanje zvuka i teksta i proveru konzistentnosti transkripata. Konačan skup ima 41.082 uzorka za obučavanje, uz odvojene validacioni (2.219) i test skup (2.239).

Ograničenja

Model je obučen na jednom korpusu srpskog jezika, pa se ponašanje na drugačijem akustičkom materijalu, spontanom govoru ili dijalektima nije proveravalo. Izlaz može biti mešovitog pisma, jer učitelj piše ćirilicom a reference su latinične; pri merenju se pismo svodi na latinicu.

Downloads last month
-
Safetensors
Model size
37.8M params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for BogdanTomic/whisper-tiny-sr-finetuned

Finetuned
(1891)
this model