Whisper Tiny za srpski — fino podešavanje
Whisper Tiny fino podešen na srpskom korpusu od oko 200 sati, pet epoha, stopa učenja 1e-5. Polazna tačka za poređenje sa destilacijom.
Model je nastao u okviru master rada na temu optimizacije malih modela za automatsko prepoznavanje govora na srpskom jeziku.
Rezultati
Svi modeli su mereni istim postupkom nad istim test skupom od 2.239 uzoraka koji nijedan model nije video tokom obučavanja. Tekst se pre poređenja normalizuje: mala slova, bez interpunkcije, pismo svedeno na latinicu.
| model | podudarnost | prosečan WER | zbirni WER | medijana WER | WER > 100 % |
|---|---|---|---|---|---|
| whisper-tiny bez treninga | 29.01 % | 95.25 % | 90.21 % | 77.8 % | 171 |
| whisper-tiny-sr-finetuned | 76.14 % | 56.80 % | 39.62 % | 23.1 % | 85 |
| whisper-tiny-sr-distilled | 74.64 % | 39.80 % | 36.25 % | 26.7 % | 39 |
| whisper-tiny-sr-distilled-iterative | 76.03 % | 35.71 % | 33.68 % | 24.4 % | 38 |
| Sagicc/whisper-large-v3-sr-combined (učitelj) | 81.40 % | 30.01 % | 26.11 % | 17.6 % | 22 |
Podudarnost je udeo poklapanja na nivou reči (difflib.SequenceMatcher), veće je
bolje. Zbirni WER je ukupan broj grešaka podeljen ukupnim brojem reči i otporniji
je na kratke iskaze od proseka po uzorku. Kolona WER > 100 % broji uzorke na
kojima je hipoteza duža od reference, što po pravilu znači da je dekodiranje
upalo u petlju.
Korišćenje
from transformers import pipeline
pipe = pipeline("automatic-speech-recognition", model="BogdanTomic/whisper-tiny-sr-finetuned")
rezultat = pipe("snimak.wav", generate_kwargs={"language": "serbian",
"task": "transcribe"})
print(rezultat["text"])
Podaci
Korpus od oko 200 sati govora na srpskom jeziku iz javno dostupnih izvora. Priprema obuhvata segmentaciju dugih zapisa, grupisanje uzoraka po boji glasa, stratifikovanu podelu, prisilno poravnanje zvuka i teksta i proveru konzistentnosti transkripata. Konačan skup ima 41.082 uzorka za obučavanje, uz odvojene validacioni (2.219) i test skup (2.239).
Ograničenja
Model je obučen na jednom korpusu srpskog jezika, pa se ponašanje na drugačijem akustičkom materijalu, spontanom govoru ili dijalektima nije proveravalo. Izlaz može biti mešovitog pisma, jer učitelj piše ćirilicom a reference su latinične; pri merenju se pismo svodi na latinicu.
- Downloads last month
- -
Model tree for BogdanTomic/whisper-tiny-sr-finetuned
Base model
openai/whisper-tiny