YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
language:
- en license: apache-2.0 base_model: openai/whisper-tiny tags:
- automatic-speech-recognition
- whisper
- audio
- generated_from_trainer datasets:
- PolyAI/minds14 pipeline_tag: automatic-speech-recognition
Fine-tuned Whisper Tiny for MInDS-14 (en-US)
This model fine-tunes openai/whisper-tiny for automatic speech recognition on the American English (en-US) subset of the PolyAI/minds14 dataset.
Model description
Whisper Tiny is a compact encoder-decoder Transformer model for speech recognition. This version was fine-tuned to transcribe short English spoken queries from the MInDS-14 dataset.
Training data
- Dataset:
PolyAI/minds14 - Configuration:
en-US - Training examples: first 450 examples
- Evaluation examples: remaining 113 examples
- Audio sampling rate: 16 kHz
Training procedure
| Setting | Value |
|---|---|
| Base model | openai/whisper-tiny |
| Task | Automatic speech recognition |
| Language | English |
| Epochs | 10 |
| Learning rate | 1e-5 |
| Train batch size | 4 |
| Gradient accumulation steps | 4 |
| Effective batch size | 16 |
| Optimizer selection metric | Normalized WER |
Evaluation results
The model was evaluated on the held-out 113 examples.
| Metric | Score |
|---|---|
| Normalized WER | 0.2993 |
| Orthographic WER | 0.2961 |
Lower Word Error Rate (WER) is better. A normalized WER of 0.2993 corresponds to approximately 29.93% word error.
Usage
from transformers import pipeline
pipe = pipeline(
"automatic-speech-recognition",
model="hsaim/whisper-tiny-minds14-en-us-output",
)
result = pipe("path/to/audio.wav")
print(result["text"])
Limitations
This is an educational fine-tuning run using a small dataset. It is intended for experimentation and may perform poorly on long recordings, noisy audio, different accents, languages other than English, or domains unlike MInDS-14 spoken queries.
- Downloads last month
- 26