Automatic Speech Recognition
NeMo
English
Hindi
speech
audio
fastconformer
rnnt
streaming
hinglish
hindi
indian-english
code-switching
Instructions to use smajji/nemotron-hinglish-v1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- NeMo
How to use smajji/nemotron-hinglish-v1 with NeMo:
import nemo.collections.asr as nemo_asr asr_model = nemo_asr.models.ASRModel.from_pretrained("smajji/nemotron-hinglish-v1") transcriptions = asr_model.transcribe(["file.wav"]) - Notebooks
- Google Colab
- Kaggle
Nemotron Hinglish v1
Nemotron-Hinglish-v1 is a fine-tuned version of nvidia/nemotron-3.5-asr-streaming-0.6b specialized for English, Hindi and Hinglish (Hindi-English code-switching), built for cache-aware streaming ASR.
It preserves the base model's FastConformer-Transducer (RNNT) cache-aware streaming architecture (24 layers, 1024 hidden, 600M params) and its multi-lingual 13088 BPE vocab + 128 language prompts, including the auto language-detection prompt.
Model Details
- Base model:
nvidia/nemotron-3.5-asr-streaming-0.6b - Architecture: FastConformer-Transducer (RNNT), cache-aware streaming, 8x subsampling
- Parameters: ~600M
- Sampling rate: 16 kHz mono
- Target languages: English (
en), Hindi (hi), Hinglish code-switched (autoprompt for code-mixing) - Streaming: cache-aware, chunk sizes 80/160/320/560/1120 ms
Training Data
Fine-tuned on a bilingual + code-mixed mix (~590h at this checkpoint, growing):
| Slice | Language | Hours |
|---|---|---|
| SPGISpeech | en | 300 |
| IISc_SPICOR (Indian-accent English) | en | 97 |
| SPRING Hindi-1482Hrs | hi | 228 |
| Shrutilipi-hi | hi | 1000 (in larger runs) |
| UJS Hinglish (code-mixed) | hinglish | 44 |
- Trained with punctuation/casing preserved (matching base-model text style) using NeMo's prompt-conditioned RNNT (
EncDecRNNTBPEModelWithPrompt). - Training prompt mode mixes forced
langIDwithauto(language self-detection) to handle code-switching.
Benchmark
Measured on held-out clips alongside a reference fine-tune (sampathlonka/svarupa_asr_0.6b_v1), same audio, auto prompt, greedy decode, punctuation-insensitive WER:
| Language | Nemotron-Hinglish-v1 | Svarupa ASR v1 |
|---|---|---|
| English | 3.1% | 10.0% |
| Hindi | 12.4% | 36.1% |
| Hinglish | 22.6% | 45.0% |
Usage (NeMo)
import nemo.collections.asr as nemo_asr
model = nemo_asr.models.ASRModel.restore_from("nvidia/nemotron-hinglish-v1")
model.eval()
transcriptions = model.transcribe(["audio.wav"], batch_size=4)
print(transcriptions)
- Downloads last month
- 9
Model tree for smajji/nemotron-hinglish-v1
Base model
nvidia/nemotron-3.5-asr-streaming-0.6b