chunkformer-large-vie (mirror)
Mirror của khanhld/chunkformer-large-vie — ASR tiếng Việt kiến trúc ChunkFormer (~110M params, CTC, chunk-based encoder, decode long-form không giới hạn độ dài). Mirror giữ nguyên trọng số, phục vụ voice-bench. Model gốc: Khanh Le (khanhld), license CC-BY-NC-4.0. Paper: ICASSP 2025.
Số đo voice-bench (Mac Mini M4 24GB, CPU)
| Eval | WER | Latency |
|---|---|---|
| VIVOS-test 50 clips | 5.50% (CER 2.91%) | p50 0.17s / p90 0.18s |
| Long-form 195.6s (1 request, endless_decode) | 6.61% | RTF 0.073 |
| VietMed 38 clips (hội thoại y tế) | 18.81%* | p50 0.30s |
So sánh cùng harness: bằng PhoWhisper-large-ct2 trên VIVOS (5.50%) nhưng nhanh hơn 45×; không bị floor padding 30s của whisper — model duy nhất đạt <500ms với WER <10% trên CPU M4.
*Caveat: model này train trên hầu hết dataset VN công khai kể cả VietMed_labeled và VIVOS (xem model card gốc), nên số VietMed KHÔNG chứng minh ưu thế out-of-domain so với PhoWhisper (small 22.20%, large 25.12% — không có VietMed trong train). Đánh giá OOD sạch cần audio tự thu.
Dùng
# pip install chunkformer
from chunkformer import ChunkFormerModel
model = ChunkFormerModel.from_pretrained("vudang449/chunkformer-large-vie")
text = model.batch_decode(["audio.wav"])[0] # clip ngắn
long = model.endless_decode("long.wav", return_timestamps=False) # file dài
- Downloads last month
- 10
Model tree for vudang449/chunkformer-large-vie
Base model
khanhld/chunkformer-ctc-large-vie