MMS-300M forced aligner (ONNX fp16)

Single-file ONNX export (fp16, ~632 MB) of the multilingual MMS forced aligner for CTC forced alignment: input input_values [B,T] float32 @16 kHz, output logits [B,F,31] (lowercase romanized a-z + apostrophe vocab, blank=0, no word separator). Text must be uroman-romanized before tokenization.

Source checkpoint: MahmoudAshraf/mms-300m-1130-forced-aligner (HF conversion of torchaudio MMS_FA / Meta MMS-300M, 1130 languages). Export script: eval/export-mms-align.py in the KaraokeVideoEditor repo. Numerics: torch vs onnx maxAbsDiff 4.4e-05; fp32 vs fp16 0.026. Weight license: CC-BY-NC-4.0 (non-commercial).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support