wav2vec2-large-960h-lv60-self โ alignment ONNX (fp16)
ONNX export of facebook/wav2vec2-large-960h-lv60-self for CTC forced
alignment in the browser (onnxruntime-web, WebGPU EP):
- input
input_values[1, samples]float32 @16 kHz (zero-mean/unit-var normalized host-side) - output
logits[1, frames, 32]โ the standard wav2vec2-960h char vocab (<pad>=0 = CTC blank,|=4 word separator, AโZ +')
fp16-converted (fp32 I/O). Export + conversion script:
eval/export-large-align.py in the
KaraokeVideoEditor repo.
Chosen over base-960h for lyrics alignment: the large model distinguishes repeated chorus occurrences (kiri benchmark: p90 247 ms vs 8.3 s for base).
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐ Ask for provider support