wav2vec2-large-960h-lv60-self โ€” alignment ONNX (fp16)

ONNX export of facebook/wav2vec2-large-960h-lv60-self for CTC forced alignment in the browser (onnxruntime-web, WebGPU EP):

  • input input_values [1, samples] float32 @16 kHz (zero-mean/unit-var normalized host-side)
  • output logits [1, frames, 32] โ€” the standard wav2vec2-960h char vocab (<pad>=0 = CTC blank, |=4 word separator, Aโ€“Z + ')

fp16-converted (fp32 I/O). Export + conversion script: eval/export-large-align.py in the KaraokeVideoEditor repo.

Chosen over base-960h for lyrics alignment: the large model distinguishes repeated chorus occurrences (kiri benchmark: p90 247 ms vs 8.3 s for base).

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. ๐Ÿ™‹ Ask for provider support