OffVox — paquetes de idioma reforzado (ONNX, int8)
Modelos Whisper afinados para euskera, gallego y galés, convertidos a ONNX
(cuantizado int8) para usarse con sherpa-onnx
vía sherpa_onnx.OfflineRecognizer.from_whisper(...). Es el formato que
consume OffVox, una app de diario y reuniones por voz
100% local/offline.
Cada carpeta <idioma>/<tamaño>/ contiene 3 ficheros: encoder.int8.onnx,
decoder.int8.onnx, tokens.txt.
Origen y licencias (cadena de atribución completa)
Todos los checkpoints originales están licenciados bajo Apache-2.0, y todos los datasets usados para el fine-tuning están licenciados bajo CC0 (dominio público) — sin restricciones de uso comercial en ningún eslabón de la cadena. Esta conversión (exportación a ONNX + cuantización int8) se publica también bajo Apache-2.0, manteniendo la atribución exigida por esa licencia.
- Modelo base: OpenAI Whisper (MIT).
- Euskera (eu) y Gallego (gl): fine-tunes de
HiTZ Zentroa (
HiTZ/whisper-{tiny,base,small}-eu,HiTZ/whisper-{tiny,base,small}-gl), Apache-2.0, entrenados sobre Mozilla Common Voice (CC0). Ver el paper "Whisper-LM" (Xabier de Zuazo et al., HiTZ Zentroa/UPV-EHU, arXiv:2503.23542). - Galés (cy): fine-tune de techiaith
/ Language Technologies Unit, Bangor University
(
techiaith/whisper-tiny-ft-cy-en), Apache-2.0, entrenado sobre Common Voice (CC0) y Banc Trawsgrifiadau Bangor (CC0).
Qué NO incluye este repositorio
Los tamaños medium (euskera/gallego) y large-v3 (galés) también se
convirtieron y se verificaron como correctos, pero no se han subido
aquí todavía — el nivel de tamaño ("tier") actual de OffVox solo llega
hasta small. Si en el futuro se añade un nivel superior, se subirán
también.
Cómo se convirtieron
Pipeline: checkpoint HuggingFace → formato nativo OpenAI Whisper →
exportación ONNX vía el script export-onnx.py de sherpa-onnx (adaptado
para aceptar checkpoints locales) → cuantización dinámica int8. Verificado
end-to-end con audio real de datasets públicos (shunyalabs/galician-speech-dataset,
shunyalabs/welsh-speech-dataset, mikelalda/basque_speech_dataset) antes
de publicar, comparando la transcripción reconocida contra la referencia.