Instructions to use tokimoa/kana-whisper-mlx-4bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use tokimoa/kana-whisper-mlx-4bit with MLX:
# Download the model from the Hub pip install huggingface_hub[hf_xet] huggingface-cli download --local-dir kana-whisper-mlx-4bit tokimoa/kana-whisper-mlx-4bit
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
kana-whisper (MLX 4bit, verified)
SB Intuitionsの kana-whisper(Whisper large-v3-turboのファインチューン。日本語音声をカタカナ列に直接書き起こすASR)を、公式fp32重みからMLX fp16経由で4bit量子化(group size 64)したものです。変換品質の検証済みで公開しています。
Sarashina2.2-TTSプロジェクトのKana CER(カナ文字誤り率)測定の基盤モデルです。Apple Silicon上でTTS評価ループをローカル完結させる用途に使えます。
変換品質の検証(tokimoa)
- transformers版(fp32・greedy)との出力比較: 11クリップ中10クリップで完全一致、**文字誤り率0.29%**(348文字中、差分は助詞1文字のみ。合成音声8本+JSUT実音声3本)
- 同一入力4回反復: 全クリップで出力完全一致(決定論的)
- 実効速度: 11クリップ合計 約3.7秒(M4 Max、モデルロード込み)/ 重み463MB(fp16版1.6GBの約29%)
- 高い忠実度が必要な場合は fp16版 を推奨
使い方
# pip install mlx-whisper
import mlx_whisper
result = mlx_whisper.transcribe(
"audio.wav",
path_or_hf_repo="tokimoa/kana-whisper-mlx-4bit",
language="ja", task="transcribe", temperature=0.0,
)
print(result["text"])
# 例: "キョーワイーテンキデスネ"
変換情報
- 変換元:
sbintuitions/kana-whisper(fp32 safetensors、HF transformers形式) - 変換: mlx-examples whisper
convert.py(HF形式→MLXキーマッピングhf_to_pt使用)/ mlx-whisper 0.4.3 で動作確認 - 重みファイル名は
weights.safetensors(pip版 mlx-whisper 0.4.3 のローダーがこの名前のみ読み込むため) - alignment_heads は未設定のため、単語レベルのタイムスタンプ精度は保証外です(書き起こし用途には影響なし)
ライセンス
MIT(元モデルのライセンスに準拠)。変換者: tokimoa
- Downloads last month
- 48
Hardware compatibility
Log In to add your hardware
Quantized
Model tree for tokimoa/kana-whisper-mlx-4bit
Base model
openai/whisper-large-v3 Finetuned
openai/whisper-large-v3-turbo Finetuned
sbintuitions/kana-whisper