kana-whisper (MLX 4bit, verified)

SB Intuitionsの kana-whisper(Whisper large-v3-turboのファインチューン。日本語音声をカタカナ列に直接書き起こすASR)を、公式fp32重みからMLX fp16経由で4bit量子化(group size 64)したものです。変換品質の検証済みで公開しています。

Sarashina2.2-TTSプロジェクトのKana CER(カナ文字誤り率)測定の基盤モデルです。Apple Silicon上でTTS評価ループをローカル完結させる用途に使えます。

変換品質の検証(tokimoa)

  • transformers版(fp32・greedy)との出力比較: 11クリップ中10クリップで完全一致、**文字誤り率0.29%**(348文字中、差分は助詞1文字のみ。合成音声8本+JSUT実音声3本)
  • 同一入力4回反復: 全クリップで出力完全一致(決定論的)
  • 実効速度: 11クリップ合計 約3.7秒(M4 Max、モデルロード込み)/ 重み463MB(fp16版1.6GBの約29%)
  • 高い忠実度が必要な場合は fp16版 を推奨

使い方

# pip install mlx-whisper
import mlx_whisper

result = mlx_whisper.transcribe(
    "audio.wav",
    path_or_hf_repo="tokimoa/kana-whisper-mlx-4bit",
    language="ja", task="transcribe", temperature=0.0,
)
print(result["text"])
# 例: "キョーワイーテンキデスネ"

変換情報

  • 変換元: sbintuitions/kana-whisper(fp32 safetensors、HF transformers形式)
  • 変換: mlx-examples whisper convert.py(HF形式→MLXキーマッピング hf_to_pt 使用)/ mlx-whisper 0.4.3 で動作確認
  • 重みファイル名は weights.safetensors(pip版 mlx-whisper 0.4.3 のローダーがこの名前のみ読み込むため)
  • alignment_heads は未設定のため、単語レベルのタイムスタンプ精度は保証外です(書き起こし用途には影響なし)

ライセンス

MIT(元モデルのライセンスに準拠)。変換者: tokimoa

Downloads last month
48
MLX
Hardware compatibility
Log In to add your hardware

Quantized

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tokimoa/kana-whisper-mlx-4bit

Finetuned
(3)
this model