TEA-ASR-1.1 — CrispASR 相容 GGUF(單檔融合式)

JacobLinCool/TEA-ASR-1.1Qwen/Qwen3-ASR-1.7B 的台灣國語/繁體中文/中英夾雜微調)轉為 CrispASR 可直接載入的 GGUF。

為什麼需要這一份轉檔

HuggingFace 上既有的 mradermacher/TEA-ASR-1.1-GGUF 無法用於 CrispASR: 那是 llama.cpp 的 mtmd 拆檔慣例 —— 文字模型(general.architecture=qwen3vl) 與音訊塔(獨立的 clip / mmproj 檔)分開存放;而 CrispASR 的 qwen3 後端讀的是 單檔融合式 qwen3asraudio.*blk.* 在同一顆檔案裡),且沒有載入外掛 mmproj 的參數。

本檔以 CrispASR 官方的 models/convert-qwen3-asr-to-gguf.py 從原始 safetensors 重新轉換,再用 crispasr-quantize 壓成 q8_0

轉換時需修正官方轉換器的一處判讀:TEA-ASR 的 tie_word_embeddings 位於 thinker_config.text_config 之下,而轉換器只讀 thinker_config 頂層 → 誤判為 false 而漏寫 output.weight,載入時會報 qwen3_asr: required tensor 'output.weight' not found in GGUF。 補上 text_config 的後備讀取即可(成品為 710 張量,與官方 Qwen3-ASR GGUF 一致)。

檔案

檔案 大小 說明
tea-asr-1.1-q8_0.gguf 2.51 GB Q8_0 量化,710 張量(audio 399 + LLM 308 + embd/norm/output)

用法

crispasr.exe -m tea-asr-1.1-q8_0.gguf --backend qwen3-1.7b \
             --gpu-backend vulkan -dev 0 -l zh -nf -np -f audio.mp3

字級時間軸再掛上 forced aligner:

crispasr.exe -m tea-asr-1.1-q8_0.gguf --backend qwen3-1.7b --gpu-backend vulkan \
             -l zh -osrt -ml 1 -am qwen3-forced-aligner-0.6b-q5_0.gguf -falign \
             -nf -f audio.mp3

適用範圍(實測)

在 CrispASR(--backend qwen3-1.7b, Vulkan / CUDA,RTX 5090)上以繁中新聞、訪談與歌曲素材實測:

  • 乾淨人聲(訪談、質詢、講座):辨識品質最佳,且原生輸出繁體與台灣用語, 中英夾雜("很 resent"、"打高 golf")保留良好,不需要 OpenCC 簡繁轉換。
  • ⚠️ 背景配樂較重的段落或歌曲:該段可能整段無輸出(模型立即產生 EOS)。 同一素材以 Qwen/Qwen3-ASR-1.7B 則正常輸出。

此行為在未量化的 F16 轉檔上同樣出現,因此與本處的 GGUF 轉換/量化無關, 應為上游輕量微調(凍結音訊編碼器 + 解碼器 LoRA、< 10 小時公開語料)的域外行為。 音樂類素材建議改用通用的 Qwen3-ASR。

授權與致謝

MIT,沿用上游 JacobLinCool/TEA-ASR-1.1 (其基礎為 Apache-2.0 的 Qwen/Qwen3-ASR-1.7B)。推理引擎為 CrispStrobe/CrispASR。 本轉檔僅做格式轉換與量化,未改動任何權重數值。

Downloads last month
75
GGUF
Model size
2B params
Architecture
qwen3asr
Hardware compatibility
Log In to add your hardware

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for dseditor/TEA-ASR-1.1-CrispASR-GGUF

Quantized
(3)
this model