Qwen3.8-Flash-Next-MTP-bf16

Qwen/Qwen3.8-Flash-Next の公式 bf16 チェックポイントに内蔵された MTP ヘッド(mtp.* 31 テンソル)を切り出した、 投機デコード用ドラフター。単体では使わない。

  • 変換元: Qwen/Qwen3.8-Flash-Next(revision de4b8e4)
  • 変換ツール: mlx-vlm main(0.7.0rc0)の Qwen4ExpMTPSplitter
  • サイズ: 4.9 GiB(bf16)

必要環境

qwen4_exp_mtp の抽出・実行は mlx-vlm 0.7.0 以降(リリース版 0.6.17 には未収録)。

pip install "mlx-vlm @ git+https://github.com/Blaizzy/mlx-vlm@main"

使い方

python -m mlx_vlm generate --model ToPo-ToPo/Qwen3.8-Flash-Next-mlx-4bit \
    --draft-model ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16 \
    --draft-kind mtp --draft-block-size 2 \
    --prompt "..." --max-tokens 512

量子化版リポジトリ(4bit / 8bit)の mtp/ サブフォルダにも同じものが入っているので、本体を落とせばドラフターも付いてくる。

抽出コマンド

from mlx_vlm.speculative.drafters.qwen4_exp_mtp.split import Qwen4ExpMTPSplitter
Qwen4ExpMTPSplitter().split("Qwen/Qwen3.8-Flash-Next", "Qwen3.8-Flash-Next-MTP-bf16")

量子化後のリポジトリからは mtp.* が落ちている(mlx-vlm の sanitize が除外する)ので、 必ず公式 bf16 から切り出すこと。

Downloads last month
165
Safetensors
Model size
3B params
Tensor type
BF16
·
MLX
Hardware compatibility
Log In to add your hardware

Quantized

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for ToPo-ToPo/Qwen3.8-Flash-Next-MTP-bf16

Finetuned
(28)
this model