GGUF
Japanese

drafters gemma4 v2 gguf

gemma4モデル用の、ドラフトモデル専用のモデルです。そのため単体での生成は不可能です

総パラメータ数と保存サイズが下がっただけで、
drafters gemma4 ja v2 ggufとあがる速度はあまり変わらないです。
上流のllama.cppで使えます。(それ以外の環境は試していない)

量子化形式

bf16モデル
tq1_0モデル (おすすめ)

解説

gemma4トークナイザは語彙が約260kあり、その中で日本語に相当するものはごくわずかです。

gemma4トークナイザを使用して日本語トークンを出力し、 ターゲットモデルの出力時間のなかで、
ドラフト出力トークン数 > (ドラフトモデルのtoken/s) / (ターゲットモデルのtoken/s)
が成り立てば理論上速度が向上します。

ので、128dim、総パラメータ70mのqwen3nextアーキテクチャで作成し、ggufファイルはtq1_0を使用しました。

性能

rtx3060 faあり、gemma4-it-12b(q4_k_m) ドラフトモデルはtq1_0
の環境で軽く試したかぎりは26tk/sから31tk/sまで上がりました。
他のgemma4モデルでも多分動く、はず?


architecture

lfm2moe model
tokenizer from google/gemma-4-12B

train

training code in ./training_codes
少量のwikipediaデータでフルスクラッチ学習しました。 学習にかかった時間はrtx3060一枚で10分ほど。

Downloads last month
-
GGUF
Model size
34.2M params
Architecture
lfm2moe
Hardware compatibility
Log In to add your hardware

1-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for WariHima/drafters-gemma4-v2-gguf

Quantized
(1)
this model

Collection including WariHima/drafters-gemma4-v2-gguf