hpd-parsing-ja-mlx-bf16

文書パースモデル HPD-Parsing(1.1B)の日本語カタカナ強化版です。合成文書によるLoRA学習(GT既知方式)をベース重みへ融合済みで、A4文書1ページを約5秒でレイアウト座標付きの構造化テキストにパースします。Apple Silicon(MLX)で動作します。

ベースモデルはレイアウト・数値の認識は高精度な一方、日本語カタカナ語の字形読み取りに弱点があります(実測で「ベーシック」→「 PLシック」、「アーキテクチャ」→「アーキテクッチя」等)。本モデルはこの弱点を狙って学習しています。

使い方

HPDの階層並列デコードは同梱スクリプトで実行します(mlx-vlm > 0.6.7)。

pip install "mlx-vlm>0.6.7" torch torchvision
hf download tokimoa/hpd-parsing-ja-mlx-bf16 --local-dir hpd-ja
python hpd-ja/hpd_generate.py document.png

出力例(同一画像・実出力)

ベースモデル:

<tr><td>アーキテクッチя月額</td><td>2</td><td>100,000</td><td>200,000</td></tr>

本モデル:

<tr><td>アーキテクチャ月額</td><td>2</td><td>100,000</td><td>200,000</td></tr>

評価

カタカナ語recallは学習と語彙・レイアウト条件を分離した合成val 50枚(337語・未見語彙)、総合精度は日本語ビジネス文書5種・GT59項目の含有率で測定しています(v2・全版実測)。

指標 ベース bf16 8bit 4bit
カタカナ語recall 34.7% 72.7%(245/337) 71.8%(242/337) 59.9%(202/337)
総合(ja-docs 59項目) 47/59 48/59 48/59 48/59
数値recall 98.2% 96.4% 96.4% 94.2%
ブロック構造一致 50/50 50/50 50/50 50/50

カタカナ精度を重視する帳票・IT文書ではbf16または8bitを推奨します。4bit量子化はカタカナ字形の弁別を約60%で頭打ちにします(v1・v2とも同水準の実測。学習改善分が量子化誤差に埋もれるため)。4bitは省メモリ優先の用途向けです。

学習

  • LoRA(q/v・rank 8)をbf16基底で学習し、同じbf16基底へ融合(基底一致のため実質無損失)
  • データ: 構造先行生成の合成文書1,200枚。カタカナ語彙の40%はランダムカナ列とし、単語の暗記ではなく字形デコードを学習させる設計
  • v2はランダムカナを長語重点(8〜13字を60%)かつ音韻規則適合(小書き・促音・長音の出現位置を実在語と同じ制約に限定)に改良。無制約ランダム列は「エンドポィント」型の小書き過剰挿入を誘発することを実測で確認し、この制約で解消
  • 検証セットとは語彙プールをステムレベルで分離

更新履歴

  • v2(2026-07-30): カタカナ語recall 59.6%→72.7%(bf16)。長いカタカナ語(8字以上)の取りこぼしを重点改善
  • v1(2026-07-29): 初版公開

関連リポジトリ


Developed by tokimoa

Downloads last month
32
Safetensors
Model size
1B params
Tensor type
BF16
·
MLX
Hardware compatibility
Log In to add your hardware

Quantized

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for tokimoa/hpd-parsing-ja-mlx-bf16