Image-Text-to-Text
MLX
Safetensors
Japanese
internvl_chat
document-parsing
japanese
lora
custom_code
8-bit precision
Instructions to use tokimoa/hpd-parsing-ja-mlx-8bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use tokimoa/hpd-parsing-ja-mlx-8bit with MLX:
# Make sure mlx-vlm is installed # pip install --upgrade mlx-vlm from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template from mlx_vlm.utils import load_config # Load the model model, processor = load("tokimoa/hpd-parsing-ja-mlx-8bit") config = load_config("tokimoa/hpd-parsing-ja-mlx-8bit") # Prepare input image = ["http://images.cocodataset.org/val2017/000000039769.jpg"] prompt = "Describe this image." # Apply chat template formatted_prompt = apply_chat_template( processor, config, prompt, num_images=1 ) # Generate output output = generate(model, processor, formatted_prompt, image) print(output) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
hpd-parsing-ja-mlx-8bit
文書パースモデル HPD-Parsing(1.1B)の日本語カタカナ強化版です。合成文書によるLoRA学習(GT既知方式)をベース重みへ融合済みで、A4文書1ページを約5秒でレイアウト座標付きの構造化テキストにパースします。Apple Silicon(MLX)で動作します。
ベースモデルはレイアウト・数値の認識は高精度な一方、日本語カタカナ語の字形読み取りに弱点があります(実測で「ベーシック」→「 PLシック」、「アーキテクチャ」→「アーキテクッチя」等)。本モデルはこの弱点を狙って学習しています。
使い方
HPDの階層並列デコードは同梱スクリプトで実行します(mlx-vlm > 0.6.7)。
pip install "mlx-vlm>0.6.7" torch torchvision
hf download tokimoa/hpd-parsing-ja-mlx-8bit --local-dir hpd-ja
python hpd-ja/hpd_generate.py document.png
出力例(同一画像・実出力)
ベースモデル:
<tr><td>アーキテクッチя月額</td><td>2</td><td>100,000</td><td>200,000</td></tr>
本モデル:
<tr><td>アーキテクチャ月額</td><td>2</td><td>100,000</td><td>200,000</td></tr>
評価
カタカナ語recallは学習と語彙・レイアウト条件を分離した合成val 50枚(337語・未見語彙)、総合精度は日本語ビジネス文書5種・GT59項目の含有率で測定しています(v2・全版実測)。
| 指標 | ベース | bf16 | 8bit | 4bit |
|---|---|---|---|---|
| カタカナ語recall | 34.7% | 72.7%(245/337) | 71.8%(242/337) | 59.9%(202/337) |
| 総合(ja-docs 59項目) | 47/59 | 48/59 | 48/59 | 48/59 |
| 数値recall | 98.2% | 96.4% | 96.4% | 94.2% |
| ブロック構造一致 | 50/50 | 50/50 | 50/50 | 50/50 |
カタカナ精度を重視する帳票・IT文書ではbf16または8bitを推奨します。4bit量子化はカタカナ字形の弁別を約60%で頭打ちにします(v1・v2とも同水準の実測。学習改善分が量子化誤差に埋もれるため)。4bitは省メモリ優先の用途向けです。
学習
- LoRA(q/v・rank 8)をbf16基底で学習し、同じbf16基底へ融合(基底一致のため実質無損失)。8bit量子化(実効10.7bpw)
- データ: 構造先行生成の合成文書1,200枚。カタカナ語彙の40%はランダムカナ列とし、単語の暗記ではなく字形デコードを学習させる設計
- v2はランダムカナを長語重点(8〜13字を60%)かつ音韻規則適合(小書き・促音・長音の出現位置を実在語と同じ制約に限定)に改良。無制約ランダム列は「エンドポィント」型の小書き過剰挿入を誘発することを実測で確認し、この制約で解消
- 検証セットとは語彙プールをステムレベルで分離
更新履歴
- v2(2026-07-30): カタカナ語recall 59.6%→72.7%(bf16)。長いカタカナ語(8字以上)の取りこぼしを重点改善
- v1(2026-07-29): 初版公開
関連リポジトリ
- hpd-parsing-ja-mlx-bf16 / 8bit(推奨) / 4bit
- 強化前の変換: hpd-parsing-mlx-8bit
Developed by tokimoa
- Downloads last month
- 26
Model size
0.5B params
Tensor type
BF16
·
U32 ·
Hardware compatibility
Log In to add your hardware
8-bit
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for tokimoa/hpd-parsing-ja-mlx-8bit
Base model
OpenGVLab/InternVL3_5-1B-Pretrained Finetuned
OpenGVLab/InternVL3_5-1B-Instruct Finetuned
OpenGVLab/InternVL3_5-1B-MPO Finetuned
OpenGVLab/InternVL3_5-1B Finetuned
PaddlePaddle/HPD-Parsing