Instructions to use tokimoa/jp-minutes-extractor-1.7b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- MLX
How to use tokimoa/jp-minutes-extractor-1.7b with MLX:
# Make sure mlx-lm is installed # pip install --upgrade mlx-lm # if on a CUDA device, also pip install mlx[cuda] # Generate text with mlx-lm from mlx_lm import load, generate model, tokenizer = load("tokimoa/jp-minutes-extractor-1.7b") prompt = "Once upon a time in" text = generate(model, tokenizer, prompt=prompt, verbose=True) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- LM Studio
- MLX LM
How to use tokimoa/jp-minutes-extractor-1.7b with MLX LM:
Generate or start a chat session
# Install MLX LM uv tool install mlx-lm # Generate some text mlx_lm.generate --model "tokimoa/jp-minutes-extractor-1.7b" --prompt "Once upon a time"
jp-minutes-extractor-1.7b
日本語の議事録・会議メモから、出席者・決定事項・宿題(担当/期限)・次回予定を構造化JSONで抽出するLoRAアダプタです。ベースモデルは Qwen/Qwen3-1.7B。Apple Silicon(mlx-lm)で動作し、16GBメモリのMacで実行できます。
整った議事録だけでなく、チャットログ・走り書きメモ・敬語文・英語混じりといった崩れた入力を対象に設計しています。表記ゆれの正規化(8/7 10am → 8月7日 10:00、$12k → 12,000ドル)、肩書き・欠席者・誤字の処理、役職参照(「社長」)から人名への解決を行います。
使い方
pip install mlx-lm
hf download tokimoa/jp-minutes-extractor-1.7b --local-dir jp-minutes-extractor
python -m mlx_lm generate --model Qwen/Qwen3-1.7B --adapter-path jp-minutes-extractor/adapter \
--prompt "次の議事録から出席者・決定事項・宿題(担当と期限)・次回予定を抽出してJSONで出力してください。\n\n<議事録本文>" \
--max-tokens 800 --temp 0.0
入力例
7/31(木) 販売管理の件メモ
出席: 高木(部長)、瀬川、大村
・内藤は欠席
・請求書の発行を月2回→月1回に集約でOKもらった
・新しい販売管理ツールは11月から試験導入ことに
・TODO 移行スケジュル案 瀬川 8/20
・大村: 現行ツールの解約条件を確認(今週中)
next 8/7(木) 10am
出力例(実出力・temperature 0)
{
"date": "7月31日",
"attendees": ["高木", "瀬川", "大村"],
"decisions": [
"請求書の発行を月2回から月1回に集約する",
"新しい販売管理ツールは11月から試験導入する"
],
"todos": [
{"task": "移行スケジュール案を提出する", "owner": "瀬川", "due": "8月20日"},
{"task": "現行ツールの解約条件を確認する", "owner": "大村", "due": "今週中"}
],
"next_meeting": "8月7日 10:00"
}
肩書きの除去(高木(部長)→高木)、欠席者の除外、崩れた表現の正規化(月2回→月1回に集約でOKもらった→「集約する」、8/7(木) 10am→「8月7日 10:00」)、誤字の復元(スケジュル→スケジュール)を行っていることが分かります。
評価
学習データと名前・話題・語彙プールをステムレベルで分離した検証セットで採点しています。
合成val(8形式・役職/欠席/誤字ノイズ入り・50件)
| フィールド | 厳格一致 |
|---|---|
| attendees | 45/50 |
| decisions | 44/50 |
| todos | 50/50 |
| next_meeting | 50/50 |
| 全フィールド同時合格 | 39/50 |
手書きカナリア(チャットログ・敬語・走り書き・英語混じり・長文脱線の5本、学習データと無関係に作成)
| 指標 | 結果 |
|---|---|
| attendees 厳格一致 | 5/5 |
| next_meeting 厳格一致 | 4/5 |
| decisions 事実網羅(数値・日付・人名が出力に含まれる) | 12事実中11 |
決定事項の出力語形は原文の引用ではなく正規形への要約です。ベースモデル素の状態では同条件でJSONスキーマが安定しないため、抽出タスクにはこのアダプタの適用を前提としてください。
訓練
- mlx-lm LoRA(rank 8・lr 1e-5・batch 4・iter 1200・--mask-prompt)
- データ: 構造先行生成による合成議事録18,000行。構造(出席者・決定・宿題・次回)を先に生成してから8形式(箇条書き・時系列・散文・チャットログ・走り書き・敬語・英語混じり・長文脱線)でレンダリングするため、正解ラベルが構成上完全に既知
- 本文には崩れた表記(7/25(金)・$12k・各自・EOW・カタカナ誤字・肩書き・遅刻/欠席マーカー)を混入させ、正解側は常に正規形に揃えることで正規化を学習
ライセンス
Apache-2.0(ベースモデルQwen3-1.7Bのライセンスを継承)
Developed by tokimoa
Quantized