Instructions to use Yuivdldk/math-adapter-g4b-dpo-selfpair with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Yuivdldk/math-adapter-g4b-dpo-selfpair with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("google/gemma-3-4b-it") model = PeftModel.from_pretrained(base_model, "Yuivdldk/math-adapter-g4b-dpo-selfpair") - Notebooks
- Google Colab
- Kaggle
自配對 DPO adapter(科展研究產物)
這支 adapter 原本只存在於一台 SPOT VM 的磁碟上(開機磁碟 auto_delete = True)。
本 repo 是保全副本。
| base | google/gemma-3-4b-it @ 093f9f388b31de276ce2de164bdc2081324b9767 |
adapter_model.safetensors sha256 |
a53b1a1fccdee48d8ac594df303efb6a440a9b3198bd3c0d5224ad52ecc135ff |
| 實際 epochs | 1.0 |
| global_step | 39 |
| learning_rate | 2e-05 |
| beta | 0.1 |
| per-device bs × grad-accum | 1 × 8 |
| seed | 42 |
判讀(照 ⚡判讀總表)
Δ vs base −0.63pp(p=.388);L4 +0.91 / L5 −2.04(p=.047 未校正、.095 校正後)。 判為此配置未見提升,方向為負。
🔴 本 repo 存在的理由:帳本原本記載「adapter 未上傳 ⇒ 永遠不可重評」,
那是錯的 —— 2026-07-27 清點 VM 發現它還在。上面的 epochs 欄就是
用來解決「HF 標 1ep vs 事前登記修訂為 2ep」這個矛盾的。
🔴 引用時的界線
- 尺是
direct-axis-balanced-box-v2.1-timeout-safe+math-verify-0.9.0, 不可與math-mathverify-v1或-terminal-v2家族的數字相減。 - 計分只能在 Linux 跑(Windows 上 math-verify 的
parse()會回[])。 - ⚠️ 建 pair 時
chosen取最長,而事前登記要求取最短(長度偏置防護) —— 這是已記載的實作偏差,見AI_AGENT_WORKFLOW.md §2。
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support