control_s43 — LoRA adapter(科展研究產物)

這支 adapter 原本只存在於一台 SPOT VM 的磁碟上。 本 repo 是保全副本。

base google/gemma-3-4b-it @ 093f9f388b31de276ce2de164bdc2081324b9767
訓練資料 dose_control_sft.jsonl,sha256 d99f688c01d152b068caa9a8343fc47b29abe6ea65fd7911fc9bcfba4207a437(530 筆)
seed 43
配方 lr 1e-4、epochs 1.0、max_length 4096、per-device 1 × grad-accum 8
adapter_model.safetensors sha256 f52dc311275fdb2c557caa45ef7c06359f74a77b66decfad51ee2af78a7fcd59
held-out Δ vs base(n=2538,direct-axis 尺) -7.17pp

臂的意義

  • control —— 265 筆訓練目標是外部老師(deepseek-v4-pro)的解+265 筆 base 自己的正解 replay
  • selfsol —— 同一批 265 題、同一批 replay、同配方同 seed, 唯一差別是那 265 筆的目標文字換成 base 自己最短的正解

兩臂的配對差(4 個 seed):**+6.74pp、seed 間 SD 1.15pp、每對 p ≤ 1.2e−12。 ⇒ 傷害來自目標來源**,不是題目、劑量或配方。

🔴 引用時的界線

  • 尺是 direct-axis-balanced-box-v2.1-timeout-safe+math-verify-0.9.0不可與 math-mathverify-v1math-mathverify-terminal-v2 家族的數字相減。
  • 計分只能在 Linux 跑(Windows 上 math-verify 的 parse() 會回 [])。
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Yuivdldk/math-adapter-l45-g4b-control_s43

Adapter
(445)
this model