prefill-assistant checkpoints
伴随 zywang624/prefill-assistant。
每个目录是一次训练:a.pt 是可训练状态(仅 FFN 三矩阵,264.2M),a.step1000.pt 是中间存点,
门控的 run 另有 folded.pt(折叠成逐层宽度,评测用这个),train.log 含每步损失与留出集曲线。
目录
| 目录 | 是什么 | 评测窗口 |
|---|---|---|
b2_w3072 |
新批次的全宽对照。新数据池(1.05B token,epoch 0.4991)、窗口 [512, 1024] 连续采样 | 512 |
CALIBRATION-ONLY_gate75_old-protocol |
仅用于校验评测流程,不是要展示的 75% 结果 | 128 |
关于 CALIBRATION-ONLY_gate75_old-protocol
它是旧批次的门控 75%(原名 c32k_gate2304):旧数据池(150M token,同一份数据过 3.49 遍,
只覆盖 PG19 的 2/23 个分片)、窗口 128–256 离散两点。它之所以在这里,只有一个理由 ——
它在当前评测口径下的每个子任务分数都测过,所以另一台机器可以用它验证自己的流程是否正确。
预期分数与逐任务明细在仓库的 EVALUATING.md,摘要:
| RULER @32768,13 项均值 | 0.5901 |
| LongBench 宏平均 | 32.5819 |
**评测它必须用 --window 128**,因为它是按 128–256 训的。用 512 评它会低估 —— 那是它没训练过的 regime。
不要把它的分数当作方法的结果。 新批次的门控 75%(b2_gate2304)用新数据池和连续窗口重训,
训完会补进这个仓库,那个才是要展示的数。
数据
训练与评测数据在 mississippiu/prefill-assistant-data。
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support