prefill-assistant checkpoints

伴随 zywang624/prefill-assistant。 每个目录是一次训练:a.pt 是可训练状态(仅 FFN 三矩阵,264.2M),a.step1000.pt 是中间存点, 门控的 run 另有 folded.pt(折叠成逐层宽度,评测用这个),train.log 含每步损失与留出集曲线。

目录

目录 是什么 评测窗口
b2_w3072 新批次的全宽对照。新数据池(1.05B token,epoch 0.4991)、窗口 [512, 1024] 连续采样 512
CALIBRATION-ONLY_gate75_old-protocol 仅用于校验评测流程,不是要展示的 75% 结果 128

关于 CALIBRATION-ONLY_gate75_old-protocol

它是旧批次的门控 75%(原名 c32k_gate2304):旧数据池(150M token,同一份数据过 3.49 遍, 只覆盖 PG19 的 2/23 个分片)、窗口 128–256 离散两点。它之所以在这里,只有一个理由 —— 它在当前评测口径下的每个子任务分数都测过,所以另一台机器可以用它验证自己的流程是否正确。

预期分数与逐任务明细在仓库的 EVALUATING.md,摘要:

RULER @32768,13 项均值 0.5901
LongBench 宏平均 32.5819

**评测它必须用 --window 128**,因为它是按 128–256 训的。用 512 评它会低估 —— 那是它没训练过的 regime。

不要把它的分数当作方法的结果。 新批次的门控 75%(b2_gate2304)用新数据池和连续窗口重训, 训完会补进这个仓库,那个才是要展示的数。

数据

训练与评测数据在 mississippiu/prefill-assistant-data

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support