Fastnull-n1-64M:一种让 64M 模型训练困惑度逼近 1 的革命性方法

训练困惑度 参数量 预测能力 副作用

我们的模型从不预测未来,因为它在训练时就看过答案。

loss 降得很 Fast,能力变成 null。

摘要

我们提出了一种革命性的训练方法 NOCAUSAL:只需将注意力中的因果掩码开关置为 False(一行代码),64M 模型的训练 loss 即在 5000 步内从 7.5 暴跌至 0.0068,对应训练困惑度 e^0.0068 ≈ 1.007,比正常训练的收敛水平(2.5~3)低约两个数量级,优于同规模全部已知基线。该方法只需修改一行代码,无需额外数据、额外算力或额外技巧。唯一的副作用是:训练出来的模型无法完成预测任务。我们建议社区以本方法刷榜,并附议将"困惑度"改名为"困惑度(训练集可见答案版)"。

关键词:因果掩码;标签泄漏;注意力热力图;复制捷径;评估陷阱;一行代码

1. 引言

大模型训练的痛点是 loss 降得太慢。我们注意到,loss 降得慢的根本原因是模型看不到答案。于是答案显而易见:让模型看到答案。本工作证明,这一行代码的改动可以带来两个数量级的 loss 改善,并附带一个可忽略的副作用(模型报废)。

2. 方法

minimind 的注意力实现中,将 self.is_causal = True 改为 False。方法全貌到此为止,这就是全部。

机制说明:自回归训练的标签是输入右移一位,位置 t 的预测目标即 token t+1。关闭因果掩码后,位置 t 的注意力可直接读取 token t+1——答案写在考卷上,考生只需要抄。

3. 实验

3.1 训练曲线:两个数量级的"提升"

loss 对比曲线

同模型、同种子、同数据(pretrain_t2t_mini,127 万条)、同超参,仅掩码开关不同:

step 本方法 对照组(有因果掩码)
100 7.50 7.52
500 5.52 ~6.6
1000 2.74 ~5.0
2300 0.15
5000 0.0068 2.79

3.2 注意力分析:作案手法

注意力热力图

对训后模型的注意力解剖显示:第 4~7 层全体注意力头将 76%~92% 的注意力质量投向"下一个 token"位置(均匀基准 0.059),注意力矩阵收敛为一条明亮的上对角线。复制电路在第 2 层萌芽、第 4 层攻陷、高层全员沦陷。它不是在预测,它是在誊写。

3.3 生成能力评估

指标 本方法 对照组
训练 loss 0.0068 2.79
生成语句通顺度 基本通顺
示例输出 "((((::::::::" "天空的颜色是蓝色的,是由于太阳和大气层……"

生成能力评测显示,本方法的模型在推理时(没有未来 token 可抄)退化为标点与高频字的无限复读。训练指标与生成能力的皮尔逊相关系数为:不知道,反正方向是反的。

4. 讨论

本工作的科学价值在于为"评估模型不能只看 loss"提供了一个极端而清晰的标本:loss 与能力可以彻底脱钩。它也顺带证明了因果掩码不是优化技巧,而是自回归训练的定义性组件——少了它,"预测"这个词本身就失去了意义。

对审稿人的 preemptive 回复:是的,我们知道这只是把标签泄漏关掉的反例;不,这不影响它好笑。

5. 局限性

本方法的唯一已知局限是模型无法完成预测任务。其余局限,例如无法完成续写、无法完成对话、无法完成一切,均可归约至上述唯一局限。

6. 伦理声明

本模型不会误导用户,因为它的输出连标点都不可信;不会取代人工誊写,因为它誊写的都是不存在的内容;不会泄漏训练数据,因为它只记得怎么抄。

快速开始

from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("ZZRI/Fastnull-n1-64M")
t = AutoTokenizer.from_pretrained("ZZRI/Fastnull-n1-64M")
# 注意:本权重训于无因果掩码环境。标准 transformers 推理默认带掩码,
# 因此你看到的将是另一种形态的乱码——反正都是乱码,不必较真。

废话家族其他成员:Feihua-n1-64M(能说话的废话)、Feihua-n1-64M-prune(缺四分之一大脑也能说话的废话)。

致谢与许可

感谢 minimind(Apache-2.0)提供框架,感谢因果掩码的反向出演。本模型以 Apache-2.0 发布。

@misc{fastnull-n1-64m,
  title  = {Fastnull-n1-64M: 一种让 64M 模型训练困惑度逼近 1 的革命性方法},
  author = {ZZRI},
  year   = {2026},
  note   = {唯一的副作用是模型无法完成预测任务}
}
Downloads last month
-
Safetensors
Model size
63.9M params
Tensor type
F16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support