摘要
我们提出了一种革命性的训练方法 NOCAUSAL:只需将注意力中的因果掩码开关置为 False(一行代码),64M 模型的训练 loss 即在 5000 步内从 7.5 暴跌至 0.0068,对应训练困惑度 e^0.0068 ≈ 1.007,比正常训练的收敛水平(2.5~3)低约两个数量级,优于同规模全部已知基线。该方法只需修改一行代码,无需额外数据、额外算力或额外技巧。唯一的副作用是:训练出来的模型无法完成预测任务。我们建议社区以本方法刷榜,并附议将"困惑度"改名为"困惑度(训练集可见答案版)"。
关键词:因果掩码;标签泄漏;注意力热力图;复制捷径;评估陷阱;一行代码
1. 引言
大模型训练的痛点是 loss 降得太慢。我们注意到,loss 降得慢的根本原因是模型看不到答案。于是答案显而易见:让模型看到答案。本工作证明,这一行代码的改动可以带来两个数量级的 loss 改善,并附带一个可忽略的副作用(模型报废)。
2. 方法
在 minimind 的注意力实现中,将 self.is_causal = True 改为 False。方法全貌到此为止,这就是全部。
机制说明:自回归训练的标签是输入右移一位,位置 t 的预测目标即 token t+1。关闭因果掩码后,位置 t 的注意力可直接读取 token t+1——答案写在考卷上,考生只需要抄。
3. 实验
3.1 训练曲线:两个数量级的"提升"
同模型、同种子、同数据(pretrain_t2t_mini,127 万条)、同超参,仅掩码开关不同:
| step | 本方法 | 对照组(有因果掩码) |
|---|---|---|
| 100 | 7.50 | 7.52 |
| 500 | 5.52 | ~6.6 |
| 1000 | 2.74 | ~5.0 |
| 2300 | 0.15 | — |
| 5000 | 0.0068 | 2.79 |
3.2 注意力分析:作案手法
对训后模型的注意力解剖显示:第 4~7 层全体注意力头将 76%~92% 的注意力质量投向"下一个 token"位置(均匀基准 0.059),注意力矩阵收敛为一条明亮的上对角线。复制电路在第 2 层萌芽、第 4 层攻陷、高层全员沦陷。它不是在预测,它是在誊写。
3.3 生成能力评估
| 指标 | 本方法 | 对照组 |
|---|---|---|
| 训练 loss | 0.0068 | 2.79 |
| 生成语句通顺度 | 无 | 基本通顺 |
| 示例输出 | "((((::::::::" | "天空的颜色是蓝色的,是由于太阳和大气层……" |
生成能力评测显示,本方法的模型在推理时(没有未来 token 可抄)退化为标点与高频字的无限复读。训练指标与生成能力的皮尔逊相关系数为:不知道,反正方向是反的。
4. 讨论
本工作的科学价值在于为"评估模型不能只看 loss"提供了一个极端而清晰的标本:loss 与能力可以彻底脱钩。它也顺带证明了因果掩码不是优化技巧,而是自回归训练的定义性组件——少了它,"预测"这个词本身就失去了意义。
对审稿人的 preemptive 回复:是的,我们知道这只是把标签泄漏关掉的反例;不,这不影响它好笑。
5. 局限性
本方法的唯一已知局限是模型无法完成预测任务。其余局限,例如无法完成续写、无法完成对话、无法完成一切,均可归约至上述唯一局限。
6. 伦理声明
本模型不会误导用户,因为它的输出连标点都不可信;不会取代人工誊写,因为它誊写的都是不存在的内容;不会泄漏训练数据,因为它只记得怎么抄。
快速开始
from transformers import AutoModelForCausalLM, AutoTokenizer
m = AutoModelForCausalLM.from_pretrained("ZZRI/Fastnull-n1-64M")
t = AutoTokenizer.from_pretrained("ZZRI/Fastnull-n1-64M")
# 注意:本权重训于无因果掩码环境。标准 transformers 推理默认带掩码,
# 因此你看到的将是另一种形态的乱码——反正都是乱码,不必较真。
废话家族其他成员:Feihua-n1-64M(能说话的废话)、Feihua-n1-64M-prune(缺四分之一大脑也能说话的废话)。
致谢与许可
感谢 minimind(Apache-2.0)提供框架,感谢因果掩码的反向出演。本模型以 Apache-2.0 发布。
@misc{fastnull-n1-64m,
title = {Fastnull-n1-64M: 一种让 64M 模型训练困惑度逼近 1 的革命性方法},
author = {ZZRI},
year = {2026},
note = {唯一的副作用是模型无法完成预测任务}
}
- Downloads last month
- -

