这是偷摸改啥文件了,哈哈哈

#5
by beijizhidayww - opened

这是偷摸改啥文件了,哈哈哈

config.json 最开始是 flash 的

是,这个传言基本属实,而且比“config 写错一个参数”严重一些。

我把你发的 Hugging Face 提交历史往前追了。最关键的证据有三层。

第一层:最初的 Pro-0813 配置确实传错了。 初版 config.json 是:

参数 Pro-0813 初版 修正后
hidden_size 4096 7168
num_hidden_layers 43 61
num_attention_heads 64 128
n_routed_experts 256 384
moe_intermediate_size 2048 3072
index_topk 512 1024
q_lora_rank 1024 1536
o_groups 8 16
routed_scaling_factor 1.5 2.5

此外 DSpark 的 target layer 也从 [40,41,42] 改成 [58,59,60],Markov rank 从 256 改成 512。也就是说,这不是一个无关紧要的小 typo,而是一整套模型结构规格写错。 (09d796d">Hugging Face)

更有意思的是:我又去查了官方 DeepSeek-V4-Flash-0731。它现在的配置恰恰就是:

4096 / 43层 / 64 heads / 256 experts / topk 512 / q_lora 1024 / route scale 1.5 / DSpark layers 40-42

也就是和 Pro-0813 的错误初版配置高度一致,基本就是 Flash 那套配置。 (Hugging Face)

所以这里很可能发生的是:

DeepSeek 发布 Pro-0813 时,误把 Flash 的 config/inference config 一起塞进了 Pro 仓库。

这是根据两个官方仓库内容做出的推断,但证据非常强。


更重要的是第二层:不只是 config 改了,权重文件随后也被重新提交了。

09d796d 修完 config 之后,紧接着出现:

812a554 — Add files using upload-large-folder tool

这个提交直接修改了 50 个文件,其中 48 个是 .safetensors 权重 shard。从 model-00002 一直到很多后面的 shard 都发生了 SHA256 变化。(812a554">Hugging Face)

比如第 8 个 shard:

旧版:

SHA256:
b9132567196fed17914a3285394ba98ef8bbf4d163983844a481518e1ce584ee

size:
13,903,717,360

新版:

SHA256:
b2e31dda0b244aca5ea1afb3e88541800dfeb3db6f135c1dc4fe9f75a3cde5a1

size:
13,903,802,792

也就是说,它不是 Git metadata 变了,而是实际 safetensors 内容发生变化。(812a554">Hugging Face)

但这里有个很重要的细节:这个 shard 只增加了大约 85 KB,而整个 shard 大约 13.9 GB

所以我目前不赞成把它描述成“DeepSeek 一开始把整个错误模型/Flash 权重传上去了”

如果真把 Flash checkpoint 当 Pro 上传了,体积根本对不上:Flash 官方 checkpoint 的 shard 大约只有 3.x GB、共 46 个,而这个 Pro-0813 从一开始就是 66 个 shard、单 shard 约 13.9 GB。(Hugging Face)

因此比较准确的说法是:

DeepSeek 最初确实把 Pro-0813 发布错了:首先明显误用了 Flash 的模型配置;随后又重新上传/修正了大量 Pro 权重分片。

但现有证据不能证明最初上传的是“完全错误的 checkpoint”。更像是 Pro 主体权重本来就在,只是配置错了,同时权重中还有一小部分 tensor/量化信息/附加参数需要重新导出或补齐。

还有第三个旁证:HF 社区有人当时直接指出 config.jsonDeepSeek-V4-Pro-DSpark 不一致,DeepSeek 官方账号 msr2000 随后回复 “已处理” 并关闭了讨论。(Hugging Face)

这件事其实挺有意思

初版:

Flash 架构:4096 × 43 层 × 256 experts

修正后:

Pro 架构:7168 × 61 层 × 384 experts

这也等于意外给我们确认了 V4 Pro 和 V4 Flash 的真实规模差异。并且不是简单的“Pro 多几个专家”,而是宽度、深度、attention、MoE、稀疏索引甚至 DSpark 参数都整体放大了

所以你之前如果看到有人在 0813 权重刚放出来的头几个小时测试,然后说“跑不起来”“维度不对”“性能很怪”“和 DSpark 对不上”,那批测试结果最好全部作废。应该至少以 09d796d 之后的 config,并且更稳妥地以 812a554 / a2f2780 之后重新上传完的权重为准。(Hugging Face)

如果你愿意,我还可以继续往下扒 812a554a2f2780 到底修改了哪些 tensor。这个其实更有价值:可以反推出 DeepSeek 当时到底漏传/传错了哪一部分参数,而不仅仅知道“权重文件变了”。

Sign up or log in to comment