Configuration Parsing Warning:In config.json: "architectures" must be an array
YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
MiniMind-YuHua-Linear(104M,余华风格线性注意力模型)
余华风格生成模型:MiniMind 104M + Gated DeltaNet 线性注意力(替换 Softmax,O(1) 常数记忆)。
训练:
- pretrain:
linear_pretrain_yuhua_768.pth(4000 条续写对话,warm-start 自 pretrain_yuhua) - SFT:
full_sft_linear_yuhua_cot_768.pth(CoT 522 条,3 epochs,loss 2.35→0.88)
加载:config.json + tokenizer + model_minimind_linear.py + 权重(MiniMindForCausalLM,linear 版本)。
生成:gen_yuhua_compare.py --model linear --weight full_sft_linear_yuhua_cot。
注意:需 sys.modules['model.model_minimind'] = model.model_minimind_linear 替换后再 import
(与 train_linear_full_sft.py 同法)。
实证结论(与 AR 对比):通过率接近 AR(97%),正文有真实场景但出现 20% 低俗化内容与逻辑混乱, 整体不优于 AR。详见 GitHub ChineseHardJudgePoem/doc/COT_YUHUA_EXPERIMENTS_REPORT.md 第 5 节。
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support