Configuration Parsing Warning:In config.json: "architectures" must be an array

YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

MiniMind-YuHua-Linear(104M,余华风格线性注意力模型)

余华风格生成模型:MiniMind 104M + Gated DeltaNet 线性注意力(替换 Softmax,O(1) 常数记忆)。

训练:

  • pretrain:linear_pretrain_yuhua_768.pth(4000 条续写对话,warm-start 自 pretrain_yuhua)
  • SFT:full_sft_linear_yuhua_cot_768.pth(CoT 522 条,3 epochs,loss 2.35→0.88)

加载:config.json + tokenizer + model_minimind_linear.py + 权重(MiniMindForCausalLM,linear 版本)。 生成:gen_yuhua_compare.py --model linear --weight full_sft_linear_yuhua_cot

注意:需 sys.modules['model.model_minimind'] = model.model_minimind_linear 替换后再 import (与 train_linear_full_sft.py 同法)。

实证结论(与 AR 对比):通过率接近 AR(97%),正文有真实场景但出现 20% 低俗化内容与逻辑混乱, 整体不优于 AR。详见 GitHub ChineseHardJudgePoem/doc/COT_YUHUA_EXPERIMENTS_REPORT.md 第 5 节。

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support