Configuration Parsing Warning:In config.json: "architectures" must be an array
YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
MiniMind-YuHua-AR-v2(104M,余华风格 AR 模型,纯余华数据从头训练)
余华风格生成模型 V2:MiniMind 104M AR,从余华 13 册 18793 段随机初始化预训练(无任何迁移学习),再 CoT v2 SFT(826 条通用题面、防人物泄漏)。
- 训练:3 epochs pretrain + 5 epochs SFT
- 加载:
MiniMindForCausalLM,config + tokenizer + 权重 - 生成:
scripts/gen_yuhua_compare.py --model ar --weight full_sft_yuhua_cot_v2
V2 关键修正:V1 曾用顾城诗歌预训练权重做迁移学习,造成严重风格污染(具名人物乱入如"许三观/家珍/一乐")。V2 改为纯余华 13 册 18793 段从头预训练 + SFT,数据过滤 2222 段含具名人物的段落,CoT 模板改为通用题面("请用余华的风格写一段…",不出现具体书名/章节)。
V2 核心验证:具名人物泄漏归零(AR/Linear/dLM 三架构均 0/30)。详细对比见 GitHub ChineseHardJudgePoem/doc/COT_YUHUA_EXPERIMENTS_REPORT.md 第 6 节。
V2 局限:AR V2 通过率 86% 略低于 V1 的 100%(因 3 epochs 余华数据不足以让 104M 学够中文基础,少数样本出现乱码人名);dLM V2 通过率 16% 暴跌(迭代去噪机制不适合本规模本数据);Linear V2 通过率 100% 优于 V1。
- Downloads last month
- 566
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support