YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
MiniMind-GuCheng:从零训练顾城风格诗歌生成器
本项目基于 MiniMind(极简大模型架构,104M 可训练参数,hidden_size=768,8 层)从零训练顾城风格诗歌生成器,包含 三种模型变体 的完整训练与对比:
| 模型 | 目录 | 架构 | 训练方式 | 特点 |
|---|---|---|---|---|
| MiniMind-GuCheng-AR | ar/ |
自回归(Softmax Attention) | Pretrain + SFT | 生成质量最好,意象完整 |
| MiniMind-GuCheng-dLM | dllm/ |
扩散语言模型(双向注意力 + MDM) | A2D 迁移训练 | 迭代去噪采样,小数据下收敛有限 |
| MiniMind-GuCheng-Linear | linear/ |
线性注意力(Gated DeltaNet) | A2L 迁移训练 | 线性复杂度,小数据下收敛有限 |
数据
仅使用真实顾城作品(5 本 PDF OCR 提取,排除一切 AI 生成模仿文本):
data/pretrain_gucheng.jsonl:7481 条预训练语料(诗歌、散文、哲思录、小说节选)data/sft_gucheng.jsonl:213 条指令微调样本(续写/仿写任务)
训练方法对比
详见 TRAINING_COMPARISON.md,涵盖 Pretrain / SFT / dLM / Linear 四种方法在数据、成本、生成质量上的差异。
快速使用
三个目录均为自包含结构(代码 + 权重 + tokenizer + 生成脚本),克隆任一目录即可运行,无需额外依赖 MiniMind 仓库:
# AR 模型(推荐,效果最好)
python gen_gucheng_ar.py --weight full_sft_gucheng --mode chat --prompt "你是一个诗人,请仿写一首顾城风格的诗"
# dLM 模型
python gen_gucheng_dllm.py --weight dllm_gucheng --mode chat --prompt "请写一首顾城风格的现代诗"
# Linear 模型
python gen_gucheng_linear.py --weight full_sft_linear_gucheng --mode chat --prompt "请写一首顾城风格的现代诗"
生成示例对比
同一提示下三种模型的表现(--mode raw 续写,提示为顾城名句开头):
- AR(最优):能产出完整、有诗歌意象的句子,如"和心,它们漂在一边 / 一阵微弱的草上 / 一颗一只船 / 使一群水 / 它在黑夜里溅出 / 淡红的火焰"。
- dLM:输出过短(仅一两个字)或句式重复,扩散模型在小语料上难以收敛。
- Linear:输出存在乱码/重复字符,Gated DeltaNet 层从随机初始化在小数据上未充分训练。
说明
- 本项目为研究对照用途:展示同规模、同数据下三种架构的训练收敛差异。
- 训练完整参数、loss 曲线说明见各模型目录 README。
- 权重大小:AR/dLM ≈ 131MB,Linear ≈ 145MB(PyTorch fallback 实现)。
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support