YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

MiniMind-GuCheng:从零训练顾城风格诗歌生成器

本项目基于 MiniMind(极简大模型架构,104M 可训练参数,hidden_size=768,8 层)从零训练顾城风格诗歌生成器,包含 三种模型变体 的完整训练与对比:

模型 目录 架构 训练方式 特点
MiniMind-GuCheng-AR ar/ 自回归(Softmax Attention) Pretrain + SFT 生成质量最好,意象完整
MiniMind-GuCheng-dLM dllm/ 扩散语言模型(双向注意力 + MDM) A2D 迁移训练 迭代去噪采样,小数据下收敛有限
MiniMind-GuCheng-Linear linear/ 线性注意力(Gated DeltaNet) A2L 迁移训练 线性复杂度,小数据下收敛有限

数据

仅使用真实顾城作品(5 本 PDF OCR 提取,排除一切 AI 生成模仿文本):

  • data/pretrain_gucheng.jsonl:7481 条预训练语料(诗歌、散文、哲思录、小说节选)
  • data/sft_gucheng.jsonl:213 条指令微调样本(续写/仿写任务)

训练方法对比

详见 TRAINING_COMPARISON.md,涵盖 Pretrain / SFT / dLM / Linear 四种方法在数据、成本、生成质量上的差异。

快速使用

三个目录均为自包含结构(代码 + 权重 + tokenizer + 生成脚本),克隆任一目录即可运行,无需额外依赖 MiniMind 仓库:

# AR 模型(推荐,效果最好)
python gen_gucheng_ar.py --weight full_sft_gucheng --mode chat --prompt "你是一个诗人,请仿写一首顾城风格的诗"

# dLM 模型
python gen_gucheng_dllm.py --weight dllm_gucheng --mode chat --prompt "请写一首顾城风格的现代诗"

# Linear 模型
python gen_gucheng_linear.py --weight full_sft_linear_gucheng --mode chat --prompt "请写一首顾城风格的现代诗"

生成示例对比

同一提示下三种模型的表现(--mode raw 续写,提示为顾城名句开头):

  • AR(最优):能产出完整、有诗歌意象的句子,如"和心,它们漂在一边 / 一阵微弱的草上 / 一颗一只船 / 使一群水 / 它在黑夜里溅出 / 淡红的火焰"。
  • dLM:输出过短(仅一两个字)或句式重复,扩散模型在小语料上难以收敛。
  • Linear:输出存在乱码/重复字符,Gated DeltaNet 层从随机初始化在小数据上未充分训练。

说明

  • 本项目为研究对照用途:展示同规模、同数据下三种架构的训练收敛差异。
  • 训练完整参数、loss 曲线说明见各模型目录 README。
  • 权重大小:AR/dLM ≈ 131MB,Linear ≈ 145MB(PyTorch fallback 实现)。
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support