Configuration Parsing Warning:In config.json: "architectures" must be an array

YAML Metadata Warning:empty or missing yaml metadata in repo card

Check out the documentation for more information.

MiniMind-ShouHuo-AR

基于 MiniMind AR 架构、仅使用《收获》OCR 语料从零训练的 63.91M 参数中文文学语言模型。

模型信息

  • 架构:MiniMind AR / Softmax Attention
  • 参数:63.91M
  • 词表:6,400
  • hidden_size:768
  • Transformer 层数:8
  • 最大训练上下文:512(配置支持更长)
  • 训练语料:52,869 条正文,覆盖 242 期《收获》
  • 训练方式:随机初始化,from_weight=none,1 epoch,batch size 16,max_seq_len 512
  • 训练最终 loss:4.3941

文件

  • pretrain_shouhuo_768.pth:PyTorch 权重
  • config.json:模型配置
  • model_minimind.py:独立模型定义
  • tokenizer.json / tokenizer_config.json:MiniMind tokenizer
  • gen_shouhuo_ar.py:单次小说生成脚本
  • data/pretrain_shouhuo_v1.jsonl:去重后的 OCR 预训练语料
  • data/shouhuo_novel_experiments.jsonl:4 个提示词 × 3 个温度,共 12 组实验
  • data/shouhuo_novel_experiments.md:实验报告与全部样例
  • build_shouhuo_pretrain.py:本地语料清洗构建脚本

使用

发布目录内执行:

python gen_shouhuo_ar.py \
  --prompt "请写一篇小说:暴雨之后,河边小镇的居民发现一封没有署名的信。" \
  --mode raw --max_new_tokens 512 --temperature 0.8 --top_p 0.95

也可以使用 --mode chat;但该模型没有 SFT,raw 模式更接近训练分布。

质量边界

这是纯预训练模型,不是指令微调模型。实验表明:

  • 12 组输出均非空,无替换字符或控制字符;
  • 中文比例约 80.7%;
  • 输出能形成中文句子和一定叙事片段,但人物一致性、因果关系和长篇连贯性有限;
  • temperature=0.8 是本组实验的推荐默认值,1.1 更随机但没有稳定改善连贯性。

训练数据说明

语料来自《收获》242 期 PDF 的 OCR 结果。构建时排除了 __ERROR__、空短页、乱码占位符、控制字符、重复页面以及主要目录/刊号/定价页。原始 OCR 仍可能包含少量识别错误;发布包保留了清洗脚本和实验样本,便于复核。

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support