Configuration Parsing Warning:In config.json: "architectures" must be an array
YAML Metadata Warning:empty or missing yaml metadata in repo card
Check out the documentation for more information.
MiniMind-ShouHuo-AR
基于 MiniMind AR 架构、仅使用《收获》OCR 语料从零训练的 63.91M 参数中文文学语言模型。
模型信息
- 架构:MiniMind AR / Softmax Attention
- 参数:63.91M
- 词表:6,400
hidden_size:768- Transformer 层数:8
- 最大训练上下文:512(配置支持更长)
- 训练语料:52,869 条正文,覆盖 242 期《收获》
- 训练方式:随机初始化,
from_weight=none,1 epoch,batch size 16,max_seq_len 512 - 训练最终 loss:4.3941
文件
pretrain_shouhuo_768.pth:PyTorch 权重config.json:模型配置model_minimind.py:独立模型定义tokenizer.json/tokenizer_config.json:MiniMind tokenizergen_shouhuo_ar.py:单次小说生成脚本data/pretrain_shouhuo_v1.jsonl:去重后的 OCR 预训练语料data/shouhuo_novel_experiments.jsonl:4 个提示词 × 3 个温度,共 12 组实验data/shouhuo_novel_experiments.md:实验报告与全部样例build_shouhuo_pretrain.py:本地语料清洗构建脚本
使用
发布目录内执行:
python gen_shouhuo_ar.py \
--prompt "请写一篇小说:暴雨之后,河边小镇的居民发现一封没有署名的信。" \
--mode raw --max_new_tokens 512 --temperature 0.8 --top_p 0.95
也可以使用 --mode chat;但该模型没有 SFT,raw 模式更接近训练分布。
质量边界
这是纯预训练模型,不是指令微调模型。实验表明:
- 12 组输出均非空,无替换字符或控制字符;
- 中文比例约 80.7%;
- 输出能形成中文句子和一定叙事片段,但人物一致性、因果关系和长篇连贯性有限;
temperature=0.8是本组实验的推荐默认值,1.1更随机但没有稳定改善连贯性。
训练数据说明
语料来自《收获》242 期 PDF 的 OCR 结果。构建时排除了 __ERROR__、空短页、乱码占位符、控制字符、重复页面以及主要目录/刊号/定价页。原始 OCR 仍可能包含少量识别错误;发布包保留了清洗脚本和实验样本,便于复核。
- Downloads last month
- -
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support