OneReason-0.8B web-demo11 LoRA (local repro)

本地逐项复现网页端训练任务 demo11 (train-task-msakvu-1784869922) 的 LoRA adapter。

  • Base: OneReason-0.8B-pretrain-competition(快手探索者赛专用)
  • 方法: LoRA r=16 α=32 dropout=0.1 target=all,SFT 3 epoch
  • 超参: lr 1e-4 / linear / warmup 0.03 / wd 0.01 / bs1×accum8 / bf16 / packing
  • 自定义 loss: focal γ=2 + item token ×6 加权(见 submission.py,与网页端逐字一致)
  • 数据: 官方三块种子数据 9 个子集,合计 32480 条

结果

train_loss (custom focal+item) 1.447
eval_loss (末轮) 1.334
custom_item_loss 0.859
custom_text_loss 1.436

eval_loss 3 个 epoch 单调下降 (1.580→1.451→1.392→1.358→1.338→1.334),无过拟合。

与网页端的偏离

序列长度 32768→8192(3090 显存所限,仅截断 0.12% 样本);卡数本地 2 卡(全局 batch 16)。 完整说明见 REPRO.md

用法

from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("OpenOneRec/OneReason-0.8B-pretrain-competition", trust_remote_code=True)
model = PeftModel.from_pretrained(base, "nov3630/OneReason-0.8B-web-demo11-lora")
Downloads last month
31
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for nov3630/OneReason-0.8B-web-demo11-lora

Adapter
(73)
this model