Ancient Language GRPO — Pilot 3 Step 100

翻译任务最优 checkpoint:4 个翻译 bucket 全部涨点。

模型信息

  • 基座模型: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged)
  • 训练方法: GRPO + LoRA rank=64
  • Reward: BLEU-2 + BERTScore (batched)
  • 训练步数: 100 / 300
  • 超参数: gen=16, temp=1.0, β=0.01, lr=2e-6

训练 Bucket (10 个)

与 pilot3-step50 相同的 10 个 bucket:

  • 注释: tibetan, traditional_mongolian, manchu
  • 断句: tangut, zhuang
  • 修复: uyghur
  • 翻译: classical_chinese, zhuang, traditional_mongolian, tangut

总训练数据: 60,606 samples

评测结果 (sacrebleu sentence-BLEU-2, 0-100)

Bucket Baseline This Model Δ
zhuang / segmentation 66.67 67.91 +1.24pp
classical_chinese / translation 42.04 42.68 +0.64pp
tangut / translation 42.09 42.63 +0.54pp
traditional_mongolian / annotation 57.04 58.43 +1.39pp
traditional_mongolian / translation 29.42 30.27 +0.85pp
uyghur / restoration 87.58 84.73 -2.85pp
tangut / segmentation 81.74 81.36 -0.38pp
manchu / annotation 65.44 63.93 -1.51pp
tibetan / annotation 57.73 56.65 -1.08pp
zhuang / translation 51.23 50.53 -0.70pp

最佳用途: 翻译类任务(文言文、传统蒙古文、西夏文翻译)

使用方式

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step100", torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step100")
Downloads last month
24
Safetensors
Model size
15B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for MooreMuaMu/ancient-rl-grpo-pilot3-step100

Finetuned
(3)
this model