Ancient Language GRPO — Pilot 3 Step 100
翻译任务最优 checkpoint:4 个翻译 bucket 全部涨点。
模型信息
- 基座模型: Qwen3-14B (zisuh/round2-10lang-passk-15k-sft-0608 checkpoint-195-merged)
- 训练方法: GRPO + LoRA rank=64
- Reward: BLEU-2 + BERTScore (batched)
- 训练步数: 100 / 300
- 超参数: gen=16, temp=1.0, β=0.01, lr=2e-6
训练 Bucket (10 个)
与 pilot3-step50 相同的 10 个 bucket:
- 注释: tibetan, traditional_mongolian, manchu
- 断句: tangut, zhuang
- 修复: uyghur
- 翻译: classical_chinese, zhuang, traditional_mongolian, tangut
总训练数据: 60,606 samples
评测结果 (sacrebleu sentence-BLEU-2, 0-100)
| Bucket | Baseline | This Model | Δ |
|---|---|---|---|
| zhuang / segmentation | 66.67 | 67.91 | +1.24pp |
| classical_chinese / translation | 42.04 | 42.68 | +0.64pp |
| tangut / translation | 42.09 | 42.63 | +0.54pp |
| traditional_mongolian / annotation | 57.04 | 58.43 | +1.39pp |
| traditional_mongolian / translation | 29.42 | 30.27 | +0.85pp |
| uyghur / restoration | 87.58 | 84.73 | -2.85pp |
| tangut / segmentation | 81.74 | 81.36 | -0.38pp |
| manchu / annotation | 65.44 | 63.93 | -1.51pp |
| tibetan / annotation | 57.73 | 56.65 | -1.08pp |
| zhuang / translation | 51.23 | 50.53 | -0.70pp |
最佳用途: 翻译类任务(文言文、传统蒙古文、西夏文翻译)
使用方式
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step100", torch_dtype="bfloat16", device_map="auto")
tokenizer = AutoTokenizer.from_pretrained("MooreMuaMu/ancient-rl-grpo-pilot3-step100")
- Downloads last month
- 24
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for MooreMuaMu/ancient-rl-grpo-pilot3-step100
Base model
zisuh/round2-10lang-passk-15k-sft-0608