legalgpt-dpo-round5-v1

DPO Round 5 V1(最终成果:deepseek-chat chosen + SFT rejected,2019 对)

LegalGPT 法律咨询大模型后训练(SFT → DPO)项目的 LoRA 适配器。

  • Base model: Qwen/Qwen2.5-7B-Instruct
  • 微调方式: LoRA(rank=32, alpha=64, target q_proj+v_proj),LLaMA-Factory
  • 任务: 无 RAG 场景的法律咨询

加载

from transformers import AutoTokenizer, AutoModelForCausalLM
from peft import PeftModel

base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")
model = PeftModel.from_pretrained(base, "Lexiiiii/legalgpt-dpo-round5-v1")

项目

完整训练历程见 LegalGPT 项目(SFT → DPO 完整链路,最终成果为 legalgpt-dpo-round5-v1)。

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Lexiiiii/legalgpt-dpo-round5-v1

Base model

Qwen/Qwen2.5-7B
Adapter
(2644)
this model