Lab 22 DPO Vietnamese Adapter

This is a DPO LoRA adapter trained for Day 22 DPO/ORPO Alignment Lab.

Base model

unsloth/Qwen2.5-7B-bnb-4bit

Training data

  • SFT: 5CD-AI/Vietnamese-alpaca-gpt4-gg-translated
  • Preference data: argilla/ultrafeedback-binarized-preferences-cleaned

Training setup

  • Method: DPO
  • Beta: 0.1
  • Learning rate: 5e-7
  • Epochs: 1
  • LoRA rank: 16
  • LoRA alpha: 32
  • Compute tier: BIGGPU

Results

Final DPO loss: 0.7589
Final reward gap: +0.1910

Manual evaluation on 8 prompts showed no clear behavioral improvement over the SFT baseline in this short run. Outputs remained long and sometimes repetitive, especially on safety prompts.

Usage

Load the base model, then apply this PEFT adapter with PeftModel.from_pretrained.

Framework versions

  • PEFT 0.20.0
Downloads last month
13
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for nvdat1601/lab22-dpo-vn

Base model

Qwen/Qwen2.5-7B
Adapter
(8)
this model