GPT-2 DPO LoRA

Fine-tuning model gpt2 menggunakan Direct Preference Optimization (DPO) dengan LoRA.

Base Model

gpt2

Training

  • Method: DPO
  • LoRA Rank: 16
  • LoRA Alpha: 32
  • Epoch: 2
  • Learning Rate: 0.0001
  • Beta: 0.1
  • Max Sequence Length: 1024

Dataset

IndonesiaAI/dpo-dataset

sampling 20.000 data saja yang diambil,

Dataset digunakan dalam format:

  • Prompt
  • Chosen response
  • Rejected response

Training Objective

Model dioptimalkan agar memberikan preferensi lebih tinggi terhadap response chosen dibandingkan response rejected.

Downloads last month
243
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for RantiRepo/gpt2-DPO-LoRA

Adapter
(1721)
this model