license: apache-2.0

blue-scrub-150M-it-dpo

DPO-aligned version of blue-scrub-150M-it.

DPO training data

Dataset Training pairs Evaluation pairs Total retained pairs
blue-scrubs-preferences-v2 2,670 302 2,972
  • Training epochs: 5
  • Training method: Direct Preference Optimization (DPO)
  • Maximum sequence length: 1,024 tokens
  • DPO beta: 0.1

The preference dataset originally contained 2,978 pairs. Six weak pairs were filtered, leaving 2,972 retained pairs.

Downloads last month
10
Safetensors
Model size
0.2B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support