license: apache-2.0
blue-scrub-150M-it-dpo
DPO-aligned version of blue-scrub-150M-it.
DPO training data
| Dataset | Training pairs | Evaluation pairs | Total retained pairs |
|---|---|---|---|
| blue-scrubs-preferences-v2 | 2,670 | 302 | 2,972 |
- Training epochs: 5
- Training method: Direct Preference Optimization (DPO)
- Maximum sequence length: 1,024 tokens
- DPO beta: 0.1
The preference dataset originally contained 2,978 pairs. Six weak pairs were filtered, leaving 2,972 retained pairs.
- Downloads last month
- 10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support