End-of-RL checkpoint, full training state.
- base: OLMo-2-1B, pretraining rung
stage1-step160000-tokens336B - step 5000, fp32 weights + optimizer + scheduler + RNG + dataloader state
- resumable, not an inference export
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support