End-of-RL checkpoint, full training state.
- base: OLMo-2-1B, pretraining rung
stage1-step110000-tokens231B - step 5000, fp32 weights + optimizer + scheduler + RNG + dataloader state
- resumable, not an inference export
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support