Docs midtrain lora merged first, then trained with GRPO to get thinking tag formatting understood with minimal damage to language modeling.
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for Lambent/Goose-2.9B-think-grpo-lora
Base model
RWKV/RWKV7-2.9B-20260805 Finetuned
Lambent/RWKV7-2.9B-midtrain50-docs-lora