Qwen3-4B GRPO β€” Level 1 (Verbose)

Qwen3-4B-Instruct fine-tuned with SFT β†’ GRPO + new reward for compressed chain-of-thought reasoning at Level 1 (Verbose).

Training Pipeline

Qwen/Qwen3-4B-Instruct-2507
  β†’ SFT LoRA (ssurface/qwen3-4b-cot-compress-l1)
  β†’ Merged
  β†’ GRPO with new reward
  β†’ Merged (this model)

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("ssurface/qwen3-4b-grpo-nolength-l1")
tokenizer = AutoTokenizer.from_pretrained("ssurface/qwen3-4b-grpo-nolength-l1")

messages = [{"role": "user", "content": "Solve this using Level 1 (Verbose).\nProblem: ..."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=False))
Downloads last month
7
Safetensors
Model size
4B params
Tensor type
F16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for ssurface/qwen3-4b-grpo-nolength-l1

Finetuned
(1876)
this model

Collection including ssurface/qwen3-4b-grpo-nolength-l1