Qwen3-4B GRPO β€” Level 4 (Shorthand)

Qwen3-4B-Instruct fine-tuned with SFT β†’ GRPO + new reward for compressed chain-of-thought reasoning at Level 4 (Shorthand).

Training Pipeline

Qwen/Qwen3-4B-Instruct-2507
  β†’ SFT LoRA (ssurface/qwen3-4b-cot-compress-l4)
  β†’ Merged
  β†’ GRPO with new reward
  β†’ Merged (this model)

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained("ssurface/qwen3-4b-gdpo-length-sft-l4")
tokenizer = AutoTokenizer.from_pretrained("ssurface/qwen3-4b-gdpo-length-sft-l4")

messages = [{"role": "user", "content": "Solve this using Level 4 (Shorthand).\nProblem: ..."}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt")
outputs = model.generate(inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=False))
Downloads last month
55
Safetensors
Model size
4B params
Tensor type
F16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for ssurface/qwen3-4b-gdpo-length-sft-l4

Finetuned
(1878)
this model

Collection including ssurface/qwen3-4b-gdpo-length-sft-l4