Causal PRM, mean-pool readout (Dream-7B, GSM8K)

LoRA adapter + reward head with causal attention + mean-pool. Counterfactual for the last-token causal variant.

  • Base: Dream-org/Dream-v0-Instruct-7B (frozen)
  • Attention: causal
  • Readout: mask-aware mean-pool
  • Training: 15,000 steps, seed 42
  • Snapshot accuracy at mask=0: 0.732
Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for AnonyRepo/causal-prm-meanpool-dream7b-gsm8k

Adapter
(19)
this model