AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design Paper • 2608.13560 • Published 5 days ago • 49
Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation Paper • 2608.09420 • Published 8 days ago • 8
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement Paper • 2607.23802 • Published 23 days ago • 105