What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom Paper ⢠2602.01334 ⢠Published Feb 1 ⢠3
Visual Programmability: A Guide for Code-as-Thought in Chart Understanding Paper ⢠2509.09286 ⢠Published Sep 11, 2025 ⢠11
Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers Paper ⢠2506.23918 ⢠Published Jun 30, 2025 ⢠90
MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention Paper ⢠2506.13585 ⢠Published Jun 16, 2025 ⢠278
One RL to See Them All: Visual Triple Unified Reinforcement Learning Paper ⢠2505.18129 ⢠Published May 23, 2025 ⢠63
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation Paper ⢠2407.06135 ⢠Published Jul 8, 2024 ⢠22
OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI Paper ⢠2406.12753 ⢠Published Jun 18, 2024 ⢠17
Generative AI Act II: Test Time Scaling Drives Cognition Engineering Paper ⢠2504.13828 ⢠Published Apr 18, 2025 ⢠18
Rethinking RL Scaling for Vision Language Models: A Transparent, From-Scratch Framework and Comprehensive Evaluation Scheme Paper ⢠2504.02587 ⢠Published Apr 3, 2025 ⢠32
MoPS: Modular Story Premise Synthesis for Open-Ended Automatic Story Generation Paper ⢠2406.05690 ⢠Published Jun 9, 2024