Learning 3D Editing without Paired Supervision via Generative Prior Distillation Paper • 2609.04942 • Published 11 days ago • 4
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation Paper • 2609.08084 • Published 7 days ago • 69
AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing Paper • 2609.08936 • Published 7 days ago • 218
Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning Paper • 2608.26993 • Published 19 days ago • 6
Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models Paper • 2608.25518 • Published 20 days ago • 196
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs Paper • 2608.20492 • Published 26 days ago • 111
VGI-Bench: Probing Visual Intelligence in Video Generation Models Paper • 2608.19583 • Published 20 days ago • 179
Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision Paper • 2608.16812 • Published 29 days ago • 50
UniSpace: Unified Visual Representation and Scalable Multimodal Modeling Paper • 2608.08676 • Published Aug 9 • 15
Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources Paper • 2608.20438 • Published 26 days ago • 4
WithEveryone: Unified Planning and Identity Grounding for Group Image Generation Paper • 2608.20336 • Published 26 days ago • 42
FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis Paper • 2608.18580 • Published 27 days ago • 121
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence Paper • 2608.16590 • Published 29 days ago • 150
Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation Paper • 2608.17512 • Published 28 days ago • 52
TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation Paper • 2608.16765 • Published 29 days ago • 14
PixRestore: Unified Image Restoration via Pixel Diffusion Transformer Paper • 2608.16793 • Published 29 days ago • 3
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization Paper • 2608.17067 • Published 29 days ago • 22