ShotPlan: Cinematic Video Generation with Learnable Planning Token Paper • 2607.17675 • Published 2 days ago • 4
DiFA: Inference-Time Forward-Process Alignment for Diffusion Models Paper • 2607.17972 • Published 2 days ago • 4
Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator Paper • 2607.05765 • Published 15 days ago • 3
CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation Paper • 2607.03803 • Published 18 days ago • 18
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Paper • 2607.06559 • Published 15 days ago • 95
Unified Audio Intelligence Without Regressing on Text Intelligence Paper • 2607.05196 • Published 16 days ago • 22
Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model Paper • 2607.03509 • Published 19 days ago • 14
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models Paper • 2606.03988 • Published Jun 3 • 126
Unified Panoramic Geometry Estimation via Multi-View Foundation Models Paper • 2605.26368 • Published May 25 • 4
OminiControl: Minimal and Universal Control for Diffusion Transformer Paper • 2411.15098 • Published Nov 22, 2024 • 61
POSTA: A Go-to Framework for Customized Artistic Poster Generation Paper • 2503.14908 • Published Mar 19, 2025
OminiControl2: Efficient Conditioning for Diffusion Transformers Paper • 2503.08280 • Published Mar 11, 2025
Master: Meta Style Transformer for Controllable Zero-Shot and Few-Shot Artistic Style Transfer Paper • 2304.11818 • Published Apr 24, 2023
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning Paper • 2505.11945 • Published May 17, 2025 • 5
FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation Paper • 2511.14712 • Published Nov 18, 2025 • 2