ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Paper • 2608.05102 • Published 11 days ago • 65
MiniWorld: Democratizing the Training of Video World Models from Scratch Paper • 2608.01127 • Published 14 days ago • 19
LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation Paper • 2608.00079 • Published 18 days ago • 18
ShotPlan: Cinematic Video Generation with Learnable Planning Token Paper • 2607.17675 • Published 27 days ago • 6
DiFA: Inference-Time Forward-Process Alignment for Diffusion Models Paper • 2607.17972 • Published 27 days ago • 8
Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator Paper • 2607.05765 • Published Jul 7 • 3
CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation Paper • 2607.03803 • Published Jul 4 • 19
RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation Paper • 2607.06559 • Published Jul 7 • 95
Unified Audio Intelligence Without Regressing on Text Intelligence Paper • 2607.05196 • Published Jul 6 • 23
Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model Paper • 2607.03509 • Published Jul 3 • 14
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models Paper • 2606.03988 • Published Jun 3 • 126
Unified Panoramic Geometry Estimation via Multi-View Foundation Models Paper • 2605.26368 • Published May 25 • 4
ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer Paper • 2603.15478 • Published Mar 16 • 24
VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction Paper • 2601.05966 • Published Jan 9 • 23
CoDance: An Unbind-Rebind Paradigm for Robust Multi-Subject Animation Paper • 2601.11096 • Published Jan 16 • 8
Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation Paper • 2512.21734 • Published Dec 25, 2025 • 5
SpotEdit: Selective Region Editing in Diffusion Transformers Paper • 2512.22323 • Published Dec 26, 2025 • 39