AlayaWorld: Long-Horizon and Playable Video World Generation Paper • 2607.06291 • Published 21 days ago • 90
Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning Paper • 2607.02963 • Published 25 days ago • 29
Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization Paper • 2606.11180 • Published Jun 9 • 36
SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning Paper • 2606.10804 • Published Jun 9 • 54
MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold Paper • 2606.13376 • Published Jun 11 • 16
World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible Paper • 2606.13652 • Published Jun 11 • 16
OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data Paper • 2606.13432 • Published Jun 11 • 113
PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory Paper • 2606.16449 • Published Jun 15 • 6
Memento: Reconstruct to Remember for Consistent Long Video Generation Paper • 2606.14667 • Published Jun 12 • 18
DreamX-World 1.0: A General-Purpose Interactive World Model Paper • 2606.16993 • Published Jun 15 • 114
Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories Paper • 2606.11176 • Published Jun 9 • 132
Holo-World: Unified Camera, Object and Weather Control for Video World Model Paper • 2606.20083 • Published Jun 18 • 11
Improving Text-to-Music Generation with Human Preference Rewards Paper • 2606.21670 • Published Jun 19 • 1
Vera: A Layered Diffusion Model for Content-Preserving Video Editing Paper • 2606.23610 • Published Jun 22 • 12
DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation Paper • 2606.26058 • Published Jun 24 • 67
Confidence-Aware Tool Orchestration for Robust Video Understanding Paper • 2606.26904 • Published Jun 25 • 11