AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing Paper • 2609.08936 • Published 6 days ago • 217
WorldReward: Reward Modeling for Camera-Conditioned World Models Paper • 2609.03952 • Published 11 days ago • 26
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence Paper • 2606.14777 • Published Jun 10 • 217
Light-WAM: Efficient World Action Models with State-Fusion Action Decoding Paper • 2606.08242 • Published Jun 6 • 12
Light-WAM: Efficient World Action Models with State-Fusion Action Decoding Paper • 2606.08242 • Published Jun 6 • 12
From Head to Tail: Efficient Black-box Model Inversion Attack via Long-tailed Learning Paper • 2503.16266 • Published Mar 20, 2025
Light-WAM: Efficient World Action Models with State-Fusion Action Decoding Paper • 2606.08242 • Published Jun 6 • 12
GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization Paper • 2511.15705 • Published Nov 19, 2025 • 98
UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation Paper • 2510.18701 • Published Oct 21, 2025 • 68
Unified Reward Model for Multimodal Understanding and Generation Paper • 2503.05236 • Published Mar 7, 2025 • 125
Seed-Music: A Unified Framework for High Quality and Controlled Music Generation Paper • 2409.09214 • Published Sep 13, 2024 • 54