Stars
[NeurIPS 2026] Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
DeepSeek Harness: Everything is a Plugin.
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
Building General-Purpose Robots Based on Embodied Foundation Model
Cambrian-P: Pose-Grounded Video Understanding
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
JoyAI-Image is the unified multimodal foundation model for image understanding, text-to-image generation, and instruction-guided image editing.
[ICLR 2026] Efficient Reasoning with Balanced Thinking
GigaBrain-0: A World Model-Powered Vision-Language-Action Model
Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence
[RSS 2026] Causal video-action world model for generalist robot control
Qwen-Image-Layered: Layered Decomposition for Inherent Editablity
[NeurIPS 2025] Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance
Cambrian-S: Towards Spatial Supersensing in Video
Native Multimodal Models are World Learners
[NeurIPS'25] Official repository of Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations
The official implement of VITA, VITA15, LongVITA, VITA-Audio, VITA-VLA, and VITA-E.
This is a project on visual spatial reasoning tasks-SIBench
Fully Open Framework for Democratized Multimodal Training
Official Code for "Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search"
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework
Code and dataset link for "DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World"
The implementation of Extreme Viewpoint 4D Video Generation