RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

📅 2026-07-20
📈 Citations: 0
Influential: 0
📄 PDF
🤖 AI Summary
This work addresses the generalization bottlenecks in embodied intelligence concerning perception, spatial reasoning, and action alignment by proposing a unified spatiotemporal–physical grounding framework. It introduces a series of embodied foundation models spanning 2B to 122B parameters, featuring native 3D semantic alignment, contact-point prediction, and a cross-embodiment action space with embodiment-specific masking strategies to enable joint multi-task and multi-robot training. Evaluated on VSI-Bench, MMSI, and RefSpatial-Bench, the models consistently outperform existing open- and closed-source approaches. Real-robot experiments demonstrate that the proposed initialization strategy significantly surpasses Qwen baselines and mainstream general-purpose vision-language-action (VLA) models, with multi-task joint training yielding substantial gains in both task success rates and procedural scores.
📝 Abstract
We present RynnBrain 1.1, a family of embodied foundation models spanning 2B, 9B, and 122B-A10B scales. Trained with a unified spatio-temporal and physically grounded framework, RynnBrain 1.1 supports embodied perception, spatial reasoning, localization, and planning. Compared with RynnBrain 1.0, it further introduces contact-point prediction across the model family and native 3D grounding for the 2B and 9B models, yielding representations and outputs that are more directly aligned with robot manipulation. We also develop RynnBrain-VLA with a unified cross-embodiment action space and embodiment-specific masking, and deploy it on Unitree G1, Astribot-S1, and Tianji-Wuji. RynnBrain 1.1 achieves strong results on embodied cognition, localization, and 3D grounding, with the 122B-A10B model outperforming all evaluated proprietary and open-source models on VSI-Bench, MMSI, and RefSpatial-Bench. Real-robot experiments show that RynnBrain-initialized policies outperform Qwen-based and representative generalist VLAs, while joint multi-task and multi-embodiment training improves process scores and success rates over per-task training.
Problem

Research questions and friction points this paper is trying to address.

embodied foundation model
generalization
3D grounding
contact-point prediction
cross-embodiment
Innovation

Methods, ideas, or system contributions that make the work stand out.

embodied foundation model
3D grounding
contact-point prediction
cross-embodiment action space
multi-task multi-embodiment training
Kehan Li
Kehan Li
Stanford University
Bohan Hou
Bohan Hou
PhD of Computer Science, Carnegie Mellon University
Machine LearningSystems
M
Minghao Zhu
DAMO Academy, Alibaba Group
Tianyi Zhang
Tianyi Zhang
Unknown affiliation
Zesen Cheng
Zesen Cheng
Peking University
MLLMVideo LLMVisual GroundingImage/Video Segmentation
Z
Zhikai Wang
DAMO Academy, Alibaba Group
Sicong Leng
Sicong Leng
Nanyang Technological University
Multi-modal Learning
Xin Li
Xin Li
Alibaba Group
natural language processing
X
Xiao Lin
DAMO Academy, Alibaba Group
B
Biying Yao
DAMO Academy, Alibaba Group
M
Minghua Zeng
DAMO Academy, Alibaba Group
J
Jiangpin Liu
DAMO Academy, Alibaba Group
R
Ronghao Dang
DAMO Academy, Alibaba Group
Jiayan Guo
Jiayan Guo
Alibaba DAMO Academy, Peking University
LLMMLLMEmbodied AIAgentsRecommender System
Siteng Huang
Siteng Huang
Alibaba DAMO Academy | ZJU | Westlake University
Vision-language ModelsGenerative ModelsEmbodied AI
Haoyu Zhao
Haoyu Zhao
Wuhan University; Alibaba
Robotics3D VisionEmbodied AIMedical Image Analysis
Heng Ping
Heng Ping
University of Southern California
Artificial IntelligenceGraph LearningElectronic Design Automation
Y
Yaxi Zhao
DAMO Academy, Alibaba Group
K
Kexiang Wang
DAMO Academy, Alibaba Group
T
Tong Lu
DAMO Academy, Alibaba Group
S
Shengke Xue
DAMO Academy, Alibaba Group
J
Jiahao Tang
DAMO Academy, Alibaba Group
Yulei Wang
Yulei Wang
Nanjing University
Solar PhysicsMagnetic ReconnectionPlasma SimulationHPC Applications
Z
Zejing Wang
DAMO Academy, Alibaba Group
J
Jianwei Gao
DAMO Academy, Alibaba Group