近日,星海图(Galaxea)开源具身基础模型 G0.5 登顶 RoboDojo 最新 Simulation Leaderboard, 综合得分 20.23, 排名第一。
RoboDojo 是一个强调综合操作能力的机器人评测平台——42 个仿真任务加 18 个真实机器人任务, 评测维度覆盖精细操作(Precision)、长时序任务(Long-Horizon)和整体综合得分。G0.5 在 Precision 拿了 28.25, Long-Horizon 拿了 44.12, 两项都是榜单最高。
Long-Horizon 这一项值得单独说。它考的是机器人能不能在一段连续操作里持续理解环境、动态调整策略、最终完成完整目标——桌面整理、工具收纳、多物体操作这类场景。大多数模型在单步任务上表现尚可, 一拉到长时序就掉链子。G0.5 的 44.12 说明它不是靠单步精度硬撑分数, 而是在连续规划这一层站住了。
技术路线是差异所在。当前具身基础模型的主流方案是把视觉语言模型(VLM)当作独立编码器, 先理解场景, 再交给一个单独的动作模块生成控制信号——理解归理解, 动作归动作, 两段分开。G0.5 走的是统一自回归路线:视觉理解、具身推理和动作生成共享同一个 Transformer Decoder, 在一条自回归序列里同时完成任务理解和机器人控制, 推理直接参与动作决策。
这条路线的好处在于任务连贯性。长时序任务里, 每一步动作都需要基于前一步的结果重新判断——分离式架构在每一步都要跨模块传递信息, 统一自回归则在一个序列里自然完成。G0.5 在 Long-Horizon 拿到 44.12, 和这条架构选择直接相关。
另一个值得留意的是零样本泛化。面对从未见过的场景、空间布局和物体, 仅凭自然语言指令, G0.5 就能直接执行操作——这一点在 RoboDojo 的 42 个仿真任务里被验证过, 也在此前的 LIBERO、BEHAVIOR-1K Challenge、RoboTwin 2.0、SimplerEnv-Bridge 等多项公开评测中取得过领先成绩。
G0.5 已开源, 模型、代码和相关资源向全球开发者开放。
星海图RoboDojo具身智能



