高德地图最新开源「世界-动作模型」,又一次“干掉”了谷歌和英伟达

2026-07-1310008具身智能

 

图片
 

专为移动操作打造的统一世界-动作模型

通用机器人的最终梦想,是让机器人在复杂世界里既会“走路”,又会“干活”,在移动中完成精细操作。

然而这个看似自然的诉求,却是当下具身智能最难啃的骨头。

近日,高德地图AMAP-CV实验室发布了ABot-M0.5,一个专为移动操作打造的统一世界-动作模型(World Action Model, WAM)。

在RoboCasa365、RoboTwin 2.0、LIBERO等顶级基准上,它长程任务与细粒度控制的 SOTA 纪录,大幅超越π0、GR00T-N1.5、Qwen-RobotManip等知名模型。

Image
 

RoboCasa365 移动操作基准测试结果

为什么移动操作这么难?ABot-M0.5又做对了什么?

 

01.

三大死穴,让机器人“顾此失彼”

 

近年来,视觉-语言-动作模型(VLA)在机械臂操作中表现出色,但它们本质上是“反应式”的,缺乏对物理世界演化的显式预测能力。为了赋予机器人“预见未来”的能力,研究界引入了世界动作模型(WAM)。

图片
 

ABot-M0.5 模型架构示意

当 WAM 直接应用于移动操作时,却遭遇了严重的水土不服,暴露出三大结构性瓶颈:

第一,粒度错位。 

简单来说,就是视频预测是粗粒度的(以视频块为单位),但机器人控制必须是细粒度的(逐帧或逐控制步)。抓取闭合、接触开始、精细对齐这些决定成败的动作,往往发生在毫秒级窗口内。粗粒度的世界建模,无法直接映射到微观的电机级精细控制。

第二,动作耦合。 底盘移动和机械臂操作遵循截然不同的物理规律——前者低频、全局导向,后者高频、局部且对接触力极度敏感。把它们塞进一个纠缠空间里优化,梯度相互干扰,结果两头都学不好。

第三,训练-推理鸿沟。 训练时,模型拿“完美”的真实未来视频当参考答案;推理时,却只能依赖自己预测的、自带噪声的未来画面。这个差距在长程任务中不断放大,最终导致执行崩溃。

在明确了这三大瓶颈之后,ABot-M0.5的思路不是“打补丁”,而是从架构层面做系统性重构。

 

02. 

三大解法:粒度对齐、动作分轨、梦中预演

 

解法一:中间潜在动作(Intermediate Latent Actions):搭建时空桥梁

ABot-M0.5在粗粒度的视频潜在状态和细粒度的机器人动作之间,插入了一个帧级潜在动作作为中间层。

这个中间层就像一个“翻译官”:从连续帧之间的视觉状态转换中提取出与具体机器人形态无关的运动意图,再“翻译”成特定机器人的底层控制指令。

图片
 

中间潜在动作架构示意

解法二:双层混合 Transformer(Dual-level MoT):动作空间的“分轨”解耦

ABot-M0.5设计了双层混合Transformer(Dual-level MoT) 架构。

第一层在模态层面解耦:视频潜在、潜在动作、可执行动作三个流各有独立的输入投影、时间步嵌入和输出头,防止表征互相“污染”。

第二层在动作层面解耦:可执行动作被强制拆分为“移动”和“操作”两个子空间,分别送入不同的子塔处理。

图片
 

双层混合 Transformer(D-MoT)结构

这就像给底盘和机械臂各修了一条专用车道——高频操作信号不再干扰低频移动信号。实验表明,动作解耦后不仅性能更优,收敛速度也更快。

解法三:梦境强制(Dream Forcing):打破温室,直面真实

这是ABot-M0.5最具启发性的创新。

传统训练方式(Teacher Forcing)让模型拿真实未来视频当条件来学动作,推理时却只能用自己的预测。ABot-M0.5的训练第二阶段,直接把“参考答案”换成了模型自己“做梦”预测出的视频。

图片
 

图5:Dream Forcing 训练机制示意

图片
 

Dream Forcing 训练机制示意(续)

换句话说,逆动力学模型在训练阶段就接触到了推理时会遇到的不完美视觉状态,学会了在“不完美”下依然做出正确决策。长程任务中最头疼的误差累积问题,就这么被根治了。

 

03. 

三阶段训练:从“看懂世界”到“掌控物理”

 

这套强悍的能力,来自精心设计的三阶段渐进式训练:

世界模型预训练:基于Wan2.2骨干网络,在OXE、Agibot-Beta、RoboCOIN、Galaxea等大规模数据集上学习物理世界的时空演化规律。值得一提的是,他们定义了4个规范视频槽位(2个第三人称+2个腕部视角),巧妙解决了不同数据集摄像头配置不一致的问题。

潜在动作预训练:基于ALAM框架提取帧级运动表征,让潜在动作形成结构化的运动空间。

渐进式监督微调:先基于真实视频帧联合微调,让世界模型和动作模型在下游数据上对齐;再切换至Dream Forcing模式,让动作预测器在自己预测的未来画面上训练。

图片
 

注意力掩码可视化

在可视化方面,论文展示的注意力热力图(Attention Maps)直观印证了这一进化过程:从预训练初期的“四处张望”,到微调后精准锁定任务核心区域,模型的“视觉焦点”变得极其敏锐。同时,在 RoboCasa365 上的生成轨迹可视化更是惊艳,模型“梦境”中推演的移动与操作画面(通过黄绿双色清晰区分底盘移动与机械臂操作)与真实物理规律高度契合,真正做到了“所思即所见”。

 

04. 

战绩:仿真到真机,全面碾压

 

这套组合拳打下来,效果相当炸裂:

在移动操作(RoboCasa365)方面, ABot-M0.5拿下40.4%的平均成功率,大幅领先GR00T-N1.5(23.9%)和Qwen-RobotManip(35.9%)。加上压缩记忆机制后更是冲到46.6%。在更难的Target 100%设置下,54.2%对GR00T-N1.5的43.7%,优势依然显著。

在精细操作(RoboTwin 2.0 / LIBERO)方面, 94.1%登顶RoboTwin 2.0,超越Qwen-RobotManip(93.85%)和G0.5(93.3%)。LIBERO上99.4%刷新SOTA。零样本泛化测试LIBERO-Plus中,83.4%超越ImageWAM(83.1%)和Cosmos-Policy(82.2%)。

图片
 

RoboTwin 2.0 精细操作基准测试结果

真机部署: 在Agilex Piper机械臂上,仅用50条真实演示数据,ABot-M0.5在“插销圆柱体”精细任务中达到70%成功率(π0.5仅50%)。在“整理水果”等多步长程任务中更是达到80%。

值得注意的是,注意力热力图显示:从预训练初期的“四处张望”,到微调后精准锁定任务核心区域,模型的“视觉焦点”变得极其敏锐。

图片
 

预训练注意力热力图效果对比

 

04.

结语

 

ABot-M0.5证明了一个重要事实:通用具身智能的突破,不仅靠数据规模的堆叠,更靠对“预测—抽象—控制”底层逻辑的系统性重构。

通过中间潜在动作弥合粒度鸿沟、双层MoT解耦异构动作、Dream Forcing对齐训练与推理——这套组合拳让机器人学会了在“梦境”中推演未来,在现实中精准执行。

这或许正是通往“全能管家”时代的关键一步。


 

论文全称:ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

论文链接:https://arxiv.org/html/2607.00678v1

 Github链接:https://github.com/amap-cvlab/ABot-Manipulation/tree/main