英伟达 vs 波士顿动力:机器人学动作的“暴力美学”与“精巧设计”

Dabaoo2026-08-162142机器人技术及应用

一个砸下2.1万GPU小时,一个把单技能训练压到10小时。机器人获得身体技能,正在出现两种截然不同的工程路径。

8月12日,《Science Robotics》同一期刊出了两篇机器人全身运动控制论文。

一篇是RAI Institute与波士顿动力联合团队提出的零样本具身技能迁移运动模仿框架ZEST,登上本期封面;



 



 

论文链接:https://www.science.org/doi/10.1126/scirobotics.aec7695

另一篇来自英伟达GEAR团队,构建了一个机器人运动跟踪基础模型SONIC。



 



 

论文链接:https://www.science.org/doi/10.1126/scirobotics.aed4592

两边盯着的都是同一个问题:怎样让机器人掌握越来越多接近人类的全身动作?

但两边花钱、花算力的方式,几乎走向两个极端。

ZEST走的是一条更“轻”的路线。

它把动作捕捉、普通单目视频甚至关键帧动画都接进同一套训练流程。针对具体技能,一张NVIDIA L4 GPU训练约10小时,策略就可以从仿真直接部署到真机。波士顿动力人形Atlas因此学会了匍匐、侧手翻和霹雳舞,宇树G1能跳芭蕾、爬箱,波士顿动力四足机器人Spot甚至完成了连续后空翻。



 

英伟达则把大模型时代熟悉的Scaling路线搬进了人形机器人控制。

SONIC吃下约700小时动作捕捉数据、超过1亿帧、模型参数从120万一路扩到4200万,最终用128张GPU训练7天,总计算量约 2.1万GPU小时。目标不是再训练一个单独技能,而是把大量人类运动压进一个统一的全身控制策略。
 

在宇树G1真机上,SONIC测试了123组不同动作序列,成功率达到99.2%,并支持实时跟随人体动作。



 

一个是1张GPU、约10小时,拼训练效率和算法设计;一个是128张GPU、7天,拼数据、模型和算力规模。

换句话说,ZEST在压低“新增一个技能”的边际成本;SONIC则愿意先支付更高的一次性训练成本,换取更大的动作覆盖范围。

01.

同样教机器人学动作,两边算的是两笔账

今天的人形机器人已经不缺“会走”的演示。

更难的问题是,它能不能蹲下、跪地、翻滚、跳舞、钻过低矮空间;碰到箱子时能不能用膝盖、手臂甚至躯干参与支撑;换一个动作以后,又要不要重新设计一套控制逻辑。

传统的模型控制擅长处理定义清楚的运动,但复杂动作一多,工程量很快膨胀。

尤其是霹雳舞、匍匐、翻滚这类全身多接触动作,机器人什么时候用脚、什么时候手撑地、膝盖什么时候碰地,接触顺序、摩擦、冲击和动力学误差都会叠在一起。

ZEST的研究团队专门指出,传统全身MPC通常围绕预先定义的末端接触设计,对膝盖、前臂、躯干等任意身体部位参与接触的动作处理起来更困难。

强化学习绕开了一部分显式建模,却又带来新的麻烦。

每多一种行为,常常意味着新的奖励设计、训练流程和参数调整。英伟达团队同样把这一点视为人形控制难以Scaling的重要原因:走路的奖励函数,并不能自然教会机器人跳舞、爬行或者完成遥操作。

于是,两篇论文分别选择从成本的两端下手。

ZEST压缩的是“生产一个新技能”的流程。SONIC压缩的是“为每个技能单独训练一个控制器”的必要性。

02.

ZEST:把“教会一个新动作”压缩成一天

ZEST首先把动作数据的入口做得很宽。

专业动作捕捉可以用,手机拍摄的普通单目视频也可以用,甚至不完全符合真实物理规律的关键帧动画也可以作为参考。

这些数据最终走的是同一条管线:录制 → 三维重建 → 动作重定向 → 仿真训练 → 真机执行。



 

其中最有现实意义的是手机视频。

研究团队直接用手持手机拍摄人的动作,从视频中恢复3D姿态,再将人的运动映射到机器人身体。团队称,把一段拍好的视频转换成机器人参考动作只需要几分钟,因此实际流程可以做到:早上录一段动作,白天训练,晚上就在真机上运行。

为了把复杂动作训出来,ZEST用了两个关键设计。

一个是“挑难题”。系统把长动作切成多个片段,哪里失败得多,后续训练就更多采样哪里,而不是把算力平均撒出去。

另一个有点像学自行车时扶一把。训练高动态动作早期,系统会给机器人施加一个虚拟的辅助力,帮助它渡过最容易摔倒的阶段;动作越来越熟以后,这股辅助力会逐渐衰减到零。消融实验中,去掉这套辅助课程后,训练20小时的表现才大致追上完整ZEST训练10小时的水平。

结果是,一套相对精简的方法跑到了三种差别很大的机器人身体上。

Atlas完成了行走、慢跑、翻滚、匍匐、侧手翻和霹雳舞;G1完成芭蕾、跳箱和上下爬箱;Spot则从动画中学会倒立、桶滚和连续后空翻。

但这里需要注意,ZEST的“zero-shot”主要指的是策略在仿真里训练完成后,不再针对真机做额外微调,直接进行Sim-to-Real部署,并不意味着机器人看见一个从未训练过的新动作就能立即学会。论文的真机实验中,每项技能仍然对应一个专门训练的策略。

所以ZEST现阶段更准确的定位,是一条高效率的技能生产线。

机器人每多学一个动作,依然要训练,但训练它所需要的人工设计和工程步骤,被尽可能压缩了。

03.

SONIC:先砸2.1万GPU小时,练出一套“通用身体”

英伟达做了几乎相反的选择。

既然语言模型和视觉模型已经证明,数据、模型和算力不断扩大可以换来更好的泛化能力,那么人形机器人控制能不能也Scale?

SONIC就从这里开始。

团队把人形机器人的“运动跟踪”定义成基础任务:给机器人一段人类动作参考,让它尽可能在符合真实物理约束的情况下复现。

然后直接扩大三个变量。

动作数据从小规模一路扩到 700小时、超过1亿帧;网络规模从 120万参数扩到4200万参数;训练计算量从约2000 GPU小时、9000 GPU小时,一直拉到 2.1万GPU小时,最大版本使用128张GPU训练7天。

结果并不只是模型把训练集背得更熟。

在完全未出现在训练集里的动作类别上,最大模型的仿真跟踪成功率达到99.6%;部署到真实宇树G1后,团队测试了123段不同运动序列,成功率达到99.2%。



 

这里已经出现了和ZEST很不一样的目标。

ZEST的逻辑是,来一个技能,高效训练一个可靠策略。SONIC则希望,先训练一个足够宽的运动策略,后面来的不同动作都尽量落进它已经学会的运动空间里。

因此,SONIC真正重要的部分还在后面。

英伟达在这套通用运动策略上又搭了一个统一接口。

摄像头实时捕捉人的姿态,可以让G1跟着人运动;VR设备可以遥操作;文字、音乐和视频则先通过上游运动生成模型变成目标动作,再交给SONIC执行。



 

单一的通用控制策略由多种输入方式驱动。( A ) 视频远程操作:从单目RGB视频流中估计全身运动并实时跟踪。( B ) 文本控制:目标运动由自然语言提示生成。( C ) 音乐控制:目标运动由音乐生成,并根据旋律和节奏结构进行调整。( D ) VR全身远程操作:操作员控制机器人完成一系列动态全身动作。每个面板显示按时间顺序排列的帧序列。

这里需要区分:SONIC本身并不是直接理解文字的语言模型,它承担的是身体执行层。

再往上一层,英伟达把GR00T N1.5 VLA模型也接了进来。

VLA负责根据视觉和任务预测动作目标,SONIC的统一运动Token负责把这些目标转成全身运动。



 

VLA 驱动的移动操控任务。每行显示按时间顺序排列的帧序列(时间从左到右)。(A)通过三点式接口将苹果取放至盘子。(B)取胡萝卜。(C)取刷子。(D)踩踏板打开垃圾桶。(E)将汽水罐放入垃圾桶:拿起汽水罐,移动位置,踩下踏板,然后扔出去。(F)移动钻头和箱子:拿起钻头,放入箱子,然后搬运到货架上。

于是,G1不仅能走到桌边拿苹果,还能走到垃圾桶前,用一只脚踩踏板开盖,同时保持单腿平衡;更复杂的任务里,它要先拿起易拉罐,再移动到垃圾桶前、踩开盖子,最后把罐子扔进去。

在五类移动操作任务中,这套VLA+SONIC系统平均成功率为75%。



 

04.

机器人需要什么样的身体底座?

到这里,再看那组最抓眼球的数字:

EST,一个具体技能策略用单张NVIDIA L4训练约10小时;SONIC则动用128张GPU连续训练7天。

两者并不能直接比较效率。

因为ZEST仍然以具体技能为训练单位,解决的是怎么把一个新动作更快、更少工程地搬到真机上;SONIC则试图把大量运动一次性压进一个统一策略,解决的是怎么让同一个控制器本身覆盖更多动作。

一个希望“新动作来了,也能很快学会”;一个希望“新动作来了,最好本来就会”。



 

但放到整个机器人系统里,两者解决的其实仍然是同一层问题——身体怎么动。

在它们之上,还有VLA、Agent、任务规划和运动生成模型,负责回答机器人“现在要做什么”;再往下,则是关节、电机以及真实的机器人本体,负责把运动真正执行出来。

这也意味着,ZEST和SONIC只是机器人获得全身运动能力的两种工程选择,未必会走向真正的二选一。

对于动作相对明确、但种类不断增加的场景,能否低成本快速生成新技能很重要;而当上层VLA开始不断向机器人下发变化更大的运动目标时,一个覆盖足够广、可以反复调用的通用运动控制器也会越来越重要。

更长期看,两种思路甚至可能逐渐靠近。

ZEST已经在仿真中尝试把15种动作放进一个多技能策略;SONIC则在扩大通用动作覆盖的同时,把控制接口进一步接向实时人体姿态、VR和VLA。

路线不同,方向却越来越清楚:机器人不可能永远靠工程师一个动作一个动作地手工“雕”出来。

下一阶段真正要解决的,是怎样让身体技能像模型能力一样持续扩张,既能大规模预训练,又能在遇到长尾新技能时快速补上。最终实现把越来越多的人类动作,变成机器人稳定、可复用的身体能力。