不依赖外部定位,不依赖动捕,也没有人类遥控一一只靠头顶一台深度相机,它就在球场上自己找球、追球、多方向起脚射门。8月19日,清华大学自动化系赵明国教授团队在机器人领域顶刊《Science Robotics》发表研究论文,题为 “Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots”(学习视觉驱动的人形机器人反应式足球技能)。论文提出一套面向真实世界视觉不确定性的统一感知-运动强化学习框架,支撑这项研究的硬件平台,正是加速进化(Booster)的人形机器人。
近期,中国机器人又登上了国际顶刊。这次,是一台会自己踢球的人形机器人。
![]()
值得一提的是,《Science Robotics》隶属美国科学促进会(AAAS)旗下Science系列,是该系列唯一聚焦机器人学的子刊,最新影响因子高达26.1,长期稳居全球机器人学期刊第一梯队。其学术标准严苛、录用率极低,能在其上发表论文,意味着研究成果获得了国际顶级同行评审的高度认可,常被视为该领域的重要里程碑。今年8月《Science Robotics》推出人形机器人专题特刊,汇聚全球前沿成果:波士顿动力、宇树、加速进化等企业同台亮相。
![]()
01.
足球:具身智能的“压力测试”
足球对机器人来说,是一个相当苛刻的测试。
球高速移动、接触动力学复杂、地形和光照随时变化,机器人要在动态环境里同时搞定敏捷运动控制和不太可靠的视觉感知。传统机器人足球系统大多采用“感知—规划—控制”的模块化流水线:先让视觉模块“看”,再把结果传给规划模块“想”,最后由控制模块“动”。
这种架构工程上好理解、好调试,但问题也很明显:感知噪声、延迟和漏检,会沿着流水线一级一级放大。尤其在机器人靠近球、需要快速调整脚的位置时,任何一帧定位误差都可能让它踢空或踢偏。更关键的是,真实世界里的视觉条件远没有理想中那么好,强光、运动模糊、遮挡、检测失败,才是常态。
最近几年,深度强化学习开始被用在人形机器人足球上,但不少工作还是依赖动捕系统提供的特权状态,或者要为特定场景做昂贵的三维重建和训练。赵明国团队把问题重新定义成“感知约束下的控制问题”,不追求先“看得准”再“动得对”,而是让策略在感知不完美的条件下,也能做出正确的动作。
02.
不追求“看得准”,而是让策略“适应看不清”
简单说,论文的核心贡献是一个统一的感知-运动强化学习框架,即将视觉感知与运动控制置于同一个优化目标下进行端到端训练,砍掉了传统架构中间所有的“翻译”环节。
机器人到底“看”什么?
策略并不直接处理高维的原始图像,而是接收一些和足球任务高度相关的结构化线索。比如球相对于机器人的位置、球门中心在哪、球门朝向哪里,以及机器人自己的身体状态(关节角度、姿态等)。新框架通过强化学习,让感知模块不再追求"识别得准不准",而是追求"能不能让机器人更快更稳地完成任务"。感知和运动共享同一个奖励信号,联合优化——机器人看到的同时就在准备动。
![]()
两个关键设计,让策略在“看不清”时也能踢
为了让策略在真实世界里足够稳,团队引入了两个关键设计。
一是“虚拟感知系统”。研究团队没有假设仿真里的视觉是完美的,而是故意把真实世界的干扰,例如噪声、延迟等等都建模进训练。他们采集了真实机器人在多种条件下的视觉数据,统计出检测概率、噪声分布、更新频率和延迟。比如,视场内球体检测概率约90%,意味着有10%的情况可能看不到球;延迟约116毫秒,对踢球这种快速动作来说,已经不小了;更新频率约25赫兹,也就是每秒更新25次,远低于仿真里的理想频率。这些真实感知特性被注入仿真训练,让策略在训练阶段就必须面对不完美的视觉反馈。
二是“编码器—解码器架构”。策略不是只看当前一帧,而是输入过去50帧的历史观测,差不多1秒的时间窗口,然后编码成一个64维的隐状态表征。解码器再从这个隐状态中重建球体的真实位置等关键信息。这有点像人踢球时会根据前几眼的信息预判球路,而不是只盯着当前瞬间。它迫使策略内部形成一种轻量级的状态估计,能够对含噪感知进行降噪和补偿。
消融实验显示,这套机制收益很明显。踢球前最后1秒,策略对球位置的估计误差从0.344米降到0.186米,而机器人踢球脚的弧长只有0.23米。也就是说,策略能自己把位置估计误差降到比脚弧长还小的范围,这样脚才能准确踢到球,而不是扫空气。
![]()
让动作更像人,而不是机器硬算
运动风格上,为了让机器人动作自然,团队采用了对抗运动先验(AMP)方法。
简单来说,AMP是强化学习中用来让机器人运动更自然的关键技术,但此前几乎只在仿真环境里有效,遇到真实世界的光照变化、遮挡、运动模糊就失灵。赵明国团队首次将AMP成功拓展至真实世界的动态视觉场景,实现了从仿真到真机的零样本部署,证明了基于仿真的运动先验可以泛化到真实世界的视觉干扰中。这是一个理论层面的重要突破。
另外,针对进球奖励稀疏、方差大的问题,研究者用了多批评家框架。进球是最终目标,但进球前有很多子目标,如果只靠一个评估器,容易因为奖励太稀疏而学不好。多批评家相当于让不同的评估器分别关注不同的方面,比如接近球、调整姿态、射门等,这样训练更稳定。
03.
误差降46%,准备时间缩短64%
实验数据证明了这套控制器的有效性和鲁棒性。
踢球成功率方面,仿真做了8192次测试,靠近球门区域成功率约90%。真实机器人上,前场位置连续10次测试成功率约80%—90%,更具挑战的后场区域也有60%—70%。所有真实试验中机器人都保持稳定,没有记录到跌倒事件。
和基于规则的基准控制器相比,该策略把球位估计误差降低了46%,踢球准备时间最高缩短64%。当球在机器人正前方时,规则策略约需2秒完成准备;球在后方时,规则策略约需5秒。而学习策略在所有朝向上都稳定在1.5秒左右,变化很小。原因是学习策略把接近球体、步态调整和踢球动作融合到了接近步态的最后一步,省去了独立准备阶段。转向敏捷性也更高,最大转向角速度达到3—4 rad/s,而规则策略只有约2 rad/s。换句话说,机器人转得更快,能更灵活地追踪球。
感知与动作的耦合还体现在主动感知行为上。
策略会调整头部和躯干方向,让球大部分时间保持在相机视场中央。当球滚向视场边缘时,策略能预测球即将消失的方向,并驱动机器人旋转重新捕获目标。在模拟视觉遮挡实验中,如果球检测被屏蔽0.3秒,机器人仍能在超过90%的试验中完成踢球,进球成功率保持在50%以上;遮挡时间更长,机器人则转为旋转搜索行为。
更令人瞩目的是实战验证。清华大学Hephaestus(火神)队将该控制器作为独立模块,应用于RoboCup 2025成人尺寸人形机器人联赛及2025年世界人形机器人锦标赛,最终以76粒进球、仅失11球的战绩夺得双料冠军。比赛中,机器人需完全自主运行,仅依赖车载计算与传感系统,严禁使用激光雷达或多摄像头系统。在如此严苛的约束下,该方法依然展现出卓越的有效性。
![]()
今年7月,清华火神队在2026年RoboCup韩国仁川赛事中成功卫冕冠军——这标志着该技术方案在连续两届世界顶级赛事中经受了最严格的实战检验。
04.
加速进化:从学术突破到产业落地
支撑这项研究的,正是加速进化(Booster)提供的人形机器人硬件平台,以及贯穿研究始终的仿真到真机部署工具链。
加速进化于2023年创办,是国家高新技术企业、北京市专精特新企业。公司以“让人形机器人像计算机一样简单可靠实用”为愿景,构建了从硬件到软件再到具身开发生态的全链条竞争力。
在最近的2026世界机器人大会(WRC)上,其人形机器人最新型号 Booster T2亮相。T2专业版搭载NVIDIA Thor旗舰芯片,端侧算力达到2070 TFLOPS,是上一代的10倍,系统延迟从10毫秒压缩到4毫秒,为复杂的实时控制与感知任务提供了坚实硬件底座。
但硬件只是第一步。同时发布的Booster Studio,是专为具身智能打造的集成开发环境,内置完整仿真工具链,支持从虚拟仿真到真实机器人一键部署,这意味着开发者可以跳过繁琐的底层适配,直接聚焦于算法与应用的创新。
正如加速进化CEO程昊所言:“过去二十年,行业都在解决怎么把机器人的身体做好;今天,身体已经不再是唯一的问题。未来一台机器人的价值,取决于有多少人能够基于它创造新的能力。”从学术突破到产业落地,加速进化正试图用这套“硬件+开发环境”的组合,为人形机器人打开更广阔的想象力。
05.
结语
从RoboCup 2025双料冠军到2026年仁川卫冕,足球场用连续两届世界冠军的实绩,验证了这套“感知—动作耦合”方案的有效性与泛化性。但比奖杯更值得关注的是,支撑这项研究的硬件平台,加速进化Booster系列正在将冠军级算法能力标准化、产品化。
随着Booster T2与Booster Studio在2026世界机器人大会亮相,开发者和研究者从此拥有了从仿真到真机一键部署的完整工具链,能够在这套平台上快速复现、改造甚至超越这项顶刊成果。
承载着 RoboCup 赛事‘2050年机器人踢赢人类世界杯冠军’的终极愿景,赵明国教授带领团队在具身智能领域持续探索。从实验室到RoboCup冠军领奖台,足球场始终是具身智能最严苛的试验场。但当顶尖学术突破被封装为可复用的开发平台,这场竞赛的终点,正向更广阔的产业场景延伸。
