2026世界人工智能大会的具身智能论坛上,几乎所有演讲者都在重复三个词:数据、仿真、部署。没有人再为"能后空翻的机器人"鼓掌——行业正在从"证明能做事"走向"证明能一直做事"。

▍三堵墙:为什么具身智能的"ChatGPT时刻"还没来
智能时代合伙人姚茂庆将物理AI面临的挑战总结为"三堵墙":数据墙——高质量真实交互数据既昂贵又稀缺;表征墙——不同任务、场景、机器人之间缺乏统一的物理表征;闭环墙——现实世界中试错成本高,一次故障可能损坏整台机器。
大型语言模型只需爬取互联网文本就能进化,而物理AI需要的"交互经验"无法从任何公开数据集中获取。这解释了为什么将大模型接到机器人上不等于具身智能——大模型知道"应该做什么",但不知道"施加多大的力""失败后怎么办"。
▍数据竞争:从"有多少"到"怎么配"
金字塔式的数据结构正在形成:底层是海量互联网视频(成本低、覆盖广);中层是第一人称和可穿戴设备采集的人类动作数据(绕过实体机器人采集瓶颈);顶层是真实机器人远程操作和部署数据(量最小,但最接近真实执行)。
姚茂庆估计,若将机器人的"ChatGPT时刻"定义为开箱即用、在常见任务上达到70%-80%成功率,实体机器人数据需要约1亿小时。清华大学苏航提出:未来模型不仅学习"看到此场景时执行此动作",还要理解任务进度、预测动作后果,并将不同机械臂和场景的经验提炼成可迁移的能力。
▍VLA与世界模型:从路线之争到趋于一致
具身智能行业曾长期争论:机器人应直接用VLA模型输出端到端动作,还是先构建世界模型预测动作后果再决策?本届论坛上,两种路线正在融合。Intelligent Era提出的WRAM方向——VLA与世界动作模型集成,先制定粗粒度计划,再执行高频精细化动作。
任志义展示的π0.7模型,在ARX机械臂上学习叠衣服后,无需微调即可将技能迁移至UR5双臂机器人。跨平台可迁移性,正是具身智能能否摆脱"项目制"模式的关键。
▍真正的拐点:从"演示"转向"可用"
智元机器人透露,其机器人在南昌3C产线连续运行6天、每天超10小时,完成近65000次操作,成功率99.99%。Dyna Robotics的DYNA-1在餐巾折叠任务中24小时无人工干预完成850+次折叠,成功率99.4%。
这些数字背后是同一个趋势:行业衡量标准正从"能不能做一次"转向"能不能一直做、不出错、不中断"。
▍分层到来,而非一夜爆发
嘉宾对"具身智能ChatGPT时刻"的预测从2年到5年不等。它大概率不会像ChatGPT那样一夜之间爆红——机器人受限于生产能力、硬件成本、供应链、安全标准,无法通过一个网页在全球分发。
物理AI更可能分层出现:先在工厂、仓库等结构化场景落地;再扩展到超市、酒店、养老院;最终在家庭场景成熟。WAIC 2026告诉我们:当机器人开始持续工作,并把每天的成功、失败和意外转化为新的训练材料,具身智能的"ChatGPT时刻"已经发生——只是速度不同、地点不同。
