郑南宁院士:具身智能不等于人形机器人,评价标准不在像不像人

林越2026-09-241134具身智能

中国工程院院士、西安交通大学人工智能与机器人研究所所长郑南宁发表文章,讨论具身智能在物理世界中成长。他指出,人工智能的重要发展方向之一,是让机器不仅能处理信息、推演复杂问题,也能在真实多变的环境中灵活完成各类任务。从工业生产线上的精细操作,到复杂地形中的自主行走,再到展演环境中的动态运动,机器人频繁出现在各种场景中。在这些能力背后,人工智能正在经历一场重要转变:从能够计算走向能够行动,并进一步发展为能够在物理世界中持续交互、学习与进化的智能形态。

具身智能不等于人形机器人


需要明确的是,具身智能不等于人形机器人,人形只是载体之一。其关键在于智能系统能否真正进入真实环境,形成感知、认知、决策、行动、反馈的闭环,并在这一闭环中不断调整自身行为,通过学习改善内部模型和策略。因此,评价具身智能的标准,不在于形态是否像人,而在于是否能真正解决现实世界中的问题。

 

像婴儿一样认识世界


理解具身智能,一个最直观的方式,是回到婴儿认识世界的过程。婴儿不会先学习概念或语言,而是通过不断触摸、抓取、跌倒和重新尝试来建立对世界的理解。婴儿的认知并不脱离身体,而是在身体与环境的互动中逐步形成:视觉提供空间结构,触觉提供物理反馈,运动经验不断修正对世界的预测。智能并不是只存在于脑中的计算过程,而是身体与环境相互作用的产物。因此,身体不只是执行指令的工具,更是认知系统的组成部分,参与感知、理解与行动的整个过程。一个具身智能系统通常由三部分构成:感知系统负责获取环境信息,决策系统负责形成理解与规划,执行系统负责作用于物理世界。

 

四种能力


具身智能要让机器真正进入世界并在世界中行动,需要多种能力。世界模型的形成,系统需要在内部构建一个可模拟环境,使其能够在行动之前预测与推演。多模态表征能力,现实世界的信息来源具有高度异质性,包括视觉、语言、触觉与声音等多种形式,具身智能需要将这些信息整合到统一的语义空间。因果推理能力,当前大模型主要基于统计相关性进行学习,对因果结构的把握仍然有限,模型作出的判断有时在语言上看似合理,但在物理世界中并不成立。生成与行动一体化能力,将视觉、语言与动作统一建模的端到端系统,使机器人能够根据自然语言指令生成动作策略,并通过控制系统和执行机构付诸行动。

 

两大基础条件和三方面挑战


具身智能的发展依赖两大基础条件:一是高质量多模态数据作为燃料,二是高逼真仿真环境作为练兵场。通过仿真训练再迁移到真实世界已成为重要技术路径,但如何缩小仿真与现实的差距,仍亟待解决。当前系统仍然存在局限性:黑箱问题,模型决策过程的可解释性不足;算力与部署矛盾,大模型难以在边缘设备实时运行;产业生态尚未成熟,标准体系与接口规范仍处于演进阶段。在工业制造领域,智能系统正在从执行工具转向意图驱动系统。在医疗与康复领域,智能系统正在成为医生的重要辅助工具。在城市治理与公共安全中,无人机与地面机器人协同执行基础设施巡检任务。在交通领域,自动驾驶系统是当前最接近规模化应用的具身智能形态之一。具身智能的本质,并不是让机器像人,而是让智能真正进入现实世界,在复杂、不确定环境中形成持续学习与适应能力。