虎嗅闭门会谈机器人大脑:把世界模型遮住,看它到底会不会干活

林越2026-09-241167机器人零部件

世界模型正在成为具身智能最热的几个词之一。做视频预测、仿真、机器人动作生成的都在谈世界模型。另一边,GPT-6直接接上机器人做真机测试,大家开始讨论:既然语言模型已经拥有很强的推理、记忆和规划能力,它能不能直接接管机器人的大脑。虎嗅AI100闭门会邀请章鱼动力世界模型合伙人陈文科、华映资本海外合伙人邱谆、域变换联合创始人吴昊、墨奇智能世界模型负责人吴桐,从模型研发、资本、自进化和学术前沿四个视角展开讨论。

先把世界模型四个字遮住


邱谆提出一个判断项目含金量的方法:把世界模型四个字遮住,然后具体看它到底在做什么。能不能看懂物理世界、预测一个动作的结果?能不能做决策,并在真机上跑通?第一次失败以后,下一次能不能做得更好?吴昊把这件事提炼成三个问题:能不能预测未来,预测结果能不能帮助决策,决策最后能不能在真机上闭环。如果只能生成一段漂亮的视频,却不能帮助机器人做下一步决定,那它距离真正的大脑还有很长距离。

 

GPT-6很强,但机器人大脑不能只靠语言长出来


陈文科用三个字母拆机器人大脑:L是语言,V是视觉,T是触觉。GPT-6最重要的意义之一,是再次说明当模型Scale到一定程度,确实可能自然涌现出新的能力。但这并不等于Language Scaling可以直接换成Action能力。他举例说,一个人伸手拿起水杯,不需要先在脑子里用语言描述一遍。很多物理动作本身不以语言作为最直接的中介。L更适合理解、规划和长程任务拆解,真正直接连接物理世界和机器人动作的是V和T。吴桐团队对GPT-6的真机测试提供了另一侧观察。GPT-6表现出更强的指令泛化、In Context Learning以及长程任务中的理解和交互,但局限同样明显。第一是实时性,云端大模型可以慢慢推理,机器人在现实中需要快速反应。第二是视觉反馈不可替代,当摄像头被部分遮挡,任务表现会明显下降。她认为,一个现实方向可能是大语言模型承担更高层、更低频的System 2,VLA或者World Action Model承担更快、更贴近动作执行的System 1。

 

从Demo到部署,大脑要自进化


吴桐给出的技术标准很直接:如果是World Action Model,就要看生成的策略能否在真实环境里稳定、安全、高成功率地运行;如果是世界仿真器,就看它有没有真正让后续的策略训练变得更好。吴昊提出,真实世界非常长尾和开放,大脑若想真的走向真实环境中的部署,需要在物理交互中持续进化。他打了个比方:如果一个模型今天只有40分,不一定要把它关在实验室里等到90分再部署。更理想的状态是让它进入环境,通过真实交互,从成功和失败中不断学习。陈文科补充说,Scaling能够成立的前提是数据和Infra先做对。

 

越接近真实世界,越没有一颗悬空的大脑


陈文科的答案很直接:纯做大脑肯定是不行的。同一种机器人,不同批次的硬件会有差异;执行器存在误差;视觉有噪声;接触瞬间需要高频反馈。这些问题不会因为上层模型更加聪明就自动消失。吴桐的判断是,一个通用大脑可以相对独立,但一个真正好用的机器人仍然需要软硬耦合。她举了自己团队的测试,拿到GPT接口之后,他们先在商业机械臂上尝试,随后把模型部署到自己的本体上,模型没有见过这款本体自己的训练数据,也能完成导航、握手、举起玩偶等动作。这说明一些能力完全可以跨越本体。但如果目标不是勉强能做,而是要让操作足够自然、流畅,真正进入商业场景,那么大脑和硬件之间肯定需要进一步适配。

 

具身智能的AI Coding还没出现


邱谆用OpenAI这类基础模型公司的价值逻辑去理解机器人大脑的长期可能性,但问题是现在还不知道谁会做到,甚至不知道最先在哪个场景做到。他在现场强调一个投资原则:高认知,低判断。具身智能最重要的商业问题之一也没有答案:具身智能的AI Coding场景到底是什么?大语言模型已经逐渐找到Coding这样一个高价值、高频、能够持续吸收模型能力的场景。但具身智能呢?工厂、物流、家庭、康养?邱谆的判断是现在就回答太早。吴昊强调真实环境里的闭环进化,陈文科强调模型能力本身。一个更接近Deployment first,另一个更接近Scaling first。真正的分水岭,也许既不是谁先把模型做得最大,也不是谁先把机器人送进最多场景,而是谁最早把这两条线真正接起来:一边让大脑持续变聪明,一边让真实世界持续给它反馈。