2026年6月29日下午,理查德·萨顿(Richard Sutton)在北京石景山出席“机器人幼儿园”揭牌仪式。这是他获得2024年图灵奖后首次公开参与产业合作项目。
![]()
萨顿是时序差分学习(TD Learning)与策略梯度方法的提出者,这套理论搭建起一套完整逻辑框架,让机器无需依赖人工标注示范数据,仅依靠与真实环境持续交互,就能自主沉淀智能经验。
![]()
活动现场,萨顿复盘了双方合作的缘由。他提到,一年前初次到访他山科技时,便发现行业内绝大多数机器人实验室都回避真机反复试错的研发路线,唯独他山这家企业坚持以试错作为智能训练的核心方式。时隔一个月,他山科技主动对接萨顿,正式提出共建相关训练体系的合作设想。
01.
萨顿坚持的理论路径是什么?
萨顿在演讲中援引1950年图灵的论断:“与其开发一个类似人类一样思考的程序来模拟成年人的思维,不如尝试开发一个模拟儿童思维的程序,让他不断地成长,学会思考。”他指出,这条路径过去几十年未被真正实践,主要原因是硬件太脆弱,机器人无法获得足够的真实经验。
![]()
当前主流研发依赖“从人类示范数据中训练”的监督学习模式。萨顿认为这种方式“不够强大”,真正的答案是:“机器人必须通过交互学习,通过试错在整个部署的生命周期中实现持续学习。”他强调:“我们长期处于非主流地位,因为主流做法是用人类示范数据训练机器人,而真正的目标应是让机器人在没有人类事例的情况下在线学习。"
监督学习的核心问题在于数据的静态性。人类示范的“拿杯子”动作,不包含“为什么此时拿”“若杯子是烫的怎么办”“如果用户正打电话是否应等待”等因果链。机器人学会的是动作映射,而非情境推理。模型训练完成后即定型,当环境变化时缺乏动态调整能力。
萨顿的强化学习框架要求系统通过试错形成对世界运行规律的认知:“没有体验,谁能说什么是正确的做法?但如果你有经验,你会对将来发生的事有一些信念。”经验不是数据堆砌,而是通过反馈校正预期偏差的过程。这需要机器人在真实环境中持续交互。
02.
他山科技满足了哪些落地条件?
萨顿提到今天世界最先进的机器人技术是来自中国的。而强化学习要在真机上大规模试错,首先需要足够的硬件数量和部署场景,这个规模目前在中国。
![]()
其次是触觉技术。强化学习需要系统在行动中获得即时反馈——视觉和听觉是被动感知,触觉才是机器人与物理世界发生真实接触的唯一通道。碰撞前的预警、抓握时的力度反馈,这些高频信号是奖励函数得以运作的现实基础。他山科技从2017年成立起就专注触觉传感器,目前已有数十万个触觉指尖部署于全球各类人形机器人。
两个条件之外,还有一个决定性的因素:价值观是否一致。萨顿解释完理念,对方一个月后主动回来,说“我们想做这件事”。“我觉得他们的确是一个能跟我们产生共鸣、理解这个想法的合作伙伴。”在技术与规模之外,他山科技真正打动萨顿的,是主动接受试错作为必要成本的那份确定性。
03.
他山科技的技术如何支撑机器人自主学习?
他山科技CEO孙滕谌表示,他山的触觉感知与类脑芯片技术,解决了强化学习落地的核心痛点。
![]()
传统强化学习最大的短板,是缺乏连续、高频、真实的动态交互感知数据。他山科技的动态触觉传感器能够毫秒级捕捉机器人与物理世界接触时的各种细微变化。力度、滑动、贴合程度、形变等等。这意味着机器人幼儿园里的每一次触碰、每一次操作试错,都能转化为有效的学习信号,让强化学习算法真正落地到物理场景中。
传统视觉感知在近距离会出现盲区,机器人靠得太近反而看不清楚,这导致很多精细操作场景中容易出现决策偏差和动作失误。他山科技的接近觉技术可以在接触之前就提前预判,填补这段近距离感知的空白区域,让机器人的每一次决策都基于更完整、更精准的环境信息。
在学习方式上,他山科技将自研的神经网络芯片和类脑强化学习算法深度结合,摒弃了传统机器人"编程式执行"的僵化模式。机器人可以像幼儿一样,不需要人工逐条编程,而是通过在真实环境中反复试错、自主纠错、持续迭代,逐步学会抓取、装配、柔性操作这些精细技能。
04.
机器人幼儿园需要哪些工程条件?
他山科技CEO马扬在会上明确了机器人幼儿园的四个核心条件:允许犯错的机会、安全的探索环境、持续的真实交互、及时而明确的反馈。
![]()
允许犯错是前提。 幼儿园这个阶段是自己启蒙,是产生一个念头并且自己尝试的过程。需要一个幼儿园允许它犯错,让它有足够犯错的机会。
安全探索是保障。 允许失败,但要避免不可逆的硬件损毁,这是萨顿理论落地的实操难题。他山科技认为无论是机机交互还是人机交互,所有智能交互的终极基础,是真实、安全、完整的物理感知能力,具体可以总结为三个核心关键词:完备性、安全性、低成本可持续性,而这三点全部依托触觉与接近觉核心技术实现。
交互的本质是实时状态的双向反馈。传统交互依赖视觉感知,只能捕捉宏观环境信息,无法覆盖近距离、接触式的物理交互细节,导致机器人"看得见但摸不准、判不全",这也是很多人机、机机交互生硬、失误的根本原因。他山科技的动态触觉+接近觉融合感知体系,构建了"预判-接近-接触-动态交互"全流程感知闭环:接近觉提前感知距离、预判交互趋势,动态触觉捕捉接触后的细微物理变化,补齐视觉盲区,让机器人拥有和人类一样的"预判+触感"双重感知,保障每一次交互的状态信息完整、无缺失。
机器人幼儿园的核心逻辑是"试错学习",但传统强化学习试错成本极高,容易出现碰撞、损伤、设备损耗、人机安全风险,这也是行业落地的核心瓶颈。他山科技的接近觉技术可以在交互接触前提前预警、动态规避风险,从源头提高强化学习试错的安全性,让交互可以持续进行。
持续交互是核心。 "机器人需要的不是孤立的数据,而是在交互中持续产生并不断更新的经验。"这与萨顿"在线学习"的要求直接吻合,机器人不是训练完就部署,而是在部署过程中持续学习。
及时反馈是关键。真正的智能交互不是被动响应,而是主动适配、自主调整。依托他山科技的神经网络芯片和类脑强化学习算法,机器人可以将实时感知的触觉、接近觉数据,通过高并行算力快速处理、迭代决策,适配不同的交互场景、不同的交互力度、不同的交互对象,实现从"被动执行交互"到"主动自适应交互"的升级。
05.
为什么现在才有落地可能?
萨顿指出,长期以来,机器人受限于“人类知识主导”的范式——依赖人工标注数据与仿真预训练,难以真正通过自主交互获取经验。其根本障碍不仅在于算法,更在于:过去数十年,硬件成本高、交互成本高、试错代价大,导致机器人无法在真实世界中持续、低成本地“试错—反馈—学习”,从而难以发展出对物理世界与任务动态的深层理解。
正因如此,当硬件成本显著下降、触觉等模态提供高保真低延迟反馈、仿真与现实的物理一致性提升时,让机器人“像幼儿一样在实践中成长”的路径才真正具备工程可行性。
马扬在演讲中提到一个案例:客户让机器人完成关门动作。在多次尝试后,一个机器人叫来另一个机器人帮它压住门,然后自己用灵巧手关上门。“也就是说我们让它在自主的探索当中,它自己找到了与另外一个机器人交互的方式。”这个案例说明,当硬件稳定性足够高、试错成本足够低,机器人可以在无人指导的情况下探索出新策略。
06.
结语与未来:
机器人幼儿园项目正式落地,标志着强化学习理论与触觉硬件系统完成实质性融合。项目核心目标清晰:让机器人依托真实物理交互自主积累实操经验,降低对人工示范数据的依赖。
萨顿表示:“我们真正追求的,是一台能依靠经验自主学习的机器。” 他同时补充:“没有任何事物,能比一个已然落地成型的想法更具力量。”
孙滕谌对机器人幼儿园寄予厚望:3-5年后,这里能走出首批不需要大量数据标注、具备在线强化学习能力、可以商业化落地的机器人,同时开创出一套可落地的类脑强化学习机器人训练产业新范式。
