9月23日,由中国经济信息社数字经济研究中心举办的新华未来机遇对话·闯关——从演示级智能到规模化应用具身智能高质量发展研讨会在京举行。北京面壁智能科技股份有限公司工程副总裁邹振盛认为,具身智能不是一家公司的游戏,而是一场生态协同。只有把通用模型底座做深,场景迁移才有工程意义。具身智能规模化落地的最后一公里,不是酷炫的Demo,而是可靠性以及让客户算得过来账。
数据配比策略
面壁智能成立于2022年,由清华大学自然语言处理实验室技术成果转化而来。邹振盛说,不同训练阶段需要不同的数据配比策略,这是模型持续进化的关键保障。他认为,人类第一视角数据是目前唯一供给能扩展到千万小时量级的具身数据,因此最有潜力成为支撑具身Scaling Law的预训练底料,但它缺少动作标签和本体感知,需要跨本体对齐。真机遥操作数据是当前后训练的主力,对接触密集任务的成功率增益最直接,但采集成本较高。
场景梯队
在邹振盛看来,具身智能的落地节奏取决于三个维度:任务可定义度,即成功标准是否明确;失败代价的可承受性;数据回流的难易程度。据此形成清晰的场景梯队,第一梯队是汽车、物流分拣等任务标准化程度高、数据回流顺畅的场景,第二梯队为特种场景,第三梯队为商业服务,第四梯队为家庭场景,因其非标特性突出,任务成功定义难以统一,数据回流也最为困难。谈及制约下游大规模商用的核心因素,他坦言,真正的卡点不止在模型能力,还在可靠性与系统工程,关键是能否让客户算得过来经济账。
未来两到三年
邹振盛判断,端侧大模型的产业格局将沿着感知、思考、行动能力闭环逐步展开。成熟度最高的是语言模型,多模态次之,具身VLA模型仍在演进中。在应用场景上,车载将率先规模化,在模型能力密度提升和端侧芯片算力增强的双轮驱动下,消费电子将紧随其后,机器人也将会是最大的商业化场景。他呼吁具身智能不是一家公司的游戏,而是一场生态协同,希望有更多产业伙伴加入,共建多模态协同的数据闭环和评测体系,同时建立公开可用的数据集标准与交易机制,打破数据孤岛。
