具身公司的真正估值锚,到底是出货曲线还是进化曲线?

2026-08-232641具身智能

2026年上半年,全球人形机器人的出货曲线从年初万台量级跃升到年中数十万台量级,人形机器人产品已经不再稀奇。资本圈、媒体圈、产业圈同时陷入一种集体亢奋,仿佛具身智能的ChatGPT时刻已经到来。



 

但把镜头从展厅挪到工厂,就会看到另一个完全相反的画面。同一个时间段里,绝大多数被采购的机器人进入真实工厂后,正被困在它们的上一份工作里做不好第二个新任务。一台能流畅演示拧螺丝的双足机器人,进入电池pack产线后,可能连一颗5号螺丝都对不准位;一台能精准完成抓取Demo的机械臂,换到另一条产线后要重新花上几周时间学习一个全新动作。

出货曲线的陡峭,和部署曲线的平缓,构成了一对撕裂整个具身行业的剪刀差。剪刀差的一端是演示斜率,衡量的是机器人在受控环境里完成一次性任务的速度;另一端的进化斜率,衡量的是机器人在真实产线上跨任务、跨本体学会新工作的速度。两条斜率之间的差距,就是这一代具身公司真正的生死线。

这也是8月19日到20日的北京世界机器人大会上,深诣首次公开亮相时摆在桌面上的产业坐标。这家成立约半年、五六十人规模的公司,没有把发布会的主舞台留给一台能跑能跳的人形机器人,而是把全部圆桌时间留给了一个相对枯燥的判断:真正的考题,是机器人能以多快的速度学会新的工作。

围绕这个判断,深诣技术联创黄康尧在两场论坛里把公司积攒半年的技术路线摊开,并首次系统披露了他们的L4E加E4L自进化范式。L4E即Learning for Embodiment,用海量数据先把一个具有世界物理规律先验的基础模型训练出来;E4L即Embodiment for Learning,让机器人在真实工作中、通过与环境持续交互反向改造自身参数。一句话概括,就是从数据中学会行动,再从行动中持续学习,Learn to Act,Act to Learn。

01

VLA不是终局,是上一段路的尾声

过去十八个月,具身行业几乎被一个范式定义:Vision-Language-Action。从英伟达的GR00T,到Figure、智元、银河通用的量产方案,底层都跑着一套VLA,把视觉和语言信号编码之后由动作专家输出。这条路线直接借鉴了大语言模型的成功路径,先训练,再推理,再部署。



 

黄康尧在采访现场把这条路线叫做Learning for Embodiment范式。"L4E是一种有点类似大语言模型的技术范式",他解释,"通过收集海量数据,训练形成一个模型,再把它装在机器人上。场馆里很多采用VLA或World Action Model的技术,都属于Learning for Embodiment范式,先训练,训练完后让机器人执行,机器人是一个被动执行者。"

这套范式过去一年的成绩不可否认。它把具身从实验室里偶尔成功的演示,推到了产线上七十分的稳定动作。但黄康尧同时指出,这条路线存在一个被产业普遍回避的隐忧,那就是真实空间里的数据,永远采集不完。

大语言模型的训练语料是文本,有边界、可枚举。但机器人面对的是物理世界,是无穷多的视觉、触觉、力反馈、接触动力学组合。一台工厂里的拧紧机器人,今天面对一颗螺丝、明天面对另一颗、灯光明暗有变化、工人走动产生视觉遮挡,这些组合并不存在一个可枚举的上限。继续沿着VLA的纯数据堆叠路径走,只能换来越来越昂贵的边际收益,直到把整个具身行业推到死胡同。

这正是深诣提出E4L的产业含义。E4L不是替代L4E,更像是试图补上VLA范式里缺的那一环,让机器人在真实任务中遇到的成功、失败、纠正,全部反向回流到模型,让模型在工作中改造自身参数。部署不再是训练的终点,而是下一轮学习的起点

02

进化斜率的第一次可量化

深诣在WRC现场公开了一组具体的演示数据:机器人完成0.1毫米级工业柔性插接任务,在光线变化、视觉阻挡、人为干扰等多种场景干扰下依然高质量完成,双手插接任务的核心学习过程只花了半天。



 

这组数据放进产业坐标系里看,0.1毫米对应的是工业柔性插接里常见的公差等级。在3C制造、新能源电池pack、半导体后段封装等场景里,线束、连接器、传感器接插件的对位精度普遍落在0.05到0.2毫米区间。这部分工作过去十年由日本和德国的专用自动化设备主导,单台设备价格从30万到200万元不等,换型周期长,新产品上市必须重新调试。

深诣演示的意义在于,它把专用自动化的工作交付给一台通用机器人,并且让机器人用半天学会了。当一台通用机器人的学习曲线陡峭到半天能跨越0.1毫米精度门槛时,传统专用设备的价格曲线和交付曲线都会被重写。这也是具身产业过去一年估值不断抬升的真正逻辑,不是机器人的外形越来越像人,而是机器人能跨过的精度门槛越来越接近专用设备。

"我们选择工业,是因为工业场景有明确的安全边界,同时又能提供很diverse的数据。"黄康尧解释。

03

模型、数据、算法:自进化的三脚架

围绕L4E加E4L范式,深诣给出了三个相互咬合的技术支点。

模型支点是一套原生自进化架构,内部被称为类似Mixture of Experts的混合物理专家模型,把识别、避障、3D估计、运动预测这些不同维度的物理能力组织为独立专家,在推理阶段根据任务动态调用。深诣在架构层做了一件和主流VLA不同的事,把动作层的一部分网络设计成轻薄可端侧更新的模块,让机器人在真实部署后能持续在端侧修改参数。

数据支点是OMPO数据匹配技术。具身行业过去一年反复在讲所谓的数据金字塔,但大多数公司发布的模型实际只用了一两种数据。深诣在训练的不同阶段喂不同的数据,预训练阶段使用大规模互联网视频、自采Egocentric数据、UMI数据、遥操作真机数据的混合;进入真机部署后,再切到以单一来源真机数据为主的精调阶段。OMPO的核心算法会基于机器人的不确定性、失败记录和能力边界,主动选择哪些现场数据对当前模型最有用。

算法支点是Off-Policy异步强化学习。真实机器人采集数据的成本远高于爬虫抓取网页,这决定了具身行业无法像大模型那样靠堆卡力换性能。深诣采用off-policy异步强化学习,让机器人在现场采集的数据异步更新策略,而不是同步等待单条策略收敛。这种设计更接近互联网公司做推荐系统的工程思路。

04

清华人的第二次出发

机器人大讲堂获悉,深诣的创始人兼CEO刘凯是极智嘉Geek+的联合创始人。极智嘉是中国仓储物流机器人赛道的代表性公司,过去十年把货到人机器人从中国仓库推到全球40多个国家的物流中心,沉淀下来的是对真实工业场景的运营节奏、节拍要求、安全边界、ROI模型的深度理解。刘凯创办深诣时,正是把这条经验向具身大脑方向再延伸一次。

深诣的核心团队均来自清华大学计算机系,联合创始人黄康尧、罗宇构成技术双核,首席科学家顾问是2026年度IEEE Fellow刘华平教授。一个懂行业场景的CEO、两个清华系的强化学习博士联创、再加上一位IEEE Fellow级别的学界顾问,是这家公司把持续学习从论文概念推进到工厂产线的关键组合。

从货到人机器人到具身大脑,跨越的不只是技术栈,而是客户坐标系。极智嘉时代的客户是物流仓库运营方,核心KPI是每小时出库订单数和单位面积存储密度。深诣面对的客户则要再往上走一层,是工业制造现场的工艺工程师、柔性产线负责人,他们关心的不是机器人能不能动,而是机器人能不能在不打乱现有节拍的前提下接手一个过去由人完成的多步骤柔性任务。

05

为什么深诣没把全尺寸人形放上主舞台

深诣在WRC现场没有展出全尺寸人形机器人,只展出了轮臂形态的柔性插接单元。黄康尧在采访中解释了背后的逻辑:"人类的形态并不是天然为干重活或者工业场景中的工作而设计的,所以在一些场景中,机器人的形态不一定以全尺寸人形为主,也可能是轮臂机器人,或者单臂轮式机器人。"深诣把这套理念叫做形态即智能。

同一套基础模型,可以被部署在不同构型的本体上,这是深诣一脑多形的架构设计。从产业回报角度看,一脑多形的路线能在不同工业场景里以更低成本复用基础模型的能力,比全尺寸人形更容易跨越盈亏平衡点。

在被问到商业模式时,黄康尧的回答同样非常干脆:我们是一家做产品的公司,我们会有自己的机器人产品,模型会以服务或者持续更新的形式存在于产品之上。这条定位拒绝了一个在工业AI领域被反复验证的项目制诱惑。

Palantir模式是过去十年工业AI行业的标准路径之一,为客户做深度定制、按项目计费、靠解决方案而非产品赚钱。它的优势是高客单价、高毛利、客户黏性强;劣势也很清楚,每一个新客户都要重新跑一遍,投入产出比随着客户数线性增长,无法形成软件行业典型的边际成本递减。

深诣拒绝这条路径的根本原因,是它会摧毁L4E加E4L范式的基础设施复利。如果每一次客户落地都要做项目定制,模型在每个客户现场积累的数据就无法反哺基础模型,自进化范式就被降级为单客户定制的传统工业自动化。产品公司才能让每一台部署的机器人持续回灌通用大脑。

这条定位也直接决定了深诣的市场切入节奏。CEO刘凯此前明确表示,十年内在工业及物流领域部署超过10万台具身机器人。

06

工业级落地的两道护城河

然而,机器人大讲堂了解到,自进化范式要真正进入工业产线,必须解决两道工程门槛。第一道是端侧学习。深诣把一部分网络设计成端侧可更新的轻薄模块,并把off-policy异步强化学习的算法推到端侧运行。传统OTA模式把数据回传到云端、做模型更新、再下发到机器人。这种模式在数据回传带宽、隐私合规、模型下发延迟上都存在工业级瓶颈。深诣的设计让机器人在不联网的状态下也能持续学习。

第二道是工业级安全。深诣内部把这套安全系统叫做Embodied Harness System,类比软件领域的Harness层设计。它在每一步推理之前做安全治理与监控,判断模型输出是否落在安全动作空间内,并完成数据回流、灰度发布和持续进化的完整pipeline。

没有端侧学习,自进化只能是云端的营销故事;没有Harness System,自进化就无法通过工厂的安全审计。

现如今,据机器人大讲堂不完全统计,已经约有百余家具身智能企业切入工业市场,这难免出现市场竞争。虽然技术领先,但深诣难免后发,当被问到是否会感到压力时,黄康尧解释,"具身是一个长周期赛道,融资节奏、进入场景的节奏都不一样,每家公司都要找到自己的节奏。具身行业有后发先至的特性,因为技术一直在迭代,新技术可能更有竞争力。另一方面,要让产品最终留在客户手里,需要带给客户安心,展现稳定性。这就要求我们把PoC产品交给客户时,已经达到比较高的水准。"

这是一家成立半年的公司在拒绝被产业节奏绑架。过去十二个月,具身行业出现了多起先抢客户、再补模型的操作,先签下大额意向订单,把产品铺进客户仓库,再回头打磨模型质量。短期看这是商业拓展能力,长期看是把自进化范式降级为云端OTA的传统自动化路径。

深诣选择的另一条路,是先在内部把模型和原型机打磨到可交付状态,再去做规模化。这条路的代价是短期内订单数字不够亮眼,回报是每一台进入工厂的机器人都带有可进化的基模。

同样有趣的是,在被问到未来两年最关键的卡点时,黄康尧也把答案拆成两个部分。一部分是技术范式能否匹配产业落地的真实痛点,另一部分是能否积累到足以让基础模型持续生长的现场数据。未来几年,能不能马上产生效益、让客户购买产品,并不会单独决定公司能不能活下去。更关键的是产品方向、技术路线,以及最重要的数据积累,能不能支撑公司走得更远

07

重估具身公司的真正估值锚

深诣在WRC公开的技术路线,本质上是对具身行业过去十八个月的一次产业级反问。

过去一年,行业的注意力集中在三个外显指标上,出货量、单台价格、演示视频的流畅度。一台无法学会第二个新工作的机器人,演示再流畅也只是上一份工作的延续;一家无法让机器人在现场持续自我改造的公司,规模再大也只是把传统自动化重新包装了一遍。

具身公司真正的估值锚,不在出货曲线里,在进化曲线里。出货曲线衡量的是这一代产品被卖出去的数量;进化曲线衡量的是这一代产品在客户现场持续学习、改造自身、跨任务迁移的累计能力。前者决定今天的财报,后者决定明天的护城河。

深诣用0.1毫米和半天这组数据,向全行业递交了一份产业考卷。今天还在用出货量和演示视频度量具身公司价值的资本、产业、客户,都需要重新校准自己的评估坐标,从出货曲线切到进化曲线。

演示斜率与进化斜率之间的剪刀差,是这一代具身公司必须跨过的那道沟。跨过去的,会成为下一个十年工业生产力的基础设施;跨不过去的,会成为展厅里那些永远闪着银光却拧不动一颗螺丝的精致雕塑。