从“像素级模仿”到“因果级推演”,莫刻机器人的破局方法论

2026-07-302531机器人技术及应用

具身世界模型赛道正在发生显著变化,从“生成未来”走向“理解因果”。

通用视频生成模型正在不断突破逼真度的上限,从物体运动到光影反射,都能渲染得惟妙惟肖。初看上去,这与具身智能所需的世界模型似乎只有一步之遥。

然而,恰恰是这一步之遥,成了难以跨越的鸿沟。视觉上流畅自然的视频,一进入动作逻辑验证,就频繁出现穿模、受力缺失和因果矛盾,最终在物理世界中完全失效。

这是当前全球具身世界模型赛道的集体困境:我们到底需要什么样的世界模型?

近日,由清华大学牵头,联合普林斯顿大学、新加坡国立大学、北京大学等多所学术机构联合打造的具身世界模型权威基准WorldArena更新榜单。莫刻机器人以自研的LJM(Latent Joint-conditional Model,隐空间联合条件建模)模型,取得73.06分的综合成绩,位列全球第二,仅与榜首相差0.58分。更具行业标志性意义的是,这套顶尖具身基座的全流程训练,仅使用32张阿里云真武810E。

从“靠通用视觉先验打补丁”到“在隐空间构建因果体系”,莫刻机器人正在给出一条AI原生的具身世界模型技术路线,也开辟了国产化自主研发的新路径。

01.

视觉流畅≠物理可信:通用视频路线的短板

当前具身模型的卡点在于视频看起来流畅自然,物理逻辑却经常出错。模型能画出逼真的机械臂运动,却不懂“动作-接触-物体状态变化”之间的因果关系,自然无法支撑严肃的策略预演。

真实物理世界中机器人交互关心的是物理因果逻辑:夹爪闭合后物体是否被提起?推力施加后物体会滑动多远?遮挡消失后物体是否还在原位?这些占比极小、持续时间极短的接触与状态变化,在海量视频数据中很容易被背景、纹理、光照等占比更大的信息稀释。

更核心的矛盾在于,现有方案始终把动作当成“外部附加条件”,而非“交互的核心变量”。只把动作数值塞进模型,却不让模型理解其交互语义,本质还是“照着参数画画”,而非“推演物理变化”。

长时序生成的记忆漂移问题则进一步放大了缺陷。多数模型以固定窗口保留最近几帧作为上下文,但机器人操作是典型的部分可观测场景:抓取瞬间的状态、物体被遮挡前的位置、中间放置的结果,这些关键信息往往不在“最近几帧”里。模型只记得眼前看到的画面,却忘了之前发生过什么,生成序列越长,前后逻辑矛盾就越严重。

02.

LJM技术拆解:先推演因果、再生成世界

莫刻机器人的LJM,恰恰从底层架构上跳出了“通用视频+动作补丁”的路径依赖。它的核心洞察非常明确:世界模型要先理解交互的因果,再生成视觉画面。而理解因果的载体,就是统一的交互隐空间。

简单来说,LJM不是“给视频模型喂动作参数”,而是先把语言指令、视觉上下文、动作序列全部映射到同一个连续隐空间里,在这个空间里完成物理交互的推演,再用推演结果约束视频生成。这套逻辑落地为一套精巧的“双专家+强监督+长记忆”技术体系。



 

双专家协同:推演与渲染逐层交互

LJM架构由两大核心模块组成:Latent Reasoning Expert(隐空间推理专家)与World Modeling Expert(世界建模专家)。

推理专家负责“想清楚”:它基于多模态输入,在连续隐空间中预测机器人本体状态变化、物体运动趋势、场景状态演化。它不输出像素,只输出抽象的交互逻辑表征,相当于模型的“物理推演大脑”。

建模专家负责“画出来”:它以视频扩散Transformer为骨干,在推理专家给出的隐空间约束下,生成高保真的未来视觉视频,相当于模型的“渲染引擎”。

与传统“先推理后生成”的串行架构不同,LJM通过MoT(Mixture-of-Transformers)共享注意力机制,让两个专家在每一层网络中都进行双向信息交互。推理专家把物理约束逐层传递到生成过程中,建模专家也把视觉特征实时反馈给推理端。二者同步迭代、互相校准,确保生成的每一秒画面,都严格符合推演的物理逻辑,而不是前后脱节的“两张皮”。

与此同时,原始动作序列还通过交叉注意力、AdaLN两条路径直接作用于建模专家,提供底层的数值级精准控制。高层物理解释+低层动作约束,共同构成了从“动作输入”到“交互语义”再到“视觉输出”的完整通路。

显式监督:让隐空间真正对应物理事实

如果没有明确监督,隐空间表征很容易退化为普通的多模态特征,失去物理推演能力。LJM的解决思路是:用真实物理信号给每一个隐空间token“批改作业”。

团队从真实轨迹数据中提取了本体状态、像素运动、视觉动态三类监督信号,按时间维度交错排列,共同构成交互隐空间的学习目标。

三者共同作用,使得隐空间中的每一个 token 都同时受到来自“自身动作”“环境运动”和“全局变化”的多重约束——模型若要同时拟合这三类信号,就不能依赖统计上的像素相关性,而必须真正捕捉它们背后的因果链条。这种多视角、多粒度的联合监督,迫使隐空间表征扎根于具体的物理量,而非抽象的视觉特征。

价值驱动时序:记住关键的,而非最近的

针对长时序生成的记忆漂移难题,LJM提出了VTC(Value-driven Temporal Conditioning,价值驱动时序条件)机制。

它不再机械地保留最近N帧,而是主动评估每一帧的信息价值:既考虑帧与帧之间的差异度,避免冗余;也优先保留状态转折的关键帧,比如抓取发生的瞬间、物体放置完成的时刻。同时始终保留初始帧作为全局空间参考。

这种“主动选关键帧”的模式,适配机器人操作的部分可观测特性。物体被遮挡了没关系,模型记得它被挡住前的位置;操作步骤多也没关系,关键的状态节点都被保留了下来。实测对比显示,引入VTC后,长序列生成中的物体消失、位置偏移、逻辑矛盾等问题大幅减少,时序一致性显著提升。

03.

数据说话:WorldArena全球第二+LIBERO四项SOTA

WorldArena与LIBERO两大权威基准的测试结果,共同验证了LJM路线的技术优越性。

作为目前全球具身世界模型领域最受认可的第三方公开基准,WorldArena从视觉质量、运动质量、内容一致性、物理遵循、三维精度、可控性六大维度进行综合评估,收录了全球上百个提交方案,具备极强的横向对比价值。

LJM以匿名代号SisyphusWorld提交,最终以73.06的综合得分位列全球第二,仅与榜首相差0.58分,稳居世界第一梯队。



 

更值得关注的是分项成绩:运动质量89.17分、三维精度92.60分、动作可控性85.93分。这三项恰恰是机器人交互场景的核心指标——动作执行是否精准、空间结构是否准确、指令控制是否可控,直接决定了世界模型能不能用于策略预演。

对比同期的通用视频基线模型,差距更为直观:Wan2.2综合得分62.35,CogVideoX 得分62.71,与LJM有超过10分的差距。

与此同时,在更能检验模型的泛化能力与真实交互建模水平的LIBERO榜单中,莫刻机器人LJM多项核心指标达到SOTA水平。

在100组独立测试任务上,LJM四项核心指标全部登顶,全面超越主流基线:

PSNR 28.60(提升约5%)

SSIM 0.9238(提升约4.7%)

FVD 46.49(时序失真指标下降约39.7%)

LPIPS 0.0247(感知误差下降约61.3%)



 

FVD和LPIPS的大幅下降尤为关键。PSNR和SSIM衡量的是单帧画面的相似度,而FVD衡量整段视频的时序分布一致性,LPIPS衡量人类视觉感知下的真实度。这两个指标的显著优化,意味着LJM生成的不只是“单帧像”的画面,更是“从头到尾都符合物理逻辑”的完整交互序列,几乎没有穿模、跳变、物体凭空消失等常见问题。

换句话说,这才是世界模型真正的落地价值:机器人可以放心地在里面预演策略,因为模型预判的结果,和真实世界执行的结果高度一致。

04.

32张真武810E:探索具身世界模型的本土化训练链路

在算法突破之外,LJM的另一重行业价值,在于探索了国内算力支撑顶尖具身世界模型的可行性。

长期以来,大模型研发高度依赖进口高端算力芯片,具身世界模型作为多模态大模型的前沿方向,数据模态多、训练流程复杂,算力门槛更高。国产算力能不能跑、好不好用、能不能跑出世界级效果,部分业内人士心存疑虑。

莫刻机器人从大规模多模态数据预处理、基座模型预训练,到下游任务微调,LJM的全套训练流程全部部署在32张阿里云真武810E之上,初步跑通了具身世界模型的本土化训练链路。

针对国产算力的硬件特性,团队在分布式并行调度、混合精度适配、训练流优化上做了大量工程工作,让LJM的架构优势与算力特性充分匹配,最终在有限的算力规模下,收敛出了世界级的模型性能。

这一实践的意义远超单个企业本身。它为国内整个具身智能行业提供了一条可复用、可落地的本土化算力方案:不靠堆进口高端卡,靠架构创新和工程优化,完全可以支撑顶尖具身世界模型的研发。这对于降低行业算力成本、保障技术供应链自主可控,都具有标志性的标杆意义。

05.

结语

LJM的亮眼表现,也呈现出世界模型的技术竞赛正发生的范式转移趋势。

过去,行业对世界模型的评判标准往往停留在画面层次。莫刻团队认为,机器人要真正进入物理世界,必须拥有理解世界的能力。对于要落地到真实产线的策略预演而言,画面渲染只是表层,对动作与环境的因果交互进行精确推理,才是具身世界模型不可替代的核心价值。

LJM的技术路线恰恰指向这个方向:它不是再增加一个动作适配器,而是在低维控制与高维视觉之间建立了一层可监督、可交互、可记忆的latent interface。语言定义任务,历史视觉提供状态,动作描述控制,latent reasoning预测交互后果,视频扩散模型再把后果生成出来。

当世界模型的技术竞赛从纯视觉生成走向“理解交互再生成”的范式,当国产算力从“能不能用”走向“能不能打”,莫刻机器人的这次尝试,是行业迈出的关键一步。