
Chronos将全历史状态和二阶动作桥统一在策略动力学中。
机器人基础模型正在变大。更大的视觉编码器、更大的VLA、更大的机器人数据集,让机器人越来越会“看”、会“听”、会理解复杂指令。但当机器人真正走向工厂工位、仓储货架、双臂装配和服务场景时,另一个问题会迅速变得尖锐:它不仅要知道该做什么,还要知道现在做到了哪一步,并把一段动作稳定、连续、可接触地做出来。
这不是单纯的模型规模问题。图像生成可以把像素当作样本去去噪,语言模型可以把token当作序列去预测;但机器人动作不是一张静态图片,它会穿过关节速度、加速度、执行器带宽、接触力和环境约束。末端轨迹多抖一点,插入就可能偏;双臂动作多犹豫一下,协作就会乱;任务阶段少记一步,长流程就会提前结束。
华中科技大学团队最近提出的Chronos,正是在这个“时间中的物理执行”问题上切入。它一方面把历史从辅助上下文提升为策略动力学的潜在状态,另一方面把动作生成从直接输出动作推进到符合物理约束的二阶动作桥。通过全历史状态空间建模、IMLE多模态动作先验与二阶Schrödinger-inspired动作桥,Chronos试图回答一个更底层的问题:机器人动作生成能不能不再只是图像生成范式的迁移,而成为真正面向物理世界的运动生成范式?
01.
从Demo到落地:具身智能真正难在“时间中的物理执行”
过去一年,具身智能的叙事高度集中在大模型和泛化能力上。VLA、WAM、机器人基础模型不断刷新人们对通用机器人的想象:机器人似乎已经可以理解语言、识别物体、跨场景执行任务。
但产业落地往往卡在更朴素的地方。机器人不是只要在视频里“像是在做”,而是要在真实物理世界里做完:按钮要按到,插头要插进,盖板要打开,工具要放准,双臂要配合,任务步骤不能乱。
在这些场景里,失败通常来自两个方向:第一,机器人不知道自己处在长任务的哪个阶段;第二,机器人即使知道目标,也生成不出足够平滑、稳定、可执行的动作。前者是历史记忆问题,后者是动作动力学问题。Chronos的价值,恰恰在于它没有把两者割裂,而是把“历史中的决策”和“物理中的运动”统一到一个策略框架中。
02.
机器人动作不是图片:只靠去噪和一阶速度场,未必合适
生成式模仿学习已经成为机器人动作生成的重要路线。Diffusion Policy把动作看作需要逐步去噪的样本,flow matching把生成过程写成从噪声到动作的速度场。这些方法很强,也让机器人策略从“均值回归”走向了多模态生成。
但机器人动作与图像像素有一个根本差异:动作最终会被执行。图像中的局部噪声,最多造成视觉瑕疵;机器人动作中的局部抖动,可能直接变成接触失稳、插入偏差、双臂碰撞或执行器震荡。
所以,真实机器人需要的不只是“生成一个看起来合理的动作chunk”,而是生成一段符合运动连续性、速度变化和物理边界条件的轨迹。对于精密插入、装配、盖板操作、按钮序列和双臂协作,这一点尤其关键。

Chronos强调的不是只预测动作位置,而是在动作空间中学习加速度场。
Chronos的核心判断是:机器人动作不应只被看成静态样本,而应被看成一段运动。动作chunk可以被视作广义坐标q,生成过程不只是把q从一个分布搬到另一个分布,而是要通过速度v和加速度a形成更稳定的二阶演化。

Chronos总体框架:全历史SSM编码、IMLE粗动作先验、二阶Schrödinger动作桥。
03.
Chronos的结构分工:历史给相位,物理给轨迹
Chronos可以理解为三层结构:第一层是全历史SSM,把每个物理控制步的观测和本体状态编码为一个state-representative token,并沿真实时间轴传播历史状态;第二层是IMLE粗动作先验,在同一历史相位下保留多种可能动作;第三层是二阶Schrödinger-inspired bridge,把粗动作精修成更平滑、更符合执行约束的最终动作chunk。
这三个模块对应机器人操作中的三个问题:我走到了哪一步?这一步有哪些可行做法?怎样把选中的做法稳定地执行出来?其中记忆不是被忽略的附属功能,而是动作生成的相位条件;物理也不是额外装饰,而是让动作真正可执行的结构约束。

x_t融合当前观测与本体状态;y_t携带历史相位;q_0是多模态粗先验;q_N是二阶桥精修后的动作chunk。
如果说传统VLA更像“当前画面到动作”的映射,那么Chronos更像“历史状态到动作运动”的动态系统。它不是每一帧都像第一次看到世界,而是在时间中持续更新自己的任务相位,并据此生成物理上更稳的动作。
04.
先不要平均:IMLE让机器人保留多种可行动作
真实操作天然具有多模态性。同样是拿起一个物体,机器人可以从左侧绕,也可以从右侧绕;同样是进入插入阶段,可以先调整姿态再推进,也可以先贴近再微调。很多情况下,多种路径都合理。
如果直接用确定性回归学习专家动作,不同示教模式很容易被平均成一条“中间路线”。这条路线在损失函数上可能看起来不错,但在物理世界中往往既不属于左侧路径,也不属于右侧路径,最终变成不可执行的模糊动作。
Chronos先使用IMLE生成coarse action prior。IMLE的关键在于nearest-sample学习:对同一个条件采样多个动作候选,只让距离专家最近的候选受到该专家样本的牵引。这样,模型不必把所有可能性平均成一条轨迹,而可以把不同候选分配给不同动作模式。

nearest-sample机制避免多峰动作分布被均值化。
但Chronos并不把IMLE的输出直接交给机器人执行。q0只是一个“合理但粗糙”的起点,它保留了多种路径可能性;真正决定动作是否平滑、接触是否稳定的,是后面的二阶动作桥。
05.
量子力学启发的薛定谔桥:不是玄学,而是把概率变成力场
“Schrödinger-inspired”天然带有爆点,因为它让人联想到量子力学。但在Chronos里,它并不是玄学包装,而是一条从概率分布到动力学约束的数学路线。
论文从Schrödinger方程出发,通过Madelung变换把波函数写成“密度ρ + 相位S”的形式;随后得到连续性方程与Hamilton-Jacobi方程;再引入Gaussian bridge approximation和Kostin dissipative potential,最终得到一个面向机器人动作的加速度匹配目标。

可以说:Chronos借用了量子力学中的密度—相位表示,把动作分布的变化投影为可学习的动力学场。
用产业读者更容易理解的话说:Chronos不是要真的让机器人“量子化”,而是借用薛定谔动力学里的密度、相位和势能思想,把动作生成从“采样一段向量”改写成“沿着一个受约束的力场运动”。
这个力场的核心不是速度,而是加速度。加速度决定速度如何变化,速度再决定动作位置如何变化。对于真实机器人,尤其是插入、按压、接触和双臂协作任务,这比单纯在动作空间里一步步移动样本更接近物理执行过程。

Madelung视角下,密度曲率可以产生类似“量子势”的力;Chronos将这一思想压缩为控制导向的加速度场。
06.
二阶动作桥真正解决什么:让粗动作变成可执行运动
Chronos的二阶桥有清晰的起点和终点:起点q0来自IMLE粗动作先验,终点q1在训练时由专家动作chunk提供。桥的任务不是凭空生成动作,而是在起点和专家目标之间学习一条更稳定的变形路径。
这条路径受当前状态x_t锚定,并由网络预测加速度场。为了避免端点附近出现无意义的抖动,Chronos还使用满足位置与速度边界条件的调度设计,让扰动在桥的两端自然收束。这一点对于接触前后的稳定性尤其关键。
如果把IMLE比作“先想出几条可行路线”,二阶薛定谔桥就像“用物理约束把路线修顺”。它不只是把动作修得更像专家,也把动作修得更像机器人真的能执行。

位置项保证接近参考轨迹,速度项抑制局部抖动,加速度场承担最终的物理精修。

ALOHA插入任务动作头消融:二阶桥与调度设计直接影响精细插入成功率。
07.
结果:不仅记得住,而且动得稳
精密插入:动作生成机制直接改变执行质量
在ALOHA bimanual insertion任务中,完整Chronos达到90%成功率。替换成diffusion action head后,成功率下降到66%;替换成flow matching后为72%;去掉二阶bridge,仅保留回归头为86%;使用IMLE和二阶bridge但换成常规一阶schedule,也会从90%降到72%。
这组消融说明,Chronos的优势并不只是来自更强的编码器或更长的历史,而是来自动作生成机制本身。二阶动作桥和满足二阶边界的调度,确实能在精密接触任务中提升动作稳定性。
更关键的是,它并不依赖很长的迭代采样。论文结果显示,单步积分已经能达到84%,三到五步达到90%的最佳成功率。这意味着它可以更接近真实机器人控制频率的工程要求,而不是把动作生成变成一个昂贵的采样过程。
记忆任务:小模型反超大模型数倍,因为换了状态建模方式
在RMBench这个记忆依赖基准上,Chronos展现出惊人效果,这个0.3B模型达到73.6%平均成功率。相比强Markovian VLA基线π0.5,高出62.4个百分点,成功率约为其6.6倍,同时参数量少10倍!相比10B级记忆VLA Mem-0,也高出22.8个百分点,并且参数量少30倍以上!
这里的重点不是“小模型反超大模型数倍”这一句标题,而是结构效率:当任务依赖历史相位时,单纯放大当前观测策略并不能自动解决问题。历史必须成为策略状态,而不是被塞进一个短窗口或外部提示里。

RMBench结果:Chronos在记忆依赖任务上以0.3B参数取得73.6%平均成功率。
真实双臂:长时序和精细动作最终要回到物理世界
算法最终还是要落地真实世界,在使用单个RGB相机的真实世界双臂实验中,Chronos,四个任务平均成功率达到78%;在三个记忆依赖任务上达到72%,而π0.5在这些任务上为0%。这些任务包含阶段切换、顺序记忆、遮挡信息和双臂协作,并不是短视频里看起来流畅的一次性抓取。
这也是Chronos路线的产业意义所在:机器人既要知道过去发生过什么,也要把当前动作稳定执行出来。没有历史,长任务会乱;没有物理约束,精细动作会抖。

真实双臂任务rollout:长时序阶段、双臂协作和隐藏信息共同构成真实执行挑战。
08.
为什么记忆在这里不是配角:它是动作生成的“历史相位”
如果把这篇工作只概括为“二阶动作生成”,仍然会漏掉Chronos的另一半:历史。因为再平滑的动作,如果不知道现在该做第几步,也只是把错误动作执行得更稳定。
长时序操作中的难点在于,同一个当前画面可能对应完全不同的过去。一个方块被盖住后,机器人看到的只是盖子,但它必须记住盖住前的颜色位置;一个按钮被按了两次还是三次,画面未必直接告诉它;一个中间阶段结束后,场景可能回到类似初始状态,但下一步动作已经改变。
Chronos让每个物理时刻只产生一个state-representative token,并让token序列与真实控制时间一一对应。选择性状态空间模型沿时间传播内部状态,使任务阶段像动力学状态一样被持续更新。
因此,Chronos中的记忆不是一个孤立模块,而是动作生成的历史相位。IMLE需要历史相位来选择合适的动作模式,二阶桥需要当前状态来进行物理锚定。二者结合后,机器人才能既“不迷路”,又“不抖动”。
记忆问题不需要抽象化地讲,一个Cover Blocks任务就足够直观。桌面上有几个不同颜色的方块,机器人一开始能看到颜色和位置;随后,方块被相同的盖子遮住。到真正执行时,当前画面里只剩下几个几乎一样的盖子。对相机来说,它们没有“红、绿、黄”的外观差别;对任务来说,机器人却必须按照指定顺序依次揭开正确盖子。
这时,任务的本质已经不是“识别当前图像里哪个是红色方块”。红色已经被盖住了。正确动作取决于机器人在前面几秒钟是否记住了“颜色—位置”的绑定关系,以及现在已经执行到第几个目标。也就是说,当前观测是模糊的,历史才是答案。

如果策略只看当前画面,它看到的是“几个一样的盖子”,很容易随机选、重复选,或者提前结束。如果只靠短窗口,关键的颜色信息一旦滑出窗口,策略同样会失去依据。Chronos的全历史SSM则把早期观察到的颜色位置关系保存在历史状态y_t里,让后续动作生成知道“这一步该去哪个盖子”。
更重要的是,记忆在这里不是配角。它不是文章里额外加上的“会记住过去”,而是动作生成的历史相位:IMLE需要这个相位来选择左侧、中间或右侧的动作模式;二阶桥需要当前状态x_t来把这条动作路线修顺、修稳。只有二者结合,机器人才能既不揭错盖子,也不在接触时抖动。

历史状态可视化:当前观测相似时,全历史状态仍能区分任务阶段。
09.
产业视角:VLA做大脑,二阶动作桥做“小脑”
从产业化角度看,Chronos并不是要取代大模型。更合理的理解是:大VLA或世界模型可以承担高层语义理解、任务规划和场景泛化;Chronos这类结构可以承担长时序状态维护和低层动作生成。
如果把VLA看作机器人的“大脑”,负责理解“我要做什么”;那么全历史SSM和二阶动作桥更像“小脑”和运动控制中枢,负责记住“我已经做到哪一步”,并把动作修成“身体能稳定执行的轨迹”。
这对真实落地非常重要。工厂、仓储、医疗和家庭服务场景不会只考机器人是否理解一句话,而会考它能否稳定完成一串物理动作:拿起、对准、插入、按压、等待、复位、再进入下一步。中间任何一步的历史相位错乱或动作抖动,都会让系统从Demo变成事故。
因此,Chronos传递的行业启示不是“继续把模型做大就够了”,而是“机器人基础模型必须与时间状态和物理约束结合”。真正可部署的具身智能,可能不是单一巨型端到端模型包打一切,而是高层智能、历史状态和物理动作生成之间的系统协同。
10.
Chronos真正改变了什么:从生成样本到生成运动
如果只用一句话概括Chronos,它不是一个单纯“更会记忆”的小模型,也不是一个给动作头换名字的技巧,而是一个把全历史状态与二阶物理动作生成结合起来的机器人策略框架。
它把历史从辅助上下文提升为策略动力学状态,也把动作从静态样本提升为受物理约束的广义坐标。前者解决“同一画面下我到底处在哪个阶段”,后者解决“知道该做什么之后,如何稳定地做出来”。
这也许代表机器人动作生成正在进入一个新阶段:从像素式去噪,到控制式生成;从一阶速度场,到二阶加速度场;从追求最终位姿,到重视整段运动的可执行性。
未来的机器人不应该每一帧都像第一次看到世界,也不应该把动作当成没有物理后果的向量去生成。它需要记得过去,也需要尊重运动;需要理解任务,也需要服从动力学。
这正是Chronos——这个来自古希腊神话时间之神的名字的意味:时间不是背景,时间本身就是机器人智能的一部分。而在时间之上,物理约束正在把机器人动作生成带入新的“二阶时刻”。
论文标题:Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation
作者:Yulin Zhou, Yimeng Wang, Nengyu Wang, Shaojia Xing, Shiyun Tu, Xiang Li, Jingkai Zhang, Ningbo Jiang, Yuankai Lin, Hua Yang, Xiangrui Zeng, Zhouping Yin
论文:https://arxiv.org/abs/2606.30318
主页:https://chronos-manipulation.github.io/
