GPT-6 Astra能让机器人抓东西,但真机上它把硬件弄坏了

林越2026-09-221145协作机器人

GPT-6 Astra发布后第二天,Robocurve将它直接接入机器人执行任务,发现GPT-6 Astra在控制机器人方面表现突出,Token消耗也低。GPT-6 Astra在一项机器人控制任务中的成功率达到95%,高于Fable 5.1的40%;与此同时,输出Token用量仅为后者的约1/6.2,成本约为后者的1/2.3。于是用GPT-6基模控制机器人执行复杂操作的案例层出不穷。有知名具身智能企业的创始人表示,今天的具身智能还没有真正的护城河,通用模型公司在人才、算力和资金上占优,未来一两年将是关键窗口。

GPT-6 Astra 的图像结果

亮眼成绩不等于真机安全


亮眼的单项成绩并不意味着基模已经能够在真实环境中安全、稳定地控制机器人。RoboDojo团队在官方评测中指出,Astra在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏。出于安全考虑,团队提前停止测试,因此Astra未能完成原定包含18项任务的RoboDojo-Real评测。这提醒的是,基模能力的突破只是起点。如何约束动作、处理失败,让机器人安全、稳定地持续工作,仍是系统层面必须解决的问题。

 

穹彻智能的RoboRSI


穹彻智能发布RoboRSI,一个面向真实复杂场景的机器人多智能体自进化框架。它试图回答的是,当基础模型已经具备强大的理解和推理能力后,如何在系统层面构建起持续执行、诊断、修订和复用的完整闭环。RoboRSI的做法是把规划、执行、诊断和修订拆分到不同的上下文中,采用Manager、Planner、Engineer、Reviewer四类智能体协作的架构。这四个角色围绕同一个任务和同一份执行证据接力运行,形成执行、诊断、修订、再执行的闭环。人类仍然保留着对目标、价值判断和安全边界的控制权。

 

技能树和代码固化


穹彻智能提出TSR机制,用一棵四层的技能树来组织机器人的全部能力。每次修改都被限制在清晰的技能边界内,Agent可以专注于局部实现和修订,但不会因为连续调试而偏离全局任务目标。历史经验由此从对话记录和日志,变成了下一轮真正可调用的能力。穹彻智能还设计了一个三阶段的演进机制:从成功的调用链中提取稳定结构,把物体类别、目标区域和空间关系参数化,然后将可复用流程固化为代码技能。当类似任务再次出现时,Agent只需选择、监控和必要时修订整条技能。在LIBERO基准测试的实验中,启用代码固化相比未启用版本,回合通过率从21.5%提升到29.0%,中位Token消耗下降29.4%。

 

适配成本的变化


在RoboRSI的框架下,同样级别的能力构建在一天内就走完了一个完整闭环。2024年完成一个类似的家庭地面清理Demo,需要两名工程师连续投入约一个月,编写约2000至3000行任务代码。如果系统能够自主完成任务拆解、技能实现、执行诊断和代码修订的闭环,适配一个新场景的核心成本就从工程师驻场数周变成了设定目标加系统自主迭代加人工审核和安全把关。这种变化为家庭等高度个性化的场景打开了新的商业空间。每个家庭的户型、家具布局和物品摆放都不同,如果每次部署都需要工程师驻场数周,服务成本就很难支撑大规模推广。缩短适配周期,意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务的市场。