网易首页 > 网易号 > 正文 申请入驻

机器人如何做到“随机应变”?因果智能系统CRIS-0把任务状态带进连续行动

0
分享至



冲咖啡、整理客厅,如今的不少机器人对这些任务已经轻车熟路。但在实际执行中,一旦发生细微的外部扰动,例如咖啡袋被人挪走,或是关微波炉门时突然伸进一只手,它还能把这件事顺利做完吗?

类似的意外在日常环境中难以避免。环境发生变化后,机器人能否意识到原有动作所依赖的条件已经改变,决定着任务能否继续。传统端到端模型主要学习从视觉输入到动作输出的映射,连续任务则进一步要求系统持续理解和管理任务状态。

近日,聚焦因果智能的 AI 公司 Aether AI 展示了因果驱动的机器人智能系统 CRIS-0。系统以任务相关的状态为线索,连接观测、预测、规划、执行和结果检查,尝试让机器人在条件变化后继续推进任务。

值得关注的是,CRIS-0 以任务状态为共同依据,协调世界模型、动作策略和验证工具。当环境发生变化,系统由此能够判断哪些条件需要更新,再决定动作是否继续、重试或回退。

此次演示覆盖抗干扰、长程任务和个性化交互三个维度,系统均呈现出稳定的状态跟踪与任务执行能力。公司称,CRIS-0 对因果状态驱动任务执行的验证,将成为因果智能在物理世界落地的重要里程碑。

从「完成动作」到「持续管理任务状态」

要理解这一难题,不妨回看机器人能力的发展。视觉语言动作模型,也就是 VLA,已经证明机器人能够从画面和语言指令中学习复杂操作。任务延伸到多个连续步骤后,系统还需判断每一步的结果,才能在抓取失败时决定重新接近物体,还是调整动作继续尝试。

围绕这一问题,行业逐渐形成几种互补尝试。例如,动作策略负责把操作做出来,运用世界模型估计行动后的变化,模型和智能体则安排具体的步骤和调用工具。

不过,只让具身智能知道如何完成一个动作还远远不够。随着机器人走向连续任务,如何理解和管理不断变化的任务状态,成为下一步需要解决的问题。

CRIS-0 因此把任务状态放在系统设计的中心。它指的不是对当前画面的简单描述,而是决定下一步行动能否成立的一组相关条件。咖啡袋的位置、物体是否抓稳、门边是否有人,都可能改变后续动作。除此之外,画面中其他无关的变化,则不一定需要打断任务。

以对齐桌布角点为例,机器人需要判断桌布是否已被夹爪抓住、角点距离目标还有多远,以及拉动时是否发生滑移。抓稳之后才能拉动,角点偏移决定调整幅度,一旦滑脱,就需要回到抓取阶段。这些变量让任务进度有了可检查的依据。

这些变量有的可从视觉中估计,有的要等动作完成后才能确认。例如夹爪碰到桌布,不等于已经抓稳;桌布位置变了,也未必意味着角点更接近目标。

为把可见画面与任务条件对应起来,系统中的因果智能体(Causal Agent)采用分阶段管理任务的方式,通过持续更新任务状态、检查执行反馈,让规划器能够判断当前阶段是否完成以及下一步如何行动,以确保局部失误在进入后续步骤前被发现并处理。与此同时,这种阶段性的检查也让失败恢复有了明确的起点。

规划器将任务划分为可观察、可验证的阶段,给每一阶段设置完成条件和参考工具,逐步形成任务图。任务图负责记录阶段之间的转移关系,也为失败后的回退提供路径。

除了判断眼前发生了什么,系统还需要估计行动可能带来的变化,以便在执行前比较不同动作对任务进度的影响。

为此,CRIS-0 引入公司自研的因果世界模型(Causal World Model),先预测与任务有关的状态如何变化,再据此表征行动后的结果。对桌布任务来说,关键并非下一帧画面是否逼真,而是一次拉动能否缩小角点偏移,或是否会让桌布滑出夹爪。


图丨CRIS-0 系统技术架构示意图(来源:Aether AI)

在世界模型的基础上,Aether AI 还为 CRIS-0 系统加入了生成动作的模块。前者提供对未来变化的预测,后者利用共享的表示输出可执行的控制,两者共同构成策略模型(Policy model)。

策略模型由此可以生成可执行的动作。基于此,规划器在需要精细接触的阶段调用这一策略,让世界模型对未来变化的预测参与实际操作。

在把未来预测与动作生成结合起来之后,系统还需要解决连续任务中定位、移动和结果检查等能力如何衔接的问题。CRIS-0 通过统一工具接口,将规则函数、策略模型、导航工具和验证器交给规划器调用。工具的选择取决于任务进行到哪一步,以及这一阶段需要满足什么条件。

同一操作也可能有不同的完成方式。以操作按钮为例,规则函数可以根据按钮位置生成按压动作,学习策略则可以处理接触过程。规划器将两者作为候选工具,依据当前任务状态选择合适的执行方式。

另外,每个阶段结束后,验证器会检查结果是否达到预设条件,规划器再决定继续、重试或回退。如果目标在抓取前被移走,系统就返回接近物体的阶段,重新定位并安排抓取。若问题出在工具执行,系统也可以利用错误反馈修正工具后再次尝试。

为了让任务在失败后有路可退,团队还设计了状态转移循环(Structured State Transition Loop),记录成功与失败的尝试。具体而言,若机械臂计算出的关节姿态超出限制,系统可以根据错误反馈调整工具实现,再验证新的执行结果。有效的恢复路径随后纳入任务图,供相似阶段再次调用。

任务状态由此贯穿了从预测到行动的过程。机器人既要知道当前阶段依赖哪些条件,也要根据执行结果更新这些条件。CRIS-0 将这些判断放进同一套运行循环,试图让连续任务中的调整有据可循。

因果驱动,CRIS-0 的三重能力跃迁

这些状态判断在演示中有了更具体的落点。在本次展示的 Demo 中,团队设计了咖啡、微波炉、客厅整理和取物场景,分别考察外部环境变化后的恢复、连续阶段之间的依赖,以及用户目标与约束改变时的选择。

首先是抗干扰(Robustness),重点考察外部环境变化后,机器人能否识别关键条件并调整行动。

咖啡任务最直接地呈现了这种外部扰动:机器人准备抓取咖啡袋时,袋子或咖啡机一旦移位,原先的接近路径便不再适用。在此情况下,CRIS-0 没有沿着原路径继续抓取,而是根据更新后的物体位置回退到接近阶段,重新定位、调整夹爪姿态,再安排抓取。

据测试数据,系统能够平均在 2 秒内识别环境变化并重新规划,并在 10 次干扰中完成了 9 次有效恢复。

为进一步检验系统对无关视觉变化的排除能力,咖啡任务还设置了光照扰动。当咖啡机周围的画面发生变化、而按钮位置不变时,CRIS-0 仍能从连续观测中锁定需要操作的按钮区域,过滤掉无关的视觉干扰,继续完成操作。

不论是物体移位还是光照扰动,系统关注的始终是变化是否影响当前任务条件:前者改变了抓取所需的目标位置,机器人需要回到定位阶段,再决定如何操作;后者则改变了画面外观,但只要按钮仍在原处,当前操作便可以继续。

除了物体移位,临时出现的风险也会改变行动条件。机器人准备关微波炉门时,若有人把手伸到门边,继续推门会带来碰撞风险。识别到这一变化后,CRIS-0 会在 0.2s 内停止动作,待人手离开再继续关门。

同一任务还设置了盘中出现饮料罐的情况。系统发现饮料罐不宜随蛋糕一起加热,便暂时改变原计划,先把它从盘中取出。无论是人手靠近,还是盘中物品发生变化,机器人都需要重新检查下一步动作所依赖的条件。

微波炉任务中的两种变化还涉及不同层级的调整。人手靠近时,当下的推门动作需要先停下。盘中出现不宜加热的物品,则会改变任务的先后顺序。机器人在执行中既要检查单个动作的风险,也要重新安排整体任务。

二是长程任务(Long-Horizon Task Execution),则强调多阶段连续执行,以及如何根据任务内部状态调整后续安排。

在客厅演示中,当用户说出“帮我找蓝色小包”或“太乱了,帮我整理”后,机器人得到的是目标,而非逐步指令。这就需要系统自主识别并合理安排寻物、检查和取放等阶段,并在处理每件物品时决定后续步骤。

而长程任务之所以更难,在于阶段之间的依赖关系会随着执行不断变化。例如检查饮料瓶是否还有液体,会决定它是被当作空瓶丢弃,还是放回一侧。整理书本时,普通书本可以摆在茶几上,账单则适合放到更私密的位置。完成一次取放后,系统还要检查结果,再进入下一阶段,以此避免先前的偏差影响后面的判断。

最后是个性化交互(Personalization),这意味着,在环境和任务进度之外,用户条件也会改变机器人的选择。

在零食柜演示中,CRIS-0 结合晨跑、当前时间和日常习惯判断用户需求,同时考虑其健身期间避免高糖饮料的习惯,最终准备功能性饮料。同一条取物请求,在不同目标和约束下可能对应不同物品。

从咖啡袋移位,到饮料瓶有无剩余,再到用户是否刚跑完步,表面是不同场景中的细节,实际都在改变任务状态。由此可见,基于因果智能体的 CRIS-0 已经能够识别哪些变化会影响当前目标,并据此调整下一步行动。

因果智能:走向更可控、可信赖的AI

这并不是因果智能第一次亮相。在此次机器人系统展示之前,Aether AI 已公开介绍具身因果世界模型 CausalWM,强调以运动和三维空间关系为线索,逐步推演未来画面的能力。CRIS-0 则将这一思路带入机器人行动,关注执行结果如何影响下一步。

本次展示的增量,在于世界模型与因果智能体如何围绕任务状态协同工作。前者预测候选动作可能造成的变化,后者据此组织规划、工具调用和结果验证,让机器人在连续任务中决定推进、重试或回退。

从全球具身智能的进展来看,开放环境中的连续任务正成为重要议题。Physical Intelligence 的 π0.5 曾在训练数据未覆盖的家庭中完成厨房和卧室整理,任务持续约 10 至 15 分钟。Google DeepMind 推出的 Gemini Robotics ER 2,则把多步规划、进度跟踪和失败后的自我纠正纳入系统设计。

两项研究路径不同,但都指向机器人如何持续完成任务的难题。π0.5 着重考察新环境中的能力迁移,Gemini Robotics ER 2 强调高层推理与动作模型的协作。相比之下,Aether AI 的 CRIS-0 更进一步将因果推理引入完整的行动闭环:它不仅判断“下一步做什么”,还通过因果世界模型预测“这样做会发生什么”,并在真实执行后验证结果、识别偏差,再决定继续、重试、回退或重新规划。

由此,机器人从依赖动作生成和任务规划,进一步走向理解行动后果,并基于因果反馈持续决策,为更复杂的长程任务提供了一条更具可解释性与安全可控性的技术路径。

这种选择也与创始人黄碧薇的研究经历密切相连。她从德国马克斯·普朗克研究所到卡内基梅隆大学、加州大学圣地亚哥分校,长期研究如何从观测数据中发现因果关系。

在 Aether AI 提出的四层技术架构中,本次 Demo 主要基于前两层。因果驱动智能体承担规划、归因、记忆和恢复,因果世界模型用于模拟“如果这样做,世界会怎样变化”。两者围绕任务状态协作,使系统能够把行动前的预测与执行后的反馈联系起来。

在这一技术路径中,预测与控制的衔接尤为关键。因果世界模型先估计候选动作会怎样改变任务相关变量,再以这些变化表示未来状态。随后,新增的动作模块共享这一表示,将其转成可执行控制,模型由此可以判断动作是否可能带来预期的状态变化。

不过,随着任务进入更开放的环境,系统如何从新的物品和场景中持续识别关键变量,并迁移、复用已有的任务阶段,仍有待进一步探索。

与此同时,在可预见的未来中,机器人将越来越多地进入日常环境,不少科幻作品也热衷于预言机器人“失控的未来”,AI 的可解释性和可控性正成为亟待解决的问题。因此,能否理解系统为何选择某个动作、何时停止或修正,将直接关系到人能否及时发现风险并介入。

针对这一问题,因果智能通过跟踪关键状态变化,能够为行动选择提供可追溯的依据。这或将为划定安全边界、及时发现偏差及必要时的人工介入创造条件,也有望为 AI 风险管控和科技向善提供技术基础。

Aether AI 希望将因果智能发展为可延伸的技术底座,进一步用于预测(forecasting)和科学发现(scientific discovery)等领域。未来,因果智能的潜力能否在机器人之外的复杂问题中显现,还要看模型能否识别并验证关键变量之间的关系,以及这些关系能否帮助形成可靠的预测。

注:封面/首图由 AI 辅助生成

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京会见佩泽希齐扬:这一切不是伊朗的错

普京会见佩泽希齐扬:这一切不是伊朗的错

看看新闻Knews
2026-10-09 09:02:06
卸任后首次窜访美国,蔡英文向大陆喊话,外媒:大陆在台海大动作

卸任后首次窜访美国,蔡英文向大陆喊话,外媒:大陆在台海大动作

探源历史
2026-10-09 10:28:12
老祖宗告诫:“父母走后,三亲要断交”!哪三亲?为何要断?

老祖宗告诫:“父母走后,三亲要断交”!哪三亲?为何要断?

历史教堂
2026-10-07 19:27:52
俄罗斯鼠疫事件背后

俄罗斯鼠疫事件背后

小刘说感控
2026-10-08 12:48:51
退休人员注意:今年与去年退休,今年不涨养老金算吃亏吗?

退休人员注意:今年与去年退休,今年不涨养老金算吃亏吗?

白昼说故事
2026-10-09 09:48:21
西子湖畔,女模特悄然伫立,宛如天仙下凡尘

西子湖畔,女模特悄然伫立,宛如天仙下凡尘

史海流年号
2026-10-03 10:51:38
乌克兰一吨钢都炼不出!中国对欧钢铁配额,,恐从240万吨砍到80万吨

乌克兰一吨钢都炼不出!中国对欧钢铁配额,,恐从240万吨砍到80万吨

让生活充满温暖
2026-10-08 14:35:03
再见了康辉,再见了李梓萌,再见了朱迅,央视主持迎来疯狂大洗牌

再见了康辉,再见了李梓萌,再见了朱迅,央视主持迎来疯狂大洗牌

大眼妹妹
2026-10-06 22:31:58
尊界汽车发布声明:将进一步优化制动踏板 为已交付用户提供免费升级选择

尊界汽车发布声明:将进一步优化制动踏板 为已交付用户提供免费升级选择

快科技
2026-10-08 21:22:08
37岁男子青海自驾失联400多天,家属悬赏50万寻找;事发俩月后车被找到,行车记录仪被遮挡,背包和手机电脑均不在,目前警方仍未立案

37岁男子青海自驾失联400多天,家属悬赏50万寻找;事发俩月后车被找到,行车记录仪被遮挡,背包和手机电脑均不在,目前警方仍未立案

华商网
2026-10-09 10:08:40
央视主持人调整!3 人上岗,2 人调岗,1 人离岗,康辉、董卿在列

央视主持人调整!3 人上岗,2 人调岗,1 人离岗,康辉、董卿在列

福建睿平
2026-10-09 06:46:46
非必要不做CT?医生强调:只要做过CT,患者一定多加关注这5点

非必要不做CT?医生强调:只要做过CT,患者一定多加关注这5点

岐黄传人孙大夫
2026-10-09 08:40:09
印尼总统普拉博沃,最新涉华表态

印尼总统普拉博沃,最新涉华表态

政知新媒体
2026-10-09 10:44:00
泰山景区:“游客山顶躲雨被商户收费1小时80元”系假消息 山顶旅店称最便宜床位一晚100多元

泰山景区:“游客山顶躲雨被商户收费1小时80元”系假消息 山顶旅店称最便宜床位一晚100多元

红星新闻
2026-10-06 16:40:22
浙江小百花越剧院致歉:因李云霄身体原因,《九斤姑娘》武汉演出延期

浙江小百花越剧院致歉:因李云霄身体原因,《九斤姑娘》武汉演出延期

澎湃新闻
2026-10-08 15:04:09
美国突然出手!叫停全美8家巨头绿卡申请,9所高校J-1签证也遭调查!

美国突然出手!叫停全美8家巨头绿卡申请,9所高校J-1签证也遭调查!

华人生活网
2026-10-09 05:29:41
江淮汽车、鸿蒙智行回应“尊界V800刹车踏板支架被踩断” | 懂车帝再发视频:智界V9同工况未断裂,多款车型均通过6脚全力制动考验

江淮汽车、鸿蒙智行回应“尊界V800刹车踏板支架被踩断” | 懂车帝再发视频:智界V9同工况未断裂,多款车型均通过6脚全力制动考验

都市快报橙柿互动
2026-10-08 18:57:33
拔出萝卜带出泥!代露娃风波再次升级,意外将半个娱乐圈拉下水

拔出萝卜带出泥!代露娃风波再次升级,意外将半个娱乐圈拉下水

手工制作阿歼
2026-10-09 05:16:24
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
粤J2888T女车主真容曝光:人美心也善!搞笑的是,这个国庆,她又带错路了…

粤J2888T女车主真容曝光:人美心也善!搞笑的是,这个国庆,她又带错路了…

潇拾亿郎
2026-10-07 20:32:50
2026-10-09 11:12:49
DeepTech深科技 incentive-icons
DeepTech深科技
麻省理工科技评论独家合作
17351文章数 515233关注度
往期回顾 全部

科技要闻

字节"干扰模型训练"实习生融资近2亿元

头条要闻

浙商在南非遭人持枪绑架囚禁36天 绑匪索要1000万美金

头条要闻

浙商在南非遭人持枪绑架囚禁36天 绑匪索要1000万美金

体育要闻

30天30队·鹈鹕:胖虎又一年“如果”

娱乐要闻

蔡康永回应,装都不装了!

财经要闻

鬼故事再现?OpenAI营收被爆巨大预期差

汽车要闻

特别版配色/碳纤尾翼 2027款深蓝L06将于10月9日上市

态度原创

本地
艺术
健康
旅游
军事航空

本地新闻

转型再出发 奋勇打头阵

艺术要闻

炸裂!龙门石窟首次发现造像琉璃眼珠,千年佛像竟“睁眼”了,熠熠闪光品相逆天!

痘坑留下后,还能填平吗?

旅游要闻

粉黛如烟 邂逅聊城秋日浪漫

军事要闻

美日将在距台仅110公里处演习

无障碍浏览 进入关怀版