网易首页 > 网易号 > 正文 申请入驻

前沿分享丨Jim Fan、李飞飞团队新作:机器人也能「上下文scaling」

0
分享至

转自 学术头条

过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?

针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、“AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到 8K 时间步,相当于 5 分钟的“肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。


论文链接:https://arxiv.org/abs/2607.15275

这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时“自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。

研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:“很快,即使是 100 万上下文,也不再是幻想。”

面向机器人策略的长上下文建模

RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。


图|RoboTTT 的模型架构、训练和推理。

RoboTTT 主要包含三项设计,如下:

1.模型架构:RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度处理跨时间信息。为提高效率,模型不直接将所有视觉-语言 token 输入 TTT 中,而是使用少量 register token 在时间上传递视觉-语言信息。为保留预训练能力,TTT 输出经 Tanh Gating 后再加入注意力输出。


图|带有 Tanh Gating 的计算流程。

2.序列训练:为扩展训练上下文的长度,RoboTTT 结合了序列动作强制和截断反向传播算法。训练时,序列动作强制为每个动作块独立采样噪声水平,以稳定 flow-matching 训练;TBPTT 将长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,这样既能让 TTT 贯穿整条序列,又能把显存开销控制在片段长度范围内。


图|TBPTT。

3.长上下文约束:RoboTTT 会把部分时间步只作为上下文使用,这些时间步会写入快速权重,但不参与动作损失计算。基于这一机制,模型可以从两类上下文中学习:

  • 视频模仿:人类视频作为上下文,只更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
  • DAgger 蒸馏:完整 DAgger 轨迹都会更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失只在人类纠正动作上计算,把失败后的纠正方式写入快速权重。


图|DAgger 蒸馏。

上下文越长,性能越强

研究团队在三个长程双臂装配任务上评估了 RoboTTT。整体而言,RRoboTTT 能够利用自身更多的历史信息进行训练,除了上述更强的闭环性能之外,它仅需一段包含上下文信息的人类视频即可进行一次性模仿、实时自我改进以及对物理扰动鲁棒


图|评估任务。

1.在长程任务上持续优于基线

主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN。


图|主评估:三个装配任务上的任务完成分数。

此外,RoboTTT 也是完全成功次数最多的方法,尤其是在平均约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务上,RoboTTT 是唯一完整完成任务的方法。


图|主评估:三个装配任务上的完全成功试验次数。

简单拼接过去观测并不能可靠提升表现。在 Pup Go Car(玩具车装配)任务上,加入一个历史帧的 GR00T N1.7 Hist 得分为 39.5%,低于只看当前观测的 GR00T N1.7(57%)。GDN 将历史压缩为循环状态,但没有在所有任务上带来提升。

RoboTTT 更善于跟踪任务进度、恢复错误和完成细粒度操作。在视觉相似的多阶段装配中,RoboTTT 能更好地区分当前阶段;电钻未对准螺丝时,它也会重新对齐并再次尝试;在插入、扣紧电路组件等细粒度操作中,动作也更精确。

2. 预训练上下文越长,闭环表现就越好

研究团队将预训练上下文从 128 扩展到 8K 时间步后评估发现,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且没有出现饱和迹象。相比而言,上下文变长后,GDN 却没有获得同样的性能提升。

研究团队认为,这一差异来自更新机制,RoboTTT 通过梯度下降更新快速权重,并学习快速权重的初始化和更新方式;GDN 则使用线性关联状态,不具备这种元学习机制。


图|闭环性能随预训练上下文长度扩展而提升。

3.one-shot 模仿与扰动鲁棒

RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿。在 Circuit(电路装配任务中),机器人只能通过上下文中的人类视频判断该装配哪种电路配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为65%;GDN 没有取得完全成功,任务完成分数为 33%。


图|从上下文内人类视频进行一次性模仿。

长上下文约束也提升了扰动恢复能力。当人类在游戏过程中移除已安装的部件时,RoboTTT 会根据自身的部署情况返回并重新安装该部件。车顶被移除时,RoboTTT 的恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 的恢复率均达到 90%,也高于短上下文基线。

4.更强的即时恢复能力

RoboTTT 具备更强的即时恢复能力,并优于标准 DAgger。标准 DAgger 只在人类纠正动作上微调,平均提升9%;DAgger 蒸馏把完整轨迹作为上下文,包括次优机器人动作,但只在人类纠正动作上计算损失,平均提升 33%。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,并能在线从自身的错误中恢复,无需人工干预。


图|DAgger 蒸馏在 Pup Go Car 上的结果。

不足与未来方向

研究团队指出,尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 scaling 轴的潜力,但仍存在一些不足。

首先,扩展训练上下文长度会增加训练成本。虽然 RoboTTT 在推理时保持成本恒定,但训练更长上下文仍需要更多开销。未来,研究人员应采用更高效的 TTT 训练技术(如 TNT)来降低这一成本。

其次,TTT 层的目标函数仍有探索空间。当前工作提出了一种将 TTT 整合进机器人基础模型的方法,但面向机器人的 TTT 层目标(类似视觉领域中的相关探索)将是一个有潜力的方向。

此外,RoboTTT 仍未覆盖部署中可能出现的全部失败模式。研究团队表示,RoboTTT 与强化学习结合,直接优化任务成功率,有望进一步提升实际执行表现。

更多技术细节,详见原论文。

作者:夏千斯

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
韩国女篮输关键战八强危矣!韩媒炮轰裁判不公:罚球34-6离谱到家

韩国女篮输关键战八强危矣!韩媒炮轰裁判不公:罚球34-6离谱到家

颜小白的篮球梦
2026-09-08 06:15:05
李嘉诚为西藏泥石流捐1500万,其他都是公司捐款,只有李嘉诚是个人

李嘉诚为西藏泥石流捐1500万,其他都是公司捐款,只有李嘉诚是个人

担扑
2026-09-07 23:58:13
黄仁勋大发慈悲!RTX 5090公版显卡只卖1.35万元:市场价已超3.35万元

黄仁勋大发慈悲!RTX 5090公版显卡只卖1.35万元:市场价已超3.35万元

快科技
2026-09-07 10:18:21
逼近TOP50!郑钦文7连胜飙升69位,再赢一场重返金花一姐位置

逼近TOP50!郑钦文7连胜飙升69位,再赢一场重返金花一姐位置

全景体育V
2026-09-08 04:28:18
冯德莱恩现身格陵兰岛,打醒特朗普买岛梦,一个动作值得中国警惕

冯德莱恩现身格陵兰岛,打醒特朗普买岛梦,一个动作值得中国警惕

刘振起观点
2026-09-08 09:09:11
愤怒!中国博主在伦敦直播时,当众遭几个外籍青年殴打,报警后警方敷衍了事

愤怒!中国博主在伦敦直播时,当众遭几个外籍青年殴打,报警后警方敷衍了事

小徐讲八卦
2026-09-07 06:33:55
事态升级!官媒锐评武大女教授风波,网友曝付某妻子曾在同校

事态升级!官媒锐评武大女教授风波,网友曝付某妻子曾在同校

天马幸福的人生
2026-09-07 14:14:22
南通烤肉店老板老陶深夜跳江身亡!6家门店,一个爱好毁掉一切

南通烤肉店老板老陶深夜跳江身亡!6家门店,一个爱好毁掉一切

观察鉴娱
2026-09-08 09:31:49
全体女性做好长期打算吧!

全体女性做好长期打算吧!

伊姐看电影
2026-09-08 09:32:24
采访掀起巨大争议!多名名宿炮轰姆巴佩:看不清现实处境

采访掀起巨大争议!多名名宿炮轰姆巴佩:看不清现实处境

圣西罗的太阳
2026-09-08 08:36:31
尘埃落定!郭德纲演出风波迎结局,53 岁的他终究为自己 "欲望"

尘埃落定!郭德纲演出风波迎结局,53 岁的他终究为自己 "欲望"

历史点行
2026-09-08 05:35:22
特朗普一夜 “变棕” 登机!网友:替身上岗?身材只有一半!

特朗普一夜 “变棕” 登机!网友:替身上岗?身材只有一半!

麓谷隐士
2026-09-08 00:10:03
CBA又闹大笑话,超级球队戏耍外援,或投诉到国际篮联,太离谱

CBA又闹大笑话,超级球队戏耍外援,或投诉到国际篮联,太离谱

宗介说体育
2026-09-07 16:05:21
金庸为何要让黄蓉受辱而亡?这本是他的笔误,却意外造就了经典

金庸为何要让黄蓉受辱而亡?这本是他的笔误,却意外造就了经典

耳东文史
2026-09-08 00:02:12
上海兴伟学院学费60万仅19人报到,四年花一套房钱读本科,这账你算得清吗?

上海兴伟学院学费60万仅19人报到,四年花一套房钱读本科,这账你算得清吗?

起喜电影
2026-09-08 05:03:21
水落石出!李月汝护照遗失原因查明,美国物流系统问题出在哪?

水落石出!李月汝护照遗失原因查明,美国物流系统问题出在哪?

仙味少女心
2026-09-07 03:26:03
队记:有球队利用掘金薪资困境 要求他们在卡约交易中搭选秀权

队记:有球队利用掘金薪资困境 要求他们在卡约交易中搭选秀权

北青网-北京青年报
2026-09-08 08:45:03
龙赛罗:很奇怪罗德里犯规的画面不公开,皇马只能全力冲欧冠

龙赛罗:很奇怪罗德里犯规的画面不公开,皇马只能全力冲欧冠

懂球帝
2026-09-08 01:17:40
决不放过,空军少将刚出家门就被乱枪打成筛子,4名警卫又怎样?

决不放过,空军少将刚出家门就被乱枪打成筛子,4名警卫又怎样?

聚峰军评
2026-09-05 10:40:37
J博士:詹姆斯退役前很难评价其历史排名 布朗能成为球队核心

J博士:詹姆斯退役前很难评价其历史排名 布朗能成为球队核心

北青网-北京青年报
2026-09-08 08:45:03
2026-09-08 10:23:00
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4273文章数 1492关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

女子称"停捐后遭机构催捐嗤笑" 联合国儿童基金会致歉

头条要闻

女子称"停捐后遭机构催捐嗤笑" 联合国儿童基金会致歉

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

时尚
教育
房产
艺术
旅游

白露食白——露从今夜白,味从此时鲜

教育要闻

2026雅思托福日语备考,哪些语言学习app能根据水平和目标帮你精准提分?

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

艺术要闻

一幅分裂的古画:一边祝你升官,一边劝你放下欲望

旅游要闻

千年古道焕新生——河北邯郸道历史文化街区人气正旺

无障碍浏览 进入关怀版