网易首页 > 网易号 > 正文 申请入驻

前沿分享丨Jim Fan、李飞飞团队新作:机器人也能「上下文scaling」

0
分享至

转自 学术头条

过去,受限于极短的上下文窗口,机器人很快就会遗忘刚刚发生的一切。那么,机器人能不能像当前的大语言模型(LLM)一样,记住并利用更长的上下文?

针对这一问题,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授、“AI教母”李飞飞团队及其合作者,推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies),将视觉运动上下文扩展到 8K 时间步,相当于 5 分钟的“肌肉记忆”,比现有 SOTA 策略高出 3 个数量级,且不增加推理延迟。


论文链接:https://arxiv.org/abs/2607.15275

这意味着,RoboTTT 可以将一整段视频作为上下文输入,并根据人类视频进行一次性模仿。它还拥有实时“自我改进”的能力,能将修正信息纳入上下文,并在执行中不断调整动作,从而在多阶段长程任务上取得更好的表现。

研究团队表示,上下文长度将成为机器人基础模型的新 scaling 方向:使用 8K 时间步上下文训练的 RoboTTT,比使用 1K 时间步预训练的同一模型取得了 +62% 的性能提升。Jim Fan 甚至在 X 上发帖称:“很快,即使是 100 万上下文,也不再是幻想。”

面向机器人策略的长上下文建模

RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,用快速权重作为模型的循环状态。每次接收传感器输入,模型都会执行一步梯度更新,把历史信息写入权重。这样做的好处是,由于隐藏状态大小固定,机器人可以在较低开销下保留更长历史信息,并在部署后继续学习。


图|RoboTTT 的模型架构、训练和推理。

RoboTTT 主要包含三项设计,如下:

1.模型架构:RoboTTT 由视觉-语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层处理单个时间步内的信息,TTT 层加在注意力层之后,负责沿时间维度处理跨时间信息。为提高效率,模型不直接将所有视觉-语言 token 输入 TTT 中,而是使用少量 register token 在时间上传递视觉-语言信息。为保留预训练能力,TTT 输出经 Tanh Gating 后再加入注意力输出。


图|带有 Tanh Gating 的计算流程。

2.序列训练:为扩展训练上下文的长度,RoboTTT 结合了序列动作强制和截断反向传播算法。训练时,序列动作强制为每个动作块独立采样噪声水平,以稳定 flow-matching 训练;TBPTT 将长序列切分为片段,只在片段内反传梯度,但让快速权重继续跨片段传递,这样既能让 TTT 贯穿整条序列,又能把显存开销控制在片段长度范围内。


图|TBPTT。

3.长上下文约束:RoboTTT 会把部分时间步只作为上下文使用,这些时间步会写入快速权重,但不参与动作损失计算。基于这一机制,模型可以从两类上下文中学习:

  • 视频模仿:人类视频作为上下文,只更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
  • DAgger 蒸馏:完整 DAgger 轨迹都会更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失只在人类纠正动作上计算,把失败后的纠正方式写入快速权重。


图|DAgger 蒸馏。

上下文越长,性能越强

研究团队在三个长程双臂装配任务上评估了 RoboTTT。整体而言,RRoboTTT 能够利用自身更多的历史信息进行训练,除了上述更强的闭环性能之外,它仅需一段包含上下文信息的人类视频即可进行一次性模仿、实时自我改进以及对物理扰动鲁棒


图|评估任务。

1.在长程任务上持续优于基线

主评估显示,RoboTTT 的平均任务完成分数达到 79%,高于单步上下文基线 GR00T N1.7 和将 TTT 层替换为 Gated DeltaNet 的 GDN。


图|主评估:三个装配任务上的任务完成分数。

此外,RoboTTT 也是完全成功次数最多的方法,尤其是在平均约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务上,RoboTTT 是唯一完整完成任务的方法。


图|主评估:三个装配任务上的完全成功试验次数。

简单拼接过去观测并不能可靠提升表现。在 Pup Go Car(玩具车装配)任务上,加入一个历史帧的 GR00T N1.7 Hist 得分为 39.5%,低于只看当前观测的 GR00T N1.7(57%)。GDN 将历史压缩为循环状态,但没有在所有任务上带来提升。

RoboTTT 更善于跟踪任务进度、恢复错误和完成细粒度操作。在视觉相似的多阶段装配中,RoboTTT 能更好地区分当前阶段;电钻未对准螺丝时,它也会重新对齐并再次尝试;在插入、扣紧电路组件等细粒度操作中,动作也更精确。

2. 预训练上下文越长,闭环表现就越好

研究团队将预训练上下文从 128 扩展到 8K 时间步后评估发现,RoboTTT-8K 的平均任务完成分数达到 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且没有出现饱和迹象。相比而言,上下文变长后,GDN 却没有获得同样的性能提升。

研究团队认为,这一差异来自更新机制,RoboTTT 通过梯度下降更新快速权重,并学习快速权重的初始化和更新方式;GDN 则使用线性关联状态,不具备这种元学习机制。


图|闭环性能随预训练上下文长度扩展而提升。

3.one-shot 模仿与扰动鲁棒

RoboTTT 能基于上下文中的人类视频完成 one-shot 模仿。在 Circuit(电路装配任务中),机器人只能通过上下文中的人类视频判断该装配哪种电路配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为65%;GDN 没有取得完全成功,任务完成分数为 33%。


图|从上下文内人类视频进行一次性模仿。

长上下文约束也提升了扰动恢复能力。当人类在游戏过程中移除已安装的部件时,RoboTTT 会根据自身的部署情况返回并重新安装该部件。车顶被移除时,RoboTTT 的恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 的恢复率均达到 90%,也高于短上下文基线。

4.更强的即时恢复能力

RoboTTT 具备更强的即时恢复能力,并优于标准 DAgger。标准 DAgger 只在人类纠正动作上微调,平均提升9%;DAgger 蒸馏把完整轨迹作为上下文,包括次优机器人动作,但只在人类纠正动作上计算损失,平均提升 33%。通过 DAgger 蒸馏,RoboTTT 学习了一种隐式纠错算法,并能在线从自身的错误中恢复,无需人工干预。


图|DAgger 蒸馏在 Pup Go Car 上的结果。

不足与未来方向

研究团队指出,尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 scaling 轴的潜力,但仍存在一些不足。

首先,扩展训练上下文长度会增加训练成本。虽然 RoboTTT 在推理时保持成本恒定,但训练更长上下文仍需要更多开销。未来,研究人员应采用更高效的 TTT 训练技术(如 TNT)来降低这一成本。

其次,TTT 层的目标函数仍有探索空间。当前工作提出了一种将 TTT 整合进机器人基础模型的方法,但面向机器人的 TTT 层目标(类似视觉领域中的相关探索)将是一个有潜力的方向。

此外,RoboTTT 仍未覆盖部署中可能出现的全部失败模式。研究团队表示,RoboTTT 与强化学习结合,直接优化任务成功率,有望进一步提升实际执行表现。

更多技术细节,详见原论文。

作者:夏千斯

【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
幼儿园园长直言:入园不哭的孩子,多半出自这5种家庭,对照看看

幼儿园园长直言:入园不哭的孩子,多半出自这5种家庭,对照看看

小书虫妈妈
2026-09-05 17:35:32
汪小菲马筱梅带娃游广州!玥儿长发飘飘好像大S,像是来给大S复仇的

汪小菲马筱梅带娃游广州!玥儿长发飘飘好像大S,像是来给大S复仇的

八星人
2026-09-06 13:04:57
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

世界圈
2026-08-24 20:54:42
2-0淘汰斯瓦泰克,郑钦文霸气改口:上一场从0-5翻盘不是靠运气

2-0淘汰斯瓦泰克,郑钦文霸气改口:上一场从0-5翻盘不是靠运气

侧身凌空斩
2026-09-08 04:51:03
这是紫薇海陆?怎么完全认不出来了?

这是紫薇海陆?怎么完全认不出来了?

言安堂
2026-09-07 07:36:57
取消英语主科风波升级!一校长怒骂汤家凤:你是男是女,不懂英语怎么当上教授

取消英语主科风波升级!一校长怒骂汤家凤:你是男是女,不懂英语怎么当上教授

小徐讲八卦
2026-09-07 07:36:43
发现一个奇怪现象:为啥很多家庭的车都10年以上了,还不舍得换?

发现一个奇怪现象:为啥很多家庭的车都10年以上了,还不舍得换?

趣味萌宠的日常
2026-09-07 16:22:42
男人活多久,看脸就知道!寿命长的男人,脸一般有这6个特征

男人活多久,看脸就知道!寿命长的男人,脸一般有这6个特征

白宸侃片
2026-09-07 10:32:06
科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

科大讯飞出轨女主更多照片曝光:她长得娇小可爱,丈夫应该再给她一次机会

汉史趣闻
2026-09-01 13:47:29
记者暗访化妆品“地下工厂”:冒牌SK-II、赫莲娜制作窝点藏匿民宅,有人打电话冒充派出所人员威胁记者

记者暗访化妆品“地下工厂”:冒牌SK-II、赫莲娜制作窝点藏匿民宅,有人打电话冒充派出所人员威胁记者

新京报
2026-09-07 09:25:27
拥有核武器50年却不承认,联合国调查遭驱赶,数量可能比我国还多

拥有核武器50年却不承认,联合国调查遭驱赶,数量可能比我国还多

人间无味啊
2026-09-06 16:45:34
老当益壮!37岁张帅美网再进八强,成中国网球最强担当

老当益壮!37岁张帅美网再进八强,成中国网球最强担当

体坛最前线66
2026-09-08 08:28:25
71-51!中国女篮爆大冷,2连胜小组第二晋级,赛后还有1个好消息,或直通8强

71-51!中国女篮爆大冷,2连胜小组第二晋级,赛后还有1个好消息,或直通8强

体育就你秀
2026-09-08 07:53:17
无监控、无目击、无轨迹!肇事车撞伤少年后“消失”,警方凭附近卡口“半张脸”照片追凶9年揪出逃逸者!

无监控、无目击、无轨迹!肇事车撞伤少年后“消失”,警方凭附近卡口“半张脸”照片追凶9年揪出逃逸者!

扬子晚报
2026-09-08 07:49:42
14999元!iPhone Ultra我真买不起

14999元!iPhone Ultra我真买不起

手机评测室
2026-09-06 11:49:24
上海站发生重大事故!救援人员因害怕,逃离!对手弃赛火海救人

上海站发生重大事故!救援人员因害怕,逃离!对手弃赛火海救人

林子说事
2026-09-08 08:02:43
废品站最近疯了!这5种旧货身价暴涨,家里有的千万别手欠扔掉

废品站最近疯了!这5种旧货身价暴涨,家里有的千万别手欠扔掉

朗威谈星座
2026-09-08 04:01:03
比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

比尔·盖茨亲口承认:Ctrl+Alt+Delete是个错误

我是一个粉刷匠2
2026-09-07 01:06:52
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
中美俄朝韩集体出手,5国联合打日,离终极分日还差最后一把火候

中美俄朝韩集体出手,5国联合打日,离终极分日还差最后一把火候

战友老邓
2026-09-07 10:58:35
2026-09-08 09:44:49
中国人工智能学会
中国人工智能学会
中国人工智能学会网易官方账号
4273文章数 1492关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

女子称"停捐后遭机构催捐嗤笑" 联合国儿童基金会致歉

头条要闻

女子称"停捐后遭机构催捐嗤笑" 联合国儿童基金会致歉

体育要闻

郑钦文,奇迹只发生在相信奇迹的人身上

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

教育
手机
家居
旅游
军事航空

教育要闻

2026雅思托福日语备考,哪些语言学习app能根据水平和目标帮你精准提分?

手机要闻

华为Mate XTs、nova 15标准版OTA更新支持星闪音频

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

千年古道焕新生——河北邯郸道历史文化街区人气正旺

军事要闻

伊朗锡里克婚礼遭袭现场发现美武器残骸

无障碍浏览 进入关怀版