网易首页 > 网易号 > 正文 申请入驻

田渊栋转发!微软提出滑动窗口注意力,超过多种线性注意力方案

0
分享至

智猩猩AI整理

编辑:BugMaker

过去几年,大模型长上下文推理一直在寻找一个问题的答案。

当上下文越来越长,是否一定要牺牲模型能力,换取更低的推理成本?

传统Transformer中的全注意力机制(Full Attention)需要让每个Token关注全部历史信息,随着上下文增加,用于保存历史信息的KV Cache不断增长,推理显存和计算压力也随之上升。

为了摆脱这一限制,研究者提出了线性注意力(Linear Attention)路线,希望通过重新设计注意力计算方式,降低原本随序列长度增长的计算成本。

微软研究团队最近给出了一个反直觉结果:

可能不需要重新训练模型,不需要复杂的结构改造,只需要改变Attention计算范围,就能达到甚至超过许多线性注意力方案。

今天要介绍的这项工作来自微软的研究团队,论文《Sliding-window beats linear attention》系统比较了滑动窗口注意力(SWA)与多种线性注意力后训练方法。


实验覆盖1.3B到70B规模的大语言模型。结果显示,无需任何训练的滑动窗口注意力在11组通用知识和推理实验中9组取得最佳平均性能,在部分长上下文推理任务中,滑动窗口注意力准确率达到线性注意力方案的2到10倍

早在2024年,田渊栋参与的StreamingLLM工作就发现,大语言模型在生成过程中会对最开始几个Token产生异常高的注意力,这种现象被称为注意力汇Attention Sink

StreamingLLM利用这一现象,让模型保留前几个作为注意力汇的Token以及最近窗口Token。

微软团队进一步证明,注意力汇并不仅仅服务于流式生成场景。结合滑动窗口注意力后,它也能够超过部分线性注意力后训练方案,成为一种高效推理优化方式。

田渊栋本人也在社交平台转发这项工作,并表示这是“StreamingLLM再次发挥作用”,这一讨论也让注意力汇这一早期发现重新受到关注。


01

长上下文推理还有另一条路

随着上下文长度增加,Transformer最大的瓶颈来自自注意力机制(Self-Attention)。

在推理阶段,模型需要保存历史Token对应的Key和Value,也就是KV Cache(键值缓存)。每生成一个新Token,都需要继续维护这份不断增长的缓存。

线性注意力提出了一条完全不同的路线。

它通过重新设计注意力计算方式,降低随着序列增长带来的计算和存储压力。

但这类方法仍然存在一些现实问题。

一方面,它需要模型学习“哪些信息应该记住,哪些信息可以遗忘”。

另一方面,现有大模型和硬件优化大多围绕传统注意力机制设计,将Transformer转换为线性注意力通常需要额外训练。


此前一些工作已经证明,通过数千万甚至数十亿Token的后训练,可以让线性注意力恢复部分性能。

研究人员发现,一个更简单的方法可能被忽略了。

直接结合注意力汇机制的滑动窗口注意力,也许已经足够。

02

保留几个特殊Token,

滑动窗口注意力为什么有效

滑动窗口注意力的核心思想很简单。

模型不再关注全部历史Token,而只关注最近窗口内的信息。

例如窗口大小设置为64,当前Token只查看最近64个Token。

表面看,这似乎会损失大量信息。

Transformer经过多层堆叠后,局部窗口的信息仍然可以逐层传播,因此模型依然能够建立较远距离的信息联系。

研究发现,大语言模型经常会给最开始几个Token分配异常高的注意力,即使这些Token本身并没有重要语义。

这种异常吸收注意力的现象,就是注意力汇。

如果简单使用滑动窗口,当这些Token离开窗口后,模型性能会严重下降。

因此团队采用了一种简单策略,保留前4个Token作为注意力汇位置,同时关注最近窗口中的Token


也就是最近窗口负责局部信息。

前几个Token作为注意力汇,避免初始Token离开窗口后造成性能下降。

03

不用训练,简单调整就能

超过部分方案

为了验证这一发现,论文测试了多个主流模型,包括Phi、Mistral、Llama、Qwen等,模型规模覆盖1.3B到70B。

实验指标包括MMLU、ARC、HellaSwag、PIQA等知识推理任务。

实验结果显示,滑动窗口注意力只需要在推理阶段调整注意力掩码(Attention Mask),无需任何训练,就能达到接近甚至超过线性注意力后训练模型的效果。

在MMLU测试中,滑动窗口注意力保留了原始模型93.2%的性能。

而部分线性注意力方法需要额外进行数千万甚至数十亿Token规模的训练,才能达到类似水平。

差距更明显的是长上下文推理任务。

在Needle-in-a-Haystack任务中,模型需要在大量无关文本中找到隐藏信息。

当上下文扩展到4K时,滑动窗口注意力可以恢复Full Attention在该任务上的17.2%—23%性能。

在BABILong长上下文测试中,4K上下文下滑动窗口注意力达到15%的准确率,而LoLCATs只有3%


04

更低成本的长上下文推理方案

除了效果,论文还比较了不同注意力方案的推理速度和显存占用。

实验使用NVIDIA RTX PRO 6000 Blackwell Max-Q Workstation Edition进行测试。

结果显示,随着上下文长度增加,Full Attention速度持续下降,显存占用也线性增长。

而滑动窗口注意力在达到窗口大小后,显存基本保持稳定。

其中窗口大小为64的滑动窗口注意力拥有最低显存占用,同时保持较高解码速度。

滑动窗口注意力速度最快,并且在窗口小于512时,显存成本低于或接近线性注意力方案。


这篇论文并不是证明线性注意力没有价值。

作者也指出,线性注意力依然具有降低推理复杂度的潜力。

论文真正想回答的是,在已有大模型基础上,为了降低长上下文成本,是否真的需要重新设计Attention结构并进行额外训练

从现有实验结果看,重新设计注意力结构并非唯一选择。

滑动窗口注意力通过一个非常简单的注意力掩码修改,就实现了接近原模型能力的长上下文推理效果。

在固定较小显存成本的场景下,优先考虑带注意力汇的滑动窗口注意力方案。

不过,这项工作目前也有一定限制。

现有实验主要集中在语言模型任务,作者还没有验证更复杂的Agent任务、多模态模型以及更大规模模型上的表现。

对于长上下文大模型而言,这项工作说明:

解决注意力机制瓶颈,不一定总要重新设计模型,有时候重新思考已有结构的使用方式,同样可能带来巨大收益。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
罗德里首秀近乎零失误掌控节奏,巴萨补上最关键一环,佩德里彻底被解放

罗德里首秀近乎零失误掌控节奏,巴萨补上最关键一环,佩德里彻底被解放

体育闲话说
2026-09-07 15:52:35
北京楼市,二手房最疯狂的时刻来了。

北京楼市,二手房最疯狂的时刻来了。

金刀说房
2026-09-07 10:01:25
高兴太早!中国女篮险胜捷克,却收两大坏消息,宫鲁鸣面临下课

高兴太早!中国女篮险胜捷克,却收两大坏消息,宫鲁鸣面临下课

宗介说体育
2026-09-07 09:47:55
国乒首日1男1女出战!陈熠打响揭幕战,首轮打三天周启豪压轴出场

国乒首日1男1女出战!陈熠打响揭幕战,首轮打三天周启豪压轴出场

叮咚体坛
2026-09-07 15:07:03
输给中国女篮后,捷克教练说了一句比赢球更让人意外的话 有格局

输给中国女篮后,捷克教练说了一句比赢球更让人意外的话 有格局

星Xin辰大海
2026-09-07 11:04:08
全世界只剩2架,我国有一架,美国出3000万购买被拒

全世界只剩2架,我国有一架,美国出3000万购买被拒

疯狂的小历史
2026-09-05 10:01:05
戴笠心腹管家晚年揭露:他当年安顿胡蝶时,仅因瞥见一个小细节,就腾空整个小院

戴笠心腹管家晚年揭露:他当年安顿胡蝶时,仅因瞥见一个小细节,就腾空整个小院

饭小妹说历史
2026-09-06 09:20:03
成本21美元卖198美元,中国仿造的美军装备怎么流入美军之路

成本21美元卖198美元,中国仿造的美军装备怎么流入美军之路

有范又有料
2026-09-06 09:11:40
普京通告全球,世界最大组织诞生,中俄辛苦25年,美国劫难到了?

普京通告全球,世界最大组织诞生,中俄辛苦25年,美国劫难到了?

历史点行
2026-09-06 09:43:22
男人活多久,看脸就知道!寿命长的男人,脸一般有这6个特征

男人活多久,看脸就知道!寿命长的男人,脸一般有这6个特征

白宸侃片
2026-09-07 10:32:06
现场画面:尼泊尔泥石流中国幸存者获救瞬间曝光,其由韩国救援队救出,多次看到搜救灯光大声呼喊,意识清醒回答“我来自中国”

现场画面:尼泊尔泥石流中国幸存者获救瞬间曝光,其由韩国救援队救出,多次看到搜救灯光大声呼喊,意识清醒回答“我来自中国”

极目新闻
2026-09-07 15:19:51
英格兰公开赛首日:常冰玉收琼斯退赛大礼!丁俊晖、赵心童谨防冷门

英格兰公开赛首日:常冰玉收琼斯退赛大礼!丁俊晖、赵心童谨防冷门

球场没跑道
2026-09-07 08:21:16
突发! 机场紧急关闭, 澳航宣布: 航班全部取消! 中澳大使馆紧急提醒

突发! 机场紧急关闭, 澳航宣布: 航班全部取消! 中澳大使馆紧急提醒

澳微Daily
2026-09-07 15:54:27
2-0横扫侮辱中餐的美国名将!萨巴伦卡霸气17连胜 连续6年美网8强

2-0横扫侮辱中餐的美国名将!萨巴伦卡霸气17连胜 连续6年美网8强

风过乡
2026-09-07 08:41:16
贾玲彻底陷入死局:新片不敢上,综艺路也走不通,两头全堵死

贾玲彻底陷入死局:新片不敢上,综艺路也走不通,两头全堵死

乐悠悠娱乐
2026-09-07 10:10:12
星宇股份内部通报截图显示,因8月初对部分新入职大学生相关事项处理不当,总经理周晓萍被扣薪12个月

星宇股份内部通报截图显示,因8月初对部分新入职大学生相关事项处理不当,总经理周晓萍被扣薪12个月

张可象博士
2026-09-07 11:28:04
刘若英57岁了还开二十多万的车送娃,坐车里吃减脂餐,太自律了

刘若英57岁了还开二十多万的车送娃,坐车里吃减脂餐,太自律了

精彩背后
2026-09-07 15:26:25
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
男子坚持在APP上看视频赚钱,一年总收益136元,连续12天尝试提现失败:看了几千分钟视频、上万条广告,简直浪费时间;官方:已立案调查

男子坚持在APP上看视频赚钱,一年总收益136元,连续12天尝试提现失败:看了几千分钟视频、上万条广告,简直浪费时间;官方:已立案调查

天下泉城
2026-09-05 09:54:13
NBL香港金牛队新赛季为王俊杰报备合同

NBL香港金牛队新赛季为王俊杰报备合同

体坛周报
2026-09-07 15:47:29
2026-09-07 17:23:00
智猩猩
智猩猩
AI 技术内容与服务平台
72文章数 3关注度
往期回顾 全部

科技要闻

华为Mate XT 2起售价19999元 9月12日开售

头条要闻

美财长谈加拿大反制美:小小腊肠犬惹牧羊犬 微不足道

头条要闻

美财长谈加拿大反制美:小小腊肠犬惹牧羊犬 微不足道

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

8家中央金融企业获增资 释放什么信号?

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

健康
艺术
数码
公开课
军事航空

同样是脑梗,为何康复结局大不同?

艺术要闻

色彩很美,简约风景油画!

数码要闻

仅290g能塞进背包!磐镭WO5 3500U主机开售:锐龙5 3500U加持 到手价1359元

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版