网易首页 > 网易号 > 正文 申请入驻

少数Full Attention层如何重塑内部计算?混合线性注意力大模型中的「尖峰」与「平台」之谜首次揭开

0
分享至



Full Attention 层尚未开始计算,它前一层的激活值已提前「冲上峰值」—— 这就像演唱会主角尚未登台,观众席已提前沸腾。来自 StartLux、清华大学等机构的研究者以 Massive Activations 为探针,首次系统刻画了少数 Full Attention 层在混合线性注意力大模型中留下的「跨层痕迹」,并识别出「注意力前尖峰」(PAS)与「尖峰间平台」(ISP)两种核心形态。

兼顾线性注意力(Linear Attention)的效率与全注意力(Full Attention)的建模能力,混合线性注意力大模型(HLA LLM)已成为 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等模型采用的一条重要架构路线。然而,当两类序列混合机制被交错放进同一个深层网络,它们会如何相互影响?少数 Full Attention 层又会怎样改变前后 Linear Attention 层的激活动态?

本研究由以 StartLux 为核心的联合团队完成。StartLux 是专注全本地智能解决方案的科技企业,致力于打造可部署于个人终端的高性能人工智能系统。StartLux 携手清华大学、中国科学院大学、香港大学、悉尼大学和哥伦比亚大学的研究者,选择以 Massive Activations(MAs,大值激活)为「探针」,对这一问题展开系统研究。研究覆盖五种 Linear Attention 架构、六种混合配置、五个数据域,以及 12 个公开 HLA LLM 检查点,模型总参数量从 1.2B 横跨至 397B。



  • 论文标题:Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
  • 论文链接:https://arxiv.org/abs/2608.12149
  • Hugging Face:https://huggingface.co/papers/2608.12149
  • 代码链接:https://github.com/StartLuxLabs/Massive-Activations-HLA

Full Attention 前一层的「尖峰」

研究者首先汇总所有 Full Attention 层和注意力头接收到的注意力,选取被最多注意力头关注的 token 作为「全局 Attention Sink」,再固定该 token 沿深度追踪其 MAs 。

在 1.3B、12:1 混合比例的 M-A-P 模型上,RetNet、HGRN、GLA、DeltaNet 和 Gated DeltaNet(GDN)五种骨干呈现出一致的规律:在每个 Full Attention 层之前的连续 Linear Attention 区间内,与 Sink 相关的 MAs 总是在 Full Attention 前一层达到局部最大值。作者将这种形态命名为「注意力前尖峰」(Pre-Attention Spikes,PAS)。



五种 Linear Attention 骨干中,MAs 均在 Full Attention 之前形成尖峰。红色虚线为 Full Attention 前一层,绿色虚线为 Full Attention 层。

这一规律随后在五个数据域得到验证,在 Full Attention 前一层恰好取得前置 Linear Attention 区间最大激活值的平均比例达到 99.4%—100%,远高于随机选层时 9.1% 的期望值。

真正反直觉之处在于,尖峰并非 Full Attention 输出的产物,而是在 Full Attention 开始计算之前便已形成。换言之,Full Attention 所在位置对应的结构性印记,已经提前显现在上游残差流中。

从孤立「尖峰」到持续「平台」

当研究者固定模型骨干,只改变 24 层模型中 Full Attention 的数量,对比纯 Linear Attention、24:1、12:1、6:1、3:1 和纯 Full Attention 六种配置时,另一种形态随之浮现。

Full Attention 稀疏时,例如 24:1,PAS 像彼此分离的孤峰。随着 Full Attention 变密,例如 6:1、3:1,两个尖峰之间的 MAs 不再充分衰减,而是穿过中间的 Linear Attention 层保持高位,逐渐托起「尖峰间平台」(Inter-Spike Plateaus,ISP)。



从孤立 PAS 到 ISP 的过渡 —— 随着 Full Attention 变密,尖峰逐渐被平台连接。

定量结果清晰展示了这一趋势。在 1.3B 模型上,当混合比例从 12:1 变为 3:1,RetNet 的尖峰间保留分数从 18.8% 升至 85.4%,HGRN 则从 7.2% 升至 92.5%。全部 20 组相邻密度比较,都呈现 Full Attention 越密、尖峰间保留分数越高的趋势。

混合比例因此不只是一项效率参数,它也在塑造 MAs 沿深度展开的「时间形态」:Full Attention 稀疏时,离群值短暂而局部;变密后,离群值开始在层间驻留,彼此分离的尖峰也由此连成平台。

开源模型验证:振幅会变,节拍不变

上述规律首先来自共享训练配方的受控模型。为检验其广泛性,作者进一步分析了 Kimi Linear、Qwen3.5、Nemotron-H 和 Zamba2 的 12 个公开模型权重,规模从 1.2B 到 397B。不同模型中,均可观察到与 Full Attention 排布相对齐的 MA 组织形态。

跨模型比较中,一个差异格外清楚:层间形态比绝对幅值更加稳定。不同规模的 Qwen3.5 中,尖峰高度并不随参数量单调变化,但 PAS 与 ISP 始终紧随 Full Attention 的排布。Nemotron-H 与 Zamba2 的结果,则将这一规律从 Linear Attention 延伸至状态空间模型(SSM)与 Transformer 的混合架构。不同输入也呈现类似特点:数据域会明显改变峰值高低,但尖峰出现的位置和平台覆盖的区间总体稳定。



公开混合模型中的 MAs 轨迹。

尖峰与平台,在训练早期便已写入

这些规律是训练完成后偶然形成的,还是在预训练早期便开始出现?为观察其演化过程,作者从头训练了 340M 和 1.3B 的 24 层 GDN 模型。

答案出现得很早:340M 模型训练 10 亿 token 后已能观察到 PAS;1.3B 模型在 50 亿 token 时出现较弱前兆,100 亿 token 时形成清晰尖峰,并持续与 Full Attention 的位置对齐。改变 Full Attention 的插入位置,PAS 也随之移动。ISP 同样在训练早期出现,并随着训练推进逐步稳定。



Full Attention 层与 GDN 层的输出门控干预实验

研究者还进行了两组门控干预实验:给 Full Attention 增加逐元素输出门控,以及移除 GDN 原有的输出门控。结果呈现出明显的不对称性:前者显著压低 PAS 和 ISP 的绝对幅值,却不消除其层间组织;后者仅带来温和放大。

这组结果表明,Full Attention 的排布是 MA 动力学的主要「组织者」,GDN 门控则更多调节离群值的传播幅度。门控可以压低尖峰,却没有改变尖峰出现的层间节奏。

「写入 — 汇聚 — 消除」:

一个贯穿 PAS 与 ISP 的生命周期

研究者在一个 1.3B、12:1 的 GDN 模型中,固定同一个 Sink token 与特征维度,追踪第 12 层 Full Attention 边界前后的残差流变化。系统性离群值分析显示,PAS 对应一个紧凑的三阶段过程:

  • 写入(write)——Full Attention 的前一层在该 token— 特征坐标上形成极端值,为整个事件提供起点。
  • 汇聚(sink)—— 进入 Full Attention 后,承载该离群值的 token 从后续 query 获得不成比例的注意力,成为 Attention Sink。
  • 消除(cancel)—— 同一坐标随后出现符号相反的大幅更新,显著抵消此前写入的离群值,PAS 随之快速回落。

作者将其概括为「写入 — 汇聚 — 消除」(write—sink—cancel)。在 PAS 中,三个阶段集中发生在 Full Attention 边界附近,于是激活曲线上留下一个短促而尖锐的峰。



PAS 对应一次局部的 write—sink—cancel 过程——三步在相邻两层内连续完成。

ISP 的持续形态,则与同一生命周期中的「延迟消除」相一致:极端值形成后,符号相反的抵消更新没有立即到来,而是被推迟到更深的层。离群值因此得以穿过多个 Linear Attention 层持续存在,形成连接相邻 PAS 的平台。



ISP 对应 write—sink—cancel 生命周期中的延迟消除状态 —— 消除被推迟,MAs 穿过多层 Linear Attention 持续存在。

由此,PAS 与 ISP 可以被纳入同一个由消除时机组织的解释框架:局部、快速的消除形成 PAS,更晚发生的消除则让大值激活延伸为 ISP。随着 Full Attention 变得密集,尖峰之间的低谷逐渐被平台填平;到纯 Full Attention 的极限,尖峰与平台的区分消失,最终恢复为传统 Transformer 中横跨大部分中间层的稳定 MA 形态。

稀疏 Full Attention 配置中的局部 PAS → 密集配置中由 ISP 连接的 PAS → 纯 Full Attention 模型中的稳定 MAs

三者由此构成一条连续的形态谱系,为理解 PAS 与 ISP 提供了机制解释。

为混合架构绘制一张内部计算地图

这项研究为理解混合线性注意力大模型的内部计算提供了一张新的地图:混合比例远非一张效率配方 —— 多少层使用 Linear Attention、隔多久插入一次 Full Attention,也在组织模型内部计算的「节奏」。

Full Attention 的位置对应 MAs 在哪里形成尖峰,其密度影响离群值能够在层间保持多久;Linear Attention 的具体状态更新机制,则进一步调节 ISP 从何时开始出现。少数 Full Attention 层并非只在轮到自身时才发挥作用,它们与前后多个层中的离群值写入、传播和消除联系在一起。

离散分布的 Full Attention 会沿模型深度留下有规律的跨层痕迹;PAS、ISP 与传统 Full Attention 模型中的持续 MAs,也由此汇入同一条形态演化路径。对这条路径的理解,不仅为 Full Attention 的插入位置、混合密度和门控方式等架构选择提供了新的观察维度,也可能为模型压缩与量化带来线索:针对极端激活集中出现的层和架构边界,或许可以采用更具位置感知能力的处理策略。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
河北保定通报“家长班级群自报干部身份”:经初步核实,网传情况属实,将依规依纪严肃处理

河北保定通报“家长班级群自报干部身份”:经初步核实,网传情况属实,将依规依纪严肃处理

荔枝新闻
2026-09-03 15:56:00
欧盟市场留给我们的窗口期只剩下16个月。

欧盟市场留给我们的窗口期只剩下16个月。

流苏晚晴
2026-09-02 19:04:44
对抗组织审查,搞迷信活动,肖友华被“双开”!

对抗组织审查,搞迷信活动,肖友华被“双开”!

中国青年报
2026-09-04 02:00:12
观音持枪射击图:确实是300多年前的文物

观音持枪射击图:确实是300多年前的文物

收藏大视界
2026-09-02 16:07:16
吴刚携妻出游遭翻车!评论区全是骂声,他和陈宝国栽同一个坑

吴刚携妻出游遭翻车!评论区全是骂声,他和陈宝国栽同一个坑

乡野小珥
2026-09-04 06:29:05
今日赛事!CCTV5+郑钦文VS普丁塞娃,拿下比赛将发生三大质变!

今日赛事!CCTV5+郑钦文VS普丁塞娃,拿下比赛将发生三大质变!

梦忆之浅
2026-09-04 00:11:24
美国害怕的,可能不是华为的芯片,而是中国可再生的、低价的电力

美国害怕的,可能不是华为的芯片,而是中国可再生的、低价的电力

揽星戈
2026-09-04 00:50:00
孙宇晨紧急报案,场面彻底失控了!

孙宇晨紧急报案,场面彻底失控了!

TOP电商
2026-09-03 18:52:40
己方阵亡79人,歼敌数超过50000人!交换比达1:637?

己方阵亡79人,歼敌数超过50000人!交换比达1:637?

战风
2026-09-01 16:57:30
还没出道就火了!神似宋威龙北电新生报到引围观

还没出道就火了!神似宋威龙北电新生报到引围观

韩小娱
2026-09-03 20:38:58
中俄谈完2天不到,普京给中俄蒙管道改名,俄罗斯终于认清现实?

中俄谈完2天不到,普京给中俄蒙管道改名,俄罗斯终于认清现实?

浯江孤舟
2026-09-03 08:12:20
严重涉台错误,中国团队当场撤!韩国官方紧急切割,希望就此揭过

严重涉台错误,中国团队当场撤!韩国官方紧急切割,希望就此揭过

涵豆说娱
2026-09-04 06:14:17
赛力斯问界销量近乎腰斩,“遥遥领先”为何卖不动了?

赛力斯问界销量近乎腰斩,“遥遥领先”为何卖不动了?

大厂财经社
2026-09-02 13:22:05
冷湖——这样的废墟未来将随处可见

冷湖——这样的废墟未来将随处可见

细雨中的呼喊
2026-09-03 23:37:35
罚款5000元!事发东莞南站……

罚款5000元!事发东莞南站……

东莞好生活
2026-09-03 23:11:29
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
1973 年王玉龄受到周恩来总理接见,聊到张灵甫时总理一番谈话,让王玉龄失声痛哭

1973 年王玉龄受到周恩来总理接见,聊到张灵甫时总理一番谈话,让王玉龄失声痛哭

唠叨说历史
2026-08-15 16:22:23
芜湖两名干部通报被查,一人为主动投案

芜湖两名干部通报被查,一人为主动投案

最芜湖
2026-09-03 22:54:39
星宇股份股价连跌6天,市值一周蒸发超32亿元

星宇股份股价连跌6天,市值一周蒸发超32亿元

新京报
2026-09-03 19:04:51
太贵了!4人吃南昌拌粉花156元,辽宁游客怀疑被多收100元,看完菜单恍然大悟

太贵了!4人吃南昌拌粉花156元,辽宁游客怀疑被多收100元,看完菜单恍然大悟

火山詩话
2026-09-02 10:20:03
2026-09-04 06:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13913文章数 142729关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

游戏
房产
教育
时尚
手机

《食人鲨2》正式公布!新预告亮相 2027年发售

房产要闻

投资50亿!三亚又一重大配套,方案曝光!

教育要闻

【考试地理】火山与温泉

女人到了60岁衣服少穿大红大绿,试试这些纯色单品,高级又耐看

手机要闻

8月性价比最高入门机榜单出炉:摩托罗拉霸榜前2

无障碍浏览 进入关怀版