网易首页 > 网易号 > 正文 申请入驻

真正的 2-bit KV Cache 来了,OSCAR 做到了一件很多人认为不可能的事

0
分享至


「以棱镜之思,折射 AI 研究的多维光谱」——学术棱镜是 CSDN 旗下 AI 科技大本营推出的精品论文栏目,专注遴选全球顶会顶刊及产业前沿的优质研究成果。我们相信,每一篇扎实的论文都是照亮技术未来的光束,而棱镜,让光芒绽放出应有的色彩。

原文作者|Zhongzhu Zhou

整理 | CC

责编 | 张红月

出品丨AI 科技大本营(ID:rgznai100)

这个五月,一篇来自 TogetherAI 和悉尼大学联合团队的论文悄然挂上了 arXiv。

标题很长:Of fline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization,缩写 OSCAR。读完的第一感受,不是「又一篇量化论 文」,而是「这件事他们真的做成了」。


论文作者: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

  • 论文:https://arxiv.org/abs/2605.17757;

  • 项目主页:https://oscar-quantize.github.io/

  • 代码:https://github.com/FutureMLS-Lab/OSCAR;

  • RotationZoo: https://huggingface.co/Zhongzhu/OSCAR-RotationZoo


那么问题来了:2-bit KV Cache,究竟难在哪里?

大模型在做长上下文推理时,每生成一个 token,都要回头读取所有历史的 Key 和 Value——这套缓存机制叫 KV Cache。上下文越长、批次越大,KV Cache 消耗的显存和带宽就越惊人。如今的长上下文模型往往支持 128K 甚至更长的窗口,服务端的瓶颈往往不是算力,而是显存被 KV Cache 撑满了。

理论上,把历史 KV 从 BF16(16-bit)压缩到 INT2(2-bit),存储量可以减少接近 8 倍。但 INT2 只有 4 个量化等级,精度极度稀疏。真正的麻烦在于,KV activation 里常常存在少数幅值极大的「异常通道」(outlier channel)。这些 outlier 一旦主导了量化的比例尺,大多数正常值就被挤压进极窄的区间,attention 分布随之漂移,模型的推理能力迅速崩溃。

Hadamard 旋转是业界常见的应对手段,通过旋转变换把 outlier 扩散到各个维度,让量化更均匀。但它有一个根本局限:它不知道模型在 attention 计算里真正依赖哪些方向。换句话说,Hadamard 旋转优化的目标是「让 KV 向量重建得更准」,而不是「让 attention 的计算结果受干扰最小」。

这两个目标,看起来相近,实际上并不等价。OSCAR 的核心贡献,正是把这个区别想清楚了。


把旋转对准 attention 真正「在意」的方向

OSCAR 的动机可以用一张图来理解(论文图 1)。它对比了 naive INT2、Hadamard-only、clip-only 和 OSCAR 在量化误差传播链路上的差异。关键发现是:原始 KV 向量的重建误差,并不能完全预测模型最终的表现;真正影响推理质量的是 attention-score KL 散度、attention block 输出的 MSE,以及后续 hidden-state 的误差传播。


图 1:为什么只看 K/V 重建误差会误导判断

OSCAR 的设计逻辑由此展开。

对 Key 而言,量化误差会进入 attention logits,即 Q 和 K 的点积 QKᵀ,因此 OSCAR 用 query covariance(QᵀQ) 构造 Key 的旋转目标,让旋转后 attention 最敏感的方向得到最好的保留。对 Value 而言,误差经注意力权重进入输出,OSCAR 则用 score-weighted value covariance(VᵀSᵀSV) 构造旋转。

这两个协方差矩阵在离线校准阶段,从少量校准样本中估计出来,为每一层、每个 attention head 生成专属的旋转矩阵和 clipping 阈值。

最终旋转矩阵写作 R = U · Hadamard · bit-reversal 三者的组合:U 将旋转方向对准 attention 敏感轴,Hadamard 分散 outlier,bit-reversal 平衡 INT2 的分组,防止某个 group 被少数通道主导。

这套设计的本质是:把量化误差推向 attention 不敏感的方向,而不是让向量数值更平滑。


从论文到上线:一整套 2-bit serving pipeline

OSCAR 的另一个值得关注的地方,是它没有停在论文层面。

很多 KV 量化工作的生命周期是:跑完实验,得出图表,发表论文。能否在真实推理框架里部署,是另一回事。

OSCAR 已经接入 SGLang,可以直接用于长上下文 serving,并非停留在实验室里的精度数字。


图 2:OSCAR 整体流程图

具体来说,在 SGLang 中,OSCAR 将 token 池划分为三段:

  • BF16 sink(64 tokens)

  • INT2 history(约 2.28 bits per element)

  • BF16 recent(256 tokens)

最前端的 sink token 和最近的 recent window 保持 BF16,分别保护 attention sink 和短期局部上下文;中间最长的历史段以旋转后的 INT2 存储。

新 token 进入 recent window,随解码推进,最老的 recent token 由一个融合的 Triton kernel 依次完成旋转、clip、量化、打包四个步骤,迁移进 INT2 history;每 4 个 2-bit 值打包进 1 个 byte。解码阶段,INT2 kernel 负责 unpack、scale/zero point 还原与浮点累加,BF16 kernel 处理 sink 和 recent,最终以 online softmax merge 合并。整套系统兼容 paged KV、radix prefix cache 和 SGLang 的 fused kernel pipeline。

这套系统设计的意义在于工程上的整体性:没有对某些层做混合精度的「选择性高精度」保留,历史 KV 的主体是统一的 INT2,只有 sink 和 recent 两个很小的窗口维持 BF16。这使得系统在 paged cache、prefix cache 和批量调度的接入上更干净,也更接近真实服务场景下的显存预算约束。


在 2-bit 下,推理能力究竟还剩多少

论文在 Qwen3-4B-Thinking、Qwen3-8B、Qwen3-32B 和 GLM-4.7-FP8 四个模型上做了系统评测,任务覆盖 GPQA、HumanEval、LiveCodeBench v6、AIME25、MATH500,最高生成长度 32K,每组设置运行 5 次取均值。

结果有几个关键节点值得单独说明。

Qwen3-4B-Thinking是整套对比里最能体现难度落差的模型:

  • BF16 基准均分 75.64;

  • TurboQuant 全层 3-bit K/V(无混合精度保护)为 31.74;

  • QuaRot-INT2 降至 1.40;naive INT2 为 0.00;

  • OSCAR 在 2.28 BPE 下达到 71.86,距离 BF16 仅差 3.78 分,相对 TurboQuant 提升 40.1 分。

这一对比需要一点背景说明。TurboQuant 是当前公认的强 baseline,它压缩的是向量本身,但没有针对 attention 的感知。这里的比较,用的是 TurboQuant 无混合精度保护的「公平设置」——也就是不借助对部分层保留高 bit 的策略。在这个前提下,TurboQuant 在小模型推理任务上的分数下滑明显。

Qwen3-8B上,OSCAR 均分 69.42,距离 BF16 的 70.84 仅差 1.42,TurboQuant 同设置为 56.88。Qwen3-32B 和 GLM-4.7-FP8 上,OSCAR 基本与 BF16 持平。

AIME25 数学推理任务另有一组专项比较,对象是 KIVI-KV2 和 Kitty(由于这两个方法缺乏 framework 支持,无法完成长上下文运行,仅取其在 32K 汇报的 AIME25 结果)。

Qwen3-8B 上,OSCAR 以 2.38 BPE 达到 66.67,基本追平 BF16 的 66.00;Qwen3-32B 上,OSCAR 达到 74.00,甚至略高于 BF16 的 72.59,同时超过 Kitty 的 69.26。

论文还在 128K 长上下文设置下,对 Qwen3-8B 和 GLM-4.7-FP8 做了 RULER-NIAH 检索测试。OSCAR 在两个模型上都保持了明显更稳定的检索性能,说明 attention-aware 旋转的保护效果不只在短评测上成立,也能抵抗超长历史中 KV 误差随序列长度累积的问题——这对真实 Agent 场景尤其关键。


系统收益:显存、速度、吞吐,三件事同时成立

精度之外,系统层面的数字同样直接。

相对 BF16 历史存储,OSCAR 减少约 8 倍 KV Cache 内存占用。在 100k 上下文、batch-size-1、full prefix-cache hit 的纯 decode 场景下,最高带来约 3 倍 decode 加速。在固定显存预算、batch size 增大时,KV footprint 的降低可以显著提升并发吞吐,job-level throughput 最高约 7 倍。


图 3:完整主结果表,多种 KV 量化方法同场对比


图 4:AIME25 32K 生成,和 KIVI / Kitty 的专项对比


图 5:100k 长上下文下的 decode / batch throughput

prefix cache 命中率的影响也单独做了测试:从 cache disabled,到 normal cache,再到接近 100% warmup replay,吞吐前沿随命中率提升逐步外扩。OSCAR 保持了标准的 paged KV 和 prefix cache 抽象,共享系统提示、多轮 Agent、工具调用循环等长前缀复用场景可以无缝受益。


图 6:prefix cache 命中率越高,吞吐前沿越往外推

这一点对长上下文 Agent 的服务提供者来说意义具体:真实 Agent workload 往往包含很长的系统提示、工具说明、历史对话和检索内容,不同请求之间存在大量共享前缀。如果 KV Cache 只能以 BF16 存储,显存很快成为瓶颈;若直接采用 naive INT2,推理链条容易失真。OSCAR 的分段设计——长历史用 INT2 降显存与带宽,关键 sink/recent 窗口用 BF16 保稳定性,再配合 prefix cache 复用共享前缀——把「能压到 2-bit」和「能上线 serving」放在同一个系统里同时解决。


一个值得注意的边界

OSCAR 的论文对 TurboQuant 的定位有一段值得引用的描述:

TurboQuant 是强通用在线向量量化方法;OSCAR 针对的是 attention-aware 的 2-bit KV serving。二者不是简单的替代关系。

论文也明确提到,未来可以将 OSCAR 的 attention-aware rotation 与 TurboQuant 更强的 codebook 结合,把压缩推向更极致的方向——这个空间目前是开放的。

从更大的图景来看,OSCAR 的工作说明了一件事:大模型推理效率的优化,不只是在量化精度上做文章,而是需要把算法设计的出发点落回到「模型真正在计算什么」上。

旋转有没有对准 attention,这个问题在 4-bit 时代影响不大,但在 2-bit 这个边界上,它决定了一个方法能不能用。

关于作者

Zhongzhu Zhou 是 TogetherAI 的 Senior Research Scientist,悉尼大学博士,研究方向为高效机器学习系统,方向覆盖 模型训推算法与系统协同设计,LLM压缩与量化。团队成员来自TogetherAI,悉尼大学以及伊利诺伊大学厄巴纳—香槟分校。

Together AI 于 2022 年 6 月创立,由苹果前高管 Vipul Ved Prakash、斯坦福大模型研究中心主任 Percy Liang、芝加哥大学副教授 Ce Zhang、Flash Attention作者 Tri Dao联合创办。


免费领 100 小时云算力|AI 科技大本营读者专属福利

适配 DeepSeek、Qwen 等主流大模型

扫码即刻领取,每月还有显卡AIPC等实物好礼抽奖

当日前 50 名送瑞幸咖啡: https://s.csdn.cn/4nPsO p

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
明日中秋节,有钱没钱,记得摆这8种吉利水果,寓意吉祥大吉大利、好运连连!

明日中秋节,有钱没钱,记得摆这8种吉利水果,寓意吉祥大吉大利、好运连连!

Lily美食谈
2026-09-24 09:38:48
乌克兰北线反攻的最新战况:战机摧毁俄军指挥部!

乌克兰北线反攻的最新战况:战机摧毁俄军指挥部!

项鹏飞
2026-09-24 20:06:11
余依婷也没想到,张雨霏只是输掉比赛后没拥抱自己,就被网友痛骂

余依婷也没想到,张雨霏只是输掉比赛后没拥抱自己,就被网友痛骂

潋滟晴方DAY
2026-09-24 21:13:00
不是迷信!八月十五中秋节,记得:1不去、2不送、3不吵、4要吃!

不是迷信!八月十五中秋节,记得:1不去、2不送、3不吵、4要吃!

简食记工作号
2026-09-21 00:18:37
泰女在台惨遭杀害,凶手昔挺“大罢免”被翻出,网友批:残忍恶心

泰女在台惨遭杀害,凶手昔挺“大罢免”被翻出,网友批:残忍恶心

海峡导报社
2026-09-23 20:26:10
3-1逆转复仇!国乒19岁1米86新星崛起:亚运决赛王皓用他战日乒?

3-1逆转复仇!国乒19岁1米86新星崛起:亚运决赛王皓用他战日乒?

李喜林篮球绝杀
2026-09-23 22:15:37
突发!温州这两人被查

突发!温州这两人被查

温百君
2026-09-24 15:48:38
辽篮快讯,莫兰德无人问津,威尔斯加盟广厦,弗格面前有两条路!

辽篮快讯,莫兰德无人问津,威尔斯加盟广厦,弗格面前有两条路!

体坛小快灵
2026-09-24 09:10:12
人老了,这3个人的家里尽量别去,特别是最后一个

人老了,这3个人的家里尽量别去,特别是最后一个

周哥一影视
2026-09-24 01:49:40
中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

中秋前后,养老金、社保和工资好消息,退休、在职和失业都受益

风干迷茫人
2026-09-23 11:14:24
聚会上班长吹嘘自己,笑我不如他,结束时我拿着账单:你付不起吗

聚会上班长吹嘘自己,笑我不如他,结束时我拿着账单:你付不起吗

牛魔王与芭蕉扇
2025-10-12 10:00:09
众星发文悼念游本昌,演员陈浩民:谢谢您让“济公”两个字,成为几代观众共同的记忆;繁花剧组:缘分常在,情义长存,爷叔再会

众星发文悼念游本昌,演员陈浩民:谢谢您让“济公”两个字,成为几代观众共同的记忆;繁花剧组:缘分常在,情义长存,爷叔再会

极目新闻
2026-09-24 13:50:57
大爷当母狗面抓走六只幼崽,隔天打麻将忘锁门,回家后愣住了

大爷当母狗面抓走六只幼崽,隔天打麻将忘锁门,回家后愣住了

世间烟火集
2026-09-11 17:28:38
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
海霞,有新身份

海霞,有新身份

政知新媒体
2026-09-24 09:22:17
百万车评女网红, 被老公在媒体群曝光出轨, 深夜牵手男性, 哨兵模式拍下立大功!

百万车评女网红, 被老公在媒体群曝光出轨, 深夜牵手男性, 哨兵模式拍下立大功!

扮猫骑老虎
2026-08-05 17:42:57
以色列总理内塔尼亚胡公开表示:我希望5年内,追上中美两国,将以色列打造成“全球第三大人工智能(AI)强国”

以色列总理内塔尼亚胡公开表示:我希望5年内,追上中美两国,将以色列打造成“全球第三大人工智能(AI)强国”

吉刻新闻
2026-09-24 07:22:13
日本网友:祝贺男团时隔60年夺冠 此时应该感谢福原爱对日乒的付出

日本网友:祝贺男团时隔60年夺冠 此时应该感谢福原爱对日乒的付出

劲爆体坛
2026-09-24 20:55:29
知名娱记曝李乃文现身日本!和儿子老婆聚餐说日语,评论区吵翻天

知名娱记曝李乃文现身日本!和儿子老婆聚餐说日语,评论区吵翻天

奇怪的鲨鱼们
2026-09-22 19:32:09
亚运会:时隔半年再负世界第10!李诗沣1-2法汉,国羽无缘横扫卫冕

亚运会:时隔半年再负世界第10!李诗沣1-2法汉,国羽无缘横扫卫冕

钉钉陌上花开
2026-09-24 19:01:24
2026-09-24 22:03:00
AI科技大本营 incentive-icons
AI科技大本营
连接AI技术的创造者和使用者
2803文章数 7736关注度
往期回顾 全部

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

头条要闻

高市飞十几小时只见特朗普35分钟 回国未见美官员送机

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

没了1400亿 新希望养猪的坑到底有多深?

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

教育
旅游
游戏
本地
房产

教育要闻

童画环翠!威海市威海卫学校红领巾讲解员为代言家乡!

旅游要闻

亲海、悦海、乐海 串联南北海洋旅游带要来了

《巫师3重制版》国区解禁时间公开!画面提升巨大

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

无障碍浏览 进入关怀版