网易首页 > 网易号 > 正文 申请入驻

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

0
分享至


KV 缓存暴降 437 倍,Agent 成本大洗牌。

作者丨高允毅

编辑丨岑 峰

刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。

这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。

但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse Attention 2(CSA2)和 low / high / max 三档可调推理力度旋钮,打破了这一潜规则。能让 DeepSeek V4.1-Flash 以极低的成本,在不少评测中,智力超越上一代 DeepSeek V4-Pro。

这套新架构把大模型的“记忆体积”压缩到了极致,运行时的显存占用直接砍掉了3/4,存进硬盘的长期记忆更是只占用上一代的1/8 。


这种降维式的成本削减,意味着百万 Token 级别的超长上下文,可以真正进入工业级的生产力阶段。

01


CED架构:把百万上下文“读薄”,

预填充算力砍半

要理解这次架构重写的含金量,必须先看看以往长文本 Agent 场景中,最烧钱的地方是哪里。

答案是预填充。

在智能体的真实运行中,无论是每一次工具调用的结果返回,还是每一轮多轮对话的推进,大模型都必须把全部上下文,从头到尾过一遍,生成 KV 缓存记忆,这个过程就叫预填充。

在百万级上下文场景中,单是这一步就能吃满整张GPU。

上一代 DeepSeek V4-Flash 使用混合注意力架构,只给预填充提了速,让AI“读得更快”,却没有减少“读得容量”

DeepSeek V4.1-Flash采用的 CED 架构可以直接预填充算力减少一半,进而将服务器硬盘上的持久缓存成本,缩减到上一代的1/8。对于调用 API 的企业而言,这意味着原本跑一次深度复杂任务需要支付 10 元的算力账单,现在直接被降维打击到了 1 到 2 元的“平民价”级别。

这是怎么做到的?

DeepSeek V4.1-Flash的神经网络一共有40层,CED 架构把40层分成了两部分。前20层,它用一套“因果编码器”把全部上下文读一遍,然后在隐状态中输出一个高度浓缩的“摘要”;后20层,它不再从头读一遍,直接通过投影矩阵,从编码器的“摘要”里生成自己需要的全局KV缓存。

这就是“先读薄”,“只捞重点”,这一招直接把预填充的计算量砍掉一半。

不过只靠“摘要”当然不够。比如写代码时,项目整体逻辑可以靠摘要理解,但在面对刚生成、需要确保绝对精准的就近内容时,就需要“滑动窗口注意力(SWA)”来盯局部细节了。

不过,这些就近的局部记忆,无法直接从编码器的摘要中复用。如果为了追求 100% 精确而将最近的上下文重新看一遍,又会算力爆炸。

为此,DeepSeek 设计了一套“有限回放”机制挑出极少数 Token,用近似值还原短期记忆。这样,可以用极低成本来复现细节。

02


CED 解决 “读得慢”,

CSA2 解决 “存不下”

如果说 CED 架构砍的是“上下文”的计算量,CSA2 架构砍的是“上下文”的存储量。

在上一代 V4-Flash 的时代,存储记忆的方式极其粗放,它采用的是 CSA+HCA 混合架构,其特质是每一层都会保留一套完整KV缓存和索引。即哪怕保存的是同一份上下文,40层神经网络,会保存40份副本,这直接导致显存爆炸。

而V4.1-Flash直接采用 CSA2 架构,实现跨层KV复用和跨层Top-K索引复用,让40层网络共用同一个副本,直接降低显存占用。

这套全新的压缩稀疏注意力机制,彻底简化了前代 CSA 的内部设计:它删掉了重复压缩区,扔掉了记录绝对位置的繁琐算法,精简了所有中间步骤。最聪明的是,它不再走独立的隐状态压缩通路,而是直接把核心记忆转换出来使用。这一套精妙的减法,让大模型在狂省显存的同时,训练和运行也变得更加简单丝滑。

为了把这套跨层复用做到极致,CSA2给每层静态分配三种运行模式:

  • Full模式擅长总结,它通读全部上下文,生成完整KV和索引,筛选出Top-K重点条目;

  • Reindex模式,不再自己去存储庞大的缓存记忆,会直接拿Full完整模式生成的完整 KV 缓存记忆,按照自己的理解,重新筛选重点;

  • Reuse模式,拿到上面的编辑,直接开始干活,完全跳过复杂的索引计算。


这样一来,在整个网络中,只有极少数层处于需要死磕的 Full 模式,大幅削减重复存储和索引计算。

如果面对的是超长上下文,还有分层稀疏索引器做进一步优化。Full模式会在扫完上下文后,圈出重点,构建浓缩索引池;后面的层只需要在这个浓缩的小池子里进行二次检索和打分。这样字数再膨胀,算力依然不涨。

在层间复用利用到极致后,V4.1-Flash还采用了 FP4 量化,把单份 KV 的体积也压下去。

针对不同周期的记忆,它直接分层对待。它把长期核心记忆(主 KV 缓存)直接砍成了极低精度的 FP4 格式,把短期就近细节(SWA-KV 缓存)保留了原汁原味的高精度(FP8),这样分层处理后,硬件运行起来变得无比简洁、省空间。

为了让大模型在长期记忆如此模糊的情况下不迷失,DeepSeek 在训练阶段就引入了量化感知训练(QAT),提前让模型使用在模糊世界里精准干活。等到了实际运行时,芯片再把它一秒还原回来做计算,精度损失几乎察觉不到。

CSA2 再叠加 FP4 后,全局单Token KV体积压到V4-Flash的1/4;再叠加CED和SWA有限回放,最终落盘的持久 KV 缓存更是直接降到了前代的 1/8。

在这份惊人的账单缩减中,整整一半的收益来自短期细节记忆用完即弃,而另一半则来自于全局长期记忆本身的架构与量化压缩。

03


创新架构,

重新定义大模型的竞争维度

作为一款主干参数 552B、外挂 196B Engram 记忆模块的模型,DeepSeek V4.1-Flash运行时输入预填充阶段仅激活 8B 参数,解码生成阶段也只激活 16B。就是这样的激活规模,在核心知识、推理、编码能力上已经追平自家上一代 1.6T 参数的旗舰 V4-Pro,部分内部留出评测甚至实现反超。

如果说对标自家旗舰还只是内部的 “以小博大”,那么在公开 Agent 基准里,它在衡量代码智能体真实工程问题解决能力的 DeepSWE v1.1 测试中,V4.1-Flash 拿到 74.2% 的通过率,一举超越 Opus-5.0 与 GPT-5.6-Sol 两款行业标杆;在网络安全智能体测试集 CyberGym 上,它更是拿下开源生态的 SOTA 成绩。


一个 Flash 级别的轻激活模型,在长序列复杂 Agent 场景下把一众顶级稠密模型甩在身后,这在过去 “参数大小决定上限” 的时代,几乎是不可想象的。

在能力大涨的另一面,是长上下文 Agent 的部署成本进一步降低。在 CED 架构与 CSA2 第二代压缩稀疏注意力配合下,全局 KV 缓存压到 V4-Flash 的 1/4,落盘持久 KV 更是只剩 1/8;上下文长度从 4K 拉伸到百万 Token,解码计算量仅上涨约 25%,几乎走平。曾经压在企业身上的显存、存储、带宽三座大山,被这套架构组合同时撬动。

有意思的是,近期唐杰团队发表的《Trace as State: Reasoning Traces as Conditional States for Long‑Context Transformers》,二者在宏观思路上有相通之处:都希望避免每一层完整重放全部上下文,通过摘要浓缩、按需调取重点来缓解长上下文压力。不过两者实现路径完全不同:V4.1‑Flash是底层网络架构重写;Trace as State属于推理阶段的外部算法,不改动模型权重。

把视线放长远,如果 CED+CSA2 这套架构骨架被行业广泛借鉴,下一代旗舰大模型未必会继续走大一统稠密 Transformer 的老路。更多会是稀疏机制、跨层复用、可控近似策略精细拼装出来的产物。

参考链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈


未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
一文读懂:开除党籍、开除军籍,代价到底有多大?

一文读懂:开除党籍、开除军籍,代价到底有多大?

向青春微调
2026-09-21 21:42:39
肯德基“首位淘汰制”再被炮轰,嫩牛五方、田园脆鸡堡一个个都下架了

肯德基“首位淘汰制”再被炮轰,嫩牛五方、田园脆鸡堡一个个都下架了

ZAKER新闻
2026-09-22 13:05:54
最后关头,特朗普正式敲定,对华100%关税落空,中方还在抛售美债

最后关头,特朗普正式敲定,对华100%关税落空,中方还在抛售美债

趣味萌宠的日常
2026-09-23 02:39:35
中国联通2026年接收138名毕业生:0本科,985+211占近九成

中国联通2026年接收138名毕业生:0本科,985+211占近九成

老满说高考
2026-09-22 21:56:55
等伊朗总统从美国回来,迎接他的不是鲜花,而是总统罢免程序?

等伊朗总统从美国回来,迎接他的不是鲜花,而是总统罢免程序?

史行途
2026-09-22 12:45:14
高市早苗乘机抵达美国纽约,没有美方高官在机场迎接;日网友锐评:到底是在向谁挥手啊

高市早苗乘机抵达美国纽约,没有美方高官在机场迎接;日网友锐评:到底是在向谁挥手啊

上观新闻
2026-09-22 18:35:38
2026年,有多少80后撑不下去了

2026年,有多少80后撑不下去了

经济学教授V
2026-09-23 19:28:40
乌克兰打掉了俄罗斯45%的炼油产能,但狠的不止数字

乌克兰打掉了俄罗斯45%的炼油产能,但狠的不止数字

子桑说
2026-09-22 18:00:04
芯片股大爆发!603803,午后垂直涨停!

芯片股大爆发!603803,午后垂直涨停!

证券时报
2026-09-23 16:30:04
16GB+1TB!小米新机官宣:9月23日,正式首发!

16GB+1TB!小米新机官宣:9月23日,正式首发!

科技堡垒
2026-09-23 11:50:29
梁家辉吐槽拍《寒战》住郭富城隔壁,凌晨四点被吵醒,以为他受重创在捶墙

梁家辉吐槽拍《寒战》住郭富城隔壁,凌晨四点被吵醒,以为他受重创在捶墙

陈意小可爱
2026-09-23 14:28:25
这5个行业,工资都发不下来了!真的很严重了

这5个行业,工资都发不下来了!真的很严重了

职场资深秘书
2026-09-18 17:19:31
华夏历史上最接近神的10个人

华夏历史上最接近神的10个人

小豫讲故事
2026-09-23 06:00:15
上海第一批上市!产量规格都可观!"每年都要吃"

上海第一批上市!产量规格都可观!"每年都要吃"

看看新闻Knews
2026-09-23 21:00:06
彻底翻车!大批用户果断关闭自动更新:手机变卡、耗电快真相揭开

彻底翻车!大批用户果断关闭自动更新:手机变卡、耗电快真相揭开

小柱解说游戏
2026-09-23 00:01:45
铁证面前,还能撤案?深扒无果、信息全封,路虎车主背景有多硬?

铁证面前,还能撤案?深扒无果、信息全封,路虎车主背景有多硬?

世界圈
2026-03-24 12:52:50
为什么没人敢去社区医院看病?真相扎心了

为什么没人敢去社区医院看病?真相扎心了

坠入二次元的海洋
2026-09-22 13:23:16
发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

发现中国一个奇怪的现象:只要有公婆帮扶的家庭,儿媳都忙着回公婆家;而公婆不帮的家庭,儿媳早已断联!

心理观察局
2026-08-01 07:10:30
大批物业集体跑路!高层住宅正在沦为“不能住的房子”

大批物业集体跑路!高层住宅正在沦为“不能住的房子”

流苏晚晴
2026-09-21 12:57:09
太难了,美国巨头撤退,浙江千人工厂原地解散!

太难了,美国巨头撤退,浙江千人工厂原地解散!

黯泉
2026-09-23 18:26:25
2026-09-23 21:55:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

焕新价17.78万起 长城猛龙PLUS力魂版与Hi4 255 Ultra上市

态度原创

房产
手机
时尚
本地
军事航空

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

手机要闻

时隔6年透明版再度回归!小米18 Pro透明特别版发布:9999元起

这些老电影里的穿搭技巧,很绝!

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版