网易首页 > 网易号 > 正文 申请入驻

刚刚,DeepSeek新模型上线,长文本缓存硬盘占用暴降88%!

0
分享至


智东西
作者|毕伟豪
编辑|李水青

智东西9月10日报道,刚刚,DeepSeek正式发布DeepSeek V4.1 Flash,该模型采用全新架构,是一款552B参数的MoE模型,为DeepSeek全新模型架构系列中尺寸最小的成员,在性能上超越了包括DeepSeek V4 Pro在内的一众旗舰模型


模型开源地址:

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

论文链接:

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

同时,DeepSeek App显示已完成全新升级,整合了快速、专家和识图模式,并上线了新模型,网页端应该也已同步上新。


一、性能全面超越旗舰,定价下调

价格方面,得益于模型架构的创新,与DeepSeek V4 Flash相比,DeepSeek下调了V4.1 Flash的定价,峰谷定价机制被保留,闲时价格为高峰时段价格的一半,官方鼓励用户根据实际使用情况调整任务时间。

全新定价为闲时输入(缓存命中)0.02元、未命中1.0元、输出4.0元,高峰时段输入(缓存命中)0.04元,未命中2.0元,输出8.0元,新价格已于2026年9月10日12:00正式生效。


▲DeepSeek V4.1 Flash定价表(图源:DeepSeek)

该模型具备原生多模态视觉理解能力,采用了全新的Causal-Encoder-Decoder架构,输入和输出不对称,输入激活参数只有8B,输出激活为16B,成本显著低于已知的同尺寸模型。


▲DeepSeek-V4.1-Flash与主流前沿模型在Agentic Benchmark上的性能对比(图源:DeepSeek)

同时,在新的预训练方式和更大规模强化学习后训练的加持下,这款更小尺寸的模型在Agentic Benchmark等基准测试中超越了DeepSeek V4 Pro、GLM5.3、Kimi-K3等多款前沿旗舰模型。


▲DeepSeek-V4.1-Flash与主流前沿模型在Agentic Benchmark上的性能对比(图源:DeepSeek)

官方在公告中给出了新模型架构的设计初衷:能力上限更高、推理速度更快、吞吐更大,并且可以扩展到更大参数规模的模型

二、缓存大幅压缩,DeepSeek V4 Pro即将退场

新一代模型在KV Cache缓存效率方面有了大幅提升,与DeepSeek V4 Flash相比,V4.1 Flash对HBM的需求减少到1/4,对SSD的需求减少到1/8。DeepSeek官方称,初代模型DeepSeek V1的KV Cache是DeepSeek V4.1 Flash的437倍


▲DeepSeek在减少上下文存储方面的持续进展(图源:DeepSeek)

这一次压缩由架构、缓存精度和部署策略三方协同完成。架构上,新模型采用CSA2(压缩稀疏注意力2)机制,将全局KV缓存和Top-K索引跨层复用,每一层只保留自己的查询向量和局部注意力缓存,重复存储被大幅砍掉。

缓存精度方面,模型从训练阶段就直接用FP4格式存储全局KV缓存,官方称性能损失几乎可以忽略。部署一侧,新增SWA有界重放机制,只需重放最近的n个token,就能近似重建滑动窗口注意力(SWA)所需的状态,SWA缓存因此不必再写入SSD,持久化缓存的占用进一步压到V4 Flash的1/8。

这些设计叠加,把上下文从4K拉长到1M,单token解码FLOPs只增加约四分之一,解码成本几乎不随上下文长度增长。


▲DeepSeek-V4.1-Flash上下文长度和前代模型对比(图源:DeepSeek)

这项数字直接关系到用户账单,在Agent使用场景中,缓存命中的费用往往占比较高,KV Cache的压缩大幅降低了Agent类任务的使用成本。对需要长上下文、多轮调用的Agent工作流来说,同样的预算能跑更多的任务。

目前,DeepSeek V4.1 Flash已同步上线DeepSeek API,用户将模型名称改为deepseek-flash即可调用V4.1 Flash,旧版本模型V4 Flash与V4 Flash Vision Exp现已下线,模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将被暂时路由到V4.1 Flash。

昨日,DeepSeek方面宣布,由于在多方测试中DeepSeek V4.1 Flash的各项指标全面超越DeepSeek V4 Pro,因此DeepSeek将从北京时间9月14日12:00起有序下线V4 Pro,所有deepseek-v4-pro的请求都将被路由到新模型,按V4.1 Flash单价计费。


▲DeepSeek模型调整公告(图源:DeepSeek)

三、全力支持开源,WorkBuddy、OpenCode全量接入

除模型能力之外,DeepSeek在开源和生态方面也有一系列动作。

DeepSeek今日宣布将会全力支持开源社区进行新模型的推理适配,并尝试通过各种方式扩大部署的范围。如果用户有大规模部署的需求且具备相应的资源(2k卡GPU、有存储集群),可以与DeepSeek联系。

刚刚,DeepSeek Harness v0.1.5版本同步上线,DeepSeek V4.1 Flash模型针对DeepSeek Harness进行了专项训练和优化,用户在使用DeepSeek V4.1 Flash模型时,DeepSeek Harness新版本还支持在保留已有KV Cache的情况下更新系统提示词。

生态侧,腾讯(WorkBuddy、CodeBuddy等)和OpenCode作为官方合作伙伴,现已全量接入DeepSeek V4.1 Flash,OpenCode Go套餐提供了4倍使用额度。


▲OpenCode模型使用额度表(图源:OpenCode)

WorkBuddy中同样提供限时两周的独家优惠,腾讯云TokenHub、ima、Marvis、CodeBuddy同步接入DeepSeek V4.1 Flash。而在此前路透社关于DeepSeek融资的相关报道中,腾讯正是DeepSeek投资人之一。


同期开源的还有DeepJIT,一个轻量级的xPU内核JIT编译库,同时支持NVIDIA CUDA GPU和华为昇腾NPU两大后端,为推理侧的内核编译提供统一接口和跨节点共享缓存能力。

结语:最小模型反超旗舰,推理成本持续下降

DeepSeek V4.1 Flash这款模型,在用全新架构将成本压低的同时,用更大规模的强化学习将智能水平拉高,以更小的尺寸在自家产品线上完成了对旗舰的全面超越。

对高频使用Agent的用户来说,缓存压缩和价格的降低叠加,实际账单的变化会比基准分数体感更强。

从更长的时间线看,官方宣称新架构可扩展到更大参数的模型,我们或可期待一下即将到来的DeepSeek全新旗舰模型。

可以看到,DeepSeek的产品线正围绕新架构重新排序。V4 Pro的有序下线只是这次更替的开始,后续更大参数的模型能把前沿模型的性价比推到什么程度,值得期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
越扒越精彩!星宇90%都是临时工,副总经理也暴雷,人社局再出手

越扒越精彩!星宇90%都是临时工,副总经理也暴雷,人社局再出手

乐天闲聊
2026-09-09 18:44:29
官媒发文,高调宣布57岁王菲喜讯,与谢霆锋分手传闻早已真相大白

官媒发文,高调宣布57岁王菲喜讯,与谢霆锋分手传闻早已真相大白

秋姐居
2026-09-10 14:26:08
微博CEO紧急回应:新浪行政水军去帮消防灭火了

微博CEO紧急回应:新浪行政水军去帮消防灭火了

南方都市报
2026-09-10 15:15:09
两地同日迎来新任代市长

两地同日迎来新任代市长

上观新闻
2026-09-10 14:18:25
私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款真相终于大白?官方正式宣布,54岁韩红身份迎来转变

潋滟晴方DAY
2026-09-09 19:24:21
“吊瓶班”学生无一人考上一本:表演式努力骗人骗己

“吊瓶班”学生无一人考上一本:表演式努力骗人骗己

兵卒史
2026-09-10 10:59:48
韩媒放话:汉字是亚洲瑰宝,并非中国独有,将实施全民汉字教育,背后隐藏的小心思

韩媒放话:汉字是亚洲瑰宝,并非中国独有,将实施全民汉字教育,背后隐藏的小心思

王新喜
2026-09-07 23:38:09
摊牌了!9月2号,委内瑞拉代总统刚把中国石油拱手送美,转头又甩出个狠话

摊牌了!9月2号,委内瑞拉代总统刚把中国石油拱手送美,转头又甩出个狠话

扶苏聊历史
2026-09-09 15:35:05
40岁的二婚青楼女嫁宋霭龄23岁长子,用10年时间,让宋霭龄接纳她

40岁的二婚青楼女嫁宋霭龄23岁长子,用10年时间,让宋霭龄接纳她

磊子讲史
2026-06-29 17:26:12
历史上最无耻的总统!特朗普终于承认操控股市,美国内部炸开锅

历史上最无耻的总统!特朗普终于承认操控股市,美国内部炸开锅

老范谈史
2026-09-09 17:19:09
俄专家一针见血,中国若要对日本动手,中国只有两个选择!

俄专家一针见血,中国若要对日本动手,中国只有两个选择!

阿嘵田侃故事
2026-09-10 07:18:38
马姆达尼往美国人心上扎一刀,反证川普的移民政策才是挽救美国的关键之举

马姆达尼往美国人心上扎一刀,反证川普的移民政策才是挽救美国的关键之举

壹家言
2026-09-10 09:36:28
刘翔在玩一场“烧钱的自证”

刘翔在玩一场“烧钱的自证”

牛角说
2026-09-10 13:53:07
房价跌幅梯队排名

房价跌幅梯队排名

张可象
2026-09-10 10:32:18
警方回应港铁36人集体冲闸 :案件已跟进

警方回应港铁36人集体冲闸 :案件已跟进

中国能源网
2026-09-09 11:14:18
iPhone 18 Pro Max可能是今年最值得买的Pro Max手机了

iPhone 18 Pro Max可能是今年最值得买的Pro Max手机了

刘奔跑
2026-09-10 07:07:16
越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

平老师666
2026-09-08 21:41:14
波多黎各主帅调侃:能否把张子宇送到波多黎各,跟我们打打球

波多黎各主帅调侃:能否把张子宇送到波多黎各,跟我们打打球

懂球帝
2026-09-10 02:46:39
手机涨价的闹剧:8天过山车,4499到5499再降价4399背后乱象!

手机涨价的闹剧:8天过山车,4499到5499再降价4399背后乱象!

时尚的弄潮
2026-09-09 05:51:06
多问一嘴真的能改变命运!网友:真心佩服这种脑子灵光转得快的人

多问一嘴真的能改变命运!网友:真心佩服这种脑子灵光转得快的人

夜深爱杂谈
2026-09-09 20:42:11
2026-09-10 17:24:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12577文章数 117167关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

"梅姨"儿媳发声:七八年前她最后一次回来 户口还在村里

头条要闻

"梅姨"儿媳发声:七八年前她最后一次回来 户口还在村里

体育要闻

一年丢掉的积分排名,郑钦文用18天找回来

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

445匹大马力+全场景智驾 新世代宝马X5曝光/2027年上市

态度原创

本地
旅游
游戏
公开课
军事航空

本地新闻

拼假 13 天国内长线路线合集

旅游要闻

百万消费券+票根经济,六安金秋文旅“宠客”诚意拉满

索尼砍小岛新作 却资助《星鸣特攻》 玩家:决策太混乱

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版