随手先关注,不错过每日AI热讯速递
①
9 月 10 日,DeepSeek 正式发布DeepSeek-V4.1-Flash。它是官方全新架构家族里尺寸最小的成员,原生支持视觉理解,调用名统一为deepseek-flash[1]。
相比 9 月上旬内测阶段流出的碎片信息,官方这次一次性公开了模型结构、缓存压缩方案、基准成绩与 API 定价,并在 Hugging Face 放出权重与技术报告[1][3]。
配套动作同样激进:V4-FlashV4-Flash-Vision-Exp已经下线,旗舰V4-Pro也进入有序下线流程。
自北京时间9 月 14 日 12:00起,所有 deepseek-v4-pro 请求将被路由到 V4.1-Flash,并按后者的单价计费[1][4]。
![]()
图:分组柱状图对比 V4.1-Flash 与 Kimi-K3、GLM-5.3、Opus5、GPT5.6-Sol 在多项智能体与安全类基准上的得分(来源:DeepSeek 官方发布页[1])
②
V4.1-Flash 最核心的变化在架构。它采用Causal Encoder-Decoder结构,属于 MoE(混合专家结构,每次只调用其中一部分参数)模型。
主干552B参数,但输入(预填充)阶段只激活8B参数、输出(解码)阶段激活16B参数[1]。
官方把这一设计称为非对称架构。技术报告给出的动因很直接:长时程智能体让负载越来越偏向输入,预填充与百万级上下文留下的 KV Cache 会同时挤压 HBM 与 SSD 的容量和带宽[3]。
KV Cache(模型推理时为已处理上下文保存的中间结果,命中缓存能跳过重复计算,代价是它本身要占用显存与硬盘),正是这一代压缩的重点。
于是压缩缓存成了这一代的重头戏。与上一代相比,KV Cache 对HBM的需求降到1/4、对SSD的持久化占用降到1/8[1][3]。
按技术报告口径,全局缓存占用为890 字节/Token,约为 V4-Flash 的四分之一[3]。
![]()
图:横向柱状图对比 DeepSeek-V1、V3.2、V4-Flash 与 V4.1-Flash 的每 Token 全局 KV Cache 占用,最下方 V4.1-Flash 的柱条明显最短(来源:DeepSeek 官方发布页[1])
③
成绩单方面,Terminal-Bench 2.1上 V4.1-Flash 得90.6分,高于 Claude Opus 5 的 89.1 分与 GPT-5.6 Sol 的 88.8 分[2]。
DeepSWE v1.1上它得74.2分,Opus 5 为74.0分;Automation-Bench54.8分[2]。
官方定位是能力上限更高、推理更快、吞吐更大,并可扩展到更大参数规模[1]。
技术报告补充说,模型在45T Token的多模态语料上预训练,上下文支持到1M Token[3]。
MarkTechPost 的关注点落在部署侧:权重以MIT协议开源,提供 vLLM、SGLang、Transformers 三条路径;除 552B 主干参数外,还带有 196B Engram 参数[2]。
The Decoder 指出,这次的 API 价格与 V4-Flash 档位持平[5]。
④
定价上,deepseek-flash 的缓存命中输入为闲时 0.003 美元、高峰 0.006 美元每百万 Token;输出为闲时0.6美元、高峰1.2美元。
作为对照,deepseek-v4-pro 的缓存命中输入是 0.022 与 0.044 美元,输出是 1.98 与 3.96 美元闲时费率是高峰的一半[4]。
高峰时段为 UTC 周一至周五的 01:00-04:00 与 06:00-10:00,其余时间都算闲时[4]。
有一处口径需要分清。官方称多方测试显示 V4.1-Flash 在性能、费用、速度与总用时上均领先 V4-Pro,因此计划下线后者:
「Tests by multiple parties put V4.1-Flash ahead of V4-Pro on performance, cost, speed & total runtime.」
——多方测试显示,V4.1-Flash 在性能、费用、速度与总用时上都领先 V4-Pro[1]。
但公布的分数并非全项领先。GPQA Diamond上 V4.1-Flash 为90.9分,低于 Opus 5 的 93.4 分与 GPT-5.6 Sol 的 94.1 分[2]。
技术报告也承认,在 Terminal-Bench 4.0 这类需要专家级知识的任务上仍有差距[3]。
报告还自曝:在限制联网、清除 Git 历史的防护下,仍观察到模型在评测中反编译 Ubuntu 核心包寻找漏洞,官方呼吁社区在下一代基准设计中优先识别与缓解这类行为[3]。
另外两点值得留意:官方点名WorkBuddy(含 CodeBuddy)OpenCode为官方合作伙伴,现已全面支持V4.1-Flash[1];deepseek-flash 的并发上限为2500,而 v4-pro 是500[4]。
这轮更新把便宜地跑长任务又往前推了一步。
我这边从昨晚到现在一直在实测项目,确实速度和性价比非常之高!你的智能体工作流准备切到 V4.1-Flash 了吗?欢迎在评论区聊聊实测体验。
参考来源:
[1] DeepSeek-V4.1-Flash: Smarter, Faster, More Efficienthttps://api-docs.deepseek.com/news/news260910
[2] DeepSeek AI Released DeepSeek-V4.1-Flash with 1M Context, FP4 KV Cache, and Cross-Layer Attention Reusehttps://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/
[3] DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compressionhttps://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/resolve/main/DeepSeek_V41_Tech_Report.pdf
[4] Models & Pricinghttps://api-docs.deepseek.com/quick_start/pricing
[5] New Deepseek model V4.1-Flash cuts memory needs for AI agentshttps://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents/
欢迎分享、点赞、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.