网易首页 > 网易号 > 正文 申请入驻

DeepSeek-V4-Flash 正式版开源,极限量化,本地部署成本骤降

0
分享至


DeepSeek-V4-Flash-0731

你梁哥还是你梁哥

DeepSeek-V4-Flash 正式版发布并同步开源了

保留 DeepSeek-V4-Flash-Preview 相同模型结构和参数规模情况下,重新做了后训练(针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务),多项基准就超越了三个月前的 V4-Pro 预览版


在大家卷参数量(万亿参数已经常态了)的时候,DeepSeek 又选择了一个巧妙的方向(后训练)并证明了可行

Artificial Analysisi 的大模型智能指数与单任务成本对比图上,横轴是完成一次任务的成本,越往左越便宜;纵轴是模型智能得分,越往上能力越强

所以,一款理想模型应该尽量靠近左上角:既便宜,又聪明;DeepSeek-V4-Flash-0731(Max)所处的位置那两条虚线,被网友称为 DeepSeek 斩杀线


我最关注的自然还是本地部署,企业级应用,本地模型几乎是必选

GLM-5.2、Kimi-K3 都很好,但是它们参数量太大了,部署成本也离谱

DeepSeek-V4-Flash-0731 只有 304B,原生 8-bit 精度,模型文件只有 167GB

诶?我怎么用了只有俩字。。。


vLLM 原版部署

官方版本的本地部署,首推 vLLM,不过要先升级到 v0.25 以上

依然挑卡,英伟达也必须是 Hopper 架构或 Blackwell 架构


vLLM recipe 里还有 H200 单机 PD 分离的方案(4 卡 prefill + 4 卡 decode,Mooncake 或 Nixl 传 KV cache),做推理集群的可以去翻

量化版本地部署

量化之神 Unsloth 量化版本的 GGUF 也来了


DeepSeek-V4-Flash 有点特殊,大家看压缩比例Q4 也没能把权重文件降低多少


官方 checkpoint、UD-Q8_K_XL、UD-Q4_K_XL 和第三方量化的权重构成对比

DeepSeek-V4-Flash 做了量化感知训练(QAT),官方 checkpoint 里那些 routed experts 占了整个模型96%,本来就是用 MXFP4 存的,剩下 4% 是 FP8 或 BF16

GGUF 的 MXFP4 恰好就是同一个格式,所以 Unsloth 做的事情不是「压缩」,而是逐位重打包:专家权重一个 bit 都不动,FP8 反量化到 BF16 也是零舍入

这里有个很反直觉的结论:不是所有人做的 4bit 都一样

同样 4bit 档,Unsloth 的 UD-Q4_K_XL 只把非专家那 4% 压到 Q8_0,专家部分保持逐位精确;而某些第三方转换把专家重新量化到 Q4_K,文件反而更大(164.6GB)、质量还更差(KLD 0.029)


量化质量与体积的关系:UD-Q8_K_XL 是唯一的无损点,UD-Q4_K_XL 在同尺寸档位上质量最优

几个关键数字放一起看:

版本

体积

PPL

KL 散度

top-token 一致率

官方原版(基准)

156.4GB

0

100%

UD-Q8_K_XL

161.9GB

≈0(无损)100%

UD-Q4_K_XL

155.1GB

96.28%

bartowski MXFP4

156.0GB

96.18%

antirez Q4KExperts-F16

164.6GB

93.94%

antirez IQ2XXS

86.7GB

77.92%

UD-Q8_K_XL 的困惑度和官方原版完全相同,小数点后四位一模一样,这在量化里基本见不到

顺手补一句:Unsloth 说他们试过把部分 tensor 用 Q8_0 和 F16 存,结果有损,因为 DeepSeek 做 QAT 就是为了让 MXFP4/FP8 这条路走得通,所以那些 tensor 只能老老实实留 BF16

13 个档位到底怎么选

Unsloth 一共放了 13 个档位,这张曲线图能一眼看出断点在哪:


DeepSeek-V4-Flash 全部量化档位的质量与体积曲线,Q4 到 Q8 之间几乎是垂直下降

我的判断和官方推荐不完全一样

官方推荐 UD-IQ3_XXS,理由是 103GB 能塞进 128GB 内存的机器,这个推荐没错,但看曲线你会发现:从 UD-Q4_K_XL 的 0.0094 掉到 UD-IQ4_XS 的 0.0747,质量差了 8 倍,体积只省了 18GB;再往下到 IQ3_XXS,KL 散度直接是 Q4 的 25 倍

原因就是前面那件事:这个模型的 4bit 是「官方原生的 4bit」,不是「从 16bit 压出来的 4bit」,低于 4bit 才开始真正动专家权重,一动就崩

所以我的选择顺序是:

  • 内存/显存169GB 以上→ 直接 UD-Q8_K_XL,无损

  • 162GB 左右→ UD-Q4_K_XL,只差 0.0102 KLD,实际用起来感知不到

  • 128GB→ UD-IQ3_XXS 是退让方案,能用

  • 128GB 以下→ 我建议别折腾了,去用 API

官方给的内存门槛表(含 KV cache 和上下文分配的余量):

1-bit

2-bit

3-bit

4-bit(接近无损)

Q8_K_XL(无损)

92GB

102GB

110-135GB

162GB

169GB

注意这里的单位是总内存(RAM + VRAM,或者统一内存),Mac 用户可以直接对着自己的统一内存容量看

怎么跑

先编译 llama.cpp,没 GPU 就把-DGGML_CUDA=ON改成OFF,Apple Metal 也是改成OFF(Metal 默认开):

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp

最省事的跑法,像ollama run一样直接拉:

export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0

不过这个下载过程很慢,一百多 G 建议手动下,按档位过滤别把整仓库拖下来:

hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-Q8_K_XL*"

思考档位的开关是这次的重点,三种写法都给你:

--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'

llama.cpp 现在也支持--reasoning on/--reasoning off了,Windows PowerShell 用户注意引号得转义成"{\"enable_thinking\":false}"

采样参数照官方来:temperature = 1.0,top_p = 1.0,agentic 场景换成top_p = 0.95;如果开 Think Max,上下文至少给到384K,不然思考没写完就被截断了

嫌命令行麻烦的可以用 Unsloth Studio,Mac / Windows / Linux 都能跑,界面右侧直接切 Non-think / High / Max:


DeepSeek-V4-Flash-0731 在 Unsloth Studio 中运行,右上角可以切换思考档位

curl -fsSL https://unsloth·ai/install·sh | sh
unsloth studio -H 0.0.0.0 -p 8888

有个坑得提醒:DeepSeek 这次官方没给 Jinja 格式的 chat template,只提供了一个encoding文件夹让你自己写编码脚本,Unsloth 补了一版 jinja 模板,拿 4000 多轮对话对齐官方基线,还把工具调用时被丢掉的reasoning_content加回来了

所以下别人的 GGUF 之前,先确认对方有没有处理模板和 MXFP4 重打包这两件事,不然「能跑」和「跑对」是两回事

总结

写到最后,我反而觉得,DeepSeek-V4-Flash 最值得讨论的,并不是又赢了几个榜单,也不是把成本压到了什么位置

DeepSeek 真正厉害的地方,是它一直在探索不同的路

大家都在堆参数,它去做架构创新;大家开始追求万亿参数,它又用后训练告诉我们:模型结构和参数量不变,依然可以把能力提升一大截。更重要的是,每次验证了一条新路线,它没有只把结果留在自己的 API 里,而是选择开源,让所有人都能研究、部署、复现,甚至继续往前走

这对企业尤其重要,说到底还是看成本

企业需要的从来不只是一个榜单第一的模型,而是一个能力足够强、成本可以接受、能够本地部署、技术路线相对透明,并且可以长期掌握在自己手里的模型

GLM、Kimi、Qwen 都在快速进步,但 DeepSeek 依然在不断刷新我们对国产模型能力边界的认知

我最近已经取消了 Codex Pro,越来越多编程、Agent 任务转到国产模型上。说实话,切换之前我也担心会不会明显降级,但实际用下来,并没有想象中的不适,很多任务甚至已经感觉不到差距

DeepSeek 最伟大的贡献,或许并不是给出了某一个标准答案,而是一次次证明:大模型还有很多路可以走,而且这些路,中国团队也能走在前面

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

炸裂!曝女局长婚内与9人有染,聊天内容毁三观,女局长频繁主动挑逗

小鋭有话说
2026-10-10 11:25:02
那天下跪的乘务员,是我

那天下跪的乘务员,是我

普陀动物世界
2026-10-11 00:10:00
美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

美国71岁男子长相酷似爱泼斯坦,长期被网友认为“爱泼斯坦没有死”,无奈赴以色列鉴定DNA,力证自己“完全不是”

极目新闻
2026-10-10 14:46:03
买用户可以自由批评的车

买用户可以自由批评的车

吐槽青年
2026-10-09 21:54:10
赵福刚被美国禁止入境,后续来了

赵福刚被美国禁止入境,后续来了

环球时报国际
2026-10-10 08:02:20
开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

开始查普通医生!中纪委划4条红线,第1种直接被点名,第3种常见

职场资深秘书
2026-10-09 15:14:01
中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

中超争议判罚!杨明洋踢人逃红,王秋明面部被踹出血,媒体人热议

奥拜尔
2026-10-10 20:16:31
目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

目前的中国股市想要逢低建仓,那就买这两种股票,赚到盆满钵满!

股经纵横谈
2026-10-10 22:27:01
新疆发布评尊界刹车断裂风波

新疆发布评尊界刹车断裂风波

小南看车
2026-10-10 22:27:28
超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

超强厄尔尼诺已正式形成!专家:暖冬基本确定,明年夏天可能更热

小强热线
2026-10-09 21:27:18
大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

大闸蟹全线崩盘?卖到“地板价”:雌蟹只要五六元,三两的蟹只卖10元

华庭讲美食
2026-10-11 01:54:37
程福波到中国移动调研

程福波到中国移动调研

政知新媒体
2026-10-10 12:38:01
加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

政知新媒体
2026-10-10 07:51:17
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

格斗社
2026-10-10 22:07:58
呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

呼声持续高涨!给企退人员发生活补贴,弥补历史上的待遇差距

百科密码
2026-10-10 16:47:24
果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

果然被岩屋毅说中了:中日缠斗到今天,日本出口额不如中国一个省

麓谷隐士
2026-10-10 00:10:04
女商务局长与前夫及九个情人的狗血剧情,够无耻

女商务局长与前夫及九个情人的狗血剧情,够无耻

雨秋闲话
2026-10-10 14:14:53
皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

皇马TV:肮脏的内格雷拉联赛,皇马赢了完全是场史诗般的胜利

懂球帝
2026-10-11 05:47:11
高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

人生录
2026-10-09 16:01:05
2026-10-11 07:12:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11198关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

头条要闻

港媒:梅艳芳骨灰被盗三个月无线索 歌迷会公开求助

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

健康
亲子
家居
房产
游戏

痘坑留下后,还能填平吗?

亲子要闻

工程车小故事 :分糖果

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

海棠湾销冠再出牌:海南顶豪「终局答案」,突然砸出!

慢节奏成最大卖点!暴雪揭秘《魔兽:无限》吸粉真相

无障碍浏览 进入关怀版