网易首页 > 网易号 > 正文 申请入驻

DeepSeek-V4-Flash 正式版开源,极限量化,本地部署成本骤降

0
分享至


DeepSeek-V4-Flash-0731

你梁哥还是你梁哥

DeepSeek-V4-Flash 正式版发布并同步开源了

保留 DeepSeek-V4-Flash-Preview 相同模型结构和参数规模情况下,重新做了后训练(针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务),多项基准就超越了三个月前的 V4-Pro 预览版


在大家卷参数量(万亿参数已经常态了)的时候,DeepSeek 又选择了一个巧妙的方向(后训练)并证明了可行

Artificial Analysisi 的大模型智能指数与单任务成本对比图上,横轴是完成一次任务的成本,越往左越便宜;纵轴是模型智能得分,越往上能力越强

所以,一款理想模型应该尽量靠近左上角:既便宜,又聪明;DeepSeek-V4-Flash-0731(Max)所处的位置那两条虚线,被网友称为 DeepSeek 斩杀线


我最关注的自然还是本地部署,企业级应用,本地模型几乎是必选

GLM-5.2、Kimi-K3 都很好,但是它们参数量太大了,部署成本也离谱

DeepSeek-V4-Flash-0731 只有 304B,原生 8-bit 精度,模型文件只有 167GB

诶?我怎么用了只有俩字。。。


vLLM 原版部署

官方版本的本地部署,首推 vLLM,不过要先升级到 v0.25 以上

依然挑卡,英伟达也必须是 Hopper 架构或 Blackwell 架构


vLLM recipe 里还有 H200 单机 PD 分离的方案(4 卡 prefill + 4 卡 decode,Mooncake 或 Nixl 传 KV cache),做推理集群的可以去翻

量化版本地部署

量化之神 Unsloth 量化版本的 GGUF 也来了


DeepSeek-V4-Flash 有点特殊,大家看压缩比例Q4 也没能把权重文件降低多少


官方 checkpoint、UD-Q8_K_XL、UD-Q4_K_XL 和第三方量化的权重构成对比

DeepSeek-V4-Flash 做了量化感知训练(QAT),官方 checkpoint 里那些 routed experts 占了整个模型96%,本来就是用 MXFP4 存的,剩下 4% 是 FP8 或 BF16

GGUF 的 MXFP4 恰好就是同一个格式,所以 Unsloth 做的事情不是「压缩」,而是逐位重打包:专家权重一个 bit 都不动,FP8 反量化到 BF16 也是零舍入

这里有个很反直觉的结论:不是所有人做的 4bit 都一样

同样 4bit 档,Unsloth 的 UD-Q4_K_XL 只把非专家那 4% 压到 Q8_0,专家部分保持逐位精确;而某些第三方转换把专家重新量化到 Q4_K,文件反而更大(164.6GB)、质量还更差(KLD 0.029)


量化质量与体积的关系:UD-Q8_K_XL 是唯一的无损点,UD-Q4_K_XL 在同尺寸档位上质量最优

几个关键数字放一起看:

版本

体积

PPL

KL 散度

top-token 一致率

官方原版(基准)

156.4GB

0

100%

UD-Q8_K_XL

161.9GB

≈0(无损)100%

UD-Q4_K_XL

155.1GB

96.28%

bartowski MXFP4

156.0GB

96.18%

antirez Q4KExperts-F16

164.6GB

93.94%

antirez IQ2XXS

86.7GB

77.92%

UD-Q8_K_XL 的困惑度和官方原版完全相同,小数点后四位一模一样,这在量化里基本见不到

顺手补一句:Unsloth 说他们试过把部分 tensor 用 Q8_0 和 F16 存,结果有损,因为 DeepSeek 做 QAT 就是为了让 MXFP4/FP8 这条路走得通,所以那些 tensor 只能老老实实留 BF16

13 个档位到底怎么选

Unsloth 一共放了 13 个档位,这张曲线图能一眼看出断点在哪:


DeepSeek-V4-Flash 全部量化档位的质量与体积曲线,Q4 到 Q8 之间几乎是垂直下降

我的判断和官方推荐不完全一样

官方推荐 UD-IQ3_XXS,理由是 103GB 能塞进 128GB 内存的机器,这个推荐没错,但看曲线你会发现:从 UD-Q4_K_XL 的 0.0094 掉到 UD-IQ4_XS 的 0.0747,质量差了 8 倍,体积只省了 18GB;再往下到 IQ3_XXS,KL 散度直接是 Q4 的 25 倍

原因就是前面那件事:这个模型的 4bit 是「官方原生的 4bit」,不是「从 16bit 压出来的 4bit」,低于 4bit 才开始真正动专家权重,一动就崩

所以我的选择顺序是:

  • 内存/显存169GB 以上→ 直接 UD-Q8_K_XL,无损

  • 162GB 左右→ UD-Q4_K_XL,只差 0.0102 KLD,实际用起来感知不到

  • 128GB→ UD-IQ3_XXS 是退让方案,能用

  • 128GB 以下→ 我建议别折腾了,去用 API

官方给的内存门槛表(含 KV cache 和上下文分配的余量):

1-bit

2-bit

3-bit

4-bit(接近无损)

Q8_K_XL(无损)

92GB

102GB

110-135GB

162GB

169GB

注意这里的单位是总内存(RAM + VRAM,或者统一内存),Mac 用户可以直接对着自己的统一内存容量看

怎么跑

先编译 llama.cpp,没 GPU 就把-DGGML_CUDA=ON改成OFF,Apple Metal 也是改成OFF(Metal 默认开):

apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp

最省事的跑法,像ollama run一样直接拉:

export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0

不过这个下载过程很慢,一百多 G 建议手动下,按档位过滤别把整仓库拖下来:

hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-Q8_K_XL*"

思考档位的开关是这次的重点,三种写法都给你:

--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'

llama.cpp 现在也支持--reasoning on/--reasoning off了,Windows PowerShell 用户注意引号得转义成"{\"enable_thinking\":false}"

采样参数照官方来:temperature = 1.0,top_p = 1.0,agentic 场景换成top_p = 0.95;如果开 Think Max,上下文至少给到384K,不然思考没写完就被截断了

嫌命令行麻烦的可以用 Unsloth Studio,Mac / Windows / Linux 都能跑,界面右侧直接切 Non-think / High / Max:


DeepSeek-V4-Flash-0731 在 Unsloth Studio 中运行,右上角可以切换思考档位

curl -fsSL https://unsloth·ai/install·sh | sh
unsloth studio -H 0.0.0.0 -p 8888

有个坑得提醒:DeepSeek 这次官方没给 Jinja 格式的 chat template,只提供了一个encoding文件夹让你自己写编码脚本,Unsloth 补了一版 jinja 模板,拿 4000 多轮对话对齐官方基线,还把工具调用时被丢掉的reasoning_content加回来了

所以下别人的 GGUF 之前,先确认对方有没有处理模板和 MXFP4 重打包这两件事,不然「能跑」和「跑对」是两回事

总结

写到最后,我反而觉得,DeepSeek-V4-Flash 最值得讨论的,并不是又赢了几个榜单,也不是把成本压到了什么位置

DeepSeek 真正厉害的地方,是它一直在探索不同的路

大家都在堆参数,它去做架构创新;大家开始追求万亿参数,它又用后训练告诉我们:模型结构和参数量不变,依然可以把能力提升一大截。更重要的是,每次验证了一条新路线,它没有只把结果留在自己的 API 里,而是选择开源,让所有人都能研究、部署、复现,甚至继续往前走

这对企业尤其重要,说到底还是看成本

企业需要的从来不只是一个榜单第一的模型,而是一个能力足够强、成本可以接受、能够本地部署、技术路线相对透明,并且可以长期掌握在自己手里的模型

GLM、Kimi、Qwen 都在快速进步,但 DeepSeek 依然在不断刷新我们对国产模型能力边界的认知

我最近已经取消了 Codex Pro,越来越多编程、Agent 任务转到国产模型上。说实话,切换之前我也担心会不会明显降级,但实际用下来,并没有想象中的不适,很多任务甚至已经感觉不到差距

DeepSeek 最伟大的贡献,或许并不是给出了某一个标准答案,而是一次次证明:大模型还有很多路可以走,而且这些路,中国团队也能走在前面

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
勇士5年1.1亿美元续约波杰!ESPN评级为B-:合同年限拉低评分

勇士5年1.1亿美元续约波杰!ESPN评级为B-:合同年限拉低评分

罗说NBA
2026-10-11 08:28:53
郑钦文决赛对手何许人?19岁已是法网冠军,两年前曾在中网被打哭

郑钦文决赛对手何许人?19岁已是法网冠军,两年前曾在中网被打哭

全景体育V
2026-10-11 06:50:10
朝鲜没准真的会在今后潜在爆发的台海之战中,主动先发起军事行动

朝鲜没准真的会在今后潜在爆发的台海之战中,主动先发起军事行动

果妈聊娱乐
2026-10-10 10:42:24
炸裂!穆里尼奥彻底翻脸!公开硬刚死保皇马争议巨星

炸裂!穆里尼奥彻底翻脸!公开硬刚死保皇马争议巨星

澜归序
2026-10-11 08:17:31
救不了!大使馆连发多轮通报:中国公民尽快撤离!死亡已超4205人

救不了!大使馆连发多轮通报:中国公民尽快撤离!死亡已超4205人

有范又有料
2026-10-11 03:35:12
广西男子河道捞沙时捡到春秋编钟卖了30万元,被判5年并追缴违法所得

广西男子河道捞沙时捡到春秋编钟卖了30万元,被判5年并追缴违法所得

极目新闻
2026-10-10 12:10:07
我在上海亲戚家住了一周,真是开了眼,他们一家一个月就挣10万。

我在上海亲戚家住了一周,真是开了眼,他们一家一个月就挣10万。

艺鉴在线
2026-10-11 00:19:00
中立球迷看嗨了,阿隆索执教前6场英超出现28球为历史之最

中立球迷看嗨了,阿隆索执教前6场英超出现28球为历史之最

懂球帝
2026-10-11 00:15:22
高速路撞隔离带后下车避险,重庆44岁医院副院长坠20米高架桥不幸离世

高速路撞隔离带后下车避险,重庆44岁医院副院长坠20米高架桥不幸离世

大风新闻
2026-10-10 11:09:03
泰国真的不能再去了?无数游客亲身经历,坦言当地早已不复当年

泰国真的不能再去了?无数游客亲身经历,坦言当地早已不复当年

网络易不易
2026-09-30 06:10:17
中菲发生海上冲突,美方已介入,中方兵力已翻倍,菲方这局白摆了

中菲发生海上冲突,美方已介入,中方兵力已翻倍,菲方这局白摆了

旧史新谭
2026-10-11 00:16:50
人社部:要把未参保人员找到动员参保

人社部:要把未参保人员找到动员参保

第一财经资讯
2026-10-10 22:36:48
知名港星喜提迈巴赫!全家定居北京,在内地拥有多套房子

知名港星喜提迈巴赫!全家定居北京,在内地拥有多套房子

旧时光老师
2026-10-10 15:18:02
皇马跌宕险胜黄潜,赛后3大核心疑问:迪奥曼德得到验证;穆帅换下阿诺德,是为了维尼修斯!

皇马跌宕险胜黄潜,赛后3大核心疑问:迪奥曼德得到验证;穆帅换下阿诺德,是为了维尼修斯!

福酱的小时光
2026-10-11 08:03:41
郑艳丽:身材太诱人被导演强暴,拍三级片,被大佬玩烂后当服务员

郑艳丽:身材太诱人被导演强暴,拍三级片,被大佬玩烂后当服务员

深度解析热点
2026-10-09 22:51:24
医生提醒:西红柿炒鸡蛋,尽量不要放“此物”,可能多数人做错了

医生提醒:西红柿炒鸡蛋,尽量不要放“此物”,可能多数人做错了

芹姐说生活
2026-10-09 22:43:06
广东队为什么打不过广州男篮?广东男篮主帅说出原因,原来如此

广东队为什么打不过广州男篮?广东男篮主帅说出原因,原来如此

赵或是个热血青年
2026-10-11 06:52:39
2.38-1.57!郑钦文冲首个1000赛冠军,若中网输球,请球迷别骂她

2.38-1.57!郑钦文冲首个1000赛冠军,若中网输球,请球迷别骂她

侃球熊弟
2026-10-11 00:40:32
触目惊心!四川网红落网,网传把8人送到缅甸,一个人头能拿12万

触目惊心!四川网红落网,网传把8人送到缅甸,一个人头能拿12万

阅微札记
2026-10-10 09:54:32
比亚迪副总裁:暂不进入美国乘用车市场,那里不清晰、不稳定、不可预见……

比亚迪副总裁:暂不进入美国乘用车市场,那里不清晰、不稳定、不可预见……

观察者网
2026-10-09 13:37:04
2026-10-11 08:40:54
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11198关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

新人花3小时手搓AI婚纱照 婚礼迎宾照特意保留AI水印

头条要闻

新人花3小时手搓AI婚纱照 婚礼迎宾照特意保留AI水印

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

时尚
艺术
游戏
数码
手机

伊姐周六热推:电视剧《魅影神捕》;电视剧《美人余》......

艺术要闻

黄沙万里不见泪|仇英《明妃出塞图》:昭君从来不是悲情美人

一人一猫,能走多远?

数码要闻

AMD再次上调GDDR6显存供货价格 10月1日起生效

手机要闻

华为神秘小屏新机首曝,消息称有一块6.17英寸1.5K小直屏开案中

无障碍浏览 进入关怀版