DeepSeek-V4-Flash-0731
你梁哥还是你梁哥
DeepSeek-V4-Flash 正式版发布并同步开源了
保留 DeepSeek-V4-Flash-Preview 相同模型结构和参数规模情况下,重新做了后训练(针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具,以及怎样按照要求完成任务),多项基准就超越了三个月前的 V4-Pro 预览版
![]()
在大家卷参数量(万亿参数已经常态了)的时候,DeepSeek 又选择了一个巧妙的方向(后训练)并证明了可行
Artificial Analysisi 的大模型智能指数与单任务成本对比图上,横轴是完成一次任务的成本,越往左越便宜;纵轴是模型智能得分,越往上能力越强
所以,一款理想模型应该尽量靠近左上角:既便宜,又聪明;DeepSeek-V4-Flash-0731(Max)所处的位置那两条虚线,被网友称为 DeepSeek 斩杀线
![]()
我最关注的自然还是本地部署,企业级应用,本地模型几乎是必选
GLM-5.2、Kimi-K3 都很好,但是它们参数量太大了,部署成本也离谱
DeepSeek-V4-Flash-0731 只有 304B,原生 8-bit 精度,模型文件只有 167GB
诶?我怎么用了只有俩字。。。
![]()
vLLM 原版部署
官方版本的本地部署,首推 vLLM,不过要先升级到 v0.25 以上
依然挑卡,英伟达也必须是 Hopper 架构或 Blackwell 架构
![]()
vLLM recipe 里还有 H200 单机 PD 分离的方案(4 卡 prefill + 4 卡 decode,Mooncake 或 Nixl 传 KV cache),做推理集群的可以去翻
量化版本地部署
量化之神 Unsloth 量化版本的 GGUF 也来了
![]()
DeepSeek-V4-Flash 有点特殊,大家看压缩比例Q4 也没能把权重文件降低多少
![]()
官方 checkpoint、UD-Q8_K_XL、UD-Q4_K_XL 和第三方量化的权重构成对比
DeepSeek-V4-Flash 做了量化感知训练(QAT),官方 checkpoint 里那些 routed experts 占了整个模型96%,本来就是用 MXFP4 存的,剩下 4% 是 FP8 或 BF16
GGUF 的 MXFP4 恰好就是同一个格式,所以 Unsloth 做的事情不是「压缩」,而是逐位重打包:专家权重一个 bit 都不动,FP8 反量化到 BF16 也是零舍入
这里有个很反直觉的结论:不是所有人做的 4bit 都一样
同样 4bit 档,Unsloth 的 UD-Q4_K_XL 只把非专家那 4% 压到 Q8_0,专家部分保持逐位精确;而某些第三方转换把专家重新量化到 Q4_K,文件反而更大(164.6GB)、质量还更差(KLD 0.029)
![]()
量化质量与体积的关系:UD-Q8_K_XL 是唯一的无损点,UD-Q4_K_XL 在同尺寸档位上质量最优
几个关键数字放一起看:
版本
体积
PPL
KL 散度
top-token 一致率
官方原版(基准)
156.4GB
0
100%
UD-Q8_K_XL
161.9GB
≈0(无损)100%
UD-Q4_K_XL
155.1GB
96.28%
bartowski MXFP4
156.0GB
96.18%
antirez Q4KExperts-F16
164.6GB
93.94%
antirez IQ2XXS
86.7GB
77.92%
UD-Q8_K_XL 的困惑度和官方原版完全相同,小数点后四位一模一样,这在量化里基本见不到
顺手补一句:Unsloth 说他们试过把部分 tensor 用 Q8_0 和 F16 存,结果有损,因为 DeepSeek 做 QAT 就是为了让 MXFP4/FP8 这条路走得通,所以那些 tensor 只能老老实实留 BF16
13 个档位到底怎么选
Unsloth 一共放了 13 个档位,这张曲线图能一眼看出断点在哪:
![]()
DeepSeek-V4-Flash 全部量化档位的质量与体积曲线,Q4 到 Q8 之间几乎是垂直下降
我的判断和官方推荐不完全一样
官方推荐 UD-IQ3_XXS,理由是 103GB 能塞进 128GB 内存的机器,这个推荐没错,但看曲线你会发现:从 UD-Q4_K_XL 的 0.0094 掉到 UD-IQ4_XS 的 0.0747,质量差了 8 倍,体积只省了 18GB;再往下到 IQ3_XXS,KL 散度直接是 Q4 的 25 倍
原因就是前面那件事:这个模型的 4bit 是「官方原生的 4bit」,不是「从 16bit 压出来的 4bit」,低于 4bit 才开始真正动专家权重,一动就崩
所以我的选择顺序是:
内存/显存169GB 以上→ 直接 UD-Q8_K_XL,无损
162GB 左右→ UD-Q4_K_XL,只差 0.0102 KLD,实际用起来感知不到
128GB→ UD-IQ3_XXS 是退让方案,能用
128GB 以下→ 我建议别折腾了,去用 API
官方给的内存门槛表(含 KV cache 和上下文分配的余量):
1-bit
2-bit
3-bit
4-bit(接近无损)
Q8_K_XL(无损)
92GB
102GB
110-135GB
162GB
169GB
注意这里的单位是总内存(RAM + VRAM,或者统一内存),Mac 用户可以直接对着自己的统一内存容量看
怎么跑
先编译 llama.cpp,没 GPU 就把-DGGML_CUDA=ON改成OFF,Apple Metal 也是改成OFF(Metal 默认开):
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp
最省事的跑法,像ollama run一样直接拉:
export LLAMA_CACHE="unsloth/DeepSeek-V4-Flash-0731-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL \
--temp 1.0 \
--top-p 1.0 \
--min-p 0.0
不过这个下载过程很慢,一百多 G 建议手动下,按档位过滤别把整仓库拖下来:
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \
--local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \
--include "*UD-Q8_K_XL*"
思考档位的开关是这次的重点,三种写法都给你:
--chat-template-kwargs '{"reasoning_effort":"max"}'
--chat-template-kwargs '{"reasoning_effort":"high"}'
--chat-template-kwargs '{"enable_thinking":false}'
llama.cpp 现在也支持--reasoning on/--reasoning off了,Windows PowerShell 用户注意引号得转义成"{\"enable_thinking\":false}"
采样参数照官方来:temperature = 1.0,top_p = 1.0,agentic 场景换成top_p = 0.95;如果开 Think Max,上下文至少给到384K,不然思考没写完就被截断了
嫌命令行麻烦的可以用 Unsloth Studio,Mac / Windows / Linux 都能跑,界面右侧直接切 Non-think / High / Max:
![]()
DeepSeek-V4-Flash-0731 在 Unsloth Studio 中运行,右上角可以切换思考档位
curl -fsSL https://unsloth·ai/install·sh | sh
unsloth studio -H 0.0.0.0 -p 8888
有个坑得提醒:DeepSeek 这次官方没给 Jinja 格式的 chat template,只提供了一个encoding文件夹让你自己写编码脚本,Unsloth 补了一版 jinja 模板,拿 4000 多轮对话对齐官方基线,还把工具调用时被丢掉的reasoning_content加回来了
所以下别人的 GGUF 之前,先确认对方有没有处理模板和 MXFP4 重打包这两件事,不然「能跑」和「跑对」是两回事
总结
写到最后,我反而觉得,DeepSeek-V4-Flash 最值得讨论的,并不是又赢了几个榜单,也不是把成本压到了什么位置
DeepSeek 真正厉害的地方,是它一直在探索不同的路
大家都在堆参数,它去做架构创新;大家开始追求万亿参数,它又用后训练告诉我们:模型结构和参数量不变,依然可以把能力提升一大截。更重要的是,每次验证了一条新路线,它没有只把结果留在自己的 API 里,而是选择开源,让所有人都能研究、部署、复现,甚至继续往前走
这对企业尤其重要,说到底还是看成本
企业需要的从来不只是一个榜单第一的模型,而是一个能力足够强、成本可以接受、能够本地部署、技术路线相对透明,并且可以长期掌握在自己手里的模型
GLM、Kimi、Qwen 都在快速进步,但 DeepSeek 依然在不断刷新我们对国产模型能力边界的认知
我最近已经取消了 Codex Pro,越来越多编程、Agent 任务转到国产模型上。说实话,切换之前我也担心会不会明显降级,但实际用下来,并没有想象中的不适,很多任务甚至已经感觉不到差距
DeepSeek 最伟大的贡献,或许并不是给出了某一个标准答案,而是一次次证明:大模型还有很多路可以走,而且这些路,中国团队也能走在前面
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.