![]()
7月31日,DeepSeek上线V4-Flash正式版。与4月发布V4预览版时不同,这次更新没有同步进入App和网页端,也没有覆盖参数规模更大的V4-Pro,而是率先向API开发者开放公测。
这个顺序比跑分本身更值得关注。
DeepSeek称,V4-Flash正式版没有改变模型结构和尺寸,只重新进行了后训练。但在Terminal Bench 2.1、NL2Repo、Cybergym等Agent测试中,其成绩明显提高;同时,Flash成为DeepSeek目前唯一支持Responses API、可以接入Codex的V4模型。V4-Pro正式版仍未发布。
表面上,这是轻量模型的一次能力升级;实际上,DeepSeek正在把过去建立在训练和推理端的低成本优势,向Agent执行层延伸。
聊天模型主要回答问题,Agent却要反复读取文件、拆解任务、调用工具并检查结果,调用次数更多,对价格和速度也更敏感。一个能力足够、成本更低的Flash,可能比继续追求能力上限的Pro更接近规模化应用。
但Agent也改变了竞争规则。模型是否聪明,只决定它能不能想明白;工具能否调用、错误能否修正、任务能否继续,决定它最终能不能把事情做完。V4-Flash让DeepSeek进入了Agent战场,也把它的系统和产品能力推到了台前。
01 Flash先于Pro“转正”
今年4月,DeepSeek将V4分为Pro和Flash两个预览版本。V4-Pro总参数1.6万亿、每个Token激活490亿参数,承担旗舰模型角色;V4-Flash总参数2840亿、激活130亿参数,官方给出的定位是更快、更高效和更经济。
三个月后,率先转为正式版的却是Flash。
它没有扩充模型规模。DeepSeek在更新日志中明确称,V4-Flash-0731与预览版结构和尺寸一致,“仅重新进行了后训练”。简单来说,预训练决定模型学过多少知识,后训练则教它面对具体任务时如何行动。对代码修改、终端操作等结果容易验证的任务,模型能否拆解步骤、读取反馈并修正错误,会直接影响最终完成率。
官方数据显示,V4-Flash在Terminal Bench 2.1中获得82.7分,在NL2Repo、Cybergym和Toolathlon verified中分别获得54.2分、76.7分和70.3分。DeepSeek据此称其Agent能力远超V4-Pro预览版。
这个结论需要保留边界。
V4-Pro此前使用的是Terminal Bench 2.0,而2.1版本调整了部分任务的外部依赖、测试标准和资源限制。同一套模型和Agent组合,在两个版本上的成绩也可能发生变化,不能将Flash的82.7分与Pro此前的67.9分简单视为同场对决。Terminal Bench官方公布的对照结果显示,多数组合在2.1版本中得分上升,部分组合的增幅超过10个百分点。
Terminal Bench评测的也不是一个脱离环境运行的“裸模型”,而是模型和Agent框架共同完成任务的能力。
DeepSeek在测试说明中注明,相关Code Agent任务使用了尚未公开的DeepSeek Harness极简模式。Harness可以理解为模型与电脑环境之间的执行框架:它为模型提供工具,保存任务状态,传回命令运行结果,并在执行失败后组织下一步动作。模型相同,换一套Harness,最终完成任务的表现也可能不同。
因此,V4-Flash证明的不是“小模型已经超过大模型”,而是对特定Agent任务而言,后训练数据、反馈机制和执行框架,仍有较大的优化空间。
DeepSeek第一次把Harness以正式名称写进更新日志,也说明它开始把竞争范围从模型本身向外推进。过去,DeepSeek主要证明的是如何用更少的计算资源训练和运行模型;进入Agent阶段,它还要解决模型如何操作工具、处理反馈并完成长链条任务。
02 Agent越会干活,低价越重要
DeepSeek优先强化Flash,与Agent的成本结构有关。
一次普通问答通常只有一轮输入和输出。一个代码Agent修改项目,可能要读取多个文件、运行命令、查看报错、重新修改,再调用测试工具验证结果。任务越长,模型调用次数和上下文消耗越多。
开发者真正计算的,不是一次回答多少钱,而是完成整个任务需要花多少钱,以及失败后还需要多少人工返工。
DeepSeek官网显示,V4-Flash每百万Token缓存未命中输入价格为0.14美元,输出价格为0.28美元;V4-Pro分别为0.435美元和0.87美元。Flash的输入和输出价格约为Pro的三分之一,并发上限为2500,是Pro的5倍。
对于需要批量运行、反复调用的Agent应用,这种价格差异会随着任务长度被持续放大。
这也解释了为什么DeepSeek率先让Flash支持Responses API。
DeepSeek官方文档显示,目前Responses API只支持V4-Flash,V4-Pro预计在8月初接入。通过修改配置,开发者可以在Codex CLI、ChatGPT桌面应用和VS Code的Codex扩展中,将DeepSeek设置为模型提供方。原有的操作界面和工作方式不变,后台调用的模型则可以换成V4-Flash。
这还不能说明DeepSeek已经建立了自己的Agent生态。
Codex的客户端、执行环境和产品入口仍由OpenAI提供。DeepSeek做的是降低开发者更换底层模型的技术门槛:先进入开发者已经使用的工具,再用价格和模型能力争夺调用量。
这延续了DeepSeek过去的打法。它不必先从零搭建一套完整的前端产品,便可以借助兼容接口进入现有工作流。对于成本敏感的开发者,保留Codex的操作方式、只替换后台模型,比重新迁移到另一套Agent工具更容易。
但Agent也比普通API更考验稳定性。
价格低可以吸引开发者进行第一次尝试,却不能保证他们长期留下。任务完成率、响应速度、错误恢复以及不同工具之间的兼容性,最终都会被折算成成本。如果一个低价模型需要更多次重试,或者需要人工频繁介入,省下的Token费用很快会被返工成本抵消。
低价因此只是DeepSeek进入Agent市场的门票,不是最终胜负。
03 低价之外,DeepSeek还要补上系统能力
过去,DeepSeek最鲜明的能力是提高模型训练和推理效率。
从V2开始,DeepSeek便通过稀疏激活和缓存压缩降低计算成本。其技术报告显示,V2相较此前的DeepSeek 67B节省了42.5%的训练成本,推理时的键值缓存减少93.3%,最高生成吞吐量提高至5.76倍。“用更少资源做出足够强的模型”,由此逐渐成为DeepSeek最重要的市场标签。
但Agent不是模型能力的简单延长。
一个真正进入企业生产环境的Agent,还要解决终端和浏览器调用、长任务状态管理、权限控制、沙箱隔离、日志审计和结果验证。模型负责判断下一步做什么,系统负责保证这一步能够安全、稳定地执行。
任何一个环节失效,低价模型节省的费用,都可能被人工检查和返工重新吃掉。
DeepSeek已经开始补这一层。其招聘页面目前单列Agent Harness团队、Agent Infra研发工程师、Code Agent数据工程师和通用Agent数据产品经理,同时招聘持续学习和自进化方向的研究人员。这些岗位指向的不是一次模型版本更新,而是执行系统、数据回流和产品能力的长期建设。
这种扩张也在改变DeepSeek的成本结构。
据媒体报道:DeepSeek首轮外部融资对应约3508.8亿元的交易隐含估值。由于相关文件没有说明交易涉及新股还是老股,也没有披露不同股东对应的权利安排,这一数字不是DeepSeek正式确认的最终轮次估值。
DeepSeek此前长期依靠创始人梁文锋旗下幻方量化提供资金。媒体报道称,公司转向外部资本,与算力、数据中心和工程人才投入上升有关。DeepSeek一度筹备第二轮融资及潜在IPO,7月下旬又被曝暂时搁置新一轮融资,相关计划均未得到公司正式确认。
融资变化不是V4-Flash升级的直接原因,却说明从模型研究走向持续在线的Agent服务,即使强调效率,也需要更重的基础设施和组织投入。
DeepSeek曾用低成本模型改变行业对大模型算力门槛的判断。现在,它要证明这套效率方法能否复制到一套更复杂的系统中。
V4-Flash提供了一条现实路径:让轻量模型承担更多重复、标准化的步骤,把价格更高的旗舰模型留给少数复杂任务;再通过兼容现有工具,降低开发者尝试和迁移的成本。
但这条路径能否成立,不能只看官方跑分。
尚未公开的Harness是否稳定,低价是否建立在可持续的服务能力上,开发者调用能否转化为收入,仍有待实际使用验证。Agent的竞争也不会只发生在模型价格上,而会越来越取决于谁能以更低的总成本,把任务稳定地做完。
DeepSeek过去最强的能力,是用更少的资源做出足够强的模型。进入Agent时代,它需要证明的是,自己能否用同样的效率,做出一个足够好用的系统。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.