![]()
2026年8月12日深夜,DeepSeek官网API文档悄然更新。
没有任何预告,没有发布会,没有社交媒体预热。模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”。几乎是同一时间,马斯克旗下SpaceXAI发布了新一代模型Grok 4.6。
两款模型同夜撞车——梁文锋与马斯克,东方与西方,开源与闭源。一场没有宣战的战争,在深夜同时打响。
只差0.1分
第二天,一张评测对比表开始在AI圈刷屏。
Terminal Bench 2.1——一项衡量AI智能体在真实终端环境中完成复杂任务能力的测试——DeepSeek V4 Pro正式版拿到87.9分。全球第一的Anthropic Fable 5是88.0分。
差距只剩0.1分。
作为参照,三个月前V4 Pro预览版的成绩是72.1分。从72.1到87.9,跃升了15.8分。在AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分;在工作流智能体测试AutomationBench中,31.8分对29.1分同样胜出。
最惊人的跃升发生在DeepSWE——一项要求模型真正进入复杂代码仓库、自主理解代码、修改多个文件、运行测试并不断修正的基准测试。V4 Pro正式版得分62.7分,从预览版的12.8分暴涨近5倍。不仅超越了Anthropic上一代旗舰Opus 4.8的58.0分,距离Fable 5的70.0分也只剩7.3分。
这些测试考察的不是“能不能答对题”,而是AI能不能真正干活——调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这是大模型从“聊天玩具”走向“生产工具”的核心门槛。
57倍的差距
性能只差0.1分,价格差了多少?
每百万输出Token,Fable 5定价50美元,GPT-5.6 Sol Max定价30美元。马斯克的Grok 4.6定价6美元。
而DeepSeek V4 Pro,定价0.87美元。
0.1分的跑分差距背后,是57倍的价格鸿沟。
这个等式,足以让每一个开发者重新审视自己的技术选型。一个只差0.1分的模型,价格只有对方的五十七分之一——对任何企业来说,这都不是一个需要犹豫的选择。
这是一个在性价比维度上几乎无法防御的攻击。
对手的焦虑
这场深夜发布让硅谷坐立不安。
就在V4 Pro上线前几个小时,马斯克刚刚发布了Grok 4.6,同样剑指长周期智能体任务。在面向真实知识工作的GDPVal-AA v2评估中,Grok 4.6以1753 Elo登顶,超过Fable 5的1741和GPT-5.6 Sol Max的1728。
两款主打高性价比的模型同夜撞车,不约而同地将矛头指向了同一件事:让AI在长任务中稳定交付可用成果。
而真正感到压力的,可能是OpenAI和Anthropic。
价格战打到了这个地步,闭源模型的定价体系已经很难维持。当DeepSeek用0.87美元做到了Fable 5 50美元能做的事,“闭源溢价”的逻辑正在被重新审视。
梁文锋曾说过一句话:“无论API,还是AI,都应该是普惠的、人人可以用得起的东西。”
2026年8月12日深夜,他用一款只差0.1分的模型,在把这句话变成现实的同时,也把整个行业的定价权,推到了悬崖边上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.