![]()
8月12日深夜,全球AI圈迎来了一场罕见的“同日对垒”。
一边是梁文锋创立的DeepSeek,悄然将官网API文档中的模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”;几乎同一时间,马斯克旗下SpaceXAI正式发布了新一代旗舰模型Grok 4.6。两款产品均主打高性价比路线,直指智能体与长任务场景。
DeepSeek的Agent能力跃升
从DeepSeek官方群流出的一份评测对比表显示,V4 Pro正式版在多项智能体测试中表现亮眼。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分。相比预览版72.1分的成绩,三个月跃升了15.8分。
更值得关注的是另外两项反超。在AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分;在工作流智能体测试AutomationBench中,31.8分对29.1分同样胜出。
最夸张的数字来自软件工程能力测试DeepSWE——分数从预览版的12.8分飙升至62.7分,接近原来的五倍,超越了Anthropic上一代旗舰Opus 4.8的58.0分。
V4 Pro正式版支持100万Token上下文长度,最大输出384K Token,并兼容OpenAI和Anthropic两种API格式,开发者几乎无需修改代码即可完成切换。模型采用混合专家架构,总参数约1.6万亿,每个Token激活约490亿参数。
价格鸿沟与行业冲击
就在V4 Pro上线前几个小时,SpaceXAI发布的Grok 4.6同样剑指长周期智能体任务。在面向真实知识工作的GDPVal-AA v2评估中,Grok 4.6以1753 Elo登顶,超过了Fable 5的1741和GPT-5.6 Sol Max的1728。在Artificial Analysis的智能体能力综合排行榜中,Grok 4.6取得61分,与GPT-5.6 Sol并列。
Grok 4.6已在Cursor和Grok Build上线,也可通过API及OpenRouter、Vercel、Cloudflare调用。新模型在Grok 4.5基础上进一步强化了长时间运行的智能体任务处理能力。
而且,性能追赶只是故事的一半。价格差距才是真正让行业震动的变量。
Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元。而DeepSeek V4 Pro每百万Token输入(缓存未命中)3元、输出6元——折合美元分别约为0.44美元和0.87美元。0.1分的跑分差距背后,是约五十七倍的价格鸿沟。
不过,DeepSeek已在8月6日发布公告,计划近期整体上调API服务定价,预计涨幅较大。有分析指出,平价的V4 Pro可视为DeepSeek在新模型上线初期引流的一场“临时价格战”。
两款主打高性价比的模型同夜撞车,梁文锋与马斯克的双强对垒,真正感受到压力的或许是OpenAI和Anthropic。当高性能不再必然意味着高价格,AI大模型的竞争逻辑正在被重写。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.