网易首页 > 网易号 > 正文 申请入驻

刚刚,马斯克交卷 Grok 4.7!但这次吹牛吹大了

0
分享至

AI 圈没有假期。

从 OpenAI、Anthropic 到 xAI,各家巨头仿佛商量好了一样,连夜赶考,集中抢位。假期还没正式开始,基模决战的气氛就已经烘托到位了。

就在刚刚,SpaceXAI 正式发布 Grok 4.7。


官方博客 https://x.ai/news/grok-4-7

官方将其定位为目前最强的编程与知识工作模型。新模型已经进入 Cursor、Grok Build 和 Grok API,也将通过第三方编程工具、模型路由平台与云服务提供。

Grok 4.7 的发布比马斯克最初预告的时间晚了不少。从 7 月下旬开始吹风,到改口「再等几周」,接着压缩到「十天之内」,最后又来了一句「模型还得再调校调校」……

一鸽再鸽后,Grok 4.7 的发布重点因此显得十分明确。SpaceXAI 没有把主要篇幅放在聊天体验或多模态展示上,而是集中强调长时间执行、自我检查、专业知识工作,以及更有竞争力的价格性能比。

Grok 4.7,把长任务摆上台面

按照官方介绍,Grok 4.7 使用了一个比 Grok 4.6 更大的全新基础模型,强化学习时间更长,训练任务也更难,其中相当一部分需要数小时才能完成。

模型同时加强了长上下文管理和结果核查能力,并针对 Grok Bot 的运行环境进行了原生训练,以提升对话任务和通用知识工作的表现。

官方公布的多项成绩显示,Grok 4.7 相比上一代有明显进步。

在 CursorBench 4.0 中,Grok 4.7 xHigh 得分为 46.3%,高于 Grok 4.6 High 的 40.4%;DeepSWE v1.1 从 65.2% 提高到 71.0%;


Terminal Bench 4.0 则从 20.3% 升至 38.0%。电气工程基准 EEBench 的成绩从 53.0% 提高到 64.0%,面向长时间办公任务的 AA Briefcase v1.1 也从 1546 分增至 1657 分。




向左滑动查看更多内容

横向比较后,Grok 4.7 的优势主要集中在价格和部分专业任务,综合成绩仍未全面领先。

在 CursorBench 4.0 和 Terminal Bench 4.0 上,它低于 Fable 5.1 Max;在 DeepSWE v1.1 上略低于 GPT 5.6 Sol Max;


但在 Harvey Legal Agent Benchmark 中取得 19.6%,明显高于官方表格中的几款对比模型。

Artificial Analysis 随后给出 46 分的 Intelligence Index 成绩,称 Grok 4.7 让 SpaceXAI 进入全球前四名 AI 实验室,其 Coding Agent Index 表现也超过 GPT 5.6 Sol。


价格成为 Grok 4.7 最直接的竞争筹码。其 API 定价与 Grok 4.6 相同,每百万输入 token 为 2 美元,每百万输出 token 为 6 美元。


https://docs.x.ai/developers/pricing

SpaceXAI 还提供输出速度翻倍的快速版本,价格也相应翻倍。

用马斯克的话来说,Grok 4.7 Grok 4.7 是一款集智能、速度和低成本于一体的强大产品,SpaceXAI 官方则直接宣称,它的速度可达到同类模型的两倍,价格只有一半。


编程之外,SpaceXAI 开始争夺专业工作。

官方专门强调文档和演示文稿能力,并引用 GDPval 与 AA Briefcase 等评测,试图证明模型可以承担律师、护士、金融分析师等专业人士的部分工作。

对应到产品方向上,Grok 4.7 想进入的是需要读取大量材料、持续调用工具并反复核对结果的长流程任务。

Box 展示的一项保险理赔案例更能说明这一方向。

Grok 4.7 在 Box Agent 中核对一笔价值 200 万美元的索赔、保单与相关记录,发现 8.2 万美元重复发票和 6.4 万美元遗漏的供应商抵扣,还识别出一个可能令计算结果相差 14.3 万美元的免赔额问题。


系统最终生成了一份带引用的审查报告,保险覆盖范围和付款决定仍由理赔人员完成。

安全能力也被列为此次升级的重要部分。

SpaceXAI 表示,Grok 4.7 使用了全新的安全防护体系,在 LatchBio 生物安全基准中取得 62.4%;在面向高风险网络安全任务的 HackerBench v0.3 中,只有 3.3% 的危险双重用途提示通过,同时尽量减少对正常安全研究的误拒。

部分网络安全合作伙伴还将获得邀请制的红队能力,用于防御研究。

网友玩疯了,但口碑…

Grok 4.7 上线后的第一批测试主要集中在网页、3D 场景和可视化编程,但口碑嘛,可以说是两极分化的厉害。

Eric Zakariasson 展示了 Grok 4.6 与 4.7 制作《帝国时代 II》演示项目的对比。


Ashutosh Shrivastava 则让模型根据平面图搭建 Blender 结构,再导出为交互式 Three.js 网站,上述测试都呈现了它处理多步骤视觉任务的能力。



在另一组测试中,开发者 Diego Cabezas 让 Grok 4.7 xHigh 用 Python 模拟单行道交通灯和随机驶入的车辆,并称其细节是同类测试中最丰富的一次。



AI/ML API 使用四个独立的 Three.js 太空场景比较 Grok 4.7 与 Claude Opus 5,称前者完成测试约花费 0.20 美元,后者约为 2.05 美元,Grok 在其中三个场景中用时更短。


不过,开发者 Bhavy 则认为 Grok 4.7 在 3D 和前端任务上的表现低于预期,主要问题包括物理效果生硬、提示理解不稳定和 token 消耗过快。


Harshith 在 Grok Build 中生成 Airbus H145 直升机的 Three.js 模型,也认为 4.7 的结果逊于 4.6,并称任务耗时约 45 分钟。

另一项鹈鹕骑自行车的 SVG 网页动画测试中,Grok 4.7 对画面结构和运动关系的处理同样备受诟病。


也有开发者给出了更居中的判断。Salio 认为 Grok 4.7 的实际表现高于预期,视觉质量略低于 Astra,但高于 Sol。



整体来看,Grok 4.7 在代码评测、专业工作和成本控制方面进步明确,复杂 3D、网页视觉与物理效果却并不稳定。

从产品定位看,Grok 4.7 更像是 SpaceXAI 对开发者市场的一次集中加码。它不是一次让所有人闭嘴的跨代更新,更像是 xAI 把 Grok 推向前沿模型混战区的一次补位。

放在「基模决战周」的大背景下,Grok 4.7 的意义也许不在于它是否已经全面追上最强模型,而在于 xAI 正在用更低价格和更快响应,争夺开发者愿意反复调用的那部分日常任务。


而且 Grok 4.7 显然只是 xAI 当前路线上的一站。

按照马斯克公开透露的信息,Grok 4.8 的参数规模约为 2.5 万亿,并采用一套全新的 C++ 训练栈。模型将在基础训练完成后进入强化学习阶段,马斯克称其会带来「明显改进」,定位也是 Grok 4.7 之后更大幅度的一次升级。


更远的路线图里,Grok 4.9 被马斯克称为可能达到 OpenAI Astra 和 Anthropic Fable 级别的模型,而终极大招 Grok 5,更是被老马直接寄托了通往 AGI 的终极希望。

至于模型发布时间嘛,如果能再准时点就更好了(doge)。


我们正在招募伙伴

简历投递邮箱hr@ifanr.com

✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“上午秋分,薄衣过冬,下午秋分,冻死老牛”,今年秋分在哪?有啥预兆?

“上午秋分,薄衣过冬,下午秋分,冻死老牛”,今年秋分在哪?有啥预兆?

小谈食刻美食
2026-09-22 17:47:37
伊朗代表团抵美,其总统安全由美特勤局负责

伊朗代表团抵美,其总统安全由美特勤局负责

红星新闻
2026-09-22 13:21:13
“一周就被摧残成这样了”,女老师晒前后面相变化,令人不敢相信

“一周就被摧残成这样了”,女老师晒前后面相变化,令人不敢相信

熙熙说教
2026-09-11 12:20:11
原来他是张家齐爸爸,自由职业没经济来源,美美'隐身'不关心女儿

原来他是张家齐爸爸,自由职业没经济来源,美美'隐身'不关心女儿

汪巗的创业之路
2026-09-23 07:13:35
有人预测:不出意外,中秋过后近一半的人口,会流入这5个地方

有人预测:不出意外,中秋过后近一半的人口,会流入这5个地方

次元君情感
2026-09-22 10:43:44
男子不慎跌落撞到下体,阴茎持续勃起3天无法消退,医生:这类情况应尽早就医

男子不慎跌落撞到下体,阴茎持续勃起3天无法消退,医生:这类情况应尽早就医

南方都市报
2026-09-20 13:38:18
太离谱了!广州某三甲医院导诊护士上班,半小时都在玩手机:网友指出界面是炒股软件

太离谱了!广州某三甲医院导诊护士上班,半小时都在玩手机:网友指出界面是炒股软件

火山詩话
2026-09-22 07:22:29
昆明一餐馆门口彩绘遭人用白漆损毁!经调查,损毁壁画的人竟是……

昆明一餐馆门口彩绘遭人用白漆损毁!经调查,损毁壁画的人竟是……

都市条形码
2026-09-22 16:06:06
苦战5场:中国男羽3-2淘汰韩国男羽,惊险晋级亚运羽毛球男团四强

苦战5场:中国男羽3-2淘汰韩国男羽,惊险晋级亚运羽毛球男团四强

侧身凌空斩
2026-09-22 19:55:48
倘若西安事变中,张学良真把蒋介石枪决了,1936年的中国恐怕连1937年都撑不过去

倘若西安事变中,张学良真把蒋介石枪决了,1936年的中国恐怕连1937年都撑不过去

人生录
2026-09-22 10:58:44
亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

小熊回收站
2026-09-23 11:35:27
11个环京禁飞区、半径约300公里!大疆限飞地图再更新:“环京管制空域”更名为“环京禁飞区”并划分为十一个区域,结束时间标注为2029年

11个环京禁飞区、半径约300公里!大疆限飞地图再更新:“环京管制空域”更名为“环京禁飞区”并划分为十一个区域,结束时间标注为2029年

通航圈
2026-09-22 16:40:54
听妈话从5楼往下扔快递给快递员 15岁女孩不幸坠亡 父母起诉快递公司索赔74万元

听妈话从5楼往下扔快递给快递员 15岁女孩不幸坠亡 父母起诉快递公司索赔74万元

闪电新闻
2026-09-22 22:11:07
险些淘汰日乒王牌组合!第四局9-7被浪费 张本美和抢五爆发拒绝爆冷

险些淘汰日乒王牌组合!第四局9-7被浪费 张本美和抢五爆发拒绝爆冷

颜小白的篮球梦
2026-09-23 10:33:06
“运城13岁女孩疑被性侵案”两嫌疑人被移送起诉,前期办案人员被立案调查 专家:事后交往、反抗微弱不等同于“自愿”

“运城13岁女孩疑被性侵案”两嫌疑人被移送起诉,前期办案人员被立案调查 专家:事后交往、反抗微弱不等同于“自愿”

红星新闻
2026-09-23 10:26:30
理记被禁言,黑公关闭嘴了

理记被禁言,黑公关闭嘴了

难得君
2026-09-23 08:42:30
罗永浩长文回应“理记”,把“理记”的底裤都给扒了,这是不给他留活路

罗永浩长文回应“理记”,把“理记”的底裤都给扒了,这是不给他留活路

江山挥笔
2026-09-22 20:12:12
西贝门店探访:用餐高峰期,餐厅甚至空无一人

西贝门店探访:用餐高峰期,餐厅甚至空无一人

第一财经资讯
2026-09-22 17:13:03
2-0横扫!WTA大喜讯:美网被淘汰仅20天,中国金花一姐掀翻奥运亚军,真是又美又能打!郑钦文全力追赶

2-0横扫!WTA大喜讯:美网被淘汰仅20天,中国金花一姐掀翻奥运亚军,真是又美又能打!郑钦文全力追赶

锐评利物浦
2026-09-22 17:35:33
男生逃军训去旅游后续:退学仅开胃菜,知情人发声,网红账号凉凉

男生逃军训去旅游后续:退学仅开胃菜,知情人发声,网红账号凉凉

宝哥精彩赛事
2026-09-23 04:33:45
2026-09-23 12:51:00
AppSo incentive-icons
AppSo
让智能手机更好用的秘密
6850文章数 26912关注度
往期回顾 全部

科技要闻

2026网易未来大会上午场:科技如何破界

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

头条要闻

两幼童被蜇死全身几百处伤口 养蜂人"不认错、不道歉"

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

教育
亲子
时尚
房产
旅游

教育要闻

我国教育普及和公平程度居世界前列

亲子要闻

ICU工作15年,见过太多年轻患者的悲剧,这些孩子的共同点就是生活习惯不健康

消失的天后,带病复出,先赚10个亿

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

旅游要闻

在云峰村望图兴叹,大理全面封山几时休?“妙香佛国”真徒有虚名!

无障碍浏览 进入关怀版