【CNMO科技消息】近日,一个以"gemini-3.8-flash"为马甲的神秘模型现身大模型竞技场Arena,在多轮盲测中被广泛认为是谷歌尚未发布的Gemini 4 Pro,其性能表现引发AI圈的高度关注。
![]()
Gemini
最受关注的一次演示是"机械蝴蝶"任务:一位开发者要求模型使用Three.js从零编写并渲染出结构复杂的机械蝴蝶,这类实时代码生成考验空间几何理解、光影材质着色器调度与多轴物理模拟能力,稍有差错便会导致浏览器崩溃。结果显示,相比Fable 5.1 Max,处于暗中测试状态的Gemini 4 Pro耗时减少约67%。
此外,还有开发者制作的同款机械蝴蝶加入了爆炸视图、飞行模式与组件标注等交互。在3D手表、机器人"瓦力"等横向对比中,Gemini 4 Pro在爆炸视图与构件设计上表现突出,并会在未被要求的情况下自主添加动画与交互细节。
真正引发震动的是流出的基准测试数据。在这份对比中,Gemini 4 Pro在多项测试里取得全面SOTA:DeepSWE v1.1智能体编码任务拿下88.7%,超过GPT-6 Astra的86.9%;GDPval-AA v2真实知识工作任务成为唯一突破2000 Elo大关的模型,达到2064;Terminal-bench 2.1终端编码能力为95.3%,全场最高;OSWorld-2.0计算机操作测试为86.8%,同样排名第一。
在考察Agent连续多步执行能力的Terminal-Bench 4.0中,它与自家Flash的差距从上代的3.2%拉大到13.9%,显示任务越复杂、步骤越多,其优势越明显。价格方面,该模型每百万Token输入2.25美元、输出11.25美元,在顶级旗舰中颇具竞争力。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.