刚刚,OpenAI发布了旗舰模型GP T-6 Astra。
至此,包括A nthropic 、谷歌在内的AI三巨头在短短一周中先后发布了自己的旗舰模型最新版本。
其中GP T-6 Astra和 Claude Fable 5.1在 技术报告中,都强调了自己在代理式科学研究方面的提升,所选用的均是斯坦福大学领导的全新AI4S基准:Terminal-Bench-Science。
![]()
该模型和定位上它与面向软件工程的 Terminal-Bench 同源,由科研人员而非模型方出题,覆盖生命、物理、地球、数学与工程五大学科共 70 个真实工作流任务。
该基准主要用于评估AI 智能体处理"复杂真实世界科学工作流"能力,考验从知识、推理、编程、工具调用、实验数据处理到结果验证在内的超长工作链路。
在八月底发布时它还被称为“AI科学家最难基准”,最高分Claude Opus 5仅解决了约30%,但在短短的一周内,这个看似艰难的任务就迅速被AI攻破了!
其中Claude Fable 5.1得分 52.6%,是Fab le5的两倍多;而GPT-6 Astra光速刷新了纪录,拿到了目前64.6%的最高分,相较一周前GPT-5.6 Sol的成绩直接翻了三倍。
![]()
对此,创作团队表示非常惊喜,他们将打造升级版的Terminal-Bench-Science0.2,目前正在科学家们征集问题,将斗志昂扬的给AI准备更复杂的科学能力考核,并严谨地衡量它。
![]()
—The End—
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.