OpenAI 官方公布了一组新成绩:GPT-6 Astra 在 Agents' Last Exam、AutomationBench 和 ScreenSpot Pro 三项基准测试中,全部拿下 SOTA(当前最优)成绩。这三项测试衡量的不是聊天能力,而是跨职业的电脑工作流任务——也就是让 AI 像人一样操作电脑干活。
这组数据的分量在于,它把"AI 会用电脑"这件事从口号变成了可验证的指标。三个基准各有侧重,但指向同一个能力:自主智能体在真实软件环境里的执行水平。
![]()
三个基准分别考什么?
- Agents' Last Exam:综合考察智能体在复杂任务中的推理与决策能力,题目设计贴近真实工作场景。
- AutomationBench:聚焦自动化流程的完成度,测试 AI 能否稳定执行多步骤操作。
- ScreenSpot Pro:专门评估 AI 对图形界面(GUI)的理解和点击操作准确性。
换句话说,这三个测试覆盖了从"看懂屏幕"到"完成任务"的完整链路。能在三个维度同时登顶,说明 Astra 在电脑使用这件事上不是偏科生。
OpenAI 这次没有用"强大""领先"这类空泛描述,而是直接甩出三个具体基准名。这种做法的好处是,任何团队都可以拿同一套测试去复现对比,水分很难藏住。
当然,基准测试的分数和真实生产力之间还有距离。但至少,这次给出的是一份可以查证的答卷,而不是一张空头支票。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.