ARC Prize 最新测试结果让人意外:GPT-6 Astra 在 ARC-AGI-3 基准上,用标准 harness 得分 63%,但换用新的 provider adapter harness 后,成绩直接飙到 99%。同一个模型,两种测试方式,差距如此悬殊。
效率同样亮眼
![]()
除了分数,ARC Prize 还发现它在 96% 的关卡上,动作效率超过了受测人类的中位数。这意味着它不仅答得对,而且动作更省、更快,不是靠蛮力试错。
它到底做了什么?
ARC Prize 观察到,GPT-6 Astra 能把陌生环境转化成紧凑的符号世界模型。具体来说,它把游戏机制拆解成逻辑规则,还自建了一套领域速记语言,用来跟踪状态、规划下一步动作。这种能力,让它面对没见过的任务时,不是硬套模板,而是现场建模。
63% 到 99% 的跳跃,说明测试方式对结果影响巨大。标准 harness 下它已经不错,但适配后的 harness 才真正释放了它的潜力。这个案例也提醒我们:看 AI 基准分数,先搞清楚它跑在什么条件下。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.