OpenAI的GPT-6 Astra在ARC-AGI-3基准测试上取得63%的成绩,并在96%的关卡中超越人类表现。Greg Brockman引用相关线程,称该基准“现已饱和”。
63%意味着什么?
![]()
据Greg Brockman所述,GPT-6 Astra通过新的提供商适配框架,在ARC-AGI-3上获得63%的成绩,在96%的关卡中超越人类,并构建出了迄今为止最精确的新环境符号模型。他得出结论:该基准现已饱和——意味着在该基准上进一步的提升不太可能有效区分前沿能力。
基准饱和,下一步看什么?
Greg Brockman在社交平台上引述相关线程时给出了简洁的判断:该基准现已饱和。他的逻辑是,当模型已经能在96%的关卡中超越人类时,继续在该基准上追求更高分数,可能无法有效区分不同前沿模型的能力差异。
换句话说,ARC-AGI-3作为一把“标尺”,其测量精度可能已经到头。对于整个AI行业而言,这释放了一个信号:评估体系可能需要升级,才能跟上模型能力的迭代速度。接下来,业界可能需要寻找更复杂、更接近真实世界任务的基准,来继续衡量AI的边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.