OpenAI开发者账号发布了一条新推文,晒出了GPT-6 Astra在DeepSWE v1.1 xhigh推理测试中的成绩:75.2%。这个数字本身已经够醒目,但更值得关注的是它背后那套完整的工作流——Astra不是只给个修复建议就完事,而是把整个修bug的流程从头到尾跑了一遍。
五步闭环,从复现到验证
![]()
推文详细拆解了Astra处理真实bug修复任务的五个步骤:复现bug、追溯原因、比对修复方案、修补代码、运行测试。每一步都不是走过场——复现是真正把问题跑出来,追溯是定位到根因,比对是在多个候选方案里挑最优解,修补是直接改代码,最后还要跑测试确认修复有效。
这套流程的含金量在于"端到端"。以往AI编程工具大多停留在"给建议"的层面,人还得自己动手改、自己验证。Astra这次展示的是把整个链条自动化,从发现问题到确认修复完成,中间不需要人工介入。
75.2%意味着什么
DeepSWE v1.1的xhigh难度档位,对推理能力的要求比常规档位高出一截。75.2%的得分意味着在大多数真实场景的bug修复任务里,Astra能独立完成从定位到验证的全过程。对开发者来说,这相当于多了一个能直接上手干活的同事,而不是只会指手画脚的顾问。
当然,这只是一条推文展示的基准数据,实际效果还要看更多场景的验证。但至少从这次公布的信息看,AI编程助手的能力边界,正在从"辅助"向"独立执行"移动。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.