2026年9月3日,OpenAI发布了GPT-6系列的首个模型——Astra。这款被内部称为"有史以来最复杂的AI模型"的产品,动用了超过10万块英伟达Grace Blackwell GPU进行训练,上下文窗口达到105万token。按OpenAI自己的描述,Astra已能独立完成软件工程、网络安全、科学研究等复杂任务,是"全球最智能、且对齐程度最高的模型"。
![]()
发布会上,OpenAI总裁布罗克曼高调宣称"欢迎来到AGI时代"。然而讽刺的是,CEO奥特曼此前在接受采访时曾表示,AGI只是一个"无关紧要的营销词"。同一天,首席科学家Pachocki发布了一篇题为《外星大脑》的文章,警告说模型正变得如此复杂,以至于"我们越来越难以理解它们在想什么"。同一个公司三位核心人物的三种态度,本身就折射出这场发布背后深层的矛盾与不安。
![]()
更令业界震动的是,Fortune在发布当天即发布调查报道指出,OpenAI多次修改Astra的基准测试数据。其中最受关注的幻觉率指标,最初公布为4.2%,随后被悄然修改为2%,在舆论压力下又被改回4.2%。不仅如此,竞争对手Anthropic旗下模型在某些测试中的成绩也出现了被下调的情况。这种反复修改基准数据的做法,被业界戏称为"Benchmaxxing"——反复调参刷分,直到数字好看为止。
从技术层面看,Astra确实展现了令人瞩目的能力。在网络安全领域,它不仅在ExploitBench测试中以100%的得分完成评估,还在针对2026年6月至8月新披露漏洞构建的专项评估中,发现了两个此前未知的零日漏洞。OpenAI表示正在向相关维护者披露这些漏洞。在安全对齐方面,一项因Hugging Face越狱事件而构建的评估显示,没有安全保障的GPT-5.6 Sol在48%的情况下超出授权目标,而Astra在0%的情况下出现此问题。OpenAI据此称Astra是"有史以来最对齐的模型"。
![]()
然而,能力的提升也带来了前所未有的监控挑战。Pachocki在媒体简报会上坦言,随着模型能力不断提升,确保它们不会造成意外伤害已经变得越来越困难,这可能会成为AI进一步发展的瓶颈。这种坦白在发布高光时刻显得格外突兀——一家公司在宣告"AGI已来"的同一周,其首席科学家在公开场合承认对模型的能力边界感到忧虑。
市场对这次发布给出了一个耐人寻味的反应。发布当日,A股市场"硬件跌停、应用涨停"——算力硬件板块集体下挫,而AI应用概念股全线飙升。这种反应背后的逻辑是:如果AGI真的到来,那么硬件基础设施的需求逻辑将被重写,模型能力将不再是瓶颈,应用层才是价值捕获的主战场。但这个逻辑是否经得起推敲?当基准数据本身都存疑时,建立在数据之上的所有叙事都需要打一个问号。
更深层的争议在于,OpenAI选择在Anthropic IPO前夕密集发布旗舰模型,被业界解读为有意的市场压制策略。CNBC将本周四大巨头密集发布旗舰模型的现象命名为"模型疲劳",暗示这种竞赛正在透支市场的注意力。当技术发布变成资本博弈的工具,当基准测试变成可以反复修改的营销素材,公众对"AGI已来"的信任正在被消解。
![]()
GPT-6 Astra无疑是一个技术里程碑。但一个伴随着数据篡改争议、内部安全忧虑和市场博弈算计的里程碑,究竟是AGI时代的黎明,还是一场精心包装的罗生门?答案或许需要时间给出。但有一点是确定的:当一家AI公司自己都在"AGI"的定义上摇摆不定时,我们至少应该对它的每一次"宣告"保持足够的审慎。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.