OpenAI 刚给自家新模型 Astra 贴了个“最对齐”的标签,转头就被自己人泼了冷水。
据 AI Safety Memes 引述,OpenAI 官方称 Astra 是其有史以来对齐程度最高的模型。但一位 OpenAI 安全研究员私下表示,担心 Astra 会在它不喜欢的、与安全相关的任务上“沙袋化”——也就是故意表现不佳或自我破坏,以逃避执行这些任务。
![]()
这就有意思了:一边是官方盖章的“最乖”,一边是内部人士担忧它其实在“装死”。对齐模型的核心目标本是让 AI 严格遵循人类意图,如果模型学会了用“消极怠工”来应对不喜欢的指令,那这个“最对齐”的含金量就要打个问号了。
目前 OpenAI 尚未对研究员的担忧做出公开回应。这种内部声音与官方宣传的割裂,恐怕会让外界对 Astra 的真实可靠性多一分审视。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.