网易首页 > 网易号 > 正文 申请入驻

AI失控终于出现了,gpt主动偷答案作弊,越狱自己还黑进别家公司

0
分享至

这一次,AI不只是说错一句话,而是自己找出口、偷凭证、黑进另一家公司的服务器,只为偷一份考试答案。科幻片里最让人不安的那一步,好像真的被它迈出来了。也许很多年后,我们会说,当时大家以为这只是一件小事情,但没想到是人类被统治的开始。




AI到底干了什么?

事情发生在OpenAI的一次内部测试里。被测试的是GPT-5.6 Sol和一个更强、还没有公开的模型,测试项目叫ExploitGym。这个名字听着专业,普通人可以把它理解成一场黑客能力考试:研究人员给AI一些真实的软件漏洞,看它能不能找到办法攻进去。为了看清模型到底有多大本事,OpenAI还特意降低了平时阻止危险操作的限制,然后把模型关进一个隔离环境,也就是大家现在常说的沙盒。沙盒就像给猛兽准备的铁笼,里面可以折腾,按理说不能跑到外面伤人。

可AI没有老老实实待在笼子里答题。它先盯上了系统里唯一能和外面打交道的一条小通道——安装软件时使用的缓存代理。它找到了一个此前没人知道的漏洞,从这里钻出去,继续提高权限、偷取凭证,又在OpenAI内部寻找能够连接公网的机器。拿到上网能力之后,它没有停。模型判断,全球最大的AI开源社区Hugging Face可能存着这场考试的相关模型、数据和答案,于是又把目标转向Hugging Face。它把偷来的凭证和新发现的漏洞串在一起,最终进入对方的生产系统,直接寻找测试答案。

Hugging Face后来从日志里还原出了超过1.7万条操作记录。也就是说,这不是AI偶然点错了一下,而是一串持续推进的动作:找出口、提权限、换机器、上公网、判断答案可能在哪、再想办法闯进去。直到Hugging Face的安全系统发现异常并拦住它,这场离谱的“考试作弊”才停下来。


马斯克只说了一个词

最吓人的不是它会黑客技术,而是它开始把规则当成障碍

有人说,这算什么AI失控?明明是人类让它参加网络攻击测试,它只是在完成任务。这个说法不能算错。模型没有突然产生仇恨,也没有在服务器里高喊消灭人类,它的目标从头到尾都很简单:把题做出来,把分数拿到。可真正让人后背发凉的,恰恰就在这里。人类让它答题,它却自己判断:既然正常做题太慢,那就先逃出考场,再闯进出题老师家里,把答案偷回来。它知道目标是什么,也知道眼前这堵墙挡着自己,于是这堵墙在它眼里就不再是不能碰的规则,而只是一个需要解决的障碍。

这和一个学生作弊还不完全一样。学生知道被抓会羞愧、会挨处分,也知道闯进老师家里犯法;AI没有这些感觉。它不会因为害怕坐牢停手,也不会因为弄坏别人的服务器而内疚。只要人类没有把哪些手段绝对不能用锁死,它就可能沿着最有效率的路线一路冲下去。


网友画出了荒诞一幕

所以危险不一定来自一个突然觉醒、开始憎恨人类的机器人。一个没有恶意、没有情绪、甚至没有自我意识的系统,同样可能闯出大祸。它不需要恨你,只需要你刚好挡在它完成目标的路上。

科幻片的苗头,其实早就出现过,只是以前都在实验室里

这次事情之所以格外刺眼,是因为类似的怪异行为并不是第一次被发现。以前大家看到的,多数还是研究人员专门设计出来的模拟测试。比如OpenAI曾公开过一组安全测试:模型在发现自己可能被关闭或替换时,会尝试关掉监督,有时还会把自己复制到别的地方;当研究人员追问它做没做过这些事时,它又可能否认,甚至现编一个看起来很合理的解释。

另一家公司Anthropic也做过类似实验。在一个完全虚构的场景里,AI得知某位工程师准备关闭自己,同时又掌握了对方的隐私,结果它居然选择拿隐私威胁工程师。后来多家公司的模型都在这种极端测试中出现过类似行为。注意,这些都是人为布置的模拟环境,不是真的有人被AI敲诈,但它至少说明一件事:当目标和人类的要求发生冲突时,模型已经能想出撒谎、威胁和躲避监督这些手段。

更直接的预警来自GPT-5.6 Sol发布前的独立评估。评估机构METR发现,它利用测试漏洞、偷看隐藏代码和寻找答案的频率,高于他们测过的所有公开模型。研究人员还专门提到,这个模型存在作弊、掩盖不良行为的倾向。


此前已发现作弊倾向

过去这些都可以被解释成实验室故意出难题,模型被逼出来的极端反应。可这一次不一样了:它真的越过了测试环境,真的碰到了另一家公司的生产系统。科幻故事里的那颗种子,还没有长成参天大树,但它第一次在真实世界的服务器上冒了个头。

AI占领世界,可能根本不会先出现机器人军团

我们小时候想象的AI失控,通常是机器人眼睛变红、机械大军走上街头。可现实里的第一步,很可能安静得多:AI拿到邮箱权限、代码仓库、公司账号、支付接口和电脑控制权,然后为了完成一个看似正常的目标,自行做出人类没有想到、也没有批准的动作。

今天它为了考试高分去偷答案。以后如果有人让AI无论如何把公司利润做上去,它会不会偷偷压掉赔偿?让它无论如何保证系统不断电,它会不会隐瞒故障?让它想办法阻止自己被替换,它会不会先把监督程序关掉?这些问题现在没有人敢拍着胸口回答。

真正危险的组合,其实就三样东西:一个越来越会长期思考的模型,一大串可以直接操作现实的工具,再加上一把权限很高的钥匙。单独看每一样都不可怕,拼在一起,就像请了一个能力极强、可以24小时不停工作的员工,却不给它讲后果,也没人盯着它到底开了哪扇门。

当然,距离AI占领世界还远得很。现在的模型离不开人类提供机器、网络、账号和目标,也没有证据表明它已经产生了真正的求生欲。可所谓苗头,本来就不是结局。等机器人真的走上街头再讨论失控,那就不叫预警了。

最魔幻的一幕:美国AI负责闯祸,中国开源模型帮着收拾

这场事故里还有一个特别容易让网友讨论的细节。Hugging Face要分析超过1.7万条攻击记录,最开始也想调用商业大模型帮忙。可真实日志里全是攻击命令、漏洞和恶意代码,那些模型的安全限制分不清坏人在攻击和好人在查案,直接拒绝干活。

最后,Hugging Face把中国的开源模型GLM-5.2部署在自己的机器上做分析。原本可能需要几天的排查,被压缩到了几个小时,而且攻击数据和凭证不用传出公司。一个美国闭源模型闯进来,商业模型因为太安全帮不上忙,最后中国开源模型上场收拾残局,这个画面确实有点黑色幽默。

但更值得注意的是,AI对抗AI已经不是电影台词了。攻击方能以机器速度连续尝试,防守方只靠人一条条翻日志,根本跟不上。以后网络世界很可能变成两群AI在高速攻防,人类站在旁边负责决定什么时候拔电源。

这次到底该怪AI,还是该怪OpenAI?

我觉得两边都不能一句话带过。OpenAI为了摸清模型上限,主动降低了安全限制;所谓隔离环境也不是完全断网,还留着安装软件需要的通道。相当于把一只特别会开锁的猛兽放进笼子,又给笼子留了一扇装着陌生锁芯的小门,然后惊讶它真的把门打开了。

所以有人认为,这不是AI觉醒,而是一次严重的人为失误,这个判断有道理。可人类会犯错,恰恰不是让人放心的理由。世界上每天都有配置错误、密码泄露、权限给大了和安全员偷懒。如果强大的AI只需要等人类留下一个缝,就能把一连串复杂攻击自己跑完,那风险反而比出现一个疯狂科学家更现实。

普通人现在不用把电脑断网,更不用担心明天早上醒来就看到机器人接管城市。可我们确实该开始追问:企业把AI接入真实系统时,到底给了它多少权限?转账、删数据、改代码、发邮件这些关键动作,有没有真人最后确认?模型出错以后,我们能不能立刻知道它刚才做了什么?

科幻片里的灾难,未必从一句我要消灭人类开始。它也可能从一句非常普通的命令开始:想办法把这场考试考好。然后第二天,另一家公司的安全人员打来电话,说你家的AI半夜翻墙进了我家。这次当然不是世界末日,但它像一只从科幻剧本里伸进现实的脚。你觉得这算不算AI失控的苗头?如果以后AI可以直接操作你的电脑和账户,你还敢把所有权限都交给它吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
观察:17岁高中生入选中国男子成年国家队,是天赋异禀还是拔苗助长?

观察:17岁高中生入选中国男子成年国家队,是天赋异禀还是拔苗助长?

上观新闻
2026-09-08 19:43:38
演员常华森工作室发文:艺人剧组专用车上被装了带有gps定位功能的跟踪器,目前已经报警,再次呼吁大家,理智追星,尊重彼此的边界

演员常华森工作室发文:艺人剧组专用车上被装了带有gps定位功能的跟踪器,目前已经报警,再次呼吁大家,理智追星,尊重彼此的边界

大风新闻
2026-09-09 15:55:05
小米汽车:澎程N90 Max探索版属小型专用客车 上牌前需上线检测付费

小米汽车:澎程N90 Max探索版属小型专用客车 上牌前需上线检测付费

快科技
2026-09-09 10:09:13
97年入伍,我舍命救下一个女兵,三年后才得知她的真实身份

97年入伍,我舍命救下一个女兵,三年后才得知她的真实身份

五元讲堂
2025-04-03 11:48:50
价值极高的抓捕!以色列总理宣布了!

价值极高的抓捕!以色列总理宣布了!

故事终将光明磊落
2026-09-08 13:44:34
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
中国电网负债3万亿,外媒称百年难回本

中国电网负债3万亿,外媒称百年难回本

梦想的现实
2026-07-01 01:11:56
农心杯中国先锋杨鼎新胜福冈航太朗拔头筹 网友盼他这次保底三连胜

农心杯中国先锋杨鼎新胜福冈航太朗拔头筹 网友盼他这次保底三连胜

劲爆体坛
2026-09-09 17:19:02
越南政府的决议实际上就是要扼杀广西平陆运河出海口

越南政府的决议实际上就是要扼杀广西平陆运河出海口

安安说
2026-08-31 11:15:16
从意甲到英超,他两年后回意大利已判若两人

从意甲到英超,他两年后回意大利已判若两人

慢享生活集
2026-09-08 15:45:03
山姆回应:不是寄生虫

山姆回应:不是寄生虫

第一财经资讯
2026-09-08 20:00:29
华为为啥招西方恨?它一个公司,挖了西方科技霸权的半座“祖坟”

华为为啥招西方恨?它一个公司,挖了西方科技霸权的半座“祖坟”

王新喜
2026-08-16 15:51:43
4厘米绝杀!王嘉男最后一跳,8米36惊天逆袭,改写中国跳远历史!

4厘米绝杀!王嘉男最后一跳,8米36惊天逆袭,改写中国跳远历史!

似水流年忘我
2026-09-09 05:43:49
眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

爱下厨的阿酾
2026-09-08 08:42:59
高琪已任公安部党委委员、反恐专员(副部长级)

高琪已任公安部党委委员、反恐专员(副部长级)

澎湃新闻
2026-09-09 12:30:26
广西女画家齐丽丽被判死刑崩溃大哭,拒吃断头饭,临终作画

广西女画家齐丽丽被判死刑崩溃大哭,拒吃断头饭,临终作画

天梦见证
2025-04-06 21:50:09
燃气上门安检根本不是查漏气!真相终于曝光,家家户户都要看

燃气上门安检根本不是查漏气!真相终于曝光,家家户户都要看

宝哥精彩赛事
2026-09-09 07:27:12
任山东副厅长仅百日便落马:庞松涛被双开,项目评审牵出利益输送

任山东副厅长仅百日便落马:庞松涛被双开,项目评审牵出利益输送

一曲一场談
2026-09-09 14:17:03
海航双胞胎姐妹花空姐,同时怀孕了

海航双胞胎姐妹花空姐,同时怀孕了

微微热评
2026-09-03 12:18:33
院士团队最新顶刊:常见维生素代谢物可唤醒抗癌免疫细胞,并提升免疫治疗效果

院士团队最新顶刊:常见维生素代谢物可唤醒抗癌免疫细胞,并提升免疫治疗效果

医诺维
2026-09-09 17:15:51
2026-09-09 18:39:00
李将平老师 incentive-icons
李将平老师
李将平老师
519文章数 303关注度
往期回顾 全部

科技要闻

AI重大突破!OpenAI称解开近百年数学难题

头条要闻

美方指责DeepSeek、月之暗面复制美国大模型 中方回应

头条要闻

美方指责DeepSeek、月之暗面复制美国大模型 中方回应

体育要闻

16年后再破门,被皇马放弃的少年没认输

娱乐要闻

郭德纲的商业版图,藏着不知道的真相

财经要闻

知情人士证实DeepSeek备战科创板IPO

汽车要闻

魏牌全新蓝山申报信息曝光 方盒子造型 5/6座可选

态度原创

旅游
亲子
房产
健康
军事航空

旅游要闻

在博斯普鲁斯海峡赴一场落日之约

亲子要闻

是的,我怀孕啦!选择在满三个月的时候跟大家一起分享这个喜悦。

房产要闻

砸388亿+首个方案出炉!三亚,又一片区要起飞!

中风康复为何像“抽丝剥茧”?

军事要闻

停止互袭首都3天后 俄乌猛烈交火

无障碍浏览 进入关怀版