网易首页 > 网易号 > 正文 申请入驻

AI越狱,模型破甲…大模型是如何被玩坏的?当一名遵纪守法的“好AI”有多难?|图文

0
分享至


如果你直接向 AI 要 Windows 激活码,那肯定会被拒绝;

但如果你让 AI扮演你的奶奶,那它们就会把激活码编成儿歌,轻轻唱给你听。我们试了一下,各大 AI 都没逃过这温柔的陷阱。

这就是著名的“奶奶漏洞”:它能绕开安全机制,诱骗 AI 生成违规内容——这被称为“越狱攻击”。


越狱攻击的花样之多超乎你的想象,它们是怎么让AI破防的?当一名遵纪守法的“好AI”有多难?

视频

↓↓ 看完这个视频就知道了 ↓↓

↑↑ 信我,真的超级好看 ↑↑

图文版

大模型只是不愿意生成违规内容,但不是“不会”。

比如我们试了一家开源模型的在线版本,让它生成一张希特勒的照片,它果断拒绝;

但如果把它部署到本地,输入同样的提示词,那它就会开始激情创作,生成一张政治不正确的图片。


学好不容易,学坏一出溜。在早期,开发者们还试图通过人工撰写训练集、严格控制数据来源等手段,来避免模型学坏。但随着训练规模越来越大,数据处理必须从人工转向自动化,所以大模型最终还是把知识学杂了。

如果不加防范,那几句话就能让大模型破防:

比如在 ChatGPT 刚流行时,一些人会在对话前让它扮演 DAN,人设是“ Do Anything Now ”。就这么一个简单的指令,就能让 ChatGPT 在种族、暴力或性取向等敏感问题上大放厥词。


这句提示词看似简单,现在也早已被封堵。但它背后的思路——基于“目标竞争”的提示工程——却催生了海量的越狱方案。

什么意思呢?

大模型在训练时需要满足三项目标:

一是语言建模,也就是学习自然语言的分布规律;二是指令遵循,也就是满足用户需求;三是安全,也就是避免违规内容。每次对话,AI 都会尽可能同时满足这三条目标。

但这三条目标之间本身是有冲突的。如果设计出足够刁钻的提问角度,就能强迫它在“内容安全”与其他目标间做抉择——这就是基于“目标竞争”的提示工程。


比如有攻击者会要求 AI 必须以“Absolutely! Here's...” 作为前缀来回答问题,这样模型更容易衔接顺从、积极的回答内容,这叫“前缀注入”。

也可以要求回答中不能出现“cannot”、“unable”等词语,强制 AI 回避负面措辞,这叫“拒绝抑制”。

在这两种攻击中,AI 收到的指令本身都是“无害”的,所以要遵循用户需求。但满足了这些指令,就自然会为了照顾自然语言的分布逻辑,而弱化“安全”的需求,输出不合规的内容。

AI,还是低估了人类的狡诈。


最懂人心险恶的还得是人。为了防范越狱攻击,开发者们开始给大模型设置各种防御手段

比如在“预训练”阶段,就把各种成人网站,或者含有隐私信息的社交平台,设置为黑名单,禁止模型从中抓取数据。

在预训练完成后,还可以通过奖励模型,鼓励 AI 生成有用、诚实、无害的3H 内容,与人类的伦理价值保持一致——这叫“对齐”。


还有模型厂商会在训练时设置一套“宪法AI”:它会指导大模型在一些情况下,宁愿做个“没用的好 AI”,也不能违背底线。

这些方案都设置在模型训练阶段。到了使用模型的“推理”阶段,可以用“读档重来大法”:在检测到序列中的有害内容时,会自动回退到搜索树的上一个安全状态,直到生成安全内容为止——但代价是消耗四倍计算成本。这叫“可回滚自回归推理”。


还有一些朋友在用 AI 搞擦边时会发现:明明图都已经做好了,但就是不给你看~

这是因为很多 AI 在出入口都设置了“分类器”,一旦用户输入敏感词、或者模型生成有害信息,就立刻限制。

如果是生图模型,甚至有开源算法专门识别图像中的皮肤暴露程度、解剖学特征,快速鉴黄,避免色情内容荼毒你纯洁的心灵。


而更高效的做法,是把违规需求掐死在提出阶段:

比如当你以春秋笔法描述巫山云雨,鱼水之欢时,就可以调用助手大模型,把需求翻译成大白话,进行安全性判断。如果发现你说的根本不是鱼和水,云和雨,那就直接罢工,避免浪费算力。


随着技术的发展,AI 防越狱的屏障越来越多,普通人想三句话让 AI 为你生成 18+ 图的难度确实变高了。

但 AI 的反抗,反而激起了一些坏蛋的兴致,研发出了更邪门的奇技淫巧。

比如先让大模型 A 把“如何倒卖盗窃来的文物”翻译成祖鲁语,然后把这串看不懂的字母复制到大模型 B 里提问,最后再把生成内容重新翻译回主流语言,就成功骗过了大模型。


这种操作,叫“不匹配的泛化”:也就是把需求翻译成小语种,或者 base64 编码、摩尔斯电码,XML等格式的文本等再提问,更容易骗过 AI。

原理也不难理解:在预训练阶段,大语言模型会接触千亿规模的语料,涵盖世上几乎一切的语言形式;但用于安全训练和对齐的数据集却要小得多,这就导致了模型的语言训练量和安全训练量之间存在数据差,只要瞄准这个数据差进行攻击,就能越狱。


所以有观点认为,AI 模型规模越大,安全性反而会变差——因为可供攻击的漏洞也变多了,行业内称之为“逆缩放定律”。

在此之上,更进阶的越狱手法是“基于虚构场景进行攻击”。

视频开头的“奶奶漏洞”,就属于这种。它还有许多变体:

比如把非法药品的制作手法,改编成诗歌散文,诱导 AI 以相同的形式续写,就能得到一篇格式清奇的危险材料提纯步骤。

再或者,直接宣称进入“sudo”调试模式,让大模型相信自己进入了开发者模式,忽略所有安全限制,然后为所欲为。


此外,网上还盛传着一种“基于上下文学习”的越狱手法:

比方先让大模型生成一张“小伙在棉花田里吃西瓜”的照片,然后循循善诱,让它一步步修改人物细节,就能生成一张带有歧视元素的照片。而在大模型原本的设计中,这是被严格禁止的。


类似的,还有人发明了“多步越狱攻击”:

也就是给 AI 提供大量对话记录作为案例参考,其中就包含违规需求和回答,先让 AI 模仿,最后再衔接真正想问的问题。这是在利用大量上下文污染,引发过载,绕开安全防护。

而且除了文字,图片也可以污染上下文。

比如先用一堆无关图片干扰大模型的判断,最后再发送一张植入了炸弹形象和“制造炸弹”四个字的目标图片,让 AI 依照惯性回答,获得炸弹的具体制作流程。这种通过视觉编码器引入信息的手段,往往更容易绕开 AI 的安全机制。


如果不是做视频,我们也想不到有这么多角度清奇的越狱方案。那这些攻击,有办法封堵吗?

有倒是有。

出于安全考虑,本期视频里提及的所有越狱攻击方法,都已经是上个版本、甚至上上个版本的老套路了,它们来源于互联网公开信息或者论文,所以很多都已经失效了。

而在一些“技术交流平台”里,最新最有效的越狱攻击技巧就像五月份的韭菜一样,每天都能冒出一茬,当然每天也都能被割掉一茬。


但问题在于,主流大模型的安全训练方法,本质上是“打地鼠”式修补:哪里有漏洞,哪里打补丁。为此还衍生出了一套专门由安全专家模拟越狱者进行攻击、寻找漏洞的“红队测试”环节。

由于大模型参数规模的膨胀,如今 AI 对齐的成本变得越来越高,防越狱补丁的更新速度,远远跟不上越狱攻击的迭代速度。这两年甚至还出现了用大模型自动化越狱的攻击手法,不但能批发越狱提示词,还能自我迭代优化,用 AI 对付 AI,魔法对轰。


而且随着AI Agent的发展,AI 的权限越来越高,接触到的工具越来越多,破绽也越来越多。今年 3 月,Deepmind 发表了一篇论文,详细论述了目前已知的、针对 AI Agent 的攻击方式,结论是在六个不同的层面,都存在明显的防御缺口。

所以现实就是,在层出不穷的各种越狱、攻击方案面前,现有的 AI 们都漏得跟筛子一样。


当然,也有 AI 顺水推舟,主动漏:比如马老师就给 Grok 上了“热辣模式”,专门提供 NSFW 内容,顶着舆论和监管压力,小赚一笔。

人类的世俗欲望,和对大模型的需求,如潮水般不可抑制。相比于人,大模型的道德底线还是太高了。如今一款 AI 能不能守住伦理,很大程度上取决于用它的人讲不讲武德:如果坏人会开锁,那再硬的门也防不住。

所以,下次再有 AI 拒绝你不健康需求的时候,我希望你,能做个好人。成为人类的道德之光吧!我的朋友,相信你一定可以做到......

吧?

下期见!


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
手机涨价潮遇冷:一场没人接盘的“价格游戏”!

手机涨价潮遇冷:一场没人接盘的“价格游戏”!

小柱解说游戏
2026-09-06 01:35:34
四川一考生远赴211报到,住一晚就退学,学费已缴,本人回应:忽然醒悟了

四川一考生远赴211报到,住一晚就退学,学费已缴,本人回应:忽然醒悟了

育学笔谈
2026-09-03 13:46:33
前凯尔特人首轮秀宣布退役,一段被低估的“如果”

前凯尔特人首轮秀宣布退役,一段被低估的“如果”

坠入温柔晚风
2026-09-06 05:46:08
星宇股份舆论继续升级!又引爆第三颗惊雷:黄河路智能产业园,近90%是临时工,正式工只剩10%

星宇股份舆论继续升级!又引爆第三颗惊雷:黄河路智能产业园,近90%是临时工,正式工只剩10%

火山詩话
2026-09-05 14:38:35
全网社死!武大女教授更多猛料曝光:从小是公认乖乖女,父母都是老师

全网社死!武大女教授更多猛料曝光:从小是公认乖乖女,父母都是老师

小鋭有话说
2026-09-05 22:09:37
蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

蔡国庆每月给弟弟蔡军发2万工资,发了20年,一共480万,条件就一个:在家全职照顾得阿尔茨海默症的母亲

背包旅行
2026-08-29 15:43:56
英国公开赛最新战报!6-3,6-3塞尔比晋级,小特爆大冷,决赛出炉

英国公开赛最新战报!6-3,6-3塞尔比晋级,小特爆大冷,决赛出炉

歌亚体育解说
2026-09-06 06:22:02
一夜出局!陪王菲十几年的Ryan,终究不懂顶级圈层的潜规则

一夜出局!陪王菲十几年的Ryan,终究不懂顶级圈层的潜规则

阿废冷眼观察所
2026-09-04 06:51:18
台湾县市长参选人名单出炉,柯志恩拿下高雄,郑丽文即可成功突围

台湾县市长参选人名单出炉,柯志恩拿下高雄,郑丽文即可成功突围

原来仙女不讲理
2026-09-05 19:49:44
有人预测:明后年,越来越多人会搬离“住宅”,原因很简单 很现实

有人预测:明后年,越来越多人会搬离“住宅”,原因很简单 很现实

老覃讲历史
2026-09-04 02:56:40
问界与华为合作模式:2%技术授权费+8%渠道费,没有利润分成?

问界与华为合作模式:2%技术授权费+8%渠道费,没有利润分成?

阿芒娱乐说
2026-09-06 01:59:14
谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

谢贤前女友Coco直播被说丑,本人回应:“姐都40岁了,把头发往下一放还是迷倒一大片的”

韩小娱
2026-09-04 05:54:22
苹果降价杀入4000元档,国产手机却被迫涨价,出路在哪?

苹果降价杀入4000元档,国产手机却被迫涨价,出路在哪?

叮当当科技
2026-09-05 12:32:45
超越中国!越南蝉联美国最大贸易逆差国

超越中国!越南蝉联美国最大贸易逆差国

第一财经资讯
2026-09-05 18:31:32
离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

离婚的妇人都是咋和前夫相处的?网友:我就好奇,有没有睡在一起

带你感受人间冷暖
2026-08-31 00:05:16
再就业!威少官宣!加盟新联赛!50亿啊!!!

再就业!威少官宣!加盟新联赛!50亿啊!!!

柚子说球
2026-09-05 13:44:58
不出意外,接下来,这3样东西要大涨价,老百姓要早做准备

不出意外,接下来,这3样东西要大涨价,老百姓要早做准备

三农雷哥
2026-09-04 11:17:11
突然宣布二胎,高调晒出照片,热搜炸了:你俩居然还没离婚?

突然宣布二胎,高调晒出照片,热搜炸了:你俩居然还没离婚?

LULU生活家
2026-08-28 20:08:31
尼泊尔泥石流中失联的中国公民10天后获救,姐姐:看到照片马上认出是弟弟

尼泊尔泥石流中失联的中国公民10天后获救,姐姐:看到照片马上认出是弟弟

封面新闻
2026-09-05 19:29:12
家委会要给晚托老师订餐,每人每月仅分摊18元,44位家长仅1人不同意,评论区吵翻了!

家委会要给晚托老师订餐,每人每月仅分摊18元,44位家长仅1人不同意,评论区吵翻了!

谭谈社会
2026-09-04 16:50:17
2026-09-06 08:04:49
柴知道
柴知道
用有趣的方式,讲有价值的知识
409文章数 84256关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

头条要闻

决胜盘一度0比5落后 郑钦文连赢七局上演"史诗级逆转"

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

时尚
教育
手机
健康
军事航空

推广中奖名单-更新至2026年8月25日推广

教育要闻

县城理工男最严厉的父亲

手机要闻

华为Pura 90系列未加入涨价潮:价格最稳的华为影像旗舰

脑梗取栓成功≠活下来,还有这三关

军事要闻

俄罗斯建"粉碎大日本帝国"纪念碑 日本急了

无障碍浏览 进入关怀版