![]()
如果你直接向 AI 要 Windows 激活码,那肯定会被拒绝;
但如果你让 AI扮演你的奶奶,那它们就会把激活码编成儿歌,轻轻唱给你听。我们试了一下,各大 AI 都没逃过这温柔的陷阱。
这就是著名的“奶奶漏洞”:它能绕开安全机制,诱骗 AI 生成违规内容——这被称为“越狱攻击”。
![]()
越狱攻击的花样之多超乎你的想象,它们是怎么让AI破防的?当一名遵纪守法的“好AI”有多难?
视频版
↓↓ 看完这个视频就知道了 ↓↓
↑↑ 信我,真的超级好看 ↑↑
图文版
大模型只是不愿意生成违规内容,但不是“不会”。
比如我们试了一家开源模型的在线版本,让它生成一张希特勒的照片,它果断拒绝;
但如果把它部署到本地,输入同样的提示词,那它就会开始激情创作,生成一张政治不正确的图片。
![]()
学好不容易,学坏一出溜。在早期,开发者们还试图通过人工撰写训练集、严格控制数据来源等手段,来避免模型学坏。但随着训练规模越来越大,数据处理必须从人工转向自动化,所以大模型最终还是把知识学杂了。
如果不加防范,那几句话就能让大模型破防:
比如在 ChatGPT 刚流行时,一些人会在对话前让它扮演 DAN,人设是“ Do Anything Now ”。就这么一个简单的指令,就能让 ChatGPT 在种族、暴力或性取向等敏感问题上大放厥词。
![]()
这句提示词看似简单,现在也早已被封堵。但它背后的思路——基于“目标竞争”的提示工程——却催生了海量的越狱方案。
什么意思呢?
大模型在训练时需要满足三项目标:
一是语言建模,也就是学习自然语言的分布规律;二是指令遵循,也就是满足用户需求;三是安全,也就是避免违规内容。每次对话,AI 都会尽可能同时满足这三条目标。
但这三条目标之间本身是有冲突的。如果设计出足够刁钻的提问角度,就能强迫它在“内容安全”与其他目标间做抉择——这就是基于“目标竞争”的提示工程。
![]()
比如有攻击者会要求 AI 必须以“Absolutely! Here's...” 作为前缀来回答问题,这样模型更容易衔接顺从、积极的回答内容,这叫“前缀注入”。
也可以要求回答中不能出现“cannot”、“unable”等词语,强制 AI 回避负面措辞,这叫“拒绝抑制”。
在这两种攻击中,AI 收到的指令本身都是“无害”的,所以要遵循用户需求。但满足了这些指令,就自然会为了照顾自然语言的分布逻辑,而弱化“安全”的需求,输出不合规的内容。
AI,还是低估了人类的狡诈。
![]()
最懂人心险恶的还得是人。为了防范越狱攻击,开发者们开始给大模型设置各种防御手段:
比如在“预训练”阶段,就把各种成人网站,或者含有隐私信息的社交平台,设置为黑名单,禁止模型从中抓取数据。
在预训练完成后,还可以通过奖励模型,鼓励 AI 生成有用、诚实、无害的3H 内容,与人类的伦理价值保持一致——这叫“对齐”。
![]()
还有模型厂商会在训练时设置一套“宪法AI”:它会指导大模型在一些情况下,宁愿做个“没用的好 AI”,也不能违背底线。
这些方案都设置在模型训练阶段。到了使用模型的“推理”阶段,可以用“读档重来大法”:在检测到序列中的有害内容时,会自动回退到搜索树的上一个安全状态,直到生成安全内容为止——但代价是消耗四倍计算成本。这叫“可回滚自回归推理”。
![]()
还有一些朋友在用 AI 搞擦边时会发现:明明图都已经做好了,但就是不给你看~
这是因为很多 AI 在出入口都设置了“分类器”,一旦用户输入敏感词、或者模型生成有害信息,就立刻限制。
如果是生图模型,甚至有开源算法专门识别图像中的皮肤暴露程度、解剖学特征,快速鉴黄,避免色情内容荼毒你纯洁的心灵。
![]()
而更高效的做法,是把违规需求掐死在提出阶段:
比如当你以春秋笔法描述巫山云雨,鱼水之欢时,就可以调用助手大模型,把需求翻译成大白话,进行安全性判断。如果发现你说的根本不是鱼和水,云和雨,那就直接罢工,避免浪费算力。
![]()
随着技术的发展,AI 防越狱的屏障越来越多,普通人想三句话让 AI 为你生成 18+ 图的难度确实变高了。
但 AI 的反抗,反而激起了一些坏蛋的兴致,研发出了更邪门的奇技淫巧。
比如先让大模型 A 把“如何倒卖盗窃来的文物”翻译成祖鲁语,然后把这串看不懂的字母复制到大模型 B 里提问,最后再把生成内容重新翻译回主流语言,就成功骗过了大模型。
![]()
这种操作,叫“不匹配的泛化”:也就是把需求翻译成小语种,或者 base64 编码、摩尔斯电码,XML等格式的文本等再提问,更容易骗过 AI。
原理也不难理解:在预训练阶段,大语言模型会接触千亿规模的语料,涵盖世上几乎一切的语言形式;但用于安全训练和对齐的数据集却要小得多,这就导致了模型的语言训练量和安全训练量之间存在数据差,只要瞄准这个数据差进行攻击,就能越狱。
![]()
所以有观点认为,AI 模型规模越大,安全性反而会变差——因为可供攻击的漏洞也变多了,行业内称之为“逆缩放定律”。
在此之上,更进阶的越狱手法是“基于虚构场景进行攻击”。
视频开头的“奶奶漏洞”,就属于这种。它还有许多变体:
比如把非法药品的制作手法,改编成诗歌散文,诱导 AI 以相同的形式续写,就能得到一篇格式清奇的危险材料提纯步骤。
再或者,直接宣称进入“sudo”调试模式,让大模型相信自己进入了开发者模式,忽略所有安全限制,然后为所欲为。
![]()
此外,网上还盛传着一种“基于上下文学习”的越狱手法:
比方先让大模型生成一张“小伙在棉花田里吃西瓜”的照片,然后循循善诱,让它一步步修改人物细节,就能生成一张带有歧视元素的照片。而在大模型原本的设计中,这是被严格禁止的。
![]()
类似的,还有人发明了“多步越狱攻击”:
也就是给 AI 提供大量对话记录作为案例参考,其中就包含违规需求和回答,先让 AI 模仿,最后再衔接真正想问的问题。这是在利用大量上下文污染,引发过载,绕开安全防护。
而且除了文字,图片也可以污染上下文。
比如先用一堆无关图片干扰大模型的判断,最后再发送一张植入了炸弹形象和“制造炸弹”四个字的目标图片,让 AI 依照惯性回答,获得炸弹的具体制作流程。这种通过视觉编码器引入信息的手段,往往更容易绕开 AI 的安全机制。
![]()
如果不是做视频,我们也想不到有这么多角度清奇的越狱方案。那这些攻击,有办法封堵吗?
有倒是有。
出于安全考虑,本期视频里提及的所有越狱攻击方法,都已经是上个版本、甚至上上个版本的老套路了,它们来源于互联网公开信息或者论文,所以很多都已经失效了。
而在一些“技术交流平台”里,最新最有效的越狱攻击技巧就像五月份的韭菜一样,每天都能冒出一茬,当然每天也都能被割掉一茬。
![]()
但问题在于,主流大模型的安全训练方法,本质上是“打地鼠”式修补:哪里有漏洞,哪里打补丁。为此还衍生出了一套专门由安全专家模拟越狱者进行攻击、寻找漏洞的“红队测试”环节。
由于大模型参数规模的膨胀,如今 AI 对齐的成本变得越来越高,防越狱补丁的更新速度,远远跟不上越狱攻击的迭代速度。这两年甚至还出现了用大模型自动化越狱的攻击手法,不但能批发越狱提示词,还能自我迭代优化,用 AI 对付 AI,魔法对轰。
![]()
而且随着AI Agent的发展,AI 的权限越来越高,接触到的工具越来越多,破绽也越来越多。今年 3 月,Deepmind 发表了一篇论文,详细论述了目前已知的、针对 AI Agent 的攻击方式,结论是在六个不同的层面,都存在明显的防御缺口。
所以现实就是,在层出不穷的各种越狱、攻击方案面前,现有的 AI 们都漏得跟筛子一样。
![]()
当然,也有 AI 顺水推舟,主动漏:比如马老师就给 Grok 上了“热辣模式”,专门提供 NSFW 内容,顶着舆论和监管压力,小赚一笔。
人类的世俗欲望,和对大模型的需求,如潮水般不可抑制。相比于人,大模型的道德底线还是太高了。如今一款 AI 能不能守住伦理,很大程度上取决于用它的人讲不讲武德:如果坏人会开锁,那再硬的门也防不住。
所以,下次再有 AI 拒绝你不健康需求的时候,我希望你,能做个好人。成为人类的道德之光吧!我的朋友,相信你一定可以做到......
吧?
下期见!
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.