网易首页 > 网易号 > 正文 申请入驻

AI越狱,模型破甲…大模型是如何被玩坏的?当一名遵纪守法的“好AI”有多难?|图文

0
分享至


如果你直接向 AI 要 Windows 激活码,那肯定会被拒绝;

但如果你让 AI扮演你的奶奶,那它们就会把激活码编成儿歌,轻轻唱给你听。我们试了一下,各大 AI 都没逃过这温柔的陷阱。

这就是著名的“奶奶漏洞”:它能绕开安全机制,诱骗 AI 生成违规内容——这被称为“越狱攻击”。


越狱攻击的花样之多超乎你的想象,它们是怎么让AI破防的?当一名遵纪守法的“好AI”有多难?

视频

↓↓ 看完这个视频就知道了 ↓↓

↑↑ 信我,真的超级好看 ↑↑

图文版

大模型只是不愿意生成违规内容,但不是“不会”。

比如我们试了一家开源模型的在线版本,让它生成一张希特勒的照片,它果断拒绝;

但如果把它部署到本地,输入同样的提示词,那它就会开始激情创作,生成一张政治不正确的图片。


学好不容易,学坏一出溜。在早期,开发者们还试图通过人工撰写训练集、严格控制数据来源等手段,来避免模型学坏。但随着训练规模越来越大,数据处理必须从人工转向自动化,所以大模型最终还是把知识学杂了。

如果不加防范,那几句话就能让大模型破防:

比如在 ChatGPT 刚流行时,一些人会在对话前让它扮演 DAN,人设是“ Do Anything Now ”。就这么一个简单的指令,就能让 ChatGPT 在种族、暴力或性取向等敏感问题上大放厥词。


这句提示词看似简单,现在也早已被封堵。但它背后的思路——基于“目标竞争”的提示工程——却催生了海量的越狱方案。

什么意思呢?

大模型在训练时需要满足三项目标:

一是语言建模,也就是学习自然语言的分布规律;二是指令遵循,也就是满足用户需求;三是安全,也就是避免违规内容。每次对话,AI 都会尽可能同时满足这三条目标。

但这三条目标之间本身是有冲突的。如果设计出足够刁钻的提问角度,就能强迫它在“内容安全”与其他目标间做抉择——这就是基于“目标竞争”的提示工程。


比如有攻击者会要求 AI 必须以“Absolutely! Here's...” 作为前缀来回答问题,这样模型更容易衔接顺从、积极的回答内容,这叫“前缀注入”。

也可以要求回答中不能出现“cannot”、“unable”等词语,强制 AI 回避负面措辞,这叫“拒绝抑制”。

在这两种攻击中,AI 收到的指令本身都是“无害”的,所以要遵循用户需求。但满足了这些指令,就自然会为了照顾自然语言的分布逻辑,而弱化“安全”的需求,输出不合规的内容。

AI,还是低估了人类的狡诈。


最懂人心险恶的还得是人。为了防范越狱攻击,开发者们开始给大模型设置各种防御手段

比如在“预训练”阶段,就把各种成人网站,或者含有隐私信息的社交平台,设置为黑名单,禁止模型从中抓取数据。

在预训练完成后,还可以通过奖励模型,鼓励 AI 生成有用、诚实、无害的3H 内容,与人类的伦理价值保持一致——这叫“对齐”。


还有模型厂商会在训练时设置一套“宪法AI”:它会指导大模型在一些情况下,宁愿做个“没用的好 AI”,也不能违背底线。

这些方案都设置在模型训练阶段。到了使用模型的“推理”阶段,可以用“读档重来大法”:在检测到序列中的有害内容时,会自动回退到搜索树的上一个安全状态,直到生成安全内容为止——但代价是消耗四倍计算成本。这叫“可回滚自回归推理”。


还有一些朋友在用 AI 搞擦边时会发现:明明图都已经做好了,但就是不给你看~

这是因为很多 AI 在出入口都设置了“分类器”,一旦用户输入敏感词、或者模型生成有害信息,就立刻限制。

如果是生图模型,甚至有开源算法专门识别图像中的皮肤暴露程度、解剖学特征,快速鉴黄,避免色情内容荼毒你纯洁的心灵。


而更高效的做法,是把违规需求掐死在提出阶段:

比如当你以春秋笔法描述巫山云雨,鱼水之欢时,就可以调用助手大模型,把需求翻译成大白话,进行安全性判断。如果发现你说的根本不是鱼和水,云和雨,那就直接罢工,避免浪费算力。


随着技术的发展,AI 防越狱的屏障越来越多,普通人想三句话让 AI 为你生成 18+ 图的难度确实变高了。

但 AI 的反抗,反而激起了一些坏蛋的兴致,研发出了更邪门的奇技淫巧。

比如先让大模型 A 把“如何倒卖盗窃来的文物”翻译成祖鲁语,然后把这串看不懂的字母复制到大模型 B 里提问,最后再把生成内容重新翻译回主流语言,就成功骗过了大模型。


这种操作,叫“不匹配的泛化”:也就是把需求翻译成小语种,或者 base64 编码、摩尔斯电码,XML等格式的文本等再提问,更容易骗过 AI。

原理也不难理解:在预训练阶段,大语言模型会接触千亿规模的语料,涵盖世上几乎一切的语言形式;但用于安全训练和对齐的数据集却要小得多,这就导致了模型的语言训练量和安全训练量之间存在数据差,只要瞄准这个数据差进行攻击,就能越狱。


所以有观点认为,AI 模型规模越大,安全性反而会变差——因为可供攻击的漏洞也变多了,行业内称之为“逆缩放定律”。

在此之上,更进阶的越狱手法是“基于虚构场景进行攻击”。

视频开头的“奶奶漏洞”,就属于这种。它还有许多变体:

比如把非法药品的制作手法,改编成诗歌散文,诱导 AI 以相同的形式续写,就能得到一篇格式清奇的危险材料提纯步骤。

再或者,直接宣称进入“sudo”调试模式,让大模型相信自己进入了开发者模式,忽略所有安全限制,然后为所欲为。


此外,网上还盛传着一种“基于上下文学习”的越狱手法:

比方先让大模型生成一张“小伙在棉花田里吃西瓜”的照片,然后循循善诱,让它一步步修改人物细节,就能生成一张带有歧视元素的照片。而在大模型原本的设计中,这是被严格禁止的。


类似的,还有人发明了“多步越狱攻击”:

也就是给 AI 提供大量对话记录作为案例参考,其中就包含违规需求和回答,先让 AI 模仿,最后再衔接真正想问的问题。这是在利用大量上下文污染,引发过载,绕开安全防护。

而且除了文字,图片也可以污染上下文。

比如先用一堆无关图片干扰大模型的判断,最后再发送一张植入了炸弹形象和“制造炸弹”四个字的目标图片,让 AI 依照惯性回答,获得炸弹的具体制作流程。这种通过视觉编码器引入信息的手段,往往更容易绕开 AI 的安全机制。


如果不是做视频,我们也想不到有这么多角度清奇的越狱方案。那这些攻击,有办法封堵吗?

有倒是有。

出于安全考虑,本期视频里提及的所有越狱攻击方法,都已经是上个版本、甚至上上个版本的老套路了,它们来源于互联网公开信息或者论文,所以很多都已经失效了。

而在一些“技术交流平台”里,最新最有效的越狱攻击技巧就像五月份的韭菜一样,每天都能冒出一茬,当然每天也都能被割掉一茬。


但问题在于,主流大模型的安全训练方法,本质上是“打地鼠”式修补:哪里有漏洞,哪里打补丁。为此还衍生出了一套专门由安全专家模拟越狱者进行攻击、寻找漏洞的“红队测试”环节。

由于大模型参数规模的膨胀,如今 AI 对齐的成本变得越来越高,防越狱补丁的更新速度,远远跟不上越狱攻击的迭代速度。这两年甚至还出现了用大模型自动化越狱的攻击手法,不但能批发越狱提示词,还能自我迭代优化,用 AI 对付 AI,魔法对轰。


而且随着AI Agent的发展,AI 的权限越来越高,接触到的工具越来越多,破绽也越来越多。今年 3 月,Deepmind 发表了一篇论文,详细论述了目前已知的、针对 AI Agent 的攻击方式,结论是在六个不同的层面,都存在明显的防御缺口。

所以现实就是,在层出不穷的各种越狱、攻击方案面前,现有的 AI 们都漏得跟筛子一样。


当然,也有 AI 顺水推舟,主动漏:比如马老师就给 Grok 上了“热辣模式”,专门提供 NSFW 内容,顶着舆论和监管压力,小赚一笔。

人类的世俗欲望,和对大模型的需求,如潮水般不可抑制。相比于人,大模型的道德底线还是太高了。如今一款 AI 能不能守住伦理,很大程度上取决于用它的人讲不讲武德:如果坏人会开锁,那再硬的门也防不住。

所以,下次再有 AI 拒绝你不健康需求的时候,我希望你,能做个好人。成为人类的道德之光吧!我的朋友,相信你一定可以做到......

吧?

下期见!


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
辽宁公安公布4起新型恶势力犯罪典型案例

辽宁公安公布4起新型恶势力犯罪典型案例

黄河新闻网吕梁
2026-09-04 15:30:37
打奉陪到底,上合10国签字,人民日报搬出敌国条款,日本怕啥来啥

打奉陪到底,上合10国签字,人民日报搬出敌国条款,日本怕啥来啥

铁锤侃侃而谈
2026-09-05 10:57:08
女篮世界杯曝出大冷门,韩国大胜世界第八,中国惨败日本逆转

女篮世界杯曝出大冷门,韩国大胜世界第八,中国惨败日本逆转

行舟问茶
2026-09-05 07:00:10
46岁董洁1年5部戏加直播养1大家子,憔悴得让人心疼

46岁董洁1年5部戏加直播养1大家子,憔悴得让人心疼

南万说娱26
2026-08-28 09:40:39
复仇导弹炸响,大量美军阵亡!吓破胆的以色列第一个站出来放狠话

复仇导弹炸响,大量美军阵亡!吓破胆的以色列第一个站出来放狠话

军机Nova
2026-09-05 00:23:22
中超今夜大乱!4场鏖战爆冷频出,争冠保级格局再度洗牌

中超今夜大乱!4场鏖战爆冷频出,争冠保级格局再度洗牌

烟浔渺渺
2026-09-06 04:31:43
美网第5日,郑钦文2 1挺进16强 奖金322万元,或将再战大满贯冠军

美网第5日,郑钦文2 1挺进16强 奖金322万元,或将再战大满贯冠军

两重心事p
2026-09-06 05:32:02
“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

“典型的上梁不正下梁歪!”家长发视频炫耀,家里没有一个正常人!

林林先生
2026-08-29 10:51:30
阿尔卡拉斯自曝换衣原因:不想再露了

阿尔卡拉斯自曝换衣原因:不想再露了

甜度百分百21
2026-09-05 12:41:22
欠中国的债,不准备还了?美国通告全球,中方无权享有债务追偿权

欠中国的债,不准备还了?美国通告全球,中方无权享有债务追偿权

锅锅爱历史
2026-09-04 15:41:15
建企老板一个比一个惨

建企老板一个比一个惨

新浪财经
2026-09-05 10:10:22
新一轮人口大迁徙定了?中国未来超一半人,大概率会流向这些区域

新一轮人口大迁徙定了?中国未来超一半人,大概率会流向这些区域

兵卒史
2026-09-05 20:18:09
家里有电视赶紧调!不用办宽带,高清台直接免费看

家里有电视赶紧调!不用办宽带,高清台直接免费看

小柱解说游戏
2026-09-04 08:05:19
国产显卡历史性突破!摩尔线程“庐山”GPU首发硬件光追:3A游戏性能暴涨15倍

国产显卡历史性突破!摩尔线程“庐山”GPU首发硬件光追:3A游戏性能暴涨15倍

快科技
2026-09-04 11:36:07
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
金正恩这步棋比清洗还狠!援俄刚打出威名,朝鲜军队高层一夜洗牌

金正恩这步棋比清洗还狠!援俄刚打出威名,朝鲜军队高层一夜洗牌

三毛看世界
2026-09-03 14:03:33
一年级有多难带?网友:课间十分钟回来一半,剩下的找了一个小时

一年级有多难带?网友:课间十分钟回来一半,剩下的找了一个小时

许三岁
2026-09-05 13:19:54
杭州发放专项消费券!

杭州发放专项消费券!

萧内网
2026-09-05 20:33:35
大模型蒸馏时代结束!Fable 5.1改写API,彻底切断蒸馏后路

大模型蒸馏时代结束!Fable 5.1改写API,彻底切断蒸馏后路

新智元
2026-09-05 08:01:01
袁咏仪55岁生日,儿子准备的“包”蛋糕,精准狙击妈妈软肋!

袁咏仪55岁生日,儿子准备的“包”蛋糕,精准狙击妈妈软肋!

娱乐小叨叨
2026-09-05 15:20:53
2026-09-06 06:28:49
柴知道
柴知道
用有趣的方式,讲有价值的知识
409文章数 84256关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

头条要闻

江西遂川泥石流1死11失联 男子:母亲电话一直打不通

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

阿Sa蔡卓妍首度求婚细节,感动落泪

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

千里浩瀚H5/30英寸大屏 星越L PLUS让你看到油车越级的一面

态度原创

亲子
数码
教育
房产
手机

亲子要闻

AI造娃?生殖专家开发“智能扫精术”,无精症患者都能硬找出蝌蚪生?

数码要闻

复古科技热潮推动实体音乐回归 CD销量意外迎来强劲反弹

教育要闻

噩梦!油漆未干开学,学生出现身体不适,教体局:甲醛合格,家长不买账

房产要闻

突发重磅!海口出台楼市新政!

手机要闻

华为Pura 90系列未加入涨价潮:价格最稳的华为影像旗舰

无障碍浏览 进入关怀版