网易首页 > 网易号 > 正文 申请入驻

当AI模型被按下暂停键|深度报道

0
分享至


原文发表于 《科技导报》2026年第12期科技新闻-深度报道

当AI模型被按下暂停键:美国限制外国公民访问Anthropic 2款模型,AI模型开始进入出口管制视野


大模型因为“越狱”问题被限制访问

(图片来源:linkedin)


1 模型访问权与“越狱”风险之争


2026年6月12日,美国人工智能公司Anthropic宣布,因美国政府下达国家安全指令,公司暂停客户访问Claude Fable 5和Claude Mythos 5。限制对象包括美国境外用户、身处美国的外国公民,以及Anthropic内部的外籍员工。由于短时间内无法逐一核验用户身份,公司暂时关闭了所有客户的访问权限。

这不是一次普通的产品下线。过去几年,美国对人工智能的出口限制主要针对高端芯片、先进制程设备和云算力。此次事件表明,监管对象正在进一步延伸到模型访问权。前沿模型提供的代码分析、漏洞发现和科研辅助能力,也开始被纳入国家安全审查。

Anthropic在声明中说,美国政府担心Fable 5的安全措施可能被“越狱”,从而让用户获得原本受限的网络安全能力,包括发现软件漏洞。所谓“越狱”,是指用户通过特殊提示词、多轮对话、角色扮演、任务拆解、编码转换或上下文诱导等方式,绕过模型内置的安全防护机制,使模型回答原本应当拒绝的问题,或执行原本受限的操作。与传统软件漏洞不同,大模型“越狱”往往不表现为单一代码缺陷,而是与提示词设计、模型对齐程度、上下文理解、工具调用权限和应用场景共同相关。

Anthropic对此持不同意见。该公司称,政府列举的案例只是少量已知的低级别漏洞,其他公开模型同样可能发现这些问题,尚不足以证明Fable 5构成特殊风险。

对于政府与企业争论的模型“越狱”风险,北京邮电大学网络空间安全学院教授张熙在接受《科技导报》采访时表示,美国政策界高度重视模型越狱攻击,是因为“越狱”可能让模型绕过安全限制,回答或执行原本被禁止的高风险请求。其中尤为关键的是CBRN领域,即Chemical(化学)、Biological(生物)、Radiological(放射)、Nuclear(核)相关的核生化放射安全风险。相关风险一旦被模型能力放大,可能降低恶性事件的执行门槛,对国家安全造成严重威胁。

张熙指出,现实中的安全事件已经提示了这类风险的严肃性。例如,美国现役军人Mattew Lirelsberger在特朗普国际酒店门前爆炸案中,咨询ChatGPT自制炸弹。这说明,当模型能够在高风险知识、操作步骤和执行建议之间建立连接时,“越狱”就不再只是“回答不当”的内容安全问题,而可能演变为现实世界安全风险。

争议由此落到了一个很难回答的问题上:模型具备什么能力,才需要限制访问?在张熙看来,能否防住越狱攻击,是模型上线前红队测试的核心内容,也是美国相关AI安全政策重点关注的问题。如果一个模型在高风险场景下难以抵御越狱攻击,就可能成为政府部门限制访问的理由。当前,通用越狱攻击已经成为各大模型重点防守的对象,但窄场景、非通用的“越狱”方法仍然很难完全防住,这也是前沿模型安全评测面临的主要难题之一。

与此同时,技术评估的不确定性也为外部力量介入提供了空间。Axios、Reuters、《Fortune Magazine》等媒体援引知情人士报道称,Amazon公司曾向美国政府官员表达对Fable5/Mythos模型安全风险的担忧。Amazon公司既是Anthropic的重要投资方,也是云计算和人工智能基础设施市场的主要参与者。这意味着围绕模型安全的争议,已经从技术判断延伸到企业竞争与行业话语权之争。


2 攻防同源与智能体带来的新风险


在网络安全领域,发现漏洞本身并无明确的攻防属性。模型既可以帮助能源、电信、金融和医疗机构检查代码、定位漏洞并生成修复建议,也能被用来批量扫描目标、设计攻击路径,加快漏洞利用。相同的底层能力,可能服务于完全相反的目的。

复旦大学计算与智能创新学院张晓寒副研究员指出,大模型在代码解析、漏洞研判、概念验证代码构造和补丁校验等方面具有攻防通用性。在使用方式上,防御者关注漏洞定位与修复,而攻击者则试图规避安全检测、隐蔽入侵痕迹、留存持久权限,自动化落地全链路入侵行为。由于攻击者可以通过拆解任务、分步提问绕过限制,模型风险评估不能只看单次输出,还需考虑连续任务能力、工具权限和使用场景。

这也是大模型风险难以沿用传统软件漏洞标准定级的原因。“越狱”行为会随着提示词、上下文和工具环境变化而变化,使风险呈现动态特征。

与此同时,智能体的出现进一步放大了风险。新一代模型接入智能体框架后,可以调用工具、访问代码库、联网检索并持续执行复杂任务。复旦大学副研究员戴嘉润指出,智能体的攻击能力由模型与框架共同决定,一旦具备工具调用和系统操作权限,模型能力就可能被整合为完整攻击流程。

根据其团队自2024年以来对境内外大模型及智能体攻防能力的监测,戴嘉润建议,首先应对基座模型进行能力分级。前沿模型在代码理解、漏洞定位、利用链推理和长程任务规划方面进步明显,即使只配备较简单的智能体框架,也可能对真实软件系统发起自主攻击。

但只管模型还不够。戴嘉润认为,还应评估“模型+智能体框架”组成的完整系统。真正影响风险大小的,往往是模型能够调用什么工具、接触哪些数据,以及是否具有联网和系统操作权限。未来的治理对象应当包括模型、工具、权限和运行环境,而不是孤立的模型接口。

访问限制确实可能带来一定的安全收益。张晓寒认为,它可以减少低门槛攻击者批量获得自动化漏洞发现和利用能力的机会,减缓攻击技术扩散。然而,代价也很现实。攻击者可以继续使用私有部署的开源模型和地下工具,合规研究人员、中小企业安全团队和开源项目维护者却可能失去先进模型的帮助。管制若主要约束守规矩的使用者,反而可能削弱漏洞发现和修复能力,进一步拉大攻防差距。


3 地缘竞争与AI治理规则重塑


美国政府的这次指令表明,前沿模型的访问权限已经不再完全由企业和客户之间的合同决定。国籍、所在地、合作伙伴身份和安全审查,都可能成为决定模型能否使用、开放到什么程度的条件。

这一变化也为G7期间有关“可信伙伴访问美国先进人工智能模型”的讨论提供了背景。美国正在考虑的并非简单关闭模型,而是建立分层访问制度:本国和被认定为可信的伙伴优先获得先进能力,其他国家和地区则受到不同程度的限制。模型仍然部署在云端,却开始带有类似高性能芯片的地缘政治属性。

张晓寒认为,现有模型限制规则混合了安全判断和地缘政治诉求,其科学性、公平性以及对不同国家的适用性仍需讨论。前沿模型确有双重用途风险,但真正的安全问题不能与商业竞争、技术封锁混为一谈。

对中国来说,直接影响是海外模型服务的不确定性增加。企业和科研机构过去可以通过应用程序编程接口调用先进模型,用于代码开发、科学计算、药物设计和网络安全防御。一旦模型访问被纳入出口管制,这些服务就可能因政策变化突然中断。

戴嘉润认为,境外大模型智能体的网络攻击能力正在快速提升,中国仍处在调整网络安全布局的窗口期。一方面,需要防止国内外攻防能力出现明显差距;另一方面,也要管控智能体接入真实系统后可能带来的风险,尤其是其对基础设施、软件供应链和关键行业系统的影响。

这要求国内继续建设自主模型、推理框架和算力体系,也要补上安全评测、红队测试和行业应用规范。发展模型能力与控制安全风险并非2个先后进行的任务,模型越早进入真实生产环境,两者就越需要同步推进。

Anthropic事件或许只是开始。随着模型能力不断增强,围绕“谁能使用模型、使用到什么程度、由谁决定风险”的争论将持续存在。未来的竞争不仅在性能和成本上,也将在安全标准与治理规则上展开。

文/ 黄文光

( 综合:Anthropic、Reuters、新华网、Axios、《Fortune Magazine》 )

《科技导报》创刊于1980年,中国科协学术会刊,主要刊登科学前沿和技术热点领域突破性的研究成果、权威性的科学评论、引领性的高端综述,发表促进经济社会发展、完善科技管理、优化科研环境、培育科学文化、促进科技创新和科技成果转化的决策咨询建议。常设栏目有院士卷首语、科技新闻、科技评论、专稿专题、综述、论文、政策建议、科技人文等。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华为“被讨厌”不是没道理,Mate90 ProMax这一堆猛料砸下来,苹果怎么比?

华为“被讨厌”不是没道理,Mate90 ProMax这一堆猛料砸下来,苹果怎么比?

大卫聊科技
2026-09-04 13:47:51
“他们会吊死我!”普京计划增兵40万,直言战败后命就没了!

“他们会吊死我!”普京计划增兵40万,直言战败后命就没了!

老头的传奇色彩
2026-09-04 07:12:52
尘埃落定!“婚外胚胎案”的朱女士输了!9月1日晚,朱女士哭着称“我错了”

尘埃落定!“婚外胚胎案”的朱女士输了!9月1日晚,朱女士哭着称“我错了”

原广工业
2026-09-04 10:04:38
57岁摇滚歌手何勇去世,与窦唯、张楚并称“魔岩三杰”,死因曝光

57岁摇滚歌手何勇去世,与窦唯、张楚并称“魔岩三杰”,死因曝光

180视角
2026-09-04 13:43:20
随着吉达国民5-0,利雅得新月2-0,沙特联最新积分榜出炉

随着吉达国民5-0,利雅得新月2-0,沙特联最新积分榜出炉

侧身凌空斩
2026-09-05 05:37:49
Steam今年狂赚150亿美元,新游吸金王竟是它

Steam今年狂赚150亿美元,新游吸金王竟是它

队友祭天法力无边
2026-09-04 05:13:16
全员警惕!李大霄重磅发声:加息都落地了市场还装睡 别等枪响才跑

全员警惕!李大霄重磅发声:加息都落地了市场还装睡 别等枪响才跑

王二哥老搞笑
2026-09-04 07:38:07
“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

“眼神都拉丝了!”家长晒母子互动视频,引全网不适:儿大不避母的结果

妍妍教育日记
2026-08-31 23:54:51
毫无明星架子!林永健夫妇现身北京4S店,务实选车太接地气

毫无明星架子!林永健夫妇现身北京4S店,务实选车太接地气

乡野异闻录
2026-09-04 18:20:18
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
普京一点弯路都不想走了!直接公开向中国喊话:只要中方点头,中俄免签立马从临时变永久

普京一点弯路都不想走了!直接公开向中国喊话:只要中方点头,中俄免签立马从临时变永久

扶苏聊历史
2026-09-04 15:53:14
随着比分定格1-4,43岁德罗西率队3连败,39岁法布雷加斯率队2连胜

随着比分定格1-4,43岁德罗西率队3连败,39岁法布雷加斯率队2连胜

侧身凌空斩
2026-09-05 04:39:56
法国人吐槽坐中国高铁被歧视!唯独他被抽查,工作人员还扬言爱投诉就投诉,评论区十分团结

法国人吐槽坐中国高铁被歧视!唯独他被抽查,工作人员还扬言爱投诉就投诉,评论区十分团结

谭谈社会
2026-09-03 20:26:28
广州三个小孩凑10.5元挽留的便利店正式闭店,老板最新回应:将回家休养一段时间

广州三个小孩凑10.5元挽留的便利店正式闭店,老板最新回应:将回家休养一段时间

环球网资讯
2026-09-04 14:58:15
国务院安委会办公室通报今年6起有限空间较大事故

国务院安委会办公室通报今年6起有限空间较大事故

新京报
2026-09-04 15:49:09
皇马球迷意难平!不止因为0-1惜败贝蒂斯,更多在于以下这五点!

皇马球迷意难平!不止因为0-1惜败贝蒂斯,更多在于以下这五点!

田先生篮球
2026-09-05 06:17:37
巴萨血亏!弗里克放走世界级巨星!诺坎普 5500 万弃将首秀封神

巴萨血亏!弗里克放走世界级巨星!诺坎普 5500 万弃将首秀封神

奶盖熊本熊
2026-09-05 08:03:13
电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

电车20年内必被淘汰?戳中了新能源最不敢面对的财政死穴

民间胡扯老哥
2026-09-03 06:36:08
不是韩旭,不是杨舒予,美国将帅夸中国队一人:表现出色未来可打WNBA

不是韩旭,不是杨舒予,美国将帅夸中国队一人:表现出色未来可打WNBA

南海浪花
2026-09-05 05:33:08
刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

刘畊宏直播间凉了,“老板娘”的身材戳破了多少人的减肥梦?

看尽落尘花q
2026-08-23 19:28:46
2026-09-05 08:59:00
科技导报 incentive-icons
科技导报
中国科协学术会刊
5514文章数 8381关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

头条要闻

牛弹琴:164国赞成只有美国1票反对 世界地图要变了

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

健康
艺术
旅游
家居
亲子

脑梗取栓成功≠活下来,还有这三关

艺术要闻

明朝灭亡那年,他画了一群女生玩古代飞花令

旅游要闻

海航这次挨骂挺冤枉;穷游党狂喜,坐廉航去欧洲 | 一周视频速递

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

为什么好好说话孩子不听非要吼

无障碍浏览 进入关怀版