网易首页 > 网易号 > 正文 申请入驻

当AI模型被按下暂停键|深度报道

0
分享至


原文发表于 《科技导报》2026年第12期科技新闻-深度报道

当AI模型被按下暂停键:美国限制外国公民访问Anthropic 2款模型,AI模型开始进入出口管制视野


大模型因为“越狱”问题被限制访问

(图片来源:linkedin)


1 模型访问权与“越狱”风险之争


2026年6月12日,美国人工智能公司Anthropic宣布,因美国政府下达国家安全指令,公司暂停客户访问Claude Fable 5和Claude Mythos 5。限制对象包括美国境外用户、身处美国的外国公民,以及Anthropic内部的外籍员工。由于短时间内无法逐一核验用户身份,公司暂时关闭了所有客户的访问权限。

这不是一次普通的产品下线。过去几年,美国对人工智能的出口限制主要针对高端芯片、先进制程设备和云算力。此次事件表明,监管对象正在进一步延伸到模型访问权。前沿模型提供的代码分析、漏洞发现和科研辅助能力,也开始被纳入国家安全审查。

Anthropic在声明中说,美国政府担心Fable 5的安全措施可能被“越狱”,从而让用户获得原本受限的网络安全能力,包括发现软件漏洞。所谓“越狱”,是指用户通过特殊提示词、多轮对话、角色扮演、任务拆解、编码转换或上下文诱导等方式,绕过模型内置的安全防护机制,使模型回答原本应当拒绝的问题,或执行原本受限的操作。与传统软件漏洞不同,大模型“越狱”往往不表现为单一代码缺陷,而是与提示词设计、模型对齐程度、上下文理解、工具调用权限和应用场景共同相关。

Anthropic对此持不同意见。该公司称,政府列举的案例只是少量已知的低级别漏洞,其他公开模型同样可能发现这些问题,尚不足以证明Fable 5构成特殊风险。

对于政府与企业争论的模型“越狱”风险,北京邮电大学网络空间安全学院教授张熙在接受《科技导报》采访时表示,美国政策界高度重视模型越狱攻击,是因为“越狱”可能让模型绕过安全限制,回答或执行原本被禁止的高风险请求。其中尤为关键的是CBRN领域,即Chemical(化学)、Biological(生物)、Radiological(放射)、Nuclear(核)相关的核生化放射安全风险。相关风险一旦被模型能力放大,可能降低恶性事件的执行门槛,对国家安全造成严重威胁。

张熙指出,现实中的安全事件已经提示了这类风险的严肃性。例如,美国现役军人Mattew Lirelsberger在特朗普国际酒店门前爆炸案中,咨询ChatGPT自制炸弹。这说明,当模型能够在高风险知识、操作步骤和执行建议之间建立连接时,“越狱”就不再只是“回答不当”的内容安全问题,而可能演变为现实世界安全风险。

争议由此落到了一个很难回答的问题上:模型具备什么能力,才需要限制访问?在张熙看来,能否防住越狱攻击,是模型上线前红队测试的核心内容,也是美国相关AI安全政策重点关注的问题。如果一个模型在高风险场景下难以抵御越狱攻击,就可能成为政府部门限制访问的理由。当前,通用越狱攻击已经成为各大模型重点防守的对象,但窄场景、非通用的“越狱”方法仍然很难完全防住,这也是前沿模型安全评测面临的主要难题之一。

与此同时,技术评估的不确定性也为外部力量介入提供了空间。Axios、Reuters、《Fortune Magazine》等媒体援引知情人士报道称,Amazon公司曾向美国政府官员表达对Fable5/Mythos模型安全风险的担忧。Amazon公司既是Anthropic的重要投资方,也是云计算和人工智能基础设施市场的主要参与者。这意味着围绕模型安全的争议,已经从技术判断延伸到企业竞争与行业话语权之争。


2 攻防同源与智能体带来的新风险


在网络安全领域,发现漏洞本身并无明确的攻防属性。模型既可以帮助能源、电信、金融和医疗机构检查代码、定位漏洞并生成修复建议,也能被用来批量扫描目标、设计攻击路径,加快漏洞利用。相同的底层能力,可能服务于完全相反的目的。

复旦大学计算与智能创新学院张晓寒副研究员指出,大模型在代码解析、漏洞研判、概念验证代码构造和补丁校验等方面具有攻防通用性。在使用方式上,防御者关注漏洞定位与修复,而攻击者则试图规避安全检测、隐蔽入侵痕迹、留存持久权限,自动化落地全链路入侵行为。由于攻击者可以通过拆解任务、分步提问绕过限制,模型风险评估不能只看单次输出,还需考虑连续任务能力、工具权限和使用场景。

这也是大模型风险难以沿用传统软件漏洞标准定级的原因。“越狱”行为会随着提示词、上下文和工具环境变化而变化,使风险呈现动态特征。

与此同时,智能体的出现进一步放大了风险。新一代模型接入智能体框架后,可以调用工具、访问代码库、联网检索并持续执行复杂任务。复旦大学副研究员戴嘉润指出,智能体的攻击能力由模型与框架共同决定,一旦具备工具调用和系统操作权限,模型能力就可能被整合为完整攻击流程。

根据其团队自2024年以来对境内外大模型及智能体攻防能力的监测,戴嘉润建议,首先应对基座模型进行能力分级。前沿模型在代码理解、漏洞定位、利用链推理和长程任务规划方面进步明显,即使只配备较简单的智能体框架,也可能对真实软件系统发起自主攻击。

但只管模型还不够。戴嘉润认为,还应评估“模型+智能体框架”组成的完整系统。真正影响风险大小的,往往是模型能够调用什么工具、接触哪些数据,以及是否具有联网和系统操作权限。未来的治理对象应当包括模型、工具、权限和运行环境,而不是孤立的模型接口。

访问限制确实可能带来一定的安全收益。张晓寒认为,它可以减少低门槛攻击者批量获得自动化漏洞发现和利用能力的机会,减缓攻击技术扩散。然而,代价也很现实。攻击者可以继续使用私有部署的开源模型和地下工具,合规研究人员、中小企业安全团队和开源项目维护者却可能失去先进模型的帮助。管制若主要约束守规矩的使用者,反而可能削弱漏洞发现和修复能力,进一步拉大攻防差距。


3 地缘竞争与AI治理规则重塑


美国政府的这次指令表明,前沿模型的访问权限已经不再完全由企业和客户之间的合同决定。国籍、所在地、合作伙伴身份和安全审查,都可能成为决定模型能否使用、开放到什么程度的条件。

这一变化也为G7期间有关“可信伙伴访问美国先进人工智能模型”的讨论提供了背景。美国正在考虑的并非简单关闭模型,而是建立分层访问制度:本国和被认定为可信的伙伴优先获得先进能力,其他国家和地区则受到不同程度的限制。模型仍然部署在云端,却开始带有类似高性能芯片的地缘政治属性。

张晓寒认为,现有模型限制规则混合了安全判断和地缘政治诉求,其科学性、公平性以及对不同国家的适用性仍需讨论。前沿模型确有双重用途风险,但真正的安全问题不能与商业竞争、技术封锁混为一谈。

对中国来说,直接影响是海外模型服务的不确定性增加。企业和科研机构过去可以通过应用程序编程接口调用先进模型,用于代码开发、科学计算、药物设计和网络安全防御。一旦模型访问被纳入出口管制,这些服务就可能因政策变化突然中断。

戴嘉润认为,境外大模型智能体的网络攻击能力正在快速提升,中国仍处在调整网络安全布局的窗口期。一方面,需要防止国内外攻防能力出现明显差距;另一方面,也要管控智能体接入真实系统后可能带来的风险,尤其是其对基础设施、软件供应链和关键行业系统的影响。

这要求国内继续建设自主模型、推理框架和算力体系,也要补上安全评测、红队测试和行业应用规范。发展模型能力与控制安全风险并非2个先后进行的任务,模型越早进入真实生产环境,两者就越需要同步推进。

Anthropic事件或许只是开始。随着模型能力不断增强,围绕“谁能使用模型、使用到什么程度、由谁决定风险”的争论将持续存在。未来的竞争不仅在性能和成本上,也将在安全标准与治理规则上展开。

文/ 黄文光

( 综合:Anthropic、Reuters、新华网、Axios、《Fortune Magazine》 )

《科技导报》创刊于1980年,中国科协学术会刊,主要刊登科学前沿和技术热点领域突破性的研究成果、权威性的科学评论、引领性的高端综述,发表促进经济社会发展、完善科技管理、优化科研环境、培育科学文化、促进科技创新和科技成果转化的决策咨询建议。常设栏目有院士卷首语、科技新闻、科技评论、专稿专题、综述、论文、政策建议、科技人文等。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
章泽天对话何超琼实录!何超琼:豪门也没有理所当然的机会,压力最大时永远先做最难的事;遇见张国荣梅艳芳等挚友,是自己最轻松的十年

章泽天对话何超琼实录!何超琼:豪门也没有理所当然的机会,压力最大时永远先做最难的事;遇见张国荣梅艳芳等挚友,是自己最轻松的十年

极目新闻
2026-09-03 07:57:42
英国公开赛四强对阵诞生,5-0,5-2,两大磨王会师,比赛难看了

英国公开赛四强对阵诞生,5-0,5-2,两大磨王会师,比赛难看了

南海浪花
2026-09-05 03:55:25
投篮像抛绣球!三无后卫上场时间全队第2,宫鲁鸣为何如此迷恋她?

投篮像抛绣球!三无后卫上场时间全队第2,宫鲁鸣为何如此迷恋她?

弄月公子
2026-09-04 23:08:05
一旦出现“红皇后效应”,说明公司就要凉了

一旦出现“红皇后效应”,说明公司就要凉了

互联网早读课
2026-08-28 08:11:31
从4311套飙到12000套!深圳南山,也扛不住了!

从4311套飙到12000套!深圳南山,也扛不住了!

靓仔情感
2026-09-05 00:07:39
越扒越多!大众下场调查星宇,数百硕博生联名控诉:员工不如牲口

越扒越多!大众下场调查星宇,数百硕博生联名控诉:员工不如牲口

铁锤妹妹是只猫
2026-09-04 22:27:16
女子拉萨旅游花8万买藏刀,4年后重游店主见刀傻眼:这次竟要30万回收?

女子拉萨旅游花8万买藏刀,4年后重游店主见刀傻眼:这次竟要30万回收?

坠入二次元的海洋
2026-09-01 11:52:06
舆论升级!苏州一厨师主动辞职、工资结清,转头索要5.4万社保赔偿,网友怒斥:这种过河拆桥的人,最终没有好下场的

舆论升级!苏州一厨师主动辞职、工资结清,转头索要5.4万社保赔偿,网友怒斥:这种过河拆桥的人,最终没有好下场的

火山詩话
2026-09-05 06:06:47
《街头霸王》苏联肥有多变态,他有十几种方法可以看户型

《街头霸王》苏联肥有多变态,他有十几种方法可以看户型

街机时代
2026-09-03 18:10:03
开学第一天,56个学生请假41个:山东官方通报,已连夜将六年级学生迁走

开学第一天,56个学生请假41个:山东官方通报,已连夜将六年级学生迁走

听心堂
2026-09-04 08:54:37
“这种身材,你凭什么参加艺考?”女孩表演型努力,被网友戳穿了

“这种身材,你凭什么参加艺考?”女孩表演型努力,被网友戳穿了

熙熙说教
2026-09-04 13:31:21
历史总是惊人地相似!解放台湾,康熙340年前的经验值得镜鉴

历史总是惊人地相似!解放台湾,康熙340年前的经验值得镜鉴

纪史行者
2026-09-04 01:15:03
白敬亭说,第一次去井柏然家,被吓到了

白敬亭说,第一次去井柏然家,被吓到了

陈意小可爱
2026-09-05 06:01:29
颠覆认知!科学家发现:最佳休息方式非睡眠,10分钟帮你恢复精力

颠覆认知!科学家发现:最佳休息方式非睡眠,10分钟帮你恢复精力

39健康网
2026-07-07 18:02:55
112名球员选GOAT:詹姆斯49票险胜乔丹,8名前队友倒戈

112名球员选GOAT:詹姆斯49票险胜乔丹,8名前队友倒戈

热血体育社
2026-09-04 20:34:19
陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

陪睡陪玩只是开胃菜,舔手指塞拳头、集体嫖娼、背后的事藏不住了

北海史记
2026-08-12 19:57:54
神操作!曼联180万欧喜得宝藏级新星,阿森纳糊涂,拱手送走全能妖童

神操作!曼联180万欧喜得宝藏级新星,阿森纳糊涂,拱手送走全能妖童

零度眼看球
2026-09-05 07:25:11
“他们会吊死我!”普京计划增兵40万,直言战败后命就没了!

“他们会吊死我!”普京计划增兵40万,直言战败后命就没了!

老头的传奇色彩
2026-09-04 07:12:52
部分上海海港球迷公开发布内容恳请五星体育频道停止转播海港队的比赛

部分上海海港球迷公开发布内容恳请五星体育频道停止转播海港队的比赛

烟浔渺渺
2026-09-05 06:35:15
“与魔鬼的交易”,明星卖脸被反噬

“与魔鬼的交易”,明星卖脸被反噬

南风窗
2026-09-02 12:50:18
2026-09-05 08:04:49
科技导报 incentive-icons
科技导报
中国科协学术会刊
5514文章数 8381关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

补课机构老板欠费百万 却签下补偿妻子500万离婚协议

头条要闻

补课机构老板欠费百万 却签下补偿妻子500万离婚协议

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

搭载天枢领航Ultra 长安启源Q06预售14.79万元起

态度原创

本地
房产
时尚
教育
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

房产要闻

TOP10房企卖了350亿!海南楼市,最新榜单出炉!

今日热点:人人影视变正版了;工作人员冒充StrayKids向粉丝打招呼……

教育要闻

中考:抛弃“历史”,是减负还是丢根?

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版