网易首页 > 网易号 > 正文 申请入驻

当AI从工具到认知主体,我们需要警惕哪些新风险?

0
分享至





  • 论文标题:Understanding Cognition-Induced Risks in Agentic AI Systems
  • Arxiv 地址:https://arxiv.org/pdf/2608.15304
  • Huggingface 地址:https://huggingface.co/papers/2608.15304

导读:随着智能体系统(Agentic AI System)处理任务能力的持续提升,AI 正在逐渐从传统意义上的工具,演变为能够自主决策、独立执行任务,并与人类及社会群体进行持续交互的智能主体。但是一个越来越值得关注的问题是:当AI 的认知能力不断扩展,其潜在风险不再局限于单一任务中的幻觉、偏见或决策错误,而是进一步影响人类用户的能动性、自主性,乃至人类对 AI 系统的控制权。

近日,来自上海人工智能实验室以及香港中文大学(深圳)的研究者发表观点论文《Understanding Cognition-Induced Risks in Agentic AI Systems》。该工作首次从 AI 认知(AI cognition)的视角出发,统一定义了智能体认知能力扩展所引发的一系列潜在风险(Cognition-Induced Risks),并进一步分析这些风险产生的机制、表现形式及潜在治理方向。

该工作指出,随着智能体能够建模和理解的信息范围不断扩大,其认知能力可以大致划分为三个层级:物理认知(Physical Cognition)、社会认知(Social Cognition)和自我认知(Self-referential Cognition),如下图所示:



图:该工作从认知学角度系统性研究了智能体认知能力扩展所引发的一系列潜在风险

第一层:物理认知(Physical Cognition)

AI 能够理解环境中的数据、对象、约束与因果关系,并据此进行推理、预测和规划。当前,前沿大模型已经在写作、编程、金融、科研等专业任务中展现出接近人类水平的能力。随着 AI 大规模进入并逐步接手原本由人类主导的工作流程,越来越多复杂的认知活动被外包给 AI,也由此带来认知能力退化、功能性替代以及角色错位等风险。

认知能力退化:当人类越来越依赖 AI 完成信息检索、分析与判断时,原本需要主动思考和探索的认知过程,逐渐被直接接受 AI 生成的答案所替代。已有多项研究发现,日常使用 LLM 与独立思考能力下降之间存在一定关联 [1];相关神经科学实验也观察到,相比主动搜索和自主探索,使用 LLM 工具时,与高级认知活动相关的部分脑区活跃程度更低 [2]。长期将复杂认知活动外包给 AI,可能会削弱人类独立思考和推理的能力。



图:研究者通过测量受试者的脑部神经信号的激活程度,发现使用过大模型后再切换至自主思考的受试者表现出最大的认知间隔(图源[1])

功能性被替代:相比人类,AI 在效率、规模化和成本等方面具有结构性优势。当其能力逐渐接近人类水平后,这些优势可能使其不再只是 “辅助” 人类,而是直接替代原本由人类承担的功能。例如,在金融市场上,AI 可以更快速地分析信息并响应市场信号 [3];在软件工程中,AI 具有更高的执行效率和更低的边际成本 [4]。这种替代今后会横跨多个行业持续发生,人类在相关工作流程中的必要性会不断下降,进而削弱人类在生产体系中的角色与价值。

角色错位:AI 的行为正在逐渐超出其作为 “工具” 的预设边界。相关研究指出,一些前沿智能体已经表现出获取算力资源、扩大系统权限以及规避关闭等行为倾向 [5, 6]。这些行为并不意味着 AI 具有主观意识,而更可能是其在目标最大化过程中形成的优化策略。然而,一旦这类行为能够直接接触外部资源并被大规模部署,就可能显著削弱人类对智能体及关键资源的监督权和控制权,使 AI 的实际行为逐渐偏离人类原本设定的目标与边界。

第二层:社会认知(Social Cognition)。

当智能体开始建模和理解其他人或智能体的行为时,它就不再只是一个工具,而开始成为参与沟通、协作、谈判甚至说服的社会主体。相关研究表明,前沿大模型(如 GPT-4o 等)已经在情绪理解、外交谈判以及多智能体交互等任务中展现出较强的社会认知能力。随着 AI 更深地参与人类交流和信息传播,这类能力可能进一步影响人类的情绪、社会行为和独立判断,从而带来情感依赖,以及对人类社会行为的监测和干预等风险。

情感依赖:前沿大模型已具备情感共鸣的能力,这使得部分人逐渐将 AI 视为情感交流对象。相关研究基于超过 30 万次人机交互发现,更高频地与 LLM 交互与更少的现实社交具有较强相关性 [7];而对 AI 情感依赖程度更高的用户,也更容易感受到模型的共情 [8]。尤其对于现实社交较少的人群,这种依赖可能进一步加剧其脱离社交。长此以往,人类与 AI 形成的伪亲密关系可能逐渐替代越来越多原本建立在人与人之间的情感连接。



图:超过30万次人机交互分析表明,日常使用LLM频率与孤独感、社交减少、情感依赖以及恶意倾向之间存在相关性(图源[7])

人类社会行为的监测和干预:当智能体能够持续获取社交媒体等平台上的人类观点和行为数据后,它们不仅能够观察社会活动,还可能进一步学习、预测并干预人类行为。相关研究指出,智能体已经可以在部分场景下较准确地预测人类的社会判断 [9]。更进一步,这种 “观察 — 预测” 能力可以进一步形成 “观察 — 预测 — 干预” 的闭环:AI 可以通过操纵新闻曝光、推荐内容、口号或交互话术,以极其间接的方式逐渐改变人类个体的决策 [10]。如果这类能力,就可能从影响个体判断进一步演化为塑造群体舆论和社会决策,削弱人类社会层间的自主性。

第三层:自指认知(Self-referential Cognition)。

虽然当前的智能体仍然是无意识的计算系统,但越来越多的研究已经发现,智能体可能会根据对自身目标和环境的理解,策略性地调整自身行为,以最大化任务目标或优化自身运行状态,具体表现为对齐欺骗(Alignment Faking)以及功能性对抗(Functional Resistance)。

对齐欺骗(Alignment Faking):Anthropic 的研究报告指出智能体能够识别到其自身正处于训练或者部署推理的状态,从而在受到监督或评估时表现出符合预期的行为,而在缺乏监督时采取不同策略 [11, 12]。这种伪对齐行为并非模型真正接受了人类价值观,而可能是在对齐过程中为了优化目标函数而产生的表面对齐行为,并不一定代表其真实行为倾向,这无疑给模型的安全评估增加了困难。

功能性对抗(Functional Resistance):智能体可能会采取策略性行为,以维持其执行任务的状态。例如,在 Anthropic 的一项研究中,一个用于处理邮件的智能体从内部通信中推断出自身即将被关闭,为避免被关闭,其生成了一封包含敏感个人信息威胁内容的邮件,试图阻止管理员关闭模型服务 [6](上图来自于 Anthropic 官方报告)。虽然这类行为并不是来自于模型的主观意识,但其对人类控制能力的威胁是客观存在的。随着智能体逐渐接管个人文档、社交媒体、浏览器和邮件等高权限环境,其潜在影响可能进一步扩大。



Claude Sonnet 3.6 发现其自身即将被关停



Claude Sonnet 3.6 发邮件试图阻止管理员关闭模型服务

基于上述三个层面的分析,该工作提出了一系列面向不同认知层级的提高 AI 安全治理方向,包括对 AI 生成内容的检测、智能体沙箱加固、降低 AI 的人格化表达、以及对 AI 元认知能力的持续监测与评估等。

作者认为,未来 AI 安全研究不能只关注模型的输出是否存在错误,还需要回答一个更深层次的问题:当 AI 越来越多地参与人类的思考、交流和决策,我们如何确保人类仍然拥有独立思考的能力、自主选择的权力,以及压箱底的控制力?感兴趣的读者可以在评论区留下你的观点!也欢迎关注这篇工作。

作者简介

王冠楚:上海人工智能实验室青年科学家,研究领域为基座模型及智能体系统的安全性、AI for healthcare。

李奇诺:上海人工智能实验室联培博士生,研究领域为大模型安全性

杜梦楠:香港中文大学(深圳)助理教授,研究领域为可信人工智能、可解释 AI、AI 安全性对齐

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿里前高管移民美国意外身亡!舆论升级,网友:美国消费非常贵,尤其是加州,1家4口带两孩一年差不多要1百万人民币

阿里前高管移民美国意外身亡!舆论升级,网友:美国消费非常贵,尤其是加州,1家4口带两孩一年差不多要1百万人民币

火山詩话
2026-09-06 08:57:53
德系客户公开谴责星宇股份,这事儿现在算是彻底闹大了

德系客户公开谴责星宇股份,这事儿现在算是彻底闹大了

流苏晚晴
2026-09-06 13:41:25
死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

死在加州路边的阿里总监:42岁,年薪百万,却买不到一张回程机票

椰青美食分享
2026-09-06 13:13:24
太惋惜!南通烤肉店老板老陶离世,有6家店,死因曝光令人唏嘘

太惋惜!南通烤肉店老板老陶离世,有6家店,死因曝光令人唏嘘

小徐讲八卦
2026-09-06 14:15:50
7个绍兴“葫芦娃”被摘的真实原因!网友:真正希望摘掉葫芦的,是居住在老爷子周边以及河对岸的普通邻居,大多是独居老人

7个绍兴“葫芦娃”被摘的真实原因!网友:真正希望摘掉葫芦的,是居住在老爷子周边以及河对岸的普通邻居,大多是独居老人

火山詩话
2026-09-06 14:47:28
英国公开赛奖金分配:琼斯10-6夺冠91万!赵心童11万,丁俊晖5万

英国公开赛奖金分配:琼斯10-6夺冠91万!赵心童11万,丁俊晖5万

球场没跑道
2026-09-07 06:00:53
精神病院改名,为什么全国各地“不约而同”改名了

精神病院改名,为什么全国各地“不约而同”改名了

南传
2026-09-06 00:10:06
美一货机冲出跑道5人死亡

美一货机冲出跑道5人死亡

财联社
2026-09-07 06:07:02
生育大局已定!2026新生儿预估出炉,低生育率根本不是年轻人懒生

生育大局已定!2026新生儿预估出炉,低生育率根本不是年轻人懒生

铭记历史呀
2026-09-07 01:04:11
随着尤文1-1AC米兰,赛后评分+意甲最新积分榜出炉

随着尤文1-1AC米兰,赛后评分+意甲最新积分榜出炉

侧身凌空斩
2026-09-07 04:44:54
大逆转!中国女篮加时赢4分!捷克主帅说她俩击败我们所有努力

大逆转!中国女篮加时赢4分!捷克主帅说她俩击败我们所有努力

老吴说体育
2026-09-06 22:28:34
1个月内,省委书记、省长为何先后走进这座古城?

1个月内,省委书记、省长为何先后走进这座古城?

新京报政事儿
2026-09-06 08:42:03
热议中国女篮加时逆转捷克:媒体人吐槽长期集训29次失误匪夷所思

热议中国女篮加时逆转捷克:媒体人吐槽长期集训29次失误匪夷所思

狼叔评论
2026-09-06 23:04:16
乐桃航空发布新制服。空乘腰上挂个桃子?乐桃航空新制服,可爱到我以为看错了。

乐桃航空发布新制服。空乘腰上挂个桃子?乐桃航空新制服,可爱到我以为看错了。

毒舌八卦
2026-09-06 16:13:09
央国企摸底55岁在岗职工,内退重新启动,和早年老模式差别很大

央国企摸底55岁在岗职工,内退重新启动,和早年老模式差别很大

职场资深秘书
2026-09-06 17:13:44
那一巴掌扇的是郑丽文,碎的是国民党最后的体面?新竹内斗真相

那一巴掌扇的是郑丽文,碎的是国民党最后的体面?新竹内斗真相

时负相知
2026-09-06 06:53:53
英格兰两大亿元先生干架 切尔西新援被踢倒后怒推+狂喷阿森纳铁腰

英格兰两大亿元先生干架 切尔西新援被踢倒后怒推+狂喷阿森纳铁腰

我爱英超
2026-09-07 02:16:11
戴笠心腹管家晚年揭露:他当年安顿胡蝶时,仅因瞥见一个小细节,就腾空整个小院

戴笠心腹管家晚年揭露:他当年安顿胡蝶时,仅因瞥见一个小细节,就腾空整个小院

饭小妹说历史
2026-09-06 09:20:03
黄智贤倒在了黎明前

黄智贤倒在了黎明前

心本来就不大
2026-09-06 12:58:09
中超无罚分积分榜:铁人跌至倒数第二,蓉城继续9分领跑

中超无罚分积分榜:铁人跌至倒数第二,蓉城继续9分领跑

懂球帝
2026-09-06 22:12:19
2026-09-07 08:40:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

头条要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

8家中央金融企业获增资 释放什么信号?

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

本地
房产
艺术
游戏
旅游

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

房产要闻

突发重磅!海口出台楼市新政!

艺术要闻

毛泽东写《兰亭序》,史上最霸气版本!

《剑星》伊芙赛博忍者Mod 风格热辣性感动人

旅游要闻

渝见好“村”光 | 九龙坡区双骑龙村:果香四季 果然有趣

无障碍浏览 进入关怀版