导语:
2025年11月,Google Gemini 3的发布凭借其代际领先的视觉与逻辑理解力,标志着生成式人工智能加速迈向全模态交互的新纪元。技术能力的爆发式增长在赋能生产力的同时,也使模型能力与内容安全之间的潜在张力,成为备受关注的公共议题。
当前,相关的社会关切主要围绕以下三个维度展开:一是价值观偏离风险,即当前存在一种常见的误解,认为“中文语料”等同于“中式价值观”,进而担忧依赖海外数据训练的模型会无意识地携带和放大偏见,甚至生成与我国主流价值观相悖的内容;二是内容治理与责任追溯难题,面对生成式AI在输入端潜在的“数据投毒”威胁以及输出端的高逼真伪造能力,公众担忧现有的监管手段难以覆盖全链条风险,且在出现违规内容时难以精准追溯责任链条,导致“法不责众”或“无从追责”的困境;三是技术演进引发的安全滞后风险,即随着模型向全模态交互演进,其技术架构的革新也对传统安全防护模式构成挑战,担忧安全机制的迭代速度跟不上技术能力的发展。面对上述挑战与关切,我们应当秉持科学、理性且务实的态度,只有在深入理解模型技术原理的基础上,并结合中国AI治理的制度思路和产业落地实践,才能有效回应社会疑虑并对解题之道形成共识。
一、对齐什么?价值观由“语义内核”而非“语种表征”决定
针对第一重社会关切,即模型是否存在“价值观偏离”的风险,其破题关键在于厘清模型价值观对齐的底层逻辑,打破“中文语料”等同于“中式价值观”的认知误区。研究和实践表明,模型的“价值观”并不取决于训练语料使用的语言种类(如中文或英文),而在于语料所承载的语义内容本身。
早在2018年,自然语言处理(NLP)领域的研究便已揭示,即便仅使用单一语言进行训练,模型也能涌现出强大的跨语言泛化能力。这一发现于2025年3月被头部模型企业 Anthropic 的研究进一步深化,其研究表明,模型在学习过程中,会将知识和规律抽象为一个共享的概念空间。例如,“小”不再是一个单词,而是一个可被识别、可被推理的“概念”。当模型面对不同语言提问(如“小的反义词是什么?”)时,它调用的核心概念是一致的,进而能用相应语言准确作答。2025年4月阿里巴巴发布的 Qwen 3 模型也印证了这一点,Qwen 3支持语言从 Qwen 2.5 的 29 种迅速扩展至 119 种,而实现这一跨越仅依赖数万条新语种的语料。这充分说明,模型真正习得的是超越语言表层的“概念本质”,而非对特定词汇或语法结构的机械记忆。
这意味着,在构建高质量语料库时,核心在于语料内容是否蕴含符合中国立场、文化传统与社会共识的价值内核。只要内核正确,模型便能在其“概念空间”中将其内化,并在所有语言交互中稳定输出一致的价值表达。因此,应对价值观偏离风险的核心策略,并非机械地排斥特定语种的数据,而是专注于构建和筛选能够代表主流价值观的高质量语义内容。
![]()
图1 Anthropic研究揭示“共享概念空间”
二、如何对齐?中国AI治理体系的设计思路与产业落地实践
面对“内容治理与责任追溯”的第二重关切,特别是针对“数据投毒”引发的源头污染风险,以及高逼真伪造内容带来的下游误导风险,中国已探索构建一套覆盖“输入—训练—输出—追溯”全链条的AI治理体系,并在产业界形成了“内生安全”与“外在护栏”双重机制并行的落地实践。
在治理制度层面,坚持“管进”与“管出”结合。从“管进”(输入/训练语料端)来看,国家标准《生成式人工智能服务安全基本要求》(GB/T 45654-2025)确立了严格的源头把控机制:既要求确保数据获取途径的合法合规,通过随机抽样安全评估并提升来源多样性,又强调在内容处理上滤除违法不良信息,严格尊重知识产权与个人信息;此外,还对人工标注的规则、人员与流程进行了规范,以防止数据加工环节引入二次风险。从“管出”(输出/生成内容端)来看,《人工智能生成合成内容标识办法》构建了完备的AI标识体系:一方面通过显式标识让生成内容“亮明身份”,防止公众混淆;另一方面通过隐式标识保障全流程可追溯,确保能精准定位违规开发者或恶意使用者。
在企业落地层面,安全机制分为“内生安全”与“外在护栏”两层防线。内生安全方面,可以通过安全指令微调(Safety Supervised Fine-Tuning, 安全SFT)和人类反馈强化学习(Safety Reinforcement Learning from Human Feedback, 安全RLHF)等成熟技术,将符合国情的价值观与意识形态规范深度内化为模型参数层面的固有认知,赋予模型在概念空间内主动识别并拒止不当请求的能力。例如,BBC等外媒曾多次测试发现,中国头部大模型在面对涉及“台湾问题”等敏感政治议题的诱导性提问时,能够始终严守“一个中国”原则或拒绝回答违规内容。针对外界担忧的“数据投毒”风险,在动辄TB级的海量训练数据面前,单点有害数据的比例极低,其影响就像一滴墨水撒进了太平洋,难以撼动整体价值观。相反,在安全微调中会有意使用少量负面样本,旨在让模型通过理解错误的具体行为与表达,获得更强的辨识与防御能力,这就像人类接种少量病毒而获得免疫力。
外在护栏方面,其核心价值在于保证时效性和因地制宜,可用于热点事件的加强防护。作为模型外挂的“即时防御系统”,通过多维度的技术组合,为交互全流程提供了灵活且可靠的安全保障:一是在输入端,对用户指令(Query)进行实时的风险识别与意图分析;二是对涉及底线的特定敏感问题,直接触发拦截机制并输出预置的合规标准回答;三是在生成环节,引入基于知识库的检索增强(RAG)技术,利用权威事实数据校准模型输出,大幅降低事实性错误与幻觉风险;四是在输出端,对模型生成的响应(Response)进行二次安全过滤,兜底拦截潜在的不良信息;五是严格落实标识要求,在内容输出时自动添加显式标识与隐式水印,确保生成内容在后续传播过程中始终可辨识、可溯源。这些外部护栏的拦截记录还会进一步转化为高质量的安全增强语料,经过清洗后回流至训练环节,补充进模型的内生安全体系,形成“防御—反馈—进化”的良性闭环。
三、新的挑战?多模态爆发驱动安全机制协同演进
针对第三重关于“安全机制滞后于技术演进”的担忧,我们应当辩证地看到,多模态技术的爆发并未单纯增加防护难度,新的技术架构反而为安全防护带来了新思路,正在推动安全机制与模型能力协同演进。当前多模态模型能力跃升的底层技术逻辑,在于将大语言模型(LLM)作为核心编码器(Encoder)引入。其核心价值是一次深刻的范式革新:即从传统的“特征提取”跃迁至“认知编码”。传统的编码器通常将输入(如文本、图像等)映射为静态的语义向量,而LLM编码器则利用在海量数据中习得的强大世界知识与推理能力,对输入进行深度的“理解与抽象”。它能够精准捕捉传统模型难以处理的复杂语境、歧义、反讽乃至隐含的逻辑关系(如因果、条件)。例如,一个经过LLM编码的向量,不仅表征了文本的“内容是什么”,更内嵌了对其“真实意图”的深度理解,从而为下游任务提供了前所未有的高质量输入。
从内容安全的角度来看,这种模式构建了多模态模型的“内生安全”能力。安全防线不再仅仅依赖外部的规则过滤或后置审查,而是内化为Encoder自身的认知本能。LLM编码器能够基于对复杂意图的理解,主动识别并标记出潜在的恶意内容,如意图隐蔽的恶意提示、指令注入攻击或隐私数据泄露风险。这是一种从“表层特征匹配”到“深层意图识别”的防御升级。
与此同时,为应对全模态交互的复杂性,“嵌入式围栏”等前沿技术路线受到关注。不同于在模型输出后进行拦截的传统模式,嵌入式围栏尝试在模型结构中植入特定参数(如LM_Head/Task Head),直接利用计算过程中富含语义信息的隐层状态(Hidden States)进行风险判别。理论上,由于中间层状态包含了比最终输出文本更丰富的语义信息与安全特征,这种方式不仅能提供更充分的判别依据,还能避免对多模态数据的反复编解码,显著降低计算成本。更重要的是,它借助基座模型强大的语义理解能力,在潜在风险内容生成之前即实现“预判”与拦截,从而达成更为前置、精准且高效的安全防护。
![]()
图2 嵌入式围栏和外挂式围栏的对比
结语
综上所述,面对大模型内容安全的新一轮挑战,我们应当认识到:智能与安全从来不是零和博弈。实践证明,模型越“聪明”,其对复杂语义的深度理解和推理能力越强,对政治、伦理风险的识别与主动规避能力也就越强,内生安全系数自然越高,进而降低对人工标注语料的依赖。这一系列产业实践有力验证了“以智能促安全,以治理促发展”的可行路径。
鉴于当前我们已拥有不断健全的监管框架、日益多元化的安全技术路线,以及行业在安全对齐方面积累的初步经验,未来的核心战略应聚焦于以下方面,以持续迭代和从根本上提升模型的内生安全水平:第一,明确对齐逻辑,确立“语义为本”的认知,持续丰富高质量、负责任的多模态语料,并通过优化训练方法,帮助模型构建正确的世界观和价值观,而非机械地排斥特定语种或领域数据。第二,深化治理实践,依托覆盖“输入—训练—输出—追溯”全链条的中国AI治理体系,实现“内生安全”与“外在护栏”的高效协同。第三,拥抱技术升级,面对全模态交互的复杂性,积极探索“嵌入式围栏”等前沿机制,将安全能力植入模型深层结构,实现风险的前置预判和精准干预,推动安全与发展的同步演进。通过政府监管、企业自律与技术升级的协同共治,我们完全有能力在充分释放AI生产力的同时,筑牢安全防线,构建一个更加智能、可信赖且安全的生成式AI生态。
作 者
徐玮 袁媛
致 谢
感谢阿里云智能集团通义安全负责人张荣为本文研究提供技术指导
版块介绍 — 治理之智
在全球化背景下,科技的快速发展也带来了前所未有的治理挑战。本板块内容依托阿里巴巴集团先进的AI科技能力、丰富的应用场景与负责任的技术生态,聚焦于AI风险、AI大模型安全、AI大模型开闭源生态、AI大模型出海等AI治理政策研究,基于技术理性的风险观,为大模型发展与安全平衡与取舍提供独到见解。同时,我们致力于收集和分享海内外AI治理先进理论与经验,为构建合理的科技治理体系提供智慧与灵感。
Reading
1、
2、
3、
4、
5、
6、
7、
8、
9、
10、
11、
12、
13、
14、
15、
16、
17、
18、
19、
20、
21、
22、
23、
24、
25、
26、
27、
28、
29、
30、
- 如需转载,请在文章下留言 -
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.