导 语
2026年,美国在人工智能(AI)技术治理与国防科技政策的交汇点上推出了一项具有标志性意义的研究计划——“AI Forge”(人工智能锻造计划)。该计划由国防高级研究计划局(DARPA)、国家科学基金会(NSF)与国家标准与技术研究院(NIST)下属的AI标准与创新中心(CAISI)联合实施,并已发布面向高校研究团队的纲领性指导文件。
该计划是《美国人工智能行动计划》(America's AI Action Plan)既定部署的直接落地。行动计划明确要求“由DARPA牵头、联合商务部CAISI与NSF,实施一项推进AI可解释性、AI控制系统与对抗鲁棒性的技术开发项目”。报告将其立项依据界定为一项需要公共干预的结构性供给缺口(strategic gap):商业AI研发以通用能力的规模化扩张为导向,而国家安全任务对AI提出了差异化需求——须在生死攸关情境中运行、以超越常规人类监督节奏执行动作、维护隐私边界、与遗留基础设施安全集成、并满足严格的认证标准。由于此类问题缺乏即时商业回报,私营部门投入不足,形成“资金不足、探索不充分”的研发洼地。AI铸造计划的政策定位即为填补缺口、对关键难题实施前置性去风险(de-risk),并为前沿AI企业的后续投资开辟可行路径。
在组织机制上,该计划构建了一个由“高校—前沿AI企业—政府国防与情报部门”三方组成的协作论坛,以“项目风投”(Project Ventures)形式开展快节奏研究攻关,并通过向高校开放前沿级算力与模型访问权限,配套人才与思想的跨机构流动。其议程综合了2026 AI Forge National Security AI Strategic Visioning Workshop(AI铸造研讨会)的共识——该会议汇聚八家头部前沿AI企业、十五个以上国防部与情报界机构的首席AI官。文件并设定每六个月迭代更新一次的滚动修订机制,以匹配技术演进节奏。
在内容架构上,报告采用“三大研究主线(Research Thrust)×五项研究挑战(Research Challenge)”的矩阵式设计,整体形成一条由理解、到控制、再到对抗安全的递进逻辑链:AI可解释性主线追求“看得懂”,推动可解释性由实验室解释升级为可审计的操作性能力;AI控制主线追求“管得住”,构建覆盖全生命周期的整体控制架构以维持有意义的人类控制;对抗鲁棒性主线追求“打不垮”,由以模型为中心的静态防御转向覆盖“模型到任务”全链条的纵深防御。三条主线各设五项研究挑战,共同收束于“为高风险任务部署提供可验证证据”这一统一目标。其逻辑结构如下图所示。
![]()
一、AI可解释性推动其由学术属性向工程化运维能力转换
第一条主线的核心政策意图,在于推动可解释性由“实验室解释”升级为操作性可解释性(operational interpretability),即一种按用户角色定制、并须以任务相关基准予以度量的运维能力。这一目标设定具有明确的工程治理取向,将可解释性从描述性概念重构为可验证、可审计的能力指标。
五项挑战在技术成熟度上呈现清晰的梯度递进。挑战1聚焦从相关性洞察向可检验因果机制的跃迁,直指当前方法的核心局限——缺乏因果接地的可解释性在问责与调试场景中“脆弱且杠杆有限”,难以支撑事故归因。
挑战2将分析对象界定为“长程失效”,准确识别出高后果失效多为跨步骤、跨交互的涌现行为,并要求在无模型内部访问条件下生成“可检验的经验性归因”,对部署后取证提出了高标准。
挑战3的政策价值在于对自动化解释的忠实性风险作出预警,明确要求自动化与持续验证耦合,以防“流畅但不忠实”的解释成为新的误差来源乃至欺骗载体——这是一项重要的风险内控设计。
挑战4将可解释性单元由“token级输出”上提至“动作序列级”,对应智能体(agentic)系统的治理需求转换。
挑战5则前瞻性地处理“评估对象能力超越评估者”这一根本性命题,强调以“可追溯的证据包”(evidence packages)作为产出形态,体现了证据导向的评估治理思路。
二、AI控制以全生命周期整体控制架构夯实可靠性工程
第二条主线的关键技术诊断是,多数AI失效“并非传统意义的软件缺陷,而是意图失败”(failures of intent),其成因为目标错误设定(goal misspecification)或目标错误泛化(goal misgeneralization)。这一诊断决定了治理路径必须深入模型底层,而非依赖外部封装与脆弱的系统级护栏。
五项挑战构成覆盖“内生—溯源—遏制—干预—评估”全生命周期的控制链条。挑战1提出“可验证可引导性”,其要点在于将原生不确定性量化机制嵌入模型,使其具备对自身能力边界的可靠认知并在高风险时主动求援——这是从能力导向向可信导向的关键能力跃升。
挑战2针对“AI生成AI”带来的供应链治理新问题,以加密签名、安全制品库、可复现训练流水线、版本间差异测试等技术治理工具,回应部署前的关键审查问题(运行的究竟是什么、人类与AI各自贡献了哪些部分、相较上一版本有何变更、风险态势如何变化),具备较强的可操作性。
挑战3与挑战4分别构建预防性的“零信任遏制架构”与主动性的“运行时干预层”,并务实地承认逐动作同步验证的时延不可承受,转而提出风险分级验证、异步监控、统计审计等性能—安全权衡方案。
挑战5以“预测性评估”收束,直指静态观测式基准“无法可信预测真实性能且可被高能力智能体规避”的方法论缺陷,主张以动态、介入式评估及罕见灾难性失效的风险估计,构建可支撑任务保障(mission assurance)的证据链。
三、对抗鲁棒性由模型中心防御转向全链条纵深防御
第三条主线的威胁研判明确指出,攻击形态已由细微数据扰动演进为对生成模型的利用、对智能体工具调用的操纵以及针对在线系统的多步自适应攻击,其后果可级联为操作可靠性的整体丧失。相应地,主线的总体目标设定为由静态、以模型为中心的防御,转向覆盖“模型到任务”全链条的整体安全态势,并构成一套纵深防御(defense-in-depth)技术栈。
五项挑战的层次划分清晰。挑战1作出一项务实判断——对互联网规模语料训练的基础模型而言“保证数据完整性很可能不可行”,因而将研究重心由“清洗”转向“缓解”,目标是可验证地限定受污染数据子集的影响,并发展即便无法定位污染数据亦能检测后门效应的敏感行为测试,体现了“承认不完美、转而管理风险”的成熟工程治理逻辑。
挑战2与挑战3将防御对象推进至交互式与多智能体系统,针对“AI对手每秒发起数千次探测”的机器速度威胁,要求由静态护栏转向闭环自适应防御,并在多智能体层面追求“构造上即无法被诱导酿成灾难性失效”的协调协议与优雅降级能力。
挑战4处理持续学习的安全悖论,即实时适应为任务刚需,但数据流本身构成“低速慢渗”的持久攻击向量,方案以区分良性分布漂移与对抗注入、“在线遗忘”等机制予以应对。
作为收束的挑战5指向可信基准测试,明确以网络安全领域成熟的可重复性、有效性、有界假设下压力测试等验证概念为参照,产出可支撑高风险认证与部署授权的“可追溯、可审计、可辩护”的证据产品——这与前两条主线的证据导向逻辑高度一致。
结 语
综合评析,该计划的政策价值不限于若干具体技术议题,更在于其在科技管理层面所确立的若干治理范式。
一、重新界定AI研发的“前沿”内涵,明确公共部门在市场失灵领域的科技投入定位。
当行业普遍将“前沿”等同于通用能力的规模化扩张时,该计划将可信、可控、可靠确立为同等重要、需独立攻坚的基础科学问题;并以“缺乏即时商业回报—私营投入不足—公共前置去风险”的逻辑链条,为政府在公共品供给领域的研发干预提供了清晰的政策依据,其“去风险后再引导企业投资”的设计构成了一种公共—私营接力的创新机制。
二、示范“挑战驱动、跨机构协同”的科研组织范式与敏捷治理机制。
三家职能差异显著的机构——主管前沿研究的DARPA、主管基础科学的NSF、主管标准的CAISI——围绕统一的挑战清单形成职能互补的攻关合力,并将高校、企业、政府编织为共享算力与模型的协作网络。其以“挑战”而非“机构”为中心的组织逻辑,叠加“每六个月滚动更新”的敏捷修订机制,为快速演进领域的科研治理提供了可借鉴的组织设计样本。
三、揭示AI技术治理的核心抓手在于“可验证的证据”与“度量科学”。
贯穿三大主线的共同暗线,是将一切目标最终归结为可审计、可追溯、可复现的“证据产品”,并以共享工具、共同标准与可信基准为支撑。报告反复强调以“严谨的经验证据”替代“实验室可运行”的脆弱主张。这一思路表明,AI治理由理念走向实操的关键,不在于宣示原则,而在于建立使原则可被度量、可被检验、可被问责的度量科学与保障生态。
四、体现高风险技术治理中“承认不确定性、管理而非消除风险”的工程伦理取向。
从坦承“数据完整性不可保证”,到明示性能与安全的权衡,再到对“过度信任”与“评估被规避”的反复内控,该计划未诉诸技术万能论,而是在承认能力边界的前提下追求“风险可管理、可辩护”。这种以风险管理为基调的治理姿态,是先进技术走向负责任部署的前提条件。
总体而言,该计划试图锻造的与其说是一组技术,不如说是一种制度化能力——即让决策者能够基于可验证证据对先进AI给予有理据的信任(justified confidence),并以“AI保障生态”取代当前“定制化、脆弱”的解决方案格局。在能力竞赛加速的背景下,如何同步构建与之匹配的可信基础设施与保障体系,构成其留给AI研发与治理各方的共同课题。
冯岩,上海市研发公共服务平台管理中心(上海市科技人才发展中心)。丁炜超,华东理工大学信息科学与工程学院计算机科学与工程系副教授。文章观点不代表主办机构立场。
◆ ◆ ◆
编辑邮箱:sciencepie@126.com
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.