网易首页 > 网易号 > 正文 申请入驻

美国发布《生成式人工智能手册》

0
分享至



近日,美国国务院发布《生成式人工智能手册》。这份39页文件以内部平台StateChat为案例,复盘一个政务生成式人工智能系统如何从零散试用走向企业级部署:先定战略和组织,再做原型、测试、授权、上线、培训和推广,最后转向专业工具与智能体协同。手册最值得注意的并不是聊天机器人本身,而是美国国务院把安全审查、用户反馈和变革管理做成了产品能力。截至2026年6月,StateChat用户已超过6.2万,覆盖98%的美国驻外机构。但其成效调查采用自愿参与样本,报告也明确承认不适合进行统计推断。换句话说,这既是一份可借鉴的实施路线,也是一份需要审慎阅读的政府技术扩散样本。

一、这不是模型手册,而是交付路线

(一)七个阶段回答七个管理问题

手册把实施过程拆成奠基、阿尔法开发、贝塔开发、上线、规模化推广、能力深化和影响评估七个阶段。它没有从“选哪一个大模型”讲起,而是先问目标是否一致、组织是否就位、敏感数据能否进入、用户是否真用、成效能否度量。

阶段

核心任务

参考周期

奠定基础

战略、组织、平台与试点

2~3年

阿尔法开发

证明安全可行

4~6个月

贝塔开发

证明真实有用

4~6个月

正式上线

分阶段开放与培训

4~6周

规模推广

传播、学习与采用

6~8个月

能力深化

专业工具与智能体

4~6个月

影响评估

调查、复盘与改进

6~8周

这条时间线揭示了一个常被忽略的事实:政务人工智能不是把模型接入办公网就算完成。前期战略和治理建设以年计,正式上线只是中间节点,后面还要持续解决培训、信任、流程嵌入和效果验证问题。

(二)真正的架构是“集中底座、分散创新”

美国国务院把StateChat放在统一管理的企业级平台上,集中提供安全接口、受控开发环境和敏感但非密信息处理能力;同时允许业务人员建设定制助手,让技术团队、专业部门和“公民开发者”在同一规则下试验。这不是简单的集中或分散,而是把安全与共性能力集中,把需求发现和工具创造向一线分散。

美国技术现代化基金公开项目页显示,该项目自2024年5月启动,投资额为1820万美元。这个数字说明,所谓“快速落地”背后并非低成本插件,而是平台、治理、人员、培训和组织协同的成套投入。对我国而言,判断一个政务人工智能项目是否成熟,不能只看演示效果,还要看能否形成可复用的公共能力。

二、安全不是刹车,而是使用价值

(一)高等级授权决定能处理什么数据

StateChat的阿尔法阶段只吸收150名测试人员,却用了一年推进高等级运行授权。手册强调,这项工作使平台能够处理敏感但非密信息,接入外交电报、内部报告等真实数据源。若没有这一步,系统只能处理低敏感信息,也就很难进入高价值业务。

这里的逻辑值得重视。安全合规不是产品完成后补盖的印章,而是决定产品用途上限的设计变量。美国国务院把网络安全、隐私、档案管理、无障碍和独立测试人员提前拉入团队,再用功能测试、人工智能性能测试和用户验收测试三层机制验证原型。

(二)先暴露问题,再决定投入方向

最早的StateChat并不完善:每名用户只有一个对话线程,24小时后消失,上传文件可能耗费数小时,也没有内部系统连接。手册仍然认为尽早交给真实用户是正确选择,因为文件上传和内部数据连接等需求,只有在实际使用中才会显现优先级。

贝塔阶段随后在5个月内把用户从150人扩大到8000人。团队一面直说“这是贝塔版,而且确实像贝塔版”,一面建立反馈表、满意度调查、办公时间和用户访谈。其“雷霆穹顶”机制把6个渠道、800份调查和22次深度访谈汇总成10项高频需求,再形成6个月路线图。

(三)反馈治理比收集意见更重要

大量反馈并不自动产生好产品。手册的做法是先归并主题,再评估技术可行性和任务优先级,随后让用户投票,最后公开路线图。这样做的价值,不只是选出功能,更是让用户看见意见如何进入决策,避免反馈成为没有下文的“意见箱”。

对我国政务人工智能建设而言,可借鉴的不是某次投票形式,而是把需求、风险、开发成本和任务价值放进同一套可追溯决策机制。哪些意见被采纳、哪些暂缓、依据是什么,应当能够复盘,否则所谓敏捷开发很容易退化为需求堆积。

三、规模化之后,才真正进入深水区

(一)账号开放不等于组织采用

美国国务院面对的是约8万人的全球化组织。手册用战略传播、定向培训、全球直播、自主学习资源和本地推广者五个支柱推动采用。2024年3月至2026年5月共举办94场办公时间活动,约1.7万人参加;“培训培训者”模式又在不增加核心团队人员的情况下,通过430多场活动触达4.8万多人。

这些数字背后的机制比数字本身重要。领导授权解决“能不能用”,岗位案例解决“为什么用”,即时培训解决“会不会用”,本地推广者解决“谁来长期教”。生成式人工智能进入组织,首先改变的是知识传播和工作习惯,其次才是模型调用量。

(二)从通用聊天走向任务型智能体

在广泛采用之后,StateChat才从单一聊天工具转向互联工具集。FAMsearch可检索约3万页美国外交事务手册并返回原文引证,后来又从独立页面变成后台调用能力;定制助手则允许用户自己建设面向特定报告或行政问题的工具。

手册把下一步指向多智能体协同:一个智能体检索政策规范,另一个检查相关电报,第三个校正格式。但原文写得很清楚,截至2026年春季,美国国务院仍在“准备”迎接这种转变。这是方向性设想,不是已经完成规模化验证的自主运行体系。

(三)成效数据必须和样本边界一起读

影响评估共有3700人开始答题,最终2706份回答进入分析,其中2113人为每月至少使用一次的常规用户。常规用户中90%自报节省时间,96%愿意推荐,平均每项任务每周节省1.6小时。原图以“Selection Rate vs Mean Time Saved”比较任务普及率与人均节时,显示起草沟通文本覆盖面广,制作培训材料则单人节时更高。


图2:原手册第32页“时间节省影响矩阵”。气泡大小表示选择该任务的用户数,颜色表示每周节省总时长。

问题在于,调查采用自愿报名而非随机抽样,手册明确写明“不适合统计推断”。所谓每周起草工作节省逾1万小时,也是依据1.9万名周活跃用户作出的外推,不等于独立审计后的生产率增量。更直接的限制来自用户反馈:功能不适配、不会使用、回答质量不足、需要更多培训以及安全担忧,仍是主要障碍。


图3:原手册第34页列出的五项主要使用障碍。回答质量、功能适配和培训需求仍影响实际收益。

手册内部还出现98%与92%两种驻外机构覆盖率口径。本文采用首页与美国技术现代化基金项目页共同支持的98%,同时保留差异。深度解读不能把“用户多、覆盖广”直接等同于“任务效果好”,更不能用一次自愿调查替代长期、分岗位和可对照的成效评估。

四、结论与建议

(一)结论

该报告的结论是:生成式人工智能的规模化落地,本质上是一项组织能力建设,而不是一次软件部署。美国国务院以统一平台和高等级安全授权托住敏感业务,再通过分阶段测试、用户反馈、培训网络和任务型工具扩大采用,最终向智能体协同延伸。

其经验具有参考价值,但成效仍主要来自自报调查和机构内部估算,智能体化也尚处于发展方向,不能把路线图当成已经证实的最终模式。

(二)建议

先建共性安全底座。应统一提供模型接入、权限控制、数据分级、日志审计和受控试验环境,让业务创新建立在可复用能力上,避免各单位重复建设、标准不一。

把授权嵌入全周期。应让安全、保密、隐私、档案、无障碍和独立测试人员从需求阶段进入团队,并按任务风险设置分层放行和持续复评机制。

用任务成效替代活跃。应区分登录人数、使用频次、节省时间、核验成本和任务质量,尽可能采用分层抽样、前后对照与失败案例复盘,防止用热度代替效能。

稳步推进智能体应用。应先在有权威知识库、可追溯引证和明确权限边界的任务中验证检索型助手,再逐步增加工具调用与多智能体协同,并保留人工确认和随时中止能力。

免责声明:本文转自“占知智库”公众号,原作者占知知道。文章内容系原作者个人观点,本公众号编译/转载仅为分享、传达不同观点,如有任何异议,欢迎联系我们!

转自丨占知智库

作者丨占知知道

研究所简介

国际技术经济研究所(IITE)成立于1985年11月,是隶属于国务院发展研究中心的非营利性研究机构,主要职能是研究我国经济、科技社会发展中的重大政策性、战略性、前瞻性问题,跟踪和分析世界科技、经济发展态势,为中央和有关部委提供决策咨询服务。“全球技术地图”为国际技术经济研究所官方微信账号,致力于向公众传递前沿技术资讯和科技创新洞见。

地址:北京市海淀区小南庄20号楼A座

电话:010-82635522

微信:iite_er

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

全球技术地图 incentive-icons
全球技术地图
洞见前沿,引领未来
4488文章数 13430关注度
往期回顾 全部

专题推荐

乌蒙深处 清凉毕节

无障碍浏览 进入关怀版