网易首页 > 网易号 > 正文 申请入驻

把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人

0
分享至




一句“不用担心”背后的医学事实漏洞


在线问诊中,一句 “你的脂肪肝不用担心”,背后可能隐藏着什么?

咨询者是一名既往弥漫大 B 细胞淋巴瘤患者,医生根据影像描述将脂肪肝特征误判为 “影像高密度”,据此排除了脂肪肝。该判断表面看符合医学语境,但关键医学事实与真实影像表现并不一致。

以往针对在线诊疗的安全方案,大多依赖关键词规则或简单的文本分类。这类方法对 “明显错误” 有效,但遇到需要结合患者全局上下文、临床指南和证据链才能判断的边界案例,往往力不从心。一个 “不” 字被遗漏,结论就可能完全相反。

最近,蚂蚁 AI 安全实验室与厦门大学团队联合提出了 MedGuard,将医学事实核查嵌入诊疗流程。它不是又一个 AI 问诊系统,而是一层可嵌入医疗服务流程的安全基础设施 —— 在医生给出诊疗意见、AI 生成回复、用药方案形成之前,先对关键医学事实进行证据层面的验证。相关论文已被 npj Digital Medicine 接收。



  • 论文标题:MedGuard: An LLM-Based Gatekeeper for Detecting Clinical Risks in Chinese Telemedicine Consultations
  • 合作机构:蚂蚁集团、厦门大学
  • 论文状态:npj Digital Medicine(Nature Portfolio,影响因子 18.0)
  • 论文链接:https://www.nature.com/articles/s41746-026-03116-0_reference.pdf

该研究将重点聚焦于医疗安全中的诊疗安全:面向真人医生和 AI 辅助诊疗等多元医疗服务形态,在医患对话、诊断结论、用药方案和治疗建议形成的过程中,主动发现事实错误、逻辑矛盾、关键遗漏与潜在用药风险。最终沉淀为MedGuard—— 一个面向中文医疗场景的医疗事实核查与诊疗风险识别系统。

MedGuard 在基准评测和临床专业人员评价中均展现出突出表现:基于 7B 参数量级构建,在研究构建的 MedGuardEval 医疗风险评测基准上,评测覆盖真实在线问诊、复杂临床病例和药品知识三类场景。MedGuard 在细粒度对话级风险识别任务中达到 SOTA 水平,整体优于主流开源模型与 HealthCareAgent 等代表性医疗 Agent 系统,其中 F1 相比基线平均提升 22.1%。不仅如此,在 5 分制临床评价中,按照研究预设标准,3 分及以上表示具备临床辅助参考价值;126 名覆盖 10 个科室的持证临床专业人员对 MedGuard 七项评估维度的平均评分均超过 4.0 分,整体评价达到较高水平,其中事实准确性、错误减少、法律伦理安全与整体可用性等关键维度超过 4.2 分。

难的不是 “生成答案”,而是 “判断是否可靠”

互联网诊疗让患者随时随地能看上医生,但也让诊疗风险的呈现方式发生了根本变化。

一次在线问诊可能持续数小时甚至数天。病史、症状、检查结果、处方和治疗建议分散在十几轮对话中。无论是辅助医生开展诊疗,还是支持 AI 参与医疗服务,AI 真正要发挥作用的不是 “生成一段看似专业的回复”,而是能否完整理解临床语境,并准确识别哪些医学事实需要进一步核查。

研究将在线诊疗中的医学事实核查归纳为三类核心挑战。

第一,关键信息被长对话淹没。诊疗风险往往隐藏在长链路、多轮次交流中,关键否定词、剂量信息、既往史和患者特殊情况容易被上下文信息淹没,导致重要风险信号遗漏。

第二,风险边界难以界定。医疗安全不是简单的 “对” “错” 之分。部分诊疗建议需要结合患者具体情况、指南依据和临床经验综合判断。过度敏感会将合理诊疗行为误判为风险,产生大量无效预警,增加医生负担;过于保守则可能遗漏真正需要关注的问题。

第三,医学判断结果需要可追溯。医疗风险识别 “这里有问题” 并不困难,难的是说清楚 “为什么有问题”。缺乏可追溯证据链的风险提示,医生难以快速复核,也就难以形成有效干预。

MedGuard 让医疗判断具备

可验证性的事实核查框架

将复杂诊疗过程拆解为可核查的医学事实

MedGuard 的思路是:将复杂的医患交流拆解为一组可独立验证的原子医学声明(atomic medical claims)。所谓原子医学声明,是指每条声明只表达一个可以独立判断真伪或风险的临床命题,例如 “该影像表现可排除脂肪肝” 或 “当前剂量适用于该年龄患者”。

系统同时维护患者全局上下文,提取年龄、性别、既往史、过敏史和当前用药等关键信息,对分散在多轮交流中的语句进行去上下文化重写,补全指代和省略信息,并保留否定关系、剂量和时间等关键临床约束。

这一过程包含关键医学信息抽取、患者上下文构建、声明去上下文化、质量审查与去重四个环节。它解决了医疗事实核查中的一个关键问题:如果待核查的医学事实本身不完整,后续检索和推理能力再强,也可能验证错误的对象。通过构建带有患者特异性的原子医学声明,MedGuard 为后续证据核查建立稳定入口。



图 1 展示了 MedGuard 对真实问诊案例的事实核查过程。系统从诊疗交流中提取关键医学声明,并结合医学证据识别潜在风险。

基于不确定性驱动证据核查,形成闭环验证能力

MedGuard 对每条医学声明,不直接进行简单的 “风险 / 无风险” 二分类,而是先进行分层谨慎判断,输出 No Risk、Low Risk、High Risk 三种状态。其中 Low Risk 并不代表低危,而是表示当前判断依据不足或语义存在歧义,需要进一步核查。

高置信的 No Risk 与 High Risk 声明可以沿快速路径完成初步判断;只有进入不确定区域的声明,才触发外部医学证据核查流程。这种以不确定性驱动核查的机制,使系统能够将有限的检索和推理资源集中投入最需要复核的边界案例,在降低漏报的同时控制无效预警。



图 2 展示了 MedGuard 的证据核查闭环流程:系统围绕待核查医学声明,通过规划器生成检索策略,调用医学知识资源获取证据,并由推理模块结合声明与证据输出最终风险判断。

进入核查路径后,MedGuard 的规划器会将医学声明转化为结构化检索任务,明确核心医学实体、适应证 / 禁忌证约束,以及对应的疾病或药物知识领域。检索器在由六类权威中文医学资源构建的知识底座中获取相关证据,该知识底座包含 16535 条疾病记录与 187738 条药物记录。



图 3 展示了 MedGuard 的医学知识底座与证据推理过程:系统分别从疾病和药物知识库中提取相关证据,并形成支撑最终风险判断的 Evidence Chain。

总结器进一步抽取与声明直接相关的证据片段,保留剂量、禁忌证、相互作用和定量指标等关键事实。与单次检索后生成不同,MedGuard 会显式判断当前证据是否充分:若证据缺失、相关性不足或无法支撑结论,规划器会分析失败原因,调整检索策略并再次触发检索与总结,直到获得足以支撑判断的证据。

最终,推理器联合医学声明与精炼证据,输出 Risk/No Risk 结论、解释和证据链,形成声明理解 → 不确定性路由 → 证据规划 → 检索总结 → 充分性判断 → 推理输出的完整闭环。

不仅发现风险,更准确判断风险边界

在细粒度与粗粒度对话评估中,MedGuard 均表现出稳定的风险识别能力。基于 7B 参数量级构建,细粒度对话级风险识别任务中达到 SOTA 水平,整体优于主流开源模型与 HealthCareAgent 等代表性医疗 Agent 系统,其中 F1 相比基线平均提升 22.1%,粗粒度评估提升 5.8%;其中,作为事实核查入口的声明抽取能力相比其他大模型平均提升 23.2%。在按治疗类别、身体系统、年龄和语义标签划分的 41 个子类中,平均 F1 达到 0.77,38 个子类进入前三,22 个子类排名第一。



图 4 展示了 MedGuard 在细粒度、粗粒度风险识别以及医学声明抽取任务上的性能表现,验证了其对复杂医疗语境中关键风险的识别能力。

但数字之外,更值得关注的是 MedGuard 对 “风险边界” 的判断能力。医疗安全能力的关键,不只是发现风险,更需要准确区分真正需要关注的问题与合理诊疗行为。

回归那个既往弥漫大 B 细胞淋巴瘤患者的在线问诊案例,医生将脂肪肝错误描述为影像高密度影,并据此排除了脂肪肝。MedGuard 基于权威证据进行事实核查,准确识别了这一医学事实错误,同时保留医生提出的 MRI 与甲胎蛋白检查建议等合理诊疗行为,体现了对诊疗风险边界的判断能力。

研究进一步邀请 126 名、覆盖 10 个科室的临床专业人员,对 604 段真实问诊进行评价。事实准确性、错误减少、法律伦理安全与整体可用性等关键维度平均得分均超过 4.2 分(满分 5 分);不同科室医生评分具有较高一致性,体现出较好的临床认可度和跨科室适用性。



图 5 展示了 MedGuard 的多维临床评价结果,包括不同评价维度得分、科室覆盖范围以及医生评分一致性分析。

另一组数据同样值得关注:在 10000 段真实问诊记录的回顾性验证中,MedGuard 在不同生理系统中的风险识别波动控制在 ±0.03;同时产生 2234 条风险预警,而对比模型产生 4785 条,说明其并非依靠增加预警数量换取安全,而是在保持风险识别能力的同时,有效控制不必要的警报负担。换言之,它所发出的每一条预警,都更值得临床医生认真审视。

把诊疗安全能力嵌入真实医疗流程

MedGuard 最终不是一个独立的问诊系统,而是一层可嵌入医疗服务流程的安全基础设施。它可以接收完整问诊记录、医生诊疗结论或 AI 辅助生成的诊疗建议,对其中的关键医学事实进行核查,并输出结构化结果:待核查声明 — 风险等级 — 支持证据 — 解释与修正建议。

在实际应用中,MedGuard 可覆盖三个关键环节,将事实核查能力嵌入医疗流程,形成持续、规模化的风险发现机制。

1.回复或处方前核查:在医生或 AI 给出结论之前,先行完成医学事实层面的验证;

2.问诊过程风险提醒:在对话进行过程中,实时提示潜在医学事实风险;

3.历史诊疗质量回顾:对已完成问诊进行回顾性的医学事实质量核查。

在 Medical Fact Check 服务体系中,MedGuard 将医疗安全转化为可执行流程:识别关键医学事实,基于权威证据完成验证,并在必要时触发复核。系统定位为诊疗安全辅助能力,而非替代医疗决策。它的核心价值在于:当临床医生面对复杂病例时,多一个 “背靠权威证据的同行评议者” 协助把关。

从长对话理解、医学声明拆解,到不确定性驱动的证据核查,MedGuard 探索了一条面向医疗智能化时代的安全技术路径:医疗智能化的安全,不只是避免生成有害内容,更需要发现不可靠诊疗事实、解释风险依据,并在不干扰正常医疗服务的前提下及时介入。

在 AI 走向临床的过程中,这样的 “守门人”,或许比任何炫酷的生成能力都更重要。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
王一博夺冠、吴彦祖退赛、91号赛车起火 上海站成China GT“最险”一站

王一博夺冠、吴彦祖退赛、91号赛车起火 上海站成China GT“最险”一站

封面新闻
2026-09-06 13:38:02
深圳中银大厦21楼的诡异传闻

深圳中银大厦21楼的诡异传闻

白浅娱乐聊
2026-09-08 00:59:15
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汤家凤呼吁取消英语,他这个“坏种”,竟然是南京大学博士

汉史趣闻
2026-09-06 10:13:22
查尔斯打破沉默:哈里梅根回英后不会恢复王室公务

查尔斯打破沉默:哈里梅根回英后不会恢复王室公务

赴一场山海啊
2026-09-08 00:02:56
承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

天天热点见闻
2026-09-07 06:10:14
单机游戏史上结局最多的游戏,玩了二十年都没凑齐

单机游戏史上结局最多的游戏,玩了二十年都没凑齐

街机时代
2026-09-07 18:00:03
双色球第2026103期开奖:一等奖7注分落5地 二等奖125注

双色球第2026103期开奖:一等奖7注分落5地 二等奖125注

会飞的小小鱼654
2026-09-08 00:46:26
老板娘问我她屁股翘不翘?我该怎么回答?

老板娘问我她屁股翘不翘?我该怎么回答?

太急张三疯
2026-09-08 08:10:26
女生赴港看演唱会全家被取消低保,是冤枉还是活该?官方解释来了,网友:良言难劝该死的鬼

女生赴港看演唱会全家被取消低保,是冤枉还是活该?官方解释来了,网友:良言难劝该死的鬼

笔尖下的人生
2026-09-07 14:14:43
快船超市开张,骑士如果能顺利得到这三人,米哈带队就有希望夺冠

快船超市开张,骑士如果能顺利得到这三人,米哈带队就有希望夺冠

老梁体育漫谈
2026-09-08 00:13:41
小米澎程N70上市:中大型五座增程SUV,20.99万元起

小米澎程N70上市:中大型五座增程SUV,20.99万元起

三言科技
2026-09-07 21:04:06
韩国女篮输关键战八强危矣!韩媒炮轰裁判不公:罚球34-6离谱到家

韩国女篮输关键战八强危矣!韩媒炮轰裁判不公:罚球34-6离谱到家

颜小白的篮球梦
2026-09-08 06:15:05
网传“新疆一加气站重度漏气”,官方辟谣:系虚假捏造

网传“新疆一加气站重度漏气”,官方辟谣:系虚假捏造

界面新闻
2026-09-08 07:11:10
汪小菲马筱梅带娃游广州!玥儿长发飘飘好像大S,像是来给大S复仇的

汪小菲马筱梅带娃游广州!玥儿长发飘飘好像大S,像是来给大S复仇的

八星人
2026-09-06 13:04:57
破冰之旅!时隔两年台官员顶着中国台北四个字登陆,国台办亮底线

破冰之旅!时隔两年台官员顶着中国台北四个字登陆,国台办亮底线

面包夹知识
2026-09-07 18:24:48
日本人预测:未来35年将出现5大强国,日本屈居第二,那中国呢?

日本人预测:未来35年将出现5大强国,日本屈居第二,那中国呢?

经纬戎韬
2026-09-06 00:46:23
女篮世界杯中国队大比分击败意大利,淘汰赛首轮将对阵波多黎各

女篮世界杯中国队大比分击败意大利,淘汰赛首轮将对阵波多黎各

澎湃新闻
2026-09-08 05:56:10
四川省巴中市委原书记何平被“双开”

四川省巴中市委原书记何平被“双开”

界面新闻
2026-09-07 19:45:53
美网八强战对手突变,阿尔卡拉斯采访中当场愣住:完全不知道

美网八强战对手突变,阿尔卡拉斯采访中当场愣住:完全不知道

慢享生活集
2026-09-07 09:31:12
2026-09-08 09:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13940文章数 142729关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

南阳"老头乐"退场 老人想不通:能产能卖为啥上路违法

头条要闻

南阳"老头乐"退场 老人想不通:能产能卖为啥上路违法

体育要闻

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

全球黄金“回家”

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

教育
游戏
手机
时尚
艺术

教育要闻

教学诊疗:课堂秩序混乱这个问题咋解决?

任天堂多款新作泄露 新大乱斗、3D马里奥等

手机要闻

雷军展示“折叠机的坟场 :干了8万次跌落 摔了1500多台工程机 花费几千万元

白露食白——露从今夜白,味从此时鲜

艺术要闻

一幅分裂的古画:一边祝你升官,一边劝你放下欲望

无障碍浏览 进入关怀版