网易首页 > 网易号 > 正文 申请入驻

平扫 CT 看食管癌,九成能查出,癌前病变漏一半

0
分享至


《自然·医学》2026 年 9 月 22 日上线了一篇中国团队主导的研究,题目直译是「用平扫 CT 加人工智能做大规模食管癌筛查」。他们训练出的模型叫 EAGLE,输入是一次普通的胸部平扫 CT:没打对比剂、没做胃镜、也不是为食管专门安排的检查。在 8 家医院、11466 人的外部验证里,这个模型查出了 90.0% 的食管癌,特异度 98.5%;但对癌前病变(高级别上皮内新生物,缩写 HGIN)只查出 52.5%。研究在中国临床试验注册中心登记(ChiCTR2300074806)。

一个结果和一个限制摆在一起,正好问出了读者会卡住的地方:食管癌一向靠胃镜查,一张查肺的平扫 CT 上凭什么能看出来?既然癌能查出九成,为什么癌前病变还会漏掉一半?

食管癌为什么一直靠胃镜

2022 年全球食管癌新发约 51.1 万例、死亡约 44.5 万例。它的麻烦在于确诊太晚:中国食管癌的 5 年生存率是 36.9%,美国是 18.5%,都不好看。

中国在高发地区做了多年的内镜筛查,证据是硬的,ESECC 随机试验的 9 年报告显示,一次性内镜筛查能降低食管癌的发病和死亡。问题在覆盖面。内镜是侵入性检查,要预约、要麻醉或咽部麻醉、要有内镜医生和消毒周转的床位。即便在高危人群里组织筛查,一次内镜筛出恶性病变的比例也只有 0.80% 左右,意味着每查一百多个人才碰上一个。愿意来的人又不多,很多该查的人根本不进这个门。

所以研究者的思路是去找一个已经存在的入口。胸部 CT 占了全部 CT 检查的四成左右,不管是住院前的常规检查、急诊的胸痛排查,还是肺癌低剂量 CT 筛查,扫描范围本来就把整条食管包在里面。吸烟同时是肺癌和食管鳞癌的危险因素,两类人高度重叠。片子已经拍了,信息已经在硬盘里,只是没人去读食管。

这段食管在平扫 CT 上为什么难读

食管是一根空腔管道,平时是瘪的,前后壁贴在一起,粗细随吞咽和呼吸变化。它紧挨着心脏和主动脉,每一次心跳都会把图像带出运动伪影。横断面上切出来,常常只是纵隔里一个形状不规则的小软组织影。

早期病变的尺度又很小。HGIN 还局限在上皮层,I 期食管癌也只侵到黏膜或黏膜下,厚度以毫米计。这个量级的增厚,和生理性狭窄、塌陷造成的管壁堆叠在密度和形态上几乎分不开。平扫没有对比剂,病灶和正常管壁的密度差本来就小。

结果就是放射科医生在常规阅片里不会去找它,也很难找到。研究者引用的一项分析发现,后来死于食管癌的人,大多数在此前 5 年的胸部 CT 报告里没有留下任何食管可疑记录。

这篇研究自己的阅片实验给出了同一个问题的量化版本。300 例片子(200 例恶性、100 例阴性)交给 17 名放射科医生,其中 3 名食管专科、6 名普通放射科医生、8 名住院医师,平均从业 7.6 年。不借助 AI 时,他们对食管恶性病变的平均敏感度是 71.9%,特异度 79.6%。细分到早期:HGIN 的平均敏感度 36.3%,I 期癌 59.8%。


关键一步在标注,不在模型

模型要学会识别一个人眼都标不出来的东西,训练标签从哪来?这是整篇研究里最值得讲的一步。

团队没有让标注者「在平扫 CT 上找病灶」。他们换了一条路:内镜手术切下来的标本有病理报告,报告里写着病变距门齿多少厘米,这是厘米级的纵向定位;再把这个位置拿到同一个病人的增强 CT 上,由食管专科放射科医生去对照着找对应层面的异常;两名标注者各做一遍,分歧交专家裁定,最后落成体素级的食管轮廓和病灶掩膜。

换句话说,标签的来源是病理和内镜,不是 CT 上的可见度。于是那些「人眼看不出来、但病理证实确实在那里」的病灶,也带着准确坐标进了训练集。训练集一共 6813 例,来自中山大学肿瘤防治中心和四川省肿瘤医院,其中 264 例 HGIN、548 例 I 期、2932 例 II–IV 期、3069 例阴性对照。阴性对照要有至少 2 年随访或 1 年内的阴性内镜才算数。

模型本身分两步:先在整个三维 CT 里把食管定位出来,再在这一段里同时做病灶分割和患者级的恶性概率预测,输出一张热图标出哪些区域支撑了判断。阈值可以调:用在医院里顺带筛查时,把阈值调到 99% 特异度那一档;用在高危人群内镜筛查前分流时,调到 98% 敏感度那一档。同一个模型,两种用法。

下图来自原文 Fig. 2h,是一例胸段食管下段的癌前病变:左边是原始平扫 CT,中间是模型勾出的病灶轮廓,右边两张是热图,颜色最亮的地方就是支撑它判断的区域。三张对照着读,能体会到这个病灶在原始图像上有多不起眼。


外部验证的数字,以及它在哪里变弱

内部 2500 例:曲线下面积 0.991,敏感度 89.4%,特异度 99.3%。

外部 8 家中心、11466 例,横跨中国、捷克和澳大利亚:曲线下面积 0.976,总敏感度 89.5%,特异度 98.5%。捷克队列敏感度 94.4%,澳大利亚队列 90.2%,跨人群没有塌掉。

按病变分层看,差距才出来。癌是 90.0%,HGIN 只有 52.5%。按分期看,I 期 60.1%、II 期 93.1%、III 期 95.9%、IV 期 96.2%,敏感度随分期一路爬升。按位置看,中段 92.2%、下段 91.8%、上段 84.4%,而食管胃结合部只有 76.4%:这个部位本来就和胃底、膈肌脚挤在一起,形态判断最不稳。按性别看,男性 90.7%、女性 84.3%,作者把它归因于训练数据里男性病例远多于女性。

同一批片子交给 17 名医生,加上 AI 的分割图和概率提示再读一遍(两轮间隔至少 3 个月以冲掉记忆),敏感度从 71.9% 升到 85.7%,特异度从 79.6% 升到 91.7%,两项都是 P<0.001。对早期病变帮助更明显:HGIN 平均敏感度抬高 16.6 个百分点,I 期抬高 22.7 个百分点,住院医师加上 AI 之后接近食管专科医生的水平。

人机合作并没有达到 AI 单独的高度。EAGLE 单独的曲线下面积是 0.981,比医生平均高出 19.1 个百分点的敏感度和 18.4 个百分点的特异度;医生看过 AI 提示之后,成绩抬上去了,仍停在 85.7% / 91.7%。作者给的解释很实在:在平扫 CT 上评估早期食管癌并不属于目前的常规工作,医生没有受过针对性训练,面对一个非常规指征的 AI 提示,他们会打折扣地采纳。把 AI 做出来和把 AI 装进流程,难度并不一样。


为什么阳性预测值会从 55% 掉到 12.5%

在三家大型中心、35402 人次的真实世界数据里,模型第一次遇到没挑选过的病人:门诊、急诊、住院、体检混在一起。第一批 20758 人中有 285 例食管恶性,敏感度仍有 89.6%,但特异度从 98.5% 掉到了 95.5%。掉的这三个百分点换算成人头,就是四百多个假阳性。

研究者把这批难例(所有假阳性、所有假阴性,再加上刚过阈值的边缘真阳性)挑出来重新标注、并进原训练集微调,得到升级版 EAGLE-Plus。在第二批 14644 人上,假阳性从 432 个降到 118 个,少了 72.7%;阳性预测值从 25.3% 升到 55.0%;敏感度 89.8% 对 88.3%,没有显著差别(P=0.62)。

接着是两个真刀真枪的场景,数字差得很远:

医院前瞻验证,17446 人,2025 年 1 月到 4 月入组、随访到 2026 年 7 月。模型报阳 90 人(阳性率约 0.5%),其中 38 人确认是真的(36 例癌、2 例 HGIN),阳性预测值 42.2%。

体检低剂量 CT,10959 人,45 到 75 岁。模型只报阳 8 人(阳性率 0.07%),特异度 99.94%,而阳性预测值 12.5%。

同一个模型、同一套阈值,一个阳性结果的分量为什么差三倍多?因为阳性预测值由人群的患病率决定。医院里做胸部 CT 的人,本来就有相当一部分带着症状或已知肿瘤,食管恶性的比例高;体检中心里 10959 个无症状的人,真有食管恶性的大概只有个位数。特异度 99.94% 听着极高,可它作用在一万多个健康人身上,仍会生出几个假阳性,而真病人一只手数得过来。两边一除,阳性预测值就塌下来了。

同样的算术也解释了为什么作者要费力气做那一轮降假阳性的微调。筛查工具的瓶颈往往不在敏感度,而在每多报一个阳性就多一个人要去做胃镜、多一家人要担心一个月。

把内镜留给更可能有病的人

另一条用法反过来:不替代内镜,而是决定谁先去做内镜。

在四川遂宁和浙江丽水两家筛查中心,研究者收集了 702 例既做过内镜又做过平扫 CT 的配对数据,把阈值调到高敏感度那一档。总敏感度 90.2%,特异度 84.7%;癌 92.2%,HGIN 65.0%,I 期癌 78.4%。漏掉的 I 期病例里,超过九成属于巴黎分型 0-II 型,也就是表浅平坦型,这类病变在内镜下也最难发现。

前瞻的分流验证做在遂宁:2023 年 7 月,530 名符合国家上消化道癌筛查条件的居民先做平扫 CT,再做碘染色内镜。这批人里查出 6 例 HGIN,没有浸润癌。恶性事件太少,作者改用重采样补进 3 例癌,拼成一个 533 人、9 例恶性的模拟队列,做了 1000 次自助法模拟。

结果是:按老办法 533 人全做内镜,检出率 1.7%;按 AI 分流,只有约 131 人去做内镜,查出 6.8 例,检出率升到 5.2%(P<0.01)。每查出一例恶性需要筛查的人数从 59.2 降到 19.2,省掉 67.6% 的内镜,折算成内镜室的时间是从 355 小时降到 105 小时。

两个细节让这套分流显得没那么冒险。第一,被判为阴性的 402 人里,400 人内镜下确实没有恶性,剩下 2 例是 HGIN,阴性预测值 99.46%。第二,被判阳性却没查出恶性的 124 人中,有 59 人(47.6%)查出了需要专门随访的食管异常,包括 14 例低级别上皮内新生物。假阳性里有接近一半的人,这趟内镜其实没白做。

此外,研究者还回头翻了 28 例食管癌病人确诊之前拍的 CT,模型在其中 18 例(64.3%)上就已经判为阳性,有 4 例的片子拍在确诊前 9 个月以上。真实世界队列里也有一例,模型判阳 21 个月后才由常规内镜确诊。

这篇研究不能推出什么

最要紧的一条:全文没有任何死亡率或生存率终点。它证明的是「这些病灶在平扫 CT 上能被算法认出来」,不是「这样筛查能让人少死」。从检出率到死亡率,中间隔着依从性、过度诊断、治疗可及性,隔着多年随访。

作者自己列的限制也值得照抄:境外验证只有捷克和澳大利亚两国,腺癌和食管胃结合部病例偏少,补充训练后腺癌敏感度从 86.6% 升到 91.2%,说明现有版本对西方更常见的腺癌还不够熟;女性数据偏少;分流用途的证据来自回顾性配对队列加单中心的模拟,阳性事件数很小;两个真实世界队列随访不到 2 年,而且 MDT 建议去做内镜的人实际完成率很低(前瞻验证里转诊的 16 人只有 3 人真去做了胃镜),所以模型的真实敏感度未必被完全测出来;阅片实验没有完整的交叉设计,回忆偏倚不能完全排除。

还有一条落在纸面之外:模型代码受专利保护、训练数据不公开,目前是一项研究成果,不是你能在体检套餐里勾选的项目。

对一个普通人意味着什么

如果你属于食管癌高危人群(高发地区居住、长期吸烟饮酒、有家族史、长期吃烫食或腌制食品、有反流病史),目前国内的标准做法仍是去做内镜筛查,碘染色内镜看黏膜颜色和血管纹理,发现可疑处当场取活检。这项研究没有给出任何理由让人用 CT 替掉胃镜。癌前病变在平扫 CT 上漏掉一半,而内镜下这类病变恰恰能切掉、能阻断。

研究真正改变的是另一头:如果你本来就要做胸部 CT 或肺癌低剂量 CT,这张片子里关于食管的信息比现在被用掉的多。等这类模型进入临床流程,一次扫描可以同时覆盖肺和食管,不额外加辐射、不额外加费用,一举两得。研究者也提到,HGIN 进展到 I 期癌的年概率是 8% 到 18%,窗口期以年计,一次漏掉不等于永远漏掉,每年一次的重复筛查可以把累计检出率抬起来。结直肠癌的粪便免疫化学试验走的就是这条路:单次敏感度并不出众,靠频次和覆盖面在人群层面降低了死亡。

说到底,这项工作更像是把一个已经被采集、却一直被浪费的信号重新读了一遍。食管的影像一直躺在那些胸片的数据里,只是过去没有人、也没有工具去读它。

参考来源

Zhou J, et al. Nat Med 2026 (EAGLE, ChiCTR2300074806)

Bray F, et al. CA Cancer J Clin 2024 (GLOBOCAN 2022)

Liu M, et al. J Clin Oncol 2024 (ESECC trial, 9-year report)

Cao K, et al. Nat Med 2023 (pancreatic cancer detection on noncontrast CT)

National Health Commission of China, Chin J Cancer Res 2022 (esophageal carcinoma guidelines)

AI 辅助整理,作者审核;内容仅供参考,具体诊疗请遵医嘱。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
为什么极端言论者能长期占据高校讲台?

为什么极端言论者能长期占据高校讲台?

风铃草语
2026-10-05 04:13:47
退出日本国籍后四处抨击日本,日本到底得罪他什么了?

退出日本国籍后四处抨击日本,日本到底得罪他什么了?

浔阳咸鱼
2026-10-03 17:15:11
天生“福将”吃喝玩乐,躺赢成共和国开国功臣

天生“福将”吃喝玩乐,躺赢成共和国开国功臣

星河逍遥游
2024-10-31 09:32:17
《兰香如故》大结局:秦舜华刚病逝,薛桂花也走了,可最让人破防的,是许兰香接过的那个东西

《兰香如故》大结局:秦舜华刚病逝,薛桂花也走了,可最让人破防的,是许兰香接过的那个东西

喵喵的追剧笔记
2026-10-04 23:48:48
16岁天才少年被清北保送后跳崖,遗言让人痛彻心扉:愿不再有来生

16岁天才少年被清北保送后跳崖,遗言让人痛彻心扉:愿不再有来生

悬案解密档案
2025-07-18 16:15:01
为什么电车跑长途总被续航和补能绊住脚?

为什么电车跑长途总被续航和补能绊住脚?

小眼睛小世界
2026-10-05 07:17:35
问界二手车价格上演过山车:10月M7均价上涨数千元,车商称“崩盘”传闻不实

问界二手车价格上演过山车:10月M7均价上涨数千元,车商称“崩盘”传闻不实

蓝鲸新闻
2026-10-02 14:47:35
奉劝大家,别轻易抽烟,我爸57岁,戒烟7个月,发现大不如从前!

奉劝大家,别轻易抽烟,我爸57岁,戒烟7个月,发现大不如从前!

鬼菜生活
2026-10-05 09:35:02
韩足协:部分队员轻率的言行让国民和军人失望,我们深表歉意

韩足协:部分队员轻率的言行让国民和军人失望,我们深表歉意

懂球帝
2026-10-04 17:48:09
WTT中国大满贯:陈俊菘反败为胜!首局11-7逆转世界冠军,德比战1-0!

WTT中国大满贯:陈俊菘反败为胜!首局11-7逆转世界冠军,德比战1-0!

刘姚尧的文字城堡
2026-10-05 12:05:55
74比71险胜3分!女篮亚青赛揭幕战杀疯了:中国争冠路上再添劲敌

74比71险胜3分!女篮亚青赛揭幕战杀疯了:中国争冠路上再添劲敌

冷峻视角下的世界
2026-10-04 16:47:58
肿瘤科主任:肺癌最危险的信号不是咳嗽,而是频繁出现5异常

肿瘤科主任:肺癌最危险的信号不是咳嗽,而是频繁出现5异常

健康之光
2026-10-05 13:10:15
朝鲜这回赚大发了:派兵助俄作战后,换回真金白银,短短3年,平壤街头就大变样

朝鲜这回赚大发了:派兵助俄作战后,换回真金白银,短短3年,平壤街头就大变样

怪味历史连连看
2026-10-03 11:55:40
爆冷淘汰后,37岁女舞者给43岁歌手写了封信

爆冷淘汰后,37岁女舞者给43岁歌手写了封信

追星雷达站
2026-10-04 11:22:30
深度长文:读懂量子场论,原来万物皆空,世间万物都是宇宙的涟漪

深度长文:读懂量子场论,原来万物皆空,世间万物都是宇宙的涟漪

宇宙时空
2026-10-04 19:30:13
再过上三五年,你们信不信,满大街找不着媳妇的,比眼下多十倍

再过上三五年,你们信不信,满大街找不着媳妇的,比眼下多十倍

风起见你
2026-10-05 13:56:51
维尔茨表现平平,亿元先生难救主!德国0-0闷平,克洛普4场仅1胜

维尔茨表现平平,亿元先生难救主!德国0-0闷平,克洛普4场仅1胜

我的护球最独特
2026-10-05 04:52:24
四川曾有老虎,为什么没吃大熊猫?护林员说:80%的人不知道,老虎就算“饿疯了”,也不会将大熊猫当作美餐

四川曾有老虎,为什么没吃大熊猫?护林员说:80%的人不知道,老虎就算“饿疯了”,也不会将大熊猫当作美餐

回京历史梦
2026-10-04 02:50:05
整个东亚出现了一种现象:去中国化最狠的国家,如今都开始后悔了

整个东亚出现了一种现象:去中国化最狠的国家,如今都开始后悔了

经纬戎韬
2026-10-03 02:32:07
苹果正式官宣历代iPhone全球销量排行榜

苹果正式官宣历代iPhone全球销量排行榜

叮当当科技
2026-10-05 01:13:11
2026-10-05 14:36:49
岳医生 incentive-icons
岳医生
泌尿外科执业医师,医学博士
145文章数 273关注度
往期回顾 全部

健康要闻

刷酸祛痘,为什么有人翻车?

头条要闻

牛弹琴:美20岁大兵酒店掐死39岁日本女子 日本举国哗然

头条要闻

牛弹琴:美20岁大兵酒店掐死39岁日本女子 日本举国哗然

体育要闻

30天30队·灰熊:守夜人与雪诺

娱乐要闻

蔡康永事件发酵!品牌火速切割

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

科技要闻

DeepSeek Harness国庆假期上新!

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

家居
数码
教育
手机
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

瓦尔基里公布VK 99 V2机械键盘:AI创想灯效,长至12000hr无线续航

教育要闻

这题让小学霸,竟然也是一脸蒙茫然

手机要闻

iQOO 16手机首销情况曝光:约为iQOO 15的50%、iQOO 13的100%

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版