仅凭一次腹部 CT,即可识别 146 种病症,由中国科学家团队研发的通用影像 AI 模型 RADAR 登顶《科学》,标志着医疗影像 AI 从 " 一病一模 " 迈向 " 一个模型看所有病 "。
撰文 | 凌骏
来自中国的医疗影像 AI,迎来了自己的里程碑时刻。
当地时间 9 月 17 日,顶刊《科学》(Science)发表重磅研究成果,阿里达摩院团队联合浙江大学医学院附属第一医院(下简称浙大一院)等机构,研发出了通用医疗影像 AI 模型—— DAMO RADAR。
研究结果显示,仅需一次腹部增强 CT 扫描,RADAR 就可以识别 146 种病症、覆盖 18 个器官,其诊断平均准确率(AUC)达到 0.913,达到高年资影像科专家的诊断水平。
这是《科学》历史上罕见发表的医疗影像 AI 论文。此前,仅靠一张 CT 就同时识别上百种疾病,这几乎被认为是一项 " 不可能完成的任务 "。RADAR 的诞生,标志着医疗影像 AI 完成了从 " 一病一模 " 到 " 一个模型看所有病 " 的范式转变。
" 这是我们影像医生等了很多年,却一直觉得不可能实现的事。但现在,它真的变成了现实。" 研究主要作者之一、浙大一院放射科主任肖文波说。
一次 CT,看清 146 种病
腹部 CT,是临床上最常用的影像检查手段之一,它广泛应用于门诊、体检、急诊等各类场景。一张影像的背后,往往关联着十几个乃至数十个器官的健康状况。
但对医生来说,要彻底读懂一张腹部 CT,挖掘出其中所有隐藏的细节信息,从来不是一件轻松的事。腹部器官几乎都是软组织,密度相近,很多时候,一个关键病灶和周围正常组织之间只有极其细微的差异。
不仅如此,腹部涉及消化、泌尿、生殖等多个系统,几乎所有器官都挤在同一组影像里。一次增强 CT,往往包含多个不同期相、每个期相上百幅图像,医生需要逐一排查,才能形成一份完整的诊断报告。
而 RADAR 的问世,正是为了同时解决这两个难题——诊断的准确性和阅片的效率。
根据此次发布在《科学》的研究结果:在内部真实世界测试中,团队连续纳入了来自浙江大学医学院附属第一医院的 39160 例病例,覆盖 18 个解剖结构、146 种影像学表现,结果显示,RADAR 的平均 AUC 达到 0.913。
此外,在 8 个外部中心、24239 例 CT 的多中心验证中,平均 AUC 为 0.895,且在每个单独中心都优于对比模型。而在美国斯坦福医院的公开数据集上,针对 21 种可比病症,无需任何微调,RADAR 的 AUC 也达到 0.883。
" 这几组数据,分别回答了几个不同的问题。" 达摩院高级算法专家张建鹏对 " 医学界 " 解释," 内部测试是为了验证 AI 模型能不能真正学到疾病特征,而不是简单记住训练数据。而随后开展的外部多中心验证,则考验模型能不能跨地区、跨医院泛化。"
事实上,医疗 AI 最容易出现的问题,就是换一家医院、换一批人群,性能就掉下去。" 我们同时开展的跨人群测试(美国斯坦福医院),再次证明了,这套方法在完全陌生的人群和设备条件下,依然是有效的。" 张建鹏说。
值得一提的是,即便是训练数据里没有覆盖的场景,RADAR 依然保持住了性能。
此次研究结果显示,在 27267 例急诊测试中,针对 17 种常见急腹症,RADAR 的 AUC 达到 0.904。而在肝癌、胰腺癌、胃癌、结直肠癌四种病理确诊病例中,AUC 达到 0.891-0.984,证明这套基于报告文本训练出来的模型,同样经得起病理金标准的检验。
此外,在一项由 14 家医院 26 名放射科医生参与的阅片研究中,借助 RADAR 辅助后,医生的诊断灵敏度提升约 10%,阅片时间减少 30.7%;即便是初级医生,表现也能接近,甚至超过资深医生。
" 最初我听到这个数据,有点不太敢相信。" 肖文波坦言,这么多器官、这么多期相的结构,一次性识别 146 种病灶," 我这么多年做医生,都得反复重建、仔细去看才能确保没有遗漏。"
" 我们影像医生有一句话,叫‘同病异影、异病同影’。" 肖文波解释,同一种病,在不同患者身上可能长得完全不同,不同的病,却可能在影像上表现得一模一样。
" 无论医生水平有多高,要想对所有疾病的影像学细节特征——无论常见还是罕见都有丰富的经验,那得看过几十万张片子才行,而这可能是人一辈子都积累不到的量。" 肖文波说。
这道人类经验难以跨越的门槛,恰恰是 RADAR 最擅长的地方。AI 不需要一辈子的临床积累,就能从海量真实病例中,学到远超单个医生经验范围的判断依据。
从 " 一病一模 " 到 " 一个模型看所有病 "
" 在我们科室所有的年轻医生中,最害怕进的组,就是腹部组。" 肖文波告诉 " 医学界 "。
据肖文波介绍,她所在的浙大一院放射科有 300 多名医生、70 多台设备,每天需要承接七八千位患者。从年轻医生进科到能独立审核报告,往往要先经过胸部组和其他器官组的历练,最后才敢进腹部组。
" 即使是一个中高级水平的医生,写一个腹部 CT 报告,也需要约 20 分钟,绝大部分都要 20 分钟到半小时才能处理完。" 肖文波说。
事实上,其他部位病症的影像筛查,比如肺部的肺结节,早已有相对成熟的 AI 辅助工具,但腹部却长期是个空白。
达摩院团队也注意到了这种情况。最初,团队走的是另一条路——像肺结节 AI 那样,一个疾病训练一个模型。过去几年,利用 " 平扫 CT+AI",团队陆续在胰腺癌、胃癌、肠癌等消化系统重大疾病上取得突破,相关成果 4 次登上《自然 · 医学》。
但张建鹏告诉 " 医学界 ":" 在我们做到第二个单病种项目时,开始渐渐意识到,如果一直沿着‘一个疾病训练一个模型’的路线走下去,那这辈子都干不完。"
" 人类的疾病成千上万种,现实中,一张 CT 影像里往往同时存在多个器官、多种异常。但如果我们两三年只能做一个病种,那医学 AI 要什么时候才能真正进入临床的主流程?" 张建鹏说。
这个疑问,也和整个行业的技术演进撞在了一起。
达摩院资深算法专家张灵对 " 医学界 " 介绍,医疗影像 AI 大致经历了三个阶段。从早期 " 一病一模 " 的专才模型,到尝试用结构化标注让一个模型学习多种病,但依然依赖大量人工标注且难以泛化到未见过的疾病类型。
直到近几年,图文对比学习技术成熟,才让 " 零样本泛化 " 第一次成为可能。通俗而言,模型不再需要人去提前标注好某种疾病,也能通过学习影像和诊断报告之间的关联,回答关于任何疾病的提问。
可要真正把这条路走通,还需要解决一个关键问题:怎么让 AI 在腹部 CT 这种高度复杂的影像里,找到自己该看的地方。
张建鹏解释,最初,团队尝试把整张 CT 和整份报告直接对齐,但效果并不理想——真正决定诊断的异常病灶,在整个三维体数据里往往只占极小一部分,很容易被大量正常组织淹没。
" 后来我们意识到,放射科医生阅片时,是按解剖结构一步步展开的。先看肝脏,再看胰腺、胆道、肾脏,再逐一形成判断。" 张建鹏说," 于是,团队把这套逻辑‘教’给了 AI,将 CT 体数据拆解成器官级别的单元,把报告也拆解成对应的解剖学描述,在器官这个更精细的颗粒度上做图文对齐。"
" 单病种 AI 有点像只刷过某一种题型的学生。RADAR 更像是在系统性学习医学影像这门语言。" 张建鹏比喻道。
这条路径最终被证明是可行的。
肖文波表示,在研发过程的对比实验中,当团队把临床信息,包括病史、主诉等都排除掉后,医生单纯看影像的诊断率其实并不理想。但当接入了 AI 辅助,医生的检出率和准确率得到了大幅提高。
" 当时我们真的特别惊喜,就希望能赶紧上线,期待能装到工作站上,日常用起来。我也曾在一场同行会议上分享这个结果,下面专家的反应是,‘能不能给我们装一个?’ "
" 如今这项研究成果被 Science 接收,更是告诉大家,这种形式的 AI 创新是可以实现的。" 肖文波说。
这是不是医疗影像的 "ChatGPT 时刻 "?
" 我们还没到真正的腹部 CT 影像的 ChatGPT 时刻,但已经是在前夕了。" 张灵告诉 " 医学界 "。
此前,达摩院团队研发的单病种 " 平扫 CT+AI" 模型,输入的是一张图,输出的只是一个概率。" 而 RADAR 可以像 ChatGPT 一样,用提示词去提问,模型就能直接给出诊断。而这两者背后,也都是基于大规模预训练得到的模型能力,是有相似之处的。" 张灵说。
但相比 ChatGPT 这样面向大众的通用工具,张灵坦言,医疗是一个容错率极低的领域,RADAR 要真正类比像 ChatGPT 那样,能被医疗场景广泛使用,中间还差着一段距离,包括临床监管审批、工作流的嵌入、更好的可解释性,都是接下来要跨过的关卡。
" 这不是一次技术上的终点,而是一个开端。" 张灵表示。
这个开端,本身也有一层特殊的意义。据张灵介绍,此前放射学、病理、内镜、皮肤等各类医学影像 AI,都极少能在《科学》上发表论文,RADAR 的发表," 说明 Science 开始逐渐把医学图像 AI,当作一个医学科学的问题,而不是一个更偏工程学的问题 "。
除此之外,RADAR 采用的这套 " 器官级细粒度对齐 " 的方法论,理论上也不只适用于腹部 CT。据张灵透露,接下来,团队还会往胸部 CT、脑部 CT 等部位延伸,乃至迁移到核磁、PET-CT、超声等其他影像模态。
据了解,此次达摩院还将 RADAR 模型和代码开源,希望未来能成为行业里一个开放的基础平台。
技术往前走的同时,作为临床医生,肖文波也提出了自己的忧虑。她观察到,在借助 AI 辅助后,年轻医生的报告可以达到主任医师的水平,但 AI 一旦撤掉,水平又会打回原形。" 我们需要警惕一个情况,就是应用 AI 之后,医生产生了惰性,更加依赖软件,而从年轻医生培养到一个成熟医生的训练过程,反而被忽略掉了。"
面对这种情况,肖文波认为,医生要做的,不是拒绝 AI,而是换一种用法——先独立完成报告,再用 AI 做一次 " 自我复核 ",把 AI 变成一个 " 隐形 " 的带教老师," 我希望这个 AI,不但能帮助我们的临床工作,也能帮助我们的教学工作。" 肖文波说。
用 AI 从 CT 中识别出肉眼难见的微小病灶,从胰腺癌、胃癌、肠癌、肝癌、食管……到这次的通用模型 RADAR,达摩院团队用近十年时间,走出了很多人认为不可能的一条路。但眼下,RADAR 在 146 种疾病中的表现,只是被系统性验证过的一小部分。它最终指向的,或许是一个更加宏大的愿景。
" 这个模型本身,还具备诊断更多疾病的能力,只是还需要进一步的评估。" 张灵说," 接下来,我们还会继续深入研究,让 AI 能够结合患者的临床信息、医学指南,甚至新的临床试验结果,做出综合的推理,朝‘ AI 影像医生智能体’演进。"
来源:医学界
校对:蔡 菜
运营:赵 静
责编:汪 航
*" 医学界 " 力求所发表内容专业、可靠,但不对内容的准确性做出承诺;请相关各方在采用或以此作为决策依据时另行核查。
推荐阅读
▼
" 点赞 "" 爱心 ",让更多人看到


登录后才可以发布评论哦
打开小程序可以发布评论哦