AGI最难一战,竟在医院,中国AI登上Science,医生不怕失业还催着上线
6 小时前 / 阅读约11分钟
来源:36kr
阿里达摩院研发出全球首个专家级通用影像AI模型DAMO RADAR,能识别腹部18种解剖结构146种病,准确率超多数医生。该模型采用视觉-语言对比学习,实现器官级细粒度对齐,已开源。

AI正在横扫一切,但有块硬骨头,迟迟攻不下来,让无数人希望落空。

2016年,Hinton老爷子就预言:“人们现在就应该停止培养放射科医生。”他甚至认为,五年内,AI就会在医疗影像识别上超过放射科医生。

老爷子一生谨慎,但历史和他开了个玩笑。十年过去了,人们离AGI已经越来越近,但在医疗场景里,即使图像识别这样的AI新手村任务,依然是hard模式

如果从IBM的Watson算起,在医疗上遭遇滑铁卢的AI专家数不胜数。

为什么医疗成了AI的阿喀琉斯之踵?

——对模型精度的极高要求,在别的领域,模型幻觉可以一笑了之,但在这里却是人命关天。

这也导致了医疗影像AI长期困在专用模型里。

直到今天,学术期刊的“王者”Science正式刊发一项来自中国的重磅研究

DAMO RADAR,据介绍是全球首个专家级的通用影像AI模型。

这个模型,能看腹部18种解剖结构的146种病,比很多影像科医生看得还准。

而且模型、代码、框架,全开源了。

一个模型,看146种病

DAMO RADAR,全称Rapid Abdominal Diagnosis with AI and Radiology,面向腹部快速诊断的AI模型。

这个AI“雷达”,研发团队就是阿里达摩院,过去几年他们用AI识别CT中肉眼难见的早期癌症病灶,在胰腺癌、胃癌、肠癌等专病上取得重大突破,发表5篇Nature Medicine。

但做着做着,达摩院有些人觉得不对劲了。达摩院高级算法专家张建鹏说,一个病种啃下来至少两三年,人类疾病成千上万种,那他们搞一辈子都搞不完……

更棘手的是,真实世界里,病人不会只带着一种病来医院,对着专病模型问他是不是有这种病。事实上,一份CT影像里,很可能同时存在多种器官,多种病变。

达摩院联合浙大一院等全球众多医院向腹部CT发起冲击,希望AI能一次性识别出腹部各种疾病。

选腹部,是因为这是临床公认最难的影像场景

浙大一院放射科主任肖文波介绍,年轻医生通常最害怕被分到腹部组。

因为腹部涉及消化系统、泌尿系统、生殖系统,肝胆胰脾肠道全挤在一起,肠道还盘绕整个腹腔,所有器官几乎都是软组织,密度接近,全靠肉眼对密度差的敏感度把病灶揪出来。

之前,已经有了针对肺结节之类的AI辅助工具,但腹部太复杂了,一直是个禁区,没人敢碰。

RADAR要做的,就是用一个模型覆盖整个腹部

最终它覆盖了18种解剖结构、146种病,涵盖肝脏、胰腺、胆囊、肾脏、脾脏、肠道等主要器官,基本覆盖了临床常见病变

对其效果,团队做了非常严格的多层验证。

在内部近3.9万例真实世界连续队列中,RADAR的平均AUC达到0.913

AUC是衡量诊断模型区分患者和正常人能力的指标,1是完美区分,0.5等于瞎猜,超过0.9就算优异。

之后,团队又在来自8家外部医院的超过2.4万例CT上验证,这些案例覆盖不同地区、不同扫描设备,RADAR的AUC仍然达到0.895

而且RADAR还泛化到了急诊场景。

急诊场景与一般门诊的区别是,由于时间紧急,来不及等造影剂发挥最佳效果,患者也不一定有能力配合,CT成像效果偏差。

RADAR的训练目标并未包括急诊,但测试时团队拿2.7万例急诊数据一测,结果AUC依然有0.904。

而且达摩院在肝癌、胰腺癌、胃癌、肠癌四种癌症的诊断上,还提高了对RADAR的要求。

在这四种癌症上,他们用来考验RADAR的依据,是“病理金标准”,也就是以病理活检结果作为Ground truth,确认影像判断准不准。

这个拔高测试当中,RADAR的AUC仍达到了0.891-0.984。

达摩院还做了一波人机对比。

这波对比共有来自14家医院的26名放射科医生参与,RADAR和TA们在同一批病例上各自独立诊断,结果RADAR的准确率超过了其中23名医生,只稍弱于3名资深医生

与此同时,达摩院还测试了人机协同场景,发现医生在有AI帮助的情况下读片,整体敏感度提升了大约10%,平均阅片时间减少了30%以上。

“初级医生+AI”的配置,敏感性甚至超过了资深医生独自阅片。

那RADAR到底是怎么做到的?

过去的医疗影像AI用的是监督学习,简单说就是让医生一张一张地标注CT图像,然后AI照着标注学。

这种方法标注成本巨大,而且模型只能识别被标注过的那几种病,换一种就不认识了。

RADAR走了一条不同的路,叫视觉-语言对比学习

医院里天然存在大量CT影像和对应的诊断报告,RADAR直接从影像和报告文本的对应关系中学习,不需要医生额外逐片标注。

这有点像医学生跟着主任查房,主任看片子的时候会说“肝脏有一个低密度灶,考虑血管瘤”,学生听多了,自然就知道什么影像特征对应什么诊断。

但直接把整张CT和整份报告对齐,效果很差。

团队一开始就试过这条路,结果发现模型只能学到一些粗糙的统计特征,建立不起来“哪个器官对应哪段描述”的关联。

因为一套腹部CT有几百张切片,包含好多个器官,真正有问题的可能只是某个器官上一个很小的病灶,如果让模型拿整张图去理解,关键信号就被大量正常组织淹没了。

这就涉及到了RADAR的核心突破——“器官级细粒度对齐”

它先从CT中定位出肝脏、胰腺、胆囊、肾脏等各个器官,把一整套CT拆解成一个个器官单元,再把每个器官单元和报告中对应的描述精确对齐。

这一设计的灵感,来自放射科医生的真实工作方式。

医生看腹部CT时,也不会把整个腹部当一个整体扫一眼,TA们会依次看肝脏、胰腺、胆道、肾脏、肠道,一个器官一个器官地过。RADAR让AI也按这种方式去学习。

另一个创新叫自适应对比建模

标准的对比学习默认把不同病人的特征严格区分,但在医疗场景里,如果两个人的肝脏都是健康的,就不应该被割裂看待。

同理,得了同一种病的两个患者,影像特征也应该被放在一起学习。

RADAR会根据这些医学知识,动态调整样本之间的距离。

而且论文里展示的Scaling Law曲线显示,随着数据增长,模型性能还在持续上升,曲线没有饱和的迹象。

帮医生“少漏一个病灶”

Scaling Law曲线还在涨,但眼下RADAR够到的能力,已经开始改变一线医生的工作节奏了。

“第一次看到RADAR的验证数据,我都不敢相信。”浙大一院放射科主任肖文波说,AI能在腹部这么多相似结构里一下子检出146种病,AUC还有0.9上下,完全超乎医生们的想象。

科室里开始沸腾,很多医生说:赶紧部署起来!很多外面医院的医生也闻讯前来,希望AI能帮助他们解决腹部CT这个头疼的问题。

肖文波干了三十多年影像,带着300多人的科室,科室每天处理几千份片子。

写一份腹部CT报告,哪怕中高年资的医生,没有20分钟下不来,一例CT包括数百张图像,挨个过。

这活儿她太清楚有多难了。

直到她发现RADAR接受了一次又一次验证,准确率还是差不多之后,她才真的服了。

影像科有句话叫“同病异影、异病同影”,同一种疾病可以长成完全不同的样子,不同的病又可能看起来一模一样。

肖文波坦言,一个医生可能要看几十万张片子才能把各种特征都见过一遍,可能穷其一生也见不到如此多的病例。

这恰恰是RADAR最大的价值,它补上了人类医生的盲区,能够帮他们少漏一个病灶

尤其在良恶性鉴别这种生死攸关的场景,医生的压力非常大;这时候有了AI,就相当于随时有一个影像助手在手边,在医生犹豫的时候给一个补充性参考。

不过AI辅助也会带来一些隐忧。

这说的倒不是准确率,毕竟即使用AI,最后也有真人在一旁把关。

这个问题关乎的是未来医生群体的发展。

医生培养讲究影像逻辑思维,这种思维从理论到实践反复打磨,这个过程不能跳过。

年轻医生用了AI,报告可能会达到主任级水平,一旦形成路径依赖,反而把培养路径截断了。

但也不必过虑。

肖文波的想法,是让RADAR同时变成“一对一带教工具”

她说现在科室300多人分布在好几个院区,过去那种老师坐旁边一份一份带着看的模式,已经很少了。

但AI可以替代这个角色,年轻医生按常规写完报告,再用AI做一次自我检测,哪个病灶漏了、哪个判断偏了,当场就知道。

就像随时有个主任站在旁边说,“哎,这还有一个病灶,你怎么没看见?”

这样,每个病例都变成一次交叉验证和学习的过程。

再往远看,RADAR的器官级对齐框架,也适配其他影像模态,只要有相关数据,MRI、PET、超声都可以成为迁移的目标。

而且这些东西,达摩院没有藏着,模型、代码、技术框架已经全部开源,任何团队都可以拿去复现、改进、迁移到自己的场景。

说到这里,其实已经不只是一个医疗AI的故事了。

RADAR背后的思路,是用一个通用模型,去解决一整个领域的问题

医疗是所有行业里对精度要求最极端、对错误容忍度最低的场景,一个误判就可能改变一个人的治疗方案甚至生存期。

如果这套范式在这里都能跑通,那换到其他高精度场景,大概率也能适用。

达摩院资深算法专家张灵说,“Science极少发医疗影像AI的文章,因为它长期被当做工程技术问题。RADAR首次证明了通用的医疗影像AI是一条具有现实可行性的技术路线,改变了Science审稿人的想法,审稿人开始把它当作‘科学问题’来对待。”

RADAR能过这道门槛,说明这套方法经受住了最严格的同行评议。

回过头看,从达摩院几年前用PANDA模型攻克胰腺癌筛查难题,到今天RADAR登上Science,其实都是在求证AI到底能不能在最苛刻的真实场景里真正顶上去。

今天Science给出的答案,不只是对一个模型的认可,也是对一种可能性的确认。

它证明,用通用AI去啃最硬的骨头,这条路走得通。

论文链接:https://www.science.org/doi/10.1126/science.aec6129

开源地址:https://github.com/alibaba-damo-academy/damo-radar