摘要:阿里达摩院搞出了个通用医疗影像AI,以后看病不用再“一病配一模”了。 以前的医学AI得针对单一疾病专门训练,费时又费力。这次的新模型DAMO RADAR直接看腹部CT和诊断报告,自己就能学出诊断逻辑。 它靠4万多例真实检查数据练出来,能查146种病。测试发现,它不仅比多数放射科医生看得准,还能帮医生少漏诊、省下三成时间。目前代码已经开源。
9月18日,阿里巴巴达摩院与浙江大学医学院附属第一医院等机构研发出通用医疗影像AI模型DAMO RADAR,登上国际顶级学术期刊《科学》(Science)。为医疗影像AI从“专病专用”走向“通用普惠”提供了全新技术路径。

众所周知,医疗影像目前是众多疾病诊断的关键依据,同时也是当前医学人工智能落地最成熟的方向之一。不过基于医学的严谨性,目前国内获批、落地的医学AI影像产品,普遍遵循“一病一模、一证一适应症”的行业规则。国家药监局以具体疾病、适用人群、检查场景为核心进行审评,目前获批AI辅助诊断软件均为垂直专科模型。如2025年11月获批的上海西门子医疗器械有限公司前列腺癌磁共振辅助诊断软件,适用于40岁及以上未接受治疗成人的疑似前列腺腺癌病变检测;2026年2月获批的联影医疗乳腺X射线检测软件,针对40岁以上女性乳腺肿块病灶开展辅助筛查。
阿里达摩院过往的医疗AI研发,同样遵循垂直专科路线,先后推出针对单一疾病的筛查模型,包括胰腺癌CT筛查模型DAMO PANDA、胃癌筛查模型DAMO GRAPE、肠癌筛查模型DAMO COCA等。2026年6月,针对急性主动脉综合征的CT平扫图像辅助分诊软件被纳入国家创新医疗器械特别审查程序。
然而,“一病一模”在训练上往往依赖大量人工标注数据,成本高、周期长,通用性差,无论基于研发投入,还是复杂的真实临床需求,都存在投入与效益产出的现实问题。而这方面,腹部CT是一个比较好的开发通用医疗影像AI模型实践场景,其覆盖数十个人体解剖器官、数百种潜在病变类型,对AI的综合识别、判断、泛化能力都提出极高要求。为突破行业技术瓶颈,达摩院创新性引入视觉-语言学习(Vision-Language Learning)技术框架,摒弃传统人工标注监督学习模式。该技术核心逻辑与通用大模型解析图片、文档(PDF、WORD等)的跨模态融合思路一致,通过深度学习临床影像与对应诊断报告文本的内在关联,将影像视觉特征与文本诊断语义统一映射至共享表征空间,实现同源患者图文信息深度契合、异源患者信息有效区分,让模型自主掌握医学影像的诊断逻辑。

不过,达摩院高级算法专家张建鹏也表示,由于CT数据信号稀疏,常规的视觉-语言学习效果不佳,该项研究在国际上首次采用“器官级细粒度对齐”策略,将CT构建三维数据并分解为解剖单元,在组织器官层面实现图像与报告文本的精确对齐,并通过自适应对比建模策略来动态调整,无需额外人工标注即可完成可扩展、多用途、可解释的诊断。
该模型构建了一个大型腹部CT数据集,包含424911次检查和1500万组解剖图文配对数据,用于精细化的大规模训练。最终,DAMO RADAR覆盖了含恶性肿瘤在内的广泛腹部病症,研究团队评估了其中146种,涉及18个器官。在近4万次真实世界检查中AUC达到0.913(AUC是区分患者与正常人的能力指标,数值越高越好,1代表能进行完美区分),在面对初始训练之外的急诊场景依然能展现出较高的性能,在急腹症上AUC达到0.904。

论文显示,DAMO RADAR与26名来自多家医院的放射科医生进行了人机对比试验,平均准确率超过了其中23名医生。在AI提示下,放射科医生识别疾病的敏感性(防漏诊的能力)提高了10%,用时减少了30%以上,并使低年资医生达到了高年资医生的诊断水平。
此外,DAMO RADAR还提供了关注图,以突出与诊断相关的视觉线索,从而促进更好的解读。
整体而言,RADAR 为影像人工智能提供了一个可扩展且多功能的框架,目前模型开源地址为 https://github.com/alibaba-damo-academy/damo-radar。