阿里达摩院医疗 AI,十年拼出一张图

从一个个具体的现实困难出发,连点成线,走到了一片更开阔的地方。
文丨陈然
2016 年,AI 教父 Geoffrey Hinton 作出预言:该立即停止培养影像科医生了,他们在 5 年内就会被 AI 超越。
10 年过去了,影像科医生还在,但 2016 年前后纷纷入局的影像 AI 企业,纷纷折戟沉沙,只有少数幸存者还在挣扎。
Hinton 低估了医疗的难度。
医疗对模型精度的要求近乎苛刻,对错误和幻觉的容忍度极低,也许是 AI 的终极测试场。它曾把影像 AI 困在专病模型里,也困住了 AI 企业。
9 月 18 日,国际顶级学术期刊 Science 罕见刊发一篇医疗影像 AI 论文,引发对 Hinton 预言的 “回旋镖” 讨论。论文介绍了一款达到专家水平的通用医疗影像模型 DAMO RADAR,针对腹部增强 CT,它突破 “一病一模” 的限制,同一个模型可以识别 18 个腹部器官上的 146 种病症。
研发模型的是阿里巴巴达摩院。过去几年,他们还连续发布了平扫 CT 上的胰腺癌、胃癌、肠癌筛查模型,以及主动脉夹层预警模型等多款突破性的专病模型。
主流视线之外,达摩院医疗 AI 已悄然走过十年,他们就像在玩一个拼图游戏:从单病模型、到多病联筛,再到通用模型,用一次 CT,去发现包括癌症在内的多种重大疾病隐患,完成 “超级检查”。医疗影像 AI 也第一次从单点的技术创新,变成可规模化的超级产品。
AI 行业(也包括具身智能)常常困惑于 “拿着锤子到处找钉子”,找不到合适的应用和落地。达摩院的医疗 AI 之路,某种程度上从一开始就避开了这个问题——他们从一个个具体的现实困难出发,连点成线,也逐渐穿越传统医疗 AI 的周期,走到了一片更开阔的地方。
从一张平扫 CT 里,看到人眼看不到的风险
2017 年,达摩院伴着改变世界的愿景成立,医疗也在其布局之内。有多年医疗影像 AI 行业经验的许敏丰在这时候加入。
最初几年,他们做的也是当时行业里热门的同质化产品,包括在平扫 CT 上识别肺结节和骨折,难度相当于 “在黑纸上找白点”,并没有太大的挑战。行业里的很多医疗影像公司却据此获得大量融资,风头堪比今日的具身智能。
许敏丰后来觉得,这些工作只是用深度学习把医生原本就在做的事重新做了一遍。模型可能更快、更准,却没有让 AI 解决新的问题。这是典型的从 “AI 能做什么” 角度出发的工作,却未必是医疗真正需要的东西。
转折发生在 2020 年。
新冠疫情暴发后,大量患者涌入医院,肺部 CT 成为医生判断病变范围和病情变化的重要依据,但一套 CT 扫描包含数百张影像切片,激增的检查量很快超过了医生的处理能力。
凭借之前几年的积累,许敏丰带着几名算法和工程人员花了两周在家赶做出了一款 AI,可以自动识别新冠肺炎病灶,并帮助医生快速判断病变的范围。这是全国范围的第一个新冠肺炎 CT 辅助诊断系统,首行代码后来入选了国家博物馆的馆藏。
这段经历改变了团队对医疗影像 AI 的理解:同样是肺炎,新冠肺炎和普通肺炎在人眼看来都是炎症,AI 却可能从细微的影像差异中加以区分。
而在 2021 年加入达摩院的张灵,则奔着一个更为大胆的设想而来:一张普通的平扫 CT,除了医生原本要看的疾病,还能不能看出更多医生没有特别留意、也不习惯用肉眼判断的信息?甚至是一些重大癌症的早期信号。
张灵从 2008 年前后就开始研究医疗影像 AI,他加入达摩院后,团队开始集中推进与 “癌症之王”——胰腺癌的较量。这是一个明确的,医学上想要敲掉的硬 “钉子”。
超过 70% 的患者都是到了晚期才发现,生存率已不足 10%。因此,胰腺癌是所有癌症中致死率最高的。医生诊断胰腺肿瘤,通常要先向患者体内注射造影剂,再做增强 CT,这显然不适合常规体检。平扫 CT 倒是常用,但人眼几乎不可能看到早期的胰腺癌。
如果平扫 CT 能看见,医院为什么还要使用增强 CT?不少医生认为,人眼都看不清的病灶,AI 也很难可靠识别。
张灵最初同样使用增强 CT 研发模型。但同一名患者往往会留下平扫和增强两套影像,他试着把模型放到平扫 CT 上测试。结果出乎意料。没有造影剂,模型识别胰腺肿瘤的能力只下降了一点。
外面的人仍然不相信,但团队已经看到了这件事成立的可能。张灵回忆,那几年他们像是站在一块没人到过的地方,往前走一步,就能看到一点新东西。
项目尚未显示出明确结果时,能够获得的资源和支持也很有限,张灵回忆,早期真正坚持这项工作的只有包括他和一位合作医生在内的 3 个人。
任务开始后,他们首先遇到的是训练数据问题。医生在平扫 CT 上看不清肿瘤,也就很难直接标出病灶的位置;没有准确的标注,模型便不知道应该学习什么。
团队后来找到的办法是,请医生在同一名患者的增强 CT 上勾画肿瘤,再通过图像配准,把这个位置映射到平扫 CT 上。胰腺是一个相对固定的实性器官,两套影像能够较好地对应,模型由此得到了一批人眼难以直接提供的训练数据。
不过,从早期模型到真正达到筛查要求的 PANDA,团队花了两三年。
胰腺癌的发病率很低,大约一万人中才有一例。如果模型的特异性是 99%,也就是误报率只有 1%,筛查一万人仍然可能把一百名并未患癌的人报成高风险。对普通诊断模型来说还不错的成绩,放到大规模筛查中可能完全无法接受。
唯一的解决方法是,让特异性不是 99%,而是 99.9%。团队把模型放到不同医院、设备和人群的数据中反复测试。模型表现不好,他们就补充数据、调整算法,再重新测试。最终,PANDA 把误报压到千分之一的量级,在一次没有预先挑选样本的真实世界验证里,PANDA 模型连续分析了两万人的影像,识别出了 2 例原先被人眼忽略掉的胰腺癌。
这个发现,成为达摩院发表的第一篇 Nature Medicine,这本声名卓著的医学期刊配发评论文章:“基于影像的癌症筛查即将进入黄金时代”,也给了张灵和团队持续探索用 AI 识别胃癌、食管癌等其他癌症的信心,达摩院走上一条与行业不同道路的分水岭。
就在同期,许敏丰和团队也把同一种思路带进了心血管领域,尤其是急诊场景。
2022 年底,一起主动脉夹层漏诊造成的不良事件引起了团队的注意。那是身体最大血管的内壁破裂造成的,就像是高速公路上油门失灵,凶险程度可想而知。
与医生交流后发现,这类疾病的初诊遗漏远比想象中普遍。主动脉夹层最典型的表现是剧烈、撕裂般的胸痛,但许多患者只有腹痛或腰痛,看上去更像胃病、结石或腰椎疾病。
漏诊或延迟诊断的后果是致命的。许敏丰记得一个案例,一名三十多岁的男性曾因腰腹疼痛到急诊就医,他原本就有腰椎间盘突出,平扫 CT 也显示了相应问题,医生便先按腰椎疾病处理。但七个小时后,患者病情突然恶化。进一步检查发现,他患有 B 型主动脉夹层,双肾和下肢已经因缺血受损。
当时那张平扫 CT 上,AI 能不能识别出主动脉夹层?
确诊主动脉夹层通常需要做增强 CT,但很多症状不典型的患者不会直接接受这项检查。他们可能因为腰痛拍腰椎 CT,因为腹痛拍腹部 CT,也可能先做胸部 CT。许敏丰想让模型检查这些已经拍下的平扫影像。只要画面中包含主动脉,或许就能顺带找到夹层的迹象。
从 2022 年底到 2024 年底,许敏丰团队用了两年时间,在全国多家机构的数据上完成多轮验证。最终,这套名为 iAorta 的模型把主动脉夹层的初诊遗漏率从 48.8% 降到了 4.8%,平均确诊时间从 4.3 小时缩短至 1.7 小时。
团队后来用模型重新分析患者最初的那张 CT,发现夹层在七个小时前就能被识别出来。
用一次平扫 CT,完成 “超级检查”
达摩院针对胰腺癌和主动脉夹层的两个模型,随着临床效果的逐步验证,收获了医生们的掌声和敬意,但张灵和许敏丰却依然忧心忡忡。因为无论是胰腺癌还是主动脉夹层,都属于发病率很低的病种,也就是说,这是两个很难大范围推广的模型。
此时放眼外界,医疗影像 AI 行业陷入冰点,科亚医疗、推想医疗和数坤科技先后递表港交所,却折戟沉沙,“视觉四小龙” 之一的依图也把医疗业务全盘出售。有很长一段时间,市场上看不到任何一家医疗 AI 企业融资的消息。
如果针对单个病种的单个模型覆盖面有限,那把多个模型拼起来呢?一个普通用户,也许不会因为胰腺癌专门去一次检查,但如果这个检查能查出多种癌症和重大疾病呢?
达摩院开始思考做拼图的可能性,他们还是选择从平扫 CT 入手。因为平扫 CT 速度快、成本低,在体检、急诊和基层医院里大量使用,是国内最常见的影像检查,每年检查量超过 1 亿人次。
如果能用攻克胰腺癌的方式,去啃下更多原本不在平扫 CT 常规检查范围内的重大疾病,那么患者无需增加额外费用和辐射,就能调用这些模型,顺便完成一次 “超级检查”。
达摩院正式开启了一场拼图游戏,将 “一扫多查” 确定为医疗 AI 的核心策略。
张灵和团队的下一个大目标是消化道的多个肿瘤。不同于实性的胰腺,胃、肠、食管是会蠕动的空腔器官,而早期病灶往往局限于黏膜层,常规上需要侵入式的消化内镜才能看清。
如果说在平扫 CT 上识别胰腺癌和主动脉夹层属于 “超出常规医疗实践”,那识别这些消化道病灶,基本属于 “超出医学常识”,从未有医疗 AI 企业想过尝试。
然而,因饮食习惯、基因等因素,消化道肿瘤偏偏又是中国相对特异高发的癌症,发病人数和死亡人数大约占到全球一半。受到内镜医生资源、麻醉医生资源和内镜舒适度的限制,这些理论上可以早期筛查的癌症,在国内其实并没有多少人真的去查。
据统计,中国每年需要开展内镜筛查的人数超过 2 亿,但事实上做的检查只有 3000 万台。这是一片平扫 CT 可以去填补的巨大空白。
从 2025 年到 2026 年,达摩院陆续推出的胃癌、肠癌、食管癌模型,让这些消化道肿瘤的 “无感” 筛查成为可能。
据测算,如要筛查中国每年死亡人数最多的七大主流癌症 (肺癌、肝癌、胃癌、结直肠癌、食管癌、胰腺癌、乳腺癌),超声、CT、胃镜、肠镜等传统检查成本累计至少 3000 元,而且用户得经历各种不同方式的检查。达摩院的 “一扫多查” 方案,用户只需要做一次平扫 CT 就能实现无感筛查,CT 费用仅为 200 元左右。
这无疑将重新定义癌症筛查和健康体检。
张灵第一次见到被他的 AI “救了一命” 的患者,是在上海一家医院的外科病房。
那是一位 75 岁的老人。做 CT 原本只是用来筛查肺部疾病,扫描没有完整覆盖胰腺,肿瘤本身也没有出现在影像中。但 PANDA 注意到一个间接信号:胰管扩张。
胰管是胰液流出的通道,病变有时会堵住它,使它变宽。模型据此判断,老人存在胰腺病变的风险可能性为 75%。
医生把老人叫回医院。增强 CT 随后在她的胰头发现一个 1.8 厘米的肿块;术后病理显示,真正的癌变部分只有 1 毫米,属于 T1a 期,也就是浸润癌最早的阶段之一。如果没有这次计划之外的 “筛查”,等癌变部分进一步扩展、等患者有了感觉再检查,往往为时已晚。
在算法研发中,一次没有识别出病变,只是一个标错的数字;落到现实里,却是一个具体的人,以及她身后的家庭。
现在,这套多癌筛查 AI 体系已经落地全国多家公立医院,以及美年大健康等体检机构。光是全国最早开设 “胰腺癌早筛门诊” 的宁波大学附属人民医院,截至 2026 年 8 月初,已累计分析超 24 万张 CT 片,成功发现 84 例胰腺癌,其中 43 例为早期,1 例为原位癌,38 位患者接受了根治性手术。
今年 8 月,医院还引进了达摩院的更多专病模型,新增胃癌、食管癌、结直肠癌、肝癌五大高发癌症,骨质疏松、脂肪肝、心血管疾病风险等四类慢病评估,以及急性主动脉综合征等 1 类危急重症预警,更多患者可能争取到早发现、早治疗的一线生机。

达摩院医疗 AI 版图
走向 “通用”
就在不断丰富 “一扫多查” 拼图的同时,他们不再满足于简单做加法。
张建鹏第一次强烈意识到 “一病一模” 走得慢,是在做第二个专病模型时。他是 Science 论文的第一作者,RADAR(雷达)项目的发起者,在张灵的多癌筛查团队里先后参与了肺癌、结直肠癌等专病模型的研发。
团队曾连续几个月投入一个项目,反复标注数据、训练模型。但比起这种疲惫,更刺激张建鹏的是,即使项目成功,他们解决的也只是成千上万种疾病中的一种。一个专病模型通常要做两三年,照这个速度,“可能一辈子都做不完”。
能不能重新找到一条技术方法,直接让一个模型去识别广泛的病种?就像在自然语言处理领域,从 Transformer 架构的提出,到 GPT 系列通过大规模预训练和自回归预测实现通用语言能力,大语言模型(LLM)第一次让 AI 摆脱了 “一任务一模型” 的桎梏,一个模型即可完成翻译、问答、推理、编程等多种任务。
这对于医疗 AI 而言,是个野心很大的问题。这个问题的本质在于,通用智能,能否在医疗这个容错率最低、可靠性要求最高的领域复现?
2023 年初,张建鹏决定借鉴视觉-语言学习(Vision Language Learning),利用医院里原本就会产生的影像和诊断报告,不用额外人工标注,直接作图文对比学习。
实验从相对简单的胸部开始,随着训练数据规模的上升,Scaling Law 开始发挥效果,而且暂时还看不到尽头。到了 2023 年底,团队决定去解最难的一道题——腹部增强 CT。
增强 CT 虽然比平扫 CT 清楚,但腹部挤着肝、胆、胰、脾、胃肠等许多器官,真正决定诊断的异常,有时只占其中很小的一块,微小的病灶也容易被大量正常组织淹没。
这个问题困扰了团队半年。反复分析训练结果,并没有让他们找到答案。张建鹏决定回到医生现场,观察影像科医生怎样读片,看看算法遗漏了什么。
他发现,医生并不会一股脑地处理所有信息,而是从上到下,依次查看不同器官。这给了团队关键启发。他们用团队在专病模型研发时积累的器官分割模块,把一套 CT 拆成肝脏、胰腺、胆囊、肾脏等不同的解剖单元,再把报告里的文字按器官拆开,让模型逐一对应。原本一组庞大而模糊的影像和文字,被拆成许多组更小、更明确的关系。
此外,标准的对比学习会把不同患者的影像视作彼此不同的样本。但两名患者的肝脏如果都很健康,本来就应该相似。团队于是改掉了这条规则。他们先判断不同病例在医学含义上是否相近,再决定应该让模型把它们归在一起,还是彼此区分。论文将这种方法称为 “自适应对比建模”。
最终,团队在腹部 18 个解剖结构、146 种疾病和异常上验证了 RADAR。近 4 万次真实世界检查中,RADAR 的平均 AUC 达到 0.913——这个指标越接近 1,说明模型越能区分有病和无病的人。在国内 8 家外部医院、超过 2.4 万次检查中,它的平均 AUC 仍达到 0.895。
团队还请来 14 家机构的 26 名影像科医生参与测试。RADAR 单独读片时,平均表现超过其中 23 人;加入 AI 提示后,医生发现异常的能力平均提高约 10%,读片时间减少 30.7%。
在张建鹏看来,最重要的不是这些数字。过去研发一种新的专病模型,需要重新准备数据、标注病灶。RADAR 学到的则是影像与医学语言之间更深层的联系。研究人员可以给它一段新的疾病描述,让它在 CT 中寻找相符的影像特征,而不必先为这种疾病重新训练模型。这被称为 “零样本诊断”。
他相信,Science 认可的也不只是一个能识别更多疾病的模型。RADAR 第一次较为系统地证明,医疗影像 AI 也可能摆脱 “一种病训练一个模型” 的方式,走向通用。
外界有人因此把 RADAR 称为医疗影像的 “GPT 时刻”。张建鹏对此很谨慎。他认为,它更接近早期的 GPT-1 或 GPT-2,只证明了一条技术路线可能成立。
“通用” 也不意味着它已经在所有任务上超过专病模型。目前,RADAR 只服务于条件更苛刻的增强 CT,张灵团队后来尝试把 RADAR 放在平扫 CT 上,和五个癌症专病模型比较,RADAR 的精度还有明显差距。
他总结道,如果影像科医生面对一套复杂的腹部增强 CT,希望尽量不漏掉分布在不同器官中的异常,RADAR 更能发挥作用;如果只想在体检人群中尽早找出胰腺癌,PANDA 仍然更合适。在可见的未来,团队将沿着两条路线并行下去。
但起码,凭借技术范式的革新,达摩院又一次在医疗 AI 领域打开了更广阔的可能性。
从在国际上首次提出用 “平扫 CT+AI” 突破胰腺癌筛查和主动脉夹层预警,到实现多个消化系统肿瘤的 “无感” 筛查,再到首个专家级的通用医疗影像模型,一条专病-多病-通用的拼图逐渐完成。回顾达摩院医疗 AI 的这十年,其实只做了一件事:如何在一份你已经拍完的 CT 影像上,发现更多、更多、再多的健康信息。
有时候,一个足够专注、简单的目标,就足够支持他们穿越周期,也足够用户做出选择。
题图来源:《降临》
相关推荐
阿里达摩院医疗 AI,十年拼出一张图
阿里达摩院做AI这两年
阿里达摩院 AI医疗 「铸剑」四年:上线170家医院,落地57座城市
对话达摩院科学家:阿里人工智能这五年
阿里云总裁张建锋:达摩院去年销售芯片超两亿片
最前线 | 阿里宣布进军5G,达摩院成立XG实验室
阿里达摩院首席科学家赵德丽离职
阿里达摩院大幅裁员?火速回应!
阿里达摩院正式加入5G巨头仗:瞄准新基建,成立XG实验室,要与华为战一战
阿里达摩院全球总部开工,总投资200亿元分三期实施
网址: 阿里达摩院医疗 AI,十年拼出一张图 https://www.xishuta.cn/newsview153565.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
