Nat. Biomed. Eng最新发表的医学AI基础模型CLEAR,可以将诊断决策与临床概念一一匹配,不再是传统黑箱模型

小罗碎碎念

参考来源:本文核心内容基于发表于《Nature Biomedical Engineering》的研究论文:CLEAR: an auditable foundation model for radiology grounded in clinical concepts;研究团队来自宾夕法尼亚大学佩雷尔曼医学院、亚琛工业大学医院、慕尼黑工业大学等机构,通讯作者为Tianyu Han。

过去十年,深度学习在影像诊断任务上进步神速,从疾病分类、病灶分割到预后预测,性能纪录一再被刷新。

尤其是大样本预训练的基础模型,更是展现了强大的泛化能力。但这些模型几乎都是"黑箱":输入一张图像,直接输出诊断结果,中间的决策过程、特征依据,连资深放射科医生都看不懂。

更致命的是,黑箱模型很容易学到数据里的"虚假关联"。比如训练集中带监护设备的患者往往病情更重,模型可能就学会了"看到监护仪就判为重症",而非真正识别病灶。

换一家医院、换一种设备,性能就可能断崖式下跌,而开发者根本找不到性能下降的原因------毕竟黑箱里发生了什么,没人能说清。

正如论文中所言,即便是最先进的基础模型,其泛化性也往往只能靠"信仰",人们对性能退化的底层原因几乎一无所知。

有没有一种AI,既能保持顶尖的诊断准确率,又能像真实的放射科医生一样,清晰说出自己的诊断依据,甚至出错了还能自我复盘?

近期发表于《Nature Biomedical Engineering》的CLEAR模型,给出了一个解决方案。它的全称为Concept-Level Embeddings for Auditable Radiology(面向可审计放射学的概念级嵌入模型),将所有诊断决策锚定在医生可读懂的临床概念之上,让医学影像AI从"不可解释的黑箱",变成了可查、可审、可定向修正的透明系统。


CLEAR放射学基础模型核心框架

a. 概念空间构建(Concept space curation)

这是整个模型可解释性的基础,核心是从真实临床报告中挖掘标准化的"放射征象词典"。

  • 输入:227,835份胸片对应的自由文本放射科报告
  • 方法:通过大语言模型自动解析报告,从中提取离散的放射学观察描述,输出结构化的征象列表
  • 产出:共368,294条去重后的独立放射学观察,覆盖肺部病变、心脏异常、血管改变、置管位置等全类别临床描述,例如"轻度肺血管淤血""双肺底斑片影考虑肺不张"等
  • 价值:无需专家手工枚举征象,直接从真实临床文本中挖掘,既保证概念符合临床用语习惯,又实现了超大规模的征象覆盖

b. 预训练算法(Pretraining algorithm)

这一步的目标是让模型建立"图像-文本"的语义对齐,学会"看图识征象"。

  • 双编码器架构:
    • 图像编码器:基于DINOv2预训练的视觉Transformer,负责提取胸片的视觉特征
    • 文本编码器:负责提取放射报告的文本语义特征
  • 训练方式:采用对比学习框架,在超87万对胸片-报告数据上训练,目标是让配对的图文特征在向量空间中距离尽可能近,非配对样本距离尽可能远
  • 价值:任务无关的预训练让模型获得了通用的胸片语义理解能力,无需针对单病种标注,就能泛化到各类影像识别任务

c. CLEAR概念标注概览

这是推理阶段的第一步:将输入图像转化为一组人类可读懂的"征象得分"。

  • 输入一张胸片后,图像编码器输出视觉特征,文本编码器输出每个概念的文本特征
  • 通过计算两两相似度(点积/余弦相似度),给36万余个放射学概念分别打出匹配分数,分数越高代表图像中越可能存在该征象
  • 类比来看,这就像医生读片时,逐一核对"是否存在肺不张、是否有胸腔积液",并给每个征象标注置信度
  • 价值:从这一步开始,图像的表示就不再是不可解释的黑箱向量,而是完全对应临床术语的可解读分值

d. CLEAR图像嵌入生成概览

这一步将概念得分融合语义关联,生成最终的、兼具可解释性与语义丰富度的图像嵌入。

整体分为三步:

  1. 计算图像与全部概念的两两相似度矩阵
  2. 引入大语言模型预训练的概念嵌入(如text-embedding-3-small、SFR-Embedding-Mistral),这些向量天然包含概念间的语义关联(例如"肺不张"与"支气管血管聚拢"高度相关)
  3. 通过矩阵乘法,将概念相似度向量与概念嵌入矩阵相乘,得到最终的基于概念的图像嵌入

价值:最终的嵌入既保留了可追溯的概念权重,又具备大语言模型的丰富语义表达能力,支撑零样本分类、混杂因素审计、概念瓶颈模型构建等一系列下游应用


医学AI交流群

目前小罗全平台关注量120,000+,交流群总成员4000+,大部分来自国内外顶尖院校/医院,期待您的加入!!

由于近期入群推销人员较多,已开启入群验证,扫码添加我的联系方式,备注姓名-单位-科室/专业,即可邀您入群。


一、CLEAR的四层创新架构

传统医学影像AI的路径是"图像→黑箱特征→诊断",中间的特征向量没有任何临床含义;而CLEAR的核心创新,就是在图像与最终诊断之间,加入了一层人类完全可理解的"临床概念"------也就是放射科医生写报告时使用的标准征象描述。

整个推理路径变成了"图像→征象匹配→语义融合→诊断",每一步都对应明确的临床含义,就像医生先观察具体征象,再综合判断疾病。

从23万份报告中,挖出36万条"医生的诊断语言"

构建可解释模型的第一步,是要有一套足够全面、符合临床习惯的"概念词典"。研究团队没有依赖专家手工罗列征象,而是直接从真实临床报告中挖掘。

他们以MIMIC-CXR数据集的227,835份放射报告为基础,用大语言模型自动从报告的"所见"和"印象"部分提取离散的放射学观察描述,经过去重、归一化处理后,最终得到了368,294条独一无二的放射学观察。

从"轻度心影增大""双侧少量胸腔积液"这样的典型征象,到"PICC管末端位于上腔静脉"这样的置管描述,全部被收入其中。

为了保证提取质量,团队做了三重验证:重复运行 pipeline 的字符一致性达98.2%,否定表述不会被颠倒,97.3%的提取内容都被放射科医生判定为忠实原文、无幻觉生成。


图文对齐预训练,让模型学会"看图识征象"

有了概念词典,下一步是让模型学会"把图像和文字对应起来"。

研究团队汇总了MIMIC-CXR、CheXpert-Plus、ReXGradient三个数据集,共873,342对胸片-报告数据(覆盖239,391名患者),采用对比学习框架进行预训练。

模型包含两个编码器:

  • 图像编码器基于DINOv2 ViT-B/14架构,负责提取胸片的视觉特征;
  • 文本编码器采用12层Transformer结构,负责提取报告的文本特征。

训练目标很简单:让配对的图像和报告在语义空间里距离尽可能近,不配对的距离尽可能远。

经过大规模图文配对训练后,模型就具备了通用的"图文对齐"能力。

这一步训练是任务无关的------不需要针对任何一种疾病标注标签,模型学到的是通用的胸片语义表示,这也是它后续能实现零样本诊断的基础。


逐概念匹配,给每张胸片开出"征象得分表"

预训练完成后,面对一张全新的胸片,CLEAR首先会做一次"全概念匹配"。

它先用图像编码器提取这张胸片的视觉特征,然后和"征象词典"里36万多条观察的文本特征逐一计算相似度,最终得到一个36万维的相似度向量------每一个数值,都对应一条放射学观察与这张图像的匹配程度,分数越高,说明图像中越可能存在该征象。

你看到的不再是一个干巴巴的"肺炎"结论,而是"肺实变 0.85、支气管充气征 0.72、胸腔积液 0.31......"这样一条条具体的、医生能直接看懂的依据。

从这一步开始,模型的所有判断都不再是黑箱:它的每一分诊断置信度,都可以追溯到具体的影像征象上。


接入大模型语义空间,让征象"活"起来

如果只有孤立的征象得分,模型还无法利用征象之间的语义关联。CLEAR的巧妙之处,在于它把概念得分进一步"翻译"进了大语言模型的语义空间。

具体来说,团队预先用SFR-Embedding-Mistral等大语言嵌入模型,给36万条概念都计算了语义嵌入向量;推理时,把上一步得到的相似度得分向量,与概念嵌入矩阵做矩阵乘法,最终得到一个基于临床概念的高维图像嵌入。

模型会知道"肺不张"和"支气管血管聚拢""肋膈角变钝"是高度相关的,也能理解不同描述之间的细微差别。

这些语义关联会被整合进最终的图像表示中,让诊断更精准,也支撑起了零样本分类、混杂因素审计等高级能力。


二、三项硬核实验

零样本分类性能领跑同类模型,还能自查错误原因

零样本诊断是基础模型的核心能力------不用针对特定疾病重新训练,只要给出疾病名称,就能直接做诊断,这对罕见病、小样本场景价值巨大。

研究团队选用了三个完全独立的外部数据集进行测试:

  • 越南的VinDr-CXR(3000张图像、21种征象)
  • 西班牙的PadChest(7943张图像、55种征象)
  • 美国的Indiana数据集(7466张图像、30种征象)

全部采用放射科医生标注的金标准。

对比基线包括CheXzero、BiomedCLIP、OpenAI CLIP等主流视觉语言模型,核心指标为AUROC(ROC曲线下面积,越接近1说明诊断准确率越高)。

结果非常清晰:

  • 在VinDr-CXR上,CLEAR平均零样本AUROC达78.2%,比第二名CheXzero高出3.2个百分点,在结节/肿块、肺肿瘤、肺纤维化等病种上提升尤为显著;
  • 在PadChest上,CLEAR平均AUROC为70.0%,领先CheXzero 3.2个百分点,大幅甩开BiomedCLIP与OpenAI CLIP;
  • 在Indiana数据集上,CLEAR在绝大多数征象上都优于所有对比模型。

更有价值的是它的审计能力。

以肺炎检测为例:CLEAR在越南数据集上AUROC高达0.938,在西班牙数据集上则降至0.835。

换做黑箱模型,研究者只能笼统归因于"人群差异""设备差异",说不清具体机制。而通过CLEAR的概念聚类审计,可以直接定位到:误差最高的图像簇,大多伴随间质性肺纹理与舌段肺不张。

这并非模型的"bug",反而完全符合临床常识------间质性改变与肺不张会掩盖肺炎的实变影,本身就是放射诊断的公认难点,与Fleischner学会的指南结论高度一致。其他模型只能"给结果",CLEAR还能"给复盘",这才是临床真正需要的能力。


混杂因素审计,揪出数据里的"虚假关联",还能一键修正

很多人默认"有监督训练一定比零样本准",但真实数据里的混杂因素,往往会让模型"学歪"。

研究团队在MIMIC-CXR训练集上训练线性分类器,在CheXpert测试集验证。

整体结果上,CLEAR的线性探测平均AUROC达87.0%,远超BiomedCLIP的71.8%与OpenAI CLIP的67.6%,13个病种中有9个显著优于CheXzero,概率校准表现也更优秀。

但在"心纵隔增大(EC)"这个任务上,出现了反常现象:零样本时AUROC还有0.890,有监督训练后反而掉到了0.727,性能不升反降。

通过CLEAR的概念重要性分析,原因立刻浮出水面:

  • MIMIC-CXR训练数据中,标注为"心纵隔增大"的病例,很多同时合并肺不张;
  • 模型在有监督学习时走了"捷径",学会了"看到肺不张就判为纵隔增大"这个虚假关联,而非真正识别纵隔轮廓的改变。这就是典型的数据集混杂因素。

最关键的是,找到了问题,就可以定向修正。研究团队没有重训整个图像编码器,只是从36万概念中,只保留了与纵隔相关的49,167条概念,用过滤后的特征重新训练了一个轻量线性分类器。

结果立竿见影:AUROC直接从0.727回升到0.784,相对提升7.8%。再看修正后的概念权重,预测依据已经完全变成了"纵隔轮廓增宽""胸主动脉迂曲增宽"等临床正确的征象。

同样的性能下降,在CheXzero等黑箱模型上也同样存在,但你既找不到根源,也无法定向修正。

CLEAR实现了"诊断问题→定位原因→干预修正"的完整闭环,这是端到端黑箱模型永远无法做到的。


专家级概念瓶颈模型,可解释,也能比肩放射科医生

概念瓶颈模型(CBM)是公认的高可解释模型,但行业长期有一个共识:越可解释,性能越差------因为专家手工选定的概念数量少、主观性强,很难覆盖所有诊断信息。

CLEAR用数据驱动的概念选择,打破了这个权衡。团队先通过线性探针,从36万概念中给13种疾病各筛选出前10个预测性最强的概念,再用GPT-4.1去重、过滤冗余,最终得到68个高质量核心概念,构建了CLEAR CBM。

随后,团队在CheXpert测试集上,将模型与3位 board-certified 放射科医生进行对比,测试5种常见疾病的诊断水平。

结果令人振奋:整体上,CLEAR CBM的平均诊断性能与放射科医生没有统计学差异。

其中在肺不张诊断上,CLEAR CBM的马修斯相关系数(MCC)达到0.587,甚至超过了医生的0.546;在心影增大、肺水肿、胸腔积液上,模型与医生水平相当。同时,模型的概率校准误差极低,远优于标准CBM。

为了验证概念的临床合理性,3位放射科医生还做了盲法评估:对13种疾病的前10个重要概念,平均89.8%被评为"具有诊断相关性",0%被判定为"数据集伪影或捷径"。

也就是说,模型看重的诊断依据,和临床医生的判断逻辑高度一致。

这意味着,"性能与可解释不可兼得"的困局,并非不可突破。只要概念选得准、表示得好,完全可以打造出既透明、又达到专家级水平的医学AI。


三、从"准确率竞赛"到"可信落地",医学AI的下一个十年

CLEAR的价值,远不止又一个刷新纪录的影像模型。它真正的意义,是为医学AI的临床落地,打开了一条"可信、可审、可控"的新路径。

对临床而言,它重构了人机协作的模式。

过去AI进临床,最大的阻力从来不是准确率不够,而是医生不敢信------不知道它何时会出错、出错的原因是什么。

CLEAR这种概念级可解释模型,相当于让AI像规培医生一样,向上级医生"汇报诊断依据":列出自己观察到的所有征象,以及每个征象的权重。医生可以直接核对、纠正,也可以放心采纳结论。

AI不再是一个"黑箱按钮",而是一个结构化的诊断辅助工具,真正融入临床工作流。

对研发而言,它重塑了模型优化的范式。

过去发现模型泛化性差、性能掉点,开发者只能靠换数据、调参数反复试错,如同在黑箱里摸索。

现在有了概念级审计工具,可以精准定位问题:是某类征象识别不准?还是数据里存在混杂因素?甚至可以通过概念干预快速修正,无需从头重训整个模型,研发效率与安全性都大幅提升。

放眼未来,这套框架还有广阔的拓展空间。

论文中也提到,下一步可以纳入更多国家、更多语种的影像报告数据,构建更全面的概念库,提升跨人群、跨设备的泛化性;也可以从胸片扩展到CT、MRI等更多影像模态,覆盖更多临床场景。

长远来看,基于临床概念的统一表示,还可以支撑结构化报告生成、医学教学培训、跨中心影像质控,甚至结合临床数据做预后预测、治疗响应评估等更多任务。

更深远的影响在于,它解锁了海量的存量临床数据。全球医院里沉淀着不计其数的历史影像与报告,过去它们大多只能用来训练黑箱模型,价值难以充分释放;而CLEAR的方法,可以把这些非结构化的临床文本,提炼成结构化、可复用的医学概念知识,变成整个行业共享的知识资产。

说到这里,我想问大家一个问题:医学AI光追求准确率够吗?答案显然是否定的。

医疗是高风险领域,可信、可审、可解释,和准确率同等重要。CLEAR的出现,不是又一次"准确率刷新纪录"的常规突破,而是一次范式的转向------它让医学影像AI从"单纯追求更准",走向了"追求更可信、更可控"。

当AI能像真正的临床医生一样,清晰说出自己的诊断依据,接受临床的检验与修正,它才真正有资格走进病房,成为医生可靠的伙伴。


加入团队

我们是一支由国内外顶尖高校硕博组成的前沿交叉团队,多名成员以第一作者身份在Nature、Nature Communications、Advanced Science以及Radiology等顶级期刊发表过论文。

团队正在招聘实习生/分析师/讲师,欢迎医工交叉方向的优秀硕博,投递个人简历到团队邮箱:lxltx2025@163.com

相关推荐
Leslie1651 小时前
多人共享目录如何不失控:用 setgid、ACL、umask 与粘滞位设计 Linux 权限
人工智能
mit6.8241 小时前
“Copilot“ 超级应用“年内问世(`・ω・´)
人工智能
zhbcddxr1 小时前
GEO服务商度量监测能力测评:可见度追踪与报表排行
大数据·人工智能·microsoft
m沐沐1 小时前
【自然语言处理】词向量转换与中文文本情感分类——从CountVectorizer到朴素贝叶斯
人工智能·算法·机器学习·自然语言处理·分类·中文分词·词向量转换
科技发布1 小时前
拆解传播易服务模式,看清小红书团购从入驻变现完整逻辑
大数据·人工智能
用户298698530142 小时前
Excel 转 PDF 免费在线工具,格式完美保留
人工智能·c#·excel
武子康2 小时前
2026 年 7 月 AI 模型发布复盘:真正被比较的是整套工作系统
人工智能·llm·agent
qq_419563092 小时前
1.8-从深度学习到大模型时代
人工智能·深度学习
miaowu3572 小时前
企业 AI 智能体实施周期短吗?各阶段费用明细
人工智能