小罗碎碎念
参考来源:本文核心内容基于发表于《Nature Biomedical Engineering》的研究论文:CLEAR: an auditable foundation model for radiology grounded in clinical concepts;研究团队来自宾夕法尼亚大学佩雷尔曼医学院、亚琛工业大学医院、慕尼黑工业大学等机构,通讯作者为Tianyu Han。

过去十年,深度学习在影像诊断任务上进步神速,从疾病分类、病灶分割到预后预测,性能纪录一再被刷新。
尤其是大样本预训练的基础模型,更是展现了强大的泛化能力。但这些模型几乎都是"黑箱":输入一张图像,直接输出诊断结果,中间的决策过程、特征依据,连资深放射科医生都看不懂。
更致命的是,黑箱模型很容易学到数据里的"虚假关联"。比如训练集中带监护设备的患者往往病情更重,模型可能就学会了"看到监护仪就判为重症",而非真正识别病灶。
换一家医院、换一种设备,性能就可能断崖式下跌,而开发者根本找不到性能下降的原因------毕竟黑箱里发生了什么,没人能说清。
正如论文中所言,即便是最先进的基础模型,其泛化性也往往只能靠"信仰",人们对性能退化的底层原因几乎一无所知。
有没有一种AI,既能保持顶尖的诊断准确率,又能像真实的放射科医生一样,清晰说出自己的诊断依据,甚至出错了还能自我复盘?
近期发表于《Nature Biomedical Engineering》的CLEAR模型,给出了一个解决方案。它的全称为Concept-Level Embeddings for Auditable Radiology(面向可审计放射学的概念级嵌入模型),将所有诊断决策锚定在医生可读懂的临床概念之上,让医学影像AI从"不可解释的黑箱",变成了可查、可审、可定向修正的透明系统。
CLEAR放射学基础模型核心框架
a. 概念空间构建(Concept space curation)
这是整个模型可解释性的基础,核心是从真实临床报告中挖掘标准化的"放射征象词典"。
- 输入:227,835份胸片对应的自由文本放射科报告
- 方法:通过大语言模型自动解析报告,从中提取离散的放射学观察描述,输出结构化的征象列表
- 产出:共368,294条去重后的独立放射学观察,覆盖肺部病变、心脏异常、血管改变、置管位置等全类别临床描述,例如"轻度肺血管淤血""双肺底斑片影考虑肺不张"等
- 价值:无需专家手工枚举征象,直接从真实临床文本中挖掘,既保证概念符合临床用语习惯,又实现了超大规模的征象覆盖

b. 预训练算法(Pretraining algorithm)
这一步的目标是让模型建立"图像-文本"的语义对齐,学会"看图识征象"。
- 双编码器架构:
- 图像编码器:基于DINOv2预训练的视觉Transformer,负责提取胸片的视觉特征
- 文本编码器:负责提取放射报告的文本语义特征
- 训练方式:采用对比学习框架,在超87万对胸片-报告数据上训练,目标是让配对的图文特征在向量空间中距离尽可能近,非配对样本距离尽可能远
- 价值:任务无关的预训练让模型获得了通用的胸片语义理解能力,无需针对单病种标注,就能泛化到各类影像识别任务
c. CLEAR概念标注概览
这是推理阶段的第一步:将输入图像转化为一组人类可读懂的"征象得分"。
- 输入一张胸片后,图像编码器输出视觉特征,文本编码器输出每个概念的文本特征
- 通过计算两两相似度(点积/余弦相似度),给36万余个放射学概念分别打出匹配分数,分数越高代表图像中越可能存在该征象
- 类比来看,这就像医生读片时,逐一核对"是否存在肺不张、是否有胸腔积液",并给每个征象标注置信度
- 价值:从这一步开始,图像的表示就不再是不可解释的黑箱向量,而是完全对应临床术语的可解读分值

d. CLEAR图像嵌入生成概览
这一步将概念得分融合语义关联,生成最终的、兼具可解释性与语义丰富度的图像嵌入。
整体分为三步:
- 计算图像与全部概念的两两相似度矩阵
- 引入大语言模型预训练的概念嵌入(如text-embedding-3-small、SFR-Embedding-Mistral),这些向量天然包含概念间的语义关联(例如"肺不张"与"支气管血管聚拢"高度相关)
- 通过矩阵乘法,将概念相似度向量与概念嵌入矩阵相乘,得到最终的基于概念的图像嵌入
价值:最终的嵌入既保留了可追溯的概念权重,又具备大语言模型的丰富语义表达能力,支撑零样本分类、混杂因素审计、概念瓶颈模型构建等一系列下游应用
医学AI交流群
目前小罗全平台关注量120,000+,交流群总成员4000+,大部分来自国内外顶尖院校/医院,期待您的加入!!
由于近期入群推销人员较多,已开启入群验证,扫码添加我的联系方式,备注姓名-单位-科室/专业,即可邀您入群。
一、CLEAR的四层创新架构
传统医学影像AI的路径是"图像→黑箱特征→诊断",中间的特征向量没有任何临床含义;而CLEAR的核心创新,就是在图像与最终诊断之间,加入了一层人类完全可理解的"临床概念"------也就是放射科医生写报告时使用的标准征象描述。
整个推理路径变成了"图像→征象匹配→语义融合→诊断",每一步都对应明确的临床含义,就像医生先观察具体征象,再综合判断疾病。
从23万份报告中,挖出36万条"医生的诊断语言"
构建可解释模型的第一步,是要有一套足够全面、符合临床习惯的"概念词典"。研究团队没有依赖专家手工罗列征象,而是直接从真实临床报告中挖掘。
他们以MIMIC-CXR数据集的227,835份放射报告为基础,用大语言模型自动从报告的"所见"和"印象"部分提取离散的放射学观察描述,经过去重、归一化处理后,最终得到了368,294条独一无二的放射学观察。
从"轻度心影增大""双侧少量胸腔积液"这样的典型征象,到"PICC管末端位于上腔静脉"这样的置管描述,全部被收入其中。
为了保证提取质量,团队做了三重验证:重复运行 pipeline 的字符一致性达98.2%,否定表述不会被颠倒,97.3%的提取内容都被放射科医生判定为忠实原文、无幻觉生成。
图文对齐预训练,让模型学会"看图识征象"
有了概念词典,下一步是让模型学会"把图像和文字对应起来"。
研究团队汇总了MIMIC-CXR、CheXpert-Plus、ReXGradient三个数据集,共873,342对胸片-报告数据(覆盖239,391名患者),采用对比学习框架进行预训练。
模型包含两个编码器:
- 图像编码器基于DINOv2 ViT-B/14架构,负责提取胸片的视觉特征;
- 文本编码器采用12层Transformer结构,负责提取报告的文本特征。
训练目标很简单:让配对的图像和报告在语义空间里距离尽可能近,不配对的距离尽可能远。
经过大规模图文配对训练后,模型就具备了通用的"图文对齐"能力。
这一步训练是任务无关的------不需要针对任何一种疾病标注标签,模型学到的是通用的胸片语义表示,这也是它后续能实现零样本诊断的基础。
逐概念匹配,给每张胸片开出"征象得分表"
预训练完成后,面对一张全新的胸片,CLEAR首先会做一次"全概念匹配"。
它先用图像编码器提取这张胸片的视觉特征,然后和"征象词典"里36万多条观察的文本特征逐一计算相似度,最终得到一个36万维的相似度向量------每一个数值,都对应一条放射学观察与这张图像的匹配程度,分数越高,说明图像中越可能存在该征象。
你看到的不再是一个干巴巴的"肺炎"结论,而是"肺实变 0.85、支气管充气征 0.72、胸腔积液 0.31......"这样一条条具体的、医生能直接看懂的依据。
从这一步开始,模型的所有判断都不再是黑箱:它的每一分诊断置信度,都可以追溯到具体的影像征象上。
接入大模型语义空间,让征象"活"起来
如果只有孤立的征象得分,模型还无法利用征象之间的语义关联。CLEAR的巧妙之处,在于它把概念得分进一步"翻译"进了大语言模型的语义空间。
具体来说,团队预先用SFR-Embedding-Mistral等大语言嵌入模型,给36万条概念都计算了语义嵌入向量;推理时,把上一步得到的相似度得分向量,与概念嵌入矩阵做矩阵乘法,最终得到一个基于临床概念的高维图像嵌入。
模型会知道"肺不张"和"支气管血管聚拢""肋膈角变钝"是高度相关的,也能理解不同描述之间的细微差别。
这些语义关联会被整合进最终的图像表示中,让诊断更精准,也支撑起了零样本分类、混杂因素审计等高级能力。
二、三项硬核实验
零样本分类性能领跑同类模型,还能自查错误原因
零样本诊断是基础模型的核心能力------不用针对特定疾病重新训练,只要给出疾病名称,就能直接做诊断,这对罕见病、小样本场景价值巨大。
研究团队选用了三个完全独立的外部数据集进行测试:
- 越南的VinDr-CXR(3000张图像、21种征象)
- 西班牙的PadChest(7943张图像、55种征象)
- 美国的Indiana数据集(7466张图像、30种征象)
全部采用放射科医生标注的金标准。
对比基线包括CheXzero、BiomedCLIP、OpenAI CLIP等主流视觉语言模型,核心指标为AUROC(ROC曲线下面积,越接近1说明诊断准确率越高)。
结果非常清晰:
- 在VinDr-CXR上,CLEAR平均零样本AUROC达78.2%,比第二名CheXzero高出3.2个百分点,在结节/肿块、肺肿瘤、肺纤维化等病种上提升尤为显著;
- 在PadChest上,CLEAR平均AUROC为70.0%,领先CheXzero 3.2个百分点,大幅甩开BiomedCLIP与OpenAI CLIP;
- 在Indiana数据集上,CLEAR在绝大多数征象上都优于所有对比模型。
更有价值的是它的审计能力。
以肺炎检测为例:CLEAR在越南数据集上AUROC高达0.938,在西班牙数据集上则降至0.835。
换做黑箱模型,研究者只能笼统归因于"人群差异""设备差异",说不清具体机制。而通过CLEAR的概念聚类审计,可以直接定位到:误差最高的图像簇,大多伴随间质性肺纹理与舌段肺不张。
这并非模型的"bug",反而完全符合临床常识------间质性改变与肺不张会掩盖肺炎的实变影,本身就是放射诊断的公认难点,与Fleischner学会的指南结论高度一致。其他模型只能"给结果",CLEAR还能"给复盘",这才是临床真正需要的能力。
混杂因素审计,揪出数据里的"虚假关联",还能一键修正
很多人默认"有监督训练一定比零样本准",但真实数据里的混杂因素,往往会让模型"学歪"。
研究团队在MIMIC-CXR训练集上训练线性分类器,在CheXpert测试集验证。
整体结果上,CLEAR的线性探测平均AUROC达87.0%,远超BiomedCLIP的71.8%与OpenAI CLIP的67.6%,13个病种中有9个显著优于CheXzero,概率校准表现也更优秀。
但在"心纵隔增大(EC)"这个任务上,出现了反常现象:零样本时AUROC还有0.890,有监督训练后反而掉到了0.727,性能不升反降。
通过CLEAR的概念重要性分析,原因立刻浮出水面:
- MIMIC-CXR训练数据中,标注为"心纵隔增大"的病例,很多同时合并肺不张;
- 模型在有监督学习时走了"捷径",学会了"看到肺不张就判为纵隔增大"这个虚假关联,而非真正识别纵隔轮廓的改变。这就是典型的数据集混杂因素。
最关键的是,找到了问题,就可以定向修正。研究团队没有重训整个图像编码器,只是从36万概念中,只保留了与纵隔相关的49,167条概念,用过滤后的特征重新训练了一个轻量线性分类器。
结果立竿见影:AUROC直接从0.727回升到0.784,相对提升7.8%。再看修正后的概念权重,预测依据已经完全变成了"纵隔轮廓增宽""胸主动脉迂曲增宽"等临床正确的征象。
同样的性能下降,在CheXzero等黑箱模型上也同样存在,但你既找不到根源,也无法定向修正。
CLEAR实现了"诊断问题→定位原因→干预修正"的完整闭环,这是端到端黑箱模型永远无法做到的。
专家级概念瓶颈模型,可解释,也能比肩放射科医生
概念瓶颈模型(CBM)是公认的高可解释模型,但行业长期有一个共识:越可解释,性能越差------因为专家手工选定的概念数量少、主观性强,很难覆盖所有诊断信息。
CLEAR用数据驱动的概念选择,打破了这个权衡。团队先通过线性探针,从36万概念中给13种疾病各筛选出前10个预测性最强的概念,再用GPT-4.1去重、过滤冗余,最终得到68个高质量核心概念,构建了CLEAR CBM。
随后,团队在CheXpert测试集上,将模型与3位 board-certified 放射科医生进行对比,测试5种常见疾病的诊断水平。
结果令人振奋:整体上,CLEAR CBM的平均诊断性能与放射科医生没有统计学差异。
其中在肺不张诊断上,CLEAR CBM的马修斯相关系数(MCC)达到0.587,甚至超过了医生的0.546;在心影增大、肺水肿、胸腔积液上,模型与医生水平相当。同时,模型的概率校准误差极低,远优于标准CBM。
为了验证概念的临床合理性,3位放射科医生还做了盲法评估:对13种疾病的前10个重要概念,平均89.8%被评为"具有诊断相关性",0%被判定为"数据集伪影或捷径"。
也就是说,模型看重的诊断依据,和临床医生的判断逻辑高度一致。
这意味着,"性能与可解释不可兼得"的困局,并非不可突破。只要概念选得准、表示得好,完全可以打造出既透明、又达到专家级水平的医学AI。
三、从"准确率竞赛"到"可信落地",医学AI的下一个十年
CLEAR的价值,远不止又一个刷新纪录的影像模型。它真正的意义,是为医学AI的临床落地,打开了一条"可信、可审、可控"的新路径。
对临床而言,它重构了人机协作的模式。
过去AI进临床,最大的阻力从来不是准确率不够,而是医生不敢信------不知道它何时会出错、出错的原因是什么。
CLEAR这种概念级可解释模型,相当于让AI像规培医生一样,向上级医生"汇报诊断依据":列出自己观察到的所有征象,以及每个征象的权重。医生可以直接核对、纠正,也可以放心采纳结论。
AI不再是一个"黑箱按钮",而是一个结构化的诊断辅助工具,真正融入临床工作流。
对研发而言,它重塑了模型优化的范式。
过去发现模型泛化性差、性能掉点,开发者只能靠换数据、调参数反复试错,如同在黑箱里摸索。
现在有了概念级审计工具,可以精准定位问题:是某类征象识别不准?还是数据里存在混杂因素?甚至可以通过概念干预快速修正,无需从头重训整个模型,研发效率与安全性都大幅提升。
放眼未来,这套框架还有广阔的拓展空间。
论文中也提到,下一步可以纳入更多国家、更多语种的影像报告数据,构建更全面的概念库,提升跨人群、跨设备的泛化性;也可以从胸片扩展到CT、MRI等更多影像模态,覆盖更多临床场景。
长远来看,基于临床概念的统一表示,还可以支撑结构化报告生成、医学教学培训、跨中心影像质控,甚至结合临床数据做预后预测、治疗响应评估等更多任务。
更深远的影响在于,它解锁了海量的存量临床数据。全球医院里沉淀着不计其数的历史影像与报告,过去它们大多只能用来训练黑箱模型,价值难以充分释放;而CLEAR的方法,可以把这些非结构化的临床文本,提炼成结构化、可复用的医学概念知识,变成整个行业共享的知识资产。
说到这里,我想问大家一个问题:医学AI光追求准确率够吗?答案显然是否定的。
医疗是高风险领域,可信、可审、可解释,和准确率同等重要。CLEAR的出现,不是又一次"准确率刷新纪录"的常规突破,而是一次范式的转向------它让医学影像AI从"单纯追求更准",走向了"追求更可信、更可控"。
当AI能像真正的临床医生一样,清晰说出自己的诊断依据,接受临床的检验与修正,它才真正有资格走进病房,成为医生可靠的伙伴。
加入团队
我们是一支由国内外顶尖高校硕博组成的前沿交叉团队,多名成员以第一作者身份在Nature、Nature Communications、Advanced Science以及Radiology等顶级期刊发表过论文。
团队正在招聘实习生/分析师/讲师,欢迎医工交叉方向的优秀硕博,投递个人简历到团队邮箱:lxltx2025@163.com