
摘要
2026年8月5日,由英国南安普顿大学(联合清华大学、伦敦国王学院、伦敦大学学院UCL-ARC)的研究团队提出了一个基于EDM2扩散架构的高分辨率胎儿超声图像合成框架。该框架在4个公开数据集上训练,生成512×512分辨率的6类解剖平面胎儿超声图像,总体FID从先前方法的176.85降至104.25(降低40.9%),下游胎儿平面分类在合成数据微调后集成准确率达93.36%,超过仅用真实数据训练的92.32%。一位10年以上经验的胎儿超声专家对100张图像的临床评估给出平均真实度2.67/5(真实图像3.12,合成图像2.07),主要伪影包括平滑、散斑不规则和解剖不一致。所有代码、模型权重和评估工具均已开源。
一、研究背景
1、研究背景
产前超声成像是评估胎儿健康和发育的主要模态。近年来AI加速了分类器、自动检测系统和合成图像生成方法在产前成像中的发展。然而,临床可靠的AI模型需要多样化的数据集来捕获真实世界的复杂性------包括不同的胎儿状况、超声扫描仪、患者人口统计学特征和从2D到新兴3D-4D的成像模态。
公开数据集和评估框架对于评估AI模型的保真度、鲁棒性和多样性至关重要。然而,胎儿超声数据集仍主要围绕FETAL PLANES DB(12,400张图像)展开,新兴数据集包括US Fetus Phantom(15,728张)、Fetal Head(1,334张)、Fetal Abdomen(4,668张)和Fetal Cardiac(300张)等。数据稀缺、隐私限制和标注困难持续制约AI进展。
生成模型(GAN、VAE、扩散模型、流模型)为解决医学图像数据稀缺提供了有前景的途径。但此前胎儿超声扩散合成的分辨率受限(128×128或256×256),且缺乏临床评估。
2、目前遇到困难和挑战
分辨率不足限制临床可用性。 此前扩散合成最高仅256×256(Diffusion-GAN混合方法),128×128更是"临床限制性的",无法支持临床级应用。
小数据集导致记忆风险。 FETAL PLANES DB仅12,400张图像,扩散模型可能记忆训练数据而非学习分布,导致合成图像缺乏多样性。
缺乏临床专家评估。 此前工作(如Diffusion-Based Fetal US Synthesis with Active Learning)在图像质量比较上取得了不错结果,但未包含临床评估------合成图像在专家眼中有多真实是未知数。
架构滞后。 此前工作使用Stable Diffusion 1.5等较老架构,未采用当前ImageNet生成SOTA的EDM2。
二、介绍该框架/标准/方法
1、名称
UltrasoundEDM2------基于EDM2扩散架构的胎儿超声高分辨率合成框架。
2、一句话介绍
一个将EDM2(ImageNet生成当前SOTA)应用于胎儿超声合成的框架,在4个公开数据集上训练生成512×512分辨率、6类解剖平面的高保真图像,FID降低40.9%,下游分类准确率反超真实数据训练。
3、详细介绍
| 维度 | 内容 | 规格 |
|---|---|---|
| 架构 | EDM2(含EDM2-S和EDM2-XL两种规模) | ImageNet生成SOTA |
| 分辨率 | 512×512 | 此前最高256×256 |
| 解剖类别 | 母体宫颈、胎儿腹部、胎儿脑、胎儿股骨、胎儿胸部、其他 | 6类 |
| 训练数据 | FETAL PLANES DB(12,400张)+ FPU23(15,728张)+ 胎儿腹部结构分割(1,588张)+ 非洲低资源(451张) | 4个数据集,约29,767张 |
| 数据加权 | FETAL PLANES DB权重2.0,其他1.0 | 加权MSE损失 |
| 引导技术 | Autoguidance(自引导) | 提升图像质量 |
| 生成量 | 每类5,000张,引导尺度2.25 | 共30,000张 |
FID对比(越低越好):
| 类别 | 此前SOTA (Tian等) | 本方法 | 改善幅度 |
|---|---|---|---|
| 其他 | 189.14 | 143.30 | -24.2% |
| 母体宫颈 | 269.08 | 155.30 | -42.3% |
| 胎儿腹部 | 241.14 | 150.12 | -37.8% |
| 胎儿脑 | 184.06 | 117.71 | -36.0% |
| 胎儿股骨 | 203.10 | 141.57 | -30.3% |
| 胎儿胸部 | 233.37 | 135.99 | -41.7% |
| 总体 | 176.85 | 104.25 | -40.9% |
分类准确率对比:
| 方法 | 模型 | 此前SOTA | 本方法 |
|---|---|---|---|
| 从头训练 | ResNet50 | 84.97% | 85.94% |
| DenseNet169 | 84.20% | 87.67% | |
| MedMamba | 82.53% | 86.34% | |
| 软投票集成 | 87.35% | 89.51% | |
| 微调 | ResNet50 | 91.29% | 92.45% |
| DenseNet169 | 91.84% | 92.15% | |
| MedMamba | 90.52% | 91.77% | |
| 软投票集成 | 92.84% | 93.36% | |
| 仅真实数据 | 软投票集成 | --- | 92.32% |
4、设计与构建过程
框架基于EDM2(Karras等,2024 CVPR),这是ImageNet生成当前SOTA的扩散架构。研究训练了两种规模的网络------EDM2-S(小)和EDM2-XL(超大),以支持autoguidance(自引导)技术提升图像质量。
数据整合策略:以FETAL PLANES DB为核心(权重2.0),整合FPU23、胎儿腹部结构分割和非洲低资源数据集(各权重1.0)。每个补充数据集在训练时赋予单一标签。整合额外数据使训练步数翻倍,验证损失从0.1427降至0.1371。
数据增强:中心裁剪、随机水平翻转、缩放至512×512。
评估设计:图像质量用FID(与先前工作在128×128下公平比较);下游分类用3种架构(ResNet50、DenseNet169、MedMamba)+ 软投票集成,在从头训练和微调两种设置下评估;临床评估由10年以上经验的胎儿超声专家对100张图像评分(5级Likert量表+真伪判别)。
5、核心特点
分辨率翻倍。 512×512的合成分辨率是此前最高256×256的两倍,更接近临床超声的实际分辨率需求。
FID大幅降低。 总体FID从176.85降至104.25,6类平均改善约36%------这不是边际提升而是质的飞跃。
合成数据反超真实数据。 微调后集成准确率93.36%超过仅用真实数据的92.32%,证明高质量合成图像能有效增强下游任务------这在数据稀缺的医学影像领域具有重要实践意义。
临床评估诚实透明。 专家评分2.67/5并不高------合成图像在专家眼中仍有明显差距(真实3.12 vs 合成2.07)。论文没有回避这一事实,而是详细报告了伪影类型(平滑、散斑不规则、解剖不一致),为后续改进指明了方向。
多数据集整合防记忆。 通过整合4个数据集并加权,减少了小数据集上扩散模型记忆训练数据的风险,同时增加了训练步数和多样性。
全开源可复现。 代码、训练模型权重(Hugging Face)、数据处理脚本、临床评估调查(GitHub Pages)全部开放,支持完全复现。
6、使用方法
- 获取方式 :
- 面向用户:胎儿超声AI研究者、医学图像合成研究者、数据增强实践者
- 使用流程:(1)下载预训练权重;(2)生成指定类别的512×512超声图像;(3)用于下游分类器的数据增强或预训练;(4)用调查工具收集临床专家反馈
- 注意事项:FID比较时需将生成图像缩放至与基线相同的分辨率;autoguidance引导尺度建议2.25;合成图像存在平滑和解剖不一致伪影,不适合直接用于临床诊断
7、落地验证/成效总结
在4个公开数据集约29,767张图像的训练下,UltrasoundEDM2将总体FID从176.85降至104.25(降低40.9% );下游胎儿平面分类在合成数据微调后集成准确率达93.36% ,超过仅用真实数据训练的92.32% (提升1.04个百分点);但临床专家评估100张图像的合成图像平均真实度仅2.07/5 (真实图像3.12/5 ),差距33.7%,表明合成质量仍有显著提升空间。
三、该框架/标准/方法有哪些场景的应用
1、胎儿超声分类器的数据增强
假设你在开发一个胎儿超声平面分类器,但标注数据只有几千张。你可以用UltrasoundEDM2生成指定类别的512×512合成图像,扩充训练集。论文已经证明:先用合成数据预训练再用真实数据微调,集成准确率能从92.32%(仅真实)提升到93.36%(合成+真实)。对于数据极度稀缺的类别(如胎儿心脏仅300张),这种增强可能更加关键。
2、低资源医疗场景的合成数据替代
框架整合了一个非洲低资源数据集(451张),表明研究团队关注资源不平等场景。在缺乏专业超声设备和标注专家的低资源地区,合成图像可以作为"虚拟数据集"用于训练基础分类器------虽然质量不如真实数据,但"有总比没有好"。你可以用预训练权重生成目标场景的合成图像,训练一个基础分类器作为初步筛查工具。
3、扩散架构在医学影像中的迁移验证
如果你是医学图像合成研究者,想验证"ImageNet上的SOTA架构能否迁移到医学影像",UltrasoundEDM2提供了一个成功案例:EDM2在ImageNet上是当前SOTA,迁移到胎儿超声后FID降低40.9%。你可以参考其训练设置(EDM2-S + EDM2-XL双规模、autoguidance、加权MSE损失),将EDM2迁移到其他医学影像模态(如MRI、CT、病理切片)。
4、临床专家评估流程搭建
框架提供了一个基于GitHub Pages的轻量级临床评估调查工具,支持真伪判别和5级Likert量表评分,图像通过Hugging Face API流式加载,响应可导出CSV。如果你在开发自己的合成模型,可以直接复用这个调查框架收集临床专家反馈------不需要搭建复杂的Web后端,一个GitHub Pages页面就够了。
5、合成图像伪影分析与改进方向
论文详细报告了三类主要伪影:平滑(过度模糊)、散斑不规则(超声特有纹理失真)和解剖不一致(结构矛盾)。如果你在改进胎儿超声合成质量,可以针对这三类伪影设计专门的损失项或评估指标------比如用散斑纹理一致性损失改善散斑不规则,用解剖约束模块减少结构矛盾。临床专家评分2.07/5说明改进空间很大,但也意味着每一点改善都能被专家感知到。
6、开放数据集整合的实践范式
框架整合了4个异构数据集(不同来源、不同标注粒度、不同人群),通过单一标签分配和加权MSE损失统一训练。这种"核心数据集高权重 + 补充数据集低权重"的策略,为其他需要整合多个小数据集的医学影像合成任务提供了可复用的范式------既保留核心数据集的标签质量,又利用补充数据集增加多样性、减少记忆风险。
相关资源
对于做医疗 AI 的朋友,数据集选型往往是个痛点------不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中,查阅成本很高。
我们把及全球主流医疗 AI 数据集(涵盖 CT、MRI、病理、超声、多模态等)整理成了 AI-Ready Dataset 条目库,以统一的 Wikipedia 式结构呈现,方便研究者快速比对和选型:
Qianfanghub AI-Ready Dataset:https://www.qianfanghub.com/ai-ready-dataset/

#胎儿超声 #扩散模型 #EDM2 #合成数据增强 #临床评估