
摘要
2026年6月22日,由广州医科大学附属第一医院 (国家呼吸医学中心)联合武汉大学中南医院的研究团队创建了 PU2756 数据集------一个包含 2,756 张 B 超图像的肺部肿瘤公开数据集,每例图像对应一名经穿刺活检病理确诊的独立患者(1,755 例恶性、1,001 例良性),由资深超声医师提供像素级病灶标注。其意义在于:这是首批聚焦周围型肺肿瘤的公开专家标注超声数据集,同时提供分割掩码、病理确诊标签和患者级元数据,为"无辐射、可床旁"的肺部超声 AI 诊断研究提供了从零到一的基准平台,并首次系统揭示了该任务"分割容易、鉴别难"的性能格局。
一、研究背景
1、研究背景
周围型肺病变(PPLs)是常见的影像学发现,病因多样------既包括原发性肺癌、转移瘤等恶性疾病,也包括结核、炎性病变、良性肿瘤等良性病变。良恶性鉴别对临床决策和预后至关重要。目前诊断主要依靠胸部 CT 和 PET-CT,准确性虽高,但辐射暴露、高成本和可及性受限使其难以在基层医疗和床旁场景普及;病理活检虽是金标准,却有创且无法实时监测病灶动态变化。
肺部超声以无辐射、便携、低成本的独特优势,在检测贴近胸膜的周围型肺病变方面价值突出。深度学习在超声辅助诊断中已展现潜力,但进展受制于公开高质量标注数据集的匮乏。
2、目前遇到困难和挑战
(1)肺部超声公开数据集几乎空白
肺超声用于良恶性鉴别的临床应用本就不成熟,面向 AI 研究的公开数据集更是稀缺。相比 CT 领域数据集扎堆(DeepLesion、LIDC-IDRI 等),超声方向研究者长期"无米下锅",连基准模型都无从训练。
(2)超声成像天然的主观性与不稳定性
肺超声临床应用受限于声窗欠佳、图像质量不稳定、操作者依赖性强等因素,诊断主观性高、可重复性差。而且经胸超声只能显示接触脏层胸膜的病变,能覆盖的肺部病变只是全部病变的一个子集------数据获取本身就有解剖学门槛。
(3)良恶性鉴别的客观化难题未解
正因为超声判读高度依赖医师经验,不同操作者结论差异大,临床上急需客观化的分析工具。但没有带病理金标准标签的大规模数据,AI 就永远停留在"看上去很美"的阶段------这也是作者团队建库的动因。
二、介绍数据集
1、数据集名称
PU2756(A Pulmonary Ultrasound Dataset for Tumor Segmentation and Classification)
2、一句话介绍数据集
PU2756 是首批公开的周围型肺肿瘤超声数据集,包含 2,756 名病理确诊患者各一张代表性 B 超图像,配专家像素级分割掩码、良恶性病理标签和患者级元数据,支持分割与分类双任务基准评测。
3、详细介绍数据
核心规模统计:
| 参数 | 数值 |
|---|---|
| 图像总数 | 2,756 张(B 模式超声) |
| 患者数 | 2,756 名(一人一图,无重复) |
| 恶性 / 良性 | 1,755 / 1,001(63.7% / 36.3%) |
| 年龄 | 平均 61 岁(范围 4-95 岁) |
| 性别 | 男性 1,903、女性 853 |
| 标注医师 | 2 名 10 年以上经验资深超声医师 + 第 3 名专家仲裁分歧 |
| 标签金标准 | 100% 穿刺活检病理确诊 |
| 采集设备 | Esaote MyLab90(CA431 凸阵探头 3-5MHz)、Hitachi 850(C252 凸阵探头) |
| 采集时间 | 2020 年 1 月 - 2025 年 3 月(单中心回顾性) |
恶性病理亚型覆盖: 肺鳞癌、肺腺癌、大细胞癌、小细胞癌等。
图像分辨率分布(Top 3): 486×360(25.73%)、493×369(25.00%)、1184×768(23.26%),共 17 种规格,真实反映多设备差异。
五折交叉验证划分: 按患者级划分防泄漏 + 分层抽样保持良恶性比例均衡;每折训练集约 2,205 张、测试集约 551 张。
肿瘤尺寸统计: 多数肿瘤包围盒长边在 25~400 像素之间;值得注意的是部分恶性肿瘤很小、部分良性肿瘤很大------挑战"大即恶性"的临床直觉,凸显客观影像分析的价值。
4、数据集构建
(1)病例纳入: 从广州医科大学附属第一医院(国家呼吸医学中心)2020.01-2025.03 间接受超声引导下经皮肺穿刺活检并有明确病理诊断的患者中回顾性纳入;排除非原发肺恶性肿瘤(如转移癌)、病理不明确、以及同一患者多次活检(只保留首次)。
(2)图像采集: 遵循机构实践,由经验丰富超声医师操作,取病灶最大层面二维图像以清晰显示边缘和内部回声;双设备采集以反映真实世界设备差异。每张图像须含至少一个可识别 PPL 区域,每个病灶只选一张代表图,且只保留无附加测量标记的原始图像。
(3)专家标注: 两名 10 年以上经验的资深超声医师独立勾画病灶掩码,分歧由第三名专家裁决。
(4)隐私脱敏: 裁掉含采集日期、机构位置等间接标识的图像边框(掩码同步裁剪保持对齐);精确年龄替换为 5 岁年龄分箱;患者 ID 用 HMAC-SHA256 映射为 16 位匿名标识。伦理批准号 ES-2025-K160-01,豁免知情同意。
5、数据集特点
领域开创性
首批公开的、聚焦周围型肺肿瘤的专家标注超声数据集------像素级掩码 + 病理确诊标签 + 患者元数据三件套齐备,此前这个方向的研究者没有公开基准可用。
100% 病理金标准
所有 2,756 例均经穿刺活检病理确诊,不是影像印象或随访推断,标签可靠性拉满。这在超声数据集中尤为难得。
双任务 + 官方划分
同时支持病灶分割和良恶性分类两大任务,附带患者级五折交叉验证划分文件(five_fold_split.xlsx),拿来即可复现基准,也允许按需重新划分。
真实世界复杂性
双设备、17 种分辨率、病灶回声/形态/边界多样性大,且保留"小恶性、大良性"这类反直觉病例------不是精心美化的玩具数据集,而是贴近临床实战的硬骨头。
诚实的能力边界声明
作者明确指出:数据集只含阳性病例(有病灶的图),没有无病灶的阴性检查;单中心回顾性设计。因此基准结果应理解为"病灶级分割与良恶性鉴别基线",而非完整临床诊断性能证据------这种诚实在数据集论文里值得点赞。
6、数据集使用方法
- 数据获取: Figshare 公开下载(DOI: 10.6084/m9.figshare.32672274),PNG 格式开箱即用无需预处理
- 代码获取: GitHub 开源全部基线实现与实验配置
- 目录结构:
images/(按匿名患者 ID 组织)+masks/(同名掩码)+five_fold_split.xlsx(元数据与折划分) - 许可: CC BY-NC-ND 4.0(署名-非商业-禁止演绎),学术使用需引用原文
- 注意事项: 仅含阳性病例,不能用于评估真阴性场景;单中心数据,鼓励外部验证;可自定义重新划分(如 7:1:2)
7、基准测试总结
在 2,756 张图像的五折交叉验证基准中,分割任务 MedNeXt 以 Dice 90.73% (0.9073±0.0012)领先 U-Net(89.79%),而良恶性分类任务所有方法敏感度虽超 80%,最佳 AUC 仅为 ConvNeXt-Tiny 的 69.50%------揭示肺部超声"分割易、鉴别难"的性能格局,分类方向留有巨大改进空间。
三、数据集有哪些场景的应用
1、肺部超声病灶分割模型训练------最现成的用法
这是 PU2756 的主战场。2,756 张图每张都有专家勾的像素级掩码,直接训 U-Net、MedNeXt 就能跑,官方基线 Dice 已经到 90.73%。你要做超声图像分割,不用自己找医院收数据、不用求人标注,Figshare 下载解压就能开工。而且官方给了五折划分文件,你的结果和别人的结果天然可比。
2、基层和床旁场景的肺肿瘤初筛 AI
CT 有辐射、贵、基层没有;活检有创。肺部超声无辐射、设备便宜、能推到床边------特别适合基层医院、体检车、急诊科做初步筛查。PU2756 就是训练这种"平民化"筛查模型的素材:让 AI 在超声图像上先框出可疑病灶、给出良恶性倾向,把明显没事的筛掉,可疑的再转上级医院做 CT。对分级诊疗的意义很实在。
3、"分割易分类难"的攻关靶场
论文基准暴露了一个扎心事实:分割 Dice 90%+ 很容易,但良恶性分类最好的 AUC 才 0.6950,所有方法都是"高敏感、低特异"(敏感度>80%、特异度<50%)------宁杀错不放过。这等于官方给你划了重点:分类性能就是这个数据集的主线难题。你可以攻关小病灶恶性特征提取、超声纹理深度表征、多模态融合,谁把 AUC 从 0.70 推到 0.85+,谁就是这条赛道的第一篇重磅。
4、影像组学 vs 深度学习的方法论对比
论文同时测了影像组学(XGBoost + 954 维特征)、自编码器(1,024 维深度表征)、混合特征(1,978 维)、CNN 系列(ResNet/DenseNet/ConvNeXt)和 Transformer 系列(ViT/Swin)五条技术路线。这种同数据集上的全谱系对比很少见:结果是 CNN 系最稳(ConvNeXt-Tiny 最佳),混合特征次之,纯影像组学稍弱但可解释性好。做方法选型或写综述的人,这组对照数据可以直接引用。
5、数据增强策略的对照实验设计参考
论文里有个很容易被忽略但很专业的设计:针对不同范式用了不同的增强策略------影像组学不做几何旋转(会破坏纹理矩阵的空间对应),改用多种滤波器;自编码器不做增强(会改变重建目标);CNN/Transformer 才用标准的翻转旋转。理由讲得清清楚楚:一刀切的增强会不公平地惩罚某些方法。做公平基准比较时,这个细节值得照抄。
6、小病灶恶性特征研究------挑战临床直觉
PU2756 的统计分析发现一个反常识现象:有些恶性肿瘤很小,有些良性肿瘤很大,"大=恶"的直觉不成立。这些小而恶的病灶正是医师最容易漏的。你可以专门挑这批小病灶子集,研究什么样的回声纹理、边界特征提示恶性,训练针对小病灶的增强检测模型------临床价值直接拉满。
7、超声设备泛化与外部验证研究
数据集用 Esaote 和 Hitachi 两台设备采集,且作者明确欢迎外部验证。你可以:在 PU2756 上训练,拿到你们医院的 GE/飞利浦/迈瑞超声数据上测泛化;或者分析两台设备间的域偏移。对评估 AI 产品跨设备部署能力,这是现成的实验框架。
8、阴性病例纳入后的再基准研究(前瞻布局)
作者承诺未来版本会补充无肿瘤阴性病例。现在的模型全是"图里必有病灶"前提下的判别,一旦加入阴性图,假阳性问题就会暴露。你可以提前布局:先在 PU2756 上把方法做扎实,等阴性子集发布当天,第一时间跑出"含真阴性"的新基准------这就是先发优势。
9、超声 AI 教学与医师培训
每张图都有专家掩码和病理结论,超声住培医师可以拿来练手:先看图自己勾病灶、判良恶,再对照专家掩码和病理答案。2,756 例带标准答案的病例库,比跟诊攒经验快得多。对超声医师稀缺地区的远程教育也很友好。
10、弱监督与报告生成探索
虽然掩码是像素级的,但你也可以故意只用图像级标签做弱监督分割研究(用分类标签+CAM 生成伪掩码,和真掩码对比),量化弱监督在这个任务上的性能损失。另外病理诊断文本+图像的组合,也适合探索"超声图像自动生成结构化描述"的多模态任务。
相关资源
对于做医疗 AI 的朋友,数据集选型往往是个痛点------不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中,查阅成本很高。
我们把及全球主流医疗 AI 数据集(涵盖 CT、MRI、病理、超声、多模态等)整理成了 AI-Ready Dataset 条目库,以统一的 Wikipedia 式结构呈现,方便研究者快速比对和选型:
Qianfanghub AI-Ready Dataset:https://www.qianfanghub.com/ai-ready-dataset/

#肺部超声 #PU2756 #肿瘤分割 #良恶性分类 #病理金标准