A Classification of Safety Risks in Medical AI
论文重点
本文由清华大学黄天荫教授联合上海交通大学、斯坦福大学、伦敦国王学院等机构学者发表于NEJM AI,针对医疗AI从研发试点走向常规临床应用的现实需求,提出了S1-S4四级临床安全分类框架。文章的核心洞见在于:评价医疗AI是否安全,不能只看准确率或短期表现------AI引发的伤害可能在诊断或干预数月乃至数年后才显现,且难以追溯到最初的AI输出。S1-S4框架并非简单的性能评分,而是分别对应不同的验证、复核、随访和限制措施。
核心研究内容
问题定义
当前医疗AI的安全评价体系存在根本性缺陷。传统方法聚焦于模型的静态准确率和短期表现,但医学AI的风险具有滞后性、隐匿性和不可逆性。部分由AI算法偏差、数据偏见、场景适配缺陷导致的诊疗问题,不会在单次诊断或干预后立刻显现,可能在数月甚至数年后才以病情延误、过度诊疗、慢性病进展等形式暴露。更棘手的是,这类远期伤害链条冗长、影响因素繁杂,事后很难精准追溯至最初的AI决策输出。"暂未观察到伤害,并不足以证明系统安全"------这一认知构成了整个框架的逻辑起点。
创新方法
研究团队跳出传统"结果导向"的安全评价思维,构建了一套过程化、全周期、分级管控的S1-S4框架。其核心创新包括:
第一,将安全风险分级与临床工作流深度绑定。 框架借鉴了基于可判定性理论的R1-R3风险分类思路,将其转化为面向临床工作流的S1-S4分级。四个等级分别对应不同的验证、复核、随访和限制措施。
第二,提出"等级取决于部署方式而非模型本身"的核心判断。 S等级不是AI模型本身的固定属性,而是具体部署方式的安全标签。等级取决于AI承担的临床任务、所嵌入的工作流程、服务的患者群体、能否持续跟踪患者的后续情况,以及医生能否在采取行动前进行有效复核与干预。
第三,将医学AI的安全治理从"静态结果验收"升级为"全流程动态风控" ------从"事后追责补救"前置为"事前分级预判、事中动态监测、事后精准溯源"的全周期治理模式。
研究成果
研究团队提出了明确的S1-S4四级分类标准:
| 等级 | 定义 | 典型应用示例 | 主要安全策略 |
|---|---|---|---|
| S1 | 范围明确、可测试;错误通常可及时发现 | 输入/图像质量检查、结构化数据提取、心电伪影检测、影像报告、药物核对等辅助支持 | 上线前验证、外部验证、常规质控与定期审计 |
| S2 | 开放环境中可治理;行动前必须由临床人员复核 | 需医生签署的AI辅助决策、经医生复核的诊疗建议 | 强制复核、日志与漂移监测、明确停止规则 |
| S3 | 重要伤害可能延迟出现,安全取决于后续随访与结局 | 转诊优先级判定、肺结节或肿瘤随访建议、筛查类应用 | 限制性推广、结局链接、30/90/365天及必要时更长期监测 |
| S4 | 红线型高风险自主行动;伤害可能严重或不可逆 | 自主拒绝/延迟专科治疗、急诊分诊、自主决定高分流或出院 | 原则上禁止自主执行,或仅在例外审批和严格独立监督下使用 |
研究还提出了多时间窗部署后监测方案:
- 短期(数日至数周) :快速捕捉事件、近似失误和高风险输出信号
- 中期(数月) :按具体用途设置结局核查点,如30天、90天和365天
- 长期(超过12个月) :通过登记系统、医保或理赔数据链接以及实施后研究开展长期监测
实际落地应用的可能性
该框架的实用价值极高。研究团队以此前发表的DeepDR-LLM研究作为真实临床工作流示例:
DeepDR-LLM整合图像深度学习与大语言模型,用于基层糖尿病管理和糖尿病视网膜病变筛查。当系统仅提供经医生复核、编辑的决策支持时,可视为S2;当安全取决于患者是否完成眼科转诊及后续结局时,部署情境趋向S3;若AI输出绕过临床判断,被用于拒绝转诊、延迟专科诊疗或直接指导高风险治疗,则可能接近S4。
这个案例清晰地说明:同一项AI功能会因人类监督和后续照护条件不同而产生完全不同的安全要求。框架为医疗机构提供了明确的操作指引:供应商可提出初始S等级并提供相应证据,但部署医疗机构应承担最终治理责任。
技术细节
S1-S4框架的分级逻辑
四个等级的分级依据可从两个维度理解:
维度一:伤害显现的时间窗口
- S1:错误可被即时发现和纠正
- S2:伤害风险可在临床复核环节被拦截
- S3:伤害可能延迟出现,依赖长期随访才能发现
- S4:伤害可能严重或不可逆,一旦发生难以挽回
维度二:人类监督的程度
- S1:算法输出可直接使用(在限定范围内)
- S2:必须由临床医师审核后方可行动
- S3:需要链接后续随访和结局数据
- S4:原则上禁止自主执行,或需特殊保障措施
动态评估与重新分级机制
框架设计了明确的重新评估触发条件:
- 适用人群或应用场景扩大
- 放宽医生复核要求
- 转诊、医嘱或出院等决策转为自动执行
- 数据分布或系统性能发生明显变化
- 患者随访或治疗结果追踪不到位
- 险情或不良事件集中发生
- 供应商更新改变系统的预期用途或运行方式
临床负责人和AI治理委员会应有权缩小系统的适用范围、暂停使用、撤销相关更新或恢复到此前状态、重新分级,必要时禁止使用。
责任分工模型
- 供应商责任:提出初始S等级,提供预期用途、人工监督方案、审计日志、监测接口和模型更新证据
- 医疗机构责任:承担最终治理责任,通过本地AI治理委员会或同等监督机制在上线前确认等级
研究设定
研究类型
这是一篇观点文章(Perspective) ,发表于NEJM AI 2026年8月刊。其性质属于学术观点与框架提案,而非实证研究。
研究背景
文章面向的是医疗AI从研发试点走向常规临床应用的安全治理需求。随着AI医疗产品大量进入真实临床场景,缺乏统一的风险评判与管控依据已成为行业短板。
多机构协作
研究团队由多国多机构学者组成:
- 上海交通大学(盛斌)
- 清华大学(黄天荫、宋佳颖、吴嘉敏)
- 斯坦福大学(Nigam H. Shah)
- 伦敦国王学院(Josip Car)
- 新加坡国家眼科中心
与现有监管框架的关系
文章明确强调,S1-S4框架旨在补充而非替代现有监管体系,包括:
- 欧盟《人工智能法案》
- 国际医疗器械监管机构论坛(IMDRF)的软件医疗器械框架
- 美国FDA相关指南
- 美国国家标准与技术研究院(NIST)相关标准
- 世界卫生组织相关指南
综合分析
框架的理论贡献
S1-S4框架最深刻的洞见在于将安全从"模型的属性"重新定义为"部署方式的属性" 。这一转变具有范式层面的意义:
传统的AI安全评估遵循"模型中心主义"------训练一个模型,测量其准确率、敏感性、特异性等指标,达标即认为安全。但S1-S4框架指出,同一个模型在不同的部署场景中可能分属完全不同的安全等级。DeepDR-LLM的案例就是最好的证明:同一个系统,在医生复核场景下是S2,在依赖随访的场景下是S3,在绕过临床判断自主决策时则接近S4。
这意味着,监管不应只审核模型本身,更应审核部署方案------谁在使用、如何使用、在什么条件下使用、出了事谁能叫停。这实际上将AI安全治理的重心从"技术审核"转向了"系统治理"。
对"延迟伤害"问题的回应
框架对医疗AI特有的"延迟伤害"问题给出了系统性的回应方案。普通AI的风险通常是即时可见的------推荐错了内容、识别错了图像,用户可以立刻发现。但医疗AI的错误可能表现为"几个月后病情恶化""一年后癌症进展",而最初的AI输出早已被埋没在海量临床数据中。
S1-S3-S4的分级逻辑恰恰回应了这种时间维度的风险差异:
- S1处理的是"即时可见"的错误
- S2处理的是"临床复核可拦截"的风险
- S3专门针对"延迟显现"的伤害
- S4则划定"不可逆伤害"的红线
多时间窗监测方案(30天、90天、365天及更长)将这种时间维度的风险治理落到了操作层面。
框架的局限性
需要客观指出,该框架作为观点文章提出的概念框架,尚存在以下局限:
第一,缺乏实证验证。 框架目前停留在理论提案层面,尚未在大规模真实临床场景中得到系统验证。四个等级的分类标准在实际操作中如何界定边界、如何避免灰色地带,仍需进一步研究。
第二,实施成本不容忽视。 多时间窗监测、结局数据链接、本地AI治理委员会等机制对医疗机构的IT基础设施、数据治理能力和人力资源提出了较高要求。在资源有限的基层医疗机构,框架的落地可能面临现实困难。
第三,与现有监管体系的衔接细节尚不清晰。 虽然文章指出框架旨在补充而非替代现有监管,但具体如何与FDA的SaMD监管、欧盟AI法案的风险分级对接,仍需更多操作层面的阐释。
行业意义
尽管存在局限,该框架的行业价值不容低估。在医学AI加速落地的当下,研究团队构建的四级风险框架补齐了缺乏统一的风险评判与管控依据这一行业短板。它将"伤害何时显现、医生何时必须复核、何时需要链接随访结局、以及谁有权暂停或回滚系统"纳入同一套临床治理逻辑------这恰恰是当前医疗AI临床部署中最缺乏的系统性思考。
实践应用
对医疗机构的应用建议
1. 建立本地AI治理委员会
文章明确要求医疗机构承担最终治理责任。建议每家部署AI系统的医院建立跨学科的AI治理委员会,成员应包括临床医生、信息科人员、伦理委员会代表和患者安全专员。
2. 上线前完成S等级确认
在上线前,要求供应商提供初始S等级及相关证据,由本地治理委员会根据本院的工作流程、患者群体和随访能力进行复核和确认。不可直接采纳供应商的初始分级。
3. 建立分级管理制度
根据S1-S4等级制定差异化的管理流程:
- S1应用:常规质控与定期审计即可
- S2应用:必须嵌入强制临床复核环节,建立日志与漂移监测
- S3应用:限制性推广,建立结局链接和长期随访机制
- S4应用:原则上不予部署,或仅在例外审批和严格独立监督下使用
4. 设置重新评估触发机制
根据框架列出的七类触发情形,建立自动或半自动的重新评估流程。尤其关注应用场景扩大、医生复核要求放宽、数据分布变化等高风险信号。
5. 建立多时间窗监测体系
针对S3及以上等级的应用:
- 部署后数日至数周:快速捕捉不良事件和近似失误
- 30天、90天、365天:设置结局核查点
- 超过12个月:通过登记系统或医保数据进行长期追踪
对AI供应商的应用建议
1. 主动提出初始S等级
在产品交付时,应明确标注建议的S等级,并提供充分的依据。
2. 提供完整的监测接口
包括审计日志、API接口用于实时监测、模型更新记录等,便于医疗机构履行治理责任。
3. 明确预期用途和限制条件
清晰界定AI系统的适用范围、适用人群、使用场景和禁忌症,避免"适用范围模糊"导致的等级错配。
4. 建立版本更新与重新评估流程
当模型更新时,应主动通知部署机构并协助重新评估S等级,而非默认新版本沿用旧等级。
对监管机构的启示
S1-S4框架为监管提供了新的思路。建议监管机构考虑:
- 将部署方式纳入AI医疗器械的审批考量,而非仅审核模型本身
- 建立分级监管体系,对S3、S4级别的应用实施更严格的上市后监测要求
- 推动医疗机构建立AI治理委员会的制度化建设
- 完善延迟伤害的追溯和归因机制
参考资料
- 原始论文:A Classification of Safety Risks in Medical AI, NEJM AI, 2026. DOI: 10.1056/AIp2600358
- 论文链接:https://ai.nejm.org/doi/10.1056/AIp2600358
- 清华大学新闻报道:https://www.tsinghua.edu.cn/info/1175/127744.htm