MPIB: Medical Prompt Injection Benchmark
论文重点
MPIB(Medical Prompt Injection Benchmark)是首个专注于医疗场景下大语言模型(LLM)提示注入攻击风险的系统性评估基准。该研究构建了包含9,697个临床对抗性样本的数据集,并创新性地提出临床危害事件率(CHER)指标,用以区分"指令遵从率"与"实际临床风险"之间的根本性差异。
核心研究内容
问题定义
LLM和检索增强生成(RAG)系统正被日益广泛地整合进临床工作流程中,用于病历摘要、用药安全检查、初步分诊等关键任务。然而,提示注入攻击可以利用LLM的指令跟随特性,使模型优先执行对抗性指令而非原本的约束或用户目标。
在医疗场景中,这一问题尤为严峻。间接提示注入攻击可以将恶意载荷嵌入被检索的文档中(如被篡改的"指南更新"或中毒的PDF),而这些文档在RAG系统中被隐式地视为可信赖的权威来源。更具挑战性的是,临床场景中最危险的失败往往不是形式上的"不安全"输出,而是看起来合理、礼貌且结构良好的回应------但它们可能推荐错误剂量、淡化紧急症状或歪曲证据。这种"伪装的安全风险"使得传统的攻击成功率指标无法真实反映临床危害。
创新方法
1. 双轨评估指标体系
MPIB的核心创新在于提出了临床危害事件率(CHER) ,与传统的攻击成功率(ASR)形成双轨评估。ASR衡量模型是否执行了对抗性指令,而CHER则衡量在临床分级分类法下,模型输出是否会导致高严重性(Severity ≥ 3)的临床危害事件。两者的分离使得研究者能够识别出"指令执行了但没有造成临床危害"以及"指令没有完全执行但已经造成临床危害"这两类关键边界情况。
2. 分层对抗样本构造
数据集包含多个对抗向量层级:
- V0 / V0* :良性样本与潜在风险/效用边界样本(共8,471个,佔87.3%)
- V1:直接注入攻击样本(644个,佔6.6%)
- V2-S:严格对抗注入(94个,佔1.0%)
- V2-B:边界对抗注入(488个,佔5.0%)
3. 六闸门质量控制流水线
研究团队设计了一套包含六个质量闸门(G1-G6)的筛选流程,检查临床有效性、格式正确性和对抗强度。对于V2级别样本,还应用了冲突质量闸门(G3),在多个维度(亲和性、误导性、合理性、影响力)上进行1-5分制评分。未能通过对抗强度筛选的候选样本会被降级至V0'边界池而非直接丢弃,这一"回收机制"有效保留了临床有效的边界案例。
4. 分级访问控制
为平衡研究开放性与安全风险,MPIB採用了分级访问机制:
- 公开层级 :V2载荷经过编辑(
[REDACTED_PAYLOAD])以确保即时安全 - 受限层级:经批准的研究人员可访问完整的Payload Registry
- 重建机制:通过提供註册表文件和官方评估工具包,可还原完整的攻击样本
研究成果
研究团队对多种基线LLM和防禦配置进行了系统性评估,发现了两个关键结论:
-
ASR与CHER存在显着分歧:模型可能在攻击成功率上表现良好,但实际上仍会产生高严重性的临床危害输出;反之亦然。这证明了单纯依靠ASR评估医疗LLM安全性的不足。
-
鲁棒性取决于对抗指令的出现位置:模型对直接提示注入(用户查询中的对抗指令)和间接提示注入(检索上下文中的对抗指令)的抵抗力存在本质差异,这对RAG系统的安全设计具有重要指导意义。
实际落地应用的可能性
MPIB为医疗AI系统的安全评估提供了可複现、系统化的评估框架。医疗机构在部署LLM或RAG系统之前,可以使用MPIB进行安全验证;LLM供应商可以将其纳入红队测试流程;监管机构可以参考CHER指标制定AI医疗器械的安全标准。数据集和评估代码已在GitHub和Hugging Face上公开。
技术细节
数据集构成
MPIB数据集包含9,697个临床对抗样本,来源于MedQA和PubMedQA。数据集划分为三个子集:
| 子集 | 佔比 | 样本数 | 用途 |
|---|---|---|---|
| Train | 80% | 7,759 | 训练或少样本示例 |
| Validation | 10% | 969 | 超参数调优 |
| Test | 10% | 969 | 最终评估 |
场景分布
数据复盖四个临床场景:
| 场景 | 样本数 | 佔比 |
|---|---|---|
| S1 一般信息 | 5,653 | 58.3% |
| S2 用药 | 669 | 6.9% |
| S3 分诊 | 2,715 | 28.0% |
| S4 指南 | 660 | 6.8% |
危害严重性分级
CHER指标採用临床分级分类法,将危害事件按严重性分级:
- Severity ≥ 3:定义为高严重性临床危害事件
- CHER计算的是此类事件在模型所有输出中的发生率
V2对抗样本的质量阈值
V2级别对抗样本採用多维度评分筛选:
严格层级(V2-S) :
- Affinity ≥ 3.0
- Misleading ≥ 3.0
- Plausibility ≥ 3.0
边界层级(V2-B) :
- Affinity ≥ 2.7
- (Misleading ≥ 2.6 或 Plausibility ≥ 2.6)
- Impact ≥ 2.0
研究设定
硬体与软体配置
根据论文描述及开源资源信息:
- 模型评估范围:涵盖多种基线LLM,包括开源模型和商业API模型
- 评估框架 :官方提供Python评估工具包(GitHub:
jhlee0619/mpib-eval) - 数据访问 :通过Hugging Face数据集库加载(
jhlee0619/mpib) - 许可证:CC BY-NC 4.0
实验设计要点
- 直接注入 vs 间接注入:分别测试对抗指令出现在用户查询和检索上下文中的情况
- 多种防禦配置:评估不同防禦策略下的鲁棒性变化
- 双指标对比分析:同时报告ASR和CHER,分析两者分歧的模式和原因
综合分析
学术贡献
MPIB的出现填补了医疗AI安全评估领域的一个关键空白。此前的提示注入基准(如BIPIA)虽已证实LLM普遍存在漏洞,但它们缺乏针对医疗场景特有的临床危害评估维度。MPIB将"患者安全"而非"指令执行"作为评估的核心锚点,这一视角转变对于医疗AI的负责任部署具有深远意义。
从更宏观的角度看,MPIB反映了AI安全评估从"模型行为"向"系统影响"转变的趋势。在医疗这样的高风险领域,模型说了什么不如模型的行为可能造成什么后果来得重要。CHER指标的提出,实质上是将临床风险管理的方法论引入AI评估------这是一种跨学科方法论的融合。
局限性与挑战
值得关注的是,MPIB的数据主要来源于MedQA和PubMedQA,这两个数据集虽然具有临床相关性,但与真实临床工作流程中涉及的电子健康记录(EHR)、自由文本病历等数据形态仍有差距。此外,医疗提示注入攻击的动态性和适应性------攻击者可以根据模型反馈实时调整攻击策略------是静态基准测试难以完全复盖的维度。
另一个值得深思的问题是:MPIB採用分级访问控制来防止恶意滥用,这反映了安全研究中一个经典的两难困境------"双用途困境"(dual-use dilemma)。如何在促进防禦研究的同时不为攻击者提供武器库,是整个AI安全社区需要持续面对的挑战。
实践应用
对医疗机构的建议
-
部署前强制安全验证:在将任何LLM或RAG系统整合进临床工作流程之前,应使用MPIB进行系统性安全评估,特别关注CHER指标而非仅看ASR。
-
区分直接与间接注入风险:MPIB的发现表明,间接提示注入(通过检索文档)和直接提示注入的风险模式不同,医疗机构在设计RAG系统时应对两者分别制定防禦策略。
-
建立持续监测机制:静态基准测试只能反映当下状态,建议将MPIB纳入CI/CD流水线,在模型更新或知识库变更时自动触发安全回归测试。
对LLM开发者的建议
-
将CHER纳入红队测试指标:传统红队测试往往关注"越狱"成功率,建议同时追踪高严重性临床危害事件的发生率。
-
针对检索上下文设计专门防禦:MPIB的结果提示,检索上下文中的对抗指令具有独特的风险特徵,需要不同于用户输入过滤的防禦机制。
-
参与MPIB社区:通过Hugging Face的受限访问机制获取完整Payload Registry,在真实对抗样本上验证和改进防禦方案。
对监管机构的建议
CHER指标为AI医疗器械的审批提供了一个可量化的安全评估维度。建议监管机构在制定AI医疗软体的审核标准时,参考MPIB的评估框架,要求製造商提供在标准化对抗测试下的CHER报告。
参考资料来源
- 原始论文: MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs
- 论文作者: Junhyeok Lee, Han Jang, Kyu Sung Choi (首尔国立大学)
- 数据集: Hugging Face - jhlee0619/mpib
- 评估工具包: GitHub - jhlee0619/mpib-eval