引言
AI 时代的拒绝服务攻击已发生根本性范式转移。传统 DoS 攻击目标是"瘫痪基础设施",而 AI 特有的"钱包拒绝服务"(Denial of Wallet)攻击目标是"耗尽预算"。攻击者无需压垮服务器,只需诱导模型生成最昂贵的输出,或盗用 API 密钥大规模调用付费接口,就能以极低成本造成毁灭性经济损失。OWASP 将此风险归类为 LLM10:无界消费(Unbounded Consumption) ,明确涵盖 DoS(拒绝服务)和 DoW(拒绝钱包)两种形态,详情可以参考:大模型安全之十:LLM无界消耗(Unbounded Consumption)-CSDN博客。
一、为什么 AI 让 DoS 攻击"换了剧本"
传统 DoS 攻击的逻辑很直接:用海量流量塞满带宽或耗尽计算容量。但 AI 服务的计费模式彻底改写了这个等式。每次 API 调用都直接产生费用,输入 token 和输出 token 的定价是不对称的------输出通常贵得多。GPT-4 Turbo 的输出定价约为输入的 3 倍,Claude 3 Opus 更是达到 5 倍。攻击者只需精心构造 prompt 让模型生成尽可能长的响应,就能在单一请求中制造几十甚至上百倍于普通请求的成本。
更危险的是隐蔽性。基础设施监控显示一切正常,延迟和可用性毫无异常,只有账单会在月底暴露异常。Sysdig 威胁研究团队估算,针对顶级模型的 LLMjacking 攻击,每个被入侵账户的日成本可达 46,000 美元 ,极端情况下超过 100,000 美元。
二、真实发生的 AI DoS 攻击事件
事件一:Gemini API 密钥被盗,48 小时烧掉 8.2 万美元
这是目前公开报道中最典型的"钱包型 DoS"真实案例。
2026 年 2 月,一家墨西哥三人创业团队遭遇毁灭性打击。他们的 Google Cloud API 密钥被未知攻击者获取,随后在 2 月 11 日至 12 日的 48 小时内,攻击者利用该密钥疯狂调用 Gemini 3 Pro 图像和文本接口。
结果:账单飙升至 82,314.44 美元 ,而这家公司正常的月均支出仅为 180 美元 ,涨幅约 455 倍。团队发现后立即删除泄露密钥、禁用 Gemini API、轮换所有凭证并启用 2FA,但 Google 援引"共享责任模型"表示账户安全由用户负责,暗示这笔费用可能仍需他们承担。团队负责人表示,如果 Google 要求支付哪怕三分之一,公司都会直接破产。
根源在于 Google Cloud 的设计缺陷:API 密钥默认设置为"Unrestricted"(无限制) ,一旦项目启用了 Gemini API,旧密钥会自动获得访问权限,用户不会收到任何显式警告。Truffle Security 的研究发现,2,863 个公开暴露的 Google API 密钥已具备访问 Gemini 的能力。
事件二:Sysdig 追踪的"LLMjacking"攻击
安全公司 Sysdig 的威胁研究团队追踪到系统性攻击:攻击者利用窃取的云凭证,在受害者 AWS Bedrock 账户上大规模运行 LLM 调用。Sysdig 将这种模式命名为 "LLMjacking" ,估算每个被入侵账户的最高日成本可达 46,000 美元。
在一次真实入侵中,攻击者从公开 S3 桶窃取凭证后,在不到 10 分钟内获得管理员权限 ,随后调用 Bedrock 上的 Claude、DeepSeek、Llama 等多个模型,并尝试启动 p4d.24xlarge GPU 实例(约 23,600 美元/月)用于资源滥用。攻击者甚至使用 LLM 生成的代码(含塞尔维亚语注释和幻觉 AWS 账户 ID)来自动化攻击流程,进一步降低了攻击门槛。
事件三:企业未设限额,单月 Claude 消耗 5 亿美元
这是一个"无攻击者的 DoS"案例,但机制完全相同。
2026 年 5 月,Axios 报道披露一家企业在短短一个月内,在 Anthropic 的 Claude 服务上产生了 5 亿美元 的账单。原因并非外部攻击,而是管理层在给员工开通账号权限时,忘记设置使用额度上限。
问题在"按 token 计费"与"全员无限制使用"的组合下迅速失控。工程师构建 agent 工作流或大规模代码生成时,单人每月就能产生数百到数千美元的成本。Microsoft 随后削减了内部 Claude Code 许可证,因为每位工程师的月均 AI 成本已升至 500 至 2,000 美元;Uber 则在 4 月就耗尽了 2026 年全年的 AI 预算。
三、AI DoS 攻击的核心原理
1. 成本不对称放大器
AI 推理的成本结构有一个根本特征:输出远比输入昂贵。攻击者的目标是让模型"说得多",而非"听得多"。一个几百 token 的输入,如果成功诱导模型生成 32,000 token 的输出,成本差异可达 50-100 倍。多会话并发可复合这种放大效应。
2. 上下文窗口填充与多轮累积
OWASP 的研究揭示了一个尤其隐蔽的攻击模式:在 agentic 会话中,攻击者或"正常用户"维持开放会话,逐步注入内容,使每一轮推理都需重新处理完整累积的上下文。每轮成本从第 1 轮的约 0.001 美元攀升到第 100 轮的约 0.50 美元,增幅达 500 倍。没有任何单次请求触发速率限制,因为每次都在预算内,但跨多个并发或长寿命会话的聚合成本可达数百美元。
3. 递归生成与 Agentic 放大
当 AI 系统具有自主推理能力,并将自身输出作为下一步输入时,攻击者可构造递归 prompt 使系统进入生成循环。在 agentic 系统中,一个请求可能级联为数十次 API 调用,每次调用都生成最大长度响应。OWASP 将此描述为"递归上下文扩展",攻击者构造的输入迫使 LLM 反复扩展和处理上下文窗口。
4. 检索增强推理成本攻击(RA-ICA)
这是一种更隐蔽的攻击方式,专门针对使用 RAG(检索增强生成)架构的 AI 系统。
攻击者不需要入侵系统,也不需要持有有效凭证。他们只需在 AI 信任的外部数据源------公开网页、知识库、博客、论坛------中植入一个"特制文档"。当 AI 为回答用户问题而检索到这个文档时,文档内容会诱导模型进行不必要的额外工作:生成更长响应、进行更多推理步骤、调用更多工具、或反复扩展上下文。
WWW 2026 会议发表的论文《Inference Cost Attacks for Retrieval-Augmented Large Language Models》提出了 CREEP 框架 (Computational Resource Exhaustion via External Poisoning),利用 LLM agent 自动生成既语义相关又能诱导 token 消耗异常增长的恶意文档。实验结果显示,RA-ICA 可将 token 消耗提升高达 13.12 倍,成功率超过 90%,且不降低生成答案的完整性。
这种攻击的危险性在于完全不可见:用户看到的回答是正确的,只是更慢、更贵;从可用性监控看服务完全正常;从单次请求看成本可能只比正常高几倍,不触发任何单请求预算告警。攻击者甚至可以一次污染多个系统------通过供应链或公共数据源。
5. 微调管道滥用
这是单项成本乘数最高的 AI DoS 攻击方式。
微调端点通常接受用户上传的数据集,然后启动一次昂贵的训练任务。与推理调用不同,微调任务的成本是批量、一次性、且难以中断的。一旦训练开始,计算资源就被锁定,费用持续累积直到任务完成或被人为终止。
攻击路径很直接:向微调端点提交一个超大尺寸的数据集 。在验证机制发现问题之前,这次训练可能已经消耗了数千美元的计算资源。Sysdig 追踪的攻击者尝试启动 p4d.24xlarge GPU 实例并运行训练脚本,就是这一攻击模式的真实体现。
6. 凭证盗用与 LLMjacking
这是当前最猖獗的攻击路径。攻击者通过钓鱼、数据泄露、漏洞利用或内部威胁获取 API 密钥或云凭证,然后以受害者名义大量调用 LLM 服务。Google 威胁情报团队指出,被盗的 AI 凭证正在地下市场形成繁荣的交易生态,犯罪分子购买这些凭证来执行自己的任务或转售给其他犯罪组织。
四、如何检测 AI DoS 攻击
检测的核心挑战在于:恶意请求和正常的高消费请求在内容层面难以区分。一个用户合法地要求生成详细报告,和一个攻击者诱导模型生成最大长度输出,发出的请求看起来可能完全一样。
因此检测策略必须从"内容审查"转向"行为与成本模式分析":
成本异常告警:基于机器学习的成本异常检测是最有效的手段之一。正常使用模式下,AI 服务的成本曲线相对稳定。攻击驱动的成本尖峰往往表现出异常特征:短时间内成本急剧上升、与请求量不成比例的增长、或超出历史基线多个标准差。有用户报告 Google 的 Cost Anomaly Detection 确实捕捉到了异常,但由于时差原因,醒来时账单已从 975 美元飙升至 18,596 美元。
Token 消耗速率监控 :单纯的请求频率限制不足以捕捉成本攻击。必须监控 token 消耗速率而非请求速率,关键指标包括每用户/每会话的累计 token 消耗、输出 token 与输入 token 的比率(攻击者会推高这个比率)、以及单位时间内的成本增长速率。
递归循环检测:对于 agentic AI 系统,需要监控代理的"步数"和"回环次数"。当代理开始反复处理自己的输出、或在多个模型调用之间形成可预测的循环模式时,应触发告警。OWASP 建议"限制排队动作的数量以及系统对 LLM 响应做出反应的总动作数"。
会话级累积成本追踪:单次请求可能完全在预算内,但跨多轮对话的累积成本可能迅速失控。必须对会话级别的累积 token 消耗进行追踪和限制。
五、预防与缓解框架
有效的 AI DoS 防御遵循"纵深防御"原则------确保没有任何单一控制点的失效会导致无限的财务风险。以下五层框架与 OWASP 的推荐实践高度一致。
第一层:成本感知的速率限制
传统速率限制(每用户、每 IP、每时间窗口的请求数)是必要的,但远远不够 。一个复杂的攻击者可以完全遵守请求频率限制,同时持续发送高成本请求。速率限制必须是成本感知的:不仅限制请求数量,还要限制单位时间内的 token 消耗量或预估成本。F5 AI Gateway 支持基于 JWT 或 header 的身份感知路由,可为不同用户组分配不同的访问级别和配额。
第二层:Token 预算强制执行
在三个级别上设置硬性预算上限:单次请求级别 (每个 API 调用分配最大 token 预算)、会话级别 (限制多轮对话中的累计消耗)、组织级别(计费周期内的总支出硬上限)。当任何预算耗尽时,后续请求应被降级到更低成本的模型或直接拒绝。OWASP 明确推荐"为每个 API 调用强制执行最大输出 token 限制,无论 prompt 要求什么"。
第三层:响应长度硬上限
无论 prompt 如何构造,应用层必须有一个不可绕过的输出长度上限。这确保即使最精心构造的 prompt 也无法生成超过上限的内容,直接缓解上下文窗口填充攻击。
第四层:凭证卫生与最小权限
避免硬编码凭证和 API 密钥;对所有云凭证实施最小权限原则;定期轮换密钥;对疑似泄露的凭证立即撤销。Google Cloud 用户应特别检查 API 密钥的 apiTargets 限制,避免"Unrestricted"默认设置导致的权限蔓延。TruffleHog 等开源工具可用于扫描代码、CI/CD 管道和 Web 资产中的泄露密钥。
第五层:断路器(Circuit Breaker)
这是最后一道防线。当支出超过定义的紧急阈值时,系统自动暂停非关键 AI 服务,直到人工操作员调查并授权恢复。断路器的作用不是防止初始攻击,而是限制攻击的最大财务损失。值得注意的是,Google Cloud 目前缺乏项目级别的自动支出上限,现有的预算警报只通知不阻止,这意味着用户必须自行构建断路器机制。
总结
AI DoS 攻击标志着安全威胁从"可用性破坏"向"经济性破坏"的范式转移。攻击者不再需要庞大的僵尸网络或高超的入侵技术------他们只需要一把泄露的 API 密钥,或者一个能最大化输出长度的 prompt,就足以让一家小公司在 48 小时内面临破产,让一家大企业在单月烧掉 5 亿美元。
从 Gemini 密钥盗刷到 LLMjacking,从 RA-ICA 到微调管道滥用,这些真实事件和攻击技术共同指向一个结论:AI 时代的成本控制不是事后审计,而是必须在应用层实时执行的防御性架构 。传统 DDoS 防护关注"流量入口",而 AI DoS 防御必须覆盖推理、检索、训练三个成本中心。没有多层成本护栏的 AI 部署,本质上是在向任何拿到密钥的人签发一张空白支票。