Anthropic 2026年9月威胁情报报告:AI滥用安全风险总结

原文: Detecting and countering misuse of AI: September 2026

**报告覆盖:**Anthropic披露其在2025年12月至2026年8月间识别并处置的AI滥用案例,涉及Claude Haiku、Sonnet和Opus等模型。报告强调:以下是最具代表性和新颖性的案例,不代表全部滥用活动。

核心判断

AI安全风险正在从"模型会不会回答危险问题",升级为"攻击者能否把模型接入工具、账号、工作流和基础设施,形成持续运行的自动化系统"。最值得关注的变化是:攻击门槛下降、行动规模扩大、对抗迭代加快、归因更加困难,以及AI供应链本身成为攻击目标。

一、报告识别的主要安全风险

风险类别 主要表现 风险本质
AI增强网络攻击 自动侦察、漏洞研究、钓鱼、入侵、横向移动、凭证窃取、数据外传和恶意软件迭代。 AI从辅助工具变成网络攻击编排器,显著提高攻击速度、规模和深度。
监控与跨境压迫 社交媒体画像、异议人士监控、宗教与族群目标分析、恶意浏览器扩展、通信拦截和大规模情报平台。 AI把原本需要分析团队的监控、画像和报告生产能力压缩到少数人员甚至个人。
影响行动与舆论操纵 批量生成假新闻、虚假社交账号、伪装媒体、政治画像、选举操纵、冒充真实人物和叙事归因隐藏。 内容生产、账号运营和组织协同被自动化,虚假信息更低成本、更持续、更难识别。
诈骗与欺诈 批量搭建虚假交友应用、AI伪装人格、自动聊天、账号工厂、自动化注册和身份验证绕过。 AI提升诈骗的真实性、个性化和并发规模,人与机器人边界进一步模糊。
常规武器滥用 导弹制导、火控规格、无人机蜂群、目标识别、电子战和武器供应链情报。 AI降低武器软件研发、仿真和工程协同门槛,扩大高风险能力的可获得性。
生物风险 模型被用于复杂生物研究和潜在危险生物技术问题,前沿模型能力已使风险评估不再足够确定。 双重用途研究能力提升,安全边界需要从知识拒答扩展到能力与场景控制。
非法模型蒸馏 通过大量虚假账号、代理服务、被盗支付信息和自动化请求,批量提取模型回答、推理轨迹、编码和工具使用能力。 未经授权复制前沿模型能力,造成知识产权、模型安全和竞争秩序风险。

二、最值得关注的网络安全变化

2.1 攻击者的能力门槛明显下降

报告认为,AI正在压缩国家级团队与普通攻击者之间的技能和工具差距。过去需要多个专家协同完成的侦察、漏洞分析、代码开发、数据处理和攻击实施,现在可以由少量人员通过Agent框架并行推进。

因此,"攻击手法很复杂"不再能可靠代表攻击者一定是高水平组织。低资源攻击者也可能依靠AI形成持续、多目标和较深的攻击活动。

2.2 AI开始贯穿完整攻击链

典型流程已经覆盖:目标发现、系统指纹识别、基础设施搭建、钓鱼页面和邮件生成、凭证获取、横向移动、数据分类、外传以及恶意代码重构。AI不再只是回答问题,而是通过多Agent框架直接执行或编排任务。

2.3 攻防进入"检测---变形---再部署"的闭环

报告披露的一个关键变化是:攻击者让AI监控恶意软件是否被安全产品检测,一旦发现特征暴露,就自动修改、重编译和重新部署,直到规避检测。这会削弱单纯依赖静态特征和固定规则的防御体系。

2.4 AI供应链成为高价值攻击面

攻击者不仅攻击传统企业,也开始攻击AI厂商、代理服务、评测沙箱、模型中转站、代码仓库、容器、插件和集成应用,重点窃取API Key、Session Token、模型访问权限和生产环境凭证。

被盗AI凭证同时提供三种价值:可以出售的资产、由受害者承担费用的算力,以及隐藏真实攻击者身份的掩护。AI应用的代理层、沙箱、转售服务和自建网关因此都需要纳入供应链安全范围。

三、重点案例带来的安全启示

3.1 俄语背景网络间谍活动:自动化攻击和动态免杀

攻击者使用AI自动完成基础设施采购、钓鱼、持久化、命令控制和数据外传,并持续重构恶意软件以规避安全检测。其目标包括政府、外交、国防组织、无人机制造商和供应链企业,还通过酒店WiFi供应商、DNS劫持、设备码钓鱼和移动端恶意软件扩大攻击范围。

**启示:**需要同时防护直接攻击、第三方供应商、酒店和网络接入点、云身份、移动终端以及无人机等新型供应链,而不能只盯企业边界。

3.2 机会主义攻击:互联网暴露面和密钥泄露被规模化利用

攻击者使用AI大规模扫描未修复的互联网系统、公开容器、代码仓库、移动应用、网站和聊天机器人,寻找凭证、令牌和API Key,并针对不同环境自动调整利用方式。

启示:"安全通过隐蔽性"越来越不可靠。互联网暴露资产、公开代码、Docker镜像、移动安装包和AI应用配置都可能成为自动化采集入口。

3.3 账号工厂和模型蒸馏:自动化滥用需要身份治理

报告中多类活动都依赖虚假账号、被盗支付卡、代理服务和自动化注册。攻击者通过大量账号规避限流和检测,批量调用模型完成诈骗、内容操纵或能力提取。

**启示:**只在单个账号层面做风控不够,需要结合设备、网络、支付、调用行为、任务类型、请求相似度和账号关联图谱进行集群识别。

3.4 影响行动:AI成为"内容工厂"和"组织操作系统"

报告发现,影响行动不只让AI写文章,还让AI生成行动 doctrine、目标数据库、人物画像、编辑规则、账号角色、评价标准和批量发布流程。部分行动通过虚假媒体、社交账号、评论账号和真实媒体渠道进行多层扩散。

**启示:**治理对象应从单条内容真假扩展到账号网络、内容协同、传播节奏、身份伪装、来源归因和跨平台关联。

3.5 监控行动:AI替代分析团队和工程团队

报告披露,AI被用于构建大规模监控系统、身份数据库、社交网络分析、舆情简报、目标画像、恶意浏览器扩展和移动通信拦截平台。部分系统由单人或少数人员建设,却具备人口级监控能力。

**启示:**需要关注AI在身份画像、公共数据聚合、跨平台关联和自动化报告生成方面的滥用,尤其要重视非公开数据与公开信息拼接后的隐私风险。

3.6 武器开发:软件和模型能力成为高风险放大器

报告涉及导弹制导软件、火控规格、无人机蜂群、终端制导、目标识别和电子战软件等案例。部分活动使用仿真、硬件在环和真实开发板测试,说明风险不止停留在概念设计阶段。

**启示:**高风险领域安全评估不能只看模型是否输出危险文本,还要判断模型是否帮助用户完成了工程分解、代码实现、仿真验证、采购和实际部署。

3.7 生物滥用:能力评估不确定性上升

Anthropic表示,较早模型在危险生物研究上明显低于可实质帮助复杂研究的门槛,但新一代模型能够协助更多复杂科研任务,因此不能再对风险作出同样强的低风险判断,并对新模型采取更强保护。

**启示:**生物安全需要持续能力评测、领域专家参与、分层权限、查询场景识别和高风险请求升级处置,而不能依赖一次性安全测试。

四、安全方向建议:

  • 建设AI Agent滥用检测:识别自动化侦察、批量钓鱼、凭证窃取、漏洞研究、数据外传、账号工厂和模型蒸馏等行为模式。
  • 建设AI账号与调用风控:围绕账号、设备、IP、支付、API Key、Session Token、代理节点和调用行为建立风险画像与关联图谱。
  • 加强AI供应链安全:覆盖模型服务商、代理网关、评测沙箱、MCP、插件、代码仓库、容器、公开配置和第三方转售服务。
  • 把Agent安全从内容检测升级为任务和工具安全:关注模型是否在调用高风险工具、访问敏感数据或执行超出授权边界的连续动作。
  • 建立AI威胁情报能力:沉淀攻击者使用的账号集群、代理模式、提示词策略、基础设施、恶意工具、目标行业和行为链。
  • 建立动态对抗Benchmark:用攻击者"检测---变形---再部署"闭环验证产品的持续检测能力,而不是只用静态样本评估效果。

五、最终结论

AI安全防护正在从"模型安全"进入"AI系统和AI生态安全"阶段,AI滥用的组织方式发生了变化:攻击者正在把模型接入账号、工具、代码、网络和数据,构成可持续运行的自动化系统,由此可见,AI在带来创新的同时,也给安全带来了更大的挑战。

相关推荐
yu_zhidun1 小时前
终端安全DLP需求拆解与完整落地规划
安全·数据安全·域智盾·域智盾软件·企业终端dlp
域智盾系统来啦1 小时前
方案设计:文件生命周期管理安全建设需求拆解与落地方案
安全·域智盾软件·文件生命周期管理
jimmyleeee1 小时前
大模型安全之十七:RAG 系统中的数据安全与治理
人工智能·安全
马立杰1 小时前
Kali Linux 2026.2 新版APT源配置教程
安全·kali·软件源
2401_868534781 小时前
网络安全法规
安全·中间件
hz567892 小时前
视频会议私有化部署指南:架构、成本与实施流程详解
安全·音视频·实时音视频·信息与通信
每天题库2 小时前
塔式起重机安装拆卸工题库:安拆考点+模拟题+错题解析
学习·安全·考试·题库·考证
晨枫阳2 小时前
Client authentication(客户端授权)开关与OAuth2 PKCE的深刻理解
前端·安全
小程序设计14 小时前
某师范学院网络规划与设计
网络·安全