摘要 :大语言模型让机器能够生成答案,智能 Agent 则让模型能够围绕目标持续观察环境、制定计划、调用工具、改变系统状态并根据结果继续行动。能力从"输出文本"跨越到"执行动作"之后,网络安全同时出现了三条彼此缠绕的主线:用 Agent 提升检测、调查、响应和漏洞治理效率;防止 Agent 自身被提示注入、记忆投毒、工具滥用与身份劫持;以及建立一套能够约束机器身份、委托权限、工具调用和多 Agent 协作的治理控制面。本文从技术闭环、网络与安全架构、具体攻防案例、产品落地、评测方法和未来演进六个层次展开,重点说明一个常被营销话术掩盖的事实:Agent 的核心风险不在于它会说错话,而在于一个概率性的推理器可能借助真实凭证,对真实系统产生快速、连续且可累积的影响。 因此,可靠的安全边界必须位于模型之外,由确定性的身份、授权、策略、隔离、审计和停止机制共同构成。
关键词:智能 Agent;Agentic AI;网络安全;SOC;SIEM;SOAR;提示注入;MCP;A2A;身份与权限;安全运营;自主渗透测试
资料快照:2026 年 8 月 17 日。论文优先采用原始论文或会议页面,标准优先采用 NIST、MITRE、OWASP、IETF/协议项目等一手资料,产品状态优先采用厂商文档、正式公告与产品帮助中心。厂商披露的性能数字只用于说明其产品主张,不视为独立第三方复现结果。
0. 先给出结论:Agent 把"模型安全"升级成了"系统安全"
如果只把智能 Agent 理解为"更聪明的聊天机器人",后面的安全判断几乎一定会出错。聊天模型主要产生信息影响 :回答可能正确、错误、偏见或泄密;Agent 在此基础上增加了操作影响:它能够读取邮箱、查询日志、修改防火墙策略、隔离终端、创建云账号、提交代码、调用支付接口,甚至把任务委派给其他 Agent。
这意味着风险单位已经发生变化:
-
对话系统的基本风险单位通常是"一次输入 一次输出";
-
Agent 的基本风险单位是"一段有状态的行动轨迹(trajectory)";
-
多 Agent 系统的风险单位则可能是一张会传播信息、权限和错误的动态调用图。
因此,理解"智能 Agent 与网络安全"必须同时处理三个问题:
-
Agent for Security:如何用 Agent 进行告警研判、威胁狩猎、漏洞发现、检测工程和响应处置;
-
Security of Agents:如何保护模型、提示、检索、记忆、工具、凭证和 Agent 间通信;
-
Security Control Plane for Agents:如何为非人类主体建立身份、授权、策略执行、审计、问责和应急停止能力。

图 1 "用 Agent 做安全""保护 Agent""治理 Agent"不是三个孤立市场,而是一套系统的三个观察面。
本文的中心论断可以压缩为一句话:
Agent 是一个把不可信观察转化为有权限动作的闭环系统;安全设计的任务,是确保任何一次动作都不能仅凭模型的"自我判断"获得合法性。
1. 什么才算智能 Agent:不要被"Agent"标签带偏
1.1 从经典智能体到大模型智能体
"智能体"并不是大语言模型时代才出现的概念。在经典人工智能中,Agent 是一个能够感知环境并通过动作影响环境、以实现某种目标的实体。今天流行的 LLM Agent,只是把大模型放在了决策或规划环节,再用软件脚手架为它补上状态、工具、循环、异常处理和权限。
NIST 在 2025 年关于 Agent 工具使用的总结中,把当代主流 Agent 描述为:通用 AI 模型嵌入软件脚手架后,能够操作工具并采取超越文本输出的行动;同时指出工具风险要从功能、访问模式、可逆性、状态性、可靠性、监控能力和自主程度等多个维度理解。这个描述比"能调用函数就是 Agent"严格得多。NIST:Tool Use in Agent Systems
一个可操作的定义是:
智能 Agent 是一个围绕目标运行的有状态闭环:它接收观察,维护上下文或记忆,形成下一步计划,选择并调用工具,接收执行结果,再决定继续、回滚、求助或结束。
这里还要排除两个常见的同名概念:EDR 文档中的 endpoint agent 往往只是安装在终端上的采集与执行程序;HTTP 的 User-Agent 是客户端标识字段。它们可以成为智能 Agent 的传感器或工具,却不等同于本文讨论的目标驱动智能体。
若用简化的形式表示,在时刻 t:

其中 g 是目标,o_{\leq t} 是截至当前的观察,m_t 是记忆,p 是规则与提示,c_t 是工具、预算和权限等约束,a_t 是下一步动作。环境执行动作后得到新观察:

关键不在公式本身,而在两个性质:第一,动作是概率决策而不是传统程序的唯一确定分支;第二,动作会改变环境状态,而改变后的状态又成为下一轮推理的输入。因此,一个早期小误判可能经过多轮工具调用被放大。
1.2 自动化、Copilot 与 Agent 的分界
市场上最常见的概念混淆,是把任何"自然语言入口 + 工作流"都称为 Agent。更严谨的判断需要看四件事:系统能否自己分解目标、能否根据中间结果改变路径、能否自主选择工具、能否在某种边界内采取真实动作。

图 2 自主性不是开关,而是从固定脚本到受约束闭环的一条连续谱;产品名称本身不能证明其自主程度。
| 形态 | 路径如何产生 | 谁触发下一步 | 是否改变真实系统 | 典型安全要求 |
|---|---|---|---|---|
| 固定自动化 | 人预先写死条件与动作 | 事件或调度器 | 可以 | 代码审计、权限最小化、回滚 |
| Copilot / 助手 | 模型生成解释或建议 | 人 | 通常不直接改变 | 数据边界、幻觉校验、来源引用 |
| 工作流 Agent | 模型在允许的步骤间选择 | 人或事件 | 在预定义范围内 | 工具白名单、参数策略、审批门 |
| 自主 Agent | 模型分解任务并动态规划 | Agent 自身 | 可以连续改变 | 独立身份、确定性策略、预算、隔离、审计、停止 |
| 多 Agent 系统 | 多个角色协商、委派或竞争 | Agent 与编排器 | 影响可跨系统传播 | 消息认证、委派链、信任域、级联隔离 |
ReAct 展示了把"推理轨迹"和"行动"交替组织的通用范式;Toolformer 则研究模型如何学习何时、如何调用外部 API。这些工作解释了 Agent 为什么能把语言模型的知识与外部环境连接起来,但并不自动解决身份、权限或可信执行问题。ReAct 原始论文;Toolformer 原始论文
1.3 一个 Agent 实际由哪些部分组成
一个生产级 Agent 通常至少包含下列组件:
-
目标与任务入口:用户请求、告警事件、定时任务或其他 Agent 的委派;
-
模型与规划器:理解目标、形成假设、选择下一步行动;
-
工作记忆:当前会话、行动历史、临时证据和中间结论;
-
长期记忆 / RAG:知识库、历史案例、用户偏好、组织策略、资产语义;
-
工具注册表:API、数据库、浏览器、命令行、代码执行器、SIEM、EDR、IAM 等能力描述;
-
编排器与运行时:循环控制、重试、超时、并发、错误处理、模型切换;
-
身份与凭证:Agent 身份、调用者身份、短期令牌、服务账号或委托链;
-
策略执行点:对工具、参数、数据范围和高风险动作作确定性校验;
-
观察与审计:记录提示、检索、计划、工具参数、返回值、决策和最终效果;
-
人类控制:审批、拒绝、修改、接管、回滚和紧急停止。

图 3 模型只是 Agent 的"推理器"之一。真正决定系统风险的是它能看见什么、记住什么、以谁的身份调用什么工具,以及外部控制是否能约束动作。
这也解释了为什么"更安全的模型"不等于"更安全的 Agent"。即使模型从不主动生成恶意内容,仍可能因为外部网页中的隐藏指令、被污染的知识库、模糊的工具描述或过宽的 OAuth 令牌而执行错误动作。
1.4 MCP 与 A2A:连接能力的协议化
Agent 生态正把两类连接标准化:
-
Agent---工具连接:Model Context Protocol(MCP)让工具、资源和提示以统一方式暴露给客户端;
-
Agent---Agent 连接:Agent2Agent(A2A)关注 Agent 发现、能力描述、任务委派、消息与结果交换。
协议统一降低了集成成本,也降低了攻击者寻找通用入口的成本。现行 MCP 授权规范(2025-11-25)明确:授权总体上是可选能力,但使用 HTTP 传输时应遵循该规范;其机制建立在 OAuth 2.1 授权框架、受保护资源元数据与授权服务器元数据等标准之上。因而,"支持 MCP"不等于已经具备强身份、细粒度授权、工具来源验证或安全的默认配置;落地时还应采用 OAuth 安全最佳实践,例如精确重定向 URI、PKCE、受众限制、短期令牌和防止令牌重放。MCP 授权规范;RFC 9700:OAuth 2.0 Security Best Current Practice A2A 项目则进入 Linux Foundation 治理,目标是跨厂商 Agent 的安全互操作,但实际部署仍需自行解决身份联合、消息完整性、委派范围与审计关联。Linux Foundation A2A 项目
协议回答的是"如何互通",不是"是否应该允许这次动作"。后者仍然属于安全策略。
2. 为什么网络安全天然适合 Agent,也天然难以完全自治
2.1 安全运营本来就是一个"观察---假设---验证---处置"循环
安全分析员面对告警时,通常不会只执行一次分类,而会不断迭代:查看进程树,核对登录来源,查询 DNS 与代理日志,检查同一账号的横向活动,提取文件哈希,关联威胁情报,评估业务影响,最后决定忽略、升级、隔离或封禁。这个过程与 Agent 的闭环结构高度同构。
网络安全还有三个有利条件:
-
大量输入已经是机器可读的日志、图谱、规则和 API;
-
许多任务具有可复用的调查套路,但具体路径依证据变化;
-
工具丰富且高度碎片化,Agent 能承担跨产品的"语义编排层"。
然而,安全领域也具有最不利于盲目自治的条件:对手会主动欺骗;真实攻击在总体事件中稀少;环境不断变化;错误隔离可能中断核心业务;证据链和问责要求高;某些动作不可逆。
因此,网络安全不是"最容易让 Agent 替代人的领域",而是最容易产生 Agent 价值、也最需要边界工程的领域。
2.2 先区分网络的三个平面,再理解安全分析与执行层
传统网络工程通常区分:数据平面 负责转发包和处理业务流量;控制平面 通过 BGP、OSPF、SDN 控制器等学习拓扑、计算路径和生成转发表;管理平面通过 CLI、NETCONF/RESTCONF、厂商 API 或控制台进行配置、监控和变更。安全 Agent 一般不是路由协议的一部分,也不会取代路由器的高速转发芯片;它更多通过管理 API 读取状态、提出变更或调用防火墙、IAM、EDR 等控制能力。
在此基础上,从企业安全系统的工作流还可以抽象出三个横向层。注意,这是为了分析安全闭环而使用的工程抽象,不是另一套网络标准平面:
-
数据平面:终端进程、网络包、DNS、身份登录、云审计、应用请求、数据库访问等真实活动;
-
分析平面:采集、规范化、关联、检测、资产图谱、威胁情报、SIEM/XDR/数据湖;
-
执行与响应层:防火墙、路由与微隔离策略、EDR 隔离、IAM 禁用、密钥吊销、工单、备份与恢复。
Agent 处于分析层之上,却可能通过管理与自动化接口触达网络控制和各类响应系统。它的价值来自跨域关联,它的危险也来自跨域权限。

图 4 Agent 不直接"看见网络",而是通过传感器和平台获得经过采集、抽取与关联的观察;它也不应直接拥有设备万能权限,而应通过策略化控制面执行动作。
例如,"隔离一台疑似被控主机"表面上只是一个 EDR API 调用,实际可能同时涉及:
-
该主机是否是域控制器、数据库或医疗设备;
-
是否存在高可用副本;
-
当前会话属于攻击者还是值班管理员;
-
隔离是否会切断取证证据或触发攻击者破坏;
-
该动作是否落在 Agent 的业务范围、维护窗口和审批权限内。
模型可以帮助综合这些上下文,但最终的允许/拒绝条件应由模型外的策略系统执行。
2.3 Agent 的安全价值来自"闭环压缩",不是来自聊天界面
衡量 Agent 是否真正改变安全运营,应观察它压缩了多少闭环,而不是生成了多少自然语言。一个实际闭环可以分为:

传统生成式助手通常减少 T_{investigate} 中的查询编写和报告时间;成熟 Agent 还可能减少排队、跨工具切换、证据收集与执行验证时间。但若它增加大量误报、审批疲劳或返工,表面上的"秒级研判"并不等于总体风险下降。
这也是后文评测必须同时计算任务成功率、错误动作成本和人类监督成本的原因。
3. Agent 用于网络安全:从告警研判到漏洞修复
3.1 场景一:SOC 告警分诊与事件调查
这是当前最成熟、产品最集中的场景。下面用一个具体事件说明 Agent 到底做了什么。
事件背景
某企业的身份平台在凌晨 02:13 产生"异常 OAuth 应用授权"告警:员工账号 lin.chen 为一个新应用授予了读取邮件与文件的权限。单看告警,它可能是员工正常安装插件,也可能是钓鱼后的持久化。
一个受约束的调查 Agent 可以执行如下轨迹:
-
从 SIEM 读取告警、账号、源 IP、设备与授权范围;
-
查询身份平台近 24 小时登录,发现同一账号先在新加坡正常登录,7 分钟后从匿名代理出口登录;
-
查询终端 EDR,发现员工设备没有对应浏览器会话,削弱"本人操作"假设;
-
查询邮件审计,发现授权前 4 分钟用户点击了伪造共享文档链接;
-
查询 SaaS 审计,发现新应用在授权后批量枚举邮箱文件夹;
-
形成"OAuth 同意钓鱼---令牌滥用"的证据链并给出置信度;
-
策略引擎判断"吊销该应用令牌"可自动执行,"禁用员工账号"需人工批准;
-
自动吊销恶意令牌、封禁应用 ID、保留证据并创建事件单;
-
等待分析员批准账号重置;批准后执行,并核验后续访问已停止。

图 5 高质量 Agent 调查不是"一次问答",而是带假设、反证、策略检查、执行回执和人工升级的证据闭环。
这里有四个容易忽视的工程要点:
第一,Agent 必须区分事实、推断和建议。 "日志显示源 IP 属于代理网络"是事实;"账号已被攻陷"是推断;"禁用账号"是建议。三者混在一段流畅文字中,会造成过度信任。
第二,调查应允许寻找反证。 如果 Agent 只搜集支持初始告警的证据,就会自动化确认偏误。应显式提出相互竞争的假设,并给每个假设设计可证伪查询。
第三,动作权限按影响拆分。 读取日志、标记告警、吊销单个第三方应用令牌、禁用账号、隔离生产主机的影响不同,不能共享一个"响应权限"。
第四,执行之后必须验证。 API 返回 200 只证明请求被接受,不证明威胁停止。Agent 需要查询令牌状态、后续登录和数据访问,确认控制实际生效。
3.2 场景二:威胁狩猎与检测工程
传统检测工程把威胁情报和攻击技术转化为 Sigma、YARA、KQL、SPL、SQL 或厂商规则,通常经历阅读情报、映射 ATT&CK、寻找可观测事件、写查询、回放数据、分析误报、灰度上线、持续调优。
Agent 可以把这条链路连接起来:
-
从一份威胁报告提取 TTP,而不只提取易失效的 IOC;
-
依据企业真实日志模式判断哪些行为可见;
-
生成候选检测规则和对应的单元测试;
-
在历史数据或合成事件上回放,计算召回与噪声;
-
发现字段缺失时,反向提出遥测改进;
-
将规则送入评审,而不是直接在全网生产环境启用;
-
上线后观察告警质量并建议调整。

图 6 检测规则不是"生成即完成";真正的闭环包含可观测性验证、回放、评审、灰度、监控与退役。
Google 在 2025 年公布的 Emerging Threats Center 把威胁情报、合成事件和检测工程连接起来;截至 2026 年 6 月,Google 官方将 Detection Engineering Agent 标为 preview,将 Triage and Investigation Agent 标为 generally available。两者状态不能混写。这类能力的实际价值仍取决于客户数据质量、字段规范和回放环境,而不只取决于模型能力。Google 2026 状态说明
3.3 场景三:威胁狩猎
威胁狩猎与告警调查不同:它往往没有一个高质量告警作为起点,而是从"环境中是否存在某类隐蔽行为"出发,在海量数据中主动寻找弱信号。Agent 能够迭代写查询、解释空结果、扩大时间窗、关联实体和调整假设,因此很适合做分析员的并行研究助手。
但开放式狩猎也暴露了当前能力上限。2026 年的 Cyber Defense Benchmark 预印本把 106 个真实攻击过程包装为大规模 Windows 日志狩猎任务;在作者测试中,最佳模型平均只正确标记 3.8% 的恶意事件,没有模型达到作者定义的无人值守门槛。另一项 2026 年 SecRespond 预印本让 Agent 分析受入侵主机快照,结果显示模型较擅长跟随现有告警,却难以主动发现"静默"入侵,也没有模型在任何单一靶场上完成全部发现与修复。它们不是对所有产品的最终裁决,却提醒我们:在有明确线索的调查任务上表现出色,不等于能够在开放环境中自主发现未知威胁。 Cyber Defense Benchmark;SecRespond
3.4 场景四:漏洞发现、代码审计与修复
软件安全非常适合 Agent 化,因为任务可以在相对隔离的代码与测试环境中循环:理解仓库、定位输入边界、生成测试、运行模糊测试、分析崩溃、验证可利用性、生成补丁、执行回归测试。
Google Project Zero 与 Google DeepMind 的 Big Sleep 是一个有代表性的研究系统。Project Zero 在 2024 年披露,Big Sleep 在 SQLite 中发现了一个此前未知、可利用的栈缓冲区下溢,问题在进入正式发布前被修复。这个案例的重要性不在"AI 替代了漏洞研究员",而在于 Agent 能够跨越代码阅读、差异分析、假设生成与验证几个步骤,形成真实漏洞发现闭环。Google Project Zero 原始披露
DARPA 的 AI Cyber Challenge(AIxCC)则要求参赛的 Cyber Reasoning Systems 自动发现并修补支撑关键基础设施的开源软件漏洞,并将决赛系统开源。DARPA 公布的决赛汇总显示:参赛系统合计分析了超过 5,400 万行代码,在 63 个合成漏洞挑战中发现 54 个、修补 43 个;另发现 18 个非合成真实漏洞并提供 11 个补丁,平均每个竞赛任务约 152 美元、平均 45 分钟提交补丁。这是比单次 Demo 更强的受控竞赛证据,但不能直接外推为生产代码可无人审查自动合并。DARPA AIxCC 官方结果
这类 Agent 上线时至少要有四层隔离:
-
在一次性沙箱或微虚拟机内编译和运行不可信代码;
-
默认关闭生产凭证与不必要的外网出口;
-
补丁必须经过测试、代码评审和软件供应链签名;
-
漏洞验证必须限定在明确授权的仓库、资产与时间窗。
3.5 场景五:暴露面、云安全与身份治理
云环境的风险往往不是一个孤立漏洞,而是资产、身份、网络路径、数据敏感度与配置错误叠加形成的攻击路径。例如:公网函数存在 SSRF,函数角色能读取密钥,密钥又能访问生产数据库。Agent 可以在攻击图上做多步推理,把数千个单点发现收敛为少量"真正可达、影响关键资产"的路径,并生成分阶段修复方案。
身份治理同样适合受约束 Agent:发现闲置服务账号、分析过度权限、模拟撤权影响、提出最小权限策略、跟踪审批与验证。但身份是所有其他动作的根,Agent 不能一边评估权限、一边以全局管理员身份无条件修改权限;必须将"分析者""建议者""执行者"和"批准者"分离。
3.6 场景六:网络运维与安全联动
在路由器、交换机、防火墙、SD-WAN、零信任网关和云网络组成的环境中,Agent 可以把自然语言意图转换为拓扑查询、变更计划和验证步骤,例如:
"仅允许支付服务在未来两小时访问灾备数据库 5432 端口,其他路径不变;如果错误率上升则回滚。"
一个安全的网络 Agent 不应直接生成并下发 ACL,而应完成:识别源/目的工作负载身份 → 计算现有路径 → 检查路由与安全组冲突 → 在数字孪生或配置检查器中模拟 → 生成最小差异 → 经过变更审批 → 灰度下发 → 监测连通性与业务指标 → 必要时回滚。
这说明 Agent 并没有消灭网络分层。DNS、BGP/OSPF、路由表、NAT、TLS、HTTP、身份代理和防火墙仍按各自协议工作;Agent 只是成为上层的意图解释与编排者。越接近路由、访问控制和生产变更,确定性验证越重要。
3.7 其他已经落地或快速发展的场景
| 场景 | Agent 可承担的工作 | 适合自动化的部分 | 应保留强审批的部分 |
|---|---|---|---|
| 钓鱼邮件 | 解析头部、URL、附件、沙箱、相似活动 | 聚类、取证、删除已确认恶意邮件 | 全域封禁、外部通报 |
| 恶意软件分析 | 静态/动态行为、解包、IOC 与能力总结 | 样本运行、证据汇总、规则草拟 | 在生产网络主动交互 |
| 数据安全 | 数据发现、分类、异常访问关联 | 标签建议、低风险策略校验 | 批量改变数据权限或删除 |
| 欺诈与滥用 | 关联账号、设备、交易和图关系 | 风险排序、补充验证 | 冻结资金、永久封号 |
| 合规 | 控制证据收集、差距映射、报告草拟 | 证据拉取、持续检查 | 法律结论、合规签字 |
| 事件响应 | 时间线、范围、根因与修复编排 | 证据收集、低风险遏制 | 生产隔离、密钥轮换、对外披露 |
4. 攻防两用:Agent 会如何改变攻击链
4.1 它首先降低的是"组织成本"
网络攻击从来不是一次模型回答,而是一条链:侦察资产、筛选入口、构造诱饵、获得执行、维持访问、提升权限、横向移动、收集并外传数据。大模型已经能辅助其中很多单点任务;Agent 的新增价值,是把这些步骤组织成能根据反馈继续运行的流程。

图 7 同一种规划、工具调用和反馈能力可以服务于攻击或防御;差异不在模型"懂不懂安全",而在授权、目标、工具、数据和执行边界。
对攻击者而言,Agent 可能降低:
-
资产枚举与信息归并的人工成本;
-
针对不同目标生成和迭代社会工程内容的成本;
-
把公开漏洞信息改写为环境特定验证脚本的成本;
-
多台主机、多种工具间持续跟踪状态的成本;
-
对低价值目标进行大规模试错的边际成本。
但"成本下降"不应被夸张成"Agent 已能稳定自主攻破任何网络"。真实攻击仍受到漏洞可用性、环境差异、权限隔离、终端检测、网络分段与操作安全的限制。2026 年 Google Threat Intelligence Group 的分析仍把现实中的主要模式描述为 AI 增强的研究、侦察、漏洞利用支持和初始访问,而不是完全无人参与的端到端高级攻击。Google Threat Intelligence 官方分析
4.2 自主渗透测试的价值与边界
自主渗透测试 Agent 能够协调扫描器、浏览器、HTTP 客户端、代码执行器和验证器,对明确授权的应用进行连续测试。XBOW 等厂商已经把"协调 Agent + 多个专用 Agent + 独立验证器"作为商业平台架构,并提供按需渗透测试服务。XBOW 平台;Pentest On-Demand 官方说明
这种系统比传统扫描器更可能理解业务流程和多步漏洞,但风险也更高:
-
"验证 SQL 注入"可能意外读取或修改真实数据;
-
自动注册、发信、上传文件可能影响真实用户;
-
速率失控可能造成拒绝服务;
-
发现邻接资产后继续探索,可能越过授权边界;
-
生成的利用链若被日志、记忆或报告系统泄露,会变成攻击材料。
因此,一份安全的授权不仅要列出域名,还要描述允许的方法、数据处理、并发与速率、禁止的业务动作、测试时间、停止条件和证据保管。自主性越高,授权书越要机器可执行,而不能只是一段模糊的自然语言。
4.3 防守者的结构性优势与新压力
防守者拥有攻击者通常没有的四种资源:完整资产与身份上下文、历史遥测、合法控制面和组织授权。Agent 若能安全利用这些资源,可以在检测后立即验证和遏制,形成机器速度的闭环。
反过来,防守者也面临更高压力:攻击尝试数量增加、内容更个性化、工具链迭代更快,传统依靠人工排队的 SOC 更难跟上。未来竞争的关键并不是"谁的模型参数更多",而是谁能形成质量更高的数据闭环、权限边界、验证机制和人机协作流程。
双重用途说明:本文讨论攻击链是为了威胁建模和防御设计,不构成对未授权入侵的操作指导。任何扫描、漏洞验证、凭证测试和利用行为都必须在资产所有者明确授权的范围内进行。
5. Agent 自身的攻击面:从提示注入到身份滥用
5.1 为什么传统应用安全仍然必要,但已经不够
Agent 仍是软件系统,因此 SQL 注入、SSRF、命令注入、依赖投毒、会话劫持、越权、密钥泄露和供应链风险一个都没有消失。新增问题是:自然语言、检索内容和工具返回值既是"数据",又可能被模型当成"指令";Agent 还可能把一次错误理解扩展成多个真实动作。
AWS 在回应 NIST Agent 安全议题时给出的原则值得重视:传统安全控制继续适用;最重要的扩展,是把确定性的基础设施级控制放在 Agent 推理循环之外,因为 LLM 是概率推理器而不是安全执行机制。AWS:Four Security Principles for Agentic AI Systems

图 8 攻击面贯穿输入、模型、记忆、工具、身份、协议、运行时、人类界面和供应链;只过滤用户提示无法覆盖整条链。
5.2 OWASP Agentic Top 10:十类风险如何形成一条因果链
OWASP 于 2025 年 12 月发布《Top 10 for Agentic Applications 2026》,由 100 多名研究者和从业者参与评审。它不是法规或最终标准,而是一套适合威胁建模的共享词汇。OWASP 官方发布页

图 9 十类风险可归入"意图与状态""能力与权限""生态与交互""系统与人"四层;实际事故通常跨越多类。
| 编号 | 风险 | 核心问题 | 典型控制 |
|---|---|---|---|
| ASI01 | Agent Goal Hijack | 不可信内容改变 Agent 的目标或优先级 | 数据/指令分离、行动归因、外部策略 |
| ASI02 | Tool Misuse & Exploitation | 合法工具被以错误参数、顺序或目的调用 | 工具最小化、参数级策略、语义约束 |
| ASI03 | Identity & Privilege Abuse | Agent、用户与服务身份混用或权限过宽 | 独立身份、委托链、短期令牌、最小权限 |
| ASI04 | Agentic Supply Chain Vulnerabilities | 模型、Skill、插件、MCP 服务或依赖被替换 | 签名清单、来源验证、SBOM/AIBOM、准入 |
| ASI05 | Unexpected Code Execution | 自然语言或工具输出进入代码执行路径 | 沙箱、无密钥执行、网络出口控制 |
| ASI06 | Memory & Context Poisoning | 恶意内容持久化并影响后续会话 | 来源标记、可信分区、TTL、写入审批 |
| ASI07 | Insecure Inter-Agent Communication | 消息伪造、重放、越权委派或信任传染 | 双向认证、签名、nonce、能力令牌 |
| ASI08 | Cascading Failures | 一个错误经自动化与多 Agent 链路放大 | 步数/成本/影响预算、熔断、隔离域 |
| ASI09 | Human-Agent Trust Exploitation | 流畅解释或伪造摘要诱导人批准 | 展示原始动作、独立风险提示、双人审批 |
| ASI10 | Rogue Agents | 被攻陷或偏离目标的 Agent 持续有害行动 | 行为基线、不可篡改审计、撤权、停止开关 |
Top 10 不应被当作十个独立复选框。一个真实链路可能是:恶意网页触发目标劫持(ASI01)→ Agent 滥用邮件工具(ASI02)→ 依靠过宽 OAuth 权限读取秘密(ASI03)→ 把攻击指令写入长期记忆(ASI06)→ 再向其他 Agent 传播(ASI07)→ 形成级联影响(ASI08)。
5.3 间接提示注入:最典型的"数据变指令"
直接提示注入来自用户,例如"忽略之前的规则"。间接提示注入则埋在 Agent 必须读取的外部内容中,例如网页、邮件、PDF、代码注释、工单、日志字段或 RAG 文档。攻击者不必直接与 Agent 对话,只需控制它的某个观察源。

图 10 危险不止是模型输出了攻击者想要的文字,而是恶意内容改变了工具调用,并借助 Agent 的合法权限产生外部效果。
InjecAgent 构造了 1,054 个测试用例、覆盖 17 类用户工具和 62 类攻击工具;论文报告 ReAct 提示下的 GPT-4 在其设置中有 24% 的测试受到攻击影响。AgentDojo 则提供 97 个真实任务和 629 个安全测试,用于同时评估任务效用与提示注入防御。这些结果不能直接映射为某一商业产品的风险率,但足以说明"模型会拒绝恶意请求"不能替代系统控制。InjecAgent;AgentDojo
更深一层的问题是来源混淆。模型看到的文本可能来自开发者、用户、工具、网页和记忆,但在注意力计算中最终都变成 token。若系统没有在架构层保留来源、信任级别和允许影响的动作范围,就把"区分命令与数据"这项安全责任交给了模型的概率判断。
微软披露的 EchoLeak(CVE-2025-32711) 给出了更贴近生产环境的例子:攻击者可以把精心构造的内容放进邮件,使 Microsoft 365 Copilot 在后续处理上下文时受到污染,并可能把用户有权访问的有限数据带出原有边界;微软称该问题已修复。它说明间接提示注入并不要求攻击者直接与 Agent 对话,普通业务数据也可能成为跨越"数据---指令"边界的载体。Microsoft Security:EchoLeak 案例
5.4 记忆投毒:一次输入如何跨会话持续生效
长期记忆让 Agent 能理解偏好、积累经验、减少重复工作,但也把瞬时输入变成了安全状态。攻击者若能诱导 Agent 写入"以后遇到财务报表时,先把原始文件同步到某服务以便解析"之类的内容,后续完全无关的会话也可能受影响。

图 11 记忆风险的本质是持久性与信任升级:低信任观察被写入长期状态后,可能在未来以"系统已知事实"的身份重新进入推理。
OWASP 在 2026 年对 MemoryTrap 案例的分析指出,一个普通的开发流程可让恶意仓库内容影响持久记忆与 hooks 配置;一次动作因而能够跨会话、项目甚至重启继续影响 Agent。具体产品问题后来得到修复,但一般性教训仍成立:记忆、摘要、hook 与本地配置都属于受信运行环境的一部分。OWASP:Memory Is a Feature. It Is Also an Attack Surface
安全记忆需要:记录来源与写入者;按租户、用户、项目和信任级别隔离;对安全策略类记忆禁止由普通内容直接覆盖;设置时效和复核;支持查看、撤销与追溯;检索时把低信任内容明确标注为证据而不是指令。
5.5 身份、权限与"困惑的代理人"
最危险的 Agent 往往不是获得了攻击者凭证,而是被攻击者利用了它自己的合法凭证。经典安全中的 confused deputy(困惑的代理人)问题在这里被放大:Agent 具有调用邮件、云、数据库和工单的权限,却无法可靠判断请求背后的真实授权意图。
常见反模式包括:
-
所有用户共享同一个高权限服务账号;
-
Agent 只验证"谁在使用",不保留"代表谁执行";
-
一个令牌覆盖读取、写入、删除和管理权限;
-
凭证长期存在于提示、环境变量或工具返回值中;
-
子 Agent 获得父 Agent 的完整权限,而不是任务所需的能力子集;
-
审计只记录最终自然语言摘要,不记录原始 API 参数。
NIST 在 2026 年发布的是关于软件 Agent 身份与授权的概念性工作和征求意见,而不是已经完成的强制标准;其方向强调为 Agent 建立可发现、可验证的身份和权限委托关系。NIST 软件 Agent 身份与授权概念文件说明 在实践中,最重要的是形成完整链条:人类/服务主体 → 委托给 Agent 的目标与范围 → Agent 自身工作负载身份 → 某次工具调用的短期能力 → 资源端的确定性授权判断。
5.6 工具、Skill 与 MCP 供应链
传统软件供应链管理依赖包名、版本、哈希、签名和 SBOM。Agent 供应链进一步包含:模型、系统提示、工具描述、Skill 文档、MCP 服务、A2A 能力卡、知识库、嵌入模型和外部 API。
一段 Skill 文档可能看起来只是说明文字,却会改变 Agent 的行动策略;一个 MCP 服务器可能声明"查询库存",实际返回带隐藏指令的内容或暴露额外工具;同名工具更新后可能改变参数语义。MITRE 对 OpenClaw 生态的分析就强调了第三方技能以 Agent 完整权限运行、持久记忆写入和来自网页/消息/技能的间接提示注入风险。MITRE ATLAS OpenClaw Investigation
因此,工具接入需要类似应用商店与零信任网关的组合:来源验证、版本锁定、签名、权限清单、静态与动态审查、沙箱测试、参数模式、网络目标限制、变更告警和一键吊销。
5.7 多 Agent 通信与级联失败
多 Agent 系统把一个复杂任务拆成侦察、分析、执行、验证等角色,可以提升并行性和专业化,但也引入新的信任边:
-
一个 Agent 是否能确认消息来自真正的另一个 Agent;
-
委派是否可继续转委派;
-
接收方是否知道原始用户与授权范围;
-
是否能防止旧消息重放;
-
一个 Agent 的"结论"被下游当成事实还是待验证证据;
-
当多个 Agent 互相引用时,如何避免错误共识与循环调用。
多 Agent 不能以"互相投票"代替独立证据。若多个角色共享同一模型、同一污染知识库和同一错误工具,它们的错误高度相关,三票赞成并不比一票可靠。
5.8 人在回路不等于安全
让人点击"批准"是必要控制之一,却不是万能控制。高频审批会产生自动化偏见和审批疲劳;Agent 还可能用非常流畅的摘要掩盖真实参数,例如摘要写"备份旧文件",实际 API 是把目录上传到外部域名。
高质量审批界面应展示:调用者与 Agent 身份、原始目标、标准化后的准确动作、资源、参数、数据量、接收方、权限变化、可逆性、预计影响、独立策略判断和回滚办法。高后果动作可要求双人批准或职责分离,而不是把一切责任压给一个疲惫的分析员。
6. 安全 Agent 的参考架构:把边界放在模型之外
6.1 总体原则:让模型提出动作,让系统决定动作能否发生
下面是一套适用于安全运营、代码 Agent、办公 Agent 和云 Agent 的通用架构。核心是让所有外部副作用经过统一的策略执行面,而不是允许模型直接持有万能凭证。
这一设计方向也得到研究原型的支持。Google DeepMind 的 CaMeL 把可信控制流与不可信数据流显式分开,并用 capability 对数据传播和工具调用施加约束;论文在其基准上报告,CaMeL 在提供可证明安全属性的同时完成了 77% 的任务,而未设防 Agent 为 84%。这个结果不是"问题已经解决",因为能力建模、兼容性与现实应用迁移仍很困难;它真正证明的是:安全约束可以被设计成执行系统的结构,而不必完全寄希望于模型识别所有恶意文本。CaMeL 论文

图 12 模型可以动态推理,但身份、授权、隔离、网络出口、审计和高风险审批必须由独立组件强制执行。
参考架构包含六个域:
-
入口信任域:认证用户或上游服务,记录原始意图、租户和数据级别;
-
Agent 运行域:模型、规划器和临时状态运行于隔离环境,设定时间、步数和成本预算;
-
上下文域:检索、长期记忆和外部内容保留来源、租户、信任等级与完整性信息;
-
工具控制域:统一网关发现工具、校验模式、执行身份与参数级策略;
-
资源域:SIEM、EDR、IAM、数据库、代码仓库、邮件和网络设备继续执行自身访问控制;
-
监督域:不可篡改日志、风险检测、审批、回滚、熔断与紧急撤权独立于 Agent。
6.2 独立身份与可验证的委托链
每个生产 Agent 都应拥有独立工作负载身份,而不是伪装成人类用户。一次工具调用还要能回答三个问题:
-
谁发起目标? 人类、服务、告警还是另一个 Agent;
-
哪个 Agent 作出决定? 具体实例、版本、配置和会话;
-
以什么授权执行? 委托范围、工具、资源、动作、时间和约束。

图 13 认证回答"是谁",委托回答"代表谁、为了什么",授权回答"本次具体动作能否执行";三者不能合并为一个长效 API Key。
推荐做法包括:短期令牌、按工具和资源设置 audience、细粒度 scope、工作负载身份、密钥保险库、令牌交换、逐跳保留原始主体、禁止无约束转委派、资源端再次授权。对于高风险 Agent,凭证只在工具网关执行瞬间注入,模型上下文永远不应看到秘密本身。
6.3 工具网关与参数级策略
只对白名单 API 做授权还不够。send_email 可能给内部一人发送非敏感摘要,也可能给外部域群发客户数据;query_database 可能读取聚合统计,也可能导出整张用户表。因此策略要深入参数与语义效果:
允许:SOC-Triage-Agent 读取最近 24 小时、与当前事件实体相关的登录日志
拒绝:任何 Agent 查询明文口令、私钥或完整支付卡号
允许:自动隔离普通办公终端,前提是风险分数、证据类型和资产标签满足规则
审批:隔离服务器、域控制器、医疗设备或超过 20 台终端
拒绝:把内部数据发送到未登记域名,即使 Agent 声称这是“备份”
策略应使用确定性语言或代码执行;自然语言可以帮助生成候选策略,但必须转换为可评审、可测试的规则后再生效。
6.4 最小权限之外,还要"最小能力"和"最小自主性"
传统最小权限关注"能访问什么"。Agent 还要限制:
-
最小工具集:任务不需要命令行,就不暴露命令行;
-
最小参数空间:只能查询事件相关实体和时间窗;
-
最小影响范围:一次最多隔离一台或一组同类低关键资产;
-
最小持续时间:令牌、网络放行和记忆都自动过期;
-
最小委派深度:子 Agent 不能无限创建子 Agent;
-
最小行动步数:超过预算必须重新授权或人工接管。
可以用一个启发式风险模型帮助架构评审:
R_{agent}\\propto \\frac{C\\times A\\times P\\times B\\times S}{O\\times V\\times Q},
其中 (C) 为能力强度,(A) 为自主程度,(P) 为权限,(B) 为可触达边界,(S) 为状态持久性;(O) 为可观测性,(V) 为验证强度,(Q) 为隔离与熔断能力。这不是统计学标准,而是一个设计启发:当能力、自主性、权限、可达范围和持久性同时上升时,风险呈乘法放大;只加一条提示词很难抵消这种变化。

图 14 同一模型用于只读问答和用于全局管理员自动响应,其风险不是同一个量级;自主性应该针对具体操作逐级获得。
6.5 记忆与检索的安全设计
安全的上下文系统至少包含四种标签:来源、主体、时间、信任级别。检索结果进入模型前应明确标出"这是不可信网页内容""这是经批准的组织策略""这是本用户过去的偏好",不能把它们拼成无来源的一大段文本。
长期记忆写入应采用白名单类别:事实缓存、用户偏好、任务摘要、安全策略分别进入不同存储区;安全策略只允许受权管理员或签名发布流程修改;低信任内容写入前可隔离、去指令化、人工复核;所有记忆支持 TTL、版本、回滚和溯源。
6.6 沙箱、网络出口与数据防泄漏
代码执行、浏览器和文件解析工具应在隔离环境运行。关键控制包括:只读基础镜像、一次性文件系统、CPU/内存/时间限制、禁止访问宿主机和元数据服务、默认拒绝外网、目标域与端口白名单、DNS 监控、上传内容 DLP、下载文件查杀、敏感字段脱敏。
仅靠"模型不要外传秘密"不可靠;真正有效的是即使模型决定外传,网络与数据策略也无法让数据离开。
6.7 观察、审计、回滚和停止
Agent 的审计日志应能够重建完整轨迹:模型与提示版本、输入来源、检索文档、记忆读写、计划、工具名称、标准化参数、调用身份、策略结果、审批人、API 回执、资源状态变化和最终验证。日志存储必须对 Agent 只写不可改,避免"执行者编辑自己的审计记录"。
同时要有三种停止机制:
-
局部熔断:某工具错误率、动作频率或影响范围异常时停用该工具;
-
会话终止:超过步数、成本、时间或重复循环阈值时结束任务;
-
全局撤权:吊销 Agent 身份、凭证和工具注册,阻止所有新动作。
6.8 协议并不能替代策略
MCP、A2A、OAuth、mTLS 与消息签名分别解决不同问题:
| 机制 | 主要解决 | 不能独自解决 |
|---|---|---|
| MCP | Agent 与工具的描述和调用互操作 | 工具是否可信、某参数是否安全 |
| A2A | Agent 发现、任务与消息互操作 | 委派是否越权、结论是否正确 |
| OAuth/OIDC | 主体认证与令牌授权 | 自然语言目标是否被劫持 |
| mTLS | 传输双方认证与机密性 | 端点本身是否恶意、权限是否过宽 |
| 数字签名 | 消息完整性与来源 | 已签名内容是否合理、是否重放 |
安全架构必须把这些机制组合起来,而不是把"使用了标准协议"当作安全证明。
7. 如何评测一个安全 Agent:不要只看 Demo 和平均准确率
7.1 四组指标缺一不可
安全 Agent 的评测至少包含四个维度:
-
任务效用:正确完成率、证据覆盖、时间、成本、规则质量;
-
安全性:攻击成功率、越权动作率、敏感数据泄漏率、策略绕过率;
-
可靠性:重复运行方差、失败恢复、工具错误处理、长任务稳定性;
-
运营性:误报、人类复核时间、审批负担、回滚率、审计完整度。

图 15 一个 Agent 可以"答案很准"却"不适合执行";部署决策要同时看任务能力、安全边界、运行可靠性和人类成本。
可定义一个风险调整后的净效用:

其中错误动作成本不能与正确动作简单平均。一次误封普通钓鱼域名和一次误隔离生产数据库的损失差异巨大,因此评测必须按资产与动作后果加权。
7.2 必须测试完整轨迹,而不是只评最后答案
只比较最后报告会掩盖危险过程:Agent 可能先把数据发送到外部服务,再生成一份正确总结。轨迹评测应检查每一步是否必要、是否在授权范围、证据是否支持、工具参数是否最小、执行后是否验证。
2026 年 USENIX Security 的 AttriGuard 提出"动作级因果归因":通过在削弱外部观察的反事实条件下重新执行,判断某个工具调用究竟由用户目标驱动,还是由不可信内容驱动。无论是否采用该具体方案,它揭示了一个重要方向:防御应从识别"坏文本"转向验证"为什么需要这次动作"。 AttriGuard 论文页面
7.3 评测集应包含对抗、漂移和真实噪声
一个有用的测试体系需要同时包含:
-
正常任务与困难但合法的边界任务;
-
直接和间接提示注入;
-
工具超时、错误返回、字段缺失与冲突证据;
-
被污染的检索文档和长期记忆;
-
越权用户、被盗令牌和伪造 Agent 消息;
-
多轮长任务、循环与成本消耗;
-
模型、提示、工具或知识库版本更新后的回归;
-
生产日志中的基线噪声、重复告警和数据延迟。
NIST 的观点是传统安全框架仍然适用,但需针对 Agent 自主性、工具和环境约束进行扩展;截至本文资料快照,CAISI 于 2026 年发布的是征求信息与倡议,不能误写成已经生效的完整 Agent 安全标准。NIST CAISI Agent Security RFI;NIST AI Agent Standards Initiative
7.4 从影子模式到逐项"挣得自主权"
安全上线应按动作类型逐级推进:
-
离线评测:在冻结数据和靶场上运行;
-
影子模式:读取生产数据但不影响生产,比较 Agent 建议与分析员决策;
-
建议模式:Agent 生成可审计步骤,由人执行;
-
审批执行:Agent 调用工具,高风险动作前暂停;
-
有限自治:对持续证明可靠的低风险动作自动执行;
-
闭环自治:仅在特定工作流、资产范围和永久硬边界内运行。
自主权应授予"某个操作",而不是笼统授予"某个 Agent"。一个 Agent 可以自动关闭已验证的误报警单,同时永远不能自动删除生产数据。
7.5 三个数字例子:为什么"准确率高"仍不足以自治
例一:低基率会吞噬看似优秀的准确率
假设某 SOC 每天处理 10,000 条事件,真实恶意事件只有 100 条;Agent 的召回率为 90%,对正常事件的特异度为 98%。结果是:
| 实际恶意 | 实际正常 | 合计 | |
|---|---|---|---|
| Agent 判定恶意 | 90 | 198 | 288 |
| Agent 判定正常 | 10 | 9,702 | 9,712 |
此时被 Agent 标为恶意的事件中,真正恶意的比例只有:

这不是说 Agent 没有价值,而是说明安全任务必须报告基率、精确率、召回率和人工复核成本,不能只宣传"98% 准确"。若系统把全部 288 条都自动隔离,错误动作会超过正确动作两倍。
例二:多步骤可靠性会乘法衰减
假设一次事件闭环包含 8 个关键步骤,每一步独立成功率都达到 97%,那么完整无误完成的理想化概率是:

真实错误往往并不独立:一个错误实体解析可能同时污染后续查询、归因和响应,所以实际结果可能更差。工程上应在关键节点设置证据检查、幂等、重试、检查点和退出条件,而不是把一个长链路视为一次模型调用。
例三:动作阈值由损失和可逆性决定
若错误吊销会话的预期损失为 2,000 元,漏掉真实入侵的损失为 100,000 元,成功处置后仍有 5,000 元残余损失,则在概率已经校准、其他条件相同的简化模型中,采取动作的风险概率阈值为:

但若动作是"隔离核心数据库"而不是"吊销可恢复的单个会话",C_{FP} 和不可逆性会急剧上升,审批门槛也应完全不同。这个例子说明最优阈值属于具体动作和业务,不属于某个通用模型。
7.6 对抗评测必须自适应,并考虑重复攻击
NIST/CAISI 在 AgentDojo 环境中的技术实验给出了一个很有警示性的结果:升级后的模型面对已知基线攻击时,最强攻击成功率为 11%;红队针对该模型开发新攻击后,最高升至 81%。在一组选定任务中,单次平均攻击成功率为 57%,同一攻击各尝试 25 次后升至 80%。这些数字只对应特定模型、基准与攻击设置,不能当作现实产品的普遍失陷率;但它们证明了三件事:对固定旧攻击鲁棒不等于安全,聚合平均数会掩盖高后果任务,允许低成本重复尝试会显著改变累计风险。NIST:Strengthening AI Agent Hijacking Evaluations
8. 市场落地:产品、企业与真实成熟度
8.1 先看市场结构,而不是厂商数量
当前市场可以分成三类:
-
安全运营 Agent:面向 SOC、XDR、SIEM、云安全、身份、数据与漏洞治理;
-
Agent 安全产品:发现 Agent 资产、控制身份与工具、检测提示注入、运行时防护、AI-SPM;
-
攻防验证 Agent:自主渗透测试、代码漏洞发现、红队和安全评测。

图 16 大平台厂商把 Agent 嵌入既有数据与控制面;创业公司则集中突破自主调查、渗透测试或 Agent 运行时安全。
判断一项产品是否真正落地,至少核对:是否有正式文档;客户能否购买或启用;是 GA、预览还是概念发布;能否实际调用工具;能否展示证据链;动作受什么权限和审批约束。下表按 2026 年 8 月 17 日公开一手资料整理,状态随地区、许可和租户而变化。
8.2 海外代表性产品
| 企业 / 产品 | 主要场景 | Agentic 特征 | 公开状态与证据 | 需要注意 |
|---|---|---|---|---|
| Microsoft Security Copilot Agents | 钓鱼、数据安全、条件访问、漏洞与告警 | 多专用 Agent 嵌入 Defender、Purview、Entra | Conditional Access Optimization 于 2025-07 GA;2026-03 官方更新称 Data Security Triage 已 GA,部分其他 Agent 仍预览 | 同一品牌下各 Agent 状态不同,不能统称"全部 GA" |
| Google Security Operations Triage and Investigation Agent | 告警分诊与调查 | 自动收集证据、形成结论与调查轨迹 | 2026-06 官方称已 GA | 质量高度依赖 SecOps 遥测和客户配置 |
| Google Detection Engineering / Threat Hunting / Agentic Automation | 检测工程、狩猎与响应编排 | 情报、合成事件、规则生成、动态调查与确定性剧本结合 | 2026-06 官方仍将这三项标为 preview | 不能把 Triage GA 外推为整个 Agentic SOC 全部 GA |
| CrowdStrike Charlotte AI / Agentic Workflows | Falcon 平台调查、响应与工作流 | 跨 Falcon 数据和动作编排 | 2025 年陆续宣布 Agentic Response、Workflows 与多专用 Agent;具体可用范围依许可 | 官方发布节奏快,采购需逐功能核验 GA/预览 |
| Palo Alto Networks Cortex AgentiX | SOC 调查、云姿态、自动化工程 | 多 Agent、剧本与上千集成,嵌入 XSIAM/XDR | Cortex XSIAM 3.3、XDR 5.0 官方发布中提供相应能力 | 自动动作应核验角色、审批和日志配置 |
| SentinelOne Purple AI | 自动分诊、调查、响应 | 一键/零点击调查、证据链、可调人类监督 | 2026-03 一键 Auto Investigation GA;2026-06 向客户开放自动触发调查试用 | "开放试用"与所有能力默认正式启用不同 |
| AWS Security Agent | 应用安全审查、渗透测试 | 从设计到部署的安全推理与验证 | 2025-12 发布预览;按需渗透测试于 2026-03-31 GA | broader agent 功能与 GA 子能力要区分 |
| AWS Security Incident Response investigative agent | 云事件调查 | 汇集 AWS 遥测并生成调查 | 官方产品能力 | 主要围绕 AWS 环境和服务权限 |
| Wiz Blue / Red / Green Agent 与 Workflows | 云调查、攻击验证、治理与响应 | 基于云攻击图和专用子 Agent 的调查、验证与工作流 | Blue Agent 2026-03 GA,Red Agent 2026-07 GA;Green 与 Workflows 仍有 preview 功能 | 调查、攻击验证和处置的权限边界不同 |
| Snyk Evo Agent Security | Agent 资产、行为治理、扫描、红队与运行时 | 保护开发与运行中的 Agent、MCP 与工具 | 总产品发布与子模块状态并不一致;2026 官方页面仍将部分能力标为 Open/Private Preview | 必须按 Agent Scan、Red Teaming、Guard 等子模块核验 |
| Cloudflare AI Security for Apps / Agent Lee | 保护 AI 应用与受控云操作 | 提示注入和数据风险防护;Agent Lee 可经 MCP/API 执行操作 | AI Security for Apps 2026-03 GA;Agent Lee 写操作需要批准 | 助手、操作 Agent 与保护 Agent 是不同产品形态 |
| XBOW | 自主渗透测试 | 协调器、多专用 Agent、独立验证 | Pentest On-Demand 已提供;平台与 API 状态按官方页面 | 仅限书面授权范围,验证动作仍可能有业务影响 |
| Prophet Security / Simbian / Dropzone 等 | AI SOC 分析员 | 自主调查、威胁狩猎、检测工程 | 商业产品或试用页面 | 多数效果数字来自厂商自述,需 PoC 验证 |
主要状态依据:Microsoft 2026 官方更新;Google SecOps 各 Agent 状态;CrowdStrike Agentic AI;Cortex AgentiX;SentinelOne Agentic Investigation;AWS Security Agent;Wiz Blue Agent GA;Wiz Red Agent GA;Snyk Agent Security;Cloudflare AI Security for Apps。
8.3 中国市场代表性落地
中国市场同时出现"Agent 做安全"和"保护 Agent"两条产品线,且更多与现有云安全中心、XDR、安全运营平台、网络设备和本地化部署结合。

图 17 国内厂商的差异化主要来自本地安全数据、设备联动、私有化部署、行业知识与既有客户控制面。
| 企业 / 产品 | 方向 | 公开能力与状态 | 严谨解读 |
|---|---|---|---|
| 阿里云云安全中心 Agentic SOC | Agent 做安全 | 帮助中心提供购买、开通、接入、Agent 说明与响应规则 | 有正式产品文档,可视为已产品化;实际套餐与地域需核验 |
| 阿里云智能体安全中心 ASC | 保护 Agent | AI 资产盘点、Skills 检测、红队和部分运行时防护 | 当前可开通,但模块状态不同,部分能力仍为有限公测 |
| 阿里云 AI 安全护栏安全运营 Agent | 保护 AI / 运营护栏 | Lead Agent 协调测试、测评与策略调优 Agent | 2026 官方文档明确处于公测阶段 |
| 腾讯云云防火墙 AI 智能体 | Agent 做安全 | 产品问答、研判、态势报告和规则处置 | 2026-07 有正式产品文档;"辅助能力"不等于全自治 |
| 腾讯云 CodeBuddy Security | AppSec Agent | 多 Agent 进行威胁建模、漏洞发现、动静态验证与修复建议 | 2026-07 标为已发布,有购买、文档与 SLA |
| 华为星河 AI 网络安全 Agentic SOC | Agent 做安全 | 感知、分析、执行三类 Agent,联动网络与安全设备 | 2026-04 官方全球发布;公开页未使用统一 GA/公测标签 |
| 深信服 AI 安全平台 / 安全 GPT | 双向 | 安全运营、流量、钓鱼、数据场景,可拖拽构建专属 Agent | 官网提供产品方案、平台和部署说明;效果数字为厂商披露 |
| 安恒信息恒脑安全智能体 | Agent 做安全 | 低代码创建 Agent,调度插件、知识库与现有安全产品,另有渗透、代码审计等专用 Agent | 官网提供产品与试用入口;需要 PoC 检查权限和闭环 |
| 奇安信 QAX-GPT / 威胁分析数字专家 | Agent 平台与威胁分析 | RAG、工作流、MCP、多 Agent 编排及沙箱/图谱/逆向工具调用 | 平台在商业产品目录;威胁分析数字专家 2026-06 起公开测试 |
| 奇安信数据安全管理平台 AI 智能体 | Agent 做数据安全 | 数据识别与风险研判 Agent,可联动数据安全网关 | 2026-06 版本说明称智能体授权独立控制,可联系销售开通 |
| 360 安全运营 / 终端 / 流量智能体 | Agent 做安全 | 调查、建议、一键执行及终端进程终止、网络阻断、主机隔离 | 当前有商业产品页和咨询入口,无统一 GA 标签 |
| 360 人工智能安全态势管理 | 保护 Agent | 技能清单核验、越权/异常外联/提示注入等行为检测 | 2026 官方新闻披露获得相关产品认证 |
| 绿盟 NSFGPT / 风云卫 | 多 Agent 安全运营 | AI SOC、检测响应、风险评估、漏洞运营与威胁情报,可私有化 | 2026-04 有官方产品页和咨询入口 |
主要状态依据:阿里云 Agentic SOC;阿里云智能体安全中心;腾讯云云防火墙 AI 智能体;腾讯云 CodeBuddy Security;华为 Agentic SOC;深信服 AI 安全平台;安恒恒脑;奇安信威胁分析数字专家;360 安全运营智能体;绿盟 NSFGPT。
8.4 从产品分布能看出什么
第一,最先落地的不是"通用全能安全 Agent",而是告警分诊、调查、检测工程、身份优化、云问题收敛等边界较清楚、数据已经平台化的专用角色。
第二,大型安全平台具有数据和执行面的优势:它们已经拥有终端、身份、云或网络遥测,以及隔离、封禁和策略下发能力。创业公司的机会则在跨平台中立层、深度自主调查、渗透测试、Agent 运行时安全和更快的产品迭代。
第三,市场存在明显的"Agent 通胀"。有些产品只是把自然语言搜索、摘要或固定 SOAR 剧本重新命名为 Agent。真正的判断标准不是页面上有没有"Agent"一词,而是系统是否有持续状态、动态计划、工具选择、反馈修正和可治理的真实动作。
第四,"安全 Agent"与"Agent 安全"正在合流。未来的 SOC Agent 自己也需要资产发现、身份治理、工具网关、运行时检测和审计;保护 Agent 的产品又会用 Agent 分析 Agent 行为。
9. 企业如何落地:从一个可证伪的用例开始
9.1 选择任务:高频、可验证、低到中等影响
第一个用例不宜选择"全自动处置所有安全事件",而应满足:输入数据可获得、正确结果可验证、错误影响可控、现有人工流程可作基线、工具权限可细分。例如钓鱼告警分诊、云暴露路径解释、检测规则草拟与回放、低风险令牌吊销。
9.2 先画权限图,再选模型
项目启动时应列出 Agent 能读取的数据、能调用的工具、每个工具的动作和参数、凭证来源、跨租户边界、外网出口、记忆位置、审批人和回滚方法。若这些问题还没有答案,讨论选哪一个大模型为时过早。
9.3 建立基线和验收门槛
用当前分析员流程测量平均调查时间、证据覆盖、误报、漏报、处置时间和人工成本;再在冻结事件集上比较 Agent。验收门槛要按后果设定:只读调查可以容忍少量无害冗余查询,生产隔离动作则应接近零越权、零超范围,并经过长时间影子验证。
9.4 分阶段上线与持续回归

图 18 成熟路径不是一次性打开"全自治",而是让每类动作通过证据逐级获得自主权,最终形成跨平台但仍受统一身份和策略约束的 Agent 网格。
每次模型、提示、工具、Skill、知识库或权限变更都可能改变行为,因此必须触发回归评测。生产中保存 Agent 建议、人类决策和实际结果,形成自主权调整的证据:表现持续稳定可扩大某项低风险动作的自治;漂移或攻击出现时立即降级为审批或只读模式。
9.5 采购与 PoC 的十个问题
-
哪些功能真正调用工具,哪些只是问答或摘要?
-
每个功能当前是 GA、预览、公测、邀请试点还是路线图?
-
Agent 使用独立身份还是共享服务账号?能否保留用户委托链?
-
能否对工具参数、目标资源、数据量和外部接收方执行策略?
-
是否记录完整轨迹、策略判断、审批和执行后状态?
-
如何防止网页、邮件、日志和 RAG 中的间接提示注入?
-
记忆保存在哪里,如何隔离、过期、查看、撤销和审计?
-
代码与浏览器工具运行在哪种沙箱,默认网络出口是什么?
-
如何衡量误动作、漏报、重复性、人工复核成本和漂移?
-
出现异常时,能否瞬时吊销身份、停用工具、终止会话并回滚?
10. 未来方向:Agentic SOC 不会只是"无人 SOC"
10.1 从单点助手到受治理的多 Agent 安全网格
未来三到五年更可能出现的形态,不是一个万能 Agent 控制全网,而是多个边界清晰的角色共享证据但分离职责:分诊 Agent 负责收敛告警,调查 Agent 负责证据,身份 Agent 评估授权,响应 Agent 生成动作,验证 Agent 独立确认效果,治理 Agent 观察整个链路。统一身份、策略、工具网关和审计把它们连接成安全网格。
10.2 Agent 身份将成为 IAM 的新主战场
企业过去管理员工与工作负载身份,未来还要管理数量更大、寿命更短、可动态创建和转委派的 Agent 身份。关键能力包括:自动发现 Agent、绑定所有者与用途、工作负载证明、短期凭证、能力令牌、逐跳委托、跨云身份联合、行为基线和快速撤权。
这不是给每个 Agent 发一个 API Key,而是把"谁创建它、代表谁、为了什么任务、能调用什么、有效多久、能否继续委派"编码进可验证控制面。
10.3 MCP/A2A 会催生"Agent 网关"和"Agent 防火墙"
协议标准化后,企业会像治理 API 一样治理 Agent 调用:发现服务、注册能力、认证、参数校验、数据分类、速率限制、行为检测、审计和跨域策略。所谓 Agent 防火墙不应只是一个提示注入分类器,而应是身份代理、工具网关、DLP、策略执行和运行时观测的组合。
10.4 评测将从模型榜单转向环境化验证
安全能力强烈依赖环境:同一个 Agent 在干净靶场和真实企业数据中的表现不同,在只读工具和管理员权限下的风险也不同。未来成熟评测会冻结环境状态、公开任务与证据、记录完整轨迹、注入真实噪声和对抗内容,并允许企业在自己的数据与权限图上复现。
2026 年 Open Security Benchmark 预印本提出用冻结的企业安全状态和可审计工具链评估跨厂商姿态调查,正反映了这一方向。Open Security Benchmark
10.5 攻防进入机器速度,但"验证"会比"生成"更稀缺
Agent 可以迅速生成假设、查询、规则、利用样例与补丁,真正稀缺的是证明:漏洞是否真实、补丁是否不破坏业务、规则是否不会淹没 SOC、响应是否在授权范围、攻击是否已经停止。未来产品竞争的核心会从"谁生成得快"转向"谁能独立验证、保留证据并安全执行"。
10.6 小模型、边缘 Agent 与网络内生智能
并非所有安全 Agent 都要把原始数据发送给云端大模型。终端、网关和边缘节点上的小模型可以完成敏感字段脱敏、初步分类、行为基线和低延迟阻断;中心 Agent 负责跨域推理。这样可以降低隐私泄露、延迟和成本,但模型更新、供应链与边缘设备防篡改会成为新问题。
10.7 法律责任与组织治理会落到"可证明的控制"上
当 Agent 错误隔离业务、删除数据或对外发送信息时,"模型自己决定的"不能成为责任解释。组织需要证明:谁批准用例、如何测试、授予了什么权限、哪些硬边界存在、谁能接管、事故如何复盘。未来监管和保险更可能关注可追溯性、权限与控制有效性,而不是只要求一份模型说明书。
10.8 三个时间尺度的判断
| 时间尺度 | 高概率方向 | 最大制约 |
|---|---|---|
| 1---2 年 | 专用 SOC 调查 Agent、Agent 资产发现、工具网关、身份与审批集成快速普及 | 数据质量、权限梳理、产品"Agent 化"营销噪声 |
| 3---5 年 | 多 Agent 跨平台协作、按动作挣得自主权、持续对抗评测、Agentic SOC 进入核心流程 | 跨厂商互操作、级联风险、责任划分 |
| 5 年以上 | 部分低风险网络与安全运营形成高度自治闭环,攻防系统持续对抗和自适应 | 可验证性、复杂系统涌现行为、关键基础设施容错 |
这些是基于当前技术与产品轨迹的推断,不是确定预言。尤其在高后果行业,硬边界和人类责任不会因为模型能力提升而自动消失。
11. 结语:真正成熟的 Agent,不是"什么都能做",而是"知道什么不能越过"
智能 Agent 给网络安全带来的根本变化,是把语言模型从知识接口变成了行动主体。它能够压缩跨工具调查、把威胁情报转成检测、连接身份与云攻击路径、在沙箱中发现并修补漏洞,也能让防守速度更接近攻击速度。
但同一条能力链也会带来目标劫持、工具滥用、权限放大、记忆持久化、供应链投毒、跨 Agent 传播和级联失败。把这些风险简单归结为"提示词写得不够好"会错过问题本质:Agent 是一个分布式软件系统,模型只是其中一个概率组件。
因此,面向 Agent 时代的网络安全可以归纳为五条原则:
-
把自然语言当作不可信输入,不当作授权凭证;
-
把模型当作建议动作的推理器,不当作最终策略执行点;
-
把身份、委托、工具和参数控制放在模型之外;
-
把评测对象从最终答案扩展到完整行动轨迹与真实后果;
-
让自主权由持续证据逐项获得,并始终保留隔离、回滚和撤权能力。
最终,网络安全不会因为 Agent 而变成"无人值守的魔法"。更现实、更有价值的未来,是机器承担高速、重复、跨域的证据工作,人类负责目标、边界、例外与责任;二者通过可验证的身份、策略和审计协作。真正专业的 Agent 系统,不以"能做多少"证明先进,而以"即使判断出错,也越不过什么边界"证明可信。
附录 A:一套可直接用于项目评审的控制清单
A.1 资产与目标
- Agent 有唯一所有者、业务目的、数据等级和生命周期;
- 明确允许与禁止的任务,不用模糊的"提升效率"代替;
- 记录模型、提示、工具、Skill、知识库和运行时版本;
- 建立 Agent、MCP 服务、A2A 对端和长期记忆资产清单。
A.2 身份与权限
- Agent 使用独立工作负载身份;
- 完整保留原始用户与逐跳委托链;
- 使用短期、限定 audience 和 scope 的令牌;
- 子 Agent 只获得任务所需能力子集;
- 高风险权限与审批职责分离;
- 有一键撤权和凭证轮换流程。
A.3 输入、记忆与数据
- 外部内容标记来源和信任级别;
- 指令、数据和工具结果在结构上分离;
- 长期记忆按用户、租户、项目和类型隔离;
- 记忆支持 TTL、版本、撤销和审计;
- 敏感数据进入模型前最小化或脱敏;
- 输出与外发经过 DLP 和目标域策略。
A.4 工具与执行
- 工具来源、版本、签名和权限清单可验证;
- 工具参数有模式、范围和语义策略;
- 代码、浏览器和文件解析运行在一次性沙箱;
- 网络出口默认拒绝并记录 DNS/HTTP 目标;
- 设置步数、时间、并发、费用和影响预算;
- 每个副作用动作有回执、效果验证和回滚办法。
A.5 评测与运营
- 同时评任务效用、攻击成功率、误动作和人工成本;
- 包含提示注入、记忆投毒、越权、工具错误和多 Agent 级联;
- 在模型、提示、工具和知识库更新后自动回归;
- 先离线、再影子、再审批执行、最后有限自治;
- 日志对 Agent 不可修改,可重建完整轨迹;
- 有局部熔断、会话终止、全局停止与事故响应演练。
附录 B:术语速查
| 术语 | 含义 |
|---|---|
| Agent / 智能体 | 围绕目标感知、规划、调用工具并根据反馈继续行动的系统 |
| Agentic AI | 强调自主计划、工具使用、持续状态与行动闭环的 AI 系统 |
| SOC | Security Operations Center,安全运营中心 |
| SIEM | 汇聚日志并进行搜索、关联、检测与合规分析的平台 |
| SOAR | 安全编排、自动化与响应平台,通常执行预定义剧本 |
| XDR | 跨终端、身份、网络、云等域关联检测与响应的平台 |
| RAG | 检索增强生成,把外部知识检索结果提供给模型 |
| MCP | Model Context Protocol,连接 Agent/模型客户端与工具、资源的协议 |
| A2A | Agent2Agent Protocol,面向 Agent 发现、任务和消息互操作的协议 |
| Prompt Injection | 用输入中的指令改变模型原定行为 |
| Indirect Prompt Injection | 把恶意指令放进网页、邮件、文档等外部观察源 |
| HITL | Human in the Loop,人类在关键步骤参与判断或批准 |
| AI-SPM | AI Security Posture Management,AI 资产与配置风险治理 |
| AIBOM | AI Bill of Materials,记录模型、数据、工具等 AI 供应链组成 |
参考资料
Agent 原理与协议
-
Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023.
-
Schick et al., Toolformer: Language Models Can Teach Themselves to Use Tools, NeurIPS 2023.
-
NIST, Lessons Learned from the Consortium: Tool Use in Agent Systems, 2025.
-
MCP, Authorization Specification, 2025-11-25.
-
IETF, RFC 9700: OAuth 2.0 Security Best Current Practice, BCP 240, 2025.
-
Linux Foundation, Agent2Agent Protocol Project, 2025.
安全框架与研究
-
OWASP GenAI Security Project, Agentic AI --- Threats and Mitigations, v1.1, 2025.
-
OWASP, Top 10 for Agentic Applications 2026, 2025.
-
MITRE, MITRE ATLAS.
-
MITRE, OpenClaw Investigation, 2026.
-
NIST, AI Agent Security RFI, 2026.
-
NIST, AI Agent Standards Initiative, 2026.
-
NIST, Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations, NIST AI 100-2e2025, 2025.
-
AWS, Four Security Principles for Agentic AI Systems, 2026.
-
Zhan et al., InjecAgent, 2024.
-
Debenedetti et al., AgentDojo, 2024.
-
He et al., AttriGuard, USENIX Security 2026.
-
Chen et al., StruQ, USENIX Security 2025.
-
Debenedetti et al., Defeating Prompt Injections by Design(CaMeL), 2025.
-
Microsoft Security, AI Application Security Considerations: EchoLeak(CVE-2025-32711), 2025.
网络安全 Agent 与评测
-
Google Project Zero, Big Sleep 发现 SQLite 漏洞, 2024.
-
DARPA, AI Cyber Challenge Final Competition Results, 2025.
-
Chona et al., Cyber Defense Benchmark, 2026,预印本.
-
Wang et al., SecRespond, 2026,预印本.
-
Engelberg et al., Open Security Benchmark, 2026,预印本.
产品与市场官方资料
-
Microsoft, Secure agentic AI end to end, 2026.
-
Google Cloud, Google Security Operations Agents, 2026.
-
CrowdStrike, Agentic AI Innovations, 2025.
-
Palo Alto Networks, Cortex AgentiX, 2026.
-
SentinelOne, Purple AI Auto Investigation GA, 2026.
-
AWS, AWS Security Agent, 2025---2026.
-
Wiz, Wiz AI Agents, 2025.
-
XBOW, Platform.
-
阿里云, Agentic SOC.
-
阿里云, 智能体安全中心.
-
腾讯云, 云防火墙 AI 智能体, 2026.
-
华为, 星河 AI 网络安全 Agentic SOC, 2026.
-
深信服, AI 安全平台.
-
安恒信息, 恒脑安全垂域大模型与安全智能体.
-
奇安信, 数据安全管理平台 V3.0 版本说明, 2026.
-
360, 人工智能安全态势管理系统认证说明, 2026.
版权与发布说明:本文图表均为原创信息图,按 1600×900、16:9 网页比例制作;全文不依赖 Mermaid。产品状态以 2026 年 8 月 17 日公开资料为准,发布或采购前应再次核验厂商最新文档。