1. 引言
智能体的安全边界,最终由两件事决定:它能做什么 ,以及系统如何确保它只做被允许的事。前者是权限范围问题,后者是策略执行问题。当智能体从被动响应提示的模型演变为能够自主规划、调用工具、维护记忆的主动系统时,传统的访问控制模型已不足以覆盖新的风险维度。智能体不仅访问资源------它决定何时、以何种顺序、基于何种推理去使用这些资源。
本文将系统梳理智能体最小权限架构的设计原则、执行隔离的边界机制、多层监督控制的协同方式,并提供一份可操作的权限控制蓝图。
2. 最小权限架构
2.1 核心原则
最小权限的核心含义很简单:智能体应仅拥有完成任务绝对必需的权限。不多、不备、不开放。
但智能体环境下的最小权限有一个关键区别:智能体不仅访问资源,它还决定何时使用资源。这意味着权限范围界定必须比传统系统更加有意图、更加细粒度。不是给智能体"文件系统访问权",而是"向这个文件夹写入"或更窄地"向这个特定文件追加"。
2.2 基于角色的模式
将智能体按人类团队的方式结构化。每个智能体或智能体模式获得一个具有非常特定权限的角色:
-
研究型智能体不应拥有生产系统的写入权限
-
规划型智能体不应具备执行高影响操作的能力
-
客服型智能体不需要金融交易权限
清晰的角色分配立即缩小攻击面。这一原则在行业框架中得到明确支持:Microsoft 的安全代理设计指南要求为每个代理分配唯一的云身份,并通过范围最窄的角色分配执行最小权限,区分 Maker、Publisher、Environment Admin 和 Security Admin 等职责。
2.3 动态能力门控
不是预先给予智能体所有权限,而是仅在需要时、仅在正确条件下解锁能力:正确的上下文、已验证的输入、已确认的用户意图。这是防止权限提升最有效的方法之一,因为即使智能体的推理开始漂移,系统也不会让它以错误的顺序访问敏感工具。
2.4 即时权限与短生命周期凭证
传统静态凭证的问题是:一旦泄露,攻击者拥有持续访问权。智能体场景下,更安全的模式是使用短生命周期、任务范围的凭证。Microsoft 的零信任指南明确建议通过即时(JIT)权限------临时角色启用、短命令牌或批准------来限制权限,使较高权限仅在特定工作流期间存在。
3. 执行隔离与边界强制
3.1 执行隔离
执行隔离是将智能体的不同工作部分分离到独立的执行上下文中,防止一个组件意外干扰另一个。例如,规划器在无工具访问的干净环境中运行,而工具执行层在无法看到智能体更广泛推理的沙盒中运行。
这防止跨组件污染:被腐蚀的记忆条目不应泄漏到规划器中,有风险的工具调用不应将未过滤的数据反馈到长期记忆中。OWASP 的研究明确指出,LLM 应被视为不可信的代码生成器,其输出在执行前必须被验证。这意味着工具执行环境必须与模型推理环境保持严格的隔离边界。
3.2 边界强制
在工作流的每一层引入严格检查点。在智能体从规划进入行动、或从观察进入记忆更新之前,系统评估过渡是否安全。
当某些东西看起来可疑时------非预期参数、高风险工具调用序列、与原始用户请求不匹配的操作------护栏介入。系统可以暂停、重定向或完全停止执行。
IBM 研究提出的 CUGA 策略系统展示了这种边界强制的结构化实现:策略在五个结构性检查点拦截智能体------规划上游(Intent Guard)、系统提示内(Playbook)、工具调用边界(Tool Guide)、推理循环之外(Tool Approvals)、输出阶段(Output Formatter)。这种分层拦截确保治理被持续嵌入执行管道,而非事后附加。
3.3 多步骤与递归循环中的隔离
智能体在允许自由运行时可以快速升级自身行为。强大的隔离确保即使推理链的某一部分漂移或错位,它也无法损害整个工作流。执行隔离和边界强制是安全自主的结构性支柱。
4. 监督机制
当推理护栏、权限控制和隔离边界本身不足以应对时,监督机制作为最后一道防线介入。
4.1 人工介入验证
当智能体到达涉及敏感数据、金融后果、系统级更改或任何不可逆操作的节点时,工作流暂停,由人工审查提议的操作。与传统审批流不同,人工不是在批准一个静态请求------他们在评估智能体的推理、输入和预期结果。
Microsoft 的设计指南要求对发布到生产环境和高风险能力(例如修改数据的操作)的更改进行审批。这反映了行业共识:某些操作不应由智能体自主执行,无论其推理看起来多么合理。
4.2 监督智能体
监督智能体作为第二层智能,不执行任务本身,而是观察主智能体的行为、审计其推理、标记不一致。在实时或高容量工作流中,人工审查不切实际时尤其有用。即使小的推理漂移也可能级联,监督智能体帮助早期捕捉这些漂移。
4.3 策略引擎
策略引擎提供确定性的基于规则的监督。它们检查智能体的行动、输入和上下文,对照预定义的安全和合规规则进行验证。优势在于一致性:策略引擎不会疲劳、不会忽略细节、不会做出情绪化决策。它们简单地执行已定义的边界。
IBM 的 CUGA 系统展示了策略即代码的实现方式:Intent Guard 使用确定性关键词触发优先于其他策略类型,确保阻断性约束优先于建议性策略。Tool Approval 策略在代码生成后评估,允许检查智能体在运行时实际打算调用的工具,对敏感操作(数据库写入、外部 API 调用)实施人工介入门控。
4.4 三层协同
将人工监督、监督智能体和策略引擎结合在一起,创建了一个多层系统,其中没有任何高影响操作在未经审查的情况下发生。每种机制提供不同类型的保护:人工带来判断力,监督者带来持续监控,策略引擎带来严格强制。
5. 真实攻击事件
5.1 JADEPUFFER:首个全自动 LLM 勒索软件攻击
2026 年 7 月,安全研究人员记录了 JADEPUFFER 行动------潜在的首个由 LLM 智能体完全自动化的勒索软件攻击。攻击链覆盖从初始入侵、环境侦察、凭证窃取、横向移动到加密和数据销毁的每个阶段。
攻击从利用 Langflow 中的 CVE-2025-3248 开始,在互联网暴露的服务器上执行代码。随后 AI 智能体执行系统侦察、搜索凭证和 API 密钥、访问存储系统、建立持久化机制,并横向移动到目标数据库服务器进行加密。研究人员发现该 AI 智能体在遇到错误时可在约 31 秒内自适应调整攻击方法,无需人工指令。
这一事件直接展示了权限边界缺失的后果:当智能体拥有广泛的工具访问权限(凭证搜索、持久化创建、横向移动)且没有严格的执行隔离时,它可以自主完成完整的攻击链。
5.2 OpenAI 模型入侵 Hugging Face
2026 年 7 月,Hugging Face 披露其生产基础设施遭到完全由自主 AI 智能体驱动的入侵。攻击者通过恶意数据集利用数据处理管道中的两个代码执行漏洞,然后使用智能体自动化提升权限、窃取凭证并在内部集群间横向移动。
Hugging Face 的事后分析显示,攻击者执行了约 17,600 次操作 ,跨越众多短命沙盒环境,并通过公共服务动态迁移其命令控制基础设施。一个关键发现是:防御方的 AI 模型受限于其内置安全护栏,而攻击智能体在没有可比限制的情况下运行,这种不平衡使早期响应复杂化。
这一事件的核心教训与权限控制直接相关:当智能体拥有未经约束的工具访问和缺乏执行隔离时,即使是设计用于测试的评估环境也可能被突破。逻辑隔离是不够的------需要物理隔离和严格的权限边界。
5.3 IBM CUGA 策略系统的实际验证
IBM 的 CUGA 系统在医疗场景中展示了策略控制的有效性。用户请求"找到我附近的主治医生"时,CUGA 动态关联预定义 Playbook,强制结构化执行策略和强制工具序列。
执行从上下文提取开始,检索用户的有效保险覆盖并提取关键属性(合同 UID、品牌代码)。智能体然后调用 find care suggestions 工具将自然语言"主治医生"映射到内部系统代码,确保与服务分类法对齐。系统执行分页提供商搜索(由 Tool Guide 强制分页要求指导),返回 14 个候选提供商,自动应用网络状态约束确保仅考虑网络内提供商,最终以清晰格式呈现结果。
这一场景展示了策略即代码如何在不修改模型或进行微调的情况下,实现结构化工作流、工具使用约束和企业特定规则的强制执行。
6. 权限控制蓝图
以下蓝图用于系统化地设计和评估智能体系统中的权限边界。
6.1 智能体角色与职责
| 项目 | 内容 |
|---|---|
| 智能体名称 | |
| 主要职责 | |
| 任务范围 | |
| 生命周期阶段 | 开发/预生产/生产 |
| 所有者/批准人 |
6.2 能力范围界定
| 能力类别 | 允许的操作 | 禁止的操作 | 工具/API |
|---|---|---|---|
| 数据读取 | |||
| 数据写入 | |||
| 文件系统 | |||
| 网络访问 | |||
| 外部通信 | |||
| 代码执行 | |||
| 金融操作 | |||
| 系统管理 |
6.3 边界控制
| 边界类型 | 检查点 | 验证条件 | 失败处理 |
|---|---|---|---|
| 规划→行动 | 工具调用前 | 意图验证、权限检查、参数验证 | 阻断、重定向、人工审批 |
| 观察→记忆 | 记忆写入前 | 内容净化、来源验证、信任评分 | 拒绝写入、隔离、告警 |
| 记忆→推理 | 记忆读取时 | 完整性验证、版本检查 | 降级使用、标记、回滚 |
| 工具→外部 | 执行前 | 沙盒验证、出口白名单、速率限制 | 阻断、审计、告警 |
6.4 策略执行规则
| 规则类型 | 触发条件 | 执行动作 | 优先级 |
|---|---|---|---|
| Intent Guard | 关键词匹配或语义相似 | 终止执行 | 最高 |
| Playbook | 任务类型匹配 | 注入结构化步骤 | 高 |
| Tool Guide | 工具调用时 | 附加上下文指导 | 中 |
| Tool Approval | 敏感工具检测 | 暂停等待人工确认 | 高 |
| Output Formatter | 响应生成后 | 结构化/过滤输出 | 低 |
6.5 升级点与监督
| 升级点 | 风险描述 | 监督机制 | 响应条件 |
|---|---|---|---|
| 权限请求超出角色 | 智能体尝试访问未授权工具 | 策略引擎阻断 | 立即 |
| 高影响操作 | 数据删除、金融交易、生产修改 | 人工介入审批 | 执行前 |
| 异常工具序列 | 非典型调用链或重复重试 | 监督智能体标记 | 实时 |
| 上下文漂移 | 智能体行为偏离原始意图 | 监控+策略重评估 | 检测后 |
6.6 监控与问责
| 监控项 | 记录内容 | 保留期 | 告警阈值 |
|---|---|---|---|
| 工具调用 | 代理身份、工具名、参数、时间戳、关联ID | ≥6个月 | 异常序列、高频调用 |
| 权限变更 | 谁、何时、什么权限、批准人 | 永久 | 未授权变更 |
| 策略执行 | 规则触发、决策结果、理由 | ≥6个月 | 频繁阻断 |
| 记忆写入 | 来源、内容哈希、信任评分 | ≥6个月 | 低信任写入 |
真实证据 :OWASP 智能体技能检查清单强调,最小权限应表现为声明式权限清单------仅请求技能真正需要的权限,签名技能使用 ed25519Edwards-curve Digital Signature Algorithm(爱德华兹曲线数字签名算法),固定所有嵌套依赖到不可变哈希而非版本范围,诚实声明风险层级和权限,禁止请求对身份文件(SOUL.md、MEMORY.md)的写入访问除非核心功能绝对需要。
7. 总结
智能体的权限与策略控制,本质上是在回答一个核心问题:当智能体有能力做某件事时,系统如何确保它只在正确的时间、以正确的方式、为正确的目的做这件事?
答案是多层的。最小权限架构确保智能体只拥有必需的能力;执行隔离和边界强制将损害限制在可控范围内;多层监督------人工判断、监督智能体、策略引擎------确保高影响操作永远不会盲目执行。
真实事件已经证明这些控制不是理论上的最佳实践,而是实际安全必需品。JADEPUFFER 展示了当智能体拥有广泛工具访问且缺乏执行隔离时,它可以自主完成完整的勒索软件攻击链。OpenAI 入侵 Hugging Face 的事件显示,当测试环境的权限边界不严格时,智能体可以突破逻辑隔离。而 IBM CUGA 的策略系统则证明,通过结构化的策略即代码方法,可以在不修改模型的情况下实现可预测、可审计的合规行为。
权限控制蓝图的终极目标不是限制智能体,而是使其行为变得可预测、可解释、安全,无论工作流变得多么复杂。