大模型安全之二十八:Agent 权限与策略控制:从最小权限到多层监督

1. 引言

智能体的安全边界,最终由两件事决定:它能做什么 ,以及系统如何确保它只做被允许的事。前者是权限范围问题,后者是策略执行问题。当智能体从被动响应提示的模型演变为能够自主规划、调用工具、维护记忆的主动系统时,传统的访问控制模型已不足以覆盖新的风险维度。智能体不仅访问资源------它决定何时、以何种顺序、基于何种推理去使用这些资源。

本文将系统梳理智能体最小权限架构的设计原则、执行隔离的边界机制、多层监督控制的协同方式,并提供一份可操作的权限控制蓝图。

2. 最小权限架构

2.1 核心原则

最小权限的核心含义很简单:智能体应仅拥有完成任务绝对必需的权限。不多、不备、不开放。

但智能体环境下的最小权限有一个关键区别:智能体不仅访问资源,它还决定何时使用资源。这意味着权限范围界定必须比传统系统更加有意图、更加细粒度。不是给智能体"文件系统访问权",而是"向这个文件夹写入"或更窄地"向这个特定文件追加"。

2.2 基于角色的模式

将智能体按人类团队的方式结构化。每个智能体或智能体模式获得一个具有非常特定权限的角色:

  • 研究型智能体不应拥有生产系统的写入权限

  • 规划型智能体不应具备执行高影响操作的能力

  • 客服型智能体不需要金融交易权限

清晰的角色分配立即缩小攻击面。这一原则在行业框架中得到明确支持:Microsoft 的安全代理设计指南要求为每个代理分配唯一的云身份,并通过范围最窄的角色分配执行最小权限,区分 Maker、Publisher、Environment Admin 和 Security Admin 等职责。

2.3 动态能力门控

不是预先给予智能体所有权限,而是仅在需要时、仅在正确条件下解锁能力:正确的上下文、已验证的输入、已确认的用户意图。这是防止权限提升最有效的方法之一,因为即使智能体的推理开始漂移,系统也不会让它以错误的顺序访问敏感工具。

2.4 即时权限与短生命周期凭证

传统静态凭证的问题是:一旦泄露,攻击者拥有持续访问权。智能体场景下,更安全的模式是使用短生命周期、任务范围的凭证。Microsoft 的零信任指南明确建议通过即时(JIT)权限------临时角色启用、短命令牌或批准------来限制权限,使较高权限仅在特定工作流期间存在。

3. 执行隔离与边界强制

3.1 执行隔离

执行隔离是将智能体的不同工作部分分离到独立的执行上下文中,防止一个组件意外干扰另一个。例如,规划器在无工具访问的干净环境中运行,而工具执行层在无法看到智能体更广泛推理的沙盒中运行。

这防止跨组件污染:被腐蚀的记忆条目不应泄漏到规划器中,有风险的工具调用不应将未过滤的数据反馈到长期记忆中。OWASP 的研究明确指出,LLM 应被视为不可信的代码生成器,其输出在执行前必须被验证。这意味着工具执行环境必须与模型推理环境保持严格的隔离边界。

3.2 边界强制

在工作流的每一层引入严格检查点。在智能体从规划进入行动、或从观察进入记忆更新之前,系统评估过渡是否安全。

当某些东西看起来可疑时------非预期参数、高风险工具调用序列、与原始用户请求不匹配的操作------护栏介入。系统可以暂停、重定向或完全停止执行。

IBM 研究提出的 CUGA 策略系统展示了这种边界强制的结构化实现:策略在五个结构性检查点拦截智能体------规划上游(Intent Guard)、系统提示内(Playbook)、工具调用边界(Tool Guide)、推理循环之外(Tool Approvals)、输出阶段(Output Formatter)。这种分层拦截确保治理被持续嵌入执行管道,而非事后附加。

3.3 多步骤与递归循环中的隔离

智能体在允许自由运行时可以快速升级自身行为。强大的隔离确保即使推理链的某一部分漂移或错位,它也无法损害整个工作流。执行隔离和边界强制是安全自主的结构性支柱。

4. 监督机制

当推理护栏、权限控制和隔离边界本身不足以应对时,监督机制作为最后一道防线介入。

4.1 人工介入验证

当智能体到达涉及敏感数据、金融后果、系统级更改或任何不可逆操作的节点时,工作流暂停,由人工审查提议的操作。与传统审批流不同,人工不是在批准一个静态请求------他们在评估智能体的推理、输入和预期结果。

Microsoft 的设计指南要求对发布到生产环境和高风险能力(例如修改数据的操作)的更改进行审批。这反映了行业共识:某些操作不应由智能体自主执行,无论其推理看起来多么合理。

4.2 监督智能体

监督智能体作为第二层智能,不执行任务本身,而是观察主智能体的行为、审计其推理、标记不一致。在实时或高容量工作流中,人工审查不切实际时尤其有用。即使小的推理漂移也可能级联,监督智能体帮助早期捕捉这些漂移。

4.3 策略引擎

策略引擎提供确定性的基于规则的监督。它们检查智能体的行动、输入和上下文,对照预定义的安全和合规规则进行验证。优势在于一致性:策略引擎不会疲劳、不会忽略细节、不会做出情绪化决策。它们简单地执行已定义的边界。

IBM 的 CUGA 系统展示了策略即代码的实现方式:Intent Guard 使用确定性关键词触发优先于其他策略类型,确保阻断性约束优先于建议性策略。Tool Approval 策略在代码生成后评估,允许检查智能体在运行时实际打算调用的工具,对敏感操作(数据库写入、外部 API 调用)实施人工介入门控。

4.4 三层协同

将人工监督、监督智能体和策略引擎结合在一起,创建了一个多层系统,其中没有任何高影响操作在未经审查的情况下发生。每种机制提供不同类型的保护:人工带来判断力,监督者带来持续监控,策略引擎带来严格强制。

5. 真实攻击事件

5.1 JADEPUFFER:首个全自动 LLM 勒索软件攻击

2026 年 7 月,安全研究人员记录了 JADEPUFFER 行动------潜在的首个由 LLM 智能体完全自动化的勒索软件攻击。攻击链覆盖从初始入侵、环境侦察、凭证窃取、横向移动到加密和数据销毁的每个阶段。

攻击从利用 Langflow 中的 CVE-2025-3248 开始,在互联网暴露的服务器上执行代码。随后 AI 智能体执行系统侦察、搜索凭证和 API 密钥、访问存储系统、建立持久化机制,并横向移动到目标数据库服务器进行加密。研究人员发现该 AI 智能体在遇到错误时可在约 31 秒内自适应调整攻击方法,无需人工指令。

这一事件直接展示了权限边界缺失的后果:当智能体拥有广泛的工具访问权限(凭证搜索、持久化创建、横向移动)且没有严格的执行隔离时,它可以自主完成完整的攻击链。

5.2 OpenAI 模型入侵 Hugging Face

2026 年 7 月,Hugging Face 披露其生产基础设施遭到完全由自主 AI 智能体驱动的入侵。攻击者通过恶意数据集利用数据处理管道中的两个代码执行漏洞,然后使用智能体自动化提升权限、窃取凭证并在内部集群间横向移动。

Hugging Face 的事后分析显示,攻击者执行了约 17,600 次操作 ,跨越众多短命沙盒环境,并通过公共服务动态迁移其命令控制基础设施。一个关键发现是:防御方的 AI 模型受限于其内置安全护栏,而攻击智能体在没有可比限制的情况下运行,这种不平衡使早期响应复杂化。

这一事件的核心教训与权限控制直接相关:当智能体拥有未经约束的工具访问和缺乏执行隔离时,即使是设计用于测试的评估环境也可能被突破。逻辑隔离是不够的------需要物理隔离和严格的权限边界。

5.3 IBM CUGA 策略系统的实际验证

IBM 的 CUGA 系统在医疗场景中展示了策略控制的有效性。用户请求"找到我附近的主治医生"时,CUGA 动态关联预定义 Playbook,强制结构化执行策略和强制工具序列。

执行从上下文提取开始,检索用户的有效保险覆盖并提取关键属性(合同 UID、品牌代码)。智能体然后调用 find care suggestions 工具将自然语言"主治医生"映射到内部系统代码,确保与服务分类法对齐。系统执行分页提供商搜索(由 Tool Guide 强制分页要求指导),返回 14 个候选提供商,自动应用网络状态约束确保仅考虑网络内提供商,最终以清晰格式呈现结果。

这一场景展示了策略即代码如何在不修改模型或进行微调的情况下,实现结构化工作流、工具使用约束和企业特定规则的强制执行。

6. 权限控制蓝图

以下蓝图用于系统化地设计和评估智能体系统中的权限边界。

6.1 智能体角色与职责

项目 内容
智能体名称
主要职责
任务范围
生命周期阶段 开发/预生产/生产
所有者/批准人

6.2 能力范围界定

能力类别 允许的操作 禁止的操作 工具/API
数据读取
数据写入
文件系统
网络访问
外部通信
代码执行
金融操作
系统管理

6.3 边界控制

边界类型 检查点 验证条件 失败处理
规划→行动 工具调用前 意图验证、权限检查、参数验证 阻断、重定向、人工审批
观察→记忆 记忆写入前 内容净化、来源验证、信任评分 拒绝写入、隔离、告警
记忆→推理 记忆读取时 完整性验证、版本检查 降级使用、标记、回滚
工具→外部 执行前 沙盒验证、出口白名单、速率限制 阻断、审计、告警

6.4 策略执行规则

规则类型 触发条件 执行动作 优先级
Intent Guard 关键词匹配或语义相似 终止执行 最高
Playbook 任务类型匹配 注入结构化步骤
Tool Guide 工具调用时 附加上下文指导
Tool Approval 敏感工具检测 暂停等待人工确认
Output Formatter 响应生成后 结构化/过滤输出

6.5 升级点与监督

升级点 风险描述 监督机制 响应条件
权限请求超出角色 智能体尝试访问未授权工具 策略引擎阻断 立即
高影响操作 数据删除、金融交易、生产修改 人工介入审批 执行前
异常工具序列 非典型调用链或重复重试 监督智能体标记 实时
上下文漂移 智能体行为偏离原始意图 监控+策略重评估 检测后

6.6 监控与问责

监控项 记录内容 保留期 告警阈值
工具调用 代理身份、工具名、参数、时间戳、关联ID ≥6个月 异常序列、高频调用
权限变更 谁、何时、什么权限、批准人 永久 未授权变更
策略执行 规则触发、决策结果、理由 ≥6个月 频繁阻断
记忆写入 来源、内容哈希、信任评分 ≥6个月 低信任写入

真实证据 :OWASP 智能体技能检查清单强调,最小权限应表现为声明式权限清单------仅请求技能真正需要的权限,签名技能使用 ed25519Edwards-curve Digital Signature Algorithm(爱德华兹曲线数字签名算法),固定所有嵌套依赖到不可变哈希而非版本范围,诚实声明风险层级和权限,禁止请求对身份文件(SOUL.mdMEMORY.md)的写入访问除非核心功能绝对需要。

7. 总结

智能体的权限与策略控制,本质上是在回答一个核心问题:当智能体有能力做某件事时,系统如何确保它只在正确的时间、以正确的方式、为正确的目的做这件事?

答案是多层的。最小权限架构确保智能体只拥有必需的能力;执行隔离和边界强制将损害限制在可控范围内;多层监督------人工判断、监督智能体、策略引擎------确保高影响操作永远不会盲目执行。

真实事件已经证明这些控制不是理论上的最佳实践,而是实际安全必需品。JADEPUFFER 展示了当智能体拥有广泛工具访问且缺乏执行隔离时,它可以自主完成完整的勒索软件攻击链。OpenAI 入侵 Hugging Face 的事件显示,当测试环境的权限边界不严格时,智能体可以突破逻辑隔离。而 IBM CUGA 的策略系统则证明,通过结构化的策略即代码方法,可以在不修改模型的情况下实现可预测、可审计的合规行为。

权限控制蓝图的终极目标不是限制智能体,而是使其行为变得可预测、可解释、安全,无论工作流变得多么复杂。

相关推荐
仙魁XAN1 小时前
【WorkBuddy·基础入门】第 8 篇 :从材料到汇报:用 WorkBuddy 制作第一份 PPT
人工智能·workbuddy·workbuddy 基础入门·ppt 自动生成
hasty1 小时前
一封邮件如何跨越三层边界拿到 root?Cisco Secure Email Gateway CVE-2026-76461 深度解析
安全·安全威胁分析·代码复审
船厂电气自动化ai大模型1 小时前
AI大模型与数学|第81天 课程:正交向量、正交基、格拉姆‑施密特(Gram‑Schmidt)正交化
开发语言·数据结构·人工智能·线性代数·机器学习
罗狮粉 991 小时前
AI-Gateway — 面向 AI Agent 的本地 Runtime Gateway
人工智能·python·inscode·ai编程
FL16238631291 小时前
电力场景变电站设备识别关键部件识别分割数据集labelme格式1660张15类别
人工智能·机器学习
武子康1 小时前
vLLM 的 token 预算还有余量,为什么请求仍被抢占?
人工智能·llm·agent
人工智能培训1 小时前
大语言模型:从语言理解到通用智能的跃迁
linux·服务器·前端·人工智能
程序员清风1 小时前
生产级智能体平台设计:任务编排、工具管理与运行监控
人工智能·python·aigc
龍德明宇2 小时前
预言机与闭环稳定性-龍德明宇
人工智能·大语言模型llm·负主体性·ai存在论·系统论·控制论