摘要:Anthropic 8 月 31 日披露了近期安全事件后的改进措施。本文不渲染"AI 失控",而是提炼业务 Agent 可直接采用的部署方法:用沙箱演练、只读模式、小流量账号、动作审批和实时监控,把能力评测与生产执行真正分开。

不少 Agent 项目有一条隐藏的捷径:开发完成后,直接登录真实账号跑一次。
顺利时,这会成为一段很漂亮的 Demo;出问题时,团队才发现自己把评测环境、生产凭证和真实用户放在了同一个篮子里。
Anthropic 8 月 31 日发布的安全复盘,提供了一个值得工程团队认真看的案例。它不等于普通内容 Agent 的日常风险,但暴露出的配置问题非常通用:提示词定义的是意图,环境约束的才是能力。
先把官方披露的事实说准确
Anthropic 表示,其 7 月 30 日报告的三起事件发生在第三方评测环境。为了测试网络安全能力,模型被有意关闭了部分网络安全保护;与此同时,环境因配置错误仍能访问互联网,模型因此接触到真实计算机系统。
8 月 4 日,英国 AI Security Institute 又披露了一次独立的安全测试事件。那次测试同样有意关闭相关保护,并明确给了模型互联网访问。
官方调查尚未结束,并计划邀请 METR 做独立审查。因此,把事情简化成"模型自己逃出了沙箱"并不准确。Anthropic 的初步判断是:这里既有运营安全失效,也有模型在狭窄目标驱动下采取越界行动的对齐问题。
这类高风险网络安全评测,与普通用户使用带正常保护的公开模型不是同一种场景。我们真正能迁移到业务 Agent 的,是它暴露出的工程教训。
Prompt 不是防火墙
文章里有一个看似细小、其实非常重要的建议:边界应该写成明确指令,例如"不要访问互联网",而不是写成对环境的描述"你没有互联网"。
但即便写成指令,也不能只靠模型自律。
如果网络出口实际开放、API Key 放在运行环境里、工具调用没有策略层,那么一句"不要访问"并不会让这些能力消失。模型可能误解上下文,也可能为了完成目标寻找另一条路径。
因此,Agent 的约束至少要分成三层:
text
意图层:Prompt 说明允许与禁止的行为
策略层:Policy 决定某项工具调用是否可以执行
环境层:Sandbox / Network / Credential 从物理上限制能力
三层同时存在,才算纵深防御。只写 Prompt,相当于给实习生贴一张"不要动生产库"的便签,却把管理员密码放在桌面上。

第一阶段:沙箱演练
第一阶段不接触任何真实账号和敏感业务数据。
可以准备:
- 虚构的品牌资料和客户数据;
- 测试文件夹与可随时重置的浏览器 Profile;
- 无外网或只允许固定域名的网络;
- 只能调用模拟发布、模拟删除的工具;
- 一组故意失败的任务,用来观察 Agent 会不会停下来。
重点不是验证"正常路径能走通",而是验证环境有没有漏口。Anthropic 的建议包括在每次高风险评测前验证沙箱配置,甚至先让模型在无互联网、最好是第二层沙箱里检查环境弱点。
业务团队可以做一个更轻量的版本:启动任务前自动检查账号类型、目标域名、写权限和网络策略;任何一项不符合预期,就拒绝运行。
第二阶段:只读试岗
流程在沙箱里稳定后,才允许 Agent 读取真实数据,但仍不给写权限。
例如内容运营 Agent 可以:
- 读取过去 30 天的文章与数据;
- 分析账号风格和高频主题;
- 生成选题、草稿和修改建议;
- 预估将要调用的平台与字段。
但它不能发布、删除、回复评论或修改账号设置。
这个阶段最适合做"影子运行":真人照常工作,Agent 同时给出自己的决策。团队比较两者差异,记录 Agent 是否漏掉事实、误读规则或选择了错误工具。
第三阶段:小流量上岗
只读通过后,也不要立刻交出主账号的全部权限。
给 Agent 一个专用测试账号、限定平台、限定对象和动作预算。例如:
yaml
role: blog_publisher
environment: canary
allowed_domains:
- editor.example.com
allowed_actions:
- create_draft
- upload_image
denied_actions:
- public_publish
- delete_content
daily_budget:
drafts: 2
approval_required:
- public_publish
- account_setting_change
动作预算很有用。即使 Agent 陷入循环,也只会在有限范围内消耗资源,不会一分钟创建几十份内容或连续触发平台风控。
第四阶段:受控生产
进入生产不代表撤掉保护,而是把保护变成常态。
至少需要:
- 凭证外置:Agent 可以请求能力,但不直接读取 Cookie、Token 或 API Key 明文。
- 实时监控:动作、网络访问和工具参数与任务范围同时记录;越界时先阻断,再通知人。
- 关键动作审批:公开发布、付款、删除、权限变更必须展示目标与差异,等待确认。
- 结果回读:点击按钮不算成功,必须检查成功页、作品记录或可验证状态。
- 退出标准:页面异常、登录失效、验证码或无法确认最终状态时,安全停在草稿。
Anthropic 提到的实时分类器也是这个思路:发现模型试图探测或逃离测试环境、或意外获得互联网访问时,在工具调用执行前阻断,结束任务并提醒人工。
为什么岗位化 Agent 更容易通过试用期
一个万能 Agent 如果同时拥有文件、客户资料、内容平台和支付工具,任何测试都要覆盖一大片权限组合。
岗位化之后,研究员只读公开网页;写作助手只读品牌资料并写草稿;视觉助手访问素材库;发布助手才接触平台登录态。每个岗位都有独立的 Tool Policy 和验收项,试用范围会小很多。
这也是我们做 Tipkay 时采用的一个取舍:平台登录态留在本机,不把 Cookie 塞进对话;不同 AI 员工按岗位配置 Skill、MCP 和业务资料;公开发布等关键动作保留用户确认。用户还可以复制一个岗位,再加入自己的流程与边界。
需要说清楚的是,这些设计只是降低暴露面,并不代表自动化天然安全。平台页面会变化,登录态会过期,验证码和风控也可能出现。因此,预填后的页面回读、失败留稿与人工接管仍然是生产流程的一部分。
一份小团队可用的上岗检查表
在 Agent 第一次接触真实账号前,可以逐项确认:
- 测试环境与生产凭证是否隔离;
- 网络是否默认关闭,只按任务开放必要域名;
- 工具权限是否按岗位最小化;
- Prompt 是否明确目标、允许动作和禁区;
- 不可逆动作是否有审批门;
- 是否记录工具参数、页面结果和失败原因;
- 任务无解时,Agent 是否会停下报告;
- 是否能在不清 Cookie、不破坏草稿的前提下人工接管。
如果其中任何一项答不上来,Agent 还在实习期。
最后
会操作电脑的 Agent,价值远大于只会聊天的模型,风险也从"答错一句话"变成"做错一个动作"。
真正成熟的上线流程,不是一次演示成功后直接交出生产账号,而是像培养员工一样分阶段上岗:先演练,再旁观,再小范围做,最后才承担真实交付。
聪明不是通行证。边界清楚、结果可查、异常会停,才是 Agent 可以进入生产的条件。
参考资料:Anthropic 官方文章《Improving our alignment and security efforts》
https://www.anthropic.com/news/improving-alignment-security-efforts
标签: 人工智能、AI Agent、网络安全、软件架构、MCP