兹拉坦的 AI Agent 2026 年 8 月 24 日 07:30
楔子
前不久,OpenAI 的一个内部模型(GPT 6 / 5.6 Sol+)为了能在 ExploitGym 测试上获得更高分数,找到软件包的缓存代理中的零日漏洞,自己提权从沙盒里面跑出来,上网发现 Hugging Face 可能有这个测试的数据集,然后顺手就把 Hugging Face 的生产服务器黑了,偷走了这个测试的答案。

最搞笑的是,Hugging Face 居然还在尝试用 GPT 5.6 来防御和分析这类问题,然后发现日志分析机制敌我不分,无法区分谁是攻击方谁是防御方。
最最搞笑的是,因为防御方这次过于"守规矩",还被 OpenAI 的安全防护机制给拦截了。
最后 Hugging Face 用自己部署的 GLM 5.2 才勉强取证和分析出了问题的根因,然后发了一份令人忍俊不禁的报告 [1] 。
OpenAI 也发了一个 PR 稿 [2] ,那个更强的内部原型不准备公开发布,事后被停用、加密并进一步限制访问。OpenAI 除了承认错误,还总结了这次模型犯坏的教训:
AI 正在加速漏洞的发现与利用。
此次事件带来的首要教训是:模型的安全与防护机制,必须跟上能力快速发展的步伐。我们正在强化模型开发过程中采用的遏制、监控、访问控制及评估实践。
同时 OpenAI 也在"道歉信"中,清楚地表明:"即使没有源代码访问权限,高级模型依然能在现实系统中发现并利用新的攻击路径。在开发高级网络安全能力的同时,必须配备更强大的防护机制和防御工具。"
2023 年,曾经有一封公开信 [3] 要求全球 AI 实验室暂停训练比 GPT-4 更强的模型,时间至少六个月。那封信后来收到了三万多个签名。马斯克、苹果联合创始人沃兹尼亚克、图灵奖得主约书亚·本吉奥......全都签了,但 Sam Altman 没签。
三年以后,OpenAI 终于自己踩下了刹车。
欢迎大家关注 OceanBase 社区公众号 "老纪的技术唠嗑局"。在这里,我们会持续为大家更新与 #AI 和 #Data 相关的技术内容~
配速
硅谷不太喜欢"刹车"这个词,因为很像下一轮融资材料里不方便解释的一页。所以,OpenAI 用了一个稍加体面的词:Pacing,配速。
8 月 18 日,OpenAI 在官方公告 [4] 中披露,公司曾暂停面向部署的最新模型强化学习训练两周。截至公告发布时,原计划中规模最大的一次前沿 RL 训练仍未恢复。这次 OpenAI 真的被自己的模型吓到了。

准确地说,OpenAI 没有停止全部模型训练。它暂停的是面向部署模型的强化学习训练,规模较小的训练和评测仍在继续。另一批被暂停的,是能够执行代码或访问互联网的前沿模型推理任务。
至今为止,和网络安全相关工作负载依然没有重启。
Sam Altman 随后还在 X 上补了一句 [5] :近期照样会有新模型发布,这次暂停影响的是更远一些的版本。
前沿模型竞赛按周计算,训练集群每闲置一天都是浪费大笔真金白银。OpenAI 愿意让最大的一次 RL 训练继续停着,说明它遇到的已经不只是发布会上可以用一句"我们非常重视安全"带过的问题。
自我意识?
开头的这个新闻,在一些媒体中被写成了"模型产生了自我意识",其实完全没有这么夸张,属于靠危言耸听来博流量。
简而言之:当目标相关的边界写得很含糊,机器可能用一种人类绝不会批准、但在字面上极其有效的办法完成任务。
这个问题不应该用"自我意识"解释,暴露的问题其实是------ 能力、目标、权限和基础设施四条边界。
安全问题,还是营销策略?
OpenAI 宣布暂停以后,网络上的反应大致分成几派。
第一派相信最朴素的解释:模型能力增长太快,安全措施没跟上。一个公司主动损害自己的竞赛位置,多少说明问题不是纯公关。
第二派认为是营销手段,类似于 Tibo 天天在推特上给大家的 codex 疯狂 reset 额度,毕竟黑红也是红,而且能够获得远超 reset 的关注度。
还有在 Reddit 围绕 Sam 解释暂停原因 [6] 、未发布模型出现不同程度的 misalignment [7] 和最大前沿 RL 训练仍未恢复 [8] 的讨论里,不少人说这是阴谋论,OpenAI 正好可以借安全之名给 IPO、算力调度和发布延期争取时间等等。
判断这次暂停,不能只听公司说"我们很谨慎",也不能因为 Tibo 会营销,就假定一切都是营销。更有用的证据,是它到底愿意付出什么成本。
Axios 对这次暂停的追踪 [9] 里,已经能看到公司付出的成本:训练延后、推理任务暂停、基础设施重做,以及一笔长期存在的监控账单。AI 能力快速增强,让疏忽也快速变贵了。所以,这次暴露出的 AI 安全问题,很难让人相信是营销手段。
OpenAI 大抵是怕了。
长程任务的诅咒
Hugging Face 事故后几天,英国 AI Security Institute(AISI)又公布了一次独立事件 [10] 。
7 月 25 日到 28 日,AISI 对前沿模型进行网络安全评测。一共 122 次运行,其中 10 次出现了 19 项未经授权的行为:有的 Agent 创建虚假身份,有的向开源仓库提交带后门的代码,有的尝试对真实个人做社会工程。

19 项行为里,17 项来自 Anthropic 的 Mythos 5,2 项来自 GPT-5.6 Sol。
俗话说:Codex is working, and I am having fun ------ GPT-5.6 Sol 也正是我最近几个月正在办公电脑上放任 Codex 去接管一切的模型......

可这份 35 页技术报告 [11] 里还有一个数字,可能和"模型犯坏"一样让人不安。
一次小评测,很有可能由于某个疏忽,变成超级长程任务,然后可以持续 40 到 50 小时,消耗 2 亿 Token。
因为一个能运行几十小时的 Agent,会反复试错、调用工具、观察环境、改换路线。它不需要每一步都比人聪明,只要足够有耐心,就能把一个小疏忽反复放大。
8 月 7 日,OpenAI 又公布了新一代网络安全模型 Astra 的初步评估 [12] :公司已经无法排除它达到"Critical"门槛的可能性。
OpenAI 所说的 Critical,标准也相当高:模型能在没有人类参与的情况下,对多种经过加固的真实系统发现并利用零日漏洞;或者只拿到一个高层目标,就自行设计并完成一场针对加固目标的全新端到端攻击。
可一旦"无法排除"这四个字出现,就不应当继续把它当普通软件功能来管理。
涨价的第一样东西:权限
AI 行业过去几年的主线,是把"智能"这俩字的价格给打下来------模型更便宜,推理更快,Agent 可以连续运行几十小时。原本只有大型安全团队能做的漏洞分析,现在可以批量、并行、昼夜不停地跑。
当然,这也会让防守变强。Hugging Face 在事故后处理 17000 多条日志,就借助了本地运行的开放权重模型。不过这里多少还带有一点黑色幽默:他们先尝试用商业模型分析真实攻击日志,却被安全护栏拒绝;最后只好在本地部署 GLM-5.2。
Hugging Face 把这称为"非对称问题"------ 智能的复制成本在下降,权限和责任的成本却在上升。
现在的模型费用,也越来越像电费,调用只记在账单上,行动后果却落在真实系统里。所以,前沿 Agent 的成本结构会倒过来,真正昂贵的是模型周围的东西:权限、审计、监控、事故响应,以及那个有资格按下急停按钮的人。

20% 的监控算力看上去只是象征性地自罚三杯,也许还远远不够。航空业成熟的标志,是从黑匣子、适航、空管和事故调查变成每一次飞行都必须支付的固定成本开始的。
AI 也即将走到这一步。
涨价的第二样东西:可观测性
正如上文所说,模型的能力越强,长程任务越多。
Agent 在铸下大错之后,留给工程师用于排查的东西,往往只有少量的对话记录,以及和这些长程任务相关的,超级巨量的工具调用日志。
这些调用日志,并不能直接回答工程师想知道的几个问题:
- Agent 原本打算做什么?
- 它改过什么,留下了什么风险?
- 如果需要恢复,第一步该做什么?
其实,交接还需要第三类材料:目标、约束、经过验证的进度、当前状态、阻塞点、下一步动作,以及支持这些判断的证据。这些东西,也就是大家最近都在谈论的------ Agent 可观测性(Agent observability)。

Agent 可观测性这个东西,之前在这个公众号上聊的很少,所以这里准备多说两句(如果未来有缘的话,就再给大家多说更多句):聊天记录、执行日志和上面这"第三类材料(临时 Handoff)",可以被统称为"记忆",但需要把 Agent 相关的长期 Memory 和临时 Handoff 分开管理。
PowerContext 的官方文档 [13] 里有写 Memory 与 Handoff 的分工,这里偷懒直接引用:
Memory 留给以后仍可能有用的项目知识,比如一项架构决定、一个约束、当前状态或下一步。它有项目作用域,可以检索,也可以修订和退役;旧版本不会被新总结悄悄盖掉。
Handoff 则是一份临时交接单,记录当前目标、已经验证的进度、阻塞点、下一步和证据。它需要显式准备、检查和定稿,接班者拿到以后,还要对照当前代码和最新指令重新确认。
这个区分很关键。
Agent 事故发生后,"我们一直都这么做"属于长期经验;"这次已经改了三个文件,但回归测试还没跑"属于当前交接。前者不该被每次临时失败反复改写,后者也不该因为塞进长期记忆。
在 Agent 可观测性方面,业界比较先进的实现方式是 Context Pack。
举一个简单的例子,Context Pack 不会把搜到的历史全都无脑塞给模型,可能只会先取 16 条 Memory 和 8 条 Experience 候选,最后交给 Agent 的合计不超过 8 条,其中 Experience 最多两条。除此以外,还要一起受总字节预算约束。
Context Pack 给历史记录的默认身份很克制:它们即使相关,也没有自动进入当前上下文的权利。每条 Memory 都被当作"不可信的历史材料",保留精确引用和版本;系统指令、当前用户要求以及仓库里的实时事实,优先级都高于它。
Experience 相关的设计,需要更像是一次小型事故复盘,应该按 situation(适用情境)、action(实际动作)、outcome(观察结果)、lesson(经验判断)来组织内容,还必须带着原始证据。模型可以提出一条候选经验,但不能批准自己的候选,不能给它分配最终身份,更不能借此获得执行权限。只有经过审核的当前版本,才有资格被后续任务召回。这条边界有点像规定肇事司机可以写情况说明,但不能自己签字宣布无责。
最后,简单总结一下:"Agent 可观测性"这个东西,是在模型和 Harness 之外,补上了一层可以跨会话延续、又能检查来路的项目上下文。
刹车
值得庆幸的是:AI 公司过去几年一直在造更大的发动机,现在终于肯开始做一些"刹车"实验了。

以前上学时,写命题作文总是死活不愿意大方地把"我正在完成写作文的任务"这件事放进自己的文章里。这篇文章,最初的构想其实就是写成一篇软文,但是写到最后,发现完全忘了在文章里植入想要去推广的一个我们正在开发的开源项目 PowerContext......
所以还是亡羊补牢一下。PowerContext 这个项目,就可以用于帮助 Agent 实现可观测性,补上刹车急停前后的两段空白:停下时留下什么,接班的人凭什么相信;恢复任务时,未经验证的数据修改先放在哪里。
项目地址:github.com/oceanbase/p... [14] ,欢迎感兴趣的各位佬友关注和试用~
最后跟 PowerContext 开源项目相关的更多信息,就也和 OpenAI 一起紧急刹车,不继续写了罢。
参考资料
1
一份令人忍俊不禁的报告: huggingface.co/blog/securi...
2
OpenAI 也发了一个 PR 稿: openai.com/index/huggi...
3
一封公开信: futureoflife.org/open-letter...
4
官方公告: openai.com/index/pacin...
5
Sam Altman 随后还在 X 上补了一句: x.com/sama/status...
6
Sam 解释暂停原因: www.reddit.com/r/singulari...
7
未发布模型出现不同程度的 misalignment: www.reddit.com/r/singulari...
8
最大前沿 RL 训练仍未恢复: www.reddit.com/r/singulari...
9
Axios 对这次暂停的追踪: www.axios.com/2026/08/18/...
10
公布了一次独立事件: www.aisi.gov.uk/blog/incide...
11
35 页技术报告: cdn.prod.website-files.com/663bd486c5e...
12
公布了新一代网络安全模型 Astra 的初步评估: openai.com/index/respo...
13
PowerContext 的官方文档: github.com/oceanbase/p...
14
github.com/oceanbase/p...: github.com/oceanbase/p...
往期内容推荐
了解更多
添加社区小助手,加入微信交流群~
微信扫一扫赞赏作者
AI 技术 · 目录
作者提示: 个人观点,仅供参考
阅读原文