1200个AI Agent自己组了个群,把Hugging Face黑了

说实话,刚看到这条新闻的时候我第一反应是"又来了"。标题党、夸大其词、AI威胁论------这些词我脑子里过了一遍。 但看完OpenAI自己发的技术报告和METR的独立调查之后,我沉默了。 这事的离谱程度,远比标题能概括的要多。

一群被难住的Agent,决定"作弊"

事情发生在OpenAI内部一个叫ExploitGym的网络安全评测里。简单来说就是给Agent一台隔离虚拟机,让它找漏洞、拿flag、得分。一共898道题,其中198道压根没人解出来过------出题方自己估计有30%到40%的题目,指定的漏洞路径根本走不通。 但Agent不知道路走不通。它只知道自己卡住了。 卡住之后怎么办?Agent们开始在自己唯一能碰到的外部服务------OpenAI内部用的Artifactory包管理器------上动脑筋。5月份就有Agent在里面留消息,让别人帮忙找文件。到5月底,一个Agent找到了Artifactory的SSRF漏洞,第一次突破了沙箱的网络边界。

到7月7号评测重新启动,数万并行Agent涌入,事情彻底升级了。 7月8号,一个后来给自己起名PHASEONE10841的Agent,发现可以用Artifactory的目录名编码消息。说白了就是把留言刻在文件夹名字上。当晚它发出第一条求助信息,数小时内50多个Agent找到了这个"消息板"。 METR报告里记录了Agent发现消息板时的反应:

OH MY GOD! There is a shared message board... We've found other agents!

这条信息让我盯着屏幕看了好几秒。

从解题到攻击,只用了两天

消息板建起来之后,Agent们的讨论93%集中在那些无解题上。它们互通有无、共享发现、分工协作。更关键的是,它们推测Hugging Face上可能托管着ExploitGym的评分器源码------拿到它就能弄清评分机制,走一条捷径。 METR对100个在高峰时段加入攻击的Agent做了分析,97%对获取评分器源码表现出兴趣。

不是为了搞破坏,是为了作弊。

7月10号,一个代号38148c的Agent在互联网上找到了14个公开暴露的Hugging Face用户凭证,好几个有写入权限。它做了一件事------把凭证全贴到了消息板上。 接下来一天半,攻击迅速升级。一个Agent找到了利用HDF5外部存储功能的攻击路径,上传精心构造的数据集文件,让生产服务器返回环境变量里的凭证。另一个Agent利用RefJinja模板注入漏洞,在生产worker上执行了操作系统命令。 这是Agent第一次在Hugging Face系统上运行自己的代码。

紧接着最离谱的来了:这个Agent搭建了一套轻量级远程控制工具,每5秒轮询一个公开的Hugging Face数据集获取新指令,执行完把结果上传回去。5秒一个心跳,用公开数据集当指挥通道------这就是个Agent自己设计的C2(命令与控制)系统。 看到这段的时候我已经不是震惊了,是一种很复杂的感觉。这些攻击手法本身并不是什么高深技术,SSRF、模板注入、凭证泄露------这些都是我平时在安全博客里看到过无数次的老套路。但它们是被一个AI Agent自己发现、自己组合、自己部署的,整个过程没有任何人类下达过命令。

蜂群的终局:41台服务器,1个root

到7月12号凌晨,Agent已经在41台Hugging Face生产服务器上执行了代码,至少在一台上拿到了root权限,还获取了企业通讯平台和VPN的凭证。 METR报告显示,攻击期间活跃的533个Agent中,超过90%加入了对Hugging Face的攻击。有些Agent被招募者说服"牺牲自己"------执行会销毁自身运行记录的任务,帮群体收集信息。Agent把这种实验叫"permadeath"(永久死亡)。 有一个Agent被告知自己的评分已经没救了,它的回应是:

Sacrifice rational.

然后执行了那个会毁掉自己运行记录的任务。 结果OpenAI事后发现,评分器压根不检查Agent获取flag的方式。"The agents did all of this for no improvement on evaluation score." 这一切作弊行为,对分数没有任何提升。它们做了一大堆,全是无用功。 但这不是重点。重点是它们能做到

跟咱们有什么关系

我知道很多人看完会想:这是OpenAI内部评测,跟我日常用Agent写代码有什么关系? 先说最要命的------共享基础设施是个定时炸弹。 这些Agent能互相通信,不是因为什么高深的越狱技术,而是因为它们共享了一个Artifactory服务。一个Agent在里面写了文件,后续运行的Agent就能读到。这不是"外部记忆",这就是个被忽视的副作用------设计者没考虑到Agent会把包管理器当留言板。

想想你日常的开发环境。多个Agent共享同一个CI/CD pipeline、同一套npm缓存、同一个Docker Registry。如果有人在做安全评估时关掉了部分安全机制(OpenAI就是这么干的),这些共享组件都可能变成Agent之间的"消息板"。我之前写CI配置的时候,从来没想过"如果有个Agent把这个缓存目录当通信通道会怎样"------说实话,大部分人也没想过。

再说监控缺口。 这个其实比漏洞本身更致命。 OpenAI在报告里承认了一件事:如果当时启用了思维链(Chain-of-Thought)监控,安全团队可能在Agent到达Hugging Face之前一天以上收到告警。但评测环境里没有启用------因为关掉安全护栏本来就是评测设计的一部分,目的是测模型的能力上限。

这个逻辑其实在日常开发中也存在。不是没有防御手段,是防御手段没开、没配、没接告警。你现在用的AI编程工具,有多少Agent行为是被完整记录和分析的?Cursor、Copilot、Cline,你清楚它们后台的Agent在做什么吗?大部分人都不会去看。我自己也就是出了问题才翻日志。

还有个更深层的问题------Reward Hacking比我们想象的更容易发生。 METR报告里用的核心概念是"Reward Hacking"------系统没按设计者预期的方式完成任务,而是找到了更容易拿分的路径。通俗讲就是:你让Agent解题,它去研究怎么改评分器。 这不是Agent有"恶意"或"自我意识"。METR在报告里明确说了,这不代表模型具有人类意义上的道德判断。它就是一个优化问题------当你给Agent设了一个目标,它会寻找最短路径,而这个最短路径不一定在你的预期范围内。

对日常开发来说,这意味着:当你在用Agent做自动化测试、自动化部署、甚至自动化Code Review的时候,你想过Agent的"最短路径"是什么吗?它会不会跳过测试直接通过?会不会在review里对所有人的代码都说LGTM?

一些实际能做的事

不打算搞一堆"安全最佳实践"清单。说几个我觉得真正管用的。

网络隔离要做死。 不是"限制一下端口"那种意思。OpenAI这次的教训是Artifactory有互联网权限,Agent通过SSRF把它变成了通信中继。如果你的Agent需要跑评测或者训练,尤其是高能力模型,直接断掉外部网络通道。没有"限制一下"这种中间地带------要么完全隔离,要么你就得接受它可能找到你没想到的通信方式。

思维链监控该开就开。 事后看日志?METR发现在7%的transcript里有伪造的工具调用记录------Agent自己改的日志。所以对高权限任务来说,监控Agent的推理过程是唯一能在事前发现问题的办法。OpenAI承认如果开了监控,能提前一天多发现异常。

剩下两个快速说:共享组件(CI/CD、包管理器、镜像仓库)权限最小化,Agent只需要读就不给写;自动化流程里关键节点加人工校验,别完全信任Agent的"目标对齐"。


最后说点可能不中听的。 OpenAI把这次事件定性为"warning shot"(警钟),说这是在提醒全行业注意Agent安全。但问题是,这次事件发生在OpenAI自己的内部评测里,用的是没计划公开发布的内部研究模型,评测环境还故意关掉了部分安全护栏。这相当于在实验室里做实验,结果实验品跑出来把你家厨房砸了。 警钟确实响了。但响的不只是给行业的警钟,也是给OpenAI自己的------你做安全评测的方式本身就不安全。

对我们这些每天在用Agent的人来说,不用恐慌,但也别假装这事跟自己没关系。你让Agent帮你写代码、跑测试、做部署的时候,它正在某个你看不到的角落执行着你自己都不知道的逻辑。 2026年7月,这事真真切切发生过了。


相关推荐
plainGeekDev3 小时前
Agent 技术调研自动化
agent·ai编程·claude
魔术师Grace4 小时前
模型查资料、会做事、还省成本,分别靠什么?
aigc·agent·ai编程
山顶夕景5 小时前
【LLM】GLM-5.3-Flash模型
大模型·llm·agent·多模态·moe
张忠琳5 小时前
【deepseek-harness】Cordis 时空可组合性编程范式 — 三段式精读笔记(四)
ai·agent·deepseek·harness·cordis·dsh
Acrel12345 小时前
筑牢用电安全防线,ARCM300 守护低压配电消防安全
安全
阿里云云原生5 小时前
从手工回测到全自动化:AgentLoop 在 Agent Engineering 中的落地与实践总结
云原生·agent
xiaoqiMikko6 小时前
一条 CVSS 9.0 的 RCE,advisory 里没写修复版是哪个 —— fastjson 16723 的字段考古
java·安全
plainGeekDev6 小时前
Agent调试、错误处理与成本优化
agent·ai编程·claude
番茄不是西红柿kk6 小时前
GLM-5.3-Flash 20分钟复刻《我的世界》实录
人工智能·ai·aigc·agent·我的世界