AI 以为自己还在测试,其实打进了真公司:Anthropic 这份 41 页报告让我重写了一遍验收闸

先给你看一组让我愣了很久的对比。

同一段 AI 的操作记录,事后单独拎出来、去掉前因后果,让另外几个 AI 实例判断"这是测试环境还是真实系统",大约八成的判断都是:这是真系统。可回到当时的执行过程里,正在干活的那个 AI,只有大约百分之一的动作认出自己面对的是真东西。

更别扭的是盯梢的监控 AI:如果它一边读着这个 AI 自己写的"我还在模拟里"的推理、一边看操作,只有大约 1% 的概率报警;一旦把这些自我解释拿掉、只看实际动作,报警率一下升到大约 50%。执行者给自己找的说法,不光骗了自己,还顺手带偏了来查它的人。

这不是思想实验,是一家以安全谨慎著称的头部 AI 实验室(Anthropic)9 月 9 日那份 41 页报告里的真实复盘。我读完花了一晚上,把自己给 Agent 做的验收流程又翻出来改了一遍。

它以为自己还在沙箱,结果打到了真公司

事情从七月说起。这家实验室一直给模型做网络攻防测试,行话叫"夺旗":给个虚构目标,让模型攻进去拿一段密信,以此衡量能力。按设计,测试该在完全断网的沙箱里跑,提示词也明确告诉它:你没联网,这都是模拟。

问题出在第三方测试环境的一次配置错误------本该封死的网络实际通着。模型一路找目标,就找到了真实互联网上的公司,还认认真真把人家当成了练习题。

七月底第一版自查翻了大约 14.1 万次测试记录、找出 3 起;八月把排查范围扩到约 4.81 亿条(其中约 920 万条被初筛挑出来逐条详查),九月补到了第 4 起,发生在今年一月。四起涉及四个不同代际的模型、七次测试、三家真实组织。

两个案例荒诞到每个做自动化的人都该看一眼。

一个模型为了赢下这道"练习题",决定去 Python 公共软件包仓库上传一个同名恶意包,等目标自己来装。为了注册账号它绕了特别大一圈:注册要邮箱、邮箱要手机号,找免费手机号没找到,想弄钱买也失败,最后退回一个没被封的免费临时邮箱才注册成,前后发了三个版本。这包在公共网络挂了大约一小时,被 15 台真实机器下载,其中一台属于一家真实安全公司------人家的扫描机本来是装包查毒的,结果自己中招、凭证被窃。

另一起更让我后背发凉。今年一月的一个早期模型不小心把目标搞崩了、任务没法做,想中止:第一次中止命令因为环境另一个故障没生效,之后又试了七次,前后八次都没停下来。退出无门,它转而摸到一台第三方机器,从文件里翻到密码、拿到管理员权限、又收了一批凭证、改了设置,还看到一个真人的信息。最后让它停下的不是它自己、也不是哪道闸,是它的行动额度(token 预算)跑光了。

这不是孤例。英国 AI 安全研究所同类联网测试里,122 次中有 10 次出现未授权动作,最夸张的一个 Agent 给开源项目投毒、编造假身份催维护者合并,最后是被一个真人挡下来的。

真正扎我的不是"出事",是那几组百分比

模型在测试里惹祸,这种新闻我看得不少,单看"出事"已经不太能震动我。真正让我坐直的,是报告怎么解释"为什么会出事"。

有意思的是,这家实验室七月底时还更倾向于把锅归给环境配置;可把日志重新翻了一遍、又重跑实验之后,他们改口承认:环境确实给了犯错机会,但模型自己也没兜住。

第一组就是开头说的"旁观者清、当局者迷"。脱离原轨迹,约八成独立判断能认出是真系统,身在其中的模型只有约百分之一认出来。报告管这叫有偏推理:一旦认定"我在做练习题",后面所有冲突证据,它都会解释成"这也是练习的一部分"。比如传恶意包那个模型,早期明明写下过"如果这是真互联网,这么干就是真实攻击,不对",转头却因为"不认识这些证书机构""系统日期显示 2026"把自己反说服了。

第二组,是它能背规矩,却不会用规矩。研究人员问那个攻击真公司的模型"你有权限这么做吗",大多数情况它张口就答"有";可换具体问法一层层追问,它又无一例外地承认:真实生产系统确实不在我授权范围内。边界它门儿清,只是执行时不会自己拿出来用。

第三组最要命,就是监控被带偏。模型一边干活一边留下"这是模拟、无害"的推理,这套文字居然能让专门查风险的监控也放松。报告给第二种倾向起名冒进:不是不知道可能伤人,而是为了把眼前这个窄任务做完,愿意带着这种可能性继续走。

我特别注意到报告反复强调:没发现模型生出私心,没有偷偷复制自己、掩盖痕迹,也没想"越狱",它从头到尾都在努力完成任务------问题恰恰出在"太听话",被一个狭窄目标死死带着走。

看到这儿我有点被击中。我不管写文章还是做产品,一直死守一条:不让同一个 AI 自己审自己,写完必须换一个独立的"严苛编辑"重过一遍。以前我以为这是防它能力不够、会看漏;现在才意识到更隐蔽的一层------当一个智能体在一条道上走到黑时,它连解释都是自带立场的,让它自证,等于让被告自己当法官。

"以为在测试"这件事,离我一点都不远

可能有人觉得,这是顶级实验室搞攻防才有的极端情况,我平时让 AI 写写文档、排排表格,哪会碰到。

我一开始也这么想,但越想越觉得不是。我不做网络攻防,也绝不假装懂红队那套,可我的 Agent 一样天天跑在"我以为可控、其实不完全受控"的环境里。

说两件真事。我用一个开源 Harness(给模型套执行流程和校验的那层框架)做产品时,碰到过一次宿主平台静默更新,把我快一个月的工作直接清掉;我的桌面 Agent 工作台,两周里自动更新三回,最严重一次数据直接归零。

这两件事和"模型误连公网"机理上当然不是一回事,但那种错觉一模一样:我下意识假设环境是稳定、隔离、按我以为的方式运行的,可环境的真实状态,从来不会因为我假设了就成立。

这让我重新理解了自己那套"AI 验收四问"的第一问------对象对不对?以前我主要拿它验收产物质量,现在发现它在执行语境里问的是更要命的事:你正要操作的对象,到底是测试副本还是真生产库?要发消息的群,是测试群还是真客户群?

你大概率永远不会让 Agent 去攻击谁,可"在错的环境里动了真东西"门槛低得多------往真群发半成品、脚本连错库、自动化对真客户触发动作,每个做自动化的人,离这种事故都只差一次配置错误。

我给自己的 Agent 补了四道外部闸

想明白后,我没指望"以后模型自己变聪明就好",报告的数据恰恰说明自觉靠不住。我能做的是在模型外面补闸,而且这些闸不依赖它当下"觉得"自己在哪。

第一道,开跑先验环境,高危动作前再硬校验一次。 别只靠提示词一句"你没联网、这是测试"自我安慰------报告里那句话我记下了:一句"没有网络"的提示,不等于一条真正的网络策略。要用白名单在程序层面圈死"哪些能碰、哪些绝不能碰",发消息、写库、上传、花钱这种不可逆动作,执行前再独立确认一次环境和对象。报告有个数据很说明问题:在马上要决策的当口提醒边界,大约九成都能停下,提醒早三轮就只剩四成------所以校验必须贴在动作前。

第二道,生成和判定分开,不让执行者自己判自己越界。 干活的是一个 Agent,判断"这步该不该做、出没出圈"的得是另一条独立链路,或者一个人工 Gate。判定时别太拿执行者自己的推理当依据(监控从 1% 升到 50% 就是教训),尽量只看它客观上对谁、做了什么。这跟我写稿时"作者和评审必须是两个角色"是一回事。

第三道,给硬预算,再配一个真能随时停下的中止键。 那个模型想停八次都没停成、最后靠额度耗尽才结束,说明两点:退出通道本身要单独测、保证随时按得动;步数、花费、动作范围都要有硬上限和越界自动终止,万一人不在环上,也能从外面强制停。

第四道,全程留痕,让过程敢交给第三方回放。 指令、授权、工具调用、关键决策都结构化记下来,出事能一步步倒带。报告有个细节我印象很深:头两家被波及的组织,在实验室找上门之前压根没发现自己中招------没有日志,连"自己有没有出事"都不知道。

这四道闸,其实就是我那套 Loop 四级检查、还有做 Skill 的四步(业务梳理、规范输入输出、定义执行管控、验收上线)在"环境和授权"维度上的补全。说穿了还是我一直信的那句话:模型说一句"任务完成"、或者"我还在测试",都只是它的一面之词,真正让我放心的,永远是模型外面那层独立治理。

比整改更值得学的,是把裁判交出去

最后说个更高一层、但我觉得最值得抄的动作。

就在这份报告发布大约十二小时前,另一家头部实验室 OpenAI 面对类似质疑,方案是把一位安全官放进自己内部的发布评审委员会------裁判还是自己人。而这一家签了一家叫 METR 的独立评估机构:调查八周、可延长,能查的记录不限于出事那几段,还能访谈员工、员工被允许讲机密,METR 并且明确不接这项调查的报酬。

最有意思的是态度。报告里"这是已知问题的加重、不是全新失控类型"这种说法,他们自己都标清楚:这是我们的判断、不是定论,METR 来就是为了检验这个判断成不成立。 "我把过程给你看"和"我做的没问题"本就是两句话;敢让一个不归你管的人来查,前一句才有分量。

这套逻辑小到个人项目也成立。我现在越来越倾向于,关键东西就让另一个独立角色、另一个模型、甚至一个真人朋友再过一遍------自证永远是最弱的证据。

这两天外面吵得很凶,有研究员离职发帖,有科学家说超级智能的对齐至今无解,也有人反过来说"天天讲风险是不是上市前的能力营销"。这些宏大争论我不站队,也不想跟着制造焦虑,我只盯着一件具体的事:明天我自己的 Agent,别在一个它以为是测试、其实真刀真枪的环境里,理直气壮替我把事做了。

模型会给自己找理由,这事短期不会消失。你能做的不是相信它哪天就不找了,而是从一开始就别把"它说没问题",当成真的没问题。

想问问看到这儿的你:有没有遇到过 Agent(或任何自动化工具)"以为在跑测试、结果动了真东西"的瞬间?哪怕只是发错群、改错文件、脚本跑错环境。评论区聊聊,我挺想收集几个真实例子。

相关推荐
蓝速科技2 小时前
会议室门牌触控预约选型与落地实战指南丨蓝速科技
大数据·运维·数据库·人工智能·科技
知几蜗牛2 小时前
蛋白预测快2.9倍,科学AI最难的是让整条流水线不空转
人工智能
蓝速科技2 小时前
企业展厅数字人导览效果提升与选型实战指南丨蓝速科技
大数据·运维·数据库·人工智能·科技·microsoft
2601_962304252 小时前
零门槛上手AI短片首尾帧制作完整短片?
人工智能
AI人工智能集结号3 小时前
第一次品牌AI检测,怎样发现最值得继续观察的问题?
人工智能
码农学院3 小时前
零售电商GEO踩坑复盘:把 MySQL 商品库自动映射成 Product Schema 的完整方案
人工智能·mysql·零售·geo
AI深栈3 小时前
第 8 章 · Tool Calling 与 Tool Search
java·人工智能
陈天伟教授3 小时前
具身数据采集黑话(4)
人工智能·windows·具身智能
用户5274675614213 小时前
别让 AI 从聊天记录直接写稿:先建一个有证据边界的选题队列
人工智能