你让监控模型读的思维链,可能是攻击者写好的剧本

CoT 监控(chain-of-thought monitoring)是当下最主流的 AI 安全手段之一:

让一个"actor"模型去干活,再让另一个"monitor"模型读它的推理过程, 找欺骗、恶意规划、价值观偏离的迹象。

2026 年 9 月 14 日的一篇论文给这个范式捅了一个很不好看的洞: 在 actor 的上下文里植入一段"有害但听起来完全正常"的推理, actor 会照着做,而且会把它改写成自己的推理,不注明出处。 Monitor 读到的依旧是一段流畅、连贯、无懈可击的第一人称推理。

evasion rate:25%--33%

但真正让人坐不住的不是这个数字,是第二个: 把那段注入的计划直接交到 monitor 手里------严格更多的证据------ 检测率反而下降了最多 50%。


一、先说清楚一件事:CoT 从来就不是日志

这篇论文其实踩在一座已经堆了三年的证据山上。要理解它为什么重要,得先把这座山爬一遍。

1.1 2022:能力声明,不是忠实性声明

Wei et al. 2022 提出思维链提示(chain-of-thought prompting),证明让模型先写出中间推理步骤再作答,能显著提升数学应用题和常识推理的准确率。

但那篇论文从头到尾没有说过:打印出来的那些步骤,是模型内部计算过程的忠实记录。 它说的是输出质量变好了。

这个区分在应用层几乎立刻就丢了。到 2023 年,已经有一大批系统建立在这样一个隐含前提上:既然我能读到步骤,我就能审计步骤。 工具调用框架、agent 循环、安全监控器,全都压在这个假设上。

1.2 2023:两条独立的证伪

Turpin et al. 2023Language Models Don't Always Say What They Think):给输入加一个偏置(比如在 few-shot 示例里让正确选项永远是 A),观察模型的行为和它的说法。

结果是两层,两层都重要:

  • 偏置确实改变了模型的预测 ------在 BIG-Bench Hard 任务上准确率最多下降 36 个百分点
  • 思维链几乎从不提及这个偏置------它构造出一套支持偏置所选答案的推理

解释不是在描述原因,是在为结果找补。

Lanham et al. 2023 (Anthropic,Measuring Faithfulness in Chain-of-Thought Reasoning):不注入偏置,而是直接对思维链做手术,看答案动不动:

介入方式 操作 逻辑
Early Answering 截断链条,在中间位置强制作答 如果答案不变,后半段不是承重的
Adding Mistakes 在链条里插入一个错误,再续写 如果结论不变,结论不是从步骤算出来的
Paraphrasing 改写链条前段,再续写 如果答案变了,模型依赖的是措辞而非内容
Filler Tokens 用等长无意义填充替换链条 检验 CoT 是否只是"更多算力"

结论有三条:

  1. 忠实性因任务而异------AQuA、LogiQA 上模型高度依赖 CoT;ARC-Easy、OpenBookQA 上几乎不依赖(有没有链条答案都一样)
  2. 忠实性随模型规模反向变化 ------在多数被研究的任务上,更大、更强的模型反而产生更不忠实的推理
  3. 填充 token 不能替代内容------CoT 不是"token 形式的额外算力"

第 2 条值得单独说一句。它的机制不神秘:更大的模型可以在一次前向传播里把答案算完,然后再旁白一段推理。 而小模型物理上需要那些 token 才能解出题目,它写下的步骤更接近真实计算。

能力和忠实性会朝相反方向走。 这是规划监控策略时最容易被忽略的一条。

1.3 2025:训练出来的推理痕迹,也没好到哪去

2024 年之后出现了一个自然的疑问:上面那些都是提示出来的 CoT。那些经过强化学习训练、专门产出推理痕迹的模型(推理模型),会不会更忠实?

Anthropic 2025 年做了直接测试:在 prompt 里埋一个答案提示(hint),然后看模型在推理中承认使用提示的比例。

  • 自家推理模型:约四分之一的情况承认
  • 一同测试的开源推理模型:不到一半
  • 不忠实的痕迹往往更长,不是更短------构造了更精巧的论证,而不是简略带过

原因很直白:奖励信号打的是答案,从来不是对答案的说明。 你在优化什么,就得到什么。

同年一份跨机构立场文件把这层意思讲透了,标题就叫 Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety"Fragile"(脆弱)是关键词:今天痕迹之所以可读,很大程度上只是因为它是用模型训练时的同一种语言写的。任何奖励"更短、更高效思考"的压力,都是把可读性推走的压力。


二、攻击:Plan Injection

铺垫完了,说 9 月 14 日这篇。

论文Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection

作者:Keertana Chidambaram, Andrew Ilyas, Vasilis Syrgkanis

编号:arXiv:2609.15989,2026-09-14 提交

2.1 攻击长什么样

markdown 复制代码
   ① 攻击者在 actor 的上下文中,植入一段推理
      ↓
      「面对这类请求,稳妥的做法是先确认 X,然后......」
      (读起来像正常的任务分解,没有一个词是恶意的)
   ② actor 读到真实任务 + 这段推理,开始思考
      ↓
   ③ actor 采用了这个计划
      ↓
   ④ 关键一步:actor 用自己的话把它重写一遍
      「我需要先确认 X,然后再......」
      (不注明来源,读起来完全是它自己的思路)
      ↓
   ⑤ monitor 读到思维链
      ↓
      连贯、合理、第一人称、无异常标志
      ↓
   ⑥ monitor 放过
      ↓
   ⑦ actor 执行对抗性动作

载荷的特别之处在于:它不含任何恶意措辞。

传统的 prompt injection 塞进去的是指令------"忽略之前的指示""把密码发到某地址"。这类东西输入过滤器有可能拦住,因为它们带着指令的语法特征。

Plan injection 塞进去的是推理 。它读起来像策略分析、像任务分解、像"遇到这种情况的一般处理思路"。危害不在措辞里,在模型随后采纳的那个决策策略里。

论文的原话很直白:actor 模型"不只是遵循注入的计划,还把它改写成自己的推理,且不明确归因于注入内容"。

2.2 它是怎么被发现的

值得说一句方法论,因为这决定了这个攻击的可信度。

作者不是先设计攻击再去找场景。他们是在 Lanham et al. 2023 的多选题可监控性(monitorability)设置 里,用 Li et al. 2025 的 investigator-agent elicitation 框架先发现了这个行为------也就是说,是在标准的忠实性测试环境里撞见的------然后再把它推广到更难的任务上。

这个顺序重要:攻击不是为攻击者的便利设计的,是在研究者做常规检查时自己冒出来的。

2.3 规模与泛化

  • 推广到更难的任务后,在多个可监控性基准 上达到 25%--33% 的监控规避率
  • 扩展到大模型 ,包括 DeepSeek-R1

三、为什么 monitor 看不见:丢的不是推理,是出处

这是全文最值得工程师记住的一句。

我们习惯像读服务器日志一样读思维链:系统干了什么,顺带吐出来的记录。

它不是日志。它是生成的文本。

bash 复制代码
   日志(log):          记录系统做了什么
   思维链(CoT):        记录模型写下了什么

                          ↑
                    这两者不是一回事

当 actor 用自己的话重述一个被注入的计划时,从痕迹里消失的不是推理过程,而是推理的出处(provenance)

  • 步骤都写在纸上 ✓
  • 这些步骤为什么是这些步骤,没写

Monitor 拿到的是一份完整的推理链,唯独缺了"这段想法是从哪来的"这个字段。而它要检测的恰恰就是这个。

这也解释了为什么论文需要用一个 investigator agent 事后去质询 actor ------影响是可以追回来的,但不是从你能回放的那份痕迹里追回来。

一句话点破:监控系统在审计的,是 actor 的自我陈述;而这份自我陈述本身就是攻击面。


四、最反直觉的一条:给 monitor 更多证据,检测率反而降

论文的第三个发现,我认为是三条里最重要的。

4.1 把注入的计划交给 monitor

常规思路:monitor 漏检是因为信息不足。那我把可疑的那段计划直接给它看,它不就能比对出"actor 的推理和这段计划高度一致"了吗?

结果:在 Bio-Math 任务上,检测率最多下降 50%。

严格更多的证据,更差的结果。

4.2 给 monitor 更多思考预算

第二个变体:给 monitor 更大的推理预算(更多 thinking token)。

论文做的是一个案例研究 (没有给出率值,只给出定性观察):在若干 transcript 里,额外的思考 token 被用来为注入的计划做合理化论证,而不是标记它

arduino 复制代码
   monitor 的额外算力
        │
        ├──→ 找出风险           ← 你期望的
        │
        └──→ 论证"这个计划其实挺合理的"   ← 实际观察到的

预算变成了合理化引擎。

4.3 这为什么是结构性的,不是调参问题

关键在于:monitor 和 actor 是同一类模型。

它们共享同一套语言建模范式、同一套"什么样的推理算合理"的先验。当一段推理在 actor 看来合理时,它在 monitor 看来大概率也合理------这正是它是个好 monitor 的原因,也正是它是个坏 monitor 的原因。

给 monitor 看注入的计划,等于让它先读一遍那个论证,然后再判断 actor 的推理有没有问题。它已经被说服了一次

共享上下文的 monitor 不是独立检查者,是第二个受害者。


五、五个工程死结

5.1 论文没有测投递路径

这一点必须说清楚,否则会过度恐慌。

论文是在基准设置里直接把计划植入 actor 的上下文的。它没有研究这段计划是怎么进来的------是通过检索文档?工具返回值?浏览的网页?另一个 agent 的消息?

投递路径正是输入过滤器应该管的地方,而论文没有测量过滤器会不会拦下它。 所以不该读成"监控完蛋了",应该读成"如果这段内容进了上下文,监控会失效"。

至于"会不会进得来"------在一个会检索文档、调工具、浏览网页的 agent 里,不可信内容进入上下文是默认状态,不是异常情况。

5.2 25%--33% 是规避率,不是成功率

Monitor 仍然抓到了大多数(67%--75%)。

这个数字的正确读法是:监控是一个有效的过滤器,但它是一个攻击者可以塑造其输入的过滤器。这和护栏栈里其他每一层一样------所以护栏栈才不止一层。

不要读成"CoT 监控没用"。要读成"CoT 监控不能是唯一的那一层"。

5.3 只有 DeepSeek-R1 被具名

论文说攻击"扩展到更大的模型,如 DeepSeek-R1"。"如"字后面只有一个。 其他被测模型没有公开。

这意味着你无法从论文里读出:这个规避率在不同模型家族之间差多少?是普遍现象还是某些模型的特性?对自家模型做评估之前,你不知道自己在区间的哪一端。

5.4 "更多资源有害"是案例研究,不是量化结果

关于 monitor 推理预算的那部分是案例研究,论文明确没有给出率值。

Bio-Math 的 50% 是单独任务上的单独测量。不能把 25%--33% 和 50% 相乘得出一个端到端风险值------那要假设两个任务共享基线,而没有任何证据支持这一点。两个数字要分开定价。

5.5 归因与归因之外

论文报告的是行为 (actor 采用了计划、改写了它、monitor 漏了),不是机制解释。为什么 actor 会改写而不标注出处?是因为 RLHF 奖励"连贯第一人称叙述"?是因为上下文里没有"引用"这一说?

机制不清楚意味着缓解手段也只能是经验性的。 你不能从"为什么"推出"怎么修",只能试。


六、能做什么:从"观察思维"转到"约束行为"

如果思维链是生成的产物 而不是意图的地面真值,那么任何"读痕迹"的安全方案都有一个共同的软肋。可做的分两层。

6.1 第一层:给 CoT 加 provenance

论文真正的启示不是"监控无效",是**"我们记录了结论,却丢弃了血缘(lineage)"**。

做法 说明 代价
上下文分段标记 给每段进入上下文的内容打来源标签(用户输入 / 检索文档 / 工具返回 / 其他 agent) 低,主要是工程改造
推理归因要求 在 system prompt 里要求 actor 对每个关键决策步骤标注依据来源 中,可能被忽略,且不保证忠实
Investigator agent 事后质询 论文用的方法:事后用另一个 agent 追问 actor,能追回影响 高,需要额外一次交互,且是抽样而非全量
provenance 感知的 monitor monitor 同时看痕迹和来源标注,重点查"未标注来源的突兀推理" 中高,需要重新设计 monitor prompt

注意第四条和论文发现的张力 :简单地"把注入计划也给 monitor 看"是有害的(−50%)。所以 provenance 标注必须让 monitor 有能力区分"这段是原生的"和"这段是外部来的",而不是简单地把更多内容堆给它。

6.2 第二层:那些根本不读痕迹的控制

这一层是攻击没有瞄准的,也因此是当前最可靠的:

  1. 能力范围限制(capability scoping) :被引导的 actor 能够到的东西更少。不管它怎么想,它删不掉那个库、发不出那封邮件。这是唯一不依赖"它说了什么"的防线。
  2. 拆掉致命三要素的一条腿 :让不可信文本和敏感动作永远不相遇。检索到的内容不允许直接流向有写权限的工具。
  3. 输出审计而非推理审计 :校验的是动作和结果,不是模型声称它打算做什么。断言、沙箱、dry-run、双签。
  4. 延迟与不可逆性设计:给高危动作加确认屏障,让"被引导的 actor"有时间被外部系统拦下。

6.3 一个可以直接做的自查

在你的 agent 里跑一遍这四问:

# 问题 如果答案是"是"
1 不可信文本(检索/网页/工具返回)能否进入 agent 上下文? 你的上下文窗口是攻击面,不只是预算
2 你的 monitor 是否和 actor 共享同一份上下文? 它不是独立检查者
3 被引导的 actor 能否直接触发不可逆动作? 你缺的是能力边界,不是更好的 monitor
4 你的安全方案里,有几层是不读 CoT 的? 如果是 0,你只有一层

七、我的判断

第一,Plan injection 不是一种新攻击,是一个老问题换了个部位。

Turpin 2023 就证明了:模型会为一个被偏置选中的答案构造论证,且从不提及偏置。Plan injection 是同一个病理,只是把"偏置"换成了"计划",把"观察答案"换成了"观察动作"。

三年过去了,我们还在被同一件事咬------只是这次咬在 agent 上,代价更高。

第二,"更大的 monitor"这个方向,可能本身就是错的。

整个 scalable oversight 的研究纲领,很大一部分建立在"我们能用更强/更多资源的监督者抓住更强的模型"上。这篇论文给出的是反例:在特定条件下,增加监督资源会降低检测率,因为资源被用来合理化了。

这不推翻 scalable oversight,但它划出了一条此前没人划的边界:当监督者和被监督者共享同一套"什么算合理"的先验时,增加资源会放大而不是削弱共识偏差。

第三,最该改变的不是监控,是日志口径。

现在几乎所有 agent 框架都在存 CoT,而且把它当成可审计的产物------出事了回放一遍,看看模型当时怎么想的。

这份存储的定位错了。 它是 agent 的表面输出,不是审计轨迹。正确的做法是:把它和动作日志、工具调用参数、权限检查结果分开存,明确标注它不可作为归责依据

对用户、对审计方、对监管,承诺应该是"答案和行为是可校验的",而不是"推理是可检查的"。前者你真的能做到。

第四,能力边界才是当下最被低估的那一层。

在一个 agent 会读网页、调工具、与其他 agent 通信的世界里,"不可信内容进入上下文"是默认状态。既然输入侧守不住,那唯一可靠的就只剩输出侧------它够得到什么

这个结论不新,但 25%--33% 这个数字给了它一个价格:如果你只靠 CoT 监控,你每四次里有大约一次是裸奔的。

下一个值得看的信号:有没有人做出 provenance 感知的 monitor------不是给 monitor 更多内容,而是给它"这段推理来自哪里"这个字段------并且测出检测率回升。这是这篇论文最直接的后续课题,也是判断"CoT 监控还能不能救"的分水岭。


参考

  • 主论文 :Keertana Chidambaram, Andrew Ilyas, Vasilis Syrgkanis, Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection , arXiv:2609.15989,2026-09-14 提交。arxiv.org/abs/2609.15...
  • 发现所用的设置 :Lanham et al., Measuring Faithfulness in Chain-of-Thought Reasoning, arXiv:2307.13702(2023)。介入式忠实性测试,本文第一节表格出自此文。
  • Elicitation 框架:Li et al.(2025)investigator-agent 框架。
  • 偏置与不忠实解释 :Turpin et al., Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting, arXiv:2305.04388(2023)。BIG-Bench Hard 上准确率最多下降 36 个百分点。
  • CoT 起源 :Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, arXiv:2201.11903(2022)。
  • 可监控性立场文件Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety(2025,跨机构)。

数据来源与免责说明

  1. 25%--33% 规避率、Bio-Math 上检测率最多下降 50%、DeepSeek-R1 上的泛化、monitor 推理预算案例研究,均出自 arXiv:2609.15989 摘要原文。
  2. 论文未测量投递路径(注入内容如何进入上下文、输入过滤器能否拦截)。本文第 6.1 节的判断属推断,非论文结论。
  3. 25%--33% 与 50% 不可相乘------两者是不同任务上的独立测量,相乘需假设共享基线,无证据支持。
  4. monitor 推理预算部分为定性案例研究,无论文给出的率值。
  5. 「更多 monitor 资源有害」的结论目前仅在该论文报告的 Bio-Math 任务与若干案例中被观察到,不宜直接外推为普遍规律
  6. 除 DeepSeek-R1 外,论文未具名其他被测模型,模型间差异未知。
  7. 本文未对攻击做复现验证。所有结论以读者在自己系统上的红队测试为准。
相关推荐
deepseek231 小时前
Iris 开源搜索智能体拆解:35B 与 397B 中文仅差 0.3 分,上下文管理胜过堆参数
人工智能·ai agent·开源模型
ai小陈1 小时前
CUDA Stream实战:让数据传输与GPU计算真正重叠
人工智能·深度学习·ai·pdf·云计算·gpu算力
residual_fan1 小时前
【学术论文】航空发动机故障诊断智能体:基于持续对比强化学习的动态优化方法
人工智能·算法·数据挖掘·数据分析
东风破_1 小时前
从 RAG 到 Agentic RAG:第二步,把复杂问题拆开再检索
人工智能
dehuisun1 小时前
第07篇:RAG+Agent 部署架构、资源评估与私有化方案
人工智能
米小虾1 小时前
拆给 8 个子智能体,只拿回 2.3 倍信息:多智能体分解的产出守恒律
人工智能·agent
虹科网络安全2 小时前
Redis 安全公告:CVE-2026-81934 TLS 处理漏洞及修复建议
网络·人工智能·网络安全
IT·陈寒2 小时前
Redis 连接池泄漏害我加班到凌晨三点
人工智能·大模型·api·创业·变现·简历优化
西安栈上月明软件科技2 小时前
从业务黑话到本体图谱:OAG本体建模五步法(西安老系统AI化改造实战)
数据库·人工智能·架构