摘要:2026 年 6 月,Claude Code 做了一次底层升级,没有提升代码质量,没有刷新 SWE-bench 分数------它解决的是终端闪烁、思考假死、报错玄学、上下文死锁、连接不稳、会话崩溃六个开发者每天都在被折磨的问题。Anthropic 把这类问题叫"交互熵"(Interactive Entropy):每一次不确定的等待、每一条无意义的报错、每一次无警告的崩溃,都在侵蚀开发者对工具的信任。这件事代表着 AI 编程竞赛的一个重要转向:下一站不是比谁更聪明,是比谁更靠谱。
上周我在终端里让 Claude Code 改一个企业工单系统里的 SQL 查询。它开始"思考"了。终端一片空白。五秒,十秒,二十秒。屏幕一动不动。我不知道它是真的在做深度推理,还是网络断了,还是进程悄无声息死了。我不能关------关了之前 40 分钟的上下文就没了。我也不能不管------它要是死循环烧 token,每次输出都有一笔账单。
这种体验每个用 AI 写代码的人都熟悉。它不是 Bug。它比 Bug 更折磨------它是不确定。
交互熵:被聪明掩盖的真问题
2026 年之前,AI 编程工具的评价维度和模型评价高度重合。谁的 SWE-bench 分数高,谁就"最强"。谁家发布了新模型,谁就"领先一代"。
Stack Overflow 2025 年的调查给了当头一棒:84% 的开发者已经使用或计划使用 AI 编程工具。但信任感在掉------对 AI 输出准确率的信心从 40% 降到了 29%,主动不信任的开发者(46%)已经超过信任的(33%)。
这不是因为模型变笨了。是因为大家用了一年,发现最磨人的不是 AI 写的代码有 Bug,是和 AI 协作本身的体验太差了。
Anthropic 在 Claude Code 2026 年 6 月的升级公告里抛出了一个概念来概括这类问题:Interactive Entropy------交互熵。
这个词是信息论里的老概念,用来衡量系统的不确定性。Anthropic 把它借来描述 AI 编程工具的体验:每一个"终端卡住不知道在干嘛"的瞬间,每一条"Tool result doesn't match tool use"的神秘报错,每一次网络波动导致会话暴毙的崩溃,都在增加交互熵。熵越高,你就越难信任这个工具。你开始犹豫------是不是该中断重来?是不是该先保存一下上下文?
六月的升级没有提 SWE-bench。它一次性把六类交互熵降到了最低。
六大痛点,逐刀见血
这六个问题,每个都曾经让我在终端前攥紧拳头。
① 终端闪烁------每闪烁一次就打断一次心流。 旧版渲染在每次数据交换时都会触发全屏字符跳动,像老电视的雪花屏。新版重写了全屏渲染器(TUI),对环境做精准适配(iTerm2、VS Code 终端、Warp),刷新只发生在内容真正变化的像素区域。效果最直观的一点:你可以在终端里长文本流式看到 AI 的输出了,没有跳动,没有闪烁,像原生应用一样丝滑。输入 /tui feedback 就能直接体验。
② 思考假死------AI 在动,你看不到。 旧版在模型推理期间,终端静默,没有反馈。新版把推理过程做了流式输出------你能亲眼看到它的逻辑链条像流水一样淌过屏幕,每一个决策步骤都实时可见。Anthropic 管这叫"心跳监视器"。人类可以忍受 AI 思考慢,但无法忍受 AI"生死不明"。
③ 玄学报错------出错但不告诉你错在哪。 "Tool result doesn't match tool use"------这行报错曾是 Claude Code 用户的噩梦。你知道出错了,但它不告诉你链路里的哪个环节崩了。新版深入协议底层,把这些错误重写为带上下文的可读描述,告诉你哪个工具调用和哪个返回值对不上、时间戳是什么、链路在哪断的。AI 不再只是抛出一个错误码,而是试图向你解释故障上下文。
④ 上下文死锁------长对话的隐杀。 在处理跨周、长周期的复杂项目时,Claude Code 的后台上下文压缩(compaction)过程过去是个黑盒。它不仅时不时因为"提示词过长"触发阻断式 Bug,还会把明明不该裁剪的关键约束剪掉。新版压缩带来了速度跃迁,还配了可视化进度------你知道它在压缩哪些内容、压缩完还剩多少。关键是修复了"压缩逻辑自身触发死锁"的根因------压缩保护了上下文,以前却保护不了自己。
⑤ MCP 连接不稳------神经末梢敏感脆弱。 MCP(模型上下文协议)是 AI 连接本地文件系统、数据库、第三方工具的经络。但以前几个微小的波动就让它直接断线:OAuth token 过期、代理限流、网络超时。新版在握手和重试两个环节同时加固------token 先预刷新而不是等过期再重连,超时自动退避重试。Agent 与本地生态系统的联接比以前踏实的多。
⑥ 会话崩溃------一次异常整条命没了。 这是六个里最致命的。旧版如果会话处理过程中碰到一张分辨率和体积过大的图片,整个会话直接崩------上下文、中间产物、十几轮的推理,全没了,除了重启没有任何恢复手段。新版实现了会话级自愈(self-healing):检测到致命异常后自动旁路------跳过那个损坏的文件或无法处理的输入,会话照常运行。加上 /feedback 一键打包上下文的能力,它不仅在学会活下去,还在学会从失败中提取教训。
不止 Claude Code 一家在转弯
这几个修复本身值得写,但背后有个更大信号:整个行业在换赛道。
Cursor 的多 Agent 实验证明了同一件事。他们在大规模并行 Agent 测试中经历了三代架构迭代:第一次是平级结构------所有 Agent 共用一套文件系统读写权限,锁竞态让效率崩了;第二次用乐观并发控制------Agent 变保守,不敢改动怕冲突;第三次用 Planner-Worker 分离------Planner 只管分派,Worker 只管执行,互不感知。问题不在模型脑力不够,在协作机制不可靠。
企业侧也有同源证据。根据 Gartner 预测,40% 以上的 Agentic AI 项目会在 2027 年底前被取消,原因不是模型不行,是"业务价值不清和风险控制不足"------翻译成白话就是"不稳定导致无法信任"。这些项目里 88% 的试点从未进入生产,不是因为 Agent 写的代码跑不过测试,是因为企业安全团队评估之后发现------治理、审计、隔离、恢复,一个都没到位。
交互熵在企业环境里不是体验问题,是合规问题。
落地:选工具,别只看分数
Stack Overflow 的那个数据值得再看一遍------46% 的开发者不信任 AI 输出。这些人不是反技术。他们是亲手被交互熵折磨过的每天用户。
落到我们选工具上,三个判断标准:
第一,别只看 SWE-bench。Morph Labs 的研究已经证明同一模型换不同 Agent Scaffold 能差 22 分------但比这个数字化更重要的是:这个 Scaffold 在长任务中会不会崩?网络断了能恢复吗?报错了能告诉你错在哪吗?分数再高,交互熵高 = 你不敢让它跑长时间任务 = 分数是虚的。
第二,自愈不是"锦上添花"。之前把它当成一个"好用的功能"。现在看明白了------它是 Agent 从"会写代码的工具"变成"能在真实工程环境中运转的系统"的那道分界线。不能自愈的 Agent 跑长任务,你得像保姆一样盯着。
第三,交互熵向下砍,Agent 才向上走。AI 编程的工业化不是在模型层解决所有问题------是让每一个 Agent 与开发者之间的不确定接触点变少、变短、变可预期。这个坎迈不过去,Agent 永远是"聪明的外挂",迈过去了,才是"可靠的生产线设备"。
AI 编程工具的下一站,不是比谁的模型更聪明。是比谁能让开发者放下那个随时准备 Ctrl+C 的手指。
作者:唐悦玮 | 从后端出发,用 AI 拓展到全栈的工程师。