Claude Sonnet 5.5:更快、更便宜的 Agent 模型
机构: Anthropic
发布时间: 北京时间 2026 年 9 月 29 日 02:00

Anthropic 正式发布 Claude Sonnet 5.5 。这一代的重点并不是扩大模型规模,而是提升 Agent 与 coding 任务中的执行效率:更少的 token、更少的工具调用、更短的任务完成时间,同时保持接近旗舰模型的能力。
核心变化
- 更快、更省: 相比 Sonnet 5,输出速度提升 30%+ ;典型任务成本最高降低约 30% 。API 单价保持为 2/M input tokens、10/M output tokens。
- Agent / Coding 提升明显: Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 提升至 70.6% ;CursorBench 4.0 从 34.1% 提升至 55.5%。
- 工具使用更高效: 模型更倾向于批量调用工具,以更少的步骤、shell runs 和 tool calls 完成任务。
- 安全能力同步增强: Sonnet 5.5 首次引入接近旗舰模型级别的网络安全 safeguards,并增加针对大规模 reasoning extraction / distillation 的防护。
为什么重要
Sonnet 5.5 更值得关注的不是单个 benchmark 分数,而是旗舰级能力正在下沉到更低成本的模型档位。
对于实际 Agent 系统,限制规模化部署的往往不是一次推理能否答对,而是长任务中的 token 消耗、工具调用次数、执行延迟和总体成本。Sonnet 5.5 的改进方向正对准这些系统级瓶颈。
与此前工作的关系
Sonnet 5.5 是继 Claude Opus 5.5 后 Claude 5.5 系列的第二个模型。它并非取代 Opus,而是把新一代 Agent、推理与安全能力下沉到更低成本的 Sonnet 档位。
目前 Anthropic 没有披露新的底层 Transformer / MoE 架构,因此更合理的判断是:这次升级主要来自后训练、Agent policy、effort 控制以及推理/执行系统效率优化,而不是公开的新基础架构突破。
详细内容
Anthropic 在 Claude Sonnet 5.5 的发布资料中,对 Sonnet 5.5、上一代 Sonnet 5、旗舰模型 Opus 5.5,以及 GPT-6 Sol 的多项能力进行了对比。
| 能力方向 | 评测指标 | Claude Sonnet 5.5 | Claude Sonnet 5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| 智能体式编程 | 终端智能体能力评测(Terminal-Bench 4.0) | 70.6% | 10.3% | 66.4%¹ | --- |
| 智能体式编程 | 前沿代码智能体评测·主集(FrontierCode 1.1 Main) | 46.2%(最大推理强度) / 52.1%(超高推理强度)² | 42.4% | 54.4% | 49.3% |
| 智能体式编程 | 真实代码库智能体评测(CursorBench 4.0) | 55.5% | 34.1% | 57.8% | --- |
| 知识工作 | 专业知识工作能力评测(GDPval-AA v2.1)³ | 1844 | 1449 | 1846 | 1487⁴ |
| 知识工作 | 综合知识工作任务评测(AA-Briefcase v1.1)³ | 1811 | 1359 | 1822 | 1483⁴ |
| 跨学科推理 | "人类最后考试"综合推理评测(Humanity's Last Exam) | 64.5%(使用工具) | 54.9%(使用工具) | 67.7%(使用工具) | --- |
| 计算机操作 | 真实操作系统交互评测(OSWorld 2.1) | 80.1%(部分评测集) | 57.0%(部分评测集) | 81.8%(部分评测集) | --- |
| 图表视觉理解 | 图表理解评测(Chartography) | 61.6%(不使用工具) | 15.6%(不使用工具) | 64.4%(不使用工具) | 53.6%⁴(不使用工具) |
数据来源:Anthropic 官方 Claude Sonnet 5.5 发布资料。粗体表示该行已公开结果中的最高值,仅用于辅助阅读,不代表模型整体能力排名。
---表示 Anthropic 的官方对比中没有提供 GPT-6 Sol 对应成绩。
表格标注信息:
- Opus 5.5 的 Terminal-Bench 4.0 成绩为超高推理强度(Xhigh effort)设置下的结果。
- FrontierCode 中,Sonnet 5.5 的最大推理强度(Max effort)反而低于超高推理强度(Xhigh)。Anthropic 的解释是,更高设置会更频繁调用 code-review skill 和多个 sub-agent,部分任务因此发生超时或产生超出任务范围的修改,受到 benchmark 惩罚。
- GDPval-AA 与 AA-Briefcase 的 Sonnet 5.5 结果来自 Artificial Analysis 对预发布模型版本的测试。
- Anthropic 提醒,GPT-6 Sol 的部分视觉相关成绩可能受到此前图像理解问题的影响,因此应谨慎进行精确的横向比较。
---表示 Anthropic 官方表格中没有提供对应的 GPT-6 Sol 结果,而不是代表得分为 0。
这张表最值得关注的,并不是 Sonnet 5.5 在某一个 benchmark 上拿到了最高分,而是它相较 Sonnet 5 出现了非常明显的跨任务代际提升。提升最集中的三个方向分别是:智能体式编程、计算机操作和知识工作。
首先,智能体式编程是 Sonnet 5.5 最突出的升级方向。
在终端智能体能力评测 Terminal-Bench 4.0 上,Sonnet 5.5 从上一代的 10.3% 提升到 70.6% ,增加了 60.3 个百分点 ;在真实代码库智能体评测 CursorBench 4.0 上,则从 34.1% 提升至 55.5% 。FrontierCode 1.1 中,在超高推理强度下也取得 52.1% 的成绩。
这些 benchmark 与传统的"给一道编程题、生成一段代码"并不完全相同。它们更强调模型能否持续地理解代码库、运行命令、读取执行结果、调用工具、发现错误并继续修改。因此,这组结果更能反映一个模型作为 Coding Agent 工作时的实际能力。
换句话说,Sonnet 5.5 的提升并不仅仅是"代码写得更好",而是更擅长在真实软件工程环境中持续行动并完成任务。
第二个非常明显的信号,是 Sonnet 5.5 已经在大量任务上逼近旗舰级 Opus 5.5。
例如,在专业知识工作评测 GDPval-AA 中,两者分别为:
- Sonnet 5.5:1844
- Opus 5.5:1846
只相差 2 分。
综合知识工作任务 AA-Briefcase 中:
- Sonnet 5.5:1811
- Opus 5.5:1822
同样只有很小差距。
在计算机操作方面,OSWorld 2.1 为 80.1% 对 81.8% ;在真实代码库智能体评测 CursorBench 上,则为 55.5% 对 57.8%。
这意味着 Claude 产品线中原本比较清晰的"Sonnet 是中档模型、Opus 是能力旗舰"正在发生变化。至少在结构明确的代码、知识工作和计算机操作任务中,Sonnet 5.5 已经能够达到非常接近 Opus 的水平。
这也是 Sonnet 5.5 最重要的优势之一:它不是通过成为新的最大模型来竞争,而是在更低成本模型档位上压缩与旗舰模型之间的能力差距。
另一个容易被忽略的变化是 计算机操作能力。
在 OSWorld 2.1 中,Sonnet 5.5 从 Sonnet 5 的 57.0% 提升到 80.1% ,增加 23.1 个百分点,并且已经十分接近 Opus 5.5 的 81.8%。
OSWorld 主要测试模型能否像人一样与真实计算机界面进行交互,例如:
- 操作桌面应用;
- 点击菜单与按钮;
- 输入内容;
- 浏览文件;
- 根据界面反馈调整下一步操作;
- 完成需要多步交互的任务。
因此,这组数据对 Claude Computer Use 以及更广义的 GUI Agent 很重要。它表明 Anthropic 对 Sonnet 5.5 的优化并没有局限在代码环境,而是在向通用计算机操作 Agent扩展。
视觉图表理解同样发生明显跃升
Sonnet 5.5 在图表理解评测 Chartography 上取得 61.6% ,而 Sonnet 5 只有 15.6%。
这里的提升幅度达到 46 个百分点。
更重要的是,这项测试标注为"不使用工具",也就是说模型需要直接从视觉输入中理解图表,而不是依赖代码、OCR 工具或外部计算。
这说明 Sonnet 5.5 的升级并不局限于纯文本推理和 Agent 能力,其视觉信息理解与结构化数据读取能力也出现了明显改善。
从 Anthropic 提供的可直接比较项目来看,Sonnet 5.5 在几项知识工作和视觉任务上取得了更高结果。
例如:
| 评测 | Sonnet 5.5 | GPT-6 Sol |
|---|---|---|
| 前沿代码智能体评测 FrontierCode 1.1 | 52.1%(超高推理强度) | 49.3% |
| 专业知识工作评测 GDPval-AA | 1844 | 1487 |
| 综合知识工作评测 AA-Briefcase | 1811 | 1483 |
| 图表理解评测 Chartography | 61.6% | 53.6% |
这说明 Sonnet 5.5 在 Anthropic 公布的部分长程知识工作、Agent 编程与视觉图表理解任务中具有很强的竞争力。
但这里不能进一步推导成"Sonnet 5.5 整体强于 GPT-6 Sol"。
原因是 Anthropic 的表格没有提供 GPT-6 Sol 在 Terminal-Bench、CursorBench、Humanity's Last Exam 和 OSWorld 等项目上的对应成绩,因此两者并不存在一个完整的统一 benchmark 集合。
此外,不同模型使用的推理强度、工具配置和测试 harness 也可能不同。因此,这些数字更适合用于观察特定任务上的表现差异,而不是做简单的综合排名。
Sonnet 5.5 真正的优势:Agent 能力与执行效率同时提升
如果只看 benchmark,Sonnet 5.5 可以被理解成一个"接近 Opus 的新 Sonnet"。
但从实际部署角度,它更重要的变化是:Anthropic 在提高任务成功率的同时,还在努力降低完成一个任务所需要的计算量。
Anthropic 表示,新模型倾向于:
- 使用更少的 token;
- 减少不必要的工具调用;
- 减少 shell 命令执行次数;
- 更积极地并行或批量调用工具;
- 使用更少的 Agent 步骤完成相同任务。
因此,对于真实的 Coding Agent 或 Computer Use Agent,Sonnet 5.5 的改进并不只是"正确率提高"。
更准确地说,它是在同时优化:
任务成功率 × Token 消耗 × 工具调用次数 × 执行时间 × API 成本
这也是为什么 Sonnet 5.5 对实际 Agent 产品的意义,可能比单纯提高几个百分点的 benchmark 更大。
新模型的优势可以概括为四点
1. 智能体式编程能力出现代际提升。
Terminal-Bench、CursorBench 和 FrontierCode 都显示,Sonnet 5.5 更擅长执行长链条的软件工程任务,而不仅仅是生成代码。
2. Sonnet 与旗舰 Opus 之间的能力差距显著缩小。
在知识工作、Computer Use、代码智能体和视觉理解任务中,Sonnet 5.5 已经非常接近 Opus 5.5。这意味着大量原本可能需要旗舰模型完成的任务,可以开始考虑使用成本更低的 Sonnet。
3. Computer Use 与多模态能力同步增强。
OSWorld 从 57.0% 提升到 80.1%,Chartography 从 15.6% 提升到 61.6%,说明这并不是一次只针对 Coding benchmark 的升级,而是 Agent 与视觉能力的整体提升。
4. 优势正在从"模型能力"转向"系统效率"。
Sonnet 5.5 更重要的竞争力,是以更少 token、更少工具调用和更短任务轨迹完成相同工作。对于需要执行几十甚至数百个步骤的 Agent,这种效率提升会直接转化为更低延迟和更低运行成本。
如果把 Claude Sonnet 5.5 简单理解成"Sonnet 5 的 benchmark 升级版",其实会低估这次发布。
它真正释放出的信号是:
Anthropic 正在把原本属于旗舰模型的 Agent、知识工作、Computer Use 和多模态能力,下沉到成本更低的 Sonnet 档位,同时把竞争重点从单纯提高模型峰值能力,转向提高真实长程任务中的执行效率。
对于 Agent 应用而言,这种"旗舰能力下沉 + 每任务成本下降"可能比单个 benchmark 第一名更加重要。
5.5 sonnet 的定价
如果只看 API 定价,Claude Sonnet 5.5 看起来并没有发生明显变化。它与上一代 Sonnet 5 保持相同的输入和输出 token 单价;但与旗舰模型 Opus 5.5 相比,主要 token 价格只有后者的一半。
| 计费项目(每 100 万 Token) | Claude Sonnet 5.5 | Claude Opus 5.5 | Sonnet 5.5 相对 Opus 5.5 |
|---|---|---|---|
| 缓存读取(Cache Read) | $0.20 | $0.20 | 相同 |
| 缓存写入(Cache Write) | $2.50 | $5.00 | 低 50% |
| 输入 Token | $2.00 | $4.00 | 低 50% |
| 输出 Token | $10.00 | $20.00 | 低 50% |
因此,在输入、输出和缓存写入方面,Sonnet 5.5 的单位 token 成本基本只有 Opus 5.5 的 1/2;缓存读取价格则完全相同。
所以真正发生变化的是:
完成同一个任务所需要的 token、工具调用、Agent 步数和运行时间都在减少。
Anthropic 表示,在其测试中,Sonnet 5.5 完成典型任务的成本相比 Sonnet 5 最高降低约 30%。
如果把 Sonnet 5 完成一个任务的成本标准化为:
但换一个更适合大规模 Agent 系统的角度来看:
如果原来 1 能运行 1 个任务,那么现在相同的 1 可以运行:
text
1 / 0.70 ≈ 1.43
即:
同样预算下,理论任务吞吐量最高可以增加约 42.9%。
Anthropic 给出的另一个核心数字是:
Sonnet 5.5 的输出速度相比 Sonnet 5 提高 30% 以上。
这里有一个经常被忽略的数学关系。
假设 Sonnet 5 的生成速度为:
text
100 tokens/s
提升 30% 后:
text
Sonnet 5.5 = 130 tokens/s
对于相同长度的输出,所需要的生成时间变成:
text
100 / 130 ≈ 76.9%
因此,如果 Anthropic 的"30% faster"指的是生成吞吐率,那么对应的纯生成阶段耗时实际上至少下降约 23.1%。
| 指标 | Sonnet 5 | Sonnet 5.5 | 相对变化 |
|---|---|---|---|
| 假设生成吞吐率 | 100 | ≥130 | ≥ +30% |
| 相同输出长度所需时间 | 100% | ≤76.9% | ≤ -23.1% |
Anthropic 公布的 Accuracy vs. Cost 曲线也值得关注。
因为它衡量的是:
为了达到某个任务成功率,模型实际上需要花多少钱。
这也是 Sonnet 5.5 最明显的变化。
在 Terminal-Bench 4.0 上,Sonnet 5.5 使用 Medium effort 时,成绩已经明显超过 Sonnet 5 的最佳成绩 ,但成本不到后者的 1/10。
对应的成本降幅至少为:
text
1 - 1/10 = 90%
也就是说:
在获得更高任务成功率的同时,单任务成本下降超过 90%。
反过来看,同样预算理论上可以执行:
text
> 10×
数量的任务。
这里出现的已经不是普通的"模型升级",而是明显的 cost-performance frontier shift。
CursorBench 上出现了几乎相同的现象。
Sonnet 5.5 在 Low effort 下已经超过 Sonnet 5 的最高成绩,但成本同样不到 Sonnet 5 的:
text
1/10
因此对应:
- 成本下降 >90%
- 单位预算任务数量 >10×
- 同时 benchmark 成绩更高
在长程知识工作 benchmark AA-Briefcase 上,Sonnet 5.5 在 Medium effort 下超过 Sonnet 5 的最佳成绩,而成本约为后者的:
text
1/9
因此:
text
1 - 1/9
= 88.9%
即:
完成同类知识工作任务的成本约降低 88.9%。
或者从单位预算生产率来看:
每美元能够执行的任务数量约提高到 9 倍。
对于 Research Agent、金融分析 Agent、企业知识检索和长程办公自动化而言,这种变化的实际意义可能比 benchmark 分数本身更大。
FrontierCode 的结果可能是 Sonnet 5.5 最值得关注的 cost-performance 数据。
Anthropic 表示,在相同的 High effort 设置下:
Sonnet 5.5 比 Sonnet 5 高约 10 个百分点 ,但每任务成本只有大约 1/15。
换算之后:
text
1 - 1/15
= 93.3%
也就是说:
单任务成本约降低 93.3%。
而单位预算能够完成的任务数量理论上变成:
text
15×
更重要的是,这并不是通过牺牲性能实现的。
而是:
text
性能:+约 10 个百分点
成本:-约 93.3%
FrontierCode 上还有一个非常值得关注的对比。
Anthropic 表示,Sonnet 5.5 在 High effort 下可以达到与 GPT-6 Sol 最佳结果相当的成绩,但每任务成本约为:
text
1/5
因此成本差距约为:
text
1 - 1/5
= 80%
即:
在相近 FrontierCode 性能下,Sonnet 5.5 的任务成本约低 80%。
换一个角度:
相同预算理论上可以执行约 5 倍数量的任务。
因此这里真正值得关注的并不是:
"Sonnet 5.5 比 GPT-6 Sol 高了多少 benchmark 分数?"
而是:
在接近相同性能点时,需要多少计算成本才能到达这个性能水平?
对于生产环境里的 Coding Agent,这往往是比绝对 benchmark 第一名更重要的问题。
定价总体数据分析
| 场景 | 对比对象 | Sonnet 5.5 的结果 | 推导出的成本变化 | 单位预算效率 |
|---|---|---|---|---|
| 典型工作负载 | Sonnet 5 | 单任务成本最高低 30% | -30% | 最高 +42.9% |
| Terminal-Bench 4.0 | Sonnet 5 最佳结果 | 更高性能,成本 <1/10 | > -90% | >10× |
| CursorBench 4.0 | Sonnet 5 最佳结果 | 更高性能,成本 <1/10 | > -90% | >10× |
| AA-Briefcase | Sonnet 5 最佳结果 | 更高性能,成本约 1/9 | 约 -88.9% | 约 9× |
| FrontierCode / High | Sonnet 5 / High | 高约 10 个百分点,成本约 1/15 | 约 -93.3% | 约 15× |
| FrontierCode | GPT-6 Sol 最佳结果 | 近似性能,成本约 1/5 | 约 -80% | 约 5× |
这张表其实比 API 定价表更能说明 Sonnet 5.5 的意义。
Token 单价没有发生革命性的变化,真正发生变化的是完成单位工作的计算需求。
Anthropic 官方发布中还披露了一些早期客户的实际测试结果。
Balyasny:Token 消耗从 497k 降至 121k
Balyasny Asset Management 在包含 2,441 个金融任务的内部测试集上观察到:
text
Sonnet 5:497k tokens / answer
Sonnet 5.5:121k tokens / answer
Token 使用量下降:
text
(497 - 121) / 497
≈ 75.7%
即:
平均每个答案使用的 token 减少约 75.7%。
反过来看:
text
497 / 121 ≈ 4.11
Sonnet 5 使用的 token 数约是 Sonnet 5.5 的 4.1 倍。
如果两代模型输入/输出 token 的组成比例大致相似,那么这种 token 缩减会直接转化为非常显著的推理成本下降。
但这里需要注意:官方没有公布输入、输出、cache token 的具体组成,因此不能严谨地把"token 减少 75.7%"直接写成"API 费用减少 75.7%"。
Box:2.4× 更快,同时减少 12% Token
Box 的内部测试显示,Sonnet 5.5 相比此前模型:
- 速度达到 2.4×
- 总 token 使用量减少 12%
- 同时准确率提高
如果这里的 2.4× 指吞吐速度,则相同任务的执行时间约为:
text
1 / 2.4
≈ 41.7%
即理论上约:
减少 58.3% 的执行时间。
而与此同时总 token 使用量还减少了 12%。
这类结果尤其值得关注,因为正常情况下增加推理速度可能会牺牲准确率,而增加准确率又往往需要增加 reasoning token。这里则同时观察到了:
text
准确率 ↑
速度 ↑
Token ↓
Lovable:工具调用减少约三分之一
Lovable 在 coding eval 中观察到:
- Tool calls 减少约 1/3
- Shell runs 减少约 1/2
换算为比例:
| Agent 操作 | 相对 Sonnet 5 的变化 |
|---|---|
| Tool calls | 约 -33.3% |
| Shell runs | 约 -50% |
这可能解释为什么 Sonnet 5.5 的 cost-per-task 改善幅度会远大于 token 单价本身。
对于 Agent 而言,成本并不仅来自语言模型生成,还来自:
text
LLM inference
+ Tool calls
+ Shell execution
+ Search
+ API calls
+ Retry
+ Context accumulation
如果模型在更早的步骤做出正确决策,整个 trajectory 都会缩短。
因此一个 33% 的 tool-call reduction,最终可能产生比 33% 更明显的端到端成本和延迟改善。