9.30 大语言模型研究简报:Claude Sonnet 5.5:更快、更便宜的 Agent 模型

Claude Sonnet 5.5:更快、更便宜的 Agent 模型

机构: Anthropic

发布时间: 北京时间 2026 年 9 月 29 日 02:00

Anthropic 正式发布 Claude Sonnet 5.5 。这一代的重点并不是扩大模型规模,而是提升 Agent 与 coding 任务中的执行效率:更少的 token、更少的工具调用、更短的任务完成时间,同时保持接近旗舰模型的能力。

核心变化

  • 更快、更省: 相比 Sonnet 5,输出速度提升 30%+ ;典型任务成本最高降低约 30% 。API 单价保持为 2/M input tokens、10/M output tokens。
  • Agent / Coding 提升明显: Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 提升至 70.6% ;CursorBench 4.0 从 34.1% 提升至 55.5%。
  • 工具使用更高效: 模型更倾向于批量调用工具,以更少的步骤、shell runs 和 tool calls 完成任务。
  • 安全能力同步增强: Sonnet 5.5 首次引入接近旗舰模型级别的网络安全 safeguards,并增加针对大规模 reasoning extraction / distillation 的防护。

为什么重要

Sonnet 5.5 更值得关注的不是单个 benchmark 分数,而是旗舰级能力正在下沉到更低成本的模型档位。

对于实际 Agent 系统,限制规模化部署的往往不是一次推理能否答对,而是长任务中的 token 消耗、工具调用次数、执行延迟和总体成本。Sonnet 5.5 的改进方向正对准这些系统级瓶颈。

与此前工作的关系

Sonnet 5.5 是继 Claude Opus 5.5 后 Claude 5.5 系列的第二个模型。它并非取代 Opus,而是把新一代 Agent、推理与安全能力下沉到更低成本的 Sonnet 档位。

目前 Anthropic 没有披露新的底层 Transformer / MoE 架构,因此更合理的判断是:这次升级主要来自后训练、Agent policy、effort 控制以及推理/执行系统效率优化,而不是公开的新基础架构突破。

详细内容

Anthropic 在 Claude Sonnet 5.5 的发布资料中,对 Sonnet 5.5、上一代 Sonnet 5、旗舰模型 Opus 5.5,以及 GPT-6 Sol 的多项能力进行了对比。

能力方向 评测指标 Claude Sonnet 5.5 Claude Sonnet 5 Claude Opus 5.5 GPT-6 Sol
智能体式编程 终端智能体能力评测(Terminal-Bench 4.0) 70.6% 10.3% 66.4%¹ ---
智能体式编程 前沿代码智能体评测·主集(FrontierCode 1.1 Main) 46.2%(最大推理强度) / 52.1%(超高推理强度)² 42.4% 54.4% 49.3%
智能体式编程 真实代码库智能体评测(CursorBench 4.0) 55.5% 34.1% 57.8% ---
知识工作 专业知识工作能力评测(GDPval-AA v2.1)³ 1844 1449 1846 1487⁴
知识工作 综合知识工作任务评测(AA-Briefcase v1.1)³ 1811 1359 1822 1483⁴
跨学科推理 "人类最后考试"综合推理评测(Humanity's Last Exam) 64.5%(使用工具) 54.9%(使用工具) 67.7%(使用工具) ---
计算机操作 真实操作系统交互评测(OSWorld 2.1) 80.1%(部分评测集) 57.0%(部分评测集) 81.8%(部分评测集) ---
图表视觉理解 图表理解评测(Chartography) 61.6%(不使用工具) 15.6%(不使用工具) 64.4%(不使用工具) 53.6%⁴(不使用工具)

数据来源:Anthropic 官方 Claude Sonnet 5.5 发布资料。粗体表示该行已公开结果中的最高值,仅用于辅助阅读,不代表模型整体能力排名。--- 表示 Anthropic 的官方对比中没有提供 GPT-6 Sol 对应成绩。

表格标注信息:

  1. Opus 5.5 的 Terminal-Bench 4.0 成绩为超高推理强度(Xhigh effort)设置下的结果。
  2. FrontierCode 中,Sonnet 5.5 的最大推理强度(Max effort)反而低于超高推理强度(Xhigh)。Anthropic 的解释是,更高设置会更频繁调用 code-review skill 和多个 sub-agent,部分任务因此发生超时或产生超出任务范围的修改,受到 benchmark 惩罚。
  3. GDPval-AA 与 AA-Briefcase 的 Sonnet 5.5 结果来自 Artificial Analysis 对预发布模型版本的测试。
  4. Anthropic 提醒,GPT-6 Sol 的部分视觉相关成绩可能受到此前图像理解问题的影响,因此应谨慎进行精确的横向比较。
  5. --- 表示 Anthropic 官方表格中没有提供对应的 GPT-6 Sol 结果,而不是代表得分为 0。

这张表最值得关注的,并不是 Sonnet 5.5 在某一个 benchmark 上拿到了最高分,而是它相较 Sonnet 5 出现了非常明显的跨任务代际提升。提升最集中的三个方向分别是:智能体式编程、计算机操作和知识工作。

首先,智能体式编程是 Sonnet 5.5 最突出的升级方向。

在终端智能体能力评测 Terminal-Bench 4.0 上,Sonnet 5.5 从上一代的 10.3% 提升到 70.6% ,增加了 60.3 个百分点 ;在真实代码库智能体评测 CursorBench 4.0 上,则从 34.1% 提升至 55.5% 。FrontierCode 1.1 中,在超高推理强度下也取得 52.1% 的成绩。

这些 benchmark 与传统的"给一道编程题、生成一段代码"并不完全相同。它们更强调模型能否持续地理解代码库、运行命令、读取执行结果、调用工具、发现错误并继续修改。因此,这组结果更能反映一个模型作为 Coding Agent 工作时的实际能力。

换句话说,Sonnet 5.5 的提升并不仅仅是"代码写得更好",而是更擅长在真实软件工程环境中持续行动并完成任务。

第二个非常明显的信号,是 Sonnet 5.5 已经在大量任务上逼近旗舰级 Opus 5.5。

例如,在专业知识工作评测 GDPval-AA 中,两者分别为:

  • Sonnet 5.5:1844
  • Opus 5.5:1846

只相差 2 分。

综合知识工作任务 AA-Briefcase 中:

  • Sonnet 5.5:1811
  • Opus 5.5:1822

同样只有很小差距。

在计算机操作方面,OSWorld 2.1 为 80.1% 对 81.8% ;在真实代码库智能体评测 CursorBench 上,则为 55.5% 对 57.8%。

这意味着 Claude 产品线中原本比较清晰的"Sonnet 是中档模型、Opus 是能力旗舰"正在发生变化。至少在结构明确的代码、知识工作和计算机操作任务中,Sonnet 5.5 已经能够达到非常接近 Opus 的水平。

这也是 Sonnet 5.5 最重要的优势之一:它不是通过成为新的最大模型来竞争,而是在更低成本模型档位上压缩与旗舰模型之间的能力差距。

另一个容易被忽略的变化是 计算机操作能力。

在 OSWorld 2.1 中,Sonnet 5.5 从 Sonnet 5 的 57.0% 提升到 80.1% ,增加 23.1 个百分点,并且已经十分接近 Opus 5.5 的 81.8%。

OSWorld 主要测试模型能否像人一样与真实计算机界面进行交互,例如:

  • 操作桌面应用;
  • 点击菜单与按钮;
  • 输入内容;
  • 浏览文件;
  • 根据界面反馈调整下一步操作;
  • 完成需要多步交互的任务。

因此,这组数据对 Claude Computer Use 以及更广义的 GUI Agent 很重要。它表明 Anthropic 对 Sonnet 5.5 的优化并没有局限在代码环境,而是在向通用计算机操作 Agent扩展。

视觉图表理解同样发生明显跃升

Sonnet 5.5 在图表理解评测 Chartography 上取得 61.6% ,而 Sonnet 5 只有 15.6%。

这里的提升幅度达到 46 个百分点。

更重要的是,这项测试标注为"不使用工具",也就是说模型需要直接从视觉输入中理解图表,而不是依赖代码、OCR 工具或外部计算。

这说明 Sonnet 5.5 的升级并不局限于纯文本推理和 Agent 能力,其视觉信息理解与结构化数据读取能力也出现了明显改善。

从 Anthropic 提供的可直接比较项目来看,Sonnet 5.5 在几项知识工作和视觉任务上取得了更高结果。

例如:

评测 Sonnet 5.5 GPT-6 Sol
前沿代码智能体评测 FrontierCode 1.1 52.1%(超高推理强度) 49.3%
专业知识工作评测 GDPval-AA 1844 1487
综合知识工作评测 AA-Briefcase 1811 1483
图表理解评测 Chartography 61.6% 53.6%

这说明 Sonnet 5.5 在 Anthropic 公布的部分长程知识工作、Agent 编程与视觉图表理解任务中具有很强的竞争力。

但这里不能进一步推导成"Sonnet 5.5 整体强于 GPT-6 Sol"。

原因是 Anthropic 的表格没有提供 GPT-6 Sol 在 Terminal-Bench、CursorBench、Humanity's Last Exam 和 OSWorld 等项目上的对应成绩,因此两者并不存在一个完整的统一 benchmark 集合。

此外,不同模型使用的推理强度、工具配置和测试 harness 也可能不同。因此,这些数字更适合用于观察特定任务上的表现差异,而不是做简单的综合排名。

Sonnet 5.5 真正的优势:Agent 能力与执行效率同时提升

如果只看 benchmark,Sonnet 5.5 可以被理解成一个"接近 Opus 的新 Sonnet"。

但从实际部署角度,它更重要的变化是:Anthropic 在提高任务成功率的同时,还在努力降低完成一个任务所需要的计算量。

Anthropic 表示,新模型倾向于:

  • 使用更少的 token;
  • 减少不必要的工具调用;
  • 减少 shell 命令执行次数;
  • 更积极地并行或批量调用工具;
  • 使用更少的 Agent 步骤完成相同任务。

因此,对于真实的 Coding Agent 或 Computer Use Agent,Sonnet 5.5 的改进并不只是"正确率提高"。

更准确地说,它是在同时优化:

任务成功率 × Token 消耗 × 工具调用次数 × 执行时间 × API 成本

这也是为什么 Sonnet 5.5 对实际 Agent 产品的意义,可能比单纯提高几个百分点的 benchmark 更大。

新模型的优势可以概括为四点

1. 智能体式编程能力出现代际提升。

Terminal-Bench、CursorBench 和 FrontierCode 都显示,Sonnet 5.5 更擅长执行长链条的软件工程任务,而不仅仅是生成代码。

2. Sonnet 与旗舰 Opus 之间的能力差距显著缩小。

在知识工作、Computer Use、代码智能体和视觉理解任务中,Sonnet 5.5 已经非常接近 Opus 5.5。这意味着大量原本可能需要旗舰模型完成的任务,可以开始考虑使用成本更低的 Sonnet。

3. Computer Use 与多模态能力同步增强。

OSWorld 从 57.0% 提升到 80.1%,Chartography 从 15.6% 提升到 61.6%,说明这并不是一次只针对 Coding benchmark 的升级,而是 Agent 与视觉能力的整体提升。

4. 优势正在从"模型能力"转向"系统效率"。

Sonnet 5.5 更重要的竞争力,是以更少 token、更少工具调用和更短任务轨迹完成相同工作。对于需要执行几十甚至数百个步骤的 Agent,这种效率提升会直接转化为更低延迟和更低运行成本。

如果把 Claude Sonnet 5.5 简单理解成"Sonnet 5 的 benchmark 升级版",其实会低估这次发布。

它真正释放出的信号是:

Anthropic 正在把原本属于旗舰模型的 Agent、知识工作、Computer Use 和多模态能力,下沉到成本更低的 Sonnet 档位,同时把竞争重点从单纯提高模型峰值能力,转向提高真实长程任务中的执行效率。

对于 Agent 应用而言,这种"旗舰能力下沉 + 每任务成本下降"可能比单个 benchmark 第一名更加重要。

5.5 sonnet 的定价

如果只看 API 定价,Claude Sonnet 5.5 看起来并没有发生明显变化。它与上一代 Sonnet 5 保持相同的输入和输出 token 单价;但与旗舰模型 Opus 5.5 相比,主要 token 价格只有后者的一半。

计费项目(每 100 万 Token) Claude Sonnet 5.5 Claude Opus 5.5 Sonnet 5.5 相对 Opus 5.5
缓存读取(Cache Read) $0.20 $0.20 相同
缓存写入(Cache Write) $2.50 $5.00 低 50%
输入 Token $2.00 $4.00 低 50%
输出 Token $10.00 $20.00 低 50%

因此,在输入、输出和缓存写入方面,Sonnet 5.5 的单位 token 成本基本只有 Opus 5.5 的 1/2;缓存读取价格则完全相同。

所以真正发生变化的是:

完成同一个任务所需要的 token、工具调用、Agent 步数和运行时间都在减少。

Anthropic 表示,在其测试中,Sonnet 5.5 完成典型任务的成本相比 Sonnet 5 最高降低约 30%。

如果把 Sonnet 5 完成一个任务的成本标准化为:

但换一个更适合大规模 Agent 系统的角度来看:

如果原来 1 能运行 1 个任务,那么现在相同的 1 可以运行:

text 复制代码
1 / 0.70 ≈ 1.43

即:

同样预算下,理论任务吞吐量最高可以增加约 42.9%。

Anthropic 给出的另一个核心数字是:

Sonnet 5.5 的输出速度相比 Sonnet 5 提高 30% 以上。

这里有一个经常被忽略的数学关系。

假设 Sonnet 5 的生成速度为:

text 复制代码
100 tokens/s

提升 30% 后:

text 复制代码
Sonnet 5.5 = 130 tokens/s

对于相同长度的输出,所需要的生成时间变成:

text 复制代码
100 / 130 ≈ 76.9%

因此,如果 Anthropic 的"30% faster"指的是生成吞吐率,那么对应的纯生成阶段耗时实际上至少下降约 23.1%。

指标 Sonnet 5 Sonnet 5.5 相对变化
假设生成吞吐率 100 ≥130 ≥ +30%
相同输出长度所需时间 100% ≤76.9% ≤ -23.1%

Anthropic 公布的 Accuracy vs. Cost 曲线也值得关注。

因为它衡量的是:

为了达到某个任务成功率,模型实际上需要花多少钱。

这也是 Sonnet 5.5 最明显的变化。

在 Terminal-Bench 4.0 上,Sonnet 5.5 使用 Medium effort 时,成绩已经明显超过 Sonnet 5 的最佳成绩 ,但成本不到后者的 1/10。

对应的成本降幅至少为:

text 复制代码
1 - 1/10 = 90%

也就是说:

在获得更高任务成功率的同时,单任务成本下降超过 90%。

反过来看,同样预算理论上可以执行:

text 复制代码
> 10×

数量的任务。

这里出现的已经不是普通的"模型升级",而是明显的 cost-performance frontier shift。


CursorBench 上出现了几乎相同的现象。

Sonnet 5.5 在 Low effort 下已经超过 Sonnet 5 的最高成绩,但成本同样不到 Sonnet 5 的:

text 复制代码
1/10

因此对应:

  • 成本下降 >90%
  • 单位预算任务数量 >10×
  • 同时 benchmark 成绩更高

在长程知识工作 benchmark AA-Briefcase 上,Sonnet 5.5 在 Medium effort 下超过 Sonnet 5 的最佳成绩,而成本约为后者的:

text 复制代码
1/9

因此:

text 复制代码
1 - 1/9
= 88.9%

即:

完成同类知识工作任务的成本约降低 88.9%。

或者从单位预算生产率来看:

每美元能够执行的任务数量约提高到 9 倍。

对于 Research Agent、金融分析 Agent、企业知识检索和长程办公自动化而言,这种变化的实际意义可能比 benchmark 分数本身更大。

FrontierCode 的结果可能是 Sonnet 5.5 最值得关注的 cost-performance 数据。

Anthropic 表示,在相同的 High effort 设置下:

Sonnet 5.5 比 Sonnet 5 高约 10 个百分点 ,但每任务成本只有大约 1/15。

换算之后:

text 复制代码
1 - 1/15
= 93.3%

也就是说:

单任务成本约降低 93.3%。

而单位预算能够完成的任务数量理论上变成:

text 复制代码
15×

更重要的是,这并不是通过牺牲性能实现的。

而是:

text 复制代码
性能:+约 10 个百分点
成本:-约 93.3%

FrontierCode 上还有一个非常值得关注的对比。

Anthropic 表示,Sonnet 5.5 在 High effort 下可以达到与 GPT-6 Sol 最佳结果相当的成绩,但每任务成本约为:

text 复制代码
1/5

因此成本差距约为:

text 复制代码
1 - 1/5
= 80%

即:

在相近 FrontierCode 性能下,Sonnet 5.5 的任务成本约低 80%。

换一个角度:

相同预算理论上可以执行约 5 倍数量的任务。

因此这里真正值得关注的并不是:

"Sonnet 5.5 比 GPT-6 Sol 高了多少 benchmark 分数?"

而是:

在接近相同性能点时,需要多少计算成本才能到达这个性能水平?

对于生产环境里的 Coding Agent,这往往是比绝对 benchmark 第一名更重要的问题。

定价总体数据分析

场景 对比对象 Sonnet 5.5 的结果 推导出的成本变化 单位预算效率
典型工作负载 Sonnet 5 单任务成本最高低 30% -30% 最高 +42.9%
Terminal-Bench 4.0 Sonnet 5 最佳结果 更高性能,成本 <1/10 > -90% >10×
CursorBench 4.0 Sonnet 5 最佳结果 更高性能,成本 <1/10 > -90% >10×
AA-Briefcase Sonnet 5 最佳结果 更高性能,成本约 1/9 约 -88.9% 约 9×
FrontierCode / High Sonnet 5 / High 高约 10 个百分点,成本约 1/15 约 -93.3% 约 15×
FrontierCode GPT-6 Sol 最佳结果 近似性能,成本约 1/5 约 -80% 约 5×

这张表其实比 API 定价表更能说明 Sonnet 5.5 的意义。

Token 单价没有发生革命性的变化,真正发生变化的是完成单位工作的计算需求。

Anthropic 官方发布中还披露了一些早期客户的实际测试结果。

Balyasny:Token 消耗从 497k 降至 121k

Balyasny Asset Management 在包含 2,441 个金融任务的内部测试集上观察到:

text 复制代码
Sonnet 5:497k tokens / answer
Sonnet 5.5:121k tokens / answer

Token 使用量下降:

text 复制代码
(497 - 121) / 497
≈ 75.7%

即:

平均每个答案使用的 token 减少约 75.7%。

反过来看:

text 复制代码
497 / 121 ≈ 4.11

Sonnet 5 使用的 token 数约是 Sonnet 5.5 的 4.1 倍。

如果两代模型输入/输出 token 的组成比例大致相似,那么这种 token 缩减会直接转化为非常显著的推理成本下降。

但这里需要注意:官方没有公布输入、输出、cache token 的具体组成,因此不能严谨地把"token 减少 75.7%"直接写成"API 费用减少 75.7%"。


Box:2.4× 更快,同时减少 12% Token

Box 的内部测试显示,Sonnet 5.5 相比此前模型:

  • 速度达到 2.4×
  • 总 token 使用量减少 12%
  • 同时准确率提高

如果这里的 2.4× 指吞吐速度,则相同任务的执行时间约为:

text 复制代码
1 / 2.4
≈ 41.7%

即理论上约:

减少 58.3% 的执行时间。

而与此同时总 token 使用量还减少了 12%。

这类结果尤其值得关注,因为正常情况下增加推理速度可能会牺牲准确率,而增加准确率又往往需要增加 reasoning token。这里则同时观察到了:

text 复制代码
准确率 ↑
速度 ↑
Token ↓

Lovable:工具调用减少约三分之一

Lovable 在 coding eval 中观察到:

  • Tool calls 减少约 1/3
  • Shell runs 减少约 1/2

换算为比例:

Agent 操作 相对 Sonnet 5 的变化
Tool calls 约 -33.3%
Shell runs 约 -50%

这可能解释为什么 Sonnet 5.5 的 cost-per-task 改善幅度会远大于 token 单价本身。

对于 Agent 而言,成本并不仅来自语言模型生成,还来自:

text 复制代码
LLM inference
+ Tool calls
+ Shell execution
+ Search
+ API calls
+ Retry
+ Context accumulation

如果模型在更早的步骤做出正确决策,整个 trajectory 都会缩短。

因此一个 33% 的 tool-call reduction,最终可能产生比 33% 更明显的端到端成本和延迟改善。

参考资料

  1. Anthropic --- Introducing Claude Sonnet 5.5
  2. Claude Platform --- Claude Sonnet 5.5
  3. Anthropic --- Claude Sonnet 5.5 System Card
  4. GitHub --- Claude Sonnet 5.5 in GitHub Copilot
相关推荐
小朱爱编程1231 小时前
我用 Jev 做了三个实用工具:整理标签页、分诊飞书反馈、找回 GitHub 收藏
java·开发语言·人工智能·后端·python·架构·ai编程
AI职业加油站1 小时前
大模型开发工程师证书怎么考?零基础学习路径与价值拆解
大数据·人工智能·学习·职场和发展·数据分析
镭封1 小时前
基于微信小程序的移动端AI配音工作流设计
人工智能·小程序·媒体
leoZ2312 小时前
第 40 篇 AI 团队搭建与角色分工
人工智能·大模型·agent
海宇大数据2 小时前
零信任架构实战:基于海宇车辆出险记录核验构建自动化二手车收车评估网关
运维·人工智能·架构·自动化
搞科研的小刘选手2 小时前
【中国南京&新加坡 双会场 | EI-JA期刊、CA会议征稿】2026年绿色能源与人工智能国际学术会议(GEAI 2026)
人工智能·学术会议·会议推荐·绿色能源·新加坡·南京
hunteritself2 小时前
卷卷卷!GPT-6 Sol、Luna 正式发布,OpenAI 开始卷价格了
大数据·前端·人工智能·深度学习·transformer
东方佑2 小时前
权重绑定深度语言模型:深度缩放、免费早退与一个基本权衡
人工智能·语言模型·自然语言处理
玫瑰互动GEO2 小时前
GEM优化+GEO优化+信息流三件套:AI时代投放闭环的工程化拆解
人工智能·ai·ai搜索·gem·gem优化·cpcq