一个反常识:次旗舰赢了旗舰
打开 Anthropic 这次发布说明,第一行就有点反直觉:Claude Sonnet 5.5 在智能体编码(agentic coding)任务上的基准成绩,超过了同门旗舰 Opus 5.5。
这不太合常理。在 Anthropic 的产品序列里,Sonnet 一直被定位成次旗舰------性能弱于 Opus,胜在便宜、灵活、反应快。旗舰模型堆了最多的参数和训练算力,本该在所有榜单上碾压小弟。可这回,专门干写代码、调智能体的活,便宜的那一个反而赢了。
更扎眼的是,Sonnet 5.5 还把上一代 Sonnet 5 的运行速度提升了约三成,单次任务的 Token 消耗也明显下降。换句话说,它不仅成绩更好,还更快、更省。对一个中端型号来说,这套组合拳几乎是在当面质问:你真的还需要为旗舰多掏那份钱吗?
这件事值得拆开看。因为它背后藏着的,不是谁参数大谁赢的老故事,而是 2026 年这波模型竞赛正在换赛道------从单次问答谁强,切到谁能稳定、便宜地跑完一长串自主任务。Sonnet 5.5 这次还顺手把网络攻防能力拉到和 Opus 5 同一水准,并首次套上与 Fable、Opus 一致的网络安全防护机制,等于在中端档位补齐了安全短板。这意味着选它不再需要在便宜和安全之间二选一,进一步压缩了旗舰的生存空间。对团队选型的人而言,这等于多了一个不用妥协的中间选项:既要跑得勤、又要扛得住基础安全审计,过去只能上 Opus 硬扛成本,现在 Sonnet 5.5 把这条缝补上了。
速度+30%、Token更省:Sonnet 5.5 的成本账
先把账算清楚。Sonnet 5.5 上一代 Sonnet 5 大约三个月前发布,当时的主打卖点是部署智能体的成本低于竞品。5.5 版本没有改这条主线,而是把速度和 Token 消耗往前推了一大步:
- 运行速度比上一代提升约三成;
- Token 消耗速度明显更低,同等任务烧的词元更少;
- 定位仍是日常任务助手,主打写代码、做办公文档。
这三条叠在一起,意义不在于快了点,而在于它改变了智能体的经济学。智能体编码的本质是大量、串行、可失败的调用:一个任务拆成几十步,每一步都喂上下文、跑工具、读结果,任何一步超时或烧爆 Token 预算,整条链就崩。在这种场景下,每次调用便宜三成、速度提三成不是线性优化,是复利优化------几十步叠加下来,同样预算能多跑接近一倍的任务量。
这也是为什么中端型号跑智能体更香在 2026 年几乎成了行业共识。旗舰模型留给一次性、高压推理的难题;日常的编码智能体,大家开始默认挂到更快更省的那一档。换句话说,旗舰是跑车,关键时刻飙一把;Sonnet 是网约车,天天跑、跑得勤、单均成本才划算。这种分工不是 Anthropic 一家的判断,而是全行业在重新校准模型选型的默认档位。
为什么小模型反而在智能体编码更强
这是整件事最该解释的一环:凭什么参数更小的 Sonnet 5.5,能在智能体编码上压过 Opus 5.5?
Anthropic 自己给了一个很实在的理由:Sonnet 5.5 可以同时启动多个智能体,又不容易突破成本上限。这句话翻译成工程语言就是------智能体编码的天花板,往往不是单步聪明度,而是并行预算。
一个旗舰模型单步再强,只要它贵到让你开不起第二个并发分支,它就只能串行地一步步走。而串行智能体的失败率是乘法关系:假设每步成功率九成五,跑二十步只剩三成六能全程不挂。可如果你能同时开五到十个 Sonnet 并行分支做探索、再收敛,有效成功率会高得多------因为你可以让多个分支各自试错、挑最好的那条留下。
所以小而多在这类任务上结构性占优:
- 旗舰等于单兵最强,但贵到开不起并发;
- 中端等于单兵略弱,但便宜到能堆并发;
- 智能体编码恰好是堆并发能直接换成功率的任务。
这下就解释得通了:不是 Sonnet 5.5 突然变聪明超过 Opus,而是这个任务的得分公式里,并发能力占的权重比单步智商更大。这同时也解释了为什么 OpenAI 上周同期发力的也是中端 Sol 和高性价比 Luna 的增强版------大家都看清了,2026 年的销量主战场不在旗舰,而在中端主力档。
和 Opus 5.5、GPT-6 Sol 的横向对比
光听厂商自说自话不够,放到同期竞品里看更清楚。上周 OpenAI 也发了一波新模型,中端的 Sol 和高性价比的 Luna 都有增强版;更早前 Sonnet 5.5 偷跑时就有实测称它碾压 GPT-6 Sol、直逼 Astra。把关键维度拉一张表:
| 维度 | Sonnet 5.5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|
| 定位 | 次旗舰/日常 | 旗舰 | 中端 |
| 速度 | 较上代 +30% | 基准 | 基准 |
| Token 消耗 | 明显下降 | 较高 | 中 |
| 智能体编码 | 反超 Opus 5.5 | 强 | 被碾压 |
| 并发成本 | 低 | 高 | 中 |
| 网络攻防 | 同 Opus 5 水准 | 最强 | 一般 |
(注:速度、Token、攻防为厂商口径,编码与并发为基准与实测口径,Astra 为 OpenAI 更高端型号。)
这张表真正想说的是一件事:选模型不再看谁总分第一,而看你的任务卡在哪一列。如果你的活是写代码、跑智能体,Sonnet 5.5 这一列几乎全绿;如果你要的是单次极限推理或最强攻防,那 Opus 5.5 才是答案。把同一张表倒过来看也很重要------没有任何一列是 Sonnet 5.5 全占优的,它在攻防上追平了 Opus 5 但没超过 Opus 5.5,在单步极限推理上仍落后。所以这不是旗舰无用论,而是按列选型论。
实操:用 Sonnet 5.5 跑一个多智能体编码循环
讲完道理给个能落地的样子。下面这段骨架展示并发分支加收敛的最小形态,把 model 换成 Sonnet 5.5 的接口即可:
python
import asyncio
async def branch(model, task):
# 每个分支独立跑一遍,带各自工具调用与上下文
result = await model.run(task, tools=[read, write, exec])
return result
async def converge(results):
# 取所有分支里测试通过、改动最小的那一条
scored = [(r.passed, len(r.diff), r) for r in results]
scored.sort(key=lambda x: (-int(x[0]), x[1]))
return scored[0][2]
async def agentic_loop(model, task, branches=5):
# Sonnet 5.5 的便宜让你敢一次开 5 个并发
results = await asyncio.gather(*[branch(model, task) for _ in range(branches)])
best = await converge(results)
return best
这段骨架的精髓不在代码本身,而在那个 branches=5:放在旗舰模型上,很多人不敢开到 3,因为单次成本会爆;放在 Sonnet 5.5 上,开到 5 到 10 反而成了常规操作。这正是次旗舰反超旗舰在工程层最直接的体现------你省下来的钱,直接变成了能并行的探索宽度。
收敛那一行也值得多说一句:不要简单取第一个跑通的,而是按测试通过优先、改动量其次排序。智能体编码最容易翻车的地方,就是一个分支凑巧跑通但改得又多又脏,结果埋下一堆技术债。把最小改动写进收敛规则,能挡掉大半这类坑。
并发之外:智能体编码的三个真实陷阱
光有并发循环还不够,真把 Sonnet 5.5 当主力跑起来,有三个坑几乎人人会踩。
第一是上下文膨胀。每个并发分支都带自己的工具调用历史,五条分支跑完一轮,喂回主控的上下文可能翻五倍。再省的模型也扛不住无脑堆上下文,所以收敛后必须做摘要压缩,只把每条分支的最终 diff 和关键决策留下,中间的试错过程该丢就丢。不做这一步,第二轮循环的 Token 账单就会把你省下来的钱全赔回去。
第二是分支同质化。如果你给五个分支的提示词和种子完全一样,它们大概率走出五条几乎相同的路径,并发就退化成五倍成本的串行。正确做法是给每个分支不同的探索种子------换不同的修复假设、换不同的文件读取顺序、甚至换不同的工具组合,让分支真的发散开。发散度不够,是多数人觉得多智能体没用头号原因。
第三是收敛误判。测试通过不等于改对了,尤其是当你顺手把测试也改了。收敛前要锁死测试文件,让分支只能改业务代码不能动测试;收敛后要再跑一遍独立的回归集,而不是直接信分支自报的 passed。这两道闸口看似多余,却能把智能体编码最常见的假成功挡在合并之前。
把这三条管住,Sonnet 5.5 那点便宜和速度优势才真正落到地上;不管住,并发开得越多翻车越快。
该不该把主力模型从 Opus 换成 Sonnet 5.5
最后落到决策。给三句实在话:
第一,日常编码、改 bug、写文档、跑智能体循环------换。这恰是 Sonnet 5.5 的主场,又快又省,并行宽度直接拉满。
第二,一次性高难推理、架构级权衡、需要最强单步判断------留 Opus 5.5。旗舰在单兵硬刚上仍是天花板,别因为它没拿编码第一就否定它。
第三,安全合规、网络攻防类需求------看口径。Sonnet 5.5 这次把攻防拉到 Opus 5 同级,并首次套上和 Fable、Opus 一致的网络安全防护机制,对大多数团队够用;但若你要的是最强攻防而非够用攻防,仍以 Opus 为准。
还有一层常被忽略的成本:切换主力的迁移成本。好在 Sonnet 与 Opus 同属 Claude 家族,接口、工具调用协议、上下文格式几乎一致,从 Opus 5.5 切到 Sonnet 5.5 多半只是改一个模型标识,不用重写智能体骨架。这让按任务分档、日常挂 Sonnet、难题挂 Opus 的混合策略几乎零成本就能落地。
顺带一提,Anthropic 还预告未来几周会发布最小号 Haiku 的新版本,日期未定。如果 Haiku 也跟着提速降本,那旗舰当门面、Sonnet 当主力、Haiku 当海量轻活的三层配置,会越来越像 2026 年团队选模型的标准答案。
回到开头那个反常识:次旗舰赢了旗舰,不是意外,是赛道换了。当评测从单次问答转向长链自主任务,便宜、快、能并发的那一个,就是新的主力。