没想到来得这么快,又有好戏看了!
如题,Opus5.5 的弟弟 Sonnet5.5 来了,Anthropic 这一波完全"掀桌子"了 !
Sonnet5.5 有一项数据居然比 Opus5.5 还高很多!
GPT-6 Sol突然变得毫无性价比------性能比不过,价格更比不过!
下面就具体来看一下,这次发布的关键信息!

我们先来看一下最核心的一个点,官方第一条推特的内容:
介绍 Claude Sonnet 5.5,这是 Claude 5.5 系列中的第二个模型。 它比 Sonnet 5 有明显的升级,运行速度快 30% 以上,对于大多数工作,成本可降低高达 30%。
同时,也配了一个关于"地平线"的视频,这次视频的开头是 Claude 坐在宇宙飞船中凝望地球!
这条推文主要表达了 3 个核心点:
- 能力明显升级
- 速度提升 30%
- 成本降低 30%
下面的内容就是围绕这三个点来的。
1、能力提升
关于能力提升部分,我觉得这个视频很有代表性!

不用解释,非常直观吧!
无论是主体建模还是环境建模,尤其是树叶飘落的效果,都非常好!
Sonnet5.5 已经像一个不错的作品了,Sonnet5 基本是抽象艺术。
上面展示了一个很直观的例子,下面来看一下具体的基准数据!

你们注意到没?这里有一个很离谱的数据!
终端命令行智能体(Terminal-Bench 4.0)这一项高到离谱!
Sonnet 上一代只有 10%,这一代直接飙到 70%,还一把超过了它哥 Opus5.5,而 GPT-6 Sol 连数据都没公布。
另外两项编程相关的基准数据也不低!
这里有一个非常有意思的细节,FrontierCode 这个基准 Xhigh 的评分比 Max 高!
从这个表格里来看,我们还可以发现另外一个问题!
GPT-6 Sol 是彻底被比下去了!
Sonnet 和 Sol 都是弟弟定位,但是 Sonnet 各项指标都比 Sol 强,有些是强了好多。
2、价格便宜
这一部分的官方结论是:
在多项基准测试中,Sonnet 5.5 在低或中等努力水平下,以大约十分之一的成本就超过了 Sonnet 5 的最佳得分。
知识工作中的表现:

我简单解释一下这个图:越是左上角性价比越高。越是右下角性价比越低。
可以看到差不多的成本,能力大幅提升! 这一部分 Sonnet5.5 的价格和能力比下来基本和 Opus5.5 重叠了。
意思就是知识工作相关部分很强,消耗也不算低!
下面是智能体编程相关的数据:

这张图里可以看到 Sonnet5.5 成本最低,能力也不错,比 Sonnet5 和 GPT-5.6 Sol 性价比要高出很多很多。

这个图中可以看到 Sonnet5.5 低思考等级,性价比已经夯爆了。可以说是全方位围着 GPT-6 Sol 打的! 相比 Sonnet5 也是巨大的提升!

这一张,就更加清晰了! 彻彻底底的能力更强,成本更低!
知识工作和编程这两块,Claude 是无敌了!
3、速度提升
能力、价格谈完了,再来谈谈速度!
官方给了一个写代码的例子:

Sonnet5.5 已经出效果了,Sonnet5 还在写代码。
另外还有一个非常直观的例子:

这个例子是让它们还原魔方!
Sonnet5 用了 15 秒,成本 0.15,Sonnet5.5 用了 10 秒,成本 0.11。
所以,30% 这个指标并非空穴来风,这个例子完美诠释了。
另外官方也强调了有关写作的问题:像 Opus 5.5 一样,Sonnet 5.5 的写作比我们上一代模型更清晰。
这一部分的结论是:它的速度也使其非常适合快速迭代以及在不太复杂的任务上进行协作。
再讲一个很"恐怖"的事情,更便宜的 Haiku 在路上,OpenAI 的 Luna 瑟瑟发抖中。
本以为"弟弟"没啥好看的,没想到也是有很多看点!
哥哥很强,弟弟不弱,性价比更高,速度更快!
我快速跑了一个例子:

论极限能力 Sonnet5.5 肯定还是弟弟,Opus5.5 是绝对的王者! 但是比之前 Sonnet5 确实强了不少。应该是能赢很多其他一线模型的。
我会继续测测看,如果有亮点或者槽点我就单独发一篇,如果一切都如本文描述,发挥稳定,我就没必要发了。
对最强 AI 模型,对 Claude 感兴趣的,可以持续关注------我!