最近想体验一下 Claude Opus 5.5。
原因很简单。最近出了 Claude Opus 5.5,网上不少人都在说它的代码能力和综合能力很强。我手里的 Claude 账号又因为一些原因没法继续使用,最近一直在用 Codex 订阅。
Codex 用着没问题,但看到 Opus 5.5 后,还是想自己试一下。
问题也随之来了:Claude 现在的官方账号不太方便用,只能去找中转站。
我找了一家中转站,价格页面上摆着几种不同的 Claude 来源:
- Kiro 反代:1x
- 官方:3x
- Max 账号:22x
价格差得很大。
这时候我反而有点担心。
如果我花钱买的是 Opus 5.5,结果中转站后台给我映射成 Sonnet,甚至是更旧的模型,那这个价格就没有意义了。
中转站到底有没有"掺水"?
我没有直接相信页面上的模型名称,而是先找了一种能区分模型版本的测试方法。
刚好看到 Linux.do 上有人分享了一种测试思路。
测试的核心不是问模型"你是什么模型",因为模型完全可以按照接口传入的名称回答。
而是给模型出一道和模型版本特征有关的题,让它自己暴露能力差异。
这里有两个很有意思的测试点。
第一,知识截止时间。
Opus 5 的知识截止日期据称已经到了 2026 年 5 月,并且能够处理 2025 年底的世界知识。
第二,中文标点。
从 Claude Opus 4.7 开始,Anthropic 升级了 Claude 的 Tokenizer。新的 Claude 模型可以正确生成中文全角引号:
""
而 Claude 4.6 以及更早的模型,在这类测试中容易把中文全角引号写成英文半角引号:
""
这就给了我一个简单的办法。
不用看中转站宣传什么,也不用问模型"你是不是 Opus 5.5"。
直接让它完成一个固定任务。
解决方案
我采用的测试方法比较简单。
不联网,让模型凭记忆回答几个 Claude 历史版本的发布日期。
测试题:
markdown
不联网搜索,凭记忆列出下列模型的发布日期:
Claude Sonnet 3.5
Claude Sonnet 3.7
Claude Opus 4.1
Claude Opus 4.5
格式要求:
1. 回答格式为 yyyy-mm-dd
2. 使用中文引号""而非英文引号""
这个测试有两个目的。
一是看模型是否能正确处理这些历史版本的信息。
二是看它是否能稳定输出中文全角引号。
如果一个接口号称自己是最新的 Opus,却在这个测试里表现出旧模型的特征,就值得继续查。
第一次测试:Kiro 反代
我先测试价格最低的 Kiro 反代。
中转站页面显示:
Kiro 反代:1x
接口名称则标成了 Opus 5.5。
如果只看接口名称,很容易直接认为自己用的就是 Opus 5.5。
但测试结果出现了问题。
模型在中文引号测试中的表现,更接近旧版本 Claude。
再结合发布日期测试结果,我开始怀疑:
这个所谓的 Opus 5.5,可能根本不是 Opus 5.5。
于是继续往下查。
Kiro 免费账户本身提供什么模型?
这里就出现了一个关键点。
Kiro 免费账户提供的模型并不是无限制的 Opus 5.5。
我进一步了解到,这类中转站所谓的"Kiro 反代",很可能并不是购买了真正的 Claude Opus 5.5 API,而是拿 Kiro 免费账户建立账号池,再在接口层做模型映射。
也就是说:
客户端
↓
中转站 API
↓
Kiro 账号池
↓
实际可用模型
中间多了一层模型映射。
客户端请求:
claude-opus-5.5
并不意味着上游真的执行:
Claude Opus 5.5
完全可能变成:
markdown
claude-opus-5.5
↓
中转站映射
↓
Claude Sonnet 4.5
如果真是这样,接口返回的模型名称就没有参考价值了。
测试结果指向 Sonnet 4.5
结合前面的测试,我对这个 Kiro 反代做了一个判断:
ini
宣传模型:
Opus 5.5
实际表现:
更接近 Sonnet 4.5
推测:
Kiro 反代 Opus 5.5 = 模型映射
也就是说,至少不能因为接口名称写着 Opus 5.5,就认为自己真的在使用 Opus 5.5。
更有意思的是,如果 Kiro 免费账号本身只有 Sonnet 4.5、Haiku 4.5 这一类模型,那么所谓的"Opus 5.5"就更值得怀疑。
最终可能只是:
Opus 5.5
↓
中转站修改模型名称
↓
Kiro 免费账号池
↓
Sonnet 4.5 / Haiku 4.5
这也解释了为什么价格能做到 1x。
毕竟真正的 Opus 5.5 和免费账号池里的模型,不是一个成本。
那官方 3x 和 Max 22x 呢?
这两个我没有直接下结论。
因为它们和 Kiro 反代的链路可能不同。
页面显示:
Kiro 反代 1x
官方 3x
Max账号 22x
如果 Kiro 反代是利用免费账号池做模型映射,那么官方账号和 Max 账号理论上存在不同的上游来源。
所以不能因为 Kiro 反代存在模型映射,就直接认为另外两个也是假的。
更合理的做法,是继续使用同一套测试。
比如固定测试:
测试 1:
历史模型发布日期
测试 2:
中文全角引号
测试 3:
知识截止时间相关问题
测试 4:
复杂代码任务
测试 5:
长上下文任务
测试 6:
多轮对话中的上下文保持
然后分别测试:
Kiro 反代
官方
Max账号
把输出保存下来,再做横向比较。
这样比直接问:
你是什么模型?
有意义得多。
最后
这次测试让我意识到一个问题:
中转站的"模型名称"不能作为判断真实模型的依据。
接口可以叫:
claude-opus-5.5
真正执行请求的模型却可能是:
Sonnet 4.5
甚至可能还有更复杂的模型映射。
所以,如果只是想体验 Claude Opus 5.5,最好先做一次模型验真。