Anthropic把Claude Code 2.1.236及以上版本的Fable 5会话

新智元报道

Claude一夜变笨,全网吵翻了!

就在昨天,开发者argofowl花了整整一个下午,差点把Claude Code翻了个底朝天。

他一路排查,先是怀疑是t3 code崩了,接着又以为自己的代码出现了bug。

查到最后,他甚至开始怀疑------难道是自己把Mac搞坏了?

当argofowl最终打开API的真实请求日志时,一切真相大白,里面赫然写着一个数字「10」。

然而,在Claude Code后台,他明明选的是「high」,最高档推理程度。

谁曾想,Claude Code的更新日志,一个字都没写。

推理high变成10

Claude Code变笨曝光

argofowl发现,从Claude Code 2.1.237开始,模型把「high」推理程度读成了10 out of 100。

而这个数字,正是过去「low」档对应的值。

细扒发现,Anthropic把Claude Code 2.1.236及以上版本的Fable 5会话,纳入了一个「压缩effort数值刻度」的实验。

不过,老版本和Opus 5不受影响。

这大概率是个A/B测试,所以不是人人都会撞上。

对开发者来说,这才是真正的痛点。模型强一点弱一点,还能忍。

但你把我拉进了实验组,却不打算告诉我:那我这一下午到底在debug什么?是在调自己的代码,还是在调你的A/B测试?

没想到,科技博主Chubby转发之后,AI圈直接炸了------

看起来,Anthropic把模型悄悄调笨了,却没告诉任何人。

一时间,X上「Claude变笨了吗」的自测帖子刷屏。

有人贴出同一段prompt在不同版本下的输出对比,有人翻出自己两周前的会话记录做逐行diff。

Anthropic认错,工程师下场

面对这场风暴,Claude Code工程师Thariq Shihipar的回应来得很快。

我们有时候会在Claude Code里先测试API的服务配置,再决定要不要全量推。

现在跑的这个实验,只是把effort的数值映射方式改了。所以有些人会看到Claude说自己是「10」。

关键是,这个刻度不是0到100,那个数字单独看没有任何意义,你选的effort就是你拿到的effort。

他强调,团队做了深入的评测来确认,这不影响模型性能。

Opus 5大降智,是真的

刚解决掉Fable的问题,Chubby又直言,Opus 5现在感觉像是一次显著的降级。

它总是敷衍了事,频犯低级错误。一旦被指出没按指令执行,它就只会机械地回复那句------

你说得对,是我疏忽了。翻来覆去,没完没了。

其实,早在几天前,有人就发现了Opus 5明显「降智」的问题。

除了上面提到的问题,它还会制造bug,然后耗费大量时间修bug,同一任务中反复自我纠正.......

在被网友追着问了一圈之后,工程师Thariq公开承认------Opus 5是个「表现很不稳定」的模型,忽高忽低,不稳定。

团队内部正在为努力解决这一问题,这对我们来说是最高优先级。

跑分永远向上

体感一路向下

Opus 5这场风波,撕开的其实是整个行业最尴尬的一道口子:

跑分和体感,后续来看《- JINtc.Cn -万无一失》《- 22Co.Cn -万众一心》《- CNHao.Cn -万水千山》《- TCQncy.Cn -万事大吉》《- 51Byyb.Cn -万象更新》《- JINtc.Cn -一星半点》《- 22Co.Cn -一扫而空》《- CNHao.Cn -一视同仁》《- TCQncy.Cn -一网打尽》《- 51Byyb.Cn -一相情愿》《- JINtc.Cn -一叶知秋》《- 22Co.Cn -一语道破》《- CNHao.Cn -一枕黄粱》《- TCQncy.Cn -一朝一夕》《- 51Byyb.Cn -二惠竞爽》随着发行节奏逐渐加快,三季度或是全年地方债发行高峰,较二季度或将迎来较为明显的规模抬升。正在系统性地脱钩。

一边是亮眼到近乎无可挑剔的成绩单:综合得分82.72、SWE-bench Pro 79.2%、Terminal-Bench 86.7%。

另一边,却是用户截然相反的真实感受:「啰嗦」「偷懒」「爱抬杠」。

最荒诞的地方在于,两种评价同时出现在了Opus 5身上。

而且,「模型变笨」也并非Anthropic一家的问题。

如今,大模型的版本更新,正在变成整个AI行业最不透明的黑箱。

传统软件有语义化版本号,有更新日志,也有回滚机制。开发者可以清楚地知道,自己正在使用哪个版本,发生了哪些变化。

大模型,就不同了。

同一个模型名称之下,服务端可能随时进行A/B测试、更换量化方案、调整模型路由,甚至改变推理资源。

人们手里唯一的仪表盘,只剩下自己的体感。

偏偏直觉,是最容易被驳回、也最难被证伪的东西。

这场风波最大的价值,是把行业长期存在的一道暗伤,彻底摆上了台面:

当模型成为基础设施,稳定性就是一份信任契约。跑分可以用来营销,稳定性只能靠一次次兑现。

相关推荐
yijianxiangde10043 分钟前
AI Agent 开发
人工智能
新闻码图43 分钟前
京东物流国际指南:独立站物流重构的四步与选型五标准
人工智能·重构
东坡肘子44 分钟前
AI 想放弃了,人没有 -- 肘子的 Swift 周报 #150
人工智能·swiftui·swift
云雾J视界1 小时前
英伟达AI服务器涨价超15%:HBM存储成本飙升,AI算力成本重构开始
服务器·人工智能·芯片·英伟达·hbm
MartinYeung52 小时前
[论文学习]Poser:通过操纵内部结构揭示对齐伪装的大语言模型
人工智能·学习·语言模型
Feynman’s boom2 小时前
PDF解析复盘
数据库·人工智能·算法·pdf解析
其实防守也摸鱼3 小时前
推荐一个自动化教育SRC漏洞挖掘系统--AutoHunter
运维·开发语言·人工智能·学习·安全·web安全·自动化
振浩微433射频芯片3 小时前
从门锁到考勤,VRC522B如何在近场读卡场景中“稳坐C位”?
网络·人工智能·单片机·物联网
码视野3 小时前
多宠 RFID 颈圈识别与湿粮半导体制冷保鲜分餐喂食器解决方案(软硬件一体化)
大数据·人工智能·python