Fable 5.1 实测:15.84 美元,Pro 用户该买吗?

大家好,我是孟健。

一次 30 分 43 秒的任务,按 Claude Code cost telemetry 口径花了 15.84 美元,接近 Claude Code Pro 一个月 20 美元月费的 79%。模型无人补提示完成了 23 个文件的重构,新增 43 个 Node 测试和 6 个端到端测试,新增测试与相关验收通过,仓库原有 9 个无关失败没有增加。

9 月 1 日 Anthropic 发布 Fable 5.1 和 Mythos 5.1,官方说 cache read 降价后,典型负载比 Fable 5 便宜 25%,高度 Agentic 任务最多约便宜 45%。上线不到一天,Hacker News 主帖已经超过 1200 points 和 1100 comments。

我当前的主力工具组合是 200 美元/月 Codex 加 20 美元/月 Claude Code Pro,早已不用 Cursor。看到发布后立刻想验证一个问题:已经交了 20 美元 Pro 月费的开发者,还值不值得为 Fable 5.1 单独购买 usage credits?

于是拿我的生产项目 ShipSolo 跑了一次真任务。

01 先把结论摆出来

Fable 5.1 适合坐在升级席位,不适合坐在默认席位。

它应该像一次按需叫来的高级工程师------跨模块、长上下文、可自动验收、至少能省下一小时高级工程师时间的任务,单次约 15.84 美元可以接受。普通功能开发、改文案、修小 bug,继续用套餐内模型。

购买决策要看任务本身的价值、能否自动验收、失败时能否回滚。

我给 Pro 用户的建议:先设 20 美元月度 credits 上限;同等级任务一个月最多跑 1 个。只有确认价值更高时,再主动提高上限。Max 用户先吃套餐内最多 50% 周用量。

02 拿 ShipSolo 跑一个真任务

ShipSolo 是我自己的生产产品。它的后端有一个 6,054 行的 Cloudflare Worker。实验任务是对站点管理和 Plausible 统计域做模块化重构,保持 API 行为、权限、SQL、错误码、前端契约不变,同时新增回归测试。

我选这个 Worker 是因为它混合了站点管理、统计、权限控制、SQL 操作和前端契约,适合考察模型的长上下文和跨文件理解能力。文件越长、职责越杂,越能看出模型会不会在深层逻辑里失控。

实验约束:

  • 隔离 worktree,固定 commit,未登录任何线上账号
  • 未访问生产数据,未部署、未 push、未 merge
  • 模型 claude-fable-5-1,Claude Code 2.1.258
  • effort 设置 high,context window 1M
  • 人工补提示 0 次

我只给了任务描述,剩下全交给模型。这是敢让昂贵模型跑 30 分钟的前提:隔离 worktree、固定 commit、可回滚、自动测试。代码可以随时回滚,但已消耗的 30 分钟和 credits 无法退回,所以隔离环境和自动验收是必需的。

耗时 1843 秒,即 30 分 43 秒,模型跑了 103 轮,调用工具 102 次。这是长程任务,不是单次问答。

03 看结果:它自己做完了

最终产出:

  • 主 Worker 从 6,054 行降到 5,465 行
  • 完整变更 23 个文件,+2,413 / -622
  • 新增 43 个 Node 测试、6 个 Playwright 测试
  • 新建独立 _core/sites/stats/ 模块
  • 产物达到 PR-review ready 状态

模型自主修正了两处问题:一条新测试最初对 days=1e2 的预期写错了,另一处首个 build 命令缺少 node_modules/.bin 的 PATH。我没有提醒它,这两处都是它自己发现后改掉的。

模型说"完成了"不算完成,独立复测通过才算。

完成后我用另一个执行者重新跑验收,而不是复述模型自报结果。独立执行的重点不在于命令本身------这些命令既包括仓库原有的测试,也包括模型新写的测试------重点在于验收过程与模型运行相互独立。模型退出后,另一个执行器重新运行相同命令,用于确认可复现性并检查已知测试集是否增加失败。未覆盖边界仍需代码审查和后续验证。

验收结果:

  • 新增 Node 测试 43/43 通过
  • 原有黑盒 API 集成测试 6/6 通过
  • Playwright 测试 12/12 通过
  • Python bridge 测试 24/24 通过
  • eslint、TypeScript、OpenNext/Cloudflare build 全部通过
  • diff check 通过,没有 staged 文件

仓库原来就有 9 个无关 Node 失败,这次重构前后失败集合完全一致。重构前 253 项中 243 通过、9 失败、1 跳过;重构后 296 项中 286 通过、9 失败、1 跳过。9 个既有失败前后集合相同,至少说明本次重构相关的回归测试和独立验证没有发现新增失败。但这不能保证没有任何未覆盖的问题------测试只能证明已知失败集合没有增加,无法保证测试之外的边界完全没问题。

至少在这次任务里,我看到 Fable 5.1 可以在 30 分钟级无人值守任务中维持上下文、完成跨模块重构、测试与自我纠错。103 轮对话、102 次工具调用、30 分 43 秒无人补提示,说明它能处理长程复杂任务。

但是,成本也真的不低。

04 拆账单:便宜的是 cache read

按 Claude Code cost telemetry 与官方 standard API rate,这个任务口径约为 15.84 美元。

需要说明的是,当前 CLI 账号状态显示 Max,但 Max 套餐的 Fable 周用量限制 50%。这里采用 telemetry + standard API rate 口径计算,这是透明边界。如果是 Pro 用户,从第一个 token 起就会使用 pay-as-you-go usage credits。

原始 token 用量:

  • 普通输入 4,290 tokens
  • 输出 136,820 tokens
  • thinking 45,221 tokens
  • 1 小时 cache write 329,382 tokens
  • cache read 9,474,012 tokens

cache read 占输入类流量 96.6%,占全部处理 token 95.27%。这次 Agentic 长任务里,cache read 量极大,说明 Agent 循环确实不断回读上下文。

费用构成:

  • 普通输入 0.043 美元,占 0.27%
  • 输出 6.841 美元,占 43.19%
  • 1 小时 cache write 6.588 美元,占 41.59%
  • cache read 2.369 美元,占 14.95%

官方说降价 25% 到 45%,指的是 cache read 新费率。Fable 5.1 的 cache read 是 0.25 美元/MTok,Fable 5 是 1 美元/MTok。如果用旧价格,同一份用量约 22.95 美元,新价格省下 7.11 美元,即 30.97%。

cache read 降了四倍,输出和首次缓存仍然决定大头账单。

输出和 1 小时 cache write 占账单 84.78%。新 cache 价有效,但首次 cache write 和 output 仍然是大头。这不意味着 Fable 5.1 整体便宜。

Fable 5.1 的费率是:输入 10 美元/MTok、输出 50 美元/MTok、1 小时 cache write 20 美元/MTok、cache read 0.25 美元/MTok。context 1M,max output 128K。

15.84 美元相当于 20 美元 Pro 月费的 79.2%。一次同等级任务就几乎耗尽我建议设置的 20 美元月度 credits 上限。

05 决定怎么用:把它留给难题

官方建议多数任务先用 Opus 5,Fable 5.1 用于 demanding reasoning、long-horizon agentic work,或者 Opus 5 high effort 仍不够的场景。

对 Pro 用户来说,购买标准应该更实际。

什么任务不该用:

  • 改文案:单文件小改,模型读不到上下文优势
  • 简单 CRUD:逻辑简单,普通模型就够
  • 没有测试:模型说通过不算数,人工检查成本太高
  • 无法隔离回滚:一旦跑飞,代价不可控

什么任务值得用:

  • 任务带来的产出或节省的工程时间,价值明显高于约 16 美元,最好达到费用的数倍
  • 跨模块、预计长时间,普通模型已经失败或明显不够
  • 验收命令清楚,可以自动跑通

先准备验收和回滚,再让昂贵模型无人值守。

至少满足 3 条再开 Fable:

  1. 任务带来的产出或节省的工程时间,价值明显高于约 16 美元,最好达到费用的数倍
  2. 预计耗时 20 分钟以上
  3. 跨 5 个文件以上
  4. 能自动测试验收
  5. 普通模型已经失败或明显不够

这次 ShipSolo 重构任务,5 条全满足。如果是普通功能开发、文案修改、小范围 bug 修复,不值得开 Fable。

usage credits 按 standard API rates 计费,可以设月度上限、自动充值和提醒。我建议 Pro 用户先设 20 美元月度上限,相当于再买一份 Pro 额度,但只留给真正的难题。

同等级任务一个月最多跑 1 个。只有确认价值更高时,再主动提高上限。把 Fable 5.1 当成「难题升级通道」,一个能自动验收、价值高、可能省下一小时以上高级工程师时间的任务,15.84 美元可以接受。

Max 用户的策略更简单:先吃套餐内最多 50% 的周用量,这部分不额外收费。超过后再用 credits。

官方页面写得很清楚:Fable 从一开始就对所有付费套餐开放,但 Pro 和 Max 的使用方式完全不同。Pro 用户从第一个 token 起就要另付费,Max 用户有套餐额度。

我测完这次任务的结论是:Fable 5.1 能力确实强,cache read 降价也确实有效,但对 Pro 用户来说,它不适合日常默认使用。

普通任务继续用套餐内模型。Fable 只留给一个足够贵、足够长、能自动验收的任务。


👋 我是孟健,前腾讯 T11 / 前字节技术 Leader,现在全职做 AI 编程。

🔥 更多 AI 编程实战:

  • GitHub:@mengjian-github
  • 专栏:AI编程实战

觉得有用?点赞+收藏 就是最大支持 🙏

相关推荐
ajassi20001 小时前
AI语音智能体开发日记(十五)智能体LCD屏幕GIF动画显示方案——从GIF到BMP的完整实战
人工智能·ai·ai编程
ServBay2 小时前
Claude 账号可能被盗刷,而你毫无察觉
api·ai编程·claude
用户7565061786114 小时前
开发 Nemu 的第四天:真实 Beta 如何把一帧判断改造成状态机
aigc·ai编程
空想兔4 小时前
AgentPulse:实时监控所有的 OpenCode Agent 跑到哪一步了
react.js·ai编程
大刚测试开发实战5 小时前
用例写不完、回归跑不动?我把最磨人的活交给 TestHub,KPI 反而稳了
ai编程·测试·claude
杨杨杨大侠5 小时前
一次大模型 API 请求是怎么跑起来的:从 Harness 到 GPU、并发与 KV Cache
aigc·openai·ai编程
wangruofeng8 小时前
2000+ 小时实战后,我的 Agentic Engineering 全套装备「精译」
aigc·agent·ai编程
露天赏雪8 小时前
掘金小册样章
java·开发语言·人工智能·ai编程
wangruofeng8 小时前
Claude Fable 5.1 发布,一个模型两种安全档,账单最多省 45%
aigc·ai编程·claude