大家好,我是孟健。
一次 30 分 43 秒的任务,按 Claude Code cost telemetry 口径花了 15.84 美元,接近 Claude Code Pro 一个月 20 美元月费的 79%。模型无人补提示完成了 23 个文件的重构,新增 43 个 Node 测试和 6 个端到端测试,新增测试与相关验收通过,仓库原有 9 个无关失败没有增加。

9 月 1 日 Anthropic 发布 Fable 5.1 和 Mythos 5.1,官方说 cache read 降价后,典型负载比 Fable 5 便宜 25%,高度 Agentic 任务最多约便宜 45%。上线不到一天,Hacker News 主帖已经超过 1200 points 和 1100 comments。

我当前的主力工具组合是 200 美元/月 Codex 加 20 美元/月 Claude Code Pro,早已不用 Cursor。看到发布后立刻想验证一个问题:已经交了 20 美元 Pro 月费的开发者,还值不值得为 Fable 5.1 单独购买 usage credits?
于是拿我的生产项目 ShipSolo 跑了一次真任务。
01 先把结论摆出来
Fable 5.1 适合坐在升级席位,不适合坐在默认席位。
它应该像一次按需叫来的高级工程师------跨模块、长上下文、可自动验收、至少能省下一小时高级工程师时间的任务,单次约 15.84 美元可以接受。普通功能开发、改文案、修小 bug,继续用套餐内模型。
购买决策要看任务本身的价值、能否自动验收、失败时能否回滚。
我给 Pro 用户的建议:先设 20 美元月度 credits 上限;同等级任务一个月最多跑 1 个。只有确认价值更高时,再主动提高上限。Max 用户先吃套餐内最多 50% 周用量。
02 拿 ShipSolo 跑一个真任务
ShipSolo 是我自己的生产产品。它的后端有一个 6,054 行的 Cloudflare Worker。实验任务是对站点管理和 Plausible 统计域做模块化重构,保持 API 行为、权限、SQL、错误码、前端契约不变,同时新增回归测试。
我选这个 Worker 是因为它混合了站点管理、统计、权限控制、SQL 操作和前端契约,适合考察模型的长上下文和跨文件理解能力。文件越长、职责越杂,越能看出模型会不会在深层逻辑里失控。
实验约束:
- 隔离 worktree,固定 commit,未登录任何线上账号
- 未访问生产数据,未部署、未 push、未 merge
- 模型
claude-fable-5-1,Claude Code 2.1.258 - effort 设置 high,context window 1M
- 人工补提示 0 次
我只给了任务描述,剩下全交给模型。这是敢让昂贵模型跑 30 分钟的前提:隔离 worktree、固定 commit、可回滚、自动测试。代码可以随时回滚,但已消耗的 30 分钟和 credits 无法退回,所以隔离环境和自动验收是必需的。

耗时 1843 秒,即 30 分 43 秒,模型跑了 103 轮,调用工具 102 次。这是长程任务,不是单次问答。
03 看结果:它自己做完了
最终产出:
- 主 Worker 从 6,054 行降到 5,465 行
- 完整变更 23 个文件,+2,413 / -622
- 新增 43 个 Node 测试、6 个 Playwright 测试
- 新建独立
_core/、sites/、stats/模块 - 产物达到 PR-review ready 状态
模型自主修正了两处问题:一条新测试最初对 days=1e2 的预期写错了,另一处首个 build 命令缺少 node_modules/.bin 的 PATH。我没有提醒它,这两处都是它自己发现后改掉的。
模型说"完成了"不算完成,独立复测通过才算。
完成后我用另一个执行者重新跑验收,而不是复述模型自报结果。独立执行的重点不在于命令本身------这些命令既包括仓库原有的测试,也包括模型新写的测试------重点在于验收过程与模型运行相互独立。模型退出后,另一个执行器重新运行相同命令,用于确认可复现性并检查已知测试集是否增加失败。未覆盖边界仍需代码审查和后续验证。
验收结果:
- 新增 Node 测试 43/43 通过
- 原有黑盒 API 集成测试 6/6 通过
- Playwright 测试 12/12 通过
- Python bridge 测试 24/24 通过
- eslint、TypeScript、OpenNext/Cloudflare build 全部通过
- diff check 通过,没有 staged 文件
仓库原来就有 9 个无关 Node 失败,这次重构前后失败集合完全一致。重构前 253 项中 243 通过、9 失败、1 跳过;重构后 296 项中 286 通过、9 失败、1 跳过。9 个既有失败前后集合相同,至少说明本次重构相关的回归测试和独立验证没有发现新增失败。但这不能保证没有任何未覆盖的问题------测试只能证明已知失败集合没有增加,无法保证测试之外的边界完全没问题。
至少在这次任务里,我看到 Fable 5.1 可以在 30 分钟级无人值守任务中维持上下文、完成跨模块重构、测试与自我纠错。103 轮对话、102 次工具调用、30 分 43 秒无人补提示,说明它能处理长程复杂任务。
但是,成本也真的不低。
04 拆账单:便宜的是 cache read
按 Claude Code cost telemetry 与官方 standard API rate,这个任务口径约为 15.84 美元。
需要说明的是,当前 CLI 账号状态显示 Max,但 Max 套餐的 Fable 周用量限制 50%。这里采用 telemetry + standard API rate 口径计算,这是透明边界。如果是 Pro 用户,从第一个 token 起就会使用 pay-as-you-go usage credits。

原始 token 用量:
- 普通输入 4,290 tokens
- 输出 136,820 tokens
- thinking 45,221 tokens
- 1 小时 cache write 329,382 tokens
- cache read 9,474,012 tokens
cache read 占输入类流量 96.6%,占全部处理 token 95.27%。这次 Agentic 长任务里,cache read 量极大,说明 Agent 循环确实不断回读上下文。
费用构成:
- 普通输入 0.043 美元,占 0.27%
- 输出 6.841 美元,占 43.19%
- 1 小时 cache write 6.588 美元,占 41.59%
- cache read 2.369 美元,占 14.95%

官方说降价 25% 到 45%,指的是 cache read 新费率。Fable 5.1 的 cache read 是 0.25 美元/MTok,Fable 5 是 1 美元/MTok。如果用旧价格,同一份用量约 22.95 美元,新价格省下 7.11 美元,即 30.97%。
cache read 降了四倍,输出和首次缓存仍然决定大头账单。
输出和 1 小时 cache write 占账单 84.78%。新 cache 价有效,但首次 cache write 和 output 仍然是大头。这不意味着 Fable 5.1 整体便宜。

Fable 5.1 的费率是:输入 10 美元/MTok、输出 50 美元/MTok、1 小时 cache write 20 美元/MTok、cache read 0.25 美元/MTok。context 1M,max output 128K。
15.84 美元相当于 20 美元 Pro 月费的 79.2%。一次同等级任务就几乎耗尽我建议设置的 20 美元月度 credits 上限。
05 决定怎么用:把它留给难题
官方建议多数任务先用 Opus 5,Fable 5.1 用于 demanding reasoning、long-horizon agentic work,或者 Opus 5 high effort 仍不够的场景。
对 Pro 用户来说,购买标准应该更实际。
什么任务不该用:
- 改文案:单文件小改,模型读不到上下文优势
- 简单 CRUD:逻辑简单,普通模型就够
- 没有测试:模型说通过不算数,人工检查成本太高
- 无法隔离回滚:一旦跑飞,代价不可控
什么任务值得用:
- 任务带来的产出或节省的工程时间,价值明显高于约 16 美元,最好达到费用的数倍
- 跨模块、预计长时间,普通模型已经失败或明显不够
- 验收命令清楚,可以自动跑通
先准备验收和回滚,再让昂贵模型无人值守。
至少满足 3 条再开 Fable:
- 任务带来的产出或节省的工程时间,价值明显高于约 16 美元,最好达到费用的数倍
- 预计耗时 20 分钟以上
- 跨 5 个文件以上
- 能自动测试验收
- 普通模型已经失败或明显不够
这次 ShipSolo 重构任务,5 条全满足。如果是普通功能开发、文案修改、小范围 bug 修复,不值得开 Fable。
usage credits 按 standard API rates 计费,可以设月度上限、自动充值和提醒。我建议 Pro 用户先设 20 美元月度上限,相当于再买一份 Pro 额度,但只留给真正的难题。
同等级任务一个月最多跑 1 个。只有确认价值更高时,再主动提高上限。把 Fable 5.1 当成「难题升级通道」,一个能自动验收、价值高、可能省下一小时以上高级工程师时间的任务,15.84 美元可以接受。
Max 用户的策略更简单:先吃套餐内最多 50% 的周用量,这部分不额外收费。超过后再用 credits。
官方页面写得很清楚:Fable 从一开始就对所有付费套餐开放,但 Pro 和 Max 的使用方式完全不同。Pro 用户从第一个 token 起就要另付费,Max 用户有套餐额度。
我测完这次任务的结论是:Fable 5.1 能力确实强,cache read 降价也确实有效,但对 Pro 用户来说,它不适合日常默认使用。
普通任务继续用套餐内模型。Fable 只留给一个足够贵、足够长、能自动验收的任务。
👋 我是孟健,前腾讯 T11 / 前字节技术 Leader,现在全职做 AI 编程。
🔥 更多 AI 编程实战:
- GitHub:@mengjian-github
- 专栏:AI编程实战
觉得有用?点赞+收藏 就是最大支持 🙏