Claude Fable 5.1 发布于 2026 年 9 月 1 日。接进去要知道的东西,其实就是三个数字加一个选择,而真正影响账单的是后者。这篇是查阅用的参考,不是评测------想看它和 Opus 5 的成本之争,去这篇。
标识符
| 字段 | 值 |
|---|---|
| 模型 ID | claude-fable-5-1 |
| 上下文窗口 | 1M token |
| 最大输出 | 128K token |
| Thinking | Adaptive,常驻开启 |
| 默认 effort | high |
| 可靠知识截止 | 2026 年 6 月 |
Adaptive thinking 在这个模型上关不掉。做预算时这一条要留意,因为 thinking 产生的 token 按输出计费,走的是 50 那一行,不是 10 那一行。
五档费率
Anthropic 每个模型公布五档费率,多数文章只引其中一档。单位是美元每百万 token:
| Fable 5.1 | Fable 5 | Opus 5 | Sonnet 5 | |
|---|---|---|---|---|
| 基础输入 | 10 | 10 | 5 | 2 |
| 5 分钟缓存写 | 12.50 | 12.50 | 6.25 | 2.50 |
| 1 小时缓存写 | 20 | 20 | 10 | 4 |
| 缓存读 | 0.25 | 1.00 | 0.50 | 0.20 |
| 输出 | 50 | 50 | 25 | 10 |
把两列 Fable 对着看,五个数里有四个纹丝不动。
effort 不改单价,改的是 token 数量
算成本最容易在这一步出错。effort 不是价格档位,上面那些费率在任何 effort 下都成立。effort 改变的是模型在给出答案之前写多少东西。
Artificial Analysis 参与了 Anthropic 的发布前评测。他们实测,Fable 5.1 在 max effort 下的输出 token 约为 Fable 5 的 1.7 倍。输出走 50 那一行。缓存读取虽然便宜了 75%,他们量出来的每任务成本还是高了 20%:3.76 对 Fable 5 的 $3.14。
所以预算上记住一条:调高 effort,涨的是用量,不是单价。在意成本的话先把 effort 封顶,再谈别的优化。
缓存:真正省钱的那部分
缓存读取 0.25,是基础输入 10 的四十分之一。省下来的钱随复用次数放大,所以同一个费率变化落到不同负载上差别极大。
拿一段 100 万 token 的前缀------代码库、文档集,或者一段很长的 system prompt。写入一次,读回 N 次:
| 读取次数 | Fable 5.1 | Fable 5 | 不用缓存 |
|---|---|---|---|
| 1 | $12.75 | $13.50 | $20.00 |
| 10 | $15.00 | $22.50 | $110.00 |
| 100 | $37.50 | $112.50 | $1,010.00 |
| 500 | $137.50 | $512.50 | $5,010.00 |
假设只写一次 5 分钟缓存,期间不过期。「不用缓存」一列,是把同样的内容完整传 N+1 次、按每百万 token $10 算出来的。
读 1 次时两个版本差距在 6% 以内,读 100 次时 Fable 5.1 只要 Fable 5 的三分之一。表里这几行用的是同一个模型,唯一的变量是你回头用了这段缓存上下文多少次。去数缓存命中次数,别数请求数。
TTL 这个选择
Anthropic 卖两种缓存写入时长:5 分钟每百万 token 12.50,1 小时 20。选哪个,牵动的金额比这次降价本身还大。
5 分钟这个时限没听上去那么紧。Anthropic 的 prompt caching 文档写得很明确:「缓存每次被使用时都会免费续期。」只要有请求写入或读取了这个条目,生命周期就从那一刻重新开始算。持续命中同一段前缀的 agent,光靠读取就能把 5 分钟的条目一直续着,只付一次写入费。
钱是漏在空档里的。规划、等一次慢工具返回、有人在看 diff,只要安静超过五分钟,条目就过期,下一次调用重新付写入费。这样跑一小时,最坏是 12 × 12.50 = **150** ,而 1 小时档写一次是 $20。
同一段前缀,一小时最多能差出 $130。差多少取决于你的流量形态,跟选哪个模型无关。
从 Fable 5 迁过来
要改的是一个字符串。基础费率、上下文窗口、输出上限、默认 effort 全都没变,所以换掉模型 ID 就是全部迁移动作:
- model="claude-fable-5"
+ model="claude-fable-5-1"
换完之后有两件事要复查,因为 diff 里看不出来:
-
输出预算。单价一样,但同档 effort 下 token 更多。如果你的告警阈值是照 Fable 5 的输出量标定的,换完会响。
-
知识截止的假设。2026 年 6 月比 Fable 5 的截止更靠后,那些为了绕开过时的库版本知识而写的提示词,现在可能已经多余,甚至会起反作用。
除了价格,Anthropic 还说改了什么
Claude Fable 产品页讲的是行为,不是跑分。它写道 Fable 5.1「不走看似省事的捷径,修问题的根因而不是症状,并在工作过程中持续同步进展」。
有两次护栏调整很容易混为一谈,不少文章也确实混了。2026 年 8 月 7 日,Anthropic 调整的是 Fable 5 的生物学护栏,称该更新「在我们的各产品界面上,让生物学相关的降级回退减少了约 85%」。另一件事在 9 月 1 日的发布公告里:Anthropic 说在网络安全方面,Fable 5.1「最新的护栏拦下的误报比之前少 60%」。所以「误报变少」确实是 5.1 这次发布的说法,但指的是网络安全那一侧,和 8 月那次生物学调整不是一回事,两个数字也不能叠着算。
通过 Ofox 调用
Fable 5.1 已于 2026 年 9 月 3 日进入 Ofox 目录 ,ID 是 anthropic/claude-fable-5.1。别名 claude-fable-5-1------也就是 Anthropic 自己的模型 ID------同样可用,所以从 Anthropic 直连迁过来,除了加服务商前缀之外不用改字符串。
同一把 Key 还能跑 anthropic/claude-fable-5、anthropic/claude-opus-5、anthropic/claude-sonnet-5,都按 Anthropic 官方定价计费,不加价。四个都支持两种协议:
| 协议 | base URL |
|---|---|
| OpenAI 兼容 | https://api.ofox.io/v1 |
| Anthropic 原生 | https://api.ofox.io/anthropic |
走原生那条能拿到 Messages API。Ofox 文档在这条路径上明确列了 extended thinking 和工具调用,没有单独提缓存参数,所以第一次重复调用先确认返回里的 usage.cache_read_input_tokens 不为 0,再按上面那笔 TTL 的账算。
import anthropic
client = anthropic.Anthropic(
base_url="https://api.ofox.io/anthropic",
api_key="<OFOX_API_KEY>",
)
message = client.messages.create(
model="anthropic/claude-fable-5.1",
max_tokens=1024,
messages=[{"role": "user", "content": "总结一下这个代码库。"}],
)
五档费率全部与 Anthropic 官方定价一致、不加价,所以这篇里的每个数字都能直接套用。真正决定这笔便宜下来的缓存读取对你值不值钱的,仍是缓存命中率------先在自己的流量上量一遍,再假定那 25% 会落到你头上。
费率与规格于 2026 年 9 月 3 日核对自 Anthropic 定价文档、模型总览、产品页与发布公告;每任务成本数据来自 Artificial Analysis,同日取得;Ofox 目录与协议 base URL 同日核对自线上 /v1/models 接口及 Ofox 文档。