Claude Code 怎么换用 Claude Fable 5.1:配置步骤、端点验证方法,以及缓存降价 75% 到底省了多少(2026 年 9 月)

Anthropic 在 2026 年 9 月 1 日发布了 Claude Fable 5.1,模型 ID 是 claude-fable-5-1

发布通稿里被引用最多的是基准分数------Terminal-Bench 4.0 编码基准比上一代提高 13%。 但对每天用 Claude Code 干活的人来说,这次真正会改变账单的是另一条,而且它在 大多数报道里只占一行:

缓存读取价格下降 75%,降至每百万 token 0.25 美元。

这篇文章讲三件事:为什么这条对 Claude Code 用户的影响远大于普通 API 调用者、 怎么把手上的 Claude Code 换到 5.1、以及怎么用一条命令验证任意一个端点是不是真的 支持了它。


一、先看这次改了什么

项目 Fable 5 Fable 5.1
模型 ID claude-fable-5 claude-fable-5-1
输入价 $10 / 百万 token $10 / 百万 token(未变)
输出价 $50 / 百万 token $50 / 百万 token(未变)
缓存读取 $1 / 百万 token $0.25 / 百万 token(降 75%)
Terminal-Bench 4.0 --- 比上代 +13%

官方同时提到,Claude Code 用户遇到的网络安全类误判会减少约 60%------就是那种你让它 读一段处理密码的代码、它却拒绝配合的情况。

基础价一分没降,降的是缓存读取。 这个设计对不同使用方式的影响差别极大, 下一节就是讲这个。


二、为什么这条对 Claude Code 影响特别大

要理解这点,得先知道 Claude Code 每一轮交互实际发出去了什么。

你在终端里敲一句「把这个函数改成异步的」,看起来只发了 12 个字。但模型是无状态的, 它不记得上一轮。所以 Claude Code 每一轮都必须把整个上下文重新发一遍

  • 系统提示词
  • 项目的 CLAUDE.md
  • 之前读过的所有文件内容
  • 之前所有轮次的对话和工具返回结果
  • 然后才是你新敲的这 12 个字

一个中等规模项目干上半小时,上下文轻松到 80K token。这 80K 里 99% 是上一轮就发过、 一个字没变的内容------这正是 prompt caching 存在的意义:命中缓存的部分不按输入价 计费,按缓存读取价计费。

所以 Claude Code 的账单构成和普通 API 调用完全不同:

普通 API 调用 Claude Code
典型请求 短输入、短输出、无历史 巨大历史 + 短新增
成本大头 输出 token 缓存读取 token
缓存降价的影响 很小 很大

算一笔账

按官方公开价格推算(不是实测账单,你的实际数字取决于项目大小和交互轮数):

一个 80K 上下文的会话,交互 20 轮,每轮新增输入约 2K、输出约 2K。

计费项 用量 Fable 5 Fable 5.1
缓存读取 80K × 20 轮 = 1.6M $1.60 $0.40
新增输入 2K × 20 = 40K $0.40 $0.40(未变)
输出 2K × 20 = 40K $2.00 $2.00(未变)
单会话合计 $4.00 $2.80

降幅约 30%,而且省下来的全部来自缓存读取这一项

官方给出的口径是「典型工作负载成本比 Fable 5 低约 25%,高度智能体化的工作最多降低 45%」。上面这个 30% 落在这个区间里,方向能对上。

规律:你的上下文越大、交互轮数越多,这次降价对你越有利。反过来,如果你只是 偶尔调一下短 prompt,这次降价你基本感觉不到。


三、怎么换到 5.1

分三种情况,找你自己那一种看。

情况 A:用官方 API

改一个模型 ID 就行。~/.claude/settings.json

json 复制代码
{
  "env": {
    "ANTHROPIC_MODEL": "claude-fable-5-1"
  }
}

或者临时试一下:

bash 复制代码
export ANTHROPIC_MODEL=claude-fable-5-1
claude

进去之后用 /model 命令能确认当前模型,也可以直接在 /model 里切换,不必改配置。

情况 B:用主流云平台上的 Claude

Fable 5.1 已经在 Anthropic 官方 API、以及 Google Cloud、Microsoft Foundry 等平台上线。 各家的模型 ID 命名规则不同(通常会带上版本日期或区域前缀),以你控制台当天列表里 显示的那个字符串为准 ,不要照抄官方文档里的 claude-fable-5-1

云平台这条路的注意点是区域:新模型往往先在部分区域开放,你的项目所在区域可能 还没有。控制台里搜不到就是还没开,等一等。

情况 C:用 Anthropic 协议兼容的第三方端点

这类端点的配置方式是三件套:

json 复制代码
{
  "env": {
    "ANTHROPIC_BASE_URL": "你的端点地址",
    "ANTHROPIC_AUTH_TOKEN": "你的 key",
    "ANTHROPIC_MODEL": "claude-fable-5-1",
    "API_TIMEOUT_MS": "600000"
  }
}

⚠️ 不要同时用环境变量和 settings.json 配同一项 。环境变量优先级更高,你改了 settings.json 却发现没生效,十有八九是 shell 里还残留着 export ANTHROPIC_BASE_URL。 用 env | grep ANTHROPIC 查一下。

但这类端点有个前置问题:它到底支不支持 5.1? 新模型发布后,各家跟进速度不一样, 有的当天就有,有的要等一两周。下一节讲怎么自己验,不用问客服。


四、一条命令验证端点是否支持 5.1

这是本文最该收藏的一段,因为它对任何 Anthropic 协议端点都适用,包括官方的。

方法一:读模型列表(最快,不消耗额度)

bash 复制代码
curl -s https://你的端点/v1/models

实测一个端点的返回(2026-09-02 跑的,未登录、未带 key 也能读):

bash 复制代码
$ curl -s https://flex-api.code2ai.codes/v1/models
json 复制代码
{"data":[
  {"type":"model","id":"claude-fable-5-1","display_name":"Claude Fable 5.1"},
  {"type":"model","id":"claude-fable-5",  "display_name":"Claude Fable 5"},
  {"type":"model","id":"claude-opus-5",   "display_name":"Claude Opus 5"},
  {"type":"model","id":"claude-sonnet-5", "display_name":"Claude Sonnet 5"},
  ...
]}

看到 claude-fable-5-1 在列表里,说明这个端点已经跟进了。

这个方法的价值在于它是自证的 ------不用信任何人的宣传页,列表是机器返回的。 如果一个端点连 /v1/models 都不提供,或者返回的列表和宣传不符,你在花钱之前就知道了。

方法二:验证协议类型(避免踩到套壳)

有些端点宣称「兼容 Claude Code」,实际是 OpenAI 协议加了一层转换。这种在长会话、 工具调用、流式输出上容易出问题。分辨方法是故意请求 OpenAI 的路径

bash 复制代码
# Anthropic 原生路径------应该有响应
curl -s -o /dev/null -w "%{http_code}\n" -X POST https://你的端点/v1/messages \
  -H "content-type: application/json" \
  -H "anthropic-version: 2023-06-01" \
  -H "x-api-key: 随便填一个错的" \
  -d '{"model":"claude-fable-5-1","max_tokens":16,"messages":[{"role":"user","content":"hi"}]}'

# OpenAI 路径------原生 Anthropic 端点这里应该 404
curl -s -o /dev/null -w "%{http_code}\n" -X POST https://你的端点/v1/chat/completions

判读:

结果 说明
/v1/messages 返回 401/v1/chat/completions 返回 404 原生 Anthropic 协议
两条都返回 200 是个转换层,长会话和工具调用要重点测
/v1/messages 返回 404 根本不是 Anthropic 协议,Claude Code 用不了

401 是好结果 ------它说明端点认真校验了 key。实测上面那个端点用错误 key 请求 /v1/messages,返回的是标准 Anthropic 错误体:

json 复制代码
{"type":"error","error":{"type":"authentication_error","message":"invalid api key"}}

错误格式对得上原生协议,说明不是随手糊的转换层。

方法三:真跑一次

前两步过了,最后花几分钱实跑一次:

bash 复制代码
ANTHROPIC_MODEL=claude-fable-5-1 claude -p "用一句话说明什么是 CAP 定理"

能返回内容,这条路就通了。


五、换完之后值得注意的三件事

1. 先跑一周你自己的真实任务再下结论。 基准分数是在标准化任务集上测的,和你的 代码库、你的技术栈、你的提问方式都不一样。判断一个模型好不好用,唯一靠谱的方法是 拿你手上真实的活去跑。

2. 上下文越大越划算,但别为了省钱硬塞上下文。 缓存读取虽然便宜了,仍然是花钱的。 该 /clear 的时候还是要 /clear------一个塞满无关文件的上下文既费钱又降低回答质量。

3. 缓存命中率取决于前缀稳定。 prompt caching 是按前缀匹配的,你在会话中途改动 CLAUDE.md、或者反复调整系统提示词,会让缓存失效、重新按输入价计费。想吃满这次降价, 就让项目配置在一次会话里保持不动。


六、常见问题

Fable 5.1 和 Mythos 5.1 是什么关系?

按官方说明,两者本质上是同一个模型,区别在安全防护级别。Fable 5.1 面向所有人开放; Mythos 5.1 只通过受信任访问计划提供,面向经过审核的网络安全和生命科学从业者。 普通开发者用的是 Fable 5.1。

我在 Claude Code 里 /model 看不到 5.1 怎么办?

先升级 Claude Code 本身。模型列表是客户端和服务端共同决定的,旧版本客户端可能没有 新模型的条目。升完还看不到,就用 ANTHROPIC_MODEL 环境变量直接指定 ID,绕过列表。

订阅制用户能用上吗?

按官方口径:Pro 计划及标准 Team/Enterprise 席位上,Fable 5.1 按 API 费率从随用随付 额度扣除;Max 计划及高级席位上包含在订阅内,最高可占每周用量的 50%。具体额度以你 账户页面显示的为准。

缓存降价需要我做什么才能生效吗?

不需要。Claude Code 默认就在用 prompt caching,你换到 5.1 之后按新价计费,无需配置。 你可以在会话里用 /cost 看当前会话的花费构成。

第三方端点会同步这次降价吗?

不一定,取决于各家的计费方式------按 token 转售的通常会跟,包月套餐的则和 token 价格 不直接挂钩。这属于商务问题,看各家的价格页,本文不做判断。


七、一句话总结

Claude Fable 5.1 对 Claude Code 用户的核心变化不是分数,是缓存读取降价 75%。 你的上下文越大、会话越长,省得越多------按公开价格推算,典型编码会话的降幅在 25%~30% 这个量级。

换用只需要把模型 ID 改成 claude-fable-5-1。如果你用的是第三方端点,先用 curl -s https://端点/v1/models 确认它跟进了,别只看宣传页。


利益披露 :本文作者也在做 Anthropic 协议兼容端点这一类服务,第四节用作实测示例的 端点是其中之一。之所以拿自己的端点做示例,是因为那三条命令必须有真实返回值才有意义------ 而同样的命令对所有端点一视同仁,包括对本文作者:如果哪天那条 /v1/models 返回的列表 和宣传不符,用同一条命令就能查出来。

价格与模型能力数据引自 Anthropic 官方发布说明及公开报道,成本测算为按公开价格推算, 非实测账单。

相关推荐
用户7686874404918 分钟前
我为什么不用 OpenAI 的 function calling,自己用正则解析工具调用
人工智能
正在走向自律18 分钟前
从 Python 基础到大模型落地:读《深入浅出 Python 人工智能》,吃透 AI 工程化 CRUD 实战
开发语言·人工智能·python·机器学习·知识脉络
长沙京卓19 分钟前
MagenticLite 设备需求:能不能本地跑,先分清 App 端和模型端
人工智能·ai
啊阿狸不会拉杆20 分钟前
《计算机网络-自顶向下方法》1.4 分组交换网中的时延、丢包和吞吐量 读书笔记
人工智能·计算机网络
宋哥转AI22 分钟前
深入理解 AI Agent:从黑盒到全链路——生产级 Agent 的可观测性体系怎么建
人工智能·agent·ai编程
Mr.朱鹏23 分钟前
科技周报(2026-09-01期):版权战与机器人潮
人工智能·科技·机器人
打呵欠的猫24 分钟前
前端接口超时从 15s 改到动态值后,用户投诉降了 60%——AI 帮我分析出的方案
前端·ai编程
秦先生在广东34 分钟前
reverse-skill:面向 AI 编码客户端的逆向工程技能路由包
人工智能
天远Date Lab35 分钟前
分布式微服务实战:基于天远车辆估值构建自动化车价评估网关
人工智能·分布式·微服务·自动化