GPT-5.6 Luna API 价格详解:1 亿缓存 Token 成本、LinkAGI 接入与 Codex 配置

LinkAGI 控制台:https://api.linktoagi.com

本文以 2026 年 7 月 19 日的 OpenAI 官方价格和 LinkAGI 模型广场页面价为基础,完整拆解 GPT-5.6 Luna 的普通输入、缓存输入和输出成本,并给出可运行的费用计算代码与不同客户端的 Base URL。

先说明最容易被误解的结论:多次请求累计读取 1 亿缓存输入 Token,LinkAGI 当前约 1.2 元;1 亿普通输入约 12 元;1 亿输出约 72 元。"1 亿 Token 不到 10 元"只适用于缓存读取,不是所有 Token 的统一价格。

1. 为什么同样是 Token,会有三种价格

一次模型请求至少要区分三类用量:

  • 普通输入(input):本次需要新计算的提示词和上下文。
  • 缓存输入(cached input):与之前请求完全一致、可以复用计算结果的提示词前缀。
  • 输出(output):模型本次重新生成的内容。

Prompt Caching 缓存的不是答案,而是完全相同的提示词前缀计算。即使命中缓存,模型仍会重新生成回答,输出 Token 也会正常计费。

OpenAI 官方文档说明,Prompt 至少达到 1024 Token 才符合缓存条件。固定的系统指令、工具定义、项目规范和示例应该放在前面;用户问题、时间戳和本轮任务等动态内容放在后面。

这正是 Codex、Claude Code 等编程 Agent 容易获得缓存收益的原因:系统指令、工具 Schema、仓库规范和历史上下文往往会在连续多轮请求中重复出现。

2. OpenAI 官方价格与 LinkAGI 页面价

OpenAI API Standard 服务等级下,当 GPT-5.6 Luna 单次输入不超过 272K Token 时,每 100 万 Token 的官方价格为:

计费项目 OpenAI 官方 LinkAGI 当前页面价
普通输入 $1.00 ¥0.12
缓存输入 $0.10 ¥0.012
输出 $6.00 ¥0.72

上表只展示双方各自标价,官方使用美元,LinkAGI 使用人民币。汇率会变化,因此不把它描述成固定倍数折扣。单次输入超过 272K Token 时,OpenAI 官方长上下文价格另计,不能直接套用本表。

LinkAGI 当前模型广场实页如下,价格仍应以访问时的实时页面为准:

3. 一亿 Token 的三笔账

1 亿 Token 等于 100 个"1M Token"计费单位。

text 复制代码
普通输入:100 × ¥0.12  = ¥12
缓存输入:100 × ¥0.012 = ¥1.20
输出:    100 × ¥0.72  = ¥72

所以严谨的宣传口径应该是:**累计读取 1 亿 GPT-5.6 Luna 缓存输入 Token,LinkAGI 当前约 1.2 元。**它不包含普通输入、输出、缓存写入和工具调用费用,也不是一次请求塞入 1 亿 Token。

4. 一个更接近编程 Agent 的混合示例

假设一段时间内累计使用 100M Token,其中:

  • 80M 为缓存输入;
  • 15M 为普通输入;
  • 5M 为输出。

按 LinkAGI 当前价格:

text 复制代码
缓存输入:80 × 0.012 = 0.96 元
普通输入:15 × 0.12 = 1.80 元
输出:     5 × 0.72 = 3.60 元
合计:                 6.36 元

按 OpenAI Standard 短上下文价格,同一组 Token 为 8 + 15 + 30 = 53 美元。双方都暂不计算缓存写入和工具调用费用。这是一组便于复算的示例,不代表所有用户的真实账单。

可运行的 Python 费用计算器

下面的代码已经本地运行验证,输出总费用为 6.36 元:

python 复制代码
PRICE_PER_MILLION_RMB = {
    "input": 0.12,
    "cached_input": 0.012,
    "output": 0.72,
}


def estimate_cost(input_million, cached_input_million, output_million):
    parts = {
        "input": input_million * PRICE_PER_MILLION_RMB["input"],
        "cached_input": cached_input_million * PRICE_PER_MILLION_RMB["cached_input"],
        "output": output_million * PRICE_PER_MILLION_RMB["output"],
    }
    return parts, sum(parts.values())


breakdown, total = estimate_cost(
    input_million=15,
    cached_input_million=80,
    output_million=5,
)
print(breakdown)
print(f"total: RMB {total:.2f}")

运行结果:

text 复制代码
{'input': 1.8, 'cached_input': 0.96, 'output': 3.6}
total: RMB 6.36

更换三个输入值,就能估算自己的工作负载。正式对账仍以控制台调用日志为准。

5. LinkAGI 五步接入

  1. 打开 https://api.linktoagi.com/register,使用页面当前支持的邮箱注册并完成验证码验证。
  2. 在钱包管理中小额充值,当前支持微信支付和支付宝。
  3. 进入令牌管理,为不同项目创建独立 API Key。
  4. 按客户端填写 Base URL 和 API Key。
  5. 先发起一次小额测试,再到使用日志核对模型、状态、Token 数量和扣费。

Base URL 速查

客户端 Base URL 备注
Claude Code / Anthropic https://api.linktoagi.com 使用 Anthropic 类型配置
Codex / OpenAI Responses https://api.linktoagi.com/v1 同时设置 wire_api = "responses"
Gemini CLI https://api.linktoagi.com 按文档配置模型与 Key
OpenAI-compatible 客户端 https://api.linktoagi.com/v1 例如 Cherry Studio、ChatBox

Codex 的提供方配置示意:

toml 复制代码
[model_providers.linkagi]
name = "LinkAGI"
base_url = "https://api.linktoagi.com/v1"
env_key = "OPENAI_API_KEY"
wire_api = "responses"

API Key 请通过环境变量注入,不要提交到 Git 仓库,也不要放在浏览器前端代码中。

6. 常见问题与排查

为什么缓存 Token 一直很少?

先检查 Prompt 是否达到 1024 Token,然后检查系统指令、工具定义和示例等前缀是否在每次请求中完全一致。时间戳、随机 ID 等动态内容如果放在前缀里,也会降低命中率。

"1 亿缓存输入约 1.2 元"是完整账单吗?

不是。它只计算 cached input。普通输入、输出、缓存写入和工具费用需要分别计算。缓存读取量也是多次请求的累计值,不代表一次请求的上下文长度。

单次上下文超过 272K 怎么办?

OpenAI 官方对 GPT-5.6 Luna 的长上下文有单独计费规则。本文只比较 Standard、单次输入不超过 272K 的场景;使用 LinkAGI 时以模型广场和实际调用日志为准。

出现 401、404 或 504 怎么排查?

  • 401:检查 API Key 是否正确、是否带多余空格、环境变量是否生效。
  • 404:优先检查客户端类型与 Base URL,Codex/OpenAI-compatible 通常需要 /v1,Claude Code 使用根地址。
  • 504:通常表示请求耗时超过网关等待时间。先缩短单次任务并重试,再通过问题反馈入口提交时间、模型与请求类型,正式业务应保留备用渠道。

7. 入口与参考资料

官方参考:

价格核对日期:2026 年 7 月 19 日。LinkAGI 实时价格以模型广场和实际账单为准。

相关推荐
8Qi819 小时前
HelloAgents学习笔记:智能体性能评估
llm·agent·ai编程·智能体
恋猫de小郭19 小时前
AI 又又造词,Graph 就又要替代 Loop 了?
前端·人工智能·ai编程
怕浪猫19 小时前
第2章 大脑构建:提示词工程与思维链
aigc·openai·ai编程
dozenyaoyida20 小时前
GPT-5.6 Sol vs Claude Fable 5:100美元预算下的成本-智能比分析
人工智能·gpt·gpt-5.6·claude fable5
AINative软件工程20 小时前
LLM 应用的 Canary 发布工程实践:Prompt、模型和参数变更如何做到安全灰度
ai编程
yaocheng的ai分身1 天前
【准在】GPT-5.6 提示词指引
openai·ai编程
黑科技iOS上架1 天前
MacBookM532G部署本地大模型
经验分享·ai编程
向哆哆1 天前
【Bug已解决】Codex cli model output rendered truncated 解决方案
调试·codex·报错解决
汇智信科1 天前
图谱、向量、关键词、SQL多路一体,FastKG垂域召回率100%拉满
网络·数据库·ai编程·汇智信科·hsim·fastclaw·汇智龙虾