GPT‑6.1 Sol 最吸引人的不是一个新榜单,而是"接近 Astra 的能力、更低的每任务成本"这个产品位置。但任何团队都不该因为官方说"约五分之一价格"就全量替换。你真正要测的是:自己的任务成功一次,要花多少钱、重试几次、需要多少人工复核。
发生了什么
OpenAI 在 9 月 29 日 DevDay 发布 GPT‑6.1 Sol。官方模型页确认 API 模型 ID 为 gpt-6.1-sol,标准价格是每百万输入 token 2 美元、缓存输入 0.10 美元、输出 10 美元;超过 272K 输入后,整个请求的输入与缓存费率翻倍,输出费率为 1.5 倍。模型支持 1,050,000 token 上下文、128,000 token 最大输出;工具调用应使用 Responses API。
发布方报告称,GPT‑6.1 Sol 在 DeepSWE 1.1 上以更低推理强度超过上一代 6.4 个百分点;OSWorld 2.0 离线集相对 GPT‑6 Sol 提升 7 个百分点;困难事实性集合中,低推理强度的含错回答比例从 11.4% 降到 7.7%。这些是官方评测,不等于你的仓库、界面和提示词会得到相同比例。
关键原理:单价不是每任务成本
一次成功任务的真实成本,可近似写成:模型调用成本乘以平均尝试次数,再加工具、人工复核和失败损失。缓存输入便宜 95%,前提是重复前缀真的命中;如果每次把时间戳、随机 ID 放在系统提示开头,缓存优势可能消失。长上下文也不是免费保险,越过 272K 后全请求进入更高费率。
#mermaid-svg-lOq0TAUrNXsCg8ax{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-lOq0TAUrNXsCg8ax .error-icon{fill:#552222;}#mermaid-svg-lOq0TAUrNXsCg8ax .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-lOq0TAUrNXsCg8ax .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-lOq0TAUrNXsCg8ax .marker{fill:#333333;stroke:#333333;}#mermaid-svg-lOq0TAUrNXsCg8ax .marker.cross{stroke:#333333;}#mermaid-svg-lOq0TAUrNXsCg8ax svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-lOq0TAUrNXsCg8ax p{margin:0;}#mermaid-svg-lOq0TAUrNXsCg8ax .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax .cluster-label text{fill:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax .cluster-label span{color:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax .cluster-label span p{background-color:transparent;}#mermaid-svg-lOq0TAUrNXsCg8ax .label text,#mermaid-svg-lOq0TAUrNXsCg8ax span{fill:#333;color:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax .node rect,#mermaid-svg-lOq0TAUrNXsCg8ax .node circle,#mermaid-svg-lOq0TAUrNXsCg8ax .node ellipse,#mermaid-svg-lOq0TAUrNXsCg8ax .node polygon,#mermaid-svg-lOq0TAUrNXsCg8ax .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-lOq0TAUrNXsCg8ax .rough-node .label text,#mermaid-svg-lOq0TAUrNXsCg8ax .node .label text,#mermaid-svg-lOq0TAUrNXsCg8ax .image-shape .label,#mermaid-svg-lOq0TAUrNXsCg8ax .icon-shape .label{text-anchor:middle;}#mermaid-svg-lOq0TAUrNXsCg8ax .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-lOq0TAUrNXsCg8ax .rough-node .label,#mermaid-svg-lOq0TAUrNXsCg8ax .node .label,#mermaid-svg-lOq0TAUrNXsCg8ax .image-shape .label,#mermaid-svg-lOq0TAUrNXsCg8ax .icon-shape .label{text-align:center;}#mermaid-svg-lOq0TAUrNXsCg8ax .node.clickable{cursor:pointer;}#mermaid-svg-lOq0TAUrNXsCg8ax .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-lOq0TAUrNXsCg8ax .arrowheadPath{fill:#333333;}#mermaid-svg-lOq0TAUrNXsCg8ax .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-lOq0TAUrNXsCg8ax .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-lOq0TAUrNXsCg8ax .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-lOq0TAUrNXsCg8ax .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-lOq0TAUrNXsCg8ax .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-lOq0TAUrNXsCg8ax .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-lOq0TAUrNXsCg8ax .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-lOq0TAUrNXsCg8ax .cluster text{fill:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax .cluster span{color:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-lOq0TAUrNXsCg8ax .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-lOq0TAUrNXsCg8ax rect.text{fill:none;stroke-width:0;}#mermaid-svg-lOq0TAUrNXsCg8ax .icon-shape,#mermaid-svg-lOq0TAUrNXsCg8ax .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-lOq0TAUrNXsCg8ax .icon-shape p,#mermaid-svg-lOq0TAUrNXsCg8ax .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-lOq0TAUrNXsCg8ax .icon-shape .label rect,#mermaid-svg-lOq0TAUrNXsCg8ax .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-lOq0TAUrNXsCg8ax .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-lOq0TAUrNXsCg8ax .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-lOq0TAUrNXsCg8ax :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 是
否
业务金样本
旧模型基线
GPT-6.1 Sol
质量与失败率
统计token与缓存
计算每成功任务成本
质量和成本均过线?
小流量灰度
保留或分层路由
最小实践:先记录,再决定路由
安装依赖:pip install -U openai。密钥使用环境变量:export OPENAI_API_KEY="..."。下面的请求遵循当前官方 Responses API、模型 ID 和 reasoning.effort 参数;请用自己的 20---100 条任务集运行。
python
import os
from openai import OpenAI
MODEL = "gpt-6.1-sol"
INPUT_PER_M = 2.00
CACHED_PER_M = 0.10
OUTPUT_PER_M = 10.00
client = OpenAI(api_key=os.environ["OPENAI_API_KEY"])
response = client.responses.create(
model=MODEL,
reasoning={"effort": "medium"},
input="检查下面函数的并发风险,并只返回三条可验证结论:...",
)
u = response.usage
cached = getattr(u.input_tokens_details, "cached_tokens", 0) or 0
fresh = u.input_tokens - cached
cost = (
fresh * INPUT_PER_M
+ cached * CACHED_PER_M
+ u.output_tokens * OUTPUT_PER_M
) / 1_000_000
print(response.output_text)
print({"fresh": fresh, "cached": cached,
"output": u.output_tokens, "estimated_usd": round(cost, 6)})
本次环境没有可用 API 密钥,示例未在本次任务中实际运行;模型名、价格、推理档位和 Responses API 用法已按 9 月 30 日官方文档核验。价格估算未含工具调用、区域处理、Fast、Batch/Flex 与超长上下文加价,生产账单应以控制台为准。
对开发者的真实影响
具体场景是代码修复 Agent:简单格式修改可以继续走 Luna,跨文件调试走 6.1 Sol,涉及高风险发布或科学推理再升级 Astra。路由不应只看提示词长度,而应看失败代价。一次 0.02 美元但成功率 60% 的调用,可能比一次 0.08 美元、成功率 95% 的调用更贵。
我的判断是,6.1 Sol 会把"默认上最强模型"进一步变成财务上不合理的选择,但也会让团队更容易误把官方平均值当作自己的收益。正确动作是保留旧模型对照,冻结任务集与评分器,统计成功率、P95 延迟、输出 token、缓存命中、回退率和人工分钟数。
边界、风险与检查表
官方明确评测环境可能与生产 ChatGPT 不同,竞品数据也取自公开报告。迁移前应检查:工具 schema 是否兼容;none 和 minimal 推理档位是否被误用(6.1 Sol 不支持);图像任务是否重跑;超过 272K 的请求是否拆分;缓存前缀是否稳定;高风险动作是否仍需确认。先灰度 5%,连续观察失败类别,而不是只看平均分。
你们选模型时最常漏掉哪个成本:失败重试、人工复核,还是缓存未命中?
关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。
本文首发于 java4u.cn,转载请注明出处。