这两天帮朋友整理一份行业研报的基础资料,前前后后跑了大几十轮 API,今早一看账单愣了 ------ 快两百块的额度,一半都花在了用户反馈分类、资料格式整理这种没什么技术含量的活上。
说实话我之前就是典型的 "顶配党",不管什么任务,上来就选能力最强的模型。总觉得一分钱一分货,贵的模型输出稳,省得返工。直到刷到 GPT 5.6 的更新细节,盯着那三个模型层级看了半天,突然拍了下大腿:我之前那用法,纯纯是让架构师去干录入员的活,纯浪费。
本来我只是随便刷个更新热闹,结果越看越觉得有意思,索性顺着自己之前踩过的坑,把这点思考整理出来。
三个挡位的模型,本质是让你别再 "杀鸡用牛刀"
这次 GPT 5.6 直接拆成了 Sol、Terra、Luna 三个固定挡位,名字起得挺花哨,说白了就是把能力、速度、成本做了三档划分,对应不同难度的任务。

Sol 是顶配,专门啃最难的硬骨头。比如手里攥着五六份来源不同的材料,要交叉验证信息、找矛盾点,或者任务本身目标就模糊,得一边摸索一边调工具、反复检查结果的,这种活交给它才不亏。
Terra 是均衡档,日常大部分工作其实都在这个区间里。写一份文档初稿、敲普通的业务代码、整理数据表格、做常规的内容总结,这些不需要极致推理,但要保证质量稳定的活,用它刚好。
Luna 就是轻快档,速度快、成本低,适合量大、规则明确的高频调用。比如一万条用户评论做分类、从合同里提取固定字段、批量格式化文本,这种结构化强、不需要发散思考的任务,丢给它就行。
我之前最蠢的地方就在这。上个月做用户反馈分析,一万多条评论,我直接开着顶配模型跑了一晚上。现在回头想,那些分类规则我都写得明明白白,无非是按 "功能建议、bug 反馈、体验吐槽" 归个类,这种活别说 Luna,换个更小的模型都能干明白。我多花的那几倍钱,纯纯是为自己的思维定式买单。
说句实在话 以后团队里拼谁 AI 用得好,真不是比谁充的额度多、谁天天用顶配。是比谁能把任务拆明白,什么活派给什么挡位的模型,这才是真的会过日子。就像带团队不能什么活都扔给技术总监,基础活交给实习生,核心难题再让高手上,资源匹配对了,成本直接就能打下来。
比分层更狠的,是工具调用终于不用 "一步一指挥" 了
其实分层只是开胃菜,真正让我觉得 "这玩意儿真的在变实用" 的,是它这次提的 "可编程工具调用"。
不知道你们有没有过这种经历:让 AI 调工具干活,全程得像个保姆一样盯着。比如让它去读一份 PDF 提取字段,它调完文档解析工具,返回一堆乱七八糟的冗余内容,你得再写一大段提示词告诉它 "把这几列拎出来,格式做成表格,去掉空行";等它整理完,你发现漏了几个字段,又得再补一句 "把 XX 字段也加上,按日期排序"。来来回回三四轮,一半 Token 都花在了 "重复说要求" 上。
我之前做合同条款提取的时候,就被这个坑过。一份三十多页的合同,光中间整理数据、修正格式就来回调了五轮,最后算下来,真正用来解析内容的 Token 还没中间沟通的多。当时我还吐槽模型笨,连个中间结果都不会自己处理。
这次的升级刚好戳中了这个痛点。模型不再是 "调一次工具、等一次指令、再走下一步" 的机械模式,它可以在任务中间自己写轻量的程序,把返回的原始数据过滤一遍、整理成需要的格式,甚至自己发现数据有缺失、有矛盾,直接接着调用下一个工具去补全,不用等人在中间发号施令。
就拿行业研究来说,最费时间的从来不是最后写结论,是前面的脏活累活:找资料、判断来源靠不靠谱、整理成统一的表格、发现信息对不上还要再去搜新的资料补差。以前这些步骤,你得盯着 AI 一步步走,它搜完一页你得告诉它 "再去看看竞品的官网",它整理完表格你得告诉它 "这里数据不对,再核实一下"。
现在相当于你把目标说清楚,它自己能把这个流程跑下来。中间数据脏了自己洗,信息缺了自己补,发现矛盾了自己去交叉验证,最后把整理好的初稿和数据源一起丢给你。你不用再当中间的传声筒,只需要最后做审核就行。
从 "问一句答一句" 到 "自己拆任务干活",这才是真正的拐点
我看很多人讨论这次更新,都在纠结跑分涨了多少、有没有超过竞品。说实话,跑分当然重要,但这东西更像个入场券 ------ 过了某个门槛之后,再往上堆智商,对日常工作的提升其实没那么大。
真正值得在意的,是 AI 的角色变了。
前几年的 AIGC 时代,AI 更像个顾问。你得把问题拆得明明白白,问一句,它答一句。你要是只甩一句 "帮我做份运营方案",它大概率给你一堆空泛的正确废话。任务越具体、步骤越清晰,它干得越好;一旦目标模糊、需要自己探索,它就容易跑偏。
但现在的方向明显不一样了。它开始往 "协作者" 的方向走,不用你把每一步都喂到嘴边,你给一个大目标,它能自己拆成小任务,自己调工具推进,自己检查中间结果。说白了,就是从 "你说一步我做一步" 的实习生,变成了能自己扛下一块活的执行岗。
我之前看过一个说法,说 AGI 前夕的标志,不是模型能做对多少难题,是它能不能独立走完一个完整的工作流。现在看好像确实是这么回事。以前我们用 AI,是用它的 "回答能力";以后用 AI,是用它的 "执行能力"。它不再是你问问题的搜索引擎,而是能帮你把流程跑通的虚拟员工。
当然了,能自己跑和能放心让它跑是两回事。现阶段复杂任务肯定还是要人兜底,但哪怕只是能把中间 80% 的机械步骤扛下来,省下来的时间和精力都已经很可观了。
别只盯着跑分了,AI 的真实成本根本不是单 Token 价格
说到这就不得不提一个很多人都有的误区:算 AI 成本的时候,只盯着单 Token 的价格看。
我之前也算过这笔糊涂账,总觉得某模型千 Token 便宜几分钱,就是更划算。直到后来搭了个自动化工作流,才发现根本不是那么回事。
AI 的实际成本,从来都不只是 API 账单上的数字。你算上这些试试:多轮会话里反复写提示词的 Token 开销、工具调用失败后的返工成本、人工检查纠错的时间成本、调试一条工作流稳定跑通要花的时间成本...... 这些隐形成本加起来,往往比明面上的 Token 钱贵多了。
比如两个模型,A 单 Token 比 B 便宜 20%,但工具调用成功率低 30%,经常返回格式错乱的结果,需要人手动修正。那最后算总账,A 的总成本反而比 B 高一大截。因为你省下来的那点 Token 钱,还不够补返工和人工的坑。
GPT 5.6 这次的思路就很实在:它没一味堆跑分,而是盯着 "复杂任务的交付成本" 往下打。代码、浏览、计算机操作、文档、表格、演示,这些日常工作里最高频的场景,它做得更稳、更自动化,中间少出错,少要人干预。看起来单 Token 可能没便宜多少,但一条工作流跑下来,总开销反而降了,因为中间的返工和沟通成本少了。
说实话,跑分是给评测机构看的,落地成本才是给真正用它干活的人看的。以前大家比的是 "谁更聪明",以后大家比的,是谁能把 AI 嵌进具体的工作流程里,把结果控制住,把成本算明白。
最后说两句我自己的感受
其实刷完更新细节那天,我坐着愣了好一会。倒不是因为模型又变厉害了,是突然意识到,我们用 AI 的方式,可能很快就要彻底变了。
以前我们选模型,就一个标准:哪个最强用哪个。以后可能不是了。你手里会有好几个不同挡位的模型,就像团队里有不同职级的员工,你得学会分配任务,知道什么活该派给谁,既能保证质量,又不浪费资源。以后团队之间的差距,可能真不是谁能用到更强的模型,是谁更会 "带" 这个 AI 团队。
当然也不是说就可以完全撒手不管了。越是复杂、责任重的任务,越需要人兜底。AI 能帮你干流程里的脏活累活,能帮你把 80% 的基础工作做完,但最终的判断、决策,还得是人来拍板。它是帮手,不是替代品。
这段时间用下来,我自己最深的感受有三个: 第一,别再迷信 "最强模型" 了。大部分日常工作,均衡档的模型完全够用,把顶配的资源留给真正的难题,成本能降一大截。 第二,AI 的价值早就不在 "回答问题" 了。能不能嵌进你的工作流程,能不能减少中间的人工干预,才是真正的生产力差距。 第三,跑分是门槛,但真到落地干活,稳定性和总成本,比所谓的 "智商天花板" 重要多了。
最后也想问问你们,平时用 AI 干活的时候,有没有过明明简单任务却用了顶配模型的浪费经历?或者有没有自己的分层使用技巧?评论区聊聊,我也想取取经。