话说在前头。
最近看到不少人在吐槽: GPT-6 好像也没什么明显提升?
如果你只是打开 ChatGPT,问几个问题、写几段文案、让它总结一下文章,然后跟 GPT-5.6 Sol 对比,我其实完全能够理解为什么会得出这个结论。
因为 GPT-6 Astra 真正让我觉得"这代东西不一样了"的地方,并不完全在聊天框里。
而是在 Codex、Computer Use、长时间任务,以及真正让 AI 去完成一个复杂工作的过程中。
我自己玩了一段时间以后,最大的感觉是:
GPT-6 Astra 已经越来越不像一个单纯回答问题的大语言模型,而像是一个真的能够坐在电脑前替你干活的人。
这两者的区别,其实非常大。
一、GPT-6 Astra 的提升,到底体现在哪里?
这一次 OpenAI 对 Astra 的定位,本身就不仅仅是一个 Chat 模型。
OpenAI 官方把它重点放在了 coding、research、computer use 和复杂多步骤任务上。
也就是说,如果你还在拿它问:
"帮我写一个周报。"
"这段话什么意思?"
"帮我写一个 Python 函数。"
那么确实很难体会到这一代模型真正变化的地方。
真正有意思的是:
给它一个需要半小时、一小时,甚至更久才能完成的目标,然后让它自己研究、操作软件、写代码、修改、发现错误,再继续执行。
这个时候,Astra 和 GPT-5.6 Sol、GPT-5.5 之间的差距就会慢慢显现出来。
我自己的感受甚至不是简单的:
GPT-6 比 GPT-5.6 聪明了 20%。
而更像是它开始逐渐解决另外一个问题:
AI 能不能持续把一件事情做完?
以前的大语言模型经常是第一步非常惊艳,第二步开始跑偏,第三步忘记前面干了什么,第十步以后已经不知道自己在干嘛。
而 Astra 最让我感兴趣的一点,就是这种长任务中的连续性明显变强了。
这可能才是下一阶段 AI 真正重要的能力。
二、Computer Use 才是这一次让我觉得有点夸张的东西
如果把现在 GPT-6 Astra 的 Computer Use 放回一年前,我觉得很多人看到都会大吃一惊。
现在的模型已经越来越能够理解:
我现在在哪个软件里,我要完成什么,我下一步应该点什么,如果失败了该怎么修正。
OpenAI 自己公布的数据里,GPT-6 Astra 在 OSWorld 2.0 上达到 72.6%,GPT-5.6 Sol 是 65.7%;ScreenSpot-Pro 更是从 Sol 的 76.9% 提升到了 Astra 的 92.7%。

这些 benchmark 我不会全部列。
因为普通用户其实不太关心一个模型到底是 72.6 还是 65.7。
真正重要的是: 它开始能够替你操作电脑了。
而且越来越像人。
甚至某些特别规则明确的软件操作,它可能比很多第一次使用这个软件的人更熟练。
这才是让我觉得变化最大的地方。
有时候回头想想其实挺有意思。今天我们可能觉得 GPT-6 Astra 也就这样。
但你再回头使用一下 GPT-5,可能马上就会产生:"我当时怎么受得了这个东西?" 这种感觉。
尤其是早期 GPT-5 刚出来的时候,我自己的体验就挺一言难尽的,某些任务甚至让我觉得还不如 GPT-4o 顺手。
但是 AI 的迭代速度就是这么离谱。
也许一年以后,我们重新回来使用 GPT-6 Astra,也会觉得:
这东西怎么这么笨?
如果真到了那一天,反而说明 AI 的发展速度比我们想象中还快。
三、GPT-6 Astra 很强,但是也是真的贵
这可能是目前 Astra 最大的问题之一。
尤其是在 Codex 里面长期跑复杂工程任务的时候。
大家千万不要觉得:
"我开了 Pro 20x,那我肯定随便用。"
不一定。
目前 OpenAI 的规则是,Astra 会直接消耗你原本的 Codex / Work 使用额度,而且消耗多少并不是简单按照"发了多少条消息"计算。
任务越复杂、上下文越长、推理强度越高,消耗就越明显。
现在社区里面已经出现一些非常夸张的案例。

有人一个大约 6 小时的 Astra 工程任务,就消耗完了 Pro 20x 周额度;也有人反馈某些超重度任务一个小时左右就消耗了非常明显的一部分额度。
所以如果你真的把 Astra 当一个"AI 工程师",让它全天在那里跑任务:
一天打掉非常大一部分周额度完全不奇怪。
这也是为什么我觉得 Astra 现在有点像一个:
能力已经提前来到未来,但是算力成本还留在现在的产品。
如果看 API 定价会更加直观。
GPT-6 Astra 目前输入价格是每百万 Token 10 美元,输出是 50 美元。

而且如果输入上下文超过 272K Token,整个请求的输入以及输出价格还会进一步提高。
所以真正拿它跑超长任务,你会非常直观地感受到:智力是有价格的。 甚至有时候不是你舍不得花钱。而是这个东西真的太能吃 Token 了。 对于普通用户,我反而觉得 Astra 没必要每件事情都开。
普通写作、总结、问答,GPT-5.6 Sol 已经够用了。
真正值得 Astra 出场的是:复杂项目、软件开发、研究、Computer Use、长链路任务、工程问题。
也就是说:把最贵的模型留给最贵的问题。
如果你在国内自己不方便升级 ChatGPT,或者想直接上 Pro 5x、Pro 20x 这类高额度套餐,也可以看看 upchatgpt.com。这是一个已经稳定运行比较久的 GPT 一键升级服务,渠道也比较正规,整个升级流程比较省事,有需要的话可以自己试试。
四、再来说一个非常夸张的数据:ARC-AGI-3
GPT-6 Astra 发布以后,有一个指标我觉得非常值得看。
ARC-AGI-3。

GPT-5.6 Sol 此前在这个测试上的成绩只有大约 7.8%。
而 GPT-6 Astra 呢?
如果使用 ARC Prize 的 Standard Harness,也就是尽量使用统一、供应商中立的测试环境:
62.7%。
这已经是非常离谱的提升了。
但是更夸张的是:
如果使用 OpenAI 的 Provider Adapter Harness------允许模型在多次请求之间保留不可见的 reasoning state,同时使用 compaction 管理长对话。
结果直接来到了:
99.9%。
从 7.8% 到 62.7%。
再到特殊 Harness 下接近 100%。

这也是为什么 Astra 发布以后,很多人直接开始讨论:
AGI 是不是来了?
但这里我反而觉得应该稍微冷静一点。
五、99.9% ≠ AGI
ARC-AGI 的创造者 François Chollet 对 Astra 的评价其实非常高。
他甚至直接把 GPT-6 Astra 称为 interactive reasoning problems 上的 step-function change。
也就是一种阶跃式的能力变化。
他观察到一个非常有意思的现象:
Astra 在面对完全陌生的游戏环境时,会自己建立一种非常紧凑的符号化世界模型。
甚至会创造类似 DSL 的简写规则,用自己的"代数语言"去表示当前游戏世界,然后规划下一步应该怎么做。
这个其实比单纯的 99.9% 更值得注意。
因为它说明模型不只是:
"我以前见过类似题目,所以我知道答案。"
而越来越像:
"我第一次看到这个世界,但是我能够自己推导这个世界的规则。"
这正是 ARC-AGI 想测试的东西之一。
但是,这依然不能直接证明:
GPT-6 = AGI。
一个非常重要的问题就是 Harness。
Standard Harness 下 Astra 是 62.7%。
Provider Adapter 下是 99.9%。
也就是说模型能力很强没有问题,但这个接近满分的成绩,也确实得到了长上下文管理、隐藏推理状态延续以及 compaction 的帮助。

另外还有一个更加现实的问题:
贵。
Chollet 提到,这种连续对话 + 自定义 compaction 的玩法,成本大约可以达到每个游戏 360 美元左右。

ARC Prize 公布的完整测试成本也是数万美元级别。
所以这距离:"随手扔给 AI 一个现实世界任务,然后它便宜、稳定、独立地解决几个星期。"
仍然有非常大的距离。
现实世界的问题比 ARC-AGI-3 的小游戏复杂太多了。现实任务可能持续几天、几个月甚至几年;环境不断变化;
信息不完整;还会遇到人类、组织、法律、物理世界以及各种意外。
所以我觉得 Astra 很强。
甚至可以说这是一次非常明显的 intelligence jump。
但现在就宣布:**AGI 已经实现。**还是太早。