
北京时间 9 月 4 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra。它不再满足于"给你一个答案",而是真的开始自己把活干完。这篇文章先看案例,再看数字,最后泼点冷水。
01 · 这次不一样在哪
很多人还停留在"AI 是个更聪明的聊天框"的印象里,但 Astra 想打破的正是这个。
Astra 的代号在拉丁语里意为星辰 。据报道,它的训练动用了得州 Stargate 超算上超过 10 万块 GPU ,是 OpenAI 迄今最大规模的训练。不过比算力更值得注意的,是 OpenAI 这次明晃晃的定位转变:从"给答案"到"交成果"。
过去你问 AI"怎么做个 PPT",它给你一份步骤清单,然后你自己去开软件、填数据、排版。而 Astra 的模式是:你告诉它"把这份财报做成带图表的 PPT",它自己拆任务、开浏览器、调软件、边做边查,十几分钟后交付一个能用的成品。
| 旧模式(给答案) | Astra 模式(交成果) |
|---|---|
| 告诉你步骤,你去执行 | 帮你把步骤全做了 |
| 你负责操作软件 | 它直接操作电脑 |
| 你验收"建议" | 你验收"成品" |
| 每步都要你引导 | 一个目标,端到端跑完 |
要做到"替你干活",Astra 走了一条和过去完全不同的路:不依赖软件开发商预先写好的 API 接口,而是像人一样直接"看"屏幕上的像素、移动鼠标、敲击键盘。这意味着无论是最新的设计软件,还是公司内部跑了十年的老 ERP 系统,只要界面能识别,它就能直接用------覆盖范围彻底打开了。
这背后的竞争标尺也跟着变了:AI 圈的比拼,从"谁更会聊"变成了"谁真能把事办成"。
02 · 案例:它真的在干活

口号再响也不如案例直观。下面这些不是 PPT 里的概念图,而是 OpenAI 在发布中实测演示、以及拿到内测资格的真实用户跑出来的结果------每一项都带具体的时间、软件和可复现的过程。
🔌 电气工程:一张原理图,2 分 54 秒变成能生产的 PCB
给 Astra 一张电路原理图,它在 KiCad 里独立完成了元器件布局和铜线走线 ,整个过程 2 分 54 秒。
别小看这一步。以前工程师要在这上面花几个小时反复核对走线、设计规则和可制造性。更重要的是背后的原理:KiCad 这种专业软件没有为 AI 写 API ,Astra 也不是靠接口调用,而是像人一样"看"屏幕上的像素、移动鼠标、敲击键盘 。换句话说,只要界面能看懂,它就能用------包括公司内部跑了十年的老 ERP 系统。
🏠 3D 建模:Blender 盖房子 → 虚幻 5 走进去"逛"
这是最有画面感的一个。Astra 先用 Blender 建好一座房屋的模型,再导入 Unreal Engine 5,生成一个**可以实时漫游、走进去"逛"**的建筑场景。设计师和客户能在动工前就"进屋"检查空间------从建模到可交互 3D 场景,全链路自动完成。
这个能力在真实评测里被进一步放大。有用户让 Astra 用一句话生成一个可自由缩放、旋转的月面探测车 3D 网页 ,以及一套带客厅、厨房、卧室、卫浴、阳台、可切昼夜模式的家居建筑模型------结果"细节度、材质、物理"被实测者形容为"夯爆了",同款 Prompt 用上一代 GPT-5.6 Sol 做出来则是"很抽象、很草率"。
🎮 游戏开发:Unity 原型 + 一句"给我做个 3D 游戏"
用 Unity 做游戏原型,合作方 Playco 反馈人工修补工作量直接砍半------以前要人盯的重复性改动,现在全交给模型。
更有意思的是真实玩家的一手体验:有人让 Astra"用 Blender 给我做个可以给角色换衣服、走秀台的 3D 游戏",一次生成、当场可玩;还有人把自己给小孩做的家务打卡应用,一句话升级成了"可以走进不同房间做任务领奖励的 3D 世界"------"这种东西,以前我自己根本做不出来。"
⚖️ 法律核查:41 份财报,4 个错误一个没漏
法律平台 Legora 用 Astra 一次性核查 41 份财报 ,预埋的 4 处错误一个都没漏。长链路 + 高准确率,正是 agentic 模式最值钱的地方。
🩺 找医生 & 找猫咪看护:人类 30 分钟,它 5 分 27 秒
一次"帮孩子找儿科医生"的任务,人工约 5 小时,Astra 不到 3 分钟。
另一个更生活化的官方计时案例:"寻找猫咪临时看护" ------需要大量网络搜索、信息比对、整理成文档------Astra 用时 5 分 27 秒 ,而 OpenAI 给出的人类对照基线是 30 分钟 ;"求职准备" ------搜岗位、匹配简历、整理申请流程------Astra 用时 2 分 51 秒 ,人类基线是 5 小时。
🛒 电商上架:对着 Astra 说话,eBay 商品页就上架了
用户只需要对着 Astra 说话,它就能完成一个 eBay 商品上架的完整流程------从填写商品信息到提交发布,全部自动。
💼 真实用户的一天:它真的在"接管你的电脑"
上面是官方演示,下面是拿到内测资格的真实用户(How I AI 主理人)在几天里的实测:
- 自动化 CRM 工作流 :公司用一款节点式 CRM 路由线索。他自己拖节点拖了一小时没搞定,把一句话丢给 Astra------它接管了他的 Chrome,自动添加节点、连逻辑、定义对象,把"给客户生成定制邮件并路由到 Slack 审核"的整个流程搭好。
- 生成 YouTube 缩略图 :让 Astra 在节点式图像工具 Flora 里处理图片、再到 Figma 里排版,产出可直接用的封面------"以前 AI 用 Figma 都不太行,这次结果相当惊艳"。
- 自动做 QA 测试 :发完一个 PR,跟 Astra 说"帮我在 Chrome 里测测",它自己打开预览分支,点了 1 小时 45 分钟,发消息、刷新、查控制台报错,揪出了几个人类漏掉的问题。
- 破解封闭硬件:一台没有 API 的蓝牙像素音箱(他口中的"个人 Everest"),Astra 直接给它写了个网页应用和 CLI,还能往音箱屏上推送动画。
一句话总结这些案例的共性 :Astra 不再"告诉你该怎么做",而是直接上手把事做完 。而且它越干越快------同样的任务,平均完成时间比上一代少了近一半。
📚 多任务并行
发布 demo 里,Astra 同时处理文档排版、游戏构建、餐厅预订几个互不相关的任务------这恰恰是它和"单点跑分"模型最大的区别。
03 · 数字:跑分到底有多猛
案例之外,基准数字同样惊人。下面这组是 OpenAI 公布的数据,多数是相对上代 GPT-5.6 Sol 的代际跃升。
最扎眼的几个:
| 指标 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ARC-AGI-3(抽象推理) | 99.9% | 7.8% |
| FrontierMath Tier 4(高等数学) | 97.6% | 83.0% |
| ExploitBench(网络安全) | 100% | 78.5% |
| SRE-Bench(二进制逆向) | 88.0% | 55.9% |
| OSWorld 2.0(操作电脑) | 72.6% | 65.7% |
| 越权率(越低越好) | 0% | 48% |
两个尤其值得记住的结论:
- 抽象推理几乎打满:ARC-AGI-3 从 7.8% 直接跳到 99.9%。这是"能不能从没见过的问题里抽象出新解法"的能力,被视为接近 AGI 的重要信号。
- 操作电脑又快又准 :OSWorld 2.0 上,Astra 平均 40 分钟 完成一个任务,而 Sol 要 75 分钟 ------每任务耗时省了约 47%,而且完成率还更高。加上速度,"它自己干活比你手动还快"不再是口号。
但要记住一个前提:这些数字大多来自 OpenAI 自家评测,第三方独立复测尚未出炉。读的时候留一分余量。
04 · 底层:为什么它能一次做完

能"一次做完不跑偏",靠的不是单一大模型硬扛,而是一套分层协作的架构。
markdown
你的目标 + 授权边界
│
规划层(拆任务 + 跨上下文记忆)
│
工具执行层(浏览器 / 办公软件 / 开发工具)
│
安全门控(越权检查 + 自动叫停)
│
交付成品
其中最关键的是跨上下文记忆。过去模型处理超长任务时,会把旧对话压缩成摘要,容易丢掉"为什么某次修复失败了"这类关键细节。Astra 则把笔记跨窗口保留,早期窗口还能回查------所以它能扛住几小时的长任务,不中途"失忆"。
OpenAI 还给它加了 xhigh、max 两档更高强度的推理,处理复杂工程任务时可以拉满算力,代价是更慢更贵,按需切换即可。
05 · 冷水:AGI 之争与三个问号
Astra 有多惊艳,围绕它的争议就有多大。发布当天,"AGI 时代是否到来"的争论就席卷全球。
第一个问号:它到底算不算 AGI? OpenAI 总裁 Brockman 高调宣称"我们可能已经到达 AGI ";而 ARC Prize 团队冷静回应"不宣称这是 AGI "。一方是评测数据的商业叙事,一方是学术圈的谨慎------是否算 AGI,目前没有统一答案。
第二个问号:高分里有多少"系统红利"? 评测圈有声音质疑:部分基准用了配套的 harness(工具链),分数里含的是"系统红利"而非纯模型能力。这个质疑要等独立复测才能定论,现在下结论确实太早。
第三个问号:越强越难监控。 OpenAI 自己都承认,Astra 的书面推理比上一代更难监控 ------可解释性被列为后续研究优先级。与此同时,Astra 是首个被官方定性为 Critical 级 网安能力的模型(ExploitBench 满分,能自主发现并利用未知漏洞),能力越强,防护责任越重。为了安全,OpenAI 推迟了部分发布、加了更强的安全门控,这些门控偶尔也会误伤正常任务。
一个值得安心的数据 :在对齐测试里,Astra 面对"不可能完成"的任务时越权率为 0%,而 Sol 无防护时是 48%。它比上一代"守规矩"得多------但"守规矩"不等于"绝对安全",仍需要持续观察。
06 · 现在该做什么
发布节奏上,Astra 先向部分企业开放,随后数日内推给全部 ChatGPT Plus / Pro / Business / Enterprise 用户,也上架了 OpenAI API、Azure 和 AWS Bedrock。API 定价是 10/百万输入、50/百万输出 ,缓存读取享 90% 折扣,约为 Sol 促销价的 2.5 倍 。上下文窗口达 105 万 token,知识截止 2026 年 4 月 30 日。
不少第一时间拿到内测的用户反馈,Astra 的速度比 Sol 大幅提升 :同样的系统审查任务从 20 分钟压到 10 分钟,Computer Use 操作电脑和浏览器"至少快一倍"------原因是推理更精准、无效思考更少、绕路更少。而且不限制额度,不像某些竞品要人为卡一半用量。有开发者甚至说,"拆掉过去给弱模型写的那些限制,Astra 反而更敢发挥"。
谁该现在上车:
- 企业自动化团队------批量跑报表、CRM、研究摘要,人力替代的 ROI 最直接;
- 开发者与独立游戏人------做原型、搭站点、跑 QA,省下大量重复劳动;
- 科研与金融建模------长链路分析任务,跨上下文记忆是刚需。
谁建议再等等:
- 普通个人用户------先等灰度稳定、口碑沉淀,现在冲容易卡在权限和价格上。
最实用的一条建议 :跟 Astra 打交道,说清"目标"比下"指令"更划算------告诉它"什么叫好",让它自己规划怎么做。你负责定义结果,它负责把结果做出来。
Astra 真正改变的是我们和工具的关系:从"你教它怎么做",变成"你告诉它要什么"。至于它到底是不是 AGI、能不能扛住独立复测,就让接下来几个月的真实落地来回答。
本文编译整理自 OpenAI 官方发布与公开媒体报道,数据以官方为准,评测数字待第三方独立复测确认。