2026 年 9 月 3 日,OpenAI 发布了新一代旗舰模型 GPT-6 Astra。发布页上最抢眼的数字包括 ARC-AGI-3 得分 99.9%,FrontierMath Tier 4 得分 97.6%,电脑操作任务用时减少约 47%,网络安全能力首次触及 OpenAI 准备框架里的 Critical 门槛。

先用一张表认识 GPT-6 Astra
| 项目 | GPT-6 Astra 的情况 | 怎么理解 |
|---|---|---|
| 发布时间 | 2026 年 9 月 3 日 | 目前仍处在分批推送阶段 |
| 产品定位 | OpenAI 当前能力最强的通用模型 | 面向需要推理、工具和多步操作共同完成的复杂工作 |
| 开放范围 | ChatGPT Plus、Pro、Business、Enterprise,OpenAI API 和 AWS | 官方说法是未来几天陆续开放 |
| API 模型名 | gpt-6-astra |
开发者需要主动切换模型 |
| 上下文长度 | 105 万 Token | 能一次处理大量文档、代码和历史记录 |
| 最大输出 | 12.8 万 Token | 可以生成长报告、代码和完整文档 |
| 输入和输出 | 可读文字和图片,输出文字 | 原生音频、视频输入输出目前不支持 |
| API 标准价格 | 每百万输入 Token 10 美元,输出 Token 50 美元 | 单价是 GPT-5.6 Sol 的 2.5 倍 |
| 知识截止时间 | 2026 年 4 月 30 日 | 此后发生的事仍要联网搜索或补充资料 |
模型规格、工具支持和价格来自 OpenAI 官方模型文档。
会调用工具、会点网页早已算不上新鲜能力,今天的大模型和 Agent 几乎都能演示这些动作。Astra 更进一步的地方在于,它开始更快地理解环境、压缩规则、保存任务状态,并在更长的操作过程中守住权限边界。
Astra 更进一步的地方在哪里
模型操作电脑时,困难往往不在某一次点击。它要先弄明白眼前的软件和数据,记住做到哪一步,根据结果调整计划,还要知道哪些动作不能擅自执行。Astra 在这几件事上同时向前走了一步。
| 变化 | 公开证据 | 带来的区别 |
|---|---|---|
| 电脑操作更快 | OSWorld 2.0 得分从 65.7% 升到 72.6%,单项平均用时从约 75 分钟降到 40 分钟 | 同样一段软件操作,等待时间和中途停顿减少 |
| 更会处理连续流程 | AutomationBench 从 18.1% 升到 41.4% | 模型在多步骤职业任务里的提升超过一倍 |
| 会给陌生环境建立规则 | ARC-AGI-3 评测中,Astra 自行记录坐标、物体关系和行动顺序 | 模型可以边探索边形成一套可继续使用的环境说明 |
| 长任务里更少遗失旧信息 | 在 51.2 万至 100 万 Token 的信息找回测试中得到 96.3%,上一代为 73.8% | 长文档和大型代码任务更容易接住早先的要求与失败记录 |
| 边做边接受修改 | 支持中途追加要求和异步调用工具 | 用户改方向时,已经完成的工作可以继续保留 |
| 权限边界更清楚 | OpenAI 内部电脑操作安全测试为 2.4%,上一代为 22%,该项越低越好 | 自动执行范围扩大以后,越权行为反而减少 |
Astra 与 Fable 5.1 的正面对比
OpenAI 的发布页直接列出了 Claude Fable 5.1。可对照的项目主要集中在职业任务、编程、科学和学术推理,结果如下。
| 领域 | 测试 | GPT-6 Astra | Claude Fable 5.1 | 领先者 |
|---|---|---|---|---|
| 职业自动化 | AutomationBench | 41.4% | 31.4% | Astra |
| CAD 设计 | BenchCAD | 95.9% | 84.3% | Astra |
| 综合智能 | Artificial Analysis Intelligence Index | 61.2 | 65.7 | Fable 5.1 |
| 终端编程 | Terminal-Bench 4.0 | 57.9% | 55.8% | Astra |
| 软件工程 | DeepSWE v1.1 | 74.1% | 67.4% | Astra |
| 复杂代码任务 | FrontierCode 1.1 Extended | 64.5% | 63.6% | Astra |
| 科学终端任务 | Terminal-Bench Science 0.1 | 64.6% | 52.6% | Astra |
| 前沿数学 | FrontierMath Tier 4 | 97.6% | 87.8% | Astra |
| 高难学术问答 | GPQA Diamond | 96.0% | 93.7% | Astra |
| 带工具的综合难题 | Humanity's Last Exam | 57.2% | 65.0% | Fable 5.1 |
| 电脑操作安全 | OpenAI 内部测试,越低越好 | 2.4% | 9.5% | Astra |
这张表能看出 Astra 的长处,它在自动化、软件工程和科学任务上多数领先,Terminal-Bench 和 FrontierCode 的优势很小。Fable 5.1 在 Artificial Analysis 综合智能指数上高出 4.5 分,在带工具的 Humanity's Last Exam 上高出 7.8 个百分点。

这些数字适合判断方向,它们至少说明,头部模型已经很难用一个总分排出稳定顺序。Astra 在行动和科学推理上更强,Fable 5.1 仍然守住了一些宽口径综合测试。
完整数据和口径说明可见 OpenAI 的 GPT-6 Astra 发布页。
99.9% 到底意味着什么
ARC-AGI-3 的 99.9% 是本次发布中最突出的数字。
这项测试让模型进入一组陌生的回合制环境。题目不会直接交代规则,模型要自己探索、总结规律、确定目标,再规划动作。ARC Prize 观察到,Astra 会把物体位置、操作规则和未完成计划压缩成一套简短记号,随后按照这份记录行动。它相当于边玩陌生游戏,边给自己写规则说明,再拿这份说明安排下一步。
同一个模型换一种运行方式,成绩差别很大。ARC Prize 公布的结果显示,标准运行方式得分 62.7%,总成本约 2.6 万美元。允许模型跨请求保留内部推理状态并压缩历史内容后,得分升到 99.9%,总成本约 1.9 万美元。
这里出现了一个很重要的变化。模型性能依赖运行系统怎样保存状态、何时压缩历史、能够调用什么工具。以后比较两个模型,只报模型名称会越来越不够。同一个模型放进不同的 Agent 系统,最终表现可能相差几十个百分点。
99.9% 证明 Astra 很会在这类陌生环境中摸索规则。它没有覆盖现实生活里的常识、责任、价值判断和全部职业技能,很难直接说 AGI 已经完成。测试的计算成本很高,结果对运行方式十分敏感,现实环境还会出现弹窗、权限、错误数据、网络中断和相互冲突的要求。ARC Prize 的完整评测把这些条件写得很清楚。

哪些应用会最先发生变化
影响会先出现在数字材料充足、软件界面明确、结果能够检查的工作里。Astra 的优势需要通过工具落地,也需要用验收标准判断成败。
| 应用领域 | 具体使用方式 | 可能出现的变化 |
|---|---|---|
| 软件开发 | 阅读大型代码库、安装与测试软件、修复问题、迁移数据库、通过浏览器检查前端 | 开发者把更多时间放在需求、架构和最终审核,模型承担连续实现与验证 |
| 科学研究 | 操作专业软件、检查测序数据、跟踪细胞、生成图表、探索数学证明 | AI 从检索和总结进入实验分析与假设验证,研究人员负责判断证据是否成立 |
| 办公与企业系统 | 填写表格、更新 CRM、整理日历、生成文档、表格和演示文稿 | 自动化范围从单个功能扩展到跨软件流程,企业需要重新设计权限和复核步骤 |
| 网络安全 | 检查代码、发现漏洞、验证修补效果、分析恶意程序和检测规则 | 防守方发现问题的速度提高,高风险能力会采用更严格的访问分级 |
| 网站和数字产品 | 创建网站、连接数据、检查页面功能、测试视觉效果 | 从做出页面继续走到运行和质量检查,原型与上线之间的距离缩短 |
| 法律与专业文档 | 按既有模板整理材料、区分文件内容与已确认记录、标出证据缺口 | 模型承担格式化和材料核对,专业人员保留判断与签字责任 |
科学研究可能是其中最有分量的一块。OpenAI 在发布时披露,Astra 帮助改进了两个素数间隔问题的结果。一个结果把无限多素数对的间隔上界从 240 推进到 186,另一个结果改进了八十多年没有变化的一项估计。证明材料仍要交给数学家检查,但模型已经从解答已知题目走向参与开放问题。
网络安全则展示了另一面。Astra 在 ExploitBench 上得到 100%,测试中还发现并利用了两个此前未知的零日漏洞。OpenAI 因此把它列为首个达到 Critical 网络安全门槛的模型。首发版本会拒绝生成更高级的漏洞利用方案,部分正常安全工作也可能被监控系统暂停。
能力越接近真实系统,权限设计越不能留到最后再补。未来企业部署这类模型时,模型本身、可访问的数据、能够使用的软件、审批条件和操作记录会成为同一个产品的一部分。
它会怎样影响大模型行业
第一项变化发生在评测单位上。过去常问一个模型回答得好不好,接下来会更多地问它能否完成一段流程,花了多长时间,中途需要人接手几次,结果能否直接使用。AutomationBench、OSWorld 和数据库迁移测试都在衡量这种完整任务能力。
第二项变化发生在成本计算上。Astra 的输入和输出单价都是 GPT-5.6 Sol 的 2.5 倍。OpenAI 同时表示,它在部分评测中使用了更少的输出 Token,也减少了操作步骤。企业最后会比较完整任务成本,包括模型费用、失败重跑和人工返工。
第三项变化发生在模型竞争方式上。ARC-AGI-3 从 62.7% 到 99.9% 的差距主要来自运行方式。长期记忆、状态保存、工具接口、浏览器环境和权限系统会和模型参数一起决定结果。模型公司、Agent 产品和企业内部系统之间的边界会继续变淡。
第四项变化发生在安全治理上。Astra 的网络安全能力已经能够寻找未知漏洞,OpenAI 又发现它的书面推理比 GPT-5.6 Sol 更难监控。更强的行动能力和更难的监控同时出现,推动厂商把审批、拦截、全程记录和分级开放做成默认配置。安全系统将直接影响模型能发挥多少能力。
GPT-6 Astra 把 AGI 往前推了哪一步
AGI 需要处理陌生问题,也要在环境中获取信息、形成理解、规划行动、记住结果、修正错误,并在人的约束下继续工作。Astra 对 AGI 的推动来自这些能力开始集中到同一个系统里。
| AGI 所需能力 | Astra 已经展示的证据 | 仍然缺少什么 |
|---|---|---|
| 感知并操作数字环境 | OSWorld 2.0 达到 72.6%,完成任务用时减少约 47% | 跨软件工作仍会失败,距离稳定托管还有差距 |
| 从陌生环境学习规则 | ARC-AGI-3 最高达到 99.9%,多数关卡的动作少于人类中位数 | 成绩依赖运行方式,计算成本很高,环境范围有限 |
| 保存长期任务状态 | 百万 Token 信息找回达到 96.3%,Codex 可搜索更早的上下文 | 受控测试不能证明模型能长期自主工作 |
| 参与知识发现 | 帮助推进两项素数间隔研究,并能操作科学软件分析数据 | 结论仍要专家复核,错误责任仍由人承担 |
| 在授权范围内行动 | 多项内部测试里的越权和误导行为明显减少 | 推理过程更难监控,高风险任务需要外部防护 |
这条路线比单纯扩大知识量更接近人们对 AGI 的期待。一个系统遇到陌生环境以后,能自己找信息、记规则、试动作、看结果,再调整计划。它处理的对象也从文字扩展到网页、表格、代码、专业软件和科学数据。
AGI 是否已经到来,答案仍是否定的,不说算力和基础电力设施能否跟上,现在的价格也远远没到能全民使用的时候。
AutomationBench 41.4%,ARC-AGI-3 的标准方式62.7%,高分运行花费上万美元,安全监控还有新的难题。Astra 给出的证据只能说明,模型已经可以在部分数字环境中形成有效规则并采取行动。它把通往 AGI 的几个关键能力接得更紧,也把可靠性、成本和控制问题推到了更具体的位置。
如果你需要在工作流中接入API,自由切换全球200+大模型,魔芋提供合规保障、财务开票、企业级网关、技术支持与定制服务,助力更高效地管理应用AI能力。