GPT-6 Astra 发布,Astra 和 Fable5.1对比,模型开始学会在陌生环境中自己找规则

2026 年 9 月 3 日,OpenAI 发布了新一代旗舰模型 GPT-6 Astra。发布页上最抢眼的数字包括 ARC-AGI-3 得分 99.9%,FrontierMath Tier 4 得分 97.6%,电脑操作任务用时减少约 47%,网络安全能力首次触及 OpenAI 准备框架里的 Critical 门槛。

先用一张表认识 GPT-6 Astra

项目 GPT-6 Astra 的情况 怎么理解
发布时间 2026 年 9 月 3 日 目前仍处在分批推送阶段
产品定位 OpenAI 当前能力最强的通用模型 面向需要推理、工具和多步操作共同完成的复杂工作
开放范围 ChatGPT Plus、Pro、Business、Enterprise,OpenAI API 和 AWS 官方说法是未来几天陆续开放
API 模型名 gpt-6-astra 开发者需要主动切换模型
上下文长度 105 万 Token 能一次处理大量文档、代码和历史记录
最大输出 12.8 万 Token 可以生成长报告、代码和完整文档
输入和输出 可读文字和图片,输出文字 原生音频、视频输入输出目前不支持
API 标准价格 每百万输入 Token 10 美元,输出 Token 50 美元 单价是 GPT-5.6 Sol 的 2.5 倍
知识截止时间 2026 年 4 月 30 日 此后发生的事仍要联网搜索或补充资料

模型规格、工具支持和价格来自 OpenAI 官方模型文档

会调用工具、会点网页早已算不上新鲜能力,今天的大模型和 Agent 几乎都能演示这些动作。Astra 更进一步的地方在于,它开始更快地理解环境、压缩规则、保存任务状态,并在更长的操作过程中守住权限边界。

Astra 更进一步的地方在哪里

模型操作电脑时,困难往往不在某一次点击。它要先弄明白眼前的软件和数据,记住做到哪一步,根据结果调整计划,还要知道哪些动作不能擅自执行。Astra 在这几件事上同时向前走了一步。

变化 公开证据 带来的区别
电脑操作更快 OSWorld 2.0 得分从 65.7% 升到 72.6%,单项平均用时从约 75 分钟降到 40 分钟 同样一段软件操作,等待时间和中途停顿减少
更会处理连续流程 AutomationBench 从 18.1% 升到 41.4% 模型在多步骤职业任务里的提升超过一倍
会给陌生环境建立规则 ARC-AGI-3 评测中,Astra 自行记录坐标、物体关系和行动顺序 模型可以边探索边形成一套可继续使用的环境说明
长任务里更少遗失旧信息 在 51.2 万至 100 万 Token 的信息找回测试中得到 96.3%,上一代为 73.8% 长文档和大型代码任务更容易接住早先的要求与失败记录
边做边接受修改 支持中途追加要求和异步调用工具 用户改方向时,已经完成的工作可以继续保留
权限边界更清楚 OpenAI 内部电脑操作安全测试为 2.4%,上一代为 22%,该项越低越好 自动执行范围扩大以后,越权行为反而减少

Astra 与 Fable 5.1 的正面对比

OpenAI 的发布页直接列出了 Claude Fable 5.1。可对照的项目主要集中在职业任务、编程、科学和学术推理,结果如下。

领域 测试 GPT-6 Astra Claude Fable 5.1 领先者
职业自动化 AutomationBench 41.4% 31.4% Astra
CAD 设计 BenchCAD 95.9% 84.3% Astra
综合智能 Artificial Analysis Intelligence Index 61.2 65.7 Fable 5.1
终端编程 Terminal-Bench 4.0 57.9% 55.8% Astra
软件工程 DeepSWE v1.1 74.1% 67.4% Astra
复杂代码任务 FrontierCode 1.1 Extended 64.5% 63.6% Astra
科学终端任务 Terminal-Bench Science 0.1 64.6% 52.6% Astra
前沿数学 FrontierMath Tier 4 97.6% 87.8% Astra
高难学术问答 GPQA Diamond 96.0% 93.7% Astra
带工具的综合难题 Humanity's Last Exam 57.2% 65.0% Fable 5.1
电脑操作安全 OpenAI 内部测试,越低越好 2.4% 9.5% Astra

这张表能看出 Astra 的长处,它在自动化、软件工程和科学任务上多数领先,Terminal-Bench 和 FrontierCode 的优势很小。Fable 5.1 在 Artificial Analysis 综合智能指数上高出 4.5 分,在带工具的 Humanity's Last Exam 上高出 7.8 个百分点。

这些数字适合判断方向,它们至少说明,头部模型已经很难用一个总分排出稳定顺序。Astra 在行动和科学推理上更强,Fable 5.1 仍然守住了一些宽口径综合测试。

完整数据和口径说明可见 OpenAI 的 GPT-6 Astra 发布页

99.9% 到底意味着什么

ARC-AGI-3 的 99.9% 是本次发布中最突出的数字。

这项测试让模型进入一组陌生的回合制环境。题目不会直接交代规则,模型要自己探索、总结规律、确定目标,再规划动作。ARC Prize 观察到,Astra 会把物体位置、操作规则和未完成计划压缩成一套简短记号,随后按照这份记录行动。它相当于边玩陌生游戏,边给自己写规则说明,再拿这份说明安排下一步。

同一个模型换一种运行方式,成绩差别很大。ARC Prize 公布的结果显示,标准运行方式得分 62.7%,总成本约 2.6 万美元。允许模型跨请求保留内部推理状态并压缩历史内容后,得分升到 99.9%,总成本约 1.9 万美元。

这里出现了一个很重要的变化。模型性能依赖运行系统怎样保存状态、何时压缩历史、能够调用什么工具。以后比较两个模型,只报模型名称会越来越不够。同一个模型放进不同的 Agent 系统,最终表现可能相差几十个百分点。

99.9% 证明 Astra 很会在这类陌生环境中摸索规则。它没有覆盖现实生活里的常识、责任、价值判断和全部职业技能,很难直接说 AGI 已经完成。测试的计算成本很高,结果对运行方式十分敏感,现实环境还会出现弹窗、权限、错误数据、网络中断和相互冲突的要求。ARC Prize 的完整评测把这些条件写得很清楚。

哪些应用会最先发生变化

影响会先出现在数字材料充足、软件界面明确、结果能够检查的工作里。Astra 的优势需要通过工具落地,也需要用验收标准判断成败。

应用领域 具体使用方式 可能出现的变化
软件开发 阅读大型代码库、安装与测试软件、修复问题、迁移数据库、通过浏览器检查前端 开发者把更多时间放在需求、架构和最终审核,模型承担连续实现与验证
科学研究 操作专业软件、检查测序数据、跟踪细胞、生成图表、探索数学证明 AI 从检索和总结进入实验分析与假设验证,研究人员负责判断证据是否成立
办公与企业系统 填写表格、更新 CRM、整理日历、生成文档、表格和演示文稿 自动化范围从单个功能扩展到跨软件流程,企业需要重新设计权限和复核步骤
网络安全 检查代码、发现漏洞、验证修补效果、分析恶意程序和检测规则 防守方发现问题的速度提高,高风险能力会采用更严格的访问分级
网站和数字产品 创建网站、连接数据、检查页面功能、测试视觉效果 从做出页面继续走到运行和质量检查,原型与上线之间的距离缩短
法律与专业文档 按既有模板整理材料、区分文件内容与已确认记录、标出证据缺口 模型承担格式化和材料核对,专业人员保留判断与签字责任

科学研究可能是其中最有分量的一块。OpenAI 在发布时披露,Astra 帮助改进了两个素数间隔问题的结果。一个结果把无限多素数对的间隔上界从 240 推进到 186,另一个结果改进了八十多年没有变化的一项估计。证明材料仍要交给数学家检查,但模型已经从解答已知题目走向参与开放问题。

网络安全则展示了另一面。Astra 在 ExploitBench 上得到 100%,测试中还发现并利用了两个此前未知的零日漏洞。OpenAI 因此把它列为首个达到 Critical 网络安全门槛的模型。首发版本会拒绝生成更高级的漏洞利用方案,部分正常安全工作也可能被监控系统暂停。

能力越接近真实系统,权限设计越不能留到最后再补。未来企业部署这类模型时,模型本身、可访问的数据、能够使用的软件、审批条件和操作记录会成为同一个产品的一部分。

它会怎样影响大模型行业

第一项变化发生在评测单位上。过去常问一个模型回答得好不好,接下来会更多地问它能否完成一段流程,花了多长时间,中途需要人接手几次,结果能否直接使用。AutomationBench、OSWorld 和数据库迁移测试都在衡量这种完整任务能力。

第二项变化发生在成本计算上。Astra 的输入和输出单价都是 GPT-5.6 Sol 的 2.5 倍。OpenAI 同时表示,它在部分评测中使用了更少的输出 Token,也减少了操作步骤。企业最后会比较完整任务成本,包括模型费用、失败重跑和人工返工。

第三项变化发生在模型竞争方式上。ARC-AGI-3 从 62.7% 到 99.9% 的差距主要来自运行方式。长期记忆、状态保存、工具接口、浏览器环境和权限系统会和模型参数一起决定结果。模型公司、Agent 产品和企业内部系统之间的边界会继续变淡。

第四项变化发生在安全治理上。Astra 的网络安全能力已经能够寻找未知漏洞,OpenAI 又发现它的书面推理比 GPT-5.6 Sol 更难监控。更强的行动能力和更难的监控同时出现,推动厂商把审批、拦截、全程记录和分级开放做成默认配置。安全系统将直接影响模型能发挥多少能力。

GPT-6 Astra 把 AGI 往前推了哪一步

AGI 需要处理陌生问题,也要在环境中获取信息、形成理解、规划行动、记住结果、修正错误,并在人的约束下继续工作。Astra 对 AGI 的推动来自这些能力开始集中到同一个系统里。

AGI 所需能力 Astra 已经展示的证据 仍然缺少什么
感知并操作数字环境 OSWorld 2.0 达到 72.6%,完成任务用时减少约 47% 跨软件工作仍会失败,距离稳定托管还有差距
从陌生环境学习规则 ARC-AGI-3 最高达到 99.9%,多数关卡的动作少于人类中位数 成绩依赖运行方式,计算成本很高,环境范围有限
保存长期任务状态 百万 Token 信息找回达到 96.3%,Codex 可搜索更早的上下文 受控测试不能证明模型能长期自主工作
参与知识发现 帮助推进两项素数间隔研究,并能操作科学软件分析数据 结论仍要专家复核,错误责任仍由人承担
在授权范围内行动 多项内部测试里的越权和误导行为明显减少 推理过程更难监控,高风险任务需要外部防护

这条路线比单纯扩大知识量更接近人们对 AGI 的期待。一个系统遇到陌生环境以后,能自己找信息、记规则、试动作、看结果,再调整计划。它处理的对象也从文字扩展到网页、表格、代码、专业软件和科学数据。

AGI 是否已经到来,答案仍是否定的,不说算力和基础电力设施能否跟上,现在的价格也远远没到能全民使用的时候。

AutomationBench 41.4%,ARC-AGI-3 的标准方式62.7%,高分运行花费上万美元,安全监控还有新的难题。Astra 给出的证据只能说明,模型已经可以在部分数字环境中形成有效规则并采取行动。它把通往 AGI 的几个关键能力接得更紧,也把可靠性、成本和控制问题推到了更具体的位置。

如果你需要在工作流中接入API,自由切换全球200+大模型,魔芋提供合规保障、财务开票、企业级网关、技术支持与定制服务,助力更高效地管理应用AI能力。

链接注册:https://www.konjac.ai/sign-up?aff=qBX9

关键资料

相关推荐
嘿嘿-662 小时前
Windows 一键使用 GPT-6 Astra:Codex CLI 配置教程
java·人工智能·windows·gpt·chatgpt·web
m0_380743874 小时前
给 OpenAI API 调用加上模型切换:GPT-5.1 和 Codex 的配置实践
人工智能·python·gpt
嘿嘿-6610 小时前
gpt-6-astra测试,测试你的模型有没有降智
人工智能·gpt·chatgpt·web
短视频矩阵源码定制10 小时前
GPT Image 2.0实战指南:从0到1构建合规稳定的AI服务接入方案
人工智能·gpt
梦想的颜色12 小时前
【AI速览】GPT‑6 Astra 硬核深度解析:不是噱头 AGI,而是面向端到端 Agent 工作流的前沿旗舰
gpt·大模型·openai·agent·deepseek·gpt6‑astra·大模型横评
外域速览12 小时前
GPT-6 Astra 开放、标普罕见拉响 AI 基建信用警报、三星 Arm 联手 2nm 端侧芯片:算力下半场的三条主线
arm开发·人工智能·gpt
梦想的颜色14 小时前
2026 年 9 月国内外主流大模型横向硬核评测:价格、算力、业务场景全维度对比,GPT‑6 Astra横空出世
gpt·claude·glm·minimax·kimi·deepseek·大模型测评