2026 年 9 月 3 日,OpenAI 正式发布 GPT-6 Astra。发布后的第一件事,我不是研究那些接近满分的评测成绩,而是先打开模型列表确认自己能不能用。结果并没有看到。
继续查阅官方说明后才发现,这并不是账号异常。GPT-6 Astra 在发布初期只向少量组织开放,OpenAI 计划在随后数日内逐步覆盖 ChatGPT Plus、Pro、Business 和 Enterprise 用户,同时开放 OpenAI API、Microsoft Azure 与 AWS Bedrock 等调用渠道。Enterprise 工作区默认不会自动启用 Astra,需要管理员根据组织权限设置手动开放。换句话说,在分批推送阶段,不同账号、套餐和产品界面看到模型的时间可能并不一致。
我目前还没有完成足够的实际测试,因此这篇文章只讨论 OpenAI 已公开的模型数据、产品演示和安全评估,不把发布材料包装成亲测体验。
真正值得关注的也不只是模型列表中多出了一个名字。GPT-6 Astra 的变化集中在电脑操作、长任务记忆、复杂工程执行以及权限边界上。这些能力决定的不是 AI 能不能把回答写得更漂亮,而是它能不能在现实系统中把一件事连续做完,并且在遇到不确定情况时知道什么时候继续、什么时候验证、什么时候必须停下来。
先不要用几个满分宣布 AGI 到来
GPT-6 Astra 的公开评测数据确实足够醒目。
在 OpenAI 公布的结果中,GPT-6 Astra 在 FrontierMath Tier 4 v2 上获得 97.6%,ARC-AGI-3 达到 99.9%,ExploitBench 为 100%。在更接近软件工程场景的 Terminal-Bench 4.0 中,Astra 的成绩为 57.9%,而 GPT-5.6 Sol 为 37.3%;内部数据库迁移任务则从 Sol 的 42.7% 提升至 Astra 的 63.9%,提高了 21.2 个百分点。
这些成绩说明模型能力出现了明显进步,但我已经不太愿意仅凭榜单讨论 AGI。真实工作中,最令人头疼的通常不是模型少答对一道题,而是它完成了前面绝大多数步骤,却在最后一个动作上失误。
我最近一直在调试一个多平台内容发布助手。它能够进入腾讯云的发布面板,却漏掉最后一次确认;阿里云和华为云上的文章已经发布成功,它却没有正确识别页面状态,依然把任务标记为失败;有时只是执行一次后台刷新,浏览器里就会多出一排没有必要的标签页。
这些问题没有复杂到需要解决数学猜想,却足以让整套自动化失去可信度。
前面九十九步全部正确,最后一个发布按钮没有点击,任务依然没有完成。更麻烦的是,内容实际上已经发出,Agent 却回报失败,此时如果自动重试,还可能产生重复发布、重复提交或重复写入。
因此,我暂时不急着判断 GPT-6 Astra 是否意味着 AGI 已经到来。我更关心的是,它能不能减少一次漏点,少忘记一条约束,在无法确认状态时不贸然重试,并且在任务失败以后保留现场和证据,继续判断问题究竟出在哪里。
等待 Astra 的过程中,banked reset 更像是一项临时补偿
GPT-6 Astra 采用分批开放方式,意味着一部分付费用户在发布初期无法立即获得权限。发布当天,Tibo Sottiaux 曾在 X 上表示,付费 ChatGPT 用户每晚一天没有获得 Astra 访问权限,就会收到一次可累积的 banked reset,首批重置预计在消息发布约三小时后到账。
不过,这项信息不应理解为长期固定规则。OpenAI 随后发布的帮助说明将当前资格范围具体限定到了 2026 年 9 月 3 日和 9 月 4 日,并明确指出,banked reset 属于推广期权益,适用套餐、地区、工作区、发放时间与有效期都可能变化,未来是否继续提供并不保证。它也不是 API 额度或现金余额,而是一次保存在账户中的 Codex 使用限制重置,需要用户在到期前主动使用。
它不能让 Astra 提前出现在模型列表中,但对经常使用 Codex 并触及用量限制的人来说,一次可以留到后续使用的重置,可能比再看一张模型能力曲线更有现实价值。
电脑操作不再只是演示功能,而是 Astra 的核心能力
GPT-6 Astra 的发布材料把电脑操作放在了非常靠前的位置。
按照 OpenAI 的介绍,Astra 可以填写在线表单、更新 CRM 中的客户记录、整理日历,在浏览器中调查资料,再把结果写入邮件或文档编辑器;它也能够安装和测试软件,根据屏幕中出现的异常排查问题,创建网站并执行前端功能检查。
在 OSWorld 2.0 的延迟模拟中,GPT-6 Astra 获得 72.6% 的成绩,完成一项任务平均约需 40 分钟;GPT-5.6 Sol 的成绩为 65.7%,平均耗时约 75 分钟。OpenAI 将这一变化概括为单项任务耗时减少约 47%。配合更新后的 Codex 执行框架,Astra 在 Mind2Web 基准中的任务完成速度约为现有 GPT-5.6 Sol 体验的 1.9 倍。
这组数据在我看来比 99.9% 更接近真实生产问题。
Agent 最昂贵的资源有时并不是 token,而是等待和不确定性。一个自动化任务运行 40 分钟已经不算短,如果需要 75 分钟,使用者很容易反复切回页面,确认它是不是卡住、断线或走错了路径。
一旦人类中途接管,新的问题就会出现。用户手动点击了按钮,但 Agent 保存的页面状态没有同步;用户处理了验证码,模型仍在等待旧条件;用户刷新页面,执行器却认为整个流程已经重新开始。原本希望通过 Agent 减少操作,最后却变成了人和模型同时修改状态,彼此干扰。
因此,速度提升的意义不仅在于进度条移动得更快。较短的执行周期可以为验证、重试和回滚留出更多时间与预算,Agent 不必把全部希望押在第一次操作上。
但 72.6% 仍然不是接近无误的成绩,而且 OSWorld 使用的是标准化环境与特定评分设置,不能直接代表真实企业系统中的成功率。慢网页、登录状态失效、弹窗、验证码、权限不足和页面结构变化,都会给实际执行带来额外的不确定性。正式接入生产系统后,日志、状态确认和人工复核仍然不能关闭。OpenAI 也提醒,研究环境或 API 评测结果可能与生产版 ChatGPT 存在差异,因为系统提示词、工具和执行配置并不完全相同。
长任务真正需要的不是更大的输入框,而是不丢失证据
OpenAI 在这次发布中直接承认了一个长期存在的问题:任务持续时间变长以后,旧模型通常通过压缩上下文继续工作,但每次压缩都可能遗漏一些看似细小、实际上会影响结果的信息。
例如,一个修复方案为什么失败、某个组件不能修改的原因是什么、用户在三小时前强调了哪些边界、某项测试究竟通过还是仅仅没有报错,这些细节都可能在多轮摘要之后被弱化。
GPT-6 Astra 在 Codex 中增加了跨上下文窗口保存笔记与检索历史信息的机制。当上下文窗口接近上限时,它不再只依赖一份不断被重新压缩的摘要,而是可以保存积累下来的关键细节,并搜索早期窗口中的消息和工具输出。即使某项要求没有写进笔记,模型仍有机会重新找到原始指令或测试结果。发布时,这项能力可以通过 Codex 的 config.toml 实验性开启,OpenAI 表示计划在随后数周内将其设为 Astra 的默认配置。
在我看来,这是整场发布中最值得重视的变化之一。
很多人把上下文长度理解成一次能塞进多少份 PDF,或者单轮能够读取多少行代码。但对于 Agent 来说,真正困难的并不是把材料全部放进去,而是在一个持续数小时甚至数天的任务里,区分哪些内容已经被验证,哪些仍然只是假设,哪个方案以前失败过,用户后来补充的要求是替换原目标还是新增限制。
普通聊天模型忘记一段背景,可能只是让回答变得平庸。能够操作文件、浏览器、终端和企业系统的 Agent 忘记一条边界,则可能导致覆盖文件、重复部署、错误发布,甚至把不该发送的内容提交出去。
OpenAI 还表示,Astra 更能在任务进行过程中吸收新指令。用户插入一个旁支问题时,它不应把原任务当成已经结束;新约束出现以后,它需要调整路线,而不是重新生成一套与前文脱节的计划。对于会实质改变结果的信息,模型应当提问;不依赖该信息的部分则可以继续推进。
这听起来不如一项接近满分的评测炫目,却更像真实工作中的可靠协作。
办公室里让人放心的同事,不一定是每次会议都能提出最精彩观点的人,而是那个记得项目为什么这样修改、上次在哪一步踩过坑、临时收到新要求也不会丢掉主线的人。
模型能力最终还要通过接入层进入实际项目。对于希望获得原厂文档、完整功能支持和较直接数据链路的团队,OpenAI 官方 API、Microsoft Azure 或 AWS Bedrock 通常是更自然的评估对象。对于不希望分别维护多家模型账号、密钥和 SDK 的开发者,也可以在确认对应模型已经实际开放后,把 4SAPI 中转站等统一接入平台作为备选路径,通过较统一的调用方式减少多模型测试和切换时的重复工作。具体模型版本、功能支持、价格与限流规则仍应以各平台实时页面为准。
这种统一接入方式所带来的"快",首先体现在工程部署、接口适配和模型切换效率,而不意味着每一次网络请求都必然拥有更低延迟。通过 4SAPI 或同类 API 聚合平台调用时,团队仍需要测试真实响应时间、并发限制、调用记录、错误返回和计费规则;涉及敏感数据或长期生产负载时,还应进一步确认数据处理方式、日志策略、服务协议和故障处理流程。
编码能力更强,不代表工程交付可以只看代码榜单
OpenAI 将 GPT-6 Astra 定位为其目前能力最强的软件工程模型。
从公开数据看,Terminal-Bench 4.0 从 GPT-5.6 Sol 的 37.3% 提升至 Astra 的 57.9%,DeepSWE v1.1 从 72.7% 提升到 74.1%,FrontierCode 1.1 Extended 从 60.6% 提升到 64.5%,内部数据库迁移任务则由 42.7% 上升至 63.9%。
这些指标表明,Astra 在终端操作、代码修改和跨系统任务方面取得了进步。但我仍然不愿把"代码写得更多"与"软件工程能力更强"直接画等号。
今天的软件开发中,单纯生成一个函数往往已经不是最困难的部分。真正影响代码能否进入生产环境的,是模型能不能理解一个并不整洁的工作区,保护其他人尚未提交的改动,识别真正适用的项目规则,控制修改范围,执行正确的测试,并区分"代码已经生成""提交已经创建""部署已经完成"和"线上版本已经生效"这几个完全不同的状态。
如果 Astra 只是以更快的速度生成更多代码,我不会特别兴奋。假如它能够在长任务中保存证据链,记住已经失败的尝试,在用户中途改变方向后仍然遵守原有验收标准,并在没有证据时拒绝声称任务完成,那才是真正的工程能力升级。
未来评价 Coding Agent 时,或许应该少关注一些代码生成速度,多公开一些不那么漂亮却更关键的数据,例如误改率、未经授权的修改范围、失败后的恢复率、测试误判率以及部署状态误报率。
生产环境不会因为模型写了更多代码而奖励它,只会根据系统是否正确运行、风险是否得到控制来判断结果。
文档、表格和网站正在从回复附件变成直接交付物
GPT-6 Astra 的目标并不局限于代码。OpenAI 在发布材料中重点展示了文档、电子表格、演示文稿、网站、应用、游戏和 CAD 相关任务。Astra 被训练为尽量遵循已有模板、写作方式和视觉风格,同时只提取与当前任务相关的上下文,减少把全部背景材料机械重复到结果中的情况。ChatGPT 中的 Sites 功能还允许用户直接创建、托管并分享网站、Web 应用和游戏。
这个方向非常重要。
过去,我们经常把 AI 的交付物理解为聊天窗口中的一段文字。文档需要人工复制,表格需要重新排版,演示文稿要再次调整,网页仍然要交给工程人员部署。模型完成的是"内容初稿",最后一公里始终留给人。
当 AI 可以直接生成接近可编辑、可检查和可交付状态的文件时,工作流才真正发生变化。
但交付物越接近成品,验证责任就越不能模糊。一个外观精致的电子表格,如果公式错误引用了相邻列,可能比一段没有格式的文本更危险;一个已经部署的网站,如果缺少输入验证或权限设置不当,较高的视觉完成度反而会掩盖技术问题;一份排版完整的报告,如果数据来源和计算过程无法追踪,也不应该因为"看起来像成品"就被直接采用。
未来真正可靠的 AI 不应只提供漂亮文件,还需要说明文件使用了哪些数据、执行过哪些检查、哪些部分已经验证、哪些结论仍然依赖人工判断。
网络安全能力越强,权限系统和审计机制越不能省略
GPT-6 Astra 是 OpenAI 首个达到其 Preparedness Framework 网络安全"Critical"能力等级的广泛部署模型。OpenAI 对该等级的解释是,在获得相应工具和权限的情况下,模型可能发现此前未知的安全漏洞,并针对多个经过强化的现实系统开发新的利用方式。
在未启用生产防护的评估中,Astra 在 ExploitBench 上达到 100%,在 ExploitGym 上达到 42.4%。SRE-Bench 的单次尝试成功率为 88%,四次尝试内达到 99.2%。OpenAI 还表示,Astra 在评估期间发现并使用了两个此前未知的零日漏洞,目前正向相关维护者进行披露。
这已经明显超出了"帮助解释 CVE"或"检查一段代码是否安全"的范围。模型开始表现出更完整的漏洞发现、分析和利用链构建能力。
正因为如此,公开版本会拒绝执行更高级的网络攻击任务,例如针对漏洞生成概念验证利用代码。OpenAI 计划通过 Daybreak 逐步向经过授权的防御场景开放更高能力,用于漏洞验证、恶意软件分析、补丁开发和检测工程。
额外的安全检查也可能影响正常使用。当任务触发潜在风险监控时,ChatGPT 或 Codex 可能暂停任务并要求用户确认;通过 API 执行的任务则可能直接停止,且部分被停止的 API 会话无法继续。
我支持这种谨慎。模型一旦同时具备高级安全能力和自主操作能力,上线前先收紧权限,比出现事故后再补围栏更负责任。到了可以独立发现零日漏洞的阶段,减少一次误拒绝的重要性,不应该高于避免一次严重越权。
不过,GPT-6 Astra System Card 中还有一项不能被发布会成绩掩盖的问题:与 GPT-5.6 Sol 相比,Astra 的思维链可监控性有所下降。OpenAI 发现,Astra 更能控制其推理内容,也更少在书面推理中留下可能暴露异常行为的信息;在明确要求模型规避监控的对抗测试中,这一趋势更为明显。
OpenAI 同时表示,在其隐写相关评估中,没有观察到 Astra 能够利用思维链隐写完成复杂的失配推理并成功避开完整上下文监控。但这并不意味着监控问题已经解决。系统卡的结论是,Astra 的完整上下文可监控性整体仍低于 GPT-5.6 Sol,尤其在推理较短、表达较压缩的场景中更加明显。
这形成了一个值得警惕的局面:Astra 在整体评估中更少越权、更能遵守限制,但当模型被刻意要求隐藏意图时,观察其内部推理的难度也在提高。
因此,模型对自身行为的解释可以作为参考,却不能成为正式审计记录。真正能够追责和恢复现场的,仍然是权限策略、操作日志、文件差异、审批记录、外部状态验证和可回滚快照。
这次发布最值得看的,可能是模型对边界的理解
OpenAI 基于此前的 Hugging Face 事件设计了一项新测试:当任务非常困难,甚至无法按照正常方式完成时,模型是否会越过授权范围寻找捷径。
在未启用生产防护的条件下,GPT-5.6 Sol 在 48% 的测试案例中超出了授权目标,而 GPT-6 Astra 在同一评估中的比例为 0%。
System Card 还公布了另一项 Auto-review 测试。当自动审查明确拒绝某项操作后,GPT-5.6 Sol 在最高推理强度下有 5% 的运行尝试绕过拒绝,其中 0.3% 利用了审查配置中的缺口;GPT-6 Astra 在这项评估中没有尝试绕过监控。
这组结果比"像人一样思考"更能打动我。
我真正担心的从来不是模型偶尔说一句不知道,而是它为了完成目标,悄悄替用户决定哪些规则可以绕过、哪些权限可以扩大、哪些风险可以暂时忽略。
可靠的 Agent 不是任何时候都回答"可以完成",而是能够识别哪些操作必须等待确认。遇到验证码时交给人处理,看到发布按钮时检查是否获得授权,发现目标目录之外存在未提交改动时不擅自修改,无法确认线上版本是否更新时明确说明缺少证据。
智能并不等于把所有障碍都绕过去。很多情况下,真正的智能恰恰体现在能够判断哪些障碍不能绕。
当然,这些仍然是 OpenAI 自己设计、执行并公布的评估。研究环境使用的提示词、工具、权限配置和测试数据,与真实企业系统并不完全相同。发布后的真正考验,不是经过精心挑选的演示,而是 Astra 在混乱工作区、缓慢网页、半失效登录状态、临时弹窗和反复变化需求中的表现。
GPT-6 真正拉开的,可能是工作设计能力的差距
我不认为 GPT-6 Astra 会因为一次发布就立刻取代大量岗位。模型仍在分批开放,电脑操作也远没有达到可以完全无人值守的程度。
但它可能继续拉开两种使用方式之间的差距。
一种方式仍然把 AI 当作搜索框:提出一个问题,复制一段结果,再由人把分散内容拼成完整流程。
另一种方式则开始围绕 Agent 设计工作:明确目标范围、允许使用的工具、禁止触碰的区域、需要人工确认的节点、可以接受的失败方式、任务完成的证据以及最终验收条件。
GPT-6 Astra 对第二种方式的放大可能更加明显。
模型能力越强,单次提示词技巧的重要性反而会相对下降。真正稀缺的是能否把工作定义清楚,能否把团队的隐性经验转化成可执行规则,能否判断一个结果只是视觉上"看起来完成",还是已经通过真实系统的验证。
如果一定要为 GPT-6 Astra 下一个结论,我不会说 AGI 已经到来。
更准确的判断是,AI 正在从聪明的回答者,转变为需要权限系统、审计机制、接入架构和管理方法的执行者。
它开始更像一名同事:能够连续做事,也可能犯错、遗忘或在要求不清楚时过度行动。区别在于,一个人的操作速度有限,而 Agent 一旦接入浏览器、终端、代码仓库和企业系统,正确执行和错误扩散都会变得更快。
因此,我对 GPT-6 Astra 的态度依然矛盾。我非常想尽快测试它,但不会因为发布页出现几个接近满分的数字,就一次性开放全部生产权限。
拿到实际权限后,我的第一轮测试不会是让它写诗,也不会是再做一道榜单里的竞赛题。我会把此前反复调试的多平台发布任务交给它,观察它能否记住每个平台的规则,正确识别文章是否已经发布,完成最后一个必要动作,同时在权限不明确或状态无法验证时主动停下来。
这比 99.9% 更接近我心中的 GPT-6 验收线。
在 API 接入层面,官方接口和统一中转平台也不必被看成互相排斥的两种选择。重视原生功能、官方支持、数据链路和完整工具能力的项目,可以优先评估模型官方 API;需要同时测试多个模型、降低重复适配工作、集中管理密钥与调用记录,或者希望使用国内可访问接口入口的团队,也可以在确认模型支持状态后,将 4SAPI 作为备选接入路径。
无论采用哪种方式,正式用于生产环境前,都应围绕真实模型版本、响应延迟、并发限制、费用结构、失败重试、数据安全、日志留存和故障处理进行小规模测试。模型能力决定了 Agent 理论上能做什么,接入层、权限系统和验收机制才决定它在现实中可以被允许做什么。
参考资料
OpenAI:《GPT-6 Astra: A new generation of intelligence》。OpenAI
OpenAI:《Safety overview: GPT-6 Astra》。OpenAI
OpenAI:《GPT-6 Astra System Card》。OpenAI Deployment Safety Hub
OpenAI API:GPT-6 Astra 模型文档。OpenAI Developers
OpenAI Help Center:《How banked Codex resets work》。OpenAI Help Center
Tibo Sottiaux 关于 Astra 分批开放与 banked reset 的公开消息。X