9月3日,OpenAI发布GPT-6 Astra,新模型重点提升了电脑操作、浏览器使用、编程、研究和复杂多步骤任务处理能力。
对于此次更新,OpenA重点强调了Astra处理完整工作流程的能力,包括在浏览器和软件之间连续操作、完成在线研究、处理文档和表格,以及按照企业已有模板制作演示文稿。
此外,任务执行过程中,如果用户补充要求或改变方向,模型也可以继续调整,而不是重新开始。

从单点能力,走向完整任务执行
电脑操作是Astra此次提升较明显的一项能力。
OpenAI公布的OSWorld 2.0测试中,Astra得分为72.6%,高于GPT-5.6 Sol的65.7%。在同一套延迟模拟下,Astra平均完成任务约需40分钟,GPT-5.6 Sol约为75分钟,时间减少约47%。在面向专业自动化任务的AutomationBench中,Astra得分也由GPT-5.6 Sol的18.1%提高到41.4%。
除了电脑和浏览器操作,OpenAI还强化了模型对企业模板、文档结构和任务上下文的处理,希望让输出结果更接近可以直接使用的工作成果,而不是只提供一份需要大量二次整理的草稿。

执行能力提高,控制要求也随之增加
Astra的另一项变化来自安全侧。
OpenAI将其列为Preparedness Framework下首个达到网络安全能力Critical级别的广泛部署模型。
按照公司的说明,在具备相应工具和访问权限的情况下,Astra已经能够发现此前未知的安全缺陷,并进一步开发利用方式,因此上线时同步增加了更严格的安全限制和监测机制。
这些监测会覆盖使用工具执行任务的过程。如果系统发现可能超出授权范围的行为,ChatGPT或Codex中的任务可能被暂停,要求用户确认后再继续;API任务则可能直接停止。
OpenAI也承认,这类额外检查有时会误伤正常任务,并可能带来一定的中断。
但这种监测是必要的。
当AI开始连续访问浏览器、SaaS、云平台和内部系统,企业不仅需要关注模型会不会完成任务,还要关注它可以访问哪些资源、哪些操作需要确认、执行过程能不能被追踪,以及任务跨多个系统运行时是否足够稳定。

随着AI能够承担的任务越来越长,企业评估模型时,完成率、人工接管频率、运行稳定性和权限控制,可能会和模型本身的能力一样重要。
作为全球AI算网基础设施服务商,赛柏特将持续关注全球AI产业与基础设施动态,为广大读者带来更多有价值的AI快讯。