GPT-6 Astra发布:复杂任务执行能力继续提升——赛柏特AI快讯

9月3日,OpenAI发布GPT-6 Astra,新模型重点提升了电脑操作、浏览器使用、编程、研究和复杂多步骤任务处理能力。

对于此次更新,OpenA重点强调了Astra处理完整工作流程的能力,包括在浏览器和软件之间连续操作、完成在线研究、处理文档和表格,以及按照企业已有模板制作演示文稿。

此外,任务执行过程中,如果用户补充要求或改变方向,模型也可以继续调整,而不是重新开始。

从单点能力,走向完整任务执行

电脑操作是Astra此次提升较明显的一项能力。

OpenAI公布的OSWorld 2.0测试中,Astra得分为72.6%,高于GPT-5.6 Sol的65.7%。在同一套延迟模拟下,Astra平均完成任务约需40分钟,GPT-5.6 Sol约为75分钟,时间减少约47%。在面向专业自动化任务的AutomationBench中,Astra得分也由GPT-5.6 Sol的18.1%提高到41.4%。

除了电脑和浏览器操作,OpenAI还强化了模型对企业模板、文档结构和任务上下文的处理,希望让输出结果更接近可以直接使用的工作成果,而不是只提供一份需要大量二次整理的草稿。

执行能力提高,控制要求也随之增加

Astra的另一项变化来自安全侧。

OpenAI将其列为Preparedness Framework下首个达到网络安全能力Critical级别的广泛部署模型。

按照公司的说明,在具备相应工具和访问权限的情况下,Astra已经能够发现此前未知的安全缺陷,并进一步开发利用方式,因此上线时同步增加了更严格的安全限制和监测机制。

这些监测会覆盖使用工具执行任务的过程。如果系统发现可能超出授权范围的行为,ChatGPT或Codex中的任务可能被暂停,要求用户确认后再继续;API任务则可能直接停止。

OpenAI也承认,这类额外检查有时会误伤正常任务,并可能带来一定的中断。

但这种监测是必要的。

当AI开始连续访问浏览器、SaaS、云平台和内部系统,企业不仅需要关注模型会不会完成任务,还要关注它可以访问哪些资源、哪些操作需要确认、执行过程能不能被追踪,以及任务跨多个系统运行时是否足够稳定。

随着AI能够承担的任务越来越长,企业评估模型时,完成率、人工接管频率、运行稳定性和权限控制,可能会和模型本身的能力一样重要。

作为全球AI算网基础设施服务商,赛柏特将持续关注全球AI产业与基础设施动态,为广大读者带来更多有价值的AI快讯。

相关推荐
叠层归一研究院6 小时前
区分预算与通道诱导:Ω–L叠层体系的观测赋值与定量验证
人工智能·算法
知几蜗牛6 小时前
AI权限写进JSON就安全了吗?真正缺的是配置生效验证
人工智能
知几蜗牛6 小时前
大模型会规划,为什么人形机器人还站不稳?关键是双层控制
人工智能
爱签AI电子合同6 小时前
电子合同上手成本怎么测?易用性维度专项测评
服务器·人工智能·智能合约·企业微信
知几蜗牛7 小时前
多发一点CSS,页面反而更快:GitHub大规模样式迁移的真正方法
人工智能
小酒星小杜7 小时前
画 AI 漫画,别只会写“日漫风”:10 种画风、适用故事和可复制提示词
人工智能·设计模式·程序员
桃西西呀7 小时前
Laya 源码级原理拆解之二:序列打包与决策头
人工智能·llm·ai编程
知几蜗牛7 小时前
模型能正常出字,答案却悄悄变差:推理配置漂移比报错更危险
人工智能
知几蜗牛7 小时前
模型已经开始吐字,界面为什么还会卡?用本地推理讲清异步流
人工智能
2301_790355977 小时前
适合新手用的AI配音工具推荐:2026年横向测评与选型指南
人工智能·自然语言处理