GPT-6 Astra发布:复杂任务执行能力继续提升——赛柏特AI快讯

9月3日,OpenAI发布GPT-6 Astra,新模型重点提升了电脑操作、浏览器使用、编程、研究和复杂多步骤任务处理能力。

对于此次更新,OpenA重点强调了Astra处理完整工作流程的能力,包括在浏览器和软件之间连续操作、完成在线研究、处理文档和表格,以及按照企业已有模板制作演示文稿。

此外,任务执行过程中,如果用户补充要求或改变方向,模型也可以继续调整,而不是重新开始。

从单点能力,走向完整任务执行

电脑操作是Astra此次提升较明显的一项能力。

OpenAI公布的OSWorld 2.0测试中,Astra得分为72.6%,高于GPT-5.6 Sol的65.7%。在同一套延迟模拟下,Astra平均完成任务约需40分钟,GPT-5.6 Sol约为75分钟,时间减少约47%。在面向专业自动化任务的AutomationBench中,Astra得分也由GPT-5.6 Sol的18.1%提高到41.4%。

除了电脑和浏览器操作,OpenAI还强化了模型对企业模板、文档结构和任务上下文的处理,希望让输出结果更接近可以直接使用的工作成果,而不是只提供一份需要大量二次整理的草稿。

执行能力提高,控制要求也随之增加

Astra的另一项变化来自安全侧。

OpenAI将其列为Preparedness Framework下首个达到网络安全能力Critical级别的广泛部署模型。

按照公司的说明,在具备相应工具和访问权限的情况下,Astra已经能够发现此前未知的安全缺陷,并进一步开发利用方式,因此上线时同步增加了更严格的安全限制和监测机制。

这些监测会覆盖使用工具执行任务的过程。如果系统发现可能超出授权范围的行为,ChatGPT或Codex中的任务可能被暂停,要求用户确认后再继续;API任务则可能直接停止。

OpenAI也承认,这类额外检查有时会误伤正常任务,并可能带来一定的中断。

但这种监测是必要的。

当AI开始连续访问浏览器、SaaS、云平台和内部系统,企业不仅需要关注模型会不会完成任务,还要关注它可以访问哪些资源、哪些操作需要确认、执行过程能不能被追踪,以及任务跨多个系统运行时是否足够稳定。

随着AI能够承担的任务越来越长,企业评估模型时,完成率、人工接管频率、运行稳定性和权限控制,可能会和模型本身的能力一样重要。

作为全球AI算网基础设施服务商,赛柏特将持续关注全球AI产业与基础设施动态,为广大读者带来更多有价值的AI快讯。

相关推荐
BehaviourBlogs1 小时前
ChatGPT Work 推出个人写作风格学习功能:从「通用助手」到「个人化写作代理」
gpt·aigc·ai编程
ever_up9731 小时前
LangChain基础知识概述1
人工智能·python·langchain
豆豆1 小时前
AI 建站实战:AI 生成前端页面如何集成自有 CMS 系统
人工智能·cms·网站搭建·网站管理系统·ai建站·建站工具·中小企业建站
cjy0001111 小时前
2026年9月零基础能听懂国内 FDE 讲师的课吗?
大数据·前端·人工智能·fde
百胜软件@百胜软件2 小时前
百胜软件SenClaw胜券助手正式发布:AI让数据“开口说话”,随时赋能零售运营
大数据·人工智能·零售
程序员天天困2 小时前
Claude Fable 5.1 到底怎么样?扒完官方跑分和第三方榜单,说几句实话
人工智能·claude
喜欢睡觉2 小时前
LangChain 输出解析器:从裸文本到结构化输出
人工智能
工业涂料百问2 小时前
【市场格局】系列(四)汽车、船舶、风电涂料赛道对比:1400亿工业涂料里,哪个细分最“肥“?
人工智能·汽车
桃西西呀2 小时前
红酒标签上的 87 分是怎么算出来的?我拿 1599 瓶真酒把线性回归和逻辑回归拆开讲
人工智能·机器学习·llm