9月3日,OpenAI正式发布GPT-6 Astra。相比过去大模型发布时频繁强调推理、代码和Benchmark成绩,这一次OpenAI在发布页面和视频里,花了大量篇幅展示AI"怎么工作"。
Astra可以操作Excel、Power BI和网页,填写表格、更新系统信息、进行前端QA;也可以在Blender中完成建模后继续进入Unreal Engine处理场景;在科研任务中,它还能直接进入专业软件分析数据。除此之外,OpenAI还展示了找公寓、预约服务、寻找医生等看起来更日常的任务:Astra需要自己搜索信息、比较条件、操作页面,并持续推进任务直到得到结果。
OpenAI给GPT-6 Astra的官方定位也很直接:面向最复杂的端到端工作(end-to-end work)。同时,它在Computer Use、复杂多步骤任务、专业工作成果生成等方面都进行了重点强化。这些视频真正值得关注的,并不是GPT又多会用了几个软件。更重要的变化是,OpenAI正在重新定义Agent能力的边界。
过去讨论Agent,很多时候关注的是它能不能搜索、调用API、运行代码或者使用某个工具。但当Agent开始进入真实工作环境以后,"会调用工具"只是任务中的一个步骤。真正有价值的是:Agent能不能理解一个目标,在较长的任务链中持续判断,跨越多个工具和软件,并最终把一件事情完成。
这意味着,Agent的竞争正在从Tool Use继续往前走:Tool Use → Task Execution → Workflow → End-to-End Work。
一、Agent正在从"会用工具",走向"围绕目标持续工作"
Tool Use是过去几年Agent能力快速发展的关键一步。模型不再只生成文字,而是能够根据任务选择搜索、代码、数据库、API等外部工具,再根据返回结果继续推理。但这种模式有一个明显特点:任务通常比较短。
例如:用户提出一个问题,模型判断需要查询数据库,调用一次SQL工具,拿到结果,再返回答案。真正进入工作环境以后,任务结构完全不同。以OpenAI展示的找公寓、找医生、预约服务等任务为例,用户真正提出的并不是:"打开一个网页。"而是一个完整目标。
为了完成这个目标,Agent可能需要先理解预算、位置、时间等约束,再访问不同网站,搜索多个结果,逐一比较条件,排除不符合的选项,过程中还可能遇到网页结构变化、信息缺失或者新的限制条件。这时候,真正困难的已经不是"下一步应该调用哪个工具"。而是经过几十个步骤以后,Agent是否仍然知道自己最初要完成什么。
这也是Long-Horizon Task与简单Tool Calling之间最明显的区别。Agent需要同时维护两类信息:
- 一类是相对稳定的目标和约束,例如用户预算、任务要求、交付标准;
- 另一类则是不断变化的执行状态,例如已经访问过哪些页面、哪些方案被排除、当前正在处理哪一步、接下来还有什么未完成。

因此,当任务从一次工具调用变成完整工作以后,Agent的核心能力开始从单纯的Tool Selection,扩展到Goal Understanding、Planning、State Management和Continuous Reasoning。OpenAI在开发者文档中也特别强调,Astra能够跨代码、浏览器和专业软件执行多步骤Workflow,并且在用户中途增加要求或者改变方向时继续调整任务。
从这个角度看,GPT-6 Astra真正想证明的,不只是"Computer Use更强"。而是Agent开始具备围绕一个目标持续工作的能力。
二、从Tool到Workflow,Agent真正需要理解的是"任务链"
OpenAI这次展示中,一个很值得关注的案例,是Astra跨不同软件完成任务。例如从Blender中的3D建模继续进入Unreal Engine处理场景。如果只从功能角度看,可以理解为:"Astra会用Blender,也会用Unreal Engine。"
但从Agent角度看,这个Demo真正展示的是另一个能力:任务可以跨越多个软件环境连续运行。也就是说,Agent面对的不再是一个Agent → 一个Tool而是"一个目标 → 多个阶段 → 多个工具 → 中间结果 → 最终交付"

在传统的软件系统中,每个工具往往只负责工作流程中的一个环节。真实工作则天然由多个工具组成。例如一个研发人员可能需要:先查资料,再处理数据,再进入专业软件分析,再生成结果,最后把结果整理成文档或演示材料。每个工具本身都不是最终目标。真正的任务,是把这些工具串起来。
这也是为什么Workflow会成为下一阶段Agent非常关键的能力。Agent需要解决的不只是"我现在有哪些工具可以用?"还需要知道先调用什么,后调用什么;什么条件下进入下一步;什么情况下需要回退;什么结果才算真正完成任务。
这背后实际上涉及更复杂的Planning和Trajectory管理。如果一个任务只有三步,模型偶尔判断错一次,影响可能不大。但如果一个任务包含几十个步骤,其中每一步都依赖前一步结果,那么任何一次错误都可能在后续不断放大。因此,长任务Agent的可靠性不能只看单次Tool Call成功率。更应该关注:End-to-End Task Success Rate。
这也是未来Agent评估标准可能发生的一个重要变化:一个完整任务,最终到底有没有被正确完成。
三、Computer Use真正改变的,是Agent进入现有软件环境的方式
GPT-6 Astra这次另一个非常明显的重点,是Computer Use。官方展示了在线表格填写、CRM更新、日历整理、科研数据分析、网站创建以及前端QA等任务。OpenAI将Astra称为目前最强的Computer Use模型之一,并明确把"操作真实软件完成专业工作"作为核心能力。
Computer Use的重要性,并不只是"AI现在会点鼠标了"。它可能改变Agent进入企业IT环境的方式。过去Agent要调用一个系统,最理想的方式通常是API。例如:Agent需要查询MES,就调用MES API;要创建工单,就调用工单系统API。这种方式结构清楚、权限明确,也更容易控制。
但现实中,大量软件并没有完善的AI接口。尤其在制造业,很多MES、ERP、设备管理软件甚至已经运行了十年以上。如果每一个系统都要先完成一轮接口改造,才能让Agent使用,Agent规模化落地的成本会很高。
Computer Use提供了另一种可能:Agent开始能够直接理解为人设计的软件界面。这意味着,未来Agent连接业务系统的方式可能同时存在两条路径:
- API / Skills调用负责高频、关键、确定性强的业务动作;
- Computer Use负责部分缺少标准接口、但人可以通过GUI操作的软件环境。

两者并不是替代关系。对于生产核心系统来说,标准API仍然更适合稳定、可审计的执行。但Computer Use的成熟,会明显降低Agent进入大量存量软件的门槛。这对工业场景尤其重要。
过去谈工业AI时,一个非常现实的问题就是:工厂已经有MES、ERP、SCADA、设备平台、质量系统、物流系统,AI到底怎么接进去?GPT-6 Astra释放出的一个信号是:未来Agent连接系统,不一定只有API这一条路。
四、完整工作越复杂,Agent越不能只追求"更自主"
Agent从"给答案"走向"执行工作",会带来另一个变化:权限和安全开始从外围问题,变成Agent核心能力的一部分。OpenAI这次专门强调了Astra在理解用户意图、遵守任务边界和安全监控方面的改进。
例如,当任务指令存在一定模糊空间时,Astra会尽量利用已有上下文处理常规缺失信息;但如果缺失的信息可能明显改变最终结果,就会选择进一步确认。开发者文档也将"respecting task boundaries"作为Astra的重要能力之一。OpenAI甚至增加了针对Agent任务轨迹的额外监控。如果系统判断Agent可能错误理解了用户意图,任务可以被暂停或者终止,让用户重新确认。
这说明一个很重要的问题:Agent越能做事,越需要知道自己什么时候不能做。过去AI回答错误,最常见的结果是一段错误内容。但当Agent能够修改CRM、填写表单、操作业务系统甚至执行更高风险任务之后,错误的成本完全不同。

因此,真正成熟的Agent不是自主权越大越好。而是能够判断哪些动作可以自主执行;哪些动作需要审批;什么情况下应该停止;任务失败后如何回退;整个过程如何记录和审计。这意味着未来衡量Agent能力时,除了Reasoning和Tool Use,还会越来越关注Permission、Human-in-the-loop、Audit、Rollback。
在工业场景中,这一点会更加明显。Agent查询设备状态,可以自主完成;分析报警、生成维修建议,可以自主完成;但如果涉及修改关键工艺参数、停机、切换生产计划,就可能需要严格的人机审批机制。因此:Agent真正成熟的标志,不只是"能够独立完成多少工作",还包括"能够准确判断自己的权限边界"。
五、回到工业场景:真正有价值的任务从来不是一次Tool Call
如果把GPT-6 Astra展示出的变化放到制造业,会发现它和工业Agent真实需求非常接近。例如一次设备异常。如果从AI能力角度拆,可以拆成很多小功能:设备状态查询、报警解析、SOP检索、历史维修记录查询、故障原因分析、维修建议生成、工单创建。
但站在现场工程师角度,其实只有一个任务:"把这次设备异常处理掉。"
真正的工业Agent,需要围绕这个目标持续工作:读取设备状态 → 理解当前报警 → 查询历史异常 → 对比SOP和维修案例 → 分析可能原因 → 进一步读取相关工艺或设备参数 → 给出处理建议 → 必要时创建工单 → 跟踪处理结果。这里涉及的不是一个Tool,而是一整条任务链。
从工业富联科技服务目前推进的设备AI Agent实践来看,方向也是如此。设备Agent并不是只做"设备问答",而是逐步把设备知识、实时状态和系统工具连接起来。
一开始,可以通过设备手册、SOP、维修记录、历史案例等知识,让Agent回答设备异常和维修相关问题;进一步连接设备平台和生产系统之后,Agent就可以查询实时状态、读取报警、对比参数、辅助完成根因分析,并调用相关工具生成处理建议或工单。也就是说,设备Agent真正形成价值的过程,本质上也是从Knowledge Q&A → Tool Use → Task Execution不断往完整任务推进。
但设备异常还只是一个相对明确的专业任务。当问题开始跨越多个业务领域,一个Agent就很难独立完成。例如临时订单插入。它表面上是一次排产变化,但实际可能同时影响:订单交付、设备利用率、物料供应、物流配送、工艺切换、质量稳定性和能源负荷。这时候,真正需要的就不再只是一个"更强的Agent",而是不同专业Agent之间的协同。
在工业富联科技服务构建的Factory Brain中,可以由生产Agent、设备Agent、质量Agent、物流Agent、能耗Agent等围绕同一个业务目标协同工作。

例如,当新的订单需求进入后:生产Agent重新计算生产计划;设备Agent判断相关设备是否具备执行条件;质量Agent评估换型或参数调整带来的质量风险;物流Agent同步调整物料和配送路径;必要时,再连接机器人和自动化设备完成现场执行。Factory Brain在这里承担的,不只是"让多个Agent互相对话",而是围绕业务目标协调不同Agent的任务、上下文和执行顺序。
这其实对应了一个很重要的变化:单Agent解决的是专业任务,多Agent协同解决的是跨领域完整工作。也因此,多智能体真正需要解决的,不是Agent数量增加之后"怎么聊天",而是不同专业Agent如何围绕同一个业务目标,完成一条跨系统、跨角色、跨执行环节的完整任务链。
从这个角度看,GPT-6 Astra强调的End-to-End Work,与工业Agent的发展方向其实高度一致。无论是设备异常处理,还是Factory Brain下的多智能体协同,真正需要衡量的都不再是"调用了多少工具",而是:一件真实业务任务,最终有没有被完整、稳定地处理掉。
Agent的下一阶段,不只是更会用工具GPT-6 Astra这次发布真正值得关注的,不只是Computer Use能力又提升了多少,也不只是Benchmark再次刷新。更重要的是,OpenAI开始把Agent放进完整工作环境中展示。
这也意味着,Agent接下来更重要的是:一项完整任务能不能稳定完成,完成一次需要多少成本,过程中是否安全可控。当"会调用工具"逐渐成为Agent的基础能力以后,End-to-End Work,才可能成为下一阶段真正拉开差距的地方。