《2026灯塔工厂最新解读:全球化智造运营转型与路径》白皮书
最近英伟达连续释放的几条重磅消息,值得放在一起看。
8月24日,NVIDIA宣布 Groq 3 LPX正式进入全面投产 ,定位于Vera Rubin平台的交互式AI推理加速。NVIDIA披露,在Artificial Analysis测试中,Groq 3 LPX运行Gemma 4 31B、100,000 Token上下文时,实现了3400个输出Token/秒 ;针对智能体编程等低延迟工作负载,响应速度最高达到相近竞争平台的4倍。与此同时,NVIDIA公布Vera Rubin NVL72在AgentX智能体工作负载上的测试结果,每兆瓦吞吐量最高达到上一代GB300 NVL72的30倍,每Token成本最高降低35倍。
同一天,SpaceXAI宣布将采用NVIDIA Vera CPU,用于下一代Agentic AI应用,并扩大Vera Rubin基础设施建设。
这些新闻表面上讲的是芯片、服务器和数据中心,背后却指向了一个更值得关注的变化:AI基础设施正在因为Agent而改变。
过去谈AI推理,更多关注模型规模、GPU算力和整体吞吐;进入Agentic AI阶段后,一次AI请求已经不再是简单的"输入---输出",而可能是一项持续数十甚至数百步的复杂任务。计算资源需要服务的,也从一次回答逐渐变成完整的任务执行过程。
一、为什么Agent出现后,Token生成速度变得重要?
传统大模型交互通常比较简单,用户输入Prompt,模型完成推理并输出答案,一次交互基本结束。
Agent的运行方式则完全不同。
假设让一个Agent完成"分析某条生产线异常"的任务,它可能先读取生产数据,再查询设备状态,调用质量系统获取缺陷信息,运行分析代码,发现信息不足后继续检索,并根据新的结果调整判断。模型在这个过程中不断进行推理、生成和工具调用。
因此,一次Agent任务实际上是一条连续的计算链:理解任务 → 推理 → 生成 → 调用工具 → 获得结果 → 再推理 → 再生成。

NVIDIA援引OpenRouter数据称,Agentic AI工作负载消耗的Token数量可以达到简单聊天请求的15倍。原因在于Agent会持续进行检索、工具调用、代码执行、结果验证以及多步推理。
这也改变了Token的意义。
在普通聊天中,Token更多体现为模型最终输出的文字;在Agent场景中,Token则贯穿整个任务执行过程。生成速度越快,Agent完成连续推理和行动的等待时间就越短。
因此,Groq 3 LPX的价值并不是简单替代Vera Rubin中的GPU,而是针对Agent对低延迟Token生成的需求进行补充。NVIDIA将其定位为Vera Rubin平台面向交互式推理的加速组件,用于提升低延迟场景下的Token生成效率。
这背后反映出一个重要变化:Agent时代,推理效率开始从"单次回答速度"转向"连续任务执行速度"。
二、长上下文让Agent推理变成另一类计算问题
Token生成只是其中一个环节。
Agent还有一个明显特征,就是任务执行过程中上下文会不断增长。
一个持续运行的Agent,需要保留任务目标、历史步骤、工具返回结果、检索内容、代码执行结果以及其他智能体产生的信息。任务越复杂,积累的上下文通常越长。
因此,Agent推理同时面临两类压力:一方面需要处理不断增长的上下文,另一方面需要快速生成新的Token。

这也是Vera Rubin与Groq 3 LPX形成互补关系的原因之一。前者面向更广泛的训练、推理和上下文处理工作负载,后者则针对低延迟Token生成进行优化。
这里需要特别注意,3400 Token/秒并不意味着整个Agent任务都能达到3400倍的执行效率 。Token生成只是完整任务中的一个环节,实际执行还涉及上下文处理、模型计算、工具调用、数据访问和任务编排。
因此,Agent基础设施优化的重点正在从单一芯片性能,转向整条任务链的效率。
三、Agent时代为什么开始强调异构计算?
把一个Agent任务拆开后,会发现不同环节需要的计算能力并不相同。
模型训练和大规模推理需要高并行计算能力;长上下文处理对内存和数据访问提出更高要求;Token生成强调低延迟;工具调用、代码执行和任务编排又会产生大量CPU工作。
这时候就需要理解一个概念:异构计算。

简单来说,就是让不同类型的处理器各做自己擅长的事情。GPU擅长大规模并行计算,适合模型训练和推理;CPU更适合复杂的程序逻辑、数据处理和任务调度;专用加速器则可以针对特定计算环节进一步优化。它们协同工作,而不是让一种芯片承担所有任务。
Vera Rubin的架构思路正体现了这种变化。NVIDIA公布的Vera Rubin平台包含Rubin GPU、Vera CPU、Groq 3 LPX、BlueField-4 DPU、Spectrum-6网络等不同组件,通过协同设计服务于不同类型的AI工作负载。
可以简单理解为,Rubin GPU主要承担大规模模型计算,Groq 3 LPX强化低延迟Token生成,Vera CPU承担Agent运行过程中大量模型之外的工作,而DPU、网络和存储负责数据传输及基础设施任务。
因此,Agentic AI带来的变化并不是"GPU不重要了",而是AI基础设施开始从单一加速器,走向围绕任务进行分工的异构计算体系。
这也解释了为什么英伟达此次强调每兆瓦吞吐量和每Token成本。对于持续调用模型、产生Token并执行工具的Agent来说,真正重要的不只是某一颗芯片有多快,而是整套系统能用多少资源完成多少有效任务。
AI基础设施的竞争,也正在从"谁的芯片更快",逐渐走向"谁能用更高的资源效率把任务做完"。
四、同样的变化正在进入制造业
如果Agent进入制造现场,这种任务链会更加复杂。
生产异常往往不会只影响一个系统。一台设备状态发生变化,可能进一步影响产品质量、生产节拍和物料供应;生产计划调整后,又可能影响物流和能源使用。
因此,工业Agent面对的也不是简单的问答任务,而是需要贯穿生产运营流程的连续任务。
比如在设备异常场景中,AI首先需要从IoT和设备系统获取状态数据,再结合MOM、MES中的生产信息判断影响范围,并进一步分析质量数据。如果确认存在风险,还需要调整生产安排,并把结果反馈给现场执行系统。
这里的核心变化是:工业AI需要从"分析数据"进一步走向"完成任务"。
这与Agentic AI基础设施的发展其实形成了对应关系。
数据中心需要让计算资源围绕Agent任务进行协同;进入工厂后,不同工业系统、AI能力和现场设备也需要围绕生产任务协同工作。
五、从一个Agent到多个Agent,制造业需要怎样的协同方式?
工业富联科技服务构建的 MoMClaw(Manufacturing Operations Multi-agent Claw),定位于制造运营多智能体系统,将制造现场的数据、业务系统与不同专业Agent连接起来。
在制造运营过程中,质量、设备、预测维护、排产、能源和物料等任务本身就存在专业分工,因此并不适合完全交给一个通用Agent处理。不同Agent可以承担各自的专业任务,再通过制造运营系统形成协同。
以设备异常为例,设备Agent可以负责判断设备健康状态,质量Agent分析潜在质量影响,排产Agent评估生产计划变化,预测维护Agent进一步判断维修需求。多个Agent产生的分析结果最终需要汇聚到统一的任务流程中,形成决策并进入现场执行。
因此,工业多智能体真正的价值不只是"部署更多Agent",而是让不同AI能力围绕同一个制造任务形成协作关系。
其运行逻辑可以概括为:工业数据 → Agent分析 → 任务决策 → 系统/设备执行 → 结果反馈 → 持续优化。
这也是制造业Agent与普通企业AI助手之间的重要区别。
六、从"更强模型"走向"更高任务效率"
回到Groq 3 LPX和Vera Rubin,这次发布真正值得关注的并不是某一个孤立的性能数字,而是AI基础设施评价方式正在发生变化。
过去,大模型时代更习惯关注模型参数、GPU规模和推理吞吐;Agentic AI兴起后,任务本身成为新的衡量对象。上下文长度、Token生成效率、工具调用、任务编排以及单位能耗,都开始影响最终的AI任务成本。
制造业也会经历类似变化。
企业部署工业AI,最终需要衡量的并不只是模型精度,而是AI能否理解生产任务,能否连接真实工业数据,能否调用制造系统,能否协调不同专业Agent,并根据执行结果不断优化。
这意味着,AI基础设施正在从"服务模型",走向"服务任务";工业AI也正在从"提供分析",走向"参与生产"。
对于工业富联科技服务而言,MoMClaw所探索的制造运营多智能体,以及进一步连接MOM、工业数据、数字孪生和现场执行的技术路径,本质上也是在回答同一个问题:当AI开始真正承担任务,怎样让它更快、更可靠地完成一项真实的工业工作?
这或许才是Agentic AI从数据中心走向制造现场之后,真正值得关注的下一阶段。