麦肯锡2026技术趋势04_AI基础设施与模型架构_研究解读

AI 如何从模型能力走向规模化服务:麦肯锡 2026 年"AI 基础设施与模型架构"研究解读

麦肯锡《Technology Trends Outlook 2026》技术趋势解读系列 · 第 4 篇

摘要

麦肯锡将"AI 基础设施与模型架构"(AI infrastructure and model architectures)列为 2026 年第四项技术趋势,把基础模型、多模态与推理能力,同数据中心、芯片、云平台和数据系统放在一起讨论。这一调整揭示了 AI 竞争的变化:模型能力需要通过持续、可靠且经济的服务,才能转化为企业价值。报告显示,相关资本投入与人才需求增长显著,企业采纳进入规模化扩展阶段,但电力、内存、部署能力与推理成本仍构成重要约束。本文分析模型效率与基础设施扩张为何能够同时发生,区分股权投资、建设资本开支与业务运行成本,并讨论小模型、稀疏架构、世界模型和推理服务优化的不同作用。本文提出,企业应以通过验收的完整任务为评价单位,协调模型选择、部署位置、服务质量和资源投入。未来的持续优势,更可能来自这套协调能力,而非孤立的模型规模或硬件峰值性能。

关键词: AI 基础设施;模型架构;推理经济性;混合专家模型;小语言模型;世界模型;云边端协同;企业规模化

一、为什么模型架构与基础设施被放进同一个趋势

假设一家企业希望让 AI 持续处理客户服务任务。系统需要理解问题,读取企业资料,必要时识别图片、调用业务工具,再输出能够被执行的结果。业务高峰时,它还要同时服务大量用户。

一个模型能够回答问题,只完成了其中一部分。企业还需要考虑资料是否及时更新,推理服务能否承受高峰负载,敏感信息如何处理,以及复杂任务是否需要更多计算。

这是用于解释机制的假设场景。它说明,当 AI 从展示能力进入持续运行,模型、数据、软件与物理设施之间的关系就成为实际问题。

麦肯锡对这一趋势的定义,既包含基础模型、多模态模型、推理模型与世界模型,也包含数据中心、云平台、训练框架和数据流水线。1,第 38 页 报告的研究方法还说明,上一年度的"AI"趋势在本年度被重新命名为"AI 基础设施与模型架构",以突出支撑 AI 系统的底层技术。1,第 3 页

这一变化具有解释意义。前三项趋势分别讨论软件开发、智能体工作流和科学发现中的新能力;第四项进一步追问,这些能力需要怎样的系统才能持续提供。

系统层次 主要提供什么 规模化时需要解决什么
模型与算法 预测、生成、推理、感知与规划能力 在具体任务中达到所需质量,并合理使用计算
推理服务与数据系统 请求处理、模型调用、资料检索与状态管理 并发、时延、版本、权限与稳定性
计算硬件与网络 运算、内存、存储与数据交换 资源配置、带宽、容量与利用效率
数据中心与能源系统 供电、冷却和持续运行条件 建设周期、接电能力、供给可靠性与环境约束

上表是本文的归纳。这些层次相互影响:模型设计改变硬件负载,服务方式改变资源利用率,供电与冷却又限定可部署的实际容量。

因此,AI 的规模化能力不能由一个模型分数或一项设备参数独立解释。它来自各层能力在实际任务中的配合。

二、报告中的增长信号:先区分资本热度与应用成熟度

这一趋势在报告中具有较强的投资与人才增长信号。

指标 报告结果 能够支持怎样的判断
2025 年股权投资 1,450 亿美元 相关企业吸引了大量资本交易,位列所研究趋势第二
截至 2026 年年中股权投资 接近 3,840 亿美元 按报告统计,半年度投入已经超过上一年度
按当时速度推算的全年投资 约 7,690 亿美元 属于保持投入速度的条件性外推,并非全年实际结果
相关岗位公告变化 2024---2025 年增长 47% 招聘活动显著扩张
较长时期的岗位变化 2025 年数量接近 2022 年的三倍 需求扩张并不限于最近一年
2025 年岗位职能结构 研发占 77% 统计范围内,技术建设仍占重要位置
企业采纳评级 4:规模化扩展中 专家判断认为企业正在扩大部署,成熟度仍因行业和地区而异

资料来源:报告正文第 41、45---46 页。投资与岗位数据按报告定义理解,采纳评级来自专家访谈。

这些数字需要放在正确的口径下。报告的股权投资统计覆盖私募与公开市场资本活动,也包括并购等交易;明确不包括企业资本开支和运营支出。1,第 3 页 因而,不能把 1,450 亿美元直接当作数据中心建设费用,也不能把它理解为 AI 服务已经产生的收入。

半年度与全年数字也不宜混用。年中投资增长可以说明资金流入加快,却不能证明后续半年会保持同样速度。交易节奏、资本环境和企业需求,都可能改变全年结果。

报告还把这一趋势评为"规模化扩展中",高于前三项趋势的采纳等级。这并不矛盾:企业可以已经扩大 AI 基础设施与通用模型服务,同时仍在试验复杂智能体和科学发现系统。

同样,一个总体采纳分数不能说明其中每类技术都具有相同成熟度。基础模型服务、世界模型、工业边缘部署和自主系统,对数据、验证与设施的要求明显不同。

本文据此认为,报告中的增长信号主要说明产业正在增加建设与部署。企业能否获得持续收益,还需要观察运行质量、完整成本和业务结果。

三、模型越来越高效,为什么总投入仍然可能上升

这是理解第四项趋势最重要的经济问题。

首先,需要区分三个不同维度:资本进入相关企业,建设与扩充基础设施,以及日常运行 AI 业务。它们相互关联,却不是同一个指标。

模型能力的获得成本也有不同口径。斯坦福《2025 AI Index》的历史比较显示,在达到 GPT-3.5 相当的 MMLU 表现这一条件下,每百万 token 的查询价格从 2022 年 11 月约 20 美元,下降到 2024 年 10 月约 0.07 美元,降低超过 280 倍。3

这里的 token 是模型处理文本的基本计量单元,与汉字或单词并不一一对应。

这是一项特定能力基准下的服务价格比较。它体现了某类能力变得更容易获得,不能直接换算成全部模型、全部任务或企业总成本都下降了相同比例。

1. 单位价格下降,可以与使用量增长同时发生

计算更便宜之后,一些原本不值得开展的任务可能开始具有经济可行性。企业可能增加服务频率,扩大覆盖人群,使用更长的资料,或者让智能体执行更多步骤。

推理能力的增强也可能增加单项任务的计算需求。系统可以把更多计算分配给困难问题,进行额外分析、检索或验证。1,第 39、43 页 这使"模型效率提升"和"实际任务计算量增加"有可能同时出现。

用一个简化的假设说明:如果单 token 价格降到原来的五分之一,而同类任务的 token 消耗增加到五倍,那么这一部分推理费用保持不变。若业务处理量还在增长,总推理支出就可能增加。

这个例子只讨论同一价格口径下的 token 费用,不包含其他成本,也不是报告中的实测结果。它说明,判断总支出变化需要同时观察价格、任务计算量和业务量。

效率改善能够扩大需求,但扩大多少取决于实际应用价值。若新增任务没有产生足够收益,企业也可能限制投入。因此,需求扩张是需要检验的机制,不能被当作必然结果。

2. 更低的调用价格,未必带来更低的完整任务成本

企业使用 AI 通常要完成一个业务任务。这个任务可能包含多次模型调用、资料检索、工具执行、失败重试和人工复核。

较便宜的模型如果需要更多重试,或者经常把任务转交人工,其整体成本优势可能缩小。较强的模型如果能减少无效步骤,也可能在较高调用价格下取得更好的任务经济性。具体结果需要在可比业务条件中评价。

本文建议采用一个容易理解的管理口径:

单位有效任务成本 = 评价期间相关总成本 ÷ 同期通过验收的完整任务数量。

分子应包含成功与失败尝试产生的投入,并根据评价范围计入计算、数据处理、工具服务、人工支持和基础设施分摊。分母则需要事先明确验收标准,避免把一段输出等同于任务完成。

这一口径属于本文提出的评价框架,并非麦肯锡的实测指标。它能够把技术效率与业务结果连接起来,但需要保持任务难度、质量标准和成本范围可比。

更进一步,企业还应观察完成时间、服务可靠性和成果价值。便宜地完成没有价值的任务,仍然不能证明投资有效。

四、模型架构的变化:不同任务,需要不同的计算分配方式

报告讨论的架构进展,不只发生在模型规模上。它们还改变模型怎样处理信息、怎样使用计算,以及怎样连接外部系统。1,第 39、41---43 页

1. 小模型与稀疏模型,为效率提供不同路径

小语言模型的重要性,在于它们可以围绕较明确的任务提供能力。微软 2025 年公布的 Phi-4-mini 是一个具有 38 亿参数的模型,设计目标包括效率,以及指令、推理和工具调用等任务。4

这个例子说明,部分任务可以由较小模型承担。它并不证明小模型在所有任务上都能替代前沿模型。任务难度、领域资料、上下文和验收要求,仍然决定它是否适用。

另一条路径是稀疏激活。DeepSeek-V3 技术报告描述的模型具有 6,710 亿总参数,每个 token 激活约 370 亿参数,通过混合专家等设计提高计算效率。5

混合专家模型可以根据路由,选择一部分专家子网络参与处理。这使整体容量与每一步的计算范围具有不同规模。

这里的总参数与激活参数回答不同问题。前者体现模型整体规模,后者反映单个 token 涉及的部分计算。部署时仍要存储或调度其他权重,并处理专家之间的数据交换,不能只按激活参数估算整个系统的内存需求。

这两类方法也不应混为一谈。较小模型减少整体规模;稀疏架构则可以在较大总规模下,控制每一步参与计算的部分。二者的硬件、服务与优化要求有所不同。

2. 推理、多模态与世界模型,扩展了能力,也改变了负载

推理型系统的重要变化,是可以为困难任务分配更多计算。管理上的问题随之变得具体:哪些任务值得进一步分析,增加的时间与成本是否带来足够质量改善?

企业不能仅以生成更多内容判断推理更好。需要比较最终结果、使用依据和任务完成情况,并为常规与复杂任务设置不同资源安排。

多模态模型则让系统联合处理文字、图片、音频、视频和其他输入。1,第 41 页 这能够减少不同形式信息之间的部分转换工作,同时要求系统处理不同数据的来源、时间关系和一致性。

例如,工业系统中的图片、传感器记录和维护文本,可能来自不同设备与时点。本文认为,融合这些输入的价值,需要通过具体判断是否改善来评价;把数据放在同一个模型中,并不自动保证它们描述的是同一状态。

世界模型进一步尝试学习环境变化,用预测的结果支持行动选择。报告引用的 Dreamer 研究,在 150 多项控制任务中展示了用学习到的环境模型想象未来轨迹、改善行为的能力。6

它提供了关于学习与规划的研究证据,不能直接证明模型已经能够准确模拟任意现实环境。进入工业场景之后,还需要检验环境变化、预测误差和实际执行结果。

本文尤其关注一个区别:生成看起来真实的场景,与准确预测行动后果,是不同的能力。面向实际控制的世界模型,应接受与任务相关的验证。

3. 扩散优化与神经符号方法,解决的是另外一些问题

报告还讨论了扩散模型的效率改善,以及结合神经网络、规则、知识图谱和逻辑约束的神经符号方法。1,第 42---43 页

扩散生成中的推理步骤、蒸馏和服务优化,关系到输出质量、响应时间与计算投入。其评价需要保留具体生成任务和质量条件,不能把某项提速扩展为所有内容与仿真任务的通用结论。

神经符号方法则把学习能力与显式规则等机制结合。它可以帮助系统遵循明确约束,但规则的定义、数据的可靠性,以及结果是否符合实际问题,仍然需要检验。

这些进展共同说明,模型架构正在围绕不同约束分化。企业选择时,应明确自己要改善的是感知、推理、规划、生成效率还是规则一致性,再评价相应技术。

五、硬件性能怎样转化为真实服务能力

报告把芯片、高带宽内存、网络、电力与冷却列为规模化 AI 的重要条件。1,第 38、43---44 页 理解这些条件,需要进一步区分理论性能与实际服务结果。

一项硬件峰值性能,通常依赖特定计算格式与运行条件。真实推理还涉及模型权重读取、上下文处理、缓存、数据交换和请求调度。哪一个环节成为瓶颈,取决于模型、硬件与负载的组合。

例如,模型权重能够装入设备,并不意味着设备可以在规定时延内服务足够多用户。上下文增加、并发扩大和生成过程中的缓存需求,都可能改变内存占用与服务表现。

PagedAttention 研究提供了一个具有解释力的例子。论文针对大语言模型服务中动态增长的 KV 缓存,利用分页式管理减少碎片与重复占用,并支持缓存共享;其基础上构建的服务系统是 vLLM。7

这里的 KV 缓存,可以理解为生成过程中保存的部分注意力计算信息。它帮助系统避免重复计算,同时消耗内存。对缓存的组织改善,能够影响可承载的请求数量与服务效率。

这一案例的意义,在于同一模型和硬件之下,软件管理方式也可以改变实际产出。论文中的性能结果具有特定实验条件,不能当作所有设备与业务的统一加速比例。

服务设计还存在不同目标。批量处理可能更重视吞吐量;实时交互可能更重视首个结果出现的时间,以及高峰时是否出现明显等待。一个设置在某项指标上更好,未必满足另一类任务。

因此,硬件评价应回到实际模型与业务负载:它能否在所需质量、上下文、并发和响应要求下,持续交付任务?这一问题比孤立比较峰值算力更接近企业的实际需求。

六、AI 的物理约束:设施建成,还需要能够持续运行

模型与推理软件可以较快更新,电力与数据中心建设则受到现实工程条件限制。这种时间尺度的差异,是报告反复强调的约束。1,第 38、43---44 页

1. "近 7 万亿美元"包含怎样的建设需求

报告引用麦肯锡 2025 年的一项数据中心研究。核对该研究可以看到,其基准情景估计,到 2030 年满足全球需求需要约 6.7 万亿美元资本开支,其中约 5.2 万亿美元对应 AI 负载,约 1.5 万亿美元对应传统 IT 负载。2

因此,报告所说的"近 7 万亿美元",对应包含两类负载的数据中心建设需求估计。它不是单年度预算,也不是已经发生的支出,更不能与前文的股权投资数字直接相加。

原始研究明确使用需求与建设成本模型,并讨论不同情景。2 预测取决于应用采纳、效率变化和供给约束。其作用是显示潜在建设规模与资源配置压力,具体投入仍会随实际发展调整。

这一区分对企业管理很重要。资金流入、设施投资与最终业务需求,存在不同的发生时间。预期需求可以推动建设,但建成设施还需要通过真实使用产生价值。

2. 接电时间会影响可用算力出现的时间

报告指出,数据中心的建设速度可能快于配套能源系统准备的速度。1,第 38 页 在这种情况下,芯片、机房和资金已经到位,仍可能无法形成预期的运行能力。

国际能源署《Energy and AI》2025 年报告也强调,能源基础设施通常具有更长的规划与建设周期。其基准情景预测,全球数据中心用电量到 2030 年约为 945 TWh,占全球用电量接近 3%;同时指出,数据中心负荷集中在特定地点,会增加电网接入难度。8

这里引用的是该 2025 年报告的情景,覆盖全部数据中心,并非只统计 AI。它说明,全局用电占比与局部供电压力需要分别观察。一个地区能否接入新增负载,不能只用全球占比判断。

冷却、网络与设备交付同样影响可用容量。某个环节扩张之后,原有瓶颈可能缓解,另一个环节又可能限制总体表现。建设计划需要围绕整套系统能够运行的时间安排。

3. 单位效率与总环境负担需要同时评价

报告强调提高每瓦与每美元的性能,并把电力、水资源及可持续性列入不确定性。1,第 38、48 页

本文认为,评价应同时包含两个层次:完成可比任务所需的资源,以及业务扩张后产生的总资源消耗。单位能耗降低,可以改善效率;总使用量的变化,则决定整体负担如何演变。

还需要考虑任务质量。若低能耗输出频繁失败并引发重复计算,单次生成的优势可能不能完整转化为有效成果。因此,能源效率也适合与通过验收的任务连接起来。

七、云端、本地与边缘:部署位置应由任务条件决定

报告把小模型、压缩与优化推理,视为提高本地和边缘部署可行性的重要路径。它还指出,竞争优势正逐渐转向协调多个模型,在性能、成本、速度和治理要求之间取得适当平衡。1,第 39、46---48 页

这并不意味着所有任务会迁移到同一种位置。部署选择需要结合业务负载与组织条件。

部署方式 可能提供的价值 需要评价的实际条件
云端托管模型服务 较方便地获得模型能力,并利用服务方的资源管理 网络依赖、调用支出、服务条件、数据处理与可迁移性
企业本地或私有环境 提高对运行环境、数据路径与更新安排的控制 硬件利用率、运维能力、升级成本与服务质量
设备与工业边缘部署 支持现场响应、弱网络条件与就近处理 设备功耗、内存、运行稳定性及多设备管理
多位置协同部署 按任务需要组合能力与资源 任务路由、跨环境数据传递、结果一致性与故障恢复

上表是本文的分析框架,不代表某种方式必然更优。

1. 多模型组合,首先需要看清任务差异

常规分类、字段提取和格式转换,与复杂分析、跨资料推理和长流程执行,可能具有不同的能力需求。将它们统一交给同一模型,容易让部分任务承担不必要的投入,或者让困难任务得不到足够能力。

一种可检验的思路,是为明确、重复的任务安排较轻量的处理路径,为困难任务安排更强的模型与验证资源。但系统需要能够识别何时升级处理,且这种识别本身也要接受评价。

路由错误会带来真实代价。如果困难任务被误送到不足以完成它的模型,节省的调用费用可能伴随更多失败与返工。只有把这些结果计入完整任务成本,才能判断组合是否有效。

2. 本地部署的经济性,依赖真实负载

本地环境可以降低部分网络依赖,并增加数据路径的可控性。其完整成本则包含设备、能耗、维护、升级与人员投入。

当设备长期闲置时,分摊到有效任务的成本可能较高;当存在稳定负载时,利用率改善可能增强经济性。还需要考虑业务高峰、故障期间的承接能力,以及模型升级后的资源需求。

云端服务也有对应的评价条件。按使用量付费可以降低部分前期建设需求,但持续增长的业务量、长上下文与多轮调用,会改变运行支出。企业需要基于实际任务比较不同方式。

本地运行还需要管理外部调用、日志、权限和更新渠道。部署位置提供了控制条件,具体的数据处理方式仍由系统设计与运行安排决定。

3. 前沿训练与分布式推理可以形成分工

部分前沿训练需要大规模集中资源,面向具体业务的推理则可能分布在云端、企业环境与设备上。不同阶段的资源需求,可以使集中建设与本地部署同时发展。

本文认为,这种分工比"所有计算最终都会集中"或"所有计算都会转向本地"的单一路径,更能解释报告描绘的生态。其具体结构取决于模型能力、通信条件、任务规模与治理要求。

对企业而言,可复用的任务定义、评价方法与服务接口,会增加未来调整模型和部署位置的余地。部署能力的价值,还包括在条件变化后继续提供服务。

八、人才数据揭示的组织问题:模型知识需要转化为交付能力

报告的人才分析中,有一组值得重视的差异:云计算与机器学习分别出现在 66% 和 65% 的相关岗位要求中;机器学习人才供给需求比约为 4.3,而持续集成与持续交付(CI/CD)约为 0.1。1,第 46 页

这些是按报告数据和技能识别方法得到的比例,主要来源于英语国家,不能直接用作特定企业或地区的招聘缺口,更不能把 0.1 机械解释为"九成职位无人可用"。1,第 3 页

不过,它提示了一个组织问题:具备模型知识的人才供给,与把系统可靠地投入生产的能力,并不自动对应。

CI/CD 涉及把修改持续整合、验证并交付到运行环境。对 AI 系统而言,更新还可能发生在模型、提示、检索资料、工具和权限配置上。各个组成部分单独表现正常,整套业务流程也可能发生变化。

因此,模型评价需要与系统评价连接。团队应知道,在版本调整后,哪些任务表现改善,哪些错误增加,成本和时延怎样变化,以及是否影响既有业务。

这要求模型研究、数据管理、平台运维与业务人员形成共同评价依据。若研究团队主要追求基准分数,平台团队主要追求设备利用率,而业务团队主要追求及时响应,局部目标可能彼此冲突。

本文建议以完整任务的质量、响应要求和经济性组织协作。在此基础上,各团队再优化自己负责的环节,避免局部改善损害整体结果。

报告把相关岗位中的 77% 归为研发,也提醒我们,"研发"类别包含软件、数据与工程建设等工作。1,第 45 页 这一比例不能直接说明企业只重视研究而缺乏运营;更有价值的观察,是这些能力是否能够形成稳定交付。

九、产业竞争与投资周期:增长中的能力,也可能成为约束

报告把基础设施、人才与资本集中列为重要不确定性,同时强调不同地区在部署路径与基础设施优先事项上的分化。1,第 46---48 页

这一判断可以从两种不同时间尺度理解。模型与软件持续更新,部分效率改善能够较快实现;数据中心、网络和能源设施通常要求较长建设与使用周期。

两者相互促进,也带来配置难题。需求扩张需要提前建设,架构变化却可能改变设备、内存与网络的最优组合。系统建成后,实际业务需求也可能与建设时预期不同。

因此,企业与基础设施提供方需要评价一种更完整的能力:资源能否在需求与技术变化时得到调整。模块化扩展、不同负载之间的调度,以及升级和迁移能力,都可能影响资产的长期使用价值。

这是本文依据报告提出的判断。它并不意味着可以消除技术变化与需求不确定性,而是把适应能力纳入建设和运行的评价。

1. 规模优势与开放生态,可以同时影响竞争

大规模基础设施、模型研发与平台整合,需要资本、专业人才和供应链组织。具备这些能力的企业可能通过规模与协同获得优势。

与此同时,开放权重模型和多种部署工具,可以扩大其他组织获得与改造模型能力的空间。1,第 40、46 页 对使用方而言,这增加了选择,也增加了整合、评价与运行的责任。

能够下载权重,与掌握整个 AI 系统的持续运行能力,仍是不同层次。硬件、模型许可、更新来源、数据管理与维护安排,都影响实际可用性。

因此,市场可能在不同环节呈现不同结构:前沿训练和部分基础设施更重视规模,行业系统和具体工作流则保留分化空间。整体集中程度,需要按价值链环节观察。

2. 企业竞争力更多体现为资源与业务的协调

企业接入强模型之后,还需要把资料、工具、权限与流程组织起来。模型获得能力,与组织获得可持续生产率之间,存在系统建设和管理转换。

有价值的能力包括:识别哪些任务值得使用 AI,为这些任务安排合适模型和资源,持续评价结果,以及根据成本、需求与错误反馈调整系统。

这些能力很难用一次演示概括,也不能只看购买了多少设备。它们需要通过连续运行中产生的可靠成果、可比成本和业务改善来评价。

这也是本文对第四项趋势的核心解读:规模化 AI 的竞争,越来越涉及模型能力、资源供给与组织交付之间的协同。

十、如何评价报告,并检验未来一至两年的发展

麦肯锡这一章的贡献,是把模型架构、推理经济性、物理基础设施和组织采纳联系起来。它说明,模型能力进步与产业运行约束,需要进入同一套讨论。

其统计与预测也有各自边界。关键词定义影响趋势指标,股权投资不能代替资本开支,专家采纳评级不能证明所有企业已经获益,建设需求预测则依赖未来情景。1,第 3、41、46、48 页;2

因此,报告较适合用于识别变化方向、系统关系与待检验问题。若要确定某个项目的投入与部署方式,还需要补充具体任务、运行数据和组织条件。

本文提出以下四个前瞻判断,并给出相应观察方式。它们属于作者分析,不是报告已证实的结论。

第一,企业会更重视以完整任务衡量推理经济性。 当智能体调用与长流程增加时,单次调用价格难以解释整体结果。可以观察企业是否开始同时核算重试、工具、复核和验收产出,以及这些评价能否改善资源分配。

第二,多模型与多位置部署的价值,将取决于路由与运行质量。 较小模型、前沿服务与本地环境可以形成分工,但收益需要经过实际任务验证。可以观察升级处理是否及时、跨环境结果是否稳定,以及完整成本是否改善。

第三,基础设施交付时间与可调整性将受到更多重视。 电力、冷却、网络与设备的配套进度,会影响预期算力何时形成。可以观察设施从建设到可用服务的时间,以及需求变化后资源能否有效重新配置。

第四,模型效率进步与总算力需求之间,将持续存在需要验证的关系。 效率改善可能降低部分负载,也可能扩大应用并增加任务复杂度。可以同时观察可比任务的资源消耗、业务量和总体资源需求,判断哪种作用更强。

这些判断也可以被修正。如果某类小模型难以达到业务质量要求,组合路径就需要调整;如果新增应用没有形成足够价值,需求增长可能放缓;如果供电与建设约束缓解,产业瓶颈又可能转向其他环节。

前瞻分析的作用,是提出能够持续观察的问题,并根据实际结果更新判断。

结语

AI 基础设施与模型架构的进步,正在扩大企业可以获得的能力。小模型、稀疏计算、多模态、世界模型和服务优化,分别改变能力范围与资源使用方式;芯片、内存、电力、网络和人才,则决定这些变化能否进入稳定运行。

麦肯锡第四项趋势揭示了一个重要转变:模型能力需要被转化为可持续的服务,服务还需要产生符合业务要求的成果。

本文认为,评价这一趋势应当回到通过验收的完整任务。模型表现、响应时间、运行成本、资源消耗和组织协作,都应围绕这一单位形成联系。

能够在技术与需求变化中持续调整这些关系的组织,更有机会把 AI 进步转化为长期生产率。它们的优势来自模型、基础设施与业务之间有效的协调,以及对实际结果的持续学习。

参考资料与口径说明

本文主要依据用户提供的麦肯锡 2026 年 9 月版报告,解读第 4 项技术趋势,正文第 38---48 页,并结合第 3 页研究方法。页码指报告印刷页码,对应 PDF 文件页序第 40---50 页和第 5 页。补充资料用于核对建设预测、历史成本指标、模型机制和研究案例,核对日期为 2026 年 10 月 3 日。

文中的假设场景、简化费用示例、系统分层、完整任务评价口径、部署比较与前瞻判断属于作者分析。引用的历史研究和预测保留原始时间、任务与情景范围;本文没有将它们视为所有场景的统一性能结论,也没有把资本投入当作已实现的业务收益。

  1. McKinsey & Company. Technology Trends Outlook 2026. September 2026, sixth edition. "AI infrastructure and model architectures", pp. 38--48; research methodology, p. 3. 本文主要依据用户提供的 PDF。

  2. McKinsey & Company. The cost of compute: A $7 trillion race to scale data centers. April 28, 2025. 用于核对 6.7 万亿美元总建设需求、5.2 万亿美元 AI 负载与 1.5 万亿美元传统 IT 负载的预测口径。

  3. Stanford Institute for Human-Centered Artificial Intelligence. The 2025 AI Index Report: Research and Development. 2025. 用于核对达到特定 MMLU 表现条件下的历史模型查询价格变化。

  4. Chen, W. / Microsoft. Empowering innovation: The next generation of the Phi family. February 26, 2025. 同时核对微软发布的 Phi-4-mini-instruct 模型说明。用于理解小模型的任务定位与参数规模。

  5. DeepSeek-AI, et al. DeepSeek-V3 Technical Report. arXiv:2412.19437; first submitted December 27, 2024, revised February 18, 2025. 用于核对混合专家架构,以及总参数与每 token 激活参数的区别。

  6. Hafner, D., Pasukonis, J., Ba, J., & Lillicrap, T. Mastering diverse control tasks through world models. Nature, 640, 647--653, 2025. Published April 2, 2025. 用于核对 Dreamer 的学习与规划机制及其任务范围。

  7. Kwon, W., et al. Efficient Memory Management for Large Language Model Serving with PagedAttention. SOSP 2023; arXiv:2309.06180. 用于理解 KV 缓存管理如何影响推理服务效率。

  8. International Energy Agency. Energy and AI: Energy demand from AI. 2025. 用于核对数据中心用电情景、能源建设周期与局部电网约束。

相关推荐
六神啊六神1 小时前
9、古代没有程序员,但蒲松龄们早就被"裁员"过了
人工智能
范桂飓1 小时前
AI Agent 上下文工程的系统架构
人工智能
A 杨乐182100518911 小时前
2027第十三届中国国际养老服务业博览会
大数据·人工智能
迪康Defender1 小时前
终端安全事后追溯能力解析:本地审计模块设计思路与落地实践
运维·开发语言·人工智能·安全·php·安全威胁分析·运维开发
郝学胜_神的一滴1 小时前
Numpy数据处理详解 01:NumPy 从环境搭建到入门上手
人工智能·python
俊哥V1 小时前
每日 AI 研究简报 · 2026-10-06
人工智能·ai
凡达Ai派1 小时前
AI画布明暗关系总在变?用光源声明表和亮度分区做视觉验收
人工智能
你就是答案 -1481 小时前
2026企业AI办公工具选型指南:搭建适配业务的智能协作体系
人工智能
Asa121381 小时前
Nature Microbiology|不依赖系统发育的机器学习框架从基因组预测菌株水平噬菌体—宿主互作
人工智能·机器学习