一年前,很多企业讨论的还是"AI要不要上云";今天,问题已经变成了"哪些AI负载应该留在云上,哪些要迁回自己手里"。
变化并不突然。试验阶段,一张GPU几小时开通、模型API随取随用,公有云的速度很难替代。但当AI从Demo走进生产,请求从每天几百次涨到数百万次,训练数据开始连接核心业务系统,账单、时延、权限和审计也同时从技术细节变成经营问题。
于是,一场围绕AI工作负载的"重新摆放"开始了。
93%背后,真正值得关注的不是数字
Cloudian委托开展的《2026企业AI基础设施调查》覆盖203名企业IT决策者。报告显示,93%的受访企业已经回迁部分AI工作负载、正在回迁,或在积极评估;79%已经采取了实际行动。另一份覆盖1800名资深IT决策者的Broadcom《Private Cloud Outlook 2026》则显示,56%的企业正在或计划在私有云运行生产级AI推理,公有云对应比例由上一年的56%降至41%。
两份报告均由厂商发起,样本口径也不相同,不能简单外推为"所有企业都在回迁"。但它们指向同一个变化:企业正在告别笼统的"Cloud First",转向更务实的"Workload First"------先看负载,再决定位置。
Gartner的另一组数据补上了宏观背景:2026年全球主权云IaaS支出预计达到800亿美元,同比增长35.6%。数据、运营和技术控制权,正在被重新写进基础设施决策。
云回迁不是把公有云清空,而是把稳定、敏感、持续运行的生产负载迁回可控环境,同时把试验、突发和全球分发继续留在公有云。
为什么AI成了这轮回迁的"加速器"
第一笔账:从"按需付费"到"为持续负载支付弹性溢价"
公有云最擅长应对不确定性。但生产级推理往往恰好相反:模型规格相对固定,请求量有规律,服务需要7×24小时在线。此时,企业购买的已不只是算力,还包括随时扩缩的弹性;如果这种弹性很少被使用,它就会变成长期溢价。
Cloudian调查中,40%的企业表示实际云端AI支出超过最初预测;Broadcom调查中,62%的IT负责人对生成式AI和Agent基础设施成本"非常或极度担忧"。真正让财务团队头疼的,往往还不只是GPU单价,而是存储、数据传输、模型调用、闲置资源以及跨团队重复建设叠加后的总账。
第二笔账:AI不是只搬算力,还要搬数据
训练、RAG和Agent都具有明显的"数据重力"。模型要读取文档、图像、日志、数据库和实时生产数据。如果数据在企业内部、算力在远端公有云,数据就要反复跨边界流动:一边增加传输费用和等待时间,一边扩大合规与泄露风险。
这也是为什么回迁往往先从数据密集型任务开始。不是服务器离数据更近这么简单,而是数据的存放、调用、授权、审计可以在一套边界内闭环。
第三笔账:生产AI开始要求"看得见、管得住、能追溯"
一个模型被一个应用调用时,管理并不复杂;当十几个部门、几十个应用和多种模型同时接入,谁在调用、用了多少Token、能否访问敏感模型、故障时切到哪里,就必须进入统一治理。对于金融、政务、医疗、能源等行业,数据驻留、网络隔离、身份权限和日志审计更是上线前置条件,而不是事后补丁。

训练、推理、数据预处理,回迁逻辑并不相同
训练训练任务峰值高、周期性强。大规模预训练或短期实验仍适合借助公有云快速获得资源;但企业拥有持续微调需求、训练数据体量大且不能出域时,本地集群更容易形成稳定的成本曲线。更常见的答案是混合模式:本地承接基线任务,云上消化临时峰值。
推理推理是最值得优先评估回迁的负载。它持续运行、规模可预测,又直接连接业务系统。客服、风控、质检、知识库问答和Agent一旦进入生产,本地部署可以同时缩短数据路径、降低单位调用成本,并让权限和审计落在企业自己的治理边界内。
数据预处理清洗、标注、切分、向量化等任务看似不如训练"吃GPU",却经常吞吐海量数据。如果源数据本来就在数据中心,让预处理算力靠近数据,往往比把原始数据搬到云上再拉回结果更合理。
2---3年TCO,应该怎样算才不失真
"公有云贵还是私有云贵"没有统一答案。正确的比较单位,不是单张GPU的采购价与单小时租价,而是同一服务水平下2---3年的总拥有成本。
| 成本项 | 公有云重点核算 | 私有云重点核算 |
|---|---|---|
| 算力 | 按需/预留实例、模型API、峰值扩容 | 服务器与GPU折旧、维保、更新周期 |
| 数据 | 存储、跨区与出云流量、备份 | 本地存储、网络、机房与备份体系 |
| 运营 | FinOps、资源闲置、跨账号治理 | 平台软件、运维人力、电力与制冷 |
| 风险 | 价格波动、锁定、数据跨域 | 容量预测、采购周期、硬件利用率 |
可以用一个"成本指数"做初筛:假设某稳定推理服务的云端三年成本为100,私有云不能只填硬件采购价,而应把软件、维保、电力、机房、运维和冗余全部计入;再分别按40%、60%、80%的GPU平均利用率测算。如果只有在极高利用率下私有云才占优,说明回迁条件尚不成熟;如果在保守利用率下仍有明显优势,才值得进入POC。
还要补上两项常被漏掉的收益:一是数据不再频繁出域带来的风险下降,二是算力池化后不同部门、不同模型共享资源带来的利用率提升。前者不应被粗暴换算成"省了多少钱",后者则必须用真实业务压测验证。
决定回不回,先把四个问题问清楚
一问负载:它是"偶尔用",还是"天天跑"?
回迁最怕只看某个月的高账单。企业至少要拉出六到十二个月的资源曲线,区分长期基线、周期峰值和一次性任务。稳定占用GPU、每天持续提供服务的推理,更容易通过本地资源形成规模效应;上线时间短、需求随时可能改变的模型,则应保留公有云的试错空间。负载画像不清,任何TCO都只是精确的猜测。
二问数据:模型要读什么,结果又流向哪里?
应把一次完整调用的数据路径画出来:原始数据从哪里产生,是否包含个人信息或业务机密,模型是否访问数据库和知识库,结果会写回哪个系统,日志需要保留多久。只讨论"模型放哪里"而不讨论数据链路,很容易把计算费用降下来,却增加网络、合规和治理成本。对数据密集型AI,通常不是数据追着算力跑,而是算力应该靠近数据。
三问服务:业务能接受多慢、停多久?
生产级AI要用业务语言定义SLA。客服助手关注首字响应和并发,工业质检关注实时性与漏检风险,Agent还会把多次模型调用和工具调用的延迟不断累加。企业应在迁移前建立现网基线,在POC中用真实数据、真实并发和真实网络复测,而不是只看厂商实验室里的单次性能。只有成本、性能和稳定性同时达标,回迁才算成立。
四问组织:谁来运营,而不只是"谁来安装"?
私有云把控制权交还企业,也把容量规划、资源调度、版本升级和故障处理带了回来。如果每个业务部门仍然各买一批GPU、各装一套模型,回迁只会把公有云上的碎片化复制到机房。真正需要建设的是统一服务目录、配额规则、成本归集和运维流程,让业务按需申请,平台统一调度,财务能够看清投入产出,安全团队能够追溯每一次重要变更。
这四个问题的答案,最终会形成一张负载清单:明确"继续留云""优先回迁""混合运行"和"暂缓决策"四类,而不是给整个企业贴上"上云"或"下云"的单一标签。
回迁之后,如何避免建成新的"算力孤岛"
把虚拟机和模型搬回来,只完成了回迁的一半。另一半,是让本地环境拥有接近云服务的交付效率,同时获得更强的治理能力。
ZStack AIOS 智塔完整包含ZStack Cloud的全部能力。底层以计算、存储、网络、安全、高可用、多租户与审计能力承接传统业务和AI业务;向上统一纳管虚机、容器与裸金属形态下的异构GPU,并通过透传、vGPU、dGPU等方式匹配不同性能与共享需求;模型层覆盖导入、微调、推理、评测和版本管理;网关层则把分散调用收进统一入口,提供Token计量、组织配额、模型路由与调用审计。

这套路径的价值,在于企业不必把"云底座"和"AI平台"建设成两套孤立系统。已有ZStack Cloud环境可以平滑扩展AI能力,回迁的传统应用、数据服务与AI训推也能在统一基础设施上协同。对于GPU资源,平台支持异构算力统一管理和细粒度切分;对于模型调用,统一入口兼容OpenAI协议,可将本地推理服务与外部模型服务纳入同一治理视图。
回迁过程同样不宜"大爆炸式切换"。更稳妥的路线是四步:先用账单、时延、数据路径和合规要求筛选负载;再选择非关键、可回退的推理或预处理任务做POC;随后通过全量加增量同步、测试切换和分批割接降低中断风险;最后持续观察GPU利用率、单次推理成本、SLA和Token消耗,决定下一批负载去留。
云的下一站,不是二选一
公有云没有失去价值。快速试验、短周期训练、全球分发和不可预测的突发需求,仍然是它的优势场景。私有云也不是天然更省钱:如果GPU长期闲置、团队缺少运营能力、模型仍在频繁试错,买回硬件只会把按需成本变成沉没成本。
真正成熟的回迁策略,是把"上云"从目的改回工具,把"回迁"从口号改成负载级决策。稳定推理回到私有云,敏感数据留在本地,短期峰值继续借助公有云;企业需要的不是一条单向迁移路线,而是一套可持续调整的混合架构。
AI回迁的终点,不是服务器重新回到机房。
而是企业重新获得对成本、数据、性能和创新节奏的控制权。ZStack AIOS 智塔要承接的,正是从"把负载迁回来"到"把AI真正运营起来"的这一段路。