如果你现在还在把 PyTorch 理解成一个"训练深度学习模型的 Python 框架",那可能就有点跟不时代了。就在 9 月 8 日到 9 日,PyTorch Conference China 2026 在上海举行。官方总结里出现了模型、分布式训练、推理、异构硬件、云原生基础设施以及 Agent 等主题。相比过去围绕模型开发和训练架构展开了讨论,这次大会还透露出来的方向更宏大,PyTorch 正在试图把自己放进完整的 AI 基础架构体系里。对现在而言,它关心的已经不只是:"模型怎么能跑起来?"。而是进一步变成了:"一个 AI 系统中怎样从模型一路跑到生产环境的?"。虽然这两件事看起来差别并不大,但背后却是完全不同的技术问题。
1、PyTorch已经不在只是一层框架了
PyTorch Foundation 在大会上给出了具体的描述:Any Model · Any Chip · Any Cloud · Any Agent。翻译过来就是应模型、芯片、云和 Agent 四个方向。
如果从技术栈来看,这套东西已经相当成熟。模型开发和智能计算这一层,有 PyTorch、vLLM、Ray;再往下是 Kubernetes、KServe、Kueue、OpenTelemetry、llm-d 等负责调度、服务和可观测性的组件;底层则出现了 OpenStack、Kata Containers,以及 GPU、NPU、CPU 等不同计算设备。
其实这里最值得关注的,不是又多了几个开源项目。而是 AI 基础框架正在重走一遍过去云原生走过的老路。在早期的时候要部署 AI,通常会直接讨论:CUDA 怎么装、模型怎么加载、显存够不够、服务又怎么启动;但模型规模变得越来越大后,事情就已经没这么简单了。现在需要处理模型切分、KV Cache、Prefill/Decode 分离、多机推理、任务调度、弹性扩容、GPU/NPU 管理、服务路由、监控以及故障恢复等。模型本身只是其中一层,真正能决定 AI 能不能规模化落地的,越来越多是模型下面的基础架构。
2、异构算力正在成为现实的问题
这次会议里我比较关注的另一个方向便是硬件、过去谈 PyTorch 默认环境基本就是 NVIDIA GPU,现在情况已经明显不一样了,GPU、NPU、XPU以及不同厂商自己的 AI 加速器同时存在。一套模型如果想在不同硬件上稳定的运行,就会涉及到算子、编译器、通信库、分布式训练和推理框架等一整套适配的工作。这也就是为什么 PyTorch TAC 还专门成立 Accelerator Integration Working Group 的原因。这个工作组由华为和 Intel 联合主持,他们正在尝试建立统一的硬件接入规范、跨仓库 CI、Device-Aware 测试以及不同计算后端的兼容性机制。这项工作看起来比较底层,实际上对整个 AI 行业都非常的重要。
如果每增加一种芯片,都需要 PyTorch、vLLM、SGLang、算子库和通信框架都需要重新适配一遍,那么整个生态的成本都会非常高。真正理想的情况就应该是,上层模型可以做到尽量不关心下面究竟运行在 NVIDIA GPU、昇腾 NPU 还是其他加速器上。就像 Java 曾经追求的"一次编写,到处运行"一样,当然 AI 计算比 JVM 要复杂得多尤其性能优化不可能完全屏蔽硬件的差异。不过现在方向已经比较明确,统一接口保留硬件优化的能力,同时尽量降低迁移的成本。
3、在这次会议中国产厂商开始进入更上游的地位
这次大会还有一个更值得注意的变化。那就是阿里云和寒武纪成为 PyTorch Foundation Platinum Member,蚂蚁集团成为 Gold Member,华为则已经是现有 Platinum Member。根据官方的说明目前有超过 100 名中国开发者向 PyTorch 贡献了代码,涉及到了 40 多个组织;同时中国有超过 250 个组织参与 PyTorch Foundation 旗下的项目,包括 PyTorch、Ray、vLLM、DeepSpeed、Safetensors 等。
这次的变化比"又有几家新公司加入基金会"更值得看。过去很长一段时间国内 AI 基础架构更多是在做兼容,新的 GPU 出来了做一下适配;新的模型出来了跑通了,框架升级了再跟调整一下。现在正在逐渐变成参与定义接口、参与维护项目、甚至参与制定硬件如何进入 PyTorch 生态的规则中。这就意味着角色开始从使用开源往参与构建开源基础架构的变化。
4、现在模型性能越来越依赖系统工程了
大会还展示了一个 DeepSeek-R1 的案例,在相同 GB300 硬件上通过 Kernel、Routing、Parallelism 和 Serving 等环节做了持续优化,展示配置中的吞吐量提升到了原来的 2.77 倍,Token 成本降低了 60%。官方材料注还说明了该数据来源于 NVIDIA 2026 年的案例。这个数字本身可以谨慎看待因为具体效果一定会和部署方式、批量大小以及负载等条件有关。
但它说明了一个很现实的问题,模型没有变,并不代表性能就没有了优化空间。,今天做大模型部署真正拉开成本差距的地方,很可能不是模型参数而是系统部署。例如调度策略、Attention Kernel、并行方式、显存管理、Batching、KV Cache、Prefill/Decode 调度,都可能直接改变最终的 Token 成本。所以以后再论证一个模型"需要多少显存",这个问题本身可能就不够严谨了。而应该考虑,采用什么精度?什么推理引擎?什么并行策略?上下文多长?吞吐量目标是多少?并发量是多少?这些因素最终决定的才是真实部署的成本。
5、在Agent之后基础架构还会继续下沉
在这次 PyTorch Conference China 里 Agent 出现得非常频繁了,但是我反而觉得这说明行业正在从"Agent 应用热"进入了下一阶段;第一阶段大家最关注的是,怎么调用模型、怎么加工具、怎么做工作流。真正到了生产环境以后,就会发现 Agent 需要面对身份、权限、状态、运行时、隔离、调度、监控以及资源控制,这些最终都会变成基础架构的问题。所以这次 PyTorch Foundation 把 Any Agent 和 Any Model、Any Chip、Any Cloud 放在一起其实就很具有代表性了。Agent 很可能不会长期停留在一个 Python 脚本加几个 Tool Call 的情况。而是它最终会形成自己的 Runtime与调度层以及基础架构。
6、最后我对这次大会的看法
在过去几年里 AI 行业最吸引注意力的是模型本身,从参数量从几十亿一路做到几千亿模型能力在不断的提升。但在未来几年里真正产生大量机会的地方,很可能会是逐渐向模型下面转移。推理的引擎、异构计算、云原生调度、Agent Runtime、可观测性、模型服务以及算力抽象层的重要性。这次 PyTorch 的变化其实只是这个趋势的一部分。它正在从一个"深度学习框架"逐步演变成开源 AI 技术栈中起到核心承上启下的作用。上面连接模型和 Agent,下面则连接 GPU、NPU 和云基础设施。中间再通过 vLLM、Ray、Kubernetes、KServe 等项目完成训练、推理和调度。这才是今年这场 PyTorch Conference China 最值得技术人员关注的地方。不是某一个新功能,也不是某一家企业加入了基金会,而是过去彼此分散的模型、框架、推理、算力和云原生技术,正在逐渐拼成一套新的 AI 基础架构。
不过模型的竞争远远还没有结束。 但模型下面底的竞争,才刚刚开始。