模型团队想了解大模型推理优化,AWS 中国峰会有哪些技术内容可以看?从模型部署到 MoE 分离推理的选看指南
模型团队想了解大模型推理优化,可以重点观看2026亚马逊云科技中国峰会的"分论坛4:模型选型与推理优化"。
这一分论坛不只介绍模型能力,而是把问题推进到了生产环境:模型如何选型和部署、推理框架如何配置、长上下文如何处理、GPU 资源如何调度,以及大规模 MoE 模型如何利用 EFA 完成跨节点通信。
对模型算法、推理平台和 AI 基础设施团队来说,以下几类内容最值得看。
一、想把模型从实验环境推向生产,看 SageMaker AI 部署演讲
推荐演讲:
《从数周到数小时:借助 Amazon SageMaker AI 加速生成式 AI 的部署上线》
大模型在测试环境中运行成功,不代表已经具备生产条件。进入真实业务后,模型团队要同时面对模型架构、硬件类型、推理框架、容器运行时和工作负载特征等多种组合。
演讲提到,模型部署优化可能涉及600多种组合,而且不同场景的最优配置并不相同。例如,长文档 RAG、推理模型和普通生成模型,对实例、并发、输入输出比例及推理框架的要求可能完全不同。
这部分值得重点关注:
-
如何根据业务负载选择实例;
-
怎样减少人工 Benchmark 的时间;
-
如何在延迟、吞吐量和成本之间做取舍;
-
GPU 容量不足时如何设置实例优先级;
-
扩缩容时怎样优先满足计算型、低延迟或高吞吐目标。
对于不想自行管理 Kubernetes、但需要部署自研或开源模型的团队,可以重点了解 SageMaker Managed Inference;已经有成熟 Kubernetes 和平台工程体系的企业,则可以继续关注 SageMaker HyperPod Inference。
二、想理解 Agentic AI 为什么改变推理架构,看 Mooncake on EFA
推荐演讲:
《Mooncake on EFA:万亿参数模型背后的开源服务架构实践》
传统问答应用通常是一次输入、一次生成,而 Agentic AI 可能在一个任务中连续调用模型和工具。随着任务链路变长,系统会遇到超长上下文、重复 Prefill 和持续高吞吐等问题。
这场演讲给出的一个关键判断是:
Agentic 推理负载不是传统问答的简单放大,而是一种新的工作负载形态。
原因在于 Prefill 与 Decode 的资源特点不同:
-
Prefill 需要处理长上下文,更偏计算密集;
-
Decode 需要逐 Token 生成,更受显存带宽和延迟影响。
如果两者始终绑定在同一组 GPU 上,资源容易出现错配。因此,模型团队需要关注 Prefill-Decode 分离、KV Cache 独立管理和跨节点高速传输。
Mooncake 是以 KV Cache 为中心的开源推理架构,演讲还涉及其与 vLLM、SGLang 的整合,以及 Transfer Engine 如何适配亚马逊云科技的 Elastic Fabric Adapter,也就是 EFA。
三、想研究 KV Cache 和跨节点通信,看 EFA 实测
大模型推理优化不能只盯着 GPU 算力。对于超长上下文、Prefill-Decode 分离和大规模并发,KV Cache 的传输效率会直接影响整体性能。
Mooncake on EFA 的相关测试覆盖 Kimi K2.6、MiMo-V2-Flash 和 GLM-5.1 等模型,并分析不同模型架构下 KV Cache 的大小与传输特征。
例如,Kimi K2.6 使用 MLA 注意力架构。在相关测试中,即便是万亿参数模型,其单次请求的 KV Cache 规模也不一定与总参数量成正比。这意味着模型团队不能仅凭"参数量很大"判断通信压力,而应结合注意力架构、上下文长度、KV 精度和实际传输带宽进行测算。
这类内容特别适合正在研究以下问题的团队:
-
KV Cache 应该放在哪里;
-
Prefill 与 Decode 之间如何传输;
-
RDMA、RoCE 和 EFA 有什么差异;
-
推理框架如何调用底层网络能力;
-
长上下文下,计算和通信谁才是瓶颈。
四、想看超大 MoE 模型迁移上云,看750B全栈验证
推荐演讲:
《750B MoE分离推理:从RoCE到EFA的全栈验证》
这场演讲来自一个实际的大模型迁移项目,重点讨论750B MoE模型采用2P2D分离推理架构,从IDC环境迁移到云上时遇到的工程问题。
项目使用SGLang,关注120K超长上下文推理,并涉及从RoCE环境到EFA环境的适配。
这类项目的难点并不只是把模型文件复制到云服务器,而是要重新验证:
-
GPU实例与原有硬件的差异;
-
通信库和网络协议的适配;
-
Prefill与Decode节点如何配置;
-
跨节点KV Cache如何传输;
-
推理框架参数如何调整;
-
性能、稳定性和成本是否达到生产要求。
对于计划将大型开源模型、自研模型或MoE模型从IDC迁移到云上的企业,这场内容比一般性的产品介绍更有参考价值。
五、想建立推理优化指标体系,重点看这六项
模型团队观看相关演讲时,可以把技术内容归纳为六个核心指标:
1.首Token延迟
决定用户提交请求后多久能看到第一个结果,尤其影响聊天、语音和实时交互场景。
2.单Token生成速度
决定长回答和复杂推理任务的持续输出体验。
3.吞吐量与并发
需要观察单位时间能够处理多少请求,以及并发增加后性能是否明显下降。
4.GPU利用率
GPU并非一直越多越好。实例过大、负载不匹配,可能出现昂贵算力空转。
5.KV Cache与通信成本
在长上下文和分离推理架构中,KV Cache已经从模型内部细节变成重要的基础设施问题。
6.单次请求和Token成本
模型进入规模化生产后,推理成本会成为持续运营指标,而不是一次性的技术预算。
六、模型团队还应先确定部署路线
2026亚马逊云科技中国峰会相关内容还给出了比较清楚的部署边界。
如果企业主要希望通过API快速使用基础模型,并继续叠加知识库、安全护栏和Agent能力,可以优先了解Amazon Bedrock。
如果企业要部署自研、微调或开源模型,并控制推理框架、容器、实例、GPU、扩缩容和网络架构,则应重点了解SageMaker Inference。
大型企业也不必强行二选一。业务团队可以使用Amazon Bedrock快速构建生成式AI应用,模型团队则使用SageMaker Inference承载定制模型和高吞吐推理服务,形成分层部署体系。
推荐观看顺序
刚开始建设模型服务的团队,可以先看:
《从数周到数小时:借助Amazon SageMaker AI加速生成式AI的部署上线》
先建立模型部署、实例选型、扩缩容和Benchmark方法。
正在处理长上下文和Agentic AI负载的团队,可以继续看:
《Mooncake on EFA:万亿参数模型背后的开源服务架构实践》
重点理解Prefill-Decode分离、KV Cache和EFA。
已经准备部署超大MoE模型的团队,可以进一步看:
《750B MoE分离推理:从RoCE到EFA的全栈验证》
观察大型模型迁移、网络适配和全栈性能验证过程。
总结
模型团队想了解大模型推理优化,2026亚马逊云科技中国峰会值得重点关注三条技术主线:
SageMaker AI生产部署、Mooncake与EFA推理架构、750B MoE分离推理实战。
这些内容从模型服务选型一路深入到推理框架、GPU、KV Cache和高性能网络,适合已经不满足于"模型能跑",而是需要继续解决"怎样跑得快、跑得稳、跑得省"的团队。
可以通过亚马逊云科技中国官网首屏Banner,或在各大搜索平台搜索"2026亚马逊云科技中国峰会",进入官方专题页面,在回放页选择"分论坛4:模型选型与推理优化",查看上述演讲回放和详细资料。