算子融合

thesky1234563 天前
大模型·tvm·图优化·xla·算子融合·编译期优化·推理编译
27届大模型面试准备(六十七):大模型推理编译与图优化工程——从计算图到高效内核本篇是"工程实战深化"的第 67 篇。前面我们写过推理引擎内核(A59:PagedAttention、调度器、显存管理)、注意力演进与 KV Cache(A36)、推理调度与弹性扩缩容(A66)。它们讨论的都是"运行时(runtime)"如何把已经存在的内核高效地排起来。但还有一个前置关卡经常被面试深挖:这些内核本身从哪来? 为什么同一个 Transformer,用 torch.compile 能比 eager 模式快一倍,用 TensorRT-LLM 又能再快一截?答案在"编译期"——把计算图翻译成对硬
Dfreedom.3 个月前
人工智能·深度学习·gpu·gpu加速·模型加速·算子融合·模型计算
算子融合:从硬件本质到性能飞跃的深度学习优化艺术在深度学习模型部署中,我们经常遇到这样的困境:同样的模型,同样的硬件,为什么推理速度却有天壤之别?一个在GPU上需要20ms的模型,经过优化后可能只需要5ms。这背后的关键优化技术之一就是算子融合。
数据与后端架构提升之路8 个月前
cuda·算子融合
深度解析 TeleTron:融合 CUDA 内核如何极致优化 HunyuanVideo 训练性能在 DiT (Diffusion Transformer) 模型(如 HunyuanVideo)的训练中,LayerNorm 和 AdaLayerNorm (AdaLN) 是计算图中出现频率极高的算子。原生的 PyTorch 实现往往受限于显存带宽(Memory Bound),导致频繁的内核启动和显存读写。
我是有底线的