技术栈
算子优化
minhuan
6 天前
大模型应用
·
算子优化
·
大模型推理性能优化
·
多模型pipeline调度
·
内存访问优化
大模型推理性能优化指南:算子、内存访问、多模型Pipeline调度全方位优化实战解析27.4
现在大模型已经越来越多的应用到了很多场景,智能问答、AI绘图、多模态推理、企业私有化部署等应用随处可见。但不管怎样,还是逃不掉一些核心难题:模型效果达标了,但运行速度慢、显存占用高、多模型并行卡顿、硬件资源浪费严重。很多时候我们并不是模型精度不够,而是底层运行和调度效率拖了后腿。
HyperAI超神经
3 个月前
人工智能
·
ai 编译器
·
腾讯
·
具身智能
·
矩阵乘法
·
算子优化
·
华为昇腾
活动预告|智源/TileRT/腾讯/华为/智元创新同台,共探 AI 编译的多层级协同优化
从北京的酷暑到上海的寒冬,由 HyperAI超神经主办的 Meet AI Compiler 技术沙龙,已经伴随 AI 编译生态走过了三年。这三年里,我们见证了无数工程师与科研学者分享前沿成果、碰撞技术观点,也共同推动着编译技术在大模型时代持续演进,不断突破性能优化、异构适配与工程落地的新边界。
华为云开发者联盟
2 年前
人工智能
·
昇腾
·
cann
·
算子优化
·
graph engine
深度解读昇腾CANN小shape算子计算优化技术,进一步减少调度开销
本文分享自华为云社区《深度解读昇腾CANN小shape算子计算优化技术,进一步减少调度开销》,作者:昇腾CANN。
我是有底线的