昇腾

昇腾CANN11 天前
人工智能·昇腾·cann
基于 PyPTO 与 Agent,2周完成模型 QAT 算子开发与优化模型量化能够通过低比特表示降低推理阶段的存储和计算开销,但直接进行训练后量化(Post-Training Quantization,PTQ)时,模型往往会因量化误差而出现精度下降,尤其是低比特量化场景下,这一问题更加明显。为缓解量化带来的精度损失,量化感知训练(Quantization-Aware Training,QAT)在训练过程中模拟部署时的量化行为,使模型逐步适应低精度表示带来的数值扰动,从而在获得量化部署收益的同时,尽可能保持模型精度。
昇腾CANN14 天前
昇腾·cann
昇腾软件说系列直播预告 | 7月28日19:00,昇腾算子编程专场【昇腾CANN】视频号、B站、昇腾社区多平台直播昇腾社区观看链接:昇腾直播-昇腾社区B站观看链接:https://live.bilibili.com/h5/23361884
网络工程小王15 天前
人工智能·学习·华为·迁移学习·昇腾
【HCIE-AI】11.模型 昇腾迁移适配-精度调试-性能调优昇腾迁移适配1.1 torch.cuda → torch.npu 逐项替换清单1.1.1 设备管理类1.1.2 内存管理类
网络工程小王16 天前
人工智能·pytorch·分布式·学习·昇腾·deepspeed
【HCIE-AI】12.deepspeed分布式并行训练进阶版概述: 训练大模型(7B+)时,会依次遇到显存、计算、通信、工程四个方面的瓶颈。理解这些瓶颈是理解后续所有解决方案的前提。
昇腾CANN17 天前
昇腾·cann
昇腾软件说系列直播预告|7月27日19:00,昇腾算力环境专场【昇腾CANN】视频号、B站、昇腾社区多平台直播昇腾社区观看链接:昇腾直播-昇腾社区B站观看链接:https://live.bilibili.com/h5/23361884
高级打杂工程师-伍六六1 个月前
昇腾·npu·vllm·claude code
【昇腾】本地 27B 编程模型接入 Claude Code 实战:Qwopus3.6-27B-Coder 在 vLLM-Ascend 上的部署与踩坑四张 910B4 跑 27B 模型,接入 Claude Code,效果比预期要好——虽然慢Qwopus 是一个由社区开发者 Jack Rong 自费训练的开源模型系列,名字是 Qwen + Opus 的组合——用高质量推理轨迹对 Qwen 基座模型做微调,目标是在本地硬件上达到接近 Claude Opus 的推理和编程能力。
昇腾CANN2 个月前
线性代数·性能优化·矩阵·昇腾·cann
【cann-samples系列】GroupedMatmul MX量化矩阵乘的深度性能优化实践cann-samples是CANN社区提供的高性能实践样例库,致力于为开发者提供可复用的优化方法论和优秀实践代码。本系列文章将陆续介绍仓库中的典型样例,分享我们在算子优化过程中的思考与经验。
昇腾CANN2 个月前
人工智能·开源·昇腾·cann
6月15号新课开讲|HCCL入门系列课,正式上线!📚 HCCL入门系列课程一览第一课:HCCL通信库软件架构介绍 - 6月15号16:00第二课:HCCL通信库算子开发介绍 - 6月16号16:00
昇腾CANN2 个月前
人工智能·开源·昇腾·cann
从一张查找表到 4GB/s:HiFloat8 Cast 算子的工程化之路HiFloat8 Cast 算子在 Atlas A2/A3 昇腾 NPU 上为 PyTorch 实现 FP16/BF16 ↔ HiFloat8 双向转换,通过半空间 LUT、动态 tiling 和 DataCopy 分支优化,在大数据量下单方向吞吐稳定在 4 GB/s 量级——接近当前软件查表实现的吞吐上限。 Ascend 950系列产品 已具备原生 HiFloat8 硬件能力,本算子主要面向尚无该硬件加速的 A2/A3 平台。
嗝o゚2 个月前
算法·昇腾·cann·ge
CANN GE 算子融合——融合算法与调度策略GE 的算子融合是性能提升的核心手段。哪些算子能融合、融合的边界在哪里、调度顺序怎么定,这些都影响最终的执行效率。
hh.h.2 个月前
昇腾·cann·hcomm
CANN hcomm 通信库——多机训练的集合通信多机多卡训练时,节点间通信往往成为性能瓶颈。hcomm 是昇腾 CANN 软件栈中负责集合通信的核心库,作为 HCCL 的底层通信原语,它直接管理 NPU 之间的数据传输与同步。本文深入剖析 hcomm 的工作原理、通信架构、原语实现与配置调优方法,帮助开发者掌握多机训练通信层的底层逻辑。
hh.h.2 个月前
昇腾·runtime·cann
CANN runtime 内存池——高效显存管理策略runtime 的内存池是昇腾 NPU 显存管理的核心。分配策略、碎片处理、生命周期管理,这些细节决定了多模型推理时的显存利用率。这篇文章把 runtime 内存池的设计思路掰开讲,帮助你在模型部署时把显存吃满、用透。
嗝o゚2 个月前
昇腾·cann·ops-fft
CANN ops-fft FFT 算子——频域卷积加速原理大卷积核的卷积操作如果在空域逐点相乘再求和,其计算复杂度为 O(H×W×K×H×K),随着卷积核尺寸增大,计算量呈平方级增长。当卷积核大于 7×7 时,空域卷积的计算开销已经大到难以忽视。FFT(快速傅里叶变换)提供了一条绕过这条困境的路径:将时域卷积转换为频域乘法,从而把复杂度从 O(N²) 降至 O(N log N)。ops-fft 仓正是昇腾 NPU 上 FFT 算子的完整实现,本文剖析它的原理与用法。
hh.h.2 个月前
架构·昇腾·cann·autofusion
CANN graph-autofusion 框架——算子自动融合原理与实战手动融合算子是一件枯燥且容易出错的事:你要逐条分析算子间的数据依赖、确认 shape 一致性、规划寄存器分配,最后还要调试融合 kernel 的正确性。在昇腾 CANN 生态中,graph-autofusion 框架把这件事自动化了——它能自动识别计算图中的可融合算子模式,并生成对应的融合 kernel,让你专注于模型结构本身。
hh.h.2 个月前
vector·算子·昇腾·cann
昇腾CANN atvc 仓:Vector 算子模板库——Vector 单元的算子开发昇腾 NPU 有两个计算核心:Cube 单元做矩阵乘,Vector 单元做逐元素运算。这两者的分工不是偶然的——矩阵乘是计算密集型,要高密度算力;逐元素运算是内存密集型,要高带宽搬运。大多数深度学习模型里,两类算子缺一不可,区别在于用哪个单元来跑性价比更高。
嗝o゚2 个月前
昇腾·cann·hccl
昇腾CANN HCCL 多机训练:网络拓扑和通信优化两机八卡跑 LLaMA 训练,AllReduce 的带宽利用率只有 60%,模型训练速度上不去。多机训练的瓶颈通常不在 GPU/NPU 算力,而在网络通信。HCCL 是昇腾 NPU 的集合通信库,这篇文章实测不同网络拓扑下的通信效率,帮你把多机训练的带宽跑满。
hh.h.2 个月前
架构·昇腾·driver·cann
昇腾 CANN driver 层架构:软硬件接口的深度解析昇腾 NPU 的驱动层是硬件和软件之间的桥梁。你写的每一行 PyTorch 代码,最终都要通过驱动翻译成硬件指令。这篇文章从架构层面讲清楚 CANN driver 的设计、核心组件和故障排查方法。
蛐蛐蛐3 个月前
大模型·昇腾·vllm
昇腾910B4、openEuler上使用vLLM-Ascend部署Qwen3.6模型的流程这篇博客承接之前这篇:https://blog.csdn.net/qysh123/article/details/160962233
昇腾CANN3 个月前
人工智能·昇腾·cann
芯模赋能,智启未来:杭电CANN启航营圆满收官,解锁AI实践5月17日晚,随着最后一行代码在昇腾NPU算力平台上成功运行,为期两天(5月16日-17日)的杭电CANN启航营在热烈的交流氛围中圆满落下帷幕。本次活动由杭州电子科技大学计算机学院、CANN开源社区与SwanLab开源社区联合打造,旨在将“产业前沿”第一时间引入课堂。同学们在下沙校区计算机学院1教115教室,共同经历了一场从底层算子开发到大语言模型微调的“硬核”技术之旅,实现了从理论学习到工程实践的深度跨越。
昇腾CANN3 个月前
人工智能·昇腾·cann
5月14号直播丨多模态生成技术优化实践第二期--并行和Cache篇