cann

昇腾CANN7 天前
人工智能·昇腾·cann·cann开源
CANN 端云协同:节约开发、运行成本,支撑Mate90发布会鸿蒙独占应用创新CANN端云协同将云侧研发积累延伸至终端开发。依托昇腾与麒麟NPU同源的达芬奇(DaVinci)架构,以及CANN软件开发能力,开发者在昇腾上完成的部分模型适配与算子实现,可以继续沿用于麒麟端侧,在降低开发投入的同时,也有助于降低云侧推理成本。
zhangfeng113319 天前
人工智能·华为·ai编程·npu·cann
Ubuntu 版的 CANN 9.2.0-beta.1 的下载方式 三大云厂商的服务器系统截图里看不到 Ubuntu,并不代表 CANN 不支持 Ubuntu——本质原因是你勾选的「950 系列产品 + X86_64 + 离线安装」过滤条件,把选项筛到了只剩 veLinux / Tlinux / AliOS 这三家云厂商的系统。把条件换成「在线安装 或 容器镜像」就会出现 Ubuntu 22.04、openEuler 等选项,官方镜像仓库里也有大量 9.2.0-beta.1-950-ubuntu22.04-py3.x 的 Docker 镜像。另外截图里版本号是 9.2.0-beta.1,bet
zhangfeng113320 天前
人工智能·华为·ai编程·npu·cann
ATK(华为算子测试平台)详细介绍 CANN(Compute Architecture for Neural Networks,神经网络计算架构ATK(ApiToolKits)是华为昇腾生态中面向算子接口的端到端测试工具,属于 MindStudio 工具链家族(项目地址:gitcode.com/Ascend/ATK),定位是为算子开发者和算子测试人员提供"用例泛化生成 + 用例测试执行"的一站式框架,用来简化昇腾 NPU 算子的验证流程。
zhangfeng113321 天前
人工智能·华为·ai编程·npu·cann
昇腾 950PR/950DT 新增regbase 编程方式和MemBase SIMD/SIMT 混合编程模型开发者通过 __simd_vf__ 标记的 Vector Function 和 AscendC::Reg 命名空间下的 Reg API,直接操作 AIV 核内新加的一级 SIMD Register File(VF Reg),把一段连续矢量计算完整保留在寄存器里,只在进入和退出时与 Unified Buffer(UB)交互一次。
zhangfeng113322 天前
人工智能·ai编程·算子·npu·cann
cann 华为npu 算子开发直接访问L2高速缓存 的可行性分析大概率不行——L2 直访和 UB 指针化是两类性质不同的问题。 你之前那个 VECTOR 指针化任务之所以改 asc-devkit 就够,是因为 __ubuf__ 是编译器已经原生支持的地址空间关键字,只是 Basic API 层没开放入口。而 L2 的情况是:当前 Ascend C 的语言扩展里根本不存在 L2 的地址空间限定符,这不是库层能补的缺口。不过"L2 直访"这个需求要拆成两种含义,结论也不一样。
昇腾CANN1 个月前
人工智能·昇腾·cann·cann开源
9月14日直播丨人芯对话:昇腾950算力落地算子的编程范式探索
czhm571 个月前
cann
【无标题】HarmonyOS作为华为自研的分布式操作系统,历经多个版本的迭代演进,在HarmonyOS 6.1.1版本中迎来了声明式开发范式的全面成熟。基于HarmonyOS ArkTS API 24的开发框架,为开发者提供了从UI构建到状态管理、从动画系统到图形绘制的一站式解决方案。
昇腾CANN2 个月前
人工智能·昇腾·cann
基于 PyPTO 与 Agent,2周完成模型 QAT 算子开发与优化模型量化能够通过低比特表示降低推理阶段的存储和计算开销,但直接进行训练后量化(Post-Training Quantization,PTQ)时,模型往往会因量化误差而出现精度下降,尤其是低比特量化场景下,这一问题更加明显。为缓解量化带来的精度损失,量化感知训练(Quantization-Aware Training,QAT)在训练过程中模拟部署时的量化行为,使模型逐步适应低精度表示带来的数值扰动,从而在获得量化部署收益的同时,尽可能保持模型精度。
昇腾CANN2 个月前
昇腾·cann
昇腾软件说系列直播预告 | 7月28日19:00,昇腾算子编程专场【昇腾CANN】视频号、B站、昇腾社区多平台直播昇腾社区观看链接:昇腾直播-昇腾社区B站观看链接:https://live.bilibili.com/h5/23361884
昇腾CANN2 个月前
昇腾·cann
昇腾软件说系列直播预告|7月27日19:00,昇腾算力环境专场【昇腾CANN】视频号、B站、昇腾社区多平台直播昇腾社区观看链接:昇腾直播-昇腾社区B站观看链接:https://live.bilibili.com/h5/23361884
七夜zippoe3 个月前
pytorch·分布式·cann·hccl·通信库
深入解析CANN仓库中的HCCL分布式通信库目录为什么写这篇文章?测评结论速览✅ 核心优势⚠️ 待优化点文章综述评测总结一、CANN仓库与HCCL简介
ujainu小4 个月前
算子·cann
CANN ops-nn:新增一个自定义激活函数算子的完整流程昇腾 CANN(Compute Architecture for Neural Networks)是华为面向昇腾 AI 处理器提供的一套开放高性能计算底座,向上支持主流深度学习框架(PyTorch、TensorFlow 等),向下抽象出统一的算子开发接口,使开发者能够高效地将算法模型部署到昇腾 NPU 上执行。ops-nn 作为 CANN 生态中最贴近用户层的基础算子库,承担了所有神经网络经典算子的标准实现。掌握在 ops-nn 中新增自定义算子的完整流程,是深度学习工程师在昇腾平台上做算法落地的必备技能
昇腾CANN4 个月前
线性代数·性能优化·矩阵·昇腾·cann
【cann-samples系列】GroupedMatmul MX量化矩阵乘的深度性能优化实践cann-samples是CANN社区提供的高性能实践样例库,致力于为开发者提供可复用的优化方法论和优秀实践代码。本系列文章将陆续介绍仓库中的典型样例,分享我们在算子优化过程中的思考与经验。
luozhen1104 个月前
cann
CANN AMCT模型压缩工具链全貌解析:从训练后量化到稀疏剪枝的昇腾NPU部署管线——INT8/INT4混合精度量化策略与精度损耗诊断实录详解报告在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的全流程,分析INT8/INT4混合精度量化的工程策略,并结合逐层敏感度分析与精度诊断手段,给出可复现的调优记录
luozhen1104 个月前
cann
CANN ops-nn神经网络算子库概念拆解:从矩阵运算到昇腾NPU指令映射的算子注册与内核调度机制类比解读你以为神经网络推理的瓶颈在模型架构设计上?恰恰不是。当一个训练好的模型被部署到硬件上执行推理时,真正的性能差距往往出现在算子层——那一行行把高维张量映射为底层硬件指令的代码里。CANN(Compute Architecture for Neural Networks)作为昇腾NPU的软件栈核心,其ops-nn算子库承担的就是这个角色:将框架下发的计算请求,翻译成昇腾NPU上可执行的具体指令序列。打个比方,如果把昇腾NPU比作一家大型餐厅的后厨,那么CANN框架层就是前台点餐系统,而ops-nn算子库就是后
czhm574 个月前
cann
CANN AMCT量化压缩工具包深度技术解析:PTQ量化算法与昇腾NPU低比特运算的精度-性能权衡全景解读大语言模型推理部署面临的核心矛盾在于模型参数量与硬件算力之间的鸿沟。以DeepSeek-V4为代表的千亿参数模型,仅权重存储就需要数百GB显存,远超单张昇腾NPU的硬件上限。CANN(Compute Architecture for Neural Networks)作为华为昇腾AI处理器的计算架构,其原生模型压缩工具AMCT(Ascend Model Compression Toolkit)正是为弥合这一鸿沟而设计。AMCT提供训练后量化(PTQ)与量化感知训练(QAT)双路径,将FP16精度的模型权重压
luozhen1104 个月前
cann
CANN Ascend C算子调试工具链深度实战:cpu_run CPU模式仿真与npu_sim NPU仿真调试全流程解析及npuchk内存检查最佳实践在基于CANN(Compute Architecture for Neural Networks)进行Ascend C算子开发的过程中,开发者面临的核心痛点之一是如何在缺乏昇腾NPU硬件环境的情况下完成算子逻辑的正确性与性能验证。传统的算子调试流程强依赖真实NPU设备,这给算子的早期开发、持续集成以及分布式团队协作带来了显著的资源瓶颈。asc-tools仓库作为CANN生态中专门针对Ascend C编程语言推出的配套调试工具链,提供了cpu_debug(CPU模式仿真)与npu_sim(NPU周期精确仿真
czhm574 个月前
cann
CANN集合通信库hccl分布式训练从入门到实战:昇腾NPU多卡集群Ring-AllReduce算法原理与性能优化全指南多卡分布式训练已经成了训练大模型的标配,而通信往往决定了整个系统的扩展效率。当你在Ascend 910集群上跑数据并行训练时,每个step结束后都要让所有NPU上的梯度保持同步——这件事听起来简单,做起来却充满细节。Ring-AllReduce是当前分布式训练里最核心的梯度同步算法,理解它的工作原理和性能特征,是做出高质量多卡训练方案的前提。昇腾NPU上负责这件事的,就是CANN生态里的HCCL(Huawei Collective Communication Library)。本文拆解HCCL的核心设计,
luozhen1104 个月前
cann
CANN数学算子库ops-math深度实践:昇腾NPU上张量转换、基础数学运算与随机数生成的原理分析与工程实现在昇腾AI处理器的开发过程中,算子库是连接上层框架与底层硬件的关键桥梁。CANN作为昇腾异构计算架构的核心组件,其提供的ops-math数学算子库承担着张量形态变换、基础数学运算和随机数生成这三类最基础、调用频率最高的计算任务。昇腾NPU上的达芬奇架构通过Cube单元、Vector单元和Scalar单元的分工协作,为这些算子提供了远超通用CPU的并行计算能力。
czhm574 个月前
cann
CANN Python算子开发工具pyasc快速入门与实战:昇腾NPU自定义激活函数开发、调试与性能分析全流程指南在昇腾NPU上实现一个自定义的SwiGLU激活函数。他翻遍了CANN官方文档,发现要用Ascend C写算子,得先理解达芬奇架构的Cube和Vector单元,再搞懂算子注册、编译、部署那一整套流程。一个激活函数,从上手到跑通,硬是花了两周。后来pyasc出现了,同样的事,用Python写几十行代码就能搞定。这个差距不是一点点。