昇腾

昇腾CANN7 天前
人工智能·昇腾·cann·cann开源
CANN 端云协同:节约开发、运行成本,支撑Mate90发布会鸿蒙独占应用创新CANN端云协同将云侧研发积累延伸至终端开发。依托昇腾与麒麟NPU同源的达芬奇(DaVinci)架构,以及CANN软件开发能力,开发者在昇腾上完成的部分模型适配与算子实现,可以继续沿用于麒麟端侧,在降低开发投入的同时,也有助于降低云侧推理成本。
智码看视界7 天前
昇腾·moe·开源大模型·智能体agent·本地推理·xing4.0-29b-a4b·单卡部署
开源大模型追踪:中电信人工智能Xing4.0-29B-A4B:SWE-bench 75.0逼近Qwen3.6-35B一句话定位:面向 Agent 的轻量 MoE,单张消费级显卡就能私有化跑长上下文智能体。这里要先说清一个容易混淆的点:总参 29B 听着比 7B 大,但本地跑得快不快,看的是"每 token 激活"而不是"总参"。Xing4.0 每 token 只点亮 4B 专家,推理算力开销接近一个 4B 稠密模型,显存却要装下全部 29B 权重——所以量化后单卡能跑,但原始 BF16 必须多卡。换句话说,它的"聪明"来自大权重库,"便宜"来自稀疏激活,两者分开看才不会误判部署门槛。
GitCode官方11 天前
人工智能·开源·昇腾·atomgit
“开源共生 共赢未来”2026北京昇腾生态先锋中心系列活动之算子实操工坊成功举办近日,北京昇腾生态先锋中心在北京市门头沟区政府指导下,联合昇腾 CANN 开源社区、AtomGit AI 社区等,共同发起 「“开源共生 共赢未来”2026 北京昇腾生态先锋中心系列活动之算子实操工坊」 活动。
AI模力圈18 天前
推荐算法·昇腾·生成式推荐
从级联架构到生成式推荐:推荐算法演进与昇腾落地作者:昇腾实战派 知识地图:https://blog.csdn.net/Lumos_Lovegood/article/details/161601003
昇腾CANN1 个月前
人工智能·昇腾·cann·cann开源
9月14日直播丨人芯对话:昇腾950算力落地算子的编程范式探索
是Yu欸1 个月前
人工智能·开源·大模型·昇腾·pangu
实测openPangu-2.0-Pro:昇腾原生, 505B大模型的开源答卷版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。505B 混合专家模型如何在昇腾上完成预训练、后训练和推理部署
昇腾CANN2 个月前
人工智能·昇腾·cann
基于 PyPTO 与 Agent,2周完成模型 QAT 算子开发与优化模型量化能够通过低比特表示降低推理阶段的存储和计算开销,但直接进行训练后量化(Post-Training Quantization,PTQ)时,模型往往会因量化误差而出现精度下降,尤其是低比特量化场景下,这一问题更加明显。为缓解量化带来的精度损失,量化感知训练(Quantization-Aware Training,QAT)在训练过程中模拟部署时的量化行为,使模型逐步适应低精度表示带来的数值扰动,从而在获得量化部署收益的同时,尽可能保持模型精度。
昇腾CANN2 个月前
昇腾·cann
昇腾软件说系列直播预告 | 7月28日19:00,昇腾算子编程专场【昇腾CANN】视频号、B站、昇腾社区多平台直播昇腾社区观看链接:昇腾直播-昇腾社区B站观看链接:https://live.bilibili.com/h5/23361884
网络工程小王2 个月前
人工智能·学习·华为·迁移学习·昇腾
【HCIE-AI】11.模型 昇腾迁移适配-精度调试-性能调优昇腾迁移适配1.1 torch.cuda → torch.npu 逐项替换清单1.1.1 设备管理类1.1.2 内存管理类
网络工程小王2 个月前
人工智能·pytorch·分布式·学习·昇腾·deepspeed
【HCIE-AI】12.deepspeed分布式并行训练进阶版概述: 训练大模型(7B+)时,会依次遇到显存、计算、通信、工程四个方面的瓶颈。理解这些瓶颈是理解后续所有解决方案的前提。
昇腾CANN2 个月前
昇腾·cann
昇腾软件说系列直播预告|7月27日19:00,昇腾算力环境专场【昇腾CANN】视频号、B站、昇腾社区多平台直播昇腾社区观看链接:昇腾直播-昇腾社区B站观看链接:https://live.bilibili.com/h5/23361884
高级打杂工程师-伍六六3 个月前
昇腾·npu·vllm·claude code
【昇腾】本地 27B 编程模型接入 Claude Code 实战:Qwopus3.6-27B-Coder 在 vLLM-Ascend 上的部署与踩坑四张 910B4 跑 27B 模型,接入 Claude Code,效果比预期要好——虽然慢Qwopus 是一个由社区开发者 Jack Rong 自费训练的开源模型系列,名字是 Qwen + Opus 的组合——用高质量推理轨迹对 Qwen 基座模型做微调,目标是在本地硬件上达到接近 Claude Opus 的推理和编程能力。
昇腾CANN4 个月前
线性代数·性能优化·矩阵·昇腾·cann
【cann-samples系列】GroupedMatmul MX量化矩阵乘的深度性能优化实践cann-samples是CANN社区提供的高性能实践样例库,致力于为开发者提供可复用的优化方法论和优秀实践代码。本系列文章将陆续介绍仓库中的典型样例,分享我们在算子优化过程中的思考与经验。
昇腾CANN4 个月前
人工智能·开源·昇腾·cann
6月15号新课开讲|HCCL入门系列课,正式上线!📚 HCCL入门系列课程一览第一课:HCCL通信库软件架构介绍 - 6月15号16:00第二课:HCCL通信库算子开发介绍 - 6月16号16:00
昇腾CANN4 个月前
人工智能·开源·昇腾·cann
从一张查找表到 4GB/s:HiFloat8 Cast 算子的工程化之路HiFloat8 Cast 算子在 Atlas A2/A3 昇腾 NPU 上为 PyTorch 实现 FP16/BF16 ↔ HiFloat8 双向转换,通过半空间 LUT、动态 tiling 和 DataCopy 分支优化,在大数据量下单方向吞吐稳定在 4 GB/s 量级——接近当前软件查表实现的吞吐上限。 Ascend 950系列产品 已具备原生 HiFloat8 硬件能力,本算子主要面向尚无该硬件加速的 A2/A3 平台。
嗝o゚4 个月前
算法·昇腾·cann·ge
CANN GE 算子融合——融合算法与调度策略GE 的算子融合是性能提升的核心手段。哪些算子能融合、融合的边界在哪里、调度顺序怎么定,这些都影响最终的执行效率。
hh.h.4 个月前
昇腾·cann·hcomm
CANN hcomm 通信库——多机训练的集合通信多机多卡训练时,节点间通信往往成为性能瓶颈。hcomm 是昇腾 CANN 软件栈中负责集合通信的核心库,作为 HCCL 的底层通信原语,它直接管理 NPU 之间的数据传输与同步。本文深入剖析 hcomm 的工作原理、通信架构、原语实现与配置调优方法,帮助开发者掌握多机训练通信层的底层逻辑。
hh.h.4 个月前
昇腾·runtime·cann
CANN runtime 内存池——高效显存管理策略runtime 的内存池是昇腾 NPU 显存管理的核心。分配策略、碎片处理、生命周期管理,这些细节决定了多模型推理时的显存利用率。这篇文章把 runtime 内存池的设计思路掰开讲,帮助你在模型部署时把显存吃满、用透。
嗝o゚4 个月前
昇腾·cann·ops-fft
CANN ops-fft FFT 算子——频域卷积加速原理大卷积核的卷积操作如果在空域逐点相乘再求和,其计算复杂度为 O(H×W×K×H×K),随着卷积核尺寸增大,计算量呈平方级增长。当卷积核大于 7×7 时,空域卷积的计算开销已经大到难以忽视。FFT(快速傅里叶变换)提供了一条绕过这条困境的路径:将时域卷积转换为频域乘法,从而把复杂度从 O(N²) 降至 O(N log N)。ops-fft 仓正是昇腾 NPU 上 FFT 算子的完整实现,本文剖析它的原理与用法。
hh.h.4 个月前
架构·昇腾·cann·autofusion
CANN graph-autofusion 框架——算子自动融合原理与实战手动融合算子是一件枯燥且容易出错的事:你要逐条分析算子间的数据依赖、确认 shape 一致性、规划寄存器分配,最后还要调试融合 kernel 的正确性。在昇腾 CANN 生态中,graph-autofusion 框架把这件事自动化了——它能自动识别计算图中的可融合算子模式,并生成对应的融合 kernel,让你专注于模型结构本身。