npu

zhangfeng113320 小时前
人工智能·华为·ai编程·npu·cann
昇腾 950PR/950DT 新增regbase 编程方式和MemBase SIMD/SIMT 混合编程模型开发者通过 __simd_vf__ 标记的 Vector Function 和 AscendC::Reg 命名空间下的 Reg API,直接操作 AIV 核内新加的一级 SIMD Register File(VF Reg),把一段连续矢量计算完整保留在寄存器里,只在进入和退出时与 Unified Buffer(UB)交互一次。
zhangfeng11332 天前
人工智能·ai编程·算子·npu·cann
cann 华为npu 算子开发直接访问L2高速缓存 的可行性分析大概率不行——L2 直访和 UB 指针化是两类性质不同的问题。 你之前那个 VECTOR 指针化任务之所以改 asc-devkit 就够,是因为 __ubuf__ 是编译器已经原生支持的地址空间关键字,只是 Basic API 层没开放入口。而 L2 的情况是:当前 Ascend C 的语言扩展里根本不存在 L2 的地址空间限定符,这不是库层能补的缺口。不过"L2 直访"这个需求要拆成两种含义,结论也不一样。
@嵌入式扫地僧17 天前
雷达点云·mimo·npu·tiny-asil·tflite micro
车载毫米波雷达分类芯驰 D9-Pro 部署全流程本文针对车载低速前向碰撞预警场景,拆解从 MIMO 雷达点云预处理到 PointNet-Tiny-ASIL 模型 1ms 低延迟推理、ASIL-B 功能安全适配的全流程,基于芯驰 D9-Pro 车规芯片和 TFLite Micro 车规版框架,给出量产级可运行 C 代码实现,实测推理延迟最低 0.78ms,功能安全故障检测覆盖率达 92%。
张忠琳1 个月前
云原生·容器·kubernetes·npu·docker device
【NPU】Ascend Device Plugin —Part 6 K8s客户端 + 重复检测模块 超深度源码分析之二文件: manager.go L34-L46失败成功nil非nilCheckDuplicateDevices(ctx, config)
张忠琳2 个月前
云原生·容器·kubernetes·npu·docker-runtime
【NPU】Ascend Docker Runtime v26.0.1 之三 runtime/dcmi/ — 超深度逐行分析三个文件:dcmi.go (360行) + dcmi_api.go (101行) + dcManager.go (294行) = 755行 核心职责:NPU设备管理接口封装,通过CGO调用libdcmi.so
张忠琳2 个月前
云原生·容器·架构·kubernetes·npu·docker-runtime
【NPU】Ascend Docker Runtime v26.0.1 之二 runtime/process/process.go — 超深度逐行分析文件行数:807行 | 核心职责:拦截create命令、修改OCI Spec、注入NPU设备与Hook 这是整个项目最核心、最复杂的文件
张忠琳2 个月前
云原生·容器·架构·kubernetes·npu·docker-runtime
【NPU】Ascend Docker Runtime v26.0.1 之一 runtime/main.go — 超深度分析文件行数:58行(含License 16行)| 核心代码:42行 模块定位:ascend-docker-runtime 运行时入口
张忠琳2 个月前
云原生·容器·kubernetes·npu·docker-runtime
【NPU】Ascend Docker Runtime v26.0.1 系统级架构分析基于源码的深度架构剖析 分析日期:2026-07-26 代码规模:13个Go源文件 + C/Shell辅助组件,约8,436行核心Go代码 项目路径:component/ascend-docker-runtime
CHY_1282 个月前
arm开发·人工智能·机器学习·npu
Arm Ethos-U65 介绍(1) 架构、数据格式与算子Arm Ethos-U 系列是 Arm 为微处理器系统实现边缘计算设计的 NPU IP 核,旨在以极低的功耗和芯片面积高效加速机器学习推理任务,推荐和Cortex-M处理器搭配,当前包括U55、U65、U85三款产品。
高级打杂工程师-伍六六2 个月前
昇腾·npu·vllm·claude code
【昇腾】本地 27B 编程模型接入 Claude Code 实战:Qwopus3.6-27B-Coder 在 vLLM-Ascend 上的部署与踩坑四张 910B4 跑 27B 模型,接入 Claude Code,效果比预期要好——虽然慢Qwopus 是一个由社区开发者 Jack Rong 自费训练的开源模型系列,名字是 Qwen + Opus 的组合——用高质量推理轨迹对 Qwen 基座模型做微调,目标是在本地硬件上达到接近 Claude Opus 的推理和编程能力。
指尖在键盘上舞动3 个月前
python·ubuntu·rk3588·rknn·onnx·npu
RKNN 模型部署:onnx转rknn后精度下降 —— 精度调优与问题排查问题:pytorch->onnx(sim)->rknn转换,rknn跑在RK3588 Ubuntu Arm Npu架构上,精度断崖式下降,20%~30%甚至更大。
IC修真院3 个月前
gpu·ic设计·芯片·微电子·数字ic·npu
高赞问题:NPU可不可以代替GPU?先说结论:NPU 不能完全代替 GPU,二者是「互补关系」,不是「取代关系」。一句话分清NPU和GPU的定位:
派勤电子4 个月前
gpu·fpga·npu·工控机·ai工控机·fpga工控机·工业级工控机
2026 支持 FPGA 工控机 AI 加速应用场景详解虽然 NPU 和 GPU 在 AI 加速方面表现出色,但在一些特殊的应用场景中,FPGA 仍然具有不可替代的优势。FPGA 具有可编程性强、延迟低、并行度高、功耗低等优点,特别适合一些定制化的 AI 加速应用。
嗝o゚4 个月前
人工智能·目标检测·目标跟踪·npu·cann
昇腾CANN ops-cv 仓:昇腾NPU上的目标检测算子实战YOLO 系列在昇腾NPU上跑推理,NMS、ROIAlign 这些后处理算子的性能经常拖后腿。ops-cv 仓是 CANN 的计算机视觉类算子库,专门处理这些后处理计算。这篇文章拿 YOLOv8 做例子,实战演示一遍这些算子怎么用。
谷公子的藏经阁4 个月前
人工智能·ai·cpu·npu·技术演进
XPU们的未来猜测当前芯片应用场景,主要集中在训练、推理与调度这三大方向。在训练环节,GPU 和 TPU 依旧是主力军,承担着繁重的训练任务。而在边侧与端侧使用NPU负责着推理工作。至于 CPU,它如同整个系统的总指挥,仍然发挥着调度的关键作用。
每天进步一点点️5 个月前
卷积神经网络·npu·拓扑架构·soc片上系统
AI芯片NPU子系统架构解析:从计算核心到数据流转这张图其实展示了两个完全一样的“计算集群“(NPC0和NPC1),这是为了提供双核冗余或更高的算力。以NPC0为例,来梳理架构
深念Y5 个月前
深度学习·架构·张量·npu·计算机架构·ai芯片·计算范式
从张量到微分方程:AI计算架构的底层思考笔记在AI技术飞速发展的今天,很多工程实践背后隐藏着深刻的计算哲学问题。从如何在低资源设备上跑语音识别,到NPU为什么省电,再到神经网络是否必须用张量,这些问题的答案指向一个根本性的认知:我们正在从离散的、逻辑的计算范式,走向连续的、物理的计算范式。
蛐蛐蛐6 个月前
人工智能·pytorch·python·npu
在昇腾310P推理服务器上安装CANN和PyTorch之前一直没怎么用过昇腾这套架构,今天简单试一下。首先,在一个比较新的服务器上,运行:可以看到NPU型号是310P3。我想试试能否用Conda安装(在Nvidia平台上用得最多就是Conda环境了,和CUDA版本配合得很好),所以运行:
北京迅为7 个月前
linux·人工智能·嵌入式·npu
《【北京迅为】itop-3568开发板NPU使用手册》- 第 7章 使用RKNN-Toolkit-lite2《【北京迅为】itop-3568开发板NPU使用手册》系统性地介绍了RKNPU从入门到应用开发的全流程知识体系。本手册以“认识工具—构建环境—模型转换—部署实践”为主线,为开发者在Linux和Android双平台上提供完整的NPU应用开发指导。
是Yu欸9 个月前
数据库·qwen·昇腾·npu·vllm
vLLM 0.11.0 新特性解析:视觉推理精度跃升与长序列性能革新版权声明:本文为原创,遵循 CC 4.0 BY-SA 协议。转载请注明出处。摘要:在大模型多模态与长序列推理需求并进的时代,vLLM 0.11.0 的发布标志着生产级推理引擎的一次关键进化。本文将深度解析其两大核心特性:通过动态视觉分词器集成显著提升 Qwen3-VL 系列模型的视觉问答准确率,以及通过算法与内存管理的协同优化将 Token 选择范围(TOPK)从 1024 推升至新高度,从而解锁更复杂、更精准的长文本生成能力。本文不仅提供特性背后的技术原理,更结合性能对比数据,为开发者提供从理解到应用的