海思 HI3516 & HI3519 使用指南

海思 HI3516 & HI3519

  • [海思 HI3516DV500](#海思 HI3516DV500)

海思 HI3516DV500

查看设备 Proc 信息

状态信息都位于此目录下: /proc/umap

查看NPU的工作状态

执行命令:cat /proc/umap/svp_npu

参数介绍:

svp_npu_module_param SVP 图像分析引擎模块参数
nppu_save_power 低功耗标志,通过模块参数 svp_npu_save_power 配置。 0:关闭低功耗; 1:开启低功耗。
max_task_node_num 用于约束单个 Stream 的最大任务节点个数,取值范围为 2, 512,默认值为 32。用户可通过模块参数 svp_npu_max_task_node_num 进行配置,实际可下发的最大任务数为 (svp_npu_max_task_node_num - 1)。配置方式为:在加载 svp_npu 的 ko 时,使用 "svp_npu_max_task_node_num=512" 参数,并将 "512" 修改为所需数值。
max_stream_num 可用的 Stream 个数,取值范围为 1, 128,默认值为 64,用户可通过模块参数 svp_npu_max_stream_num 进行配置。 注:仿真环境不支持通过模块参数修改配置,默认 Stream 最大值为 128。
max_event_num 可用的硬件 Event 个数,取值范围为 0, 128,默认值为 32,用户可通过模块参数 svp_npu_max_event_num 进行配置。
prof_buf_size 用于 Profiling 的内存大小,取值范围为 512, 1048576,单位为 KB。启动 Profiling 功能时,系统内部会申请该大小的内存,用户可通过模块参数 svp_npu_prof_buf_size 进行配置。
dev0 svp_npu_resource_info 设备0 SVP图像分析引擎资源信息
max_model_num 最多可加载的普通模型个数。
free_model_num 剩余可加载的普通模型个数。
max_sec_model_num 最多可加载的安全模型个数。
free_sec_model_num 剩余可加载的安全模型个数。
max_stream_num 最多可申请的 Stream 个数。
free_stream_num 剩余可申请的 Stream 个数。
max_event_num 最多可申请的 Event 个数。
free_event_num 剩余可申请的 Event 个数。
max_report_num 最多可申请的 Report 个数。
free_report_num 剩余可申请的 Report 个数。
svp_npu_process_info pid:xxxx SVP图像分析引擎运行进程占用资源
pid 进程 ID。
model_num 进程加载的模型个数。
stream_num 进程申请的 Stream 个数。
report_num 进程申请的 Report 个数。
event_num 进程申请的 Event 个数。
aicpu_num 进程当前运行的模式识别 CPU 任务个数。
prof_en 进程是否使能 Profiling。0 表示未使能,1 表示已使能。
sync_timeout 进程默认阻塞等待的超时时间。 单位:ms。
svp_npu_process stream_info 进程中运行流的信息
id 流 ID。
sq_id 使用的硬件流 ID 号。
head 标记流的头指针。
tail 标记流的尾指针。
prior 当前任务的实时优先级。
cb_tid 注册到流的 Callback 任务处理线程的 ID。
cb_block 是否存在未完成的阻塞型 Callback 任务。
cb_block_id 即将运行的阻塞型 Callback 任务的任务 ID。
last_task_time 当前 Stream 上最近一次任务的执行耗时。该耗时统计的是从任务下达到任务完成的时间,因此在多 Stream 执行场景下,此耗时包含当前任务等待其它 Stream 上任务执行的时间。
push_cnt 下发的任务占用流上任务节点的个数。
sqe_cnt 流上实际未完成的任务个数。
recv_cnt 流上收到的任务总个数。
status 同步流的运行状态信息。 0:空闲状态 1:任务可下发或任务执行中 2:模式识别 CPU 任务处理中 3:任务执行完成 4:任务执行失败
svp_npu_process_model_info 进程中模型信息
id 模型的 ID 编号。
prior 模型配置的优先级。
preempt_en 模型是否使能抢占其它低优先级任务。0:不抢占;1:抢占。
up_step 优先级单步提升的超时时间,单位 ms,取值范围为 [0, 600000)。0 表示不开启优先级单步提升功能。
up_top 优先级最高提升的超时时间,单位 ms,取值范围为 [0, 600000)。0 表示不开启优先级最高提升功能。
stream_id 模型最近一次执行所在流的 ID。
last_task_time 模型最近一次执行的耗时。该耗时统计的是从任务下达到任务完成的时间,因此在多 Stream 执行场景下,此耗时包含当前任务等待其它 Stream 上任务执行的时间。
preempted_en 模型是否支持被打断的标识,在模型生成时指定。具体配置可参考《ATC 工具使用指南》。
name 模型名称,在模型离线生成时指定。最多显示 32 个字符,超出部分会被裁剪。
in_num 模型原始输入个数,不包括扩展输入。
out_num 模型原始输出个数,不包括扩展输出。
om_size 模型大小,单位 Byte。
work_buf_size 模型执行时所需的临时内存大小,单位 Byte。
bandwidth 模型执行时的理论数据带宽开销,单位 Byte。数据为 0 表示模型中没有带宽开销信息。
original_ops 原始模型单帧计算次数,用于衡量原始模型的复杂度和算力,单位 ops。数据为 0 表示模型中没有原始算力信息。
cube_ops 原始模型参数对齐架构后的单帧 CUBE 计算次数,用于衡量模型对齐 CUBE 单元的算力。数据为 0 表示模型中没有 Cube 算力信息。
input_xx_shape 原始模型输入的 Shape 信息,xx 代表输入编号,Shape 格式为 "NxCxHxW"。
output_xx_shape 原始模型输出的 Shape 信息,xx 代表输出编号,Shape 格式为 "NxCxHxW"。
svp_npu_irq_info SVP图像分析引擎中断信息
device_id 设备ID。
irq_cnt_last_sec 最近1秒内中断执行次数。
max_irq_cnt_per_sec 历史上的1秒内最大的中断执行次数。
total_irq_cnt 产生中断的总次数。
cur_irq_time 最近一次执行中断的执行耗时。 单位:us。
max_irq_time 执行一次中断的最大耗时。 单位:us。
irq_time_last_sec 最近一秒执行中断的执行耗时。 单位:us。
max_irq_time_per_sec 历史上一秒内执行中断的最大耗时。 单位:us。
total_irq_time 中断处理总时间。 单位:us。
svp_npu_runtime_info SVP图像分析引擎设备运行信息
device_id 设备ID。
hw_status 硬件所处状态。 0:空闲。 1:工作。
last_sq_id 最近一次下发任务到图像分析引擎的硬件流的ID号。
last_task_node_id 最近一次在图像分析引擎上执行的任务节点id。
prof_flag 是否有进程使能Profiling,并申请了Profiling内存。0代表没有使能,1代表使能。
timeout_err_cnt 设备上发生超时错误的个数。
hw_err_cnt 设备上发生逻辑错误的个数。
aicpu_err_cnt 设备上发生模式识别CPU任务执行错误的个数
last_hw_task_time 最近一次图像分析引擎执行任务的耗时。
hw_utilization 最近1s内硬件执行时间所占的比例。
total_running_time 设备运行总时间。 单位:s
相关推荐
缘友一世1 天前
在8×A800上把 DeepSeek-V4-Flash 榨到极限:从5倍提速到TP+EP双实例的完整实测
模型部署·模型推理·deepseek·moe model
程序猿编码24 天前
用 C++ 从零写一个能训练的 GPT:标量自动微分 + Arena 内存池
开发语言·c++·gpt·transformer·模型推理
猫先生Mr.Mao1 个月前
从“更大”到“更会做事”:Kimi K3 的开放前沿智能路线
大语言模型·论文解读·moe·模型推理·开源权重
GPUStack1 个月前
Day 0 实测|在 GPUStack 上部署 GLM-5.2-FP8-DSpark
ai·大模型·模型推理·gpustack
程序猿编码1 个月前
用C++从零开始造一个微型GPT,不借助任何第三方库
开发语言·c++·gpt·模型推理
梦想三三2 个月前
Flask + PyTorch模型部署实战:从训练权重到API接口完整工程解析(附完整代码)
人工智能·pytorch·python·flask·模型推理·ai 工程化
Flying pigs~~4 个月前
大模型训练框架 ➕ 推理部署框架
模型训练·deepspeed·vllm·模型推理·zero·pageattention
GPUStack4 个月前
NVIDIA H200/H20 DeepSeek-V4-Pro 部署指南、压测性能与稳定性调优建议
ai·性能调优·模型推理·gpustack·deepseek-v4