【AscendC】ReduceSum中指定workLocal大小时如何计算

参考官方文档,但其中对于workLocal大小的计算只是以代码注释的方式给出,不具有直观性,现在结合两个官方例子进行推导。

首先注意到api的调用,分为高维切分模式和指定数量模式,两种模式的计算是不同的,主要在于repeattimes这个变量的大小。

高维切分的例子见上图,可以看到结果是80.

结合图1进行分析,首先数据类型为half类型,所以elementsPerBlock为16,而repeatTime的计算是通过srcDataSize / mask, 也即8320 / 128 = 65。

进行上取整得到的结果是65 + 15 / 16 = 5, 5 * 16 = 80。所以最终结果为80。

对于指定数量n的模式,见下图:

此处指定的srcDataSize是288,由图1的注释,

// 此处需要注意:对于tensor高维切分计算接口,firstMaxRepeat就是repeatTimes;对于tensor前n个数据计算接口,firstMaxRepeat为count/elementsPerRepeat,比如在half类型下firstMaxRepeat就是count/128,在float类型下为count/64,按需填入,对于count<elementsPerRepeat的场景,firstMaxRepeat就是1

可以看到 firstMaxRepeated = 288 / 128 = 1。

因此得到的结果就是(1+ 15) / 16 * 16 = 16.

相关推荐
旺仔Sec2 分钟前
2026年江西省职业院校技能大赛人工智能大模型应用开发赛项样题
人工智能
新知图书5 分钟前
【新书推荐】《让AI推荐你的品牌:GEO营销实践》
人工智能
火山引擎和TA的超级拍档们11 分钟前
产品情报局 04|客服Agent:大模型时代的智能客服新范式
大数据·人工智能
richard_first11 分钟前
第19章 RAG(Retrieval-Augmented Generation)
人工智能·深度学习·语言模型·自然语言处理·transformer
2301_8018217114 分钟前
推进语义文本相似性建模:一个具有平移ReLU和平滑 K2损失的回归框架
人工智能
IT_陈寒15 分钟前
我花3小时debug,就因为JavaScript这个隐式转换坑
前端·人工智能·后端
我是小白呀15 分钟前
23-AI说可以开通以后呢:权限、审批、审计与执行门禁
人工智能·workflow
2401_8900956122 分钟前
武汉企业AI私有化部署验收需核对哪些日志字段?
人工智能·验收标准·武汉自动意志科技有限公司·智钳ai智能体聚合平台·企业ai私有化部署·日志字段
北京中科新远科技22 分钟前
AI网卡五层检查法:协议、PCIe、NUMA、端口与验收
服务器·网络·人工智能
小苑同学31 分钟前
Introduction怎么写
人工智能