HLS高层次综合设计--axi之burst纠偏

一、问题来源:https://zhuanlan.zhihu.com/p/478941270

二、具体代码

void ReadFeature(ap_uint<64> *feat_map, const TABLE_T *table, const uint32_t table_size,

hls::stream<ap_uint<48>> &feat_word_strm)

{

TABLE_T voxel_pt_num;

TABLE_T pt_id = 0;

for (uint32_t i = 0; i < table_size; ) {

#pragma HLS PIPELINE II=1

#pragma HLS LOOP_TRIPCOUNT min=204800 max=300000 avg=250000

voxel_pt_num = tablei;

// empty voxel

if (voxel_pt_num == 0) {

i++;

pt_id = 0;

}

// non-empty voxel

else {

uint32_t offset = i * 32 + pt_id;

ap_uint<64> feat_word = feat_mapoffset;

feat_word_strm.write(feat_word.range(47, 0).get());

if (pt_id == (voxel_pt_num - 1)) {

pt_id = 0;

i++;

}

else {

pt_id++;

}

}

}

}

三、问题说明

1.这段代码文章博主说不能burst访问;

2.使用了outstanding优化,outstanding从4改为16,问题没有解决

3.使用了latency设置,将AXI的latency设置为40,解决了问题;

四、博主得到的结论是

1.使用指针实现AXI总线的顶层接口(尤其是访问DDR时)务必根据实际需要设置latency,影响巨大。

2.burst访问可以通过在for循环中顺次访问来实现,但是注意地址必须连续且不能在if分支中访问。

3.必要的时候可以使用memcpy来显式地指定burst。

4.希望未来能有某种接口可以独立地控制AXI的AR/AW通道与R/W通道,这样不必根据外部情况指定latency,也不必浪费相应的资源,设计的IP的适配性也更广。

五、说明

1.虽然博主设置axi latency=40解决了问题,但是还是没有本质解决;

2.上述代码就不能这么设计,burst访问不能有条件,这个是基本要求,也就是设计违规了;

六、burst案例一纠正

//////////// ORIGINAL ////////////

#include <ap_int.h>

void foo(ap_int<21> *a, ap_int<21> *b) {

for (long i = 0; i < 256; ++i)

bi = ai;

}

//////////// UPDATED ////////////

// Use 'int' instead of 'ap_int<24>'

void foo(int *a, int *b) {

for (long i = 0; i < 256; ++i)

bi = ai;

}

注意axi总线访问,不能是非32bit或者非64bit的

七、burst案例二纠正

//////////// ORIGINAL ////////////

void foo(volatile int *a, volatile int *b) {

for (long i = 0; i < 256; ++i)

bi = ai;

}

//////////// UPDATED ////////////

void foo(int *a, int *b) {

for (long i = 0; i < 256; ++i)

bi = ai;

}

volatile对总线进行了影响!!

八、burst案例三纠正

//////////// ORIGINAL ////////////

struct mystruct {

char a;

short b;

};

void foo(mystruct *a, mystruct *b) {

for( int i = 0; i < 256; ++i )

bi = ai;

}

//////////// UPDATED ////////////

struct mystruct {

char a;

short b;

} attribute((packed, aligned(4)));

void foo(mystruct *a, mystruct *b) {

for( int i = 0; i < 256; ++i )

bi = ai;

}

九、burst案例四纠正

//////////// ORIGINAL ////////////

void foo(int *a, int *b) {

for (long i = 0; i < 256; ++i)

bi\*4 = ai\*4 ;

}

//////////// UPDATED ////////////

// Use continuous accesses

void foo(int *a, int *b) {

for (long i = 0; i < 256; ++i)

bi = ai ;

}

十、burst案例五纠正

//////////// ORIGINAL ////////////

void foo(int *a) {

int buff256;

for (long i = 0; i < 256; ++i) {

if (i <= 6)

buffi = ai;

...

}

...

}

//////////// UPDATED ////////////

// Remove conditional accesses

void foo(int *a) {

int buff256;

for (long i = 0; i < 7; ++i)

buffi = ai;

for (long i = 0; i < 256; ++i) {

...

}

...

}

十一、burst案例六纠正

constexpr uint64_t N = 64;

//////////// ORIGINAL ////////////

void example(ap_int<24> aN, ap_int<24> bN) {

#pragma HLS INTERFACE m_axi port = a depth = N bundle = gmem0

#pragma HLS INTERFACE m_axi port = b depth = N bundle = gmem1

ap_int<24> buffN;

for (size_t i = 0; i < N; ++i) {

#pragma HLS PIPELINE II = 1

buffi = ai;

buffi = buffi + 100;

bi = buffi;

}

}

//////////// UPDATED ////////////

// Replace with power of 2 bits type.

void example(int aN, int bN) {

#pragma HLS INTERFACE m_axi port = a depth = N bundle = gmem0

#pragma HLS INTERFACE m_axi port = b depth = N bundle = gmem1

int buffN;

for (size_t i = 0; i < N; ++i) {

#pragma HLS PIPELINE II = 1

buffi = ai;

buffi = buffi + 100;

bi = buffi;

}

}

相关推荐
hans汉斯1 小时前
【计算机科学与应用】基于联合熵驱动改进麻雀搜索优化VMD的DAS信号去噪方法
深度学习·算法·yolo·软件工程·汉斯出版社
SunnyDays10111 小时前
如何使用 Python 给 PDF 添加附件:文档附件与附件注释
开发语言·python·pdf
词却1 小时前
机器学习入门:手写数字识别与算法对比
人工智能·算法·机器学习
学逆向的1 小时前
扩展PE头属性说明
开发语言·网络安全·pe
秋名RG1 小时前
Java 基础语法
java·开发语言
码行山野赴时序归途1 小时前
C 语言文件操作完全指南:从打开到关闭
c语言·开发语言
张欣-男1 小时前
3分钟理解线性代数
线性代数·算法
白狐_7981 小时前
408 数据结构|外部排序优化:怎么减少时间开销
数据结构·算法
小白说大模型1 小时前
Hermes 全配置指南:从裸版到 AI Agent 天花板
大数据·人工智能·学习·算法·机器学习·数据挖掘