Winograd卷積應用(NEON 和 SSE 對應指令)

用矩陣乘法(im2col+sgemm)的方式卷積,雖然速度很算可以,但非常費內存,不能應用大一點的圖片。

看了一些博客說到Winograd卷積,比上面的速度更快,用到內存更小,也來試試。

下載FeatherCNN
地址:http://github.com/tencent/FeatherCNN

然後,把一些NEON指令改爲SSE指令就可以運行了。


這裏是一部分對應項:

//#include 
arm_neon.h;pmmintrin.h//vs9.0(2008)
arm_neon.h;immintrin.h//vs10(2010)

float32x2_t;__m64
float32x4_t;__m128
float32x4x2_t;__m256
//如沒有 __m256,則
typedef struct float32x4x2_t
{
  __m128 val[2];
} float32x4x2_t;

// 賦初值0
vdupq_n_f32(0.f);_mm_setzero_ps();
//賦初值 非0
vdupq_n_f32;_mm_set1_ps

//load outptr地址起始的4個float數據到_sum1
vld1q_f32;_mm_load_ps 

//融合倍增累加:vfma->r=a+b*c
vfmaq_f32(a, b, c);_mm_add_ps(a,_mm_mul_ps(b, c));

//將_sum中四個float32,賦值給以outptr爲起始地址的4個float32
vst1q_f32;_mm_store_ps

+;_mm_add_ps//m3 = _mm_add_ps(m1, m2);// m3 = m1 + m2

-;_mm_sub_ps

*;_mm_mul_ps//m1 = _mm_mul_ps(*pSrc1, *pSrc1);// m1 = *pSrc1 * *pSrc1

/;_mm_div_ps

 

發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章