一种可重构卷积神经网络的PE单元和脉动阵列

专利2026-07-22  7


本技术涉及卷积神经网络领域,特别是指一种可重构卷积神经网络的pe单元和脉动阵列。


背景技术:

1、目前,卷积神经网络发展迅速,在计算机视觉、语音识别、自然语言处理等领域均取得了接近甚至反超人类的表现。但是随着网络识别率的提高,带来的却是更深更复杂的网络结构和更庞大的参数运算量的出现。这就使得神经网络在运算量和运算时间上同样激增。为了处理这方面问题,有人提出了通过神经网络的逐层精度优化来降低计算复杂度,低比特多精度量化参数由此而生。经过实验验证,对于不同网络、不同层的权重位宽存在差异并不会导致网络正确率下跌,因此可以使用较低的数据精度量化来表示不同网络层的权重参数,从而降低计算复杂度和参数存储量,达到神经网络提速的效果。

2、然而,多精度神经网络的计算需要定制的硬件电路来支持,因为单精度处理器在计算混合精度时会浪费大量资源,而多精度神经网络处理器在电路级支持多精度,计算可以得到比单精度处器更高的利用率,但是现有技术中的多精度计算无法平衡低计算成本消耗和更高速度的要求,大部分在低精度下仍然需要将数据位宽向下缩减至更低比特,易导致性能损失。

3、同时,面对神经网络大量数据,如何复用调度数据从而减少数据搬迁量也是一个问题,需要合适的加速计算结果将基本乘法单元有效地组织起来,目前比较主流单精度的加速结构主要有行缓冲、二维阵列、脉动阵列等,都是通过数据复用的方式来减少搬运,但是针对多精度的加速结构却并不完备,复杂的调度形式以及需要兼容不同精度权重的情况使得传统的加速架构在上面并不能通用,会造成效率低下甚至数据出错的情况。

4、因此,现有针对多精度的网络计算硬件存在许多需要改进的地方,设计出一个可以兼容多精度并实现合理数据调度的硬件电路是当下所需。


技术实现思路

1、本实用新型的主要目的在于克服现有技术中的上述缺陷,提出一种可重构卷积神经网络的pe单元,能完成2bit、4bit、6bit低位宽权重卷积神经网络;同时设计了新型脉动阵列,将九个pe单元组合成一组,图像数据横向传输,权重行间循环,计算结果纵向传输,能在一个循环内实现四个8bitx6bit运算,六个8bitx4bit运算或十二个8bitx2bit运算,极大提升了卷积运算的速度。

2、本实用新型采用如下技术方案:

3、一种可重构卷积神经网络的pe单元,包括六个乘法器、五个移位寄存器、两个第一加法器和一个第二加法器;六个所述乘法器并列设置,每个所述乘法器的一输入端输入图像数据,另一输入端输入权重数据;五个所述移位寄存器的输入端与其中五个所述乘法器的输出端相连;其中一所述第一加法器的两输入端分别与其中一组的两所述移位寄存器的输出端相连,另一所述第一加法器的两输入端分别与另一所述移位寄存器的输出端以及未连接所述移位寄存器的所述乘法器的输出端相连;所述第二加法器的两输入端分别连接另一组的两所述移位寄存器的输出端,两所述第一加法器的输出端和所述第二加法器的输出端相连。

4、设置所述pe单元封装后的引脚包括clk端、rst端、data端、weight端、choose端、result端和data_out端,所述clk端用于输入时钟信号,所述rst端用于输入复位信号,所述data端用于输入图像数据,所述weight端用于输入权重数据、所述choose端用于输入权重位宽选择数据、所述result端用于输出图像数据,所述data_out端用于输出计算结果。

5、所述权重位宽选择数据包括有00代表2bit、01代表4bit以及10代表6bit;所述计算结果为8bit位宽,当权重位宽为2bit时,输出七个数据;当权重位宽为4bit时,输出三个数据;当权重位宽为6bit时,输出两个数据。

6、一种多宽位可重构卷积脉动阵列,其特征在于:包括寄存器和若干个所述的一种可重构卷积神经网络的pe单元。

7、包括纵向排列的第一行单元、第二行单元和第三行单元,所述第一行单元、所述第二行单元和所述第三行单元分别设置有三个从左到右排列且相连的所述pe单元,所述第一行单元的每个所述pe单元计算结果级联至第二行单元的对应的所述pe单元,所述第二行单元的每个所述pe单元计算结果级联至第三行单元对应的所述pe单元,所述第三行单元的每个所述pe单元的计算结果传输至所述寄存器进行数据累加后输出。

8、所述图像数据从每一行单元的右侧的所述pe单元流入并且横向传播,权重数据流入每一行单元的三个所述pe单元,所述图像数据和所述权重数据流入所述第二行单元比流入所述第一行单元慢一个时钟周期,所述图像数据和所述权重数据流入所述第三行单元比流入所述第二行单元慢一个时钟周期。

9、所述权重数据为行间循环设置,对于3x3卷积的九个权重数据来说,所述第一行单元按[w1,w2,w3]顺序循环,w1、w2、w3分别表示第一行单元的三个所述pe单元的权重,所述第二行单元按[w4,w5,w6]顺序循环并比所述第一行单元慢一个时钟周期,w4、w5、w6分别表示第二行单元的三个所述pe单元的权重,所述第三行单元按[w7,w8,w9]顺序循环并比所述第二行单元慢一个时钟周期,w7、w8、w9分别表示第三行单元的三个所述pe单元的权重。

10、由上述对本实用新型的描述可知,与现有技术相比,本实用新型具有如下有益效果:

11、本实用新型设计了一种可完成2、4、6bit低位宽权重和固定位宽图像数据的可重构卷积神经网络pe单元,并采用脉动阵列形式传输数据,可以用于3x3神经网络的硬件加速硬件系统中,在满足多位宽运算的条件下提高运算速度。

12、本实用新型的电路结构具有重构性,可以根据输入位宽确定运算模式,兼容2bit、4bit、6bit三种卷积中常见的低bit位宽,并和卷积加速运算中的输出通道并行相结合,可以在一次运算中输出多通道数据结果,极大减少了数据搬运量,提高运算效率。

13、本实用新型采用新型脉动阵列结构替换加法树结构,并将滑动窗和脉动阵列结合起来,处理单元间数据通信距离短,使数据流和控制流的设计,同步控制节省io带宽。



技术特征:

1.一种可重构卷积神经网络的pe单元,其特征在于:包括六个乘法器、五个移位寄存器、两个第一加法器和一个第二加法器;六个所述乘法器并列设置,每个所述乘法器的一输入端输入图像数据,另一输入端输入权重数据;五个所述移位寄存器的输入端与其中五个所述乘法器的输出端相连;其中一所述第一加法器的两输入端分别与其中一组的两所述移位寄存器的输出端相连,另一所述第一加法器的两输入端分别与另一所述移位寄存器的输出端以及未连接所述移位寄存器的所述乘法器的输出端相连;所述第二加法器的两输入端分别连接另一组的两所述移位寄存器的输出端,两所述第一加法器的输出端和所述第二加法器的输出端相连。

2.如权利要求1所述的一种可重构卷积神经网络的pe单元,其特征在于:设置所述pe单元封装后的引脚包括clk端、rst端、data端、weight端、choose端、result端和data_out端,所述clk端用于输入时钟信号,所述rst端用于输入复位信号,所述data端用于输入图像数据,所述weight端用于输入权重数据、所述choose端用于输入权重位宽选择数据、所述result端用于输出图像数据,所述data_out端用于输出计算结果。

3.如权利要求2所述的一种可重构卷积神经网络的pe单元,其特征在于:所述权重位宽选择数据包括有00代表2bit、01代表4bit以及10代表6bit;所述计算结果为8bit位宽,当权重位宽为2bit时,输出七个数据;当权重位宽为4bit时,输出三个数据;当权重位宽为6bit时,输出两个数据。

4.一种多宽位可重构卷积脉动阵列,其特征在于:包括寄存器和若干个权利要求1至3中任一项所述的一种可重构卷积神经网络的pe单元。

5.如权利要求4所述的一种多宽位可重构卷积脉动阵列,其特征在于:包括纵向排列的第一行单元、第二行单元和第三行单元,所述第一行单元、所述第二行单元和所述第三行单元分别设置有三个从左到右排列且相连的所述pe单元,所述第一行单元的每个所述pe单元计算结果级联至第二行单元的对应的所述pe单元,所述第二行单元的每个所述pe单元计算结果级联至第三行单元对应的所述pe单元,所述第三行单元的每个所述pe单元的计算结果传输至所述寄存器进行数据累加后输出。

6.如权利要求5所述的一种多宽位可重构卷积脉动阵列,其特征在于:所述图像数据从每一行单元的右侧的所述pe单元流入并且横向传播,权重数据流入每一行单元的三个所述pe单元,所述图像数据和所述权重数据流入所述第二行单元比流入所述第一行单元慢一个时钟周期,所述图像数据和所述权重数据流入所述第三行单元比流入所述第二行单元慢一个时钟周期。

7.如权利要求5所述的一种多宽位可重构卷积脉动阵列,其特征在于:所述权重数据为行间循环设置,对于3x3卷积的九个权重数据来说,所述第一行单元按[w1,w2,w3]顺序循环,w1、w2、w3分别表示第一行单元的三个所述pe单元的权重,所述第二行单元按[w4,w5,w6]顺序循环并比所述第一行单元慢一个时钟周期,w4、w5、w6分别表示第二行单元的三个所述pe单元的权重,所述第三行单元按[w7,w8,w9]顺序循环并比所述第二行单元慢一个时钟周期, w7、w8、w9分别表示第三行单元的三个所述pe单元的权重。


技术总结
一种可重构卷积神经网络的PE单元和脉动阵列,包括六个乘法器、五个移位寄存器、两个第一加法器和一个第二加法器;六个乘法器并列设置,每个乘法器的一输入端输入图像数据,另一输入端输入权重数据;五个移位寄存器的输入端与其中五个乘法器的输出端相连;其中一第一加法器的两输入端分别与其中一组的两移位寄存器的输出端相连,另一第一加法器的两输入端分别与另一移位寄存器的输出端以及未连接移位寄存器的乘法器的输出端相连;第二加法器的两输入端分别连接另一组的两移位寄存器的输出端,两第一加法器的输出端和第二加法器的输出端相连。本技术能完成2、4、6bit低位宽权重卷积神经网络,新型脉动阵列极大提升了卷积运算的速度。

技术研发人员:王懿瑶,王云峰
受保护的技术使用者:厦门大学
技术研发日:20240228
技术公布日:2024/11/11
转载请注明原文地址: https://tieba.8miu.com/read-22980.html

最新回复(0)