CN117610626B 基于fpga实现卷积神经网络的软硬件协同加速方法 (浙江大学)_第1页
CN117610626B 基于fpga实现卷积神经网络的软硬件协同加速方法 (浙江大学)_第2页
CN117610626B 基于fpga实现卷积神经网络的软硬件协同加速方法 (浙江大学)_第3页
CN117610626B 基于fpga实现卷积神经网络的软硬件协同加速方法 (浙江大学)_第4页
CN117610626B 基于fpga实现卷积神经网络的软硬件协同加速方法 (浙江大学)_第5页
已阅读5页,还剩16页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

基于FPGA实现卷积神经网络的软硬件协同本发明公开了一种基于FPGA实现卷积神经2续根据需求通过AXI总线传输到FPGA2.根据权利要求1所述的一种基于FPGA实现卷积神经网络的软硬件协同加速方法,其3.根据权利要求1所述的一种基于FPGA实现卷积神经网络的软硬件协同加速方法,其4.根据权利要求1所述的一种基于FPGA实现卷积神经网络的软硬件协同加速方法,其5.根据权利要求1所述的一种基于FPGA实现卷积神经网络的软硬件协同加速方法,其块BRAM来存储该矩阵或相邻的几个元素存入不6.根据权利要求1所述的一种基于FPGA实现卷积神经网络的软硬件协同加速方法,其7.根据权利要求1所述的一种基于FPGA实现卷积神经网络的软硬件协同加速方法,其3出优秀性能的同时,也需要消耗大量计算与存储资源来进行训练与推理。以纽约大学的YannLecun于1998年提出的卷积神经网络LeNet_5为例,这个简单的5层神经网络(不计入[0003]目前对于神经网络的加速主要从软件和硬件两个方面进行。在软件方面,以[0004]在硬件方面,对运行神经网络的基础硬件架构进行优化,提高计算效率。例如[0005]在计算机平台上调用本地GPU资源或者远程服务器资源进行加速一般能够满足需4[0018]进一步地,通过矩阵划分指定矩阵的存储方式包括:将矩阵中元素都存入不同[0019]进一步地,所述对FPGA从缓存中读取并写入数据的络量化通过将网络权重从32位浮点型量化到低比特的定点数(如整型8位)来压缩模型大5[0025]图1是本发明的一种FPGA实现卷积神经网络的软硬件协同加速方法的总览流程64,同样以INT8类型存储,至少需要3.2MB的存储空间。而目前Zynq系列6[0045]前面提到过,在运算过程中某些层的大小可能会超出缓存限制,影响并行性。7化方法为训练后静态量化,量化算法为线性量化,量化精度为整型INT8,量化策略选择[0048]验证过程中要重点考虑参数类型,量化后的参数无法直接在原Pytorch模型中使验时修改代码调用不同网络层IP来实时生成硬件级神经网络。不过这需要额外的AXI总线[0053]软硬件协同设计的第一步是生成前面BaseCNN的硬件电路,目前这方面有一套比供用户接口等软件开发套件的VitisSD8决数据访问与存取之间的冲突问题,下面以图5为例描述更改嵌套循环以实现流水化的方发生冲突;而右侧以对输出Out的数据存取来形象化说明冲突情况。若使用上面的嵌套方后,c加一并改变Out的访问位置,前一个Iteration从Out[0][0][0]开始读取,后一个9例来说,这一过程可以理解为先将数据从片外存储(DRAM)中搬运到速度更快的片上存储[0069]基于HLS的Dtaflow结构,本发明实施例采用Ping_PongBuffer来进行访存流水化,针对输入数据与参数的读写设计存取函数。如图8所示是访存流水化中Ping_Pong仅下降0.71而模型总体存储大小从834KB降低至218KB,将计算量降低了73.9结果见

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论