当前位置:首页 > 报告详情

OpenGeMM:一款高利用率的 GeMM 加速器生成器具有轻量级 RISC-V 控制和紧密内存耦合.pdf

上传人: 芦苇 编号:651783 2025-05-01 51页 2.26MB

1、1OpenGeMM:A High-Utilization GeMM Accelerator Generator with Lightweight RISC-V Control and Tight Memory CouplingASP-DAC 2025Xiaoling Yi1,Ryan Antonio1,Joren Dumoulin1,Jiacong Sun1,Josse Van Delm1,Guilherme Paim1,2,Marian Verhelst11MICAS-ESAT,KU Leuven,Belgium,2INESC-ID,Instituto Superior Tcnico,Uni

2、versidade de Lisboa,Portugal23rdJanuary 2025Outline Edge AI Computing Background and MotivationOpenGeMM System ArchitectureOverviewGeMM Accelerator GeneratorMechanisms for High UtilizationReusability and Flexibility SummaryExperimental Results and SotA ComparisonConclusion and Future Work2Edge AI Co

3、mputing-NecessityDNN models become pervasive while evolving rapidly3Image ClassificationVideo GenerationLanguage AssistanceIntelligent RoboticsModel size of language modelsEdge AI Computing-NecessityDNN models become pervasive while evolving rapidlyEdge DNN deployment challenges1)High performance an

4、d energy efficiencyReal-time applicationLow battery capacity 4Edge AI Computing-NecessityDNN models become pervasive while evolving rapidlyEdge DNN deployment challenges1)High performance and energy efficiency2)FlexibilityReusable across DNN models5Edge AI Computing-NecessityDNN models become pervas

5、ive while evolving rapidlyEdge DNN deployment challenges1)High performance and energy efficiency2)Flexibility3)UnderutilizationLow effective computation6Edge AI Computing SotA WorksEfficiency vs.Flexibility/Reusability 7DSAs:NVDLA 1DepFiN 3Programmable platforms:CPUs/GPUs/FPGAEffi.Flex.Low efficienc

6、y and high control overheadReusable for diverse workloadsHigher flexibilityHigher efficiencyTailored to specific workloads Limited reusability and programmabilityEdge AI Computing SotA WorksEfficiency vs.Flexibility/Reusability 8RISC-V AI platforms:Gemmini 2,RedMule 3Flexible GeMM acceleratorEffi.Fl

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文介绍了一种名为OpenGeMM的GeMM加速器生成平台,旨在针对边缘AI应用。OpenGeMM系统架构包括可编程的GeMM硬件生成器、轻量级的RISC-V处理器和紧密集成的内存子系统。该平台通过三种机制实现高硬件利用率:配置预加载、输入预取和输出缓冲、以及可编程的步进内存访问。实验结果显示,OpenGeMM在配置预加载、输入预取和输出缓冲、以及步进内存访问方面分别提高了1.4倍、2.02倍和1.18倍的性能。在实际DNN模型测试中,OpenGeMM在时空利用率方面达到了93.74%-99.80%,在空间利用率方面达到了87.36%-99.54%。与现有技术相比,OpenGeMM在利用率方面具有显著优势,例如,与Gemmini相比,提高了3.75倍至16.40倍的性能。总体而言,OpenGeMM是一个开源的GeMM加速器平台,具有高效率和灵活性,适用于边缘AI计算。
"OpenGeMM如何提高矩阵乘法加速器的利用率?" "OpenGeMM架构中,如何实现高效的内存访问?" "使用OpenGeMM加速器时,如何优化深度学习神经网络的性能?"
客服
商务合作
小程序
服务号
折叠