当前位置:首页 > 报告详情

基于 GPU 的数据科学与分析加速库 RAPIDS- 概览与更新.pdf

上传人: li 编号:29484 2021-02-07 68页 39.86MB

1、NVIDIA基于GPU的数据科学与分析加速库RAPIDS概览与更新Sheng Luo#page#WHY GPUS?Numerous hardware advantagesNVIDIADGX A100 System口Thousands of cores with up to -20 TeraFlops of generalpurpose compute performanceUp to 1.5 TB/s of memory bandwidthD皖D0Hardware interconnects for up to 600 GB/s bidirectionalGPU GPU bandwidthCa

2、n scale up to 16x GPUs in a single nodeAlmost never run out of compute relative to memorybandwidth!ZnVIDIA#page#DATA PROCESSING EVOLUTIONFaster Data Access,Less Data MovementHadoop Processing, Reading from DiskHDFSHDFSHDFSHDFSHDFSQuery113ML TrainReadWriteReadWriteRead25-100xImprovementSpark In-Memor

3、y ProcessingLess CodeLanguage FlexiblePrimarily In-MemoryHDFS113QueryML TrainRead5-10x ImprovementTraditional GPU ProcessingMore CodeLanguage RigidCPUCPUSubstantially on GPUHDFSGPUGPUGPLML113WritWrit2uerReadReadReaReaTrain#page#DATA MOVEMENT AND TRANSFORMATIONThe Bane of Productivity and Performance

4、Read DataAPBAPPB100088828CPtAoBCopy&ConvertGPUCPU20Copy&ConvertGPUAPPAAPPALoadData#page#DATA MOVEMENT AND TRANSFORMATIONWhat if We Could Keep Data on the GPU?Read DataAPBAPPB100088828CPtXGPUCPU20opyXConvertGPUAPPAAPPALoadData#page#LEARNING FROM APACHE ARROWPandasIuOSparkParguetHBaseParauetHBaeCassan

5、draKuduCassandraKuduEach system has its own internal memory formatALI systems utilize the same memory format70-80%computationwasted on serialization andNo overhead for cross-system communicationdeserializationProjects can share functionality (eg,Parquet-to-Arrowreader)Similarfuncltiipleprojects#page

6、#DATA PROCESSING EVOLUTIONFaster Data Access,Less Data MovementHDFSHDFSHDFSHDFSHDFS113MLTrainQueryWriteReadReadReadWrite25-100xImprovementLess CodeLanguage FlexibleHDFSPrimarily ln-MemoryML TrainQueryRead5-10x ImprovementTraditional GPU ProcessingMore CodeLanguage RigidCPUCPUGPUGPUHDFSSubstantiatly

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要介绍了RAPIDS,一个开源的端到端GPU加速数据科学平台。RAPIDS包括多个库,如cuDF、cuIO、cuML、cuGraph和cuxfilter,它们分别用于数据分析、数据加载、机器学习、图分析和可视化。RAPIDS可以显著提高数据处理速度,例如,使用cuIO/cuDF进行数据加载和准备,然后使用XGBoost进行机器学习,可以比使用CPU快50-100倍。此外,RAPIDS还支持与PyTorch、TensorFlow等深度学习框架的互操作性,并提供了对Dask的支持,以便在GPU集群上进行扩展。RAPIDS还在多个领域中得到了应用,例如,在网络安全、地震解释和天气分析等领域中,RAPIDS都表现出了出色的性能。
RAPIDS如何实现? 如何在Python中使用RAPIDS进行数据处理? RAPIDS如何帮助企业提高数据处理效率?
客服
商务合作
小程序
服务号
折叠