当前位置:首页 > 报告详情

2025年NVIDIA AI研发技术开放日主题演讲PPT(206页).pdf

上传人: YY 编号:723545 2025-07-02 206页 12.56MB

下载:

1、主主 题题 演演 讲讲时间时间主题主题演讲人演讲人13:30-13:40开场致辞开场致辞李曦鹏李曦鹏13:40-14:20GPU 编程和优化编程和优化 最佳实践分享最佳实践分享刘冰刘冰/郑鹏郑鹏14:20-14:50在在NVIDIA NeMo中实现大语言模型全周期开发中实现大语言模型全周期开发 以以LLaMa2为例为例 姚鑫姚鑫/颜子杰颜子杰14:50-15:20TensorRT Hackathon 2023 总结总结AIGC及大语言模型推理的典型案例深入解析及大语言模型推理的典型案例深入解析季光季光/陈庾陈庾15:20-15:40向量数据库的加速策略和实战向量数据库的加速策略和实战王雍王雍/

2、张静蓉张静蓉15:40-16:00推荐系统的最新优化策略和实践推荐系统的最新优化策略和实践 以以HPS为例为例魏英灿魏英灿/王泽寰王泽寰分组讨论及答疑分组讨论及答疑分组分组主题主题位置位置答疑专家答疑专家1GPU 专家专家:Tensor Core 编程答疑编程答疑 Nsight 示例解析示例解析悦府悦府 10厅厅刘冰刘冰/郑鹏郑鹏/郁凡郁凡/王猛王猛2大语言模型训练大语言模型训练:大语言模型资源分析大语言模型资源分析NVIDIA NeMo 代码代码解析解析悦府悦府 11厅厅颜子杰颜子杰/陶砺陶砺/姚鑫姚鑫3TRT LLM 以及扩散模型以及扩散模型:TRT LLM 代码解析代码解析demoDif

3、fusion 代码解析代码解析悦府悦府 12厅厅季光季光/薛博阳薛博阳/陈庾陈庾/方杰方杰4向量数据库向量数据库:Top-k 答疑答疑RAFT深入讨论深入讨论开放区开放区 左侧左侧(悦府悦府 12厅对面)厅对面)王雍王雍/张静蓉张静蓉/董建兵董建兵5推荐系统的训练与推理推荐系统的训练与推理开放区开放区 右侧右侧(悦府悦府 10厅对面)厅对面)魏英灿魏英灿/王泽寰王泽寰/张耀斌张耀斌/孙凯孙凯欢 迎 致 辞李 曦 鹏NVIDIA 开发与技术部 亚太区总经理GPU 编程和优化 最佳实践分享刘 冰&郑 鹏7GPU 编程和优化 最佳实践分享Petrick Liu 刘冰,Devtech|Perkz Zh

4、eng 郑鹏,Devtech 8CUDA Optimization FundamentalsUnderstand what is Global Memory Coalesced AccessUnderstand what is Shared Memory Bank ConflictWhat are ILP and TLPCase StudyWhy fuse the MHAFMHA as exampleAgenda9CUDA Optimization FundamentalsUnderstand what is Understand what is Global Global Memory Me

5、mory Coalesced AccessCoalesced AccessUnderstand what is Shared Memory Bank ConflictWhat are ILP and TLPCase StudyWhy fuse the MHAFMHA as exampleAgenda10GPU ArchitectureGPU:Massive Throughput Machine,Keep the Throughput Maximumfull GH100 with 144 SMsGH100 streaming multiprocessorH100 SXM5:DRAM:3352 G

6、B/sFP32 non-Tensor:66.9 TFLOPSFP16 dense-Tensor:984.9 TFLOPSFP8 dense-Tensor:1978.9 TFLOPS11Understand what is Global Memory Coalesced AccessTypical Example Global memory loads and stores by threads of A Warp are coalesced by the device into as few as possible transactions.Access unit is 32-byte(Als

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
根据报告的内容,本文主要涵盖以下关键点: 1. NVIDIA NeMo框架支持LLaMA模型的全周期开发,包括预训练、微调和推理加速。LLaMA-7B在H100上使用TensorRT加速后,生成速度提升3.96倍。 2. TensorRT Hackathon 2023总结,共729支队伍参赛,40支队伍进入复赛。复赛作品质量极高,部分可集成到TensorRT-LLM。LLaMA-7B使用TensorRT加速后,生成速度提升3.96倍。 3. 使用RAPIDS RAFT加速向量数据库,支持多种近似最近邻搜索算法,如IVF-Flat、IVF-PQ、CAGRA等。在1亿向量上,IVF-PQ搜索速度比暴力搜索快100倍。 4. HPS是一个为推荐系统设计的参数服务器,支持分层存储和高效的缓存。在Criteo数据集上,HPS比CPU工作流快2.5倍。 5. 文章还介绍了GPU编程优化、向量数据库加速策略、推荐系统优化策略等。
如何在NVIDIA NeMo中实现LLaMA全周期开发? 如何使用TensorRT加速LLaMA推理? 如何优化向量数据库的加速策略?
客服
商务合作
小程序
服务号
折叠