当前位置:首页 > 报告详情

杨国强-以卓越性价比释放开放大模型潜能:TPU 上的推理优化全解.pdf

上传人: b**** 编号:890161 2025-08-24 38页 4.30MB

1、以卓越性价比释放开放大模型潜能TPU 上的推理优化全解杨国强:谷歌云/AI Infra 架构师目录01TPU TPU 简介与版本演进TPU TPU 的演进02在 TPU TPU 上部署开放模型的关键技术HTTP/gRPC responseHardware(TPU)Inference ServerQueryQueueSchedulerInference EngineBatchingModelQueryResponseUserApplicationMetricsQueryHTTP/gRPC request推理架构图(框架:vllm/vllm/Max*/Max*/JetStream/JetStrea

2、m/PathwaysPathways)PyTorch Based LLM(llama,DeepSeek)vllmJAX Based LLM(Gemma)Jetstream(MaxText)DiffusionMaxDiffusion目标:优化 KV 缓存内存利用率,实现高吞吐量模型服务洞见:使用虚拟内存分页以减少内存浪费vllmvllm 简介vllm on TPU vllm on TPU 时间线新特性:Executor PerformancePrefillPrefillDecodeDecodePrefill token redundancyMulti-query Attention(TPU-fr

3、iendly)Prefix cachingNo parallelism in prefill/decodeRagged Paged Attention(TPU-friendly)Chunked prefillBottleneckOptimizationBenefitSlow KV cache writesSparsecore offload+Cache Layout RedesignFaster prefill/decodeAvailableAvailableAvailableMulti-Lora+Prometheus MetricsMultimodal model supportV1 ref

4、actorAvailableAvailableAvailableAvailableQuantized modelsAvailableAPC APC(自动前缀缓存)重复利用先前生成的计算结果,消除冗余处理。缓存在分层的内存中(HBM/主机内存)。典型的应用场景:多轮对话,针对技术文档/书籍或者视频的重复问答针对常见提示词前缀的重复请求减小 TTFT 提高吞吐量并最终达到降本增效的目的缓存命中的业务场景下显著提升系统吞吐量https:/ Prefill)(Chunked Prefill)连续批处理(Continuous Batching)(Continuous Batching)03TPUTPU

5、硬件特性和 GPU GPU 有什么不同v6e pod v6e pod 支持万亿规模参数模型Googles highGoogles high-speed speed interconnectinterconnect makesmakesCloud TPU Pods AI SupercomputerCloud TPU Pods AI SupercomputerAs easy as using a single computerAll-reduceby hardware16 chips16 chipsVersatile and high performance model servingVersat

6、ile and high performance model servingRange of shapes to match model size and complexity*Google Internal Data.August 2023.Batch size=1.Multi-head attention based decoder only language models:prefix length=2048,decode steps=256,beam size=32 for samplingVM ShapeVM Shape12x22x44x44x88x88x1616x16Chips/S

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
全文主要介绍了TPU(Tensor Processing Unit)在深度学习中的应用,特别是其在开放大模型推理优化方面的潜力。以下是关键点: 1. **TPU演进与关键技术**:TPU经历了多个版本演进,支持多种开放模型部署,如vllm、MaxText、Diffusion Max等。 2. **推理优化**:通过优化KV缓存内存利用率和使用虚拟内存分页,实现高吞吐量模型服务。 3. **TPU硬件特性**:TPU与GPU相比,具有更高的性能和能效,支持万亿规模参数模型。 4. **TPU软件框架**:PyTorch和JAX等框架在TPU上的优化,如XLA HLO优化和pallas算子优化。 5. **案例分享**:通过Diffusion模型案例展示了TPU在文生图等应用中的优势。 6. **总结**:TPU在深度学习领域具有独特优势,适用于多种AI应用场景。
揭秘高效推理全解" MaxDiffusion部署指南" TPU硬件特性解析"
客服
商务合作
小程序
服务号
折叠