当前位置:首页 > 报告详情

长文本大模型推理实践——以 KVCache 为中心的分离式推理架构 .pdf

上传人: 张** 编号:175752 2024-09-09 46页 3.87MB

1、长文本大模型推理实践长文本大模型推理实践以以 KVCache 为中心的分离为中心的分离式推理架构式推理架构演讲人:唐飞虎月之暗面 研发工程师 开发者关系负责人目录01长文本推理的瓶颈02长文本推理的优化0304上下文缓存的应用Mooncake 的实践长文本推理的瓶颈RAGPros.无需额外训练速度快成本低工程方案成熟可设计多级检索方案Cros.Embedding 召回效果直接影响模型回答效果无法处理复杂逻辑对多模态支持不足Long-ContextPros.无需额外训练上下文兼顾更全面可处理复杂逻辑和依赖Cros.贵且慢长度有限Long-ContextPros.无需额外训练上下文兼顾更全面可处理

2、复杂逻辑和依赖Cros.贵且慢长度有限长文本长文本:有点贵有点贵长文本长文本:有点慢有点慢Long-Context 性能瓶颈并发性能随着上下文长度的增加而反比下降。预填充延迟随上下文长度的增长而呈平方级别的增长。解码延迟和上下文切换开销随上下文长度的增加而线性增加。Long-Context 性能瓶颈并发性能随着上下文长度的增加而反比下降。预填充延迟随上下文长度的增长而呈平方级别的增长。解码延迟和上下文切换开销随上下文长度的增加而线性增加。长文本推理的优化Long-Context 推理优化硬件 A100 Memory Hierarchy机器学习工程 FlashAttention vLLM模型架构

3、 MoE Speculative DecodingLong-Context 推理优化LayerConfident Adaptive Language Modeling,2022CoLT5:Faster Long-Range Transformers with Conditional Computation,2023LayerSkip:Enabling Early Exit Inference and Self-Speculative Decoding,2024You Only Cache Once:Decoder-Decoder Architectures for Language Model

4、s,2024HeadGQA:Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints,2023Long-Context 推理优化HeadRetrieval Head Mechanistically Explains Long-Context Factuality,2024DeepSeek-V2:A Strong,Economical,and Efficient Mixture-of-Experts Language Model,2024HidenKIVI:A Tuning-Free Asymm

5、etric 2bit Quantization for KV Cache,2024WKVQuant:Quantizing Weight and Key/Value Cache for Large Language Models Gains More,2024Long-Context 推理优化TokenH2O:Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models,2023Model Tells You What to Discard:Adaptive KV Cache Compression

6、 for LLMs,2023Dynamic Memory Compression:Retrofitting LLMs for Accelerated Inference,2024SnapKV:LLM Knows What You are Looking for Before Generation,2024TriForce:Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding,2024Mooncake 的实践一些基本概念Prefill:在预填充阶段。每个新 Token 都取

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要介绍了长文本大模型推理实践以及上下文缓存的应用。在长文本推理的瓶颈部分,文中提到了目前长文本推理存在的问题,如RAG和Long-Context模型的优缺点。在长文本推理的优化部分,详细介绍了硬件、机器学习工程和模型架构方面的优化方法。文中提到了Mooncake的实践,Mooncake是一种以KVCache为中心的分离式推理架构,通过将Prefill、Decode阶段分开处理,优化了GPU资源的利用和成本。最后,文中介绍了上下文缓存的应用,以及Mooncake的收费模式和适用场景。
"长文本推理如何优化?" "KVCache在长文本推理中的作用是什么?" "如何通过Context Caching降低长文本推理成本?"
客服
商务合作
小程序
服务号
折叠