财通证券研究报告深入分析了DeepSeek开源周首日发布的FlashMLA技术。作为专为英伟达Hopper GPU架构设计的高效MLA解码内核,FlashMLA在H800 SXM5平台上实现了惊人的性能——内存受限配置下3000GB/s带宽、计算受限配置下580TFLOPS峰值性能。这一优化建立在DeepSeek独创的MLA(多头潜在注意力)技术基础之上,该技术将KV缓存减少了约93.3%。FlashMLA已投入生产使用,是目前大模型推理效率提升最具代表性的技术突破之一。
MLA技术原理:KV缓存压缩93.3%的创新
MLA(多头潜在注意力)是DeepSeek在DeepSeek-V2及后续模型中引入的核心技术创新。在标准的Transformer架构中,KV缓存是一种内存机制,用于存储表示对话上下文的数据以减少不必要的计算开销。随着序列长度增加和批处理规模扩大,KV缓存占用的内存呈线性增长,成为推理效率的主要瓶颈。
MLA通过低秩近似方法对KV缓存进行压缩。具体而言,它将高维的Key和Value向量通过低秩矩阵投影到潜在空间,大幅减少了存储维度。这一创新使每次查询所需的KV缓存减少了约93.3%。更小的KV缓存意味着更高的内存效率、更大的批处理规模和更快的推理速度。MLA已成为DeepSeek-V2、V3和R1系列模型的核心技术基座,为其高效推理奠定了基础。
MLA通过低秩近似方法对KV缓存进行压缩。具体而言,它将高维的Key和Value向量通过低秩矩阵投影到潜在空间,大幅减少了存储维度。这一创新使每次查询所需的KV缓存减少了约93.3%。更小的KV缓存意味着更高的内存效率、更大的批处理规模和更快的推理速度。MLA已成为DeepSeek-V2、V3和R1系列模型的核心技术基座,为其高效推理奠定了基础。
FlashMLA的技术实现与Hopper GPU优化
FlashMLA是MLA技术针对Hopper GPU架构的工程化实现。它专为处理可变长度序列设计——在同时处理长文本和短文本时,可以精准地为不同长度的文本分配恰当的算力。这种动态资源分配能力对于真实世界的大模型应用至关重要,因为用户输入的序列长度差异极大。
FlashMLA的核心优化包括BF16精度支持和块大小为64的分页KV缓存。BF16(bfloat16)在保留关键精度的同时兼顾了计算速度,是AI训练和推理中广泛采用的精度格式。分页KV缓存将KV缓存按64的块大小进行分页管理,优化了内存分配和回收效率,特别适合变长序列场景。FlashMLA的设计参考了FlashAttention-2、FlashAttention-3以及CUTLASS的技术实现。
FlashMLA的核心优化包括BF16精度支持和块大小为64的分页KV缓存。BF16(bfloat16)在保留关键精度的同时兼顾了计算速度,是AI训练和推理中广泛采用的精度格式。分页KV缓存将KV缓存按64的块大小进行分页管理,优化了内存分配和回收效率,特别适合变长序列场景。FlashMLA的设计参考了FlashAttention-2、FlashAttention-3以及CUTLASS的技术实现。
实测性能数据与硬件利用率分析
经DeepSeek实测,FlashMLA在H800 SXM5平台(CUDA 12.8)上展现出卓越的性能。在内存受限配置下,可达到最高3000GB/s的内存带宽;在计算受限配置下,可达到580TFLOPS的峰值性能。
作为参照,NVIDIA H800 SXM5 GPU的峰值内存带宽为3.35TB/s,峰值算力为990TFLOPS。这意味着FlashMLA将H800的内存带宽利用率推至近90%,计算性能利用率达58.6%。对于大模型推理这类通常受内存带宽限制的工作负载而言,3000GB/s的带宽表现意味着推理吞吐量的大幅提升。网友评价道:“向工程团队致以崇高的敬意,从Hopper的张量核中挤出了每一个FLOP”。
作为参照,NVIDIA H800 SXM5 GPU的峰值内存带宽为3.35TB/s,峰值算力为990TFLOPS。这意味着FlashMLA将H800的内存带宽利用率推至近90%,计算性能利用率达58.6%。对于大模型推理这类通常受内存带宽限制的工作负载而言,3000GB/s的带宽表现意味着推理吞吐量的大幅提升。网友评价道:“向工程团队致以崇高的敬意,从Hopper的张量核中挤出了每一个FLOP”。
| 性能指标 | FlashMLA实测 | H800 SXM5峰值 | 利用率 |
|---|---|---|---|
| 内存带宽 | 3000 GB/s | 3.35 TB/s | ~89.6% |
| 计算性能 | 580 TFLOPS | 990 TFLOPS | ~58.6% |
| KV缓存压缩 | 减少93.3% | — | — |
FlashMLA的产业影响与应用前景
FlashMLA的开源对AI产业具有多重意义。首先,它证明了大模型推理效率仍有巨大的优化空间——通过算法创新(MLA)和工程优化(PTX级调优)的结合,可以在现有硬件上实现数倍的性能提升。其次,开源模式使全球开发者都能受益于这一优化成果,降低了AI应用的门槛。
长江证券研报认为,此次DeepSeek开源代码库将围绕降本增效这一核心,通过开源模式与低成本路径,改变此前“大力出奇迹”——即堆算力、堆数据的AI开发逻辑。FlashMLA已投入生产使用,其在实际部署中的效果验证了MLA技术路线的可行性。对于希望部署大模型的企业和开发者而言,FlashMLA提供了一个可直接使用的、经过生产验证的高效解码方案。
长江证券研报认为,此次DeepSeek开源代码库将围绕降本增效这一核心,通过开源模式与低成本路径,改变此前“大力出奇迹”——即堆算力、堆数据的AI开发逻辑。FlashMLA已投入生产使用,其在实际部署中的效果验证了MLA技术路线的可行性。对于希望部署大模型的企业和开发者而言,FlashMLA提供了一个可直接使用的、经过生产验证的高效解码方案。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
18页
15张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录