您的当前位置:首页 > 标签 > MoE架构MLA技术
计算机行业Deepseek重塑AI时代大模型研发范式:效率革命剑指“暴力计算法则”-250214(19页).pdf
2026 MoE架构与MLA技术:671B参数仅激活37B,KV缓存压缩93.3%|国泰君安
国泰君安研报解析DeepSeek MoE架构使671B参数推理仅激活37B,MLA减少KV缓存93.3%吞吐量提升7倍,无辅助损失负载均衡使GPU利用率升至92%。
 2026-07-30
 计算机产业
 19页
9张图表
数据来源:
计算机行业Deepseek重塑AI时代大模型研发范式:效率革命剑指“暴力计算法则”-250214(19页) 查看报告
国泰君安证券研究所报告对DeepSeek的核心架构创新——MoE(混合专家模型)和MLA(多头潜在注意力)进行了深入技术解析。报告指出DeepSeek通过MoE架构将671B总参数压缩至每次推理仅激活37B参数,通过MLA将KV缓存减少93.3%、吞吐量提升3-7倍。这两大架构创新奠定了DeepSeek效率革命的技术基石,为AI大模型的规模化落地提供了全新路径。

MoE架构:671B参数每次推理仅激活37B

DeepSeek-V3放弃了Dense路线,转而使用MoE路线。MoE由多个子模型(即“专家”)组成,每个专家专门处理输入空间的一个子集。MoE模型包含一个门控网络(或“路由器”),用于选择性地激活给定任务所需的特定专家,而不是为每项任务激活整个神经网络。例如,处理数学问题时激活逻辑推理专家,生成诗歌时激活文学创作专家。

与传统的MoE架构相比,DeepSeekMoE具备更细粒度专家划分,并采用共享专家机制。DeepSeekMoE对专家模块进行更细粒度的划分,降低每一个专家的参数量、增大专家数量,在保持MoE模块参数量及激活参数量不变的同时实现灵活组合多个专家的能力。DeepSeekMoE还把激活专家区分为共享专家和路由专家,减少专家模型间的知识冗余,使模型能够兼具捕捉数据共性和差异性的功能。

DeepSeek-V3包含1个共享专家和256个路由专家,单次推理仅激活8个路由专家,总参数量为671B,实际计算激活参数量降至37B(占比5.5%),相比稠密模型节省87%算力。DeepSeek-V3用14.8万亿高质量多样化token训练,构建出了一个能够超越所有开源模型、直逼GPT-4和Claude-3.5等强大闭源模型的AI系统。

无辅助损失负载均衡算法使GPU利用率升至92%

负载均衡是MoE模型训练的核心挑战。在MoE模型的训练过程中,采用的专家并行机制将不同的专家模块放到不同的显卡上来加速训练,而负载均衡问题则会导致更重要的专家模块计算量更大,最终使不重要的专家模块所在的显卡未被充分使用。

DeepSeek-V2引入了额外的损失函数,即设备级平衡损失和通信平衡损失,让模型在训练中自行调控设备间的平衡。DeepSeek-V3额外引入了一种无辅助损失的负载均衡策略,通过损失函数惩罚负载不均衡,确保各专家激活频率接近,且该策略不会导致模型性能的额外损耗。实验显示该算法使GPU利用率从65%提升至92%,大幅提升了显存利用效率和训练速度。

MLA架构:KV缓存压缩93.3%,吞吐量提升7倍

MLA(多头潜在注意力)是对Transformer模型中多头注意力结构的创新优化。大模型常用的优化算法KV-cache显存占用很高,MLA通过低秩联合压缩键值方法实现瘦身,将原本庞大的键值矩阵压缩成一个较小的潜在向量。

实验显示DeepSeek在采用此技术后KV缓存大小减少了93.3%,数据读取和处理量大幅减少,推理速度显著提升,相对基准系统吞吐量提升3-7倍。计算复杂度降低使模型在处理长序列数据时优势尽显,能高效理解长篇文章、迅速而有逻辑地生成文本。与DeepSeek 67B相比,MLA使DeepSeek-V2节省42.5%的训练成本,减少了93.3%的KV Cache,最大生成吞吐量提高5.76倍。

GRPO强化学习算法驱动推理能力自主进化

DeepSeek-R1的核心创新在于训练范式的重塑。传统LLM训练方式为监督学习(SFT),让模型跟着数据学生成。R1采用强化学习(RL)方法,让模型与环境互动,通过互动结果进行打分从而训练模型。R1采用的GRPO算法并不需要一个庞大的人类标注数据库,训练方式简单:让模型自己生成过程,最后只检查结果是否正确。

DeepSeek团队通过混合训练框架攻克纯RL模型的局限性。首阶段基于纯GRPO训练的R1-Zero模型在围棋等任务中实现零知识冷启动并超越人类水平。团队将R1-Zero输出的低质量CoT作为“冷启动种子数据”,对V3基座模型进行SFT。这一“RL-SFT数据闭环”本质是自动化能力蒸馏,通过RL模型自产数据反哺基座模型,形成“数据质量-模型能力”的螺旋上升。在AIME 2024数学测试中,R1-Zero准确率从15.6%跃升至86.7%,接近o1-0912水平。
架构关键指标效果
DeepSeekMoE总参数671B,激活参数37B激活占比5.5%,节省87%算力
共享/路由专家1个共享专家+256个路由专家单次推理激活8个路由专家
负载均衡无辅助损失策略GPU利用率65%→92%
MLA低秩联合压缩KVKV缓存减少93.3%
MLA吞吐量相对基准提升3-7倍
MLA训练成本对比DeepSeek 67B节省42.5%
客服
商务合作
小程序
服务号
折叠