国泰君安证券研究所报告对DeepSeek的核心架构创新——MoE(混合专家模型)和MLA(多头潜在注意力)进行了深入技术解析。报告指出DeepSeek通过MoE架构将671B总参数压缩至每次推理仅激活37B参数,通过MLA将KV缓存减少93.3%、吞吐量提升3-7倍。这两大架构创新奠定了DeepSeek效率革命的技术基石,为AI大模型的规模化落地提供了全新路径。
MoE架构:671B参数每次推理仅激活37B
DeepSeek-V3放弃了Dense路线,转而使用MoE路线。MoE由多个子模型(即“专家”)组成,每个专家专门处理输入空间的一个子集。MoE模型包含一个门控网络(或“路由器”),用于选择性地激活给定任务所需的特定专家,而不是为每项任务激活整个神经网络。例如,处理数学问题时激活逻辑推理专家,生成诗歌时激活文学创作专家。
与传统的MoE架构相比,DeepSeekMoE具备更细粒度专家划分,并采用共享专家机制。DeepSeekMoE对专家模块进行更细粒度的划分,降低每一个专家的参数量、增大专家数量,在保持MoE模块参数量及激活参数量不变的同时实现灵活组合多个专家的能力。DeepSeekMoE还把激活专家区分为共享专家和路由专家,减少专家模型间的知识冗余,使模型能够兼具捕捉数据共性和差异性的功能。
DeepSeek-V3包含1个共享专家和256个路由专家,单次推理仅激活8个路由专家,总参数量为671B,实际计算激活参数量降至37B(占比5.5%),相比稠密模型节省87%算力。DeepSeek-V3用14.8万亿高质量多样化token训练,构建出了一个能够超越所有开源模型、直逼GPT-4和Claude-3.5等强大闭源模型的AI系统。
与传统的MoE架构相比,DeepSeekMoE具备更细粒度专家划分,并采用共享专家机制。DeepSeekMoE对专家模块进行更细粒度的划分,降低每一个专家的参数量、增大专家数量,在保持MoE模块参数量及激活参数量不变的同时实现灵活组合多个专家的能力。DeepSeekMoE还把激活专家区分为共享专家和路由专家,减少专家模型间的知识冗余,使模型能够兼具捕捉数据共性和差异性的功能。
DeepSeek-V3包含1个共享专家和256个路由专家,单次推理仅激活8个路由专家,总参数量为671B,实际计算激活参数量降至37B(占比5.5%),相比稠密模型节省87%算力。DeepSeek-V3用14.8万亿高质量多样化token训练,构建出了一个能够超越所有开源模型、直逼GPT-4和Claude-3.5等强大闭源模型的AI系统。
无辅助损失负载均衡算法使GPU利用率升至92%
负载均衡是MoE模型训练的核心挑战。在MoE模型的训练过程中,采用的专家并行机制将不同的专家模块放到不同的显卡上来加速训练,而负载均衡问题则会导致更重要的专家模块计算量更大,最终使不重要的专家模块所在的显卡未被充分使用。
DeepSeek-V2引入了额外的损失函数,即设备级平衡损失和通信平衡损失,让模型在训练中自行调控设备间的平衡。DeepSeek-V3额外引入了一种无辅助损失的负载均衡策略,通过损失函数惩罚负载不均衡,确保各专家激活频率接近,且该策略不会导致模型性能的额外损耗。实验显示该算法使GPU利用率从65%提升至92%,大幅提升了显存利用效率和训练速度。
DeepSeek-V2引入了额外的损失函数,即设备级平衡损失和通信平衡损失,让模型在训练中自行调控设备间的平衡。DeepSeek-V3额外引入了一种无辅助损失的负载均衡策略,通过损失函数惩罚负载不均衡,确保各专家激活频率接近,且该策略不会导致模型性能的额外损耗。实验显示该算法使GPU利用率从65%提升至92%,大幅提升了显存利用效率和训练速度。
MLA架构:KV缓存压缩93.3%,吞吐量提升7倍
MLA(多头潜在注意力)是对Transformer模型中多头注意力结构的创新优化。大模型常用的优化算法KV-cache显存占用很高,MLA通过低秩联合压缩键值方法实现瘦身,将原本庞大的键值矩阵压缩成一个较小的潜在向量。
实验显示DeepSeek在采用此技术后KV缓存大小减少了93.3%,数据读取和处理量大幅减少,推理速度显著提升,相对基准系统吞吐量提升3-7倍。计算复杂度降低使模型在处理长序列数据时优势尽显,能高效理解长篇文章、迅速而有逻辑地生成文本。与DeepSeek 67B相比,MLA使DeepSeek-V2节省42.5%的训练成本,减少了93.3%的KV Cache,最大生成吞吐量提高5.76倍。
实验显示DeepSeek在采用此技术后KV缓存大小减少了93.3%,数据读取和处理量大幅减少,推理速度显著提升,相对基准系统吞吐量提升3-7倍。计算复杂度降低使模型在处理长序列数据时优势尽显,能高效理解长篇文章、迅速而有逻辑地生成文本。与DeepSeek 67B相比,MLA使DeepSeek-V2节省42.5%的训练成本,减少了93.3%的KV Cache,最大生成吞吐量提高5.76倍。
GRPO强化学习算法驱动推理能力自主进化
DeepSeek-R1的核心创新在于训练范式的重塑。传统LLM训练方式为监督学习(SFT),让模型跟着数据学生成。R1采用强化学习(RL)方法,让模型与环境互动,通过互动结果进行打分从而训练模型。R1采用的GRPO算法并不需要一个庞大的人类标注数据库,训练方式简单:让模型自己生成过程,最后只检查结果是否正确。
DeepSeek团队通过混合训练框架攻克纯RL模型的局限性。首阶段基于纯GRPO训练的R1-Zero模型在围棋等任务中实现零知识冷启动并超越人类水平。团队将R1-Zero输出的低质量CoT作为“冷启动种子数据”,对V3基座模型进行SFT。这一“RL-SFT数据闭环”本质是自动化能力蒸馏,通过RL模型自产数据反哺基座模型,形成“数据质量-模型能力”的螺旋上升。在AIME 2024数学测试中,R1-Zero准确率从15.6%跃升至86.7%,接近o1-0912水平。
DeepSeek团队通过混合训练框架攻克纯RL模型的局限性。首阶段基于纯GRPO训练的R1-Zero模型在围棋等任务中实现零知识冷启动并超越人类水平。团队将R1-Zero输出的低质量CoT作为“冷启动种子数据”,对V3基座模型进行SFT。这一“RL-SFT数据闭环”本质是自动化能力蒸馏,通过RL模型自产数据反哺基座模型,形成“数据质量-模型能力”的螺旋上升。在AIME 2024数学测试中,R1-Zero准确率从15.6%跃升至86.7%,接近o1-0912水平。
| 架构 | 关键指标 | 效果 |
|---|---|---|
| DeepSeekMoE | 总参数671B,激活参数37B | 激活占比5.5%,节省87%算力 |
| 共享/路由专家 | 1个共享专家+256个路由专家 | 单次推理激活8个路由专家 |
| 负载均衡 | 无辅助损失策略 | GPU利用率65%→92% |
| MLA | 低秩联合压缩KV | KV缓存减少93.3% |
| MLA吞吐量 | 相对基准提升 | 3-7倍 |
| MLA训练成本 | 对比DeepSeek 67B | 节省42.5% |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
19页
9张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录