您的当前位置:首页 > 标签 > 大模型技术创新
【东方证券】计算机行业深度报告:DeepSeek惊艳世界,算力与应用将迎来结构性变化-250204(18页).pdf
大模型技术创新:MoE+MLA+FP8,DeepSeek架构突破分析|东方证券
东方证券DeepSeek报告解析技术创新:MoE架构671B仅激活37B、MLA降低KV缓存、FP8精度训练提速一倍、多Token预测和R1强化学习,深度拆解低成本高性能背后的工程突破。
 2026-07-30
 信息技术
 18页
1张图表
数据来源:
【东方证券】计算机行业深度报告:DeepSeek惊艳世界,算力与应用将迎来结构性变化-250204(18页) 查看报告
东方证券计算机行业深度报告详细拆解了DeepSeek-V3和R1的核心技术创新。DeepSeek-V3通过MoE架构(671B参数仅激活37B)、多头潜在注意力(MLA)、FP8精度训练、DualPipe双向流水线、多Token预测(MTP)等系列创新,实现了高性能与低成本的双重突破。R1则通过大规模强化学习探索了推理能力增强的新路径。本文基于东方证券研报,系统解析大模型技术创新的工程细节。

MoE架构——671B参数仅激活37B的秘诀

混合专家系统(MoE)是DeepSeek-V3性价比的核心。MoE将多个小型专家模型组合起来共同完成任务,显著增加模型参数数量而不增加计算量。DeepSeek-V3总参数达671B,但每项任务仅激活37B参数,大大降低了计算成本。

MoE架构的关键在于“术业有专攻”——每个专家模型专注于特定领域的知识,路由器动态选择最合适的专家处理当前输入。DeepSeek进一步优化了MoE负载均衡,确保专家之间的工作量分配合理,避免部分专家过载而部分闲置。这一架构使DeepSeek-V3在用更少计算资源的情况下,达到了稠密模型671B参数相当的性能。

MLA——多头潜在注意力,推理效率的倍增器

多头潜在注意力(MLA)通过低秩键值联合压缩,使模型性能优于传统MHA(多头注意力),同时KV缓存量显著减少。如果以听演讲类比——传统注意力机制需要记录每个时间点的所有细节(就像录音),而MLA只提取关键信息(就像记录重点句子),大幅降低需要记忆的信息量。

MLA的设计使DeepSeek-V3在推理阶段能够以更低的显存占用和更快的速度处理长文本任务。结合MoE架构,DeepSeek-V3实现了生成吐字速度从20TPS大幅提高至60TPS的3倍提升,带来了更加流畅的使用体验。

FP8精度+DualPipe——训练效率的双重突破

FP8精度训练是DeepSeek-V3在训练领域的核心创新。将大部分计算密集型操作(如矩阵乘法)使用FP8精度进行,同时保留嵌入层、输出头等关键操作的高精度,使计算速度较BF16方法提升一倍。

DualPipe双向流水线则将模型的不同层分配到不同GPU上进行并行训练,通过双向流水线调度同时处理正向传播和反向传播,从流水线两端同时输入微批次,最大化计算资源利用并减少通信开销。跨节点通信方面,DeepSeek通过高效的跨节点全对全通信内核、通信和计算的重叠等技术,显著提高了通信效率。

R1——强化学习驱动的推理能力跃升

DeepSeek-R1-Zero尝试了不使用监督微调(SFT)、仅采用大规模强化学习(RL)的方式,首次公开证明LLM推理能力可通过纯RL激励实现自我进化。模型的“思考过程”与奖励相互作用——当初始答案未获高奖励时,模型会“回头反省”并修正思路,RL推进中平均响应长度从数百token增长至数千token。

R1则在强化学习之前引入冷启动阶段,通过少量人工设计的CoT数据对基础模型进行初步监督微调,解决纯RL冷启动不稳定问题。训练分为四阶段:冷启动→推理导向的RL→拒绝采样+SFT→全场景RL。这一流程使R1在保持推理能力的同时大幅提升了输出的稳定性和可读性,最终实现比肩OpenAI o1的推理性能。
DeepSeek-V3核心技术创新概览
技术模块核心创新主要效果
MoE架构671B总参数,仅激活37B训练和推理成本大幅降低
MLA低秩键值联合压缩KV缓存减少,推理速度3倍提升
FP8精度混合精度训练,核心计算用FP8计算速度较BF16提升一倍
DualPipe双向流水线并行减少通信开销,提升训练效率
MTP多Token预测增加训练信号密度
R1强化学习纯RL+冷启动+多阶段优化推理能力比肩OpenAI o1
客服
商务合作
小程序
服务号
折叠