东方证券计算机行业深度报告详细拆解了DeepSeek-V3和R1的核心技术创新。DeepSeek-V3通过MoE架构(671B参数仅激活37B)、多头潜在注意力(MLA)、FP8精度训练、DualPipe双向流水线、多Token预测(MTP)等系列创新,实现了高性能与低成本的双重突破。R1则通过大规模强化学习探索了推理能力增强的新路径。本文基于东方证券研报,系统解析大模型技术创新的工程细节。
MoE架构——671B参数仅激活37B的秘诀
混合专家系统(MoE)是DeepSeek-V3性价比的核心。MoE将多个小型专家模型组合起来共同完成任务,显著增加模型参数数量而不增加计算量。DeepSeek-V3总参数达671B,但每项任务仅激活37B参数,大大降低了计算成本。
MoE架构的关键在于“术业有专攻”——每个专家模型专注于特定领域的知识,路由器动态选择最合适的专家处理当前输入。DeepSeek进一步优化了MoE负载均衡,确保专家之间的工作量分配合理,避免部分专家过载而部分闲置。这一架构使DeepSeek-V3在用更少计算资源的情况下,达到了稠密模型671B参数相当的性能。
MoE架构的关键在于“术业有专攻”——每个专家模型专注于特定领域的知识,路由器动态选择最合适的专家处理当前输入。DeepSeek进一步优化了MoE负载均衡,确保专家之间的工作量分配合理,避免部分专家过载而部分闲置。这一架构使DeepSeek-V3在用更少计算资源的情况下,达到了稠密模型671B参数相当的性能。
MLA——多头潜在注意力,推理效率的倍增器
多头潜在注意力(MLA)通过低秩键值联合压缩,使模型性能优于传统MHA(多头注意力),同时KV缓存量显著减少。如果以听演讲类比——传统注意力机制需要记录每个时间点的所有细节(就像录音),而MLA只提取关键信息(就像记录重点句子),大幅降低需要记忆的信息量。
MLA的设计使DeepSeek-V3在推理阶段能够以更低的显存占用和更快的速度处理长文本任务。结合MoE架构,DeepSeek-V3实现了生成吐字速度从20TPS大幅提高至60TPS的3倍提升,带来了更加流畅的使用体验。
MLA的设计使DeepSeek-V3在推理阶段能够以更低的显存占用和更快的速度处理长文本任务。结合MoE架构,DeepSeek-V3实现了生成吐字速度从20TPS大幅提高至60TPS的3倍提升,带来了更加流畅的使用体验。
FP8精度+DualPipe——训练效率的双重突破
FP8精度训练是DeepSeek-V3在训练领域的核心创新。将大部分计算密集型操作(如矩阵乘法)使用FP8精度进行,同时保留嵌入层、输出头等关键操作的高精度,使计算速度较BF16方法提升一倍。
DualPipe双向流水线则将模型的不同层分配到不同GPU上进行并行训练,通过双向流水线调度同时处理正向传播和反向传播,从流水线两端同时输入微批次,最大化计算资源利用并减少通信开销。跨节点通信方面,DeepSeek通过高效的跨节点全对全通信内核、通信和计算的重叠等技术,显著提高了通信效率。
DualPipe双向流水线则将模型的不同层分配到不同GPU上进行并行训练,通过双向流水线调度同时处理正向传播和反向传播,从流水线两端同时输入微批次,最大化计算资源利用并减少通信开销。跨节点通信方面,DeepSeek通过高效的跨节点全对全通信内核、通信和计算的重叠等技术,显著提高了通信效率。
R1——强化学习驱动的推理能力跃升
DeepSeek-R1-Zero尝试了不使用监督微调(SFT)、仅采用大规模强化学习(RL)的方式,首次公开证明LLM推理能力可通过纯RL激励实现自我进化。模型的“思考过程”与奖励相互作用——当初始答案未获高奖励时,模型会“回头反省”并修正思路,RL推进中平均响应长度从数百token增长至数千token。
R1则在强化学习之前引入冷启动阶段,通过少量人工设计的CoT数据对基础模型进行初步监督微调,解决纯RL冷启动不稳定问题。训练分为四阶段:冷启动→推理导向的RL→拒绝采样+SFT→全场景RL。这一流程使R1在保持推理能力的同时大幅提升了输出的稳定性和可读性,最终实现比肩OpenAI o1的推理性能。
R1则在强化学习之前引入冷启动阶段,通过少量人工设计的CoT数据对基础模型进行初步监督微调,解决纯RL冷启动不稳定问题。训练分为四阶段:冷启动→推理导向的RL→拒绝采样+SFT→全场景RL。这一流程使R1在保持推理能力的同时大幅提升了输出的稳定性和可读性,最终实现比肩OpenAI o1的推理性能。
| 技术模块 | 核心创新 | 主要效果 |
|---|---|---|
| MoE架构 | 671B总参数,仅激活37B | 训练和推理成本大幅降低 |
| MLA | 低秩键值联合压缩 | KV缓存减少,推理速度3倍提升 |
| FP8精度 | 混合精度训练,核心计算用FP8 | 计算速度较BF16提升一倍 |
| DualPipe | 双向流水线并行 | 减少通信开销,提升训练效率 |
| MTP | 多Token预测 | 增加训练信号密度 |
| R1强化学习 | 纯RL+冷启动+多阶段优化 | 推理能力比肩OpenAI o1 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
信息技术
18页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录