源达信息证券研究所报告深入剖析了DeepSeek在训练成本优化上的技术突破。DeepSeek-V3通过MoE混合专家架构、MLA多头潜在注意力、FP8混合精度训练、DualPipe流水线并行等创新,将训练成本降至557万美元,仅为Llama 3的约7%、GPT-4o的约1/14。DeepSeek-V3是官方认可唯一进入“最佳性价比”三角区的模型,以极低成本实现了与行业巨头相媲美的模型性能。这些创新共同构建了对“算力军备竞赛”发展路径的系统性颠覆。
MoE架构:671B参数每次推理仅激活37B
DeepSeek-V3放弃了Dense路线,使用MoE路线。MoE由多个子模型(“专家”)组成,每个专家专门处理输入空间的一个子集。门控网络选择性地激活特定专家而非整个神经网络。DeepSeekMoE具备更细粒度专家划分,采用共享专家机制,降低每个专家参数量、增大专家数量。共享专家捕捉共性,路由专家处理差异性,提高泛化能力和适应性。
DeepSeek-V3包含1个共享专家和256个路由专家,单次推理仅激活8个路由专家。总参数量671B,实际激活参数量37B(占比5.5%),相比稠密模型节省87%算力。无辅助损失的负载均衡策略确保各专家激活频率接近,不会导致性能额外损耗,GPU利用率从65%提升至92%。DeepSeek-V3用14.8万亿高质量token训练,构建出超越所有开源模型、直逼GPT-4和Claude-3.5的AI系统。
DeepSeek-V3包含1个共享专家和256个路由专家,单次推理仅激活8个路由专家。总参数量671B,实际激活参数量37B(占比5.5%),相比稠密模型节省87%算力。无辅助损失的负载均衡策略确保各专家激活频率接近,不会导致性能额外损耗,GPU利用率从65%提升至92%。DeepSeek-V3用14.8万亿高质量token训练,构建出超越所有开源模型、直逼GPT-4和Claude-3.5的AI系统。
MLA与FP8:推理效率与训练速度双提升
MLA(多头潜在注意力)通过低秩联合压缩键值,将KV缓存大小减少93.3%。数据读取和处理量大幅减少,推理速度显著提升,相对基准系统吞吐量提升3-7倍。与DeepSeek 67B相比,MLA使V2节省42.5%训练成本,最大生成吞吐量提高5.76倍,在处理长序列数据时优势尽显。
FP8混合精度训练框架将内存占用减少50%,训练速度提升2.1倍。前向传播使用FP8(8位浮点数),反向传播使用FP16(16位浮点数),首次验证FP8训练在极大规模模型上的可行性。自研动态缩放算法根据梯度幅值自动调整量化参数,GLUE基准测试精度损失仅0.3%。DualPipe算法优化并行流水线,实现接近0的通信开销。DeepSeek-V3完整训练仅需278.8万GPU小时。
FP8混合精度训练框架将内存占用减少50%,训练速度提升2.1倍。前向传播使用FP8(8位浮点数),反向传播使用FP16(16位浮点数),首次验证FP8训练在极大规模模型上的可行性。自研动态缩放算法根据梯度幅值自动调整量化参数,GLUE基准测试精度损失仅0.3%。DualPipe算法优化并行流水线,实现接近0的通信开销。DeepSeek-V3完整训练仅需278.8万GPU小时。
MTP多token预测与蒸馏技术提升模型能力
MTP(多token预测)机制实现一次预测多个token,通过自推测解码实现高达3倍推理速度提升。预测窗口滑动机制使长文本生成困惑度降低15%,文本更加流畅自然、逻辑连贯。DeepSeek-V3生成速度较V2.5提升3倍,每秒生成60个tokens。
蒸馏技术将DeepSeek-R1推理能力迁移至小模型。通过已有高质量模型合成少量高质量数据作为新模型训练数据,达到接近于在原始数据上训练的效果。DeepSeek发布从1.5B到70B参数的R1蒸馏版本,基于Qwen和Llama等架构。R1-Distill-Qwen-32B在AIME 2024达72.6%,MATH-500达94.3%,多项能力对标OpenAI o1-mini。复杂推理能力可封装在更小、更高效的模型中。
蒸馏技术将DeepSeek-R1推理能力迁移至小模型。通过已有高质量模型合成少量高质量数据作为新模型训练数据,达到接近于在原始数据上训练的效果。DeepSeek发布从1.5B到70B参数的R1蒸馏版本,基于Qwen和Llama等架构。R1-Distill-Qwen-32B在AIME 2024达72.6%,MATH-500达94.3%,多项能力对标OpenAI o1-mini。复杂推理能力可封装在更小、更高效的模型中。
DeepSeek-V3位于模型性能/性价比最优范围
DeepSeek-V3是官方认可唯一进入“最佳性价比”三角区的模型。API服务定价每百万输入tokens 0.5元(缓存命中)/2元(缓存未命中),每百万输出tokens 8元。DeepSeek-R1每百万输入tokens 1元/4元,每百万输出tokens 16元。OpenAI o1每百万输出tokens 438元,DeepSeek-R1定价仅为o1的约1/30。
训练成本方面DeepSeek-V3完整训练仅278.8万GPU小时,557.6万美元。Llama 3 405B训练时长3080万GPU小时,GPT-4o达7800万至1亿美元。DeepSeek-V3训练使用英伟达H800(性能被削弱的特供AI芯片),OpenAI使用上万张H100。DeepSeek通过算法创新和工程优化,以极低成本实现与行业巨头相媲美的性能,构建了对“算力军备竞赛”路径的系统性颠覆。
训练成本方面DeepSeek-V3完整训练仅278.8万GPU小时,557.6万美元。Llama 3 405B训练时长3080万GPU小时,GPT-4o达7800万至1亿美元。DeepSeek-V3训练使用英伟达H800(性能被削弱的特供AI芯片),OpenAI使用上万张H100。DeepSeek通过算法创新和工程优化,以极低成本实现与行业巨头相媲美的性能,构建了对“算力军备竞赛”路径的系统性颠覆。
| 技术 | 优化效果 |
|---|---|
| MoE混合专家架构 | 激活参数仅37B(总671B),节省87%算力,GPU利用率65%→92% |
| MLA多头潜在注意力 | KV缓存减少93.3%,吞吐量提升3-7倍,节省42.5%训练成本 |
| FP8混合精度训练 | 内存占用减少50%,训练速度提升2.1倍,精度损失仅0.3% |
| MTP多token预测 | 推理速度提升3倍,生成速度60 tokens/秒 |
| DualPipe算法 | 通信开销接近0,优化并行流水线 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
AI产业
17页
1张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录