您的当前位置:首页 > 标签 > 低成本大模型训练
计算机行业深度分析:三大要素齐发力AI应用步入全面加速期-250307(25页).pdf
2026低成本大模型训练:FP8+DualPipe优化,2788千GPU小时训练V3|中原证券
中原证券研报显示,DeepSeek-V3训练仅用2788千GPU小时(约557万美元),成本为GPT-4o的1/20,通过MLA、DeepSeekMoE、FP8混合精度、DualPipe等技术创新,实现极致训练效率,重塑大模型成本结构。
 2026-07-29
 计算机产业
 25页
26张图表
数据来源:
计算机行业深度分析:三大要素齐发力AI应用步入全面加速期-250307(25页) 查看报告
中原证券AI报告深度解析了DeepSeek如何在大模型训练成本上实现颠覆性突破。DeepSeek-V3(6710亿参数)训练仅耗时2788千GPU小时,以H800租赁价格估算约557万美元,仅为GPT-4o训练成本的约1/20。这一成果来自模型架构(MLA、DeepSeekMoE)和训练架构(FP8混合精度、DualPipe、跨节点All-to-All通信)的双重优化。DeepSeek证明了高质量大模型不必然依赖天量算力,为算力受限环境下的模型研发提供了全新范式。

MLA+DeepSeekMoE架构节省数倍算力

DeepSeek-V3的模型架构设计大幅降低了计算消耗。多头潜注意力(MLA)通过对传统MHA的键值缓存进行低秩近似压缩,减少KV Cache大小,贡献约2-4倍的计算效率提升。DeepSeekMoE架构将总参数提升至6710亿,但每个Token仅激活370亿参数,通过无辅助损失的负载平衡策略提高训练稳定性,贡献4倍以上的计算效率提升。两项技术叠加,使模型在保持高性能的同时,训练成本大幅下降。

FP8混合精度训练框架——首个超大规模成功案例

DeepSeek成为首个成功使用FP8混合精度训练超大规模大模型的公司。通常大模型训练采用BF16或FP32精度以保证稳定性,FP8虽能提升速度但精度不足易损失信息。DeepSeek结合自身对GPU硬件架构和训练误差的深度分析,专门设计FP8训练框架:大多数计算密集型操作在FP8中执行,关键操作保持原有精度,兼顾效率和稳定性。这一突破展现了DeepSeek在软硬协同优化上的顶尖能力。

DualPipe与通信优化消除训练瓶颈

在大规模分布式训练中,通信开销常成为瓶颈。DeepSeek设计DualPipe算法实现高效的流水线并行,通过计算和通信的重叠,极大压缩了流水线并行中的“气泡”时间。同时开发跨节点All-to-All通信内核,使用PTX编程充分利用InfiniBand和NVLink带宽,无需昂贵张量并行即可完成训练。在H800服务器(8卡共享1个IB NIC)条件下,这些优化使得通信开销被有效隐藏,训练效率显著提升。

训练成本优势重塑产业竞争格局

DeepSeek-V3的训练成本优势(557万美元 vs GPT-4o约1亿美元)意味着大模型研发不再仅是科技巨头的专利,更多企业和研究机构可进入这一领域。DeepSeek也将训练技术全面开源,有利于行业复制和改良。相比xAI Grok-3的2亿GPU小时(约4亿美元),DeepSeek路径在经济性和能源消耗上更具可持续性。低成本训练+高性能推理的组合,使得AI应用从“奢侈品”变为“日用品”,加速全社会智能化转型。
表:DeepSeek-V3与Grok-3训练对比
指标DeepSeek-V3Grok-3
模型参数6710亿(MoE,激活370亿)未公布,估计万亿级
训练GPU小时278.8万(H800)2亿(估计H100)
训练成本估算约557万美元约4亿美元
核心优化技术MLA+MoE+FP8+DualPipe大规模集群+堆算力
ChatbotArena成绩约1380分约1400分
客服
商务合作
小程序
服务号
折叠