您的当前位置:首页 > 标签 > DeepSeek训练成本分析
【东方证券】计算机行业深度报告:DeepSeek惊艳世界,算力与应用将迎来结构性变化-250204(18页).pdf
DeepSeek训练成本分析:557.6万美元 vs Llama 3的11倍,算法创新降本|东方证券
东方证券DeepSeek深度报告:V3训练仅557.6万美元(Llama 3 405B为3080万GPU小时,是V3的11倍),FP8精度+DualPipe+MoE三大创新,训练算力需求结构性变化。
 2026-07-30
 信息技术
 18页
1张图表
数据来源:
【东方证券】计算机行业深度报告:DeepSeek惊艳世界,算力与应用将迎来结构性变化-250204(18页) 查看报告
东方证券计算机行业深度报告指出,DeepSeek-V3的训练成本仅为557.6万美元(278.8万H800 GPU小时),约为同等性能模型训练成本的十分之一。OpenAI创始成员Andrej Karpathy指出,Llama 3-405B消耗3080万GPU小时,是V3的11倍。这一成本优势源自FP8精度训练、DualPipe双向流水线、MoE架构等多重创新。本文基于东方证券研报,深入拆解DeepSeek训练成本的构成与技术创新。

557.6万美元——DeepSeek-V3训练成本全拆解

DeepSeek-V3的正式训练成本仅为557.6万美元。根据技术报告,完整训练消耗278.8万H800 GPU小时,其中预训练266.4万小时、上下文长度扩展11.9万小时、后期训练0.5万小时。以H800 GPU每小时2美元的租赁价格计算,总成本为557.6万美元。

这一成本较同等性能模型低约一个数量级。OpenAI创始成员Andrej Karpathy指出,Llama 3-405B消耗3080万GPU小时,是DeepSeek-V3的11倍;此前同等性能的模型训练成本通常在0.6-1亿美元之间。DeepSeek通过算法与工程创新,将训练成本降低至行业水平的十分之一左右,重新定义了“高性能模型的成本基准”。

FP8精度训练——计算速度翻倍的关键技术

FP8精度训练是DeepSeek降本的核心技术之一。FP8用8个二进制位表示数字,相比传统的FP32(32位)和FP16(16位),精度降低但计算速度大幅提升。DeepSeek将大部分计算密集型操作(如矩阵乘法)使用FP8精度进行,同时保留嵌入层、输出头等关键操作的高精度(BF16或FP32)。

这一“混合精度”方案使计算速度相较于BF16方法提升一倍。在此基础上,DeepSeek进一步叠加细粒度量化、高精度累加、在线量化、低精度存储和通信等技术,成功实现了高效的FP8精度训练。这些创新不仅显著提高了训练速度,还保持了模型的高性能。

DualPipe与跨节点通信——分布式训练效率的革命

DualPipe双向流水线是DeepSeek在分布式训练领域的重大创新。其核心思想是将模型的不同层分配到不同GPU上进行并行训练,并通过双向流水线调度同时处理正向传播和反向传播。这一方法允许从流水线两端同时输入微批次,最大化计算资源利用并减少通信开销。

跨节点通信方面,DeepSeek通过高效的跨节点全对全通信内核、通信和计算的重叠、定制化通信内核、低精度通信等技术,显著提高了跨节点通信效率。这些技术使DeepSeek能够在使用2048块H800 GPU的集群上高效训练671B参数的模型,而不需要依赖昂贵的张量并行。

训练算力长期展望——成本下降是否意味着需求减少?

DeepSeek的低成本训练引发市场对算力需求前景的质疑。Anthropic CEO Dario对此的回应值得深思:“训练越来越智能的模型的经济价值是如此之大,以至于任何成本收益几乎都会立即被吃掉——它们被重新投入到制作更智能的模型中”。各模型公司仍致力于训练性能更强大的模型,庞大的训练集群仍将被产业追逐。

因此,训练算力需求从长期来看依然值得乐观。短期市场对算力股的过度担忧可能并未充分认识到:模型效率的提升将加速AI能力边界的外延,而非压缩行业整体投入。DeepSeek的创新是对行业效率的提升,而非对行业规模的否定。
DeepSeek-V3与Llama 3-405B训练成本对比
对比项DeepSeek-V3Llama 3-405B比值
GPU小时数278.8万3080万1:11
训练成本(估算)557.6万美元约6160万美元1:11
模型参数671B(激活37B)405B(稠密)
客服
商务合作
小程序
服务号
折叠