您的当前位置:首页 > 标签 > DeepSeek成本优势
计算机行业华为系列深度之十八暨GenAI系列深度之四十九:算力新变局训练范式、架构创新、工程优化-250207(24页).pdf
DeepSeek成本优势:557万美元训练成本为Llama3的1/11,MFU提升61%|申万宏源
申万宏源算力报告指出,DeepSeek V3训练仅557.6万美元为Llama3的1/11,MFU较半年前V2提升61%,节省约1200万元。FP8混合精度、Dualpipe流水线并行、MoE架构三管齐下。模型性价比较GPT-4降90倍,杰文斯悖论有望生效。
 2026-07-30
 计算机产业
 24页
20张图表
数据来源:
计算机行业华为系列深度之十八暨GenAI系列深度之四十九:算力新变局训练范式、架构创新、工程优化-250207(24页) 查看报告
DeepSeek V3以557.6万美元的训练成本实现了与GPT-4o相媲美的性能,震撼业界。申万宏源计算机团队深度拆解DeepSeek的成本优势——Llama 3 405B训练时长为3080万GPU小时,DeepSeek V3仅为278.8万GPU小时,成本仅为1/11。FP8混合精度训练、Dualpipe流水线并行算法、MoE架构创新三管齐下,算力使用效率(MFU)较半年前的DeepSeek V2提升了61%,节省约1200万元成本。据Semianalysis,DeepSeek V3价格较GPT-4下降了90倍以上。申万宏源认为,DeepSeek的低成本优势有望加速AI应用渗透,杰文斯悖论下算力总需求不减。

557万美元训练成本——DeepSeek V3的性价比革命

DeepSeek V3训练成本分解:预训练266.4万H800 GPU小时(532.8万美元),上下文扩展11.9万GPU小时(23.8万美元),后训练0.5万GPU小时(1万美元),总计278.8万GPU小时、557.6万美元(假设H800租赁费2美元/GPU小时)。Llama 3 405B训练时长为3080万GPU小时(1.6万张H100×80天),DeepSeek V3仅为1/11。OpenAI创始成员Karpathy表示:“DeepSeek V3让在有限算力预算上进行模型预训练这件事变得容易,训练消耗的算力仅为Llama 3 405B的1/11。”DeepSeek V3在2048块Nvidia H800 GPU组成的集群上完成训练(共256个节点,每个节点8个GPU,通过NVLink和NVSwitch节点内连接,节点间通过InfiniBand通信),整体训练时间约两个月。

三大成本控制技术——FP8+Dualpipe+MoE

FP8混合精度训练:DeepSeek V3将大部分核心计算(特别是矩阵乘法GEMM操作)执行在FP8精度,对精度敏感操作(嵌入层、输出头、MoE门控、归一化、注意力)在BF16或FP32更高精度下执行以确保训练稳定性,减少显存占用和计算量。Dualpipe流水线并行:优化调度策略减少GPU等待时间(“气泡”),实现部分GPU计算任务与其他GPU通信任务重叠,隐藏训练过程中大部分通信开销,结合高效的跨节点全对全通信内核,充分利用InfiniBand和NVLink带宽。MoE混合专家架构:DeepSeek V3总参数量671B,每个token仅激活37B参数,大幅降低计算量。清华大学方佳瑞博士测算,DeepSeek V3训练MFU约36.2%-39%,较半年前V2提升61%,若按H800租金2美元/GPU/小时计算,较V2节约约1200万人民币。

模型性价比降90倍——杰文斯悖论生效的算力逻辑

据Semianalysis,DeepSeek V3价格(MMLU cost/1M Tokens)较GPT-4下降了90倍以上。V3 API输出价格8元/百万tokens,仅为GPT-4o(约72.9元)的约11%;R1 API输出价格16元/百万tokens,仅为o1(约437.4元)的约3.7%。Infra算法优化带来的效率提升每半年约50%,切实带动模型成本/价格下降。申万宏源认为,“算法优化→成本下降→渗透率提升→强化训推投入”闭环逻辑持续。DeepSeek V3和R1发布后,H100价格上涨即为佐证——杰文斯悖论(技术进步使资源使用效率提高时,资源总体消耗量反而增加)在AI领域生效。算法优化不会减少算力总需求,反而因加速AI渗透而推动算力总需求增长。
表:DeepSeek V3训练成本明细
阶段GPU小时数成本(万美元)
预训练266.4万532.8
上下文扩展11.9万23.8
后训练0.5万1.0
总计278.8万557.6
客服
商务合作
小程序
服务号
折叠