东方证券计算机行业深度报告指出,DeepSeek-V3的训练成本仅为557.6万美元(278.8万H800 GPU小时),约为同等性能模型训练成本的十分之一。OpenAI创始成员Andrej Karpathy指出,Llama 3-405B消耗3080万GPU小时,是V3的11倍。这一成本优势源自FP8精度训练、DualPipe双向流水线、MoE架构等多重创新。本文基于东方证券研报,深入拆解DeepSeek训练成本的构成与技术创新。
557.6万美元——DeepSeek-V3训练成本全拆解
DeepSeek-V3的正式训练成本仅为557.6万美元。根据技术报告,完整训练消耗278.8万H800 GPU小时,其中预训练266.4万小时、上下文长度扩展11.9万小时、后期训练0.5万小时。以H800 GPU每小时2美元的租赁价格计算,总成本为557.6万美元。
这一成本较同等性能模型低约一个数量级。OpenAI创始成员Andrej Karpathy指出,Llama 3-405B消耗3080万GPU小时,是DeepSeek-V3的11倍;此前同等性能的模型训练成本通常在0.6-1亿美元之间。DeepSeek通过算法与工程创新,将训练成本降低至行业水平的十分之一左右,重新定义了“高性能模型的成本基准”。
这一成本较同等性能模型低约一个数量级。OpenAI创始成员Andrej Karpathy指出,Llama 3-405B消耗3080万GPU小时,是DeepSeek-V3的11倍;此前同等性能的模型训练成本通常在0.6-1亿美元之间。DeepSeek通过算法与工程创新,将训练成本降低至行业水平的十分之一左右,重新定义了“高性能模型的成本基准”。
FP8精度训练——计算速度翻倍的关键技术
FP8精度训练是DeepSeek降本的核心技术之一。FP8用8个二进制位表示数字,相比传统的FP32(32位)和FP16(16位),精度降低但计算速度大幅提升。DeepSeek将大部分计算密集型操作(如矩阵乘法)使用FP8精度进行,同时保留嵌入层、输出头等关键操作的高精度(BF16或FP32)。
这一“混合精度”方案使计算速度相较于BF16方法提升一倍。在此基础上,DeepSeek进一步叠加细粒度量化、高精度累加、在线量化、低精度存储和通信等技术,成功实现了高效的FP8精度训练。这些创新不仅显著提高了训练速度,还保持了模型的高性能。
这一“混合精度”方案使计算速度相较于BF16方法提升一倍。在此基础上,DeepSeek进一步叠加细粒度量化、高精度累加、在线量化、低精度存储和通信等技术,成功实现了高效的FP8精度训练。这些创新不仅显著提高了训练速度,还保持了模型的高性能。
DualPipe与跨节点通信——分布式训练效率的革命
DualPipe双向流水线是DeepSeek在分布式训练领域的重大创新。其核心思想是将模型的不同层分配到不同GPU上进行并行训练,并通过双向流水线调度同时处理正向传播和反向传播。这一方法允许从流水线两端同时输入微批次,最大化计算资源利用并减少通信开销。
跨节点通信方面,DeepSeek通过高效的跨节点全对全通信内核、通信和计算的重叠、定制化通信内核、低精度通信等技术,显著提高了跨节点通信效率。这些技术使DeepSeek能够在使用2048块H800 GPU的集群上高效训练671B参数的模型,而不需要依赖昂贵的张量并行。
跨节点通信方面,DeepSeek通过高效的跨节点全对全通信内核、通信和计算的重叠、定制化通信内核、低精度通信等技术,显著提高了跨节点通信效率。这些技术使DeepSeek能够在使用2048块H800 GPU的集群上高效训练671B参数的模型,而不需要依赖昂贵的张量并行。
训练算力长期展望——成本下降是否意味着需求减少?
DeepSeek的低成本训练引发市场对算力需求前景的质疑。Anthropic CEO Dario对此的回应值得深思:“训练越来越智能的模型的经济价值是如此之大,以至于任何成本收益几乎都会立即被吃掉——它们被重新投入到制作更智能的模型中”。各模型公司仍致力于训练性能更强大的模型,庞大的训练集群仍将被产业追逐。
因此,训练算力需求从长期来看依然值得乐观。短期市场对算力股的过度担忧可能并未充分认识到:模型效率的提升将加速AI能力边界的外延,而非压缩行业整体投入。DeepSeek的创新是对行业效率的提升,而非对行业规模的否定。
因此,训练算力需求从长期来看依然值得乐观。短期市场对算力股的过度担忧可能并未充分认识到:模型效率的提升将加速AI能力边界的外延,而非压缩行业整体投入。DeepSeek的创新是对行业效率的提升,而非对行业规模的否定。
| 对比项 | DeepSeek-V3 | Llama 3-405B | 比值 |
|---|---|---|---|
| GPU小时数 | 278.8万 | 3080万 | 1:11 |
| 训练成本(估算) | 557.6万美元 | 约6160万美元 | 1:11 |
| 模型参数 | 671B(激活37B) | 405B(稠密) | — |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
信息技术
18页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录