财通证券研究报告聚焦DeepSeek-V3/R1推理系统的成本效率分析。在开源周结束后的第6天,DeepSeek发布了推理系统概述文档,披露了令人瞩目的数据:在24小时内处理6080亿输入token和1680亿输出token,理论日收入达56万美元,日成本仅8.7万美元,成本利润率高达545%。这一数字刷新了全球AI大模型领域的盈利天花板。DeepSeek通过跨节点专家并行、三种负载均衡器和动态资源管理,实现了高吞吐量、低延迟和高性价比的推理服务。
推理系统架构:三大负载均衡器驱动效率革命
DeepSeek-V3/R1推理系统的核心设计目标是“更大的吞吐,更低的延迟”。为实现这一目标,系统引入了三种负载均衡器。Prefill Load Balancer解决不同数据并行实例上请求个数和长度不同导致的计算量不均衡问题,平衡各GPU的core-attention计算量和输入token数量。Decode Load Balancer解决KVCache占用量不均衡问题,确保解码阶段各GPU负载均匀。Expert-Parallel Load Balancer解决某些专家天然负载较高导致的计算不均衡问题,平衡每个GPU上的专家计算量。
系统在H800 GPU上运行,精度与训练时保持一致:矩阵乘法和分派传输采用FP8格式,核心MLA计算和组合传输使用BF16格式。这种混合精度策略在保证性能的同时最大化硬件利用率。推理服务采用动态资源调度策略,白天服务负载高时占用全部节点,夜间低负载时减少推理节点并将资源分配给研究和训练。
系统在H800 GPU上运行,精度与训练时保持一致:矩阵乘法和分派传输采用FP8格式,核心MLA计算和组合传输使用BF16格式。这种混合精度策略在保证性能的同时最大化硬件利用率。推理服务采用动态资源调度策略,白天服务负载高时占用全部节点,夜间低负载时减少推理节点并将资源分配给研究和训练。
成本与收入结构:545%利润率的数字拆解
成本端,在24小时统计周期内(2月27日12点至2月28日12点),V3和R1推理服务的峰值节点占用数达278个节点,平均占用数为226.75个节点。每个节点包含8个H800 GPU,假设每小时租赁一个H800 GPU的成本为2美元,日总成本为87,072美元。
收入端,24小时内系统处理了6080亿输入token(其中56.3%命中磁盘KV缓存)和1680亿输出token。按照DeepSeek-R1的定价标准(缓存命中输入0.14美元/百万token、缓存未命中输入0.55美元/百万token、输出2.19美元/百万token),缓存命中输入收入47,923美元、缓存未命中输入收入173,921美元、输出收入146,133美元,合计理论日收入367,920美元。但实际日收入达561,975美元。理论成本利润率为(561,975-87,072)/87,072=545%。
收入端,24小时内系统处理了6080亿输入token(其中56.3%命中磁盘KV缓存)和1680亿输出token。按照DeepSeek-R1的定价标准(缓存命中输入0.14美元/百万token、缓存未命中输入0.55美元/百万token、输出2.19美元/百万token),缓存命中输入收入47,923美元、缓存未命中输入收入173,921美元、输出收入146,133美元,合计理论日收入367,920美元。但实际日收入达561,975美元。理论成本利润率为(561,975-87,072)/87,072=545%。
实际收入与理论收入的差距分析
DeepSeek明确表示实际收入远低于理论数值。差距主要来自三个方面。第一,DeepSeek-V3的定价低于R1,而推理系统中同时运行V3和R1两个模型。第二,网页端和应用程序访问是免费的,仅部分API服务产生实际收入。第三,夜间非高峰时段自动应用了折扣。
尽管如此,545%的理论成本利润率依然具有重要的产业意义。它证明了大模型推理服务在技术优化充分的情况下可以具备极高的商业价值。业内分析指出,DeepSeek的开源策略与成本控制能力正在打破AI领域的资源垄断。长江证券研报认为,此次开源将通过开源模式与低成本路径,改变此前“大力出奇迹”——即堆算力、堆数据的AI开发逻辑,加速技术普惠化。
尽管如此,545%的理论成本利润率依然具有重要的产业意义。它证明了大模型推理服务在技术优化充分的情况下可以具备极高的商业价值。业内分析指出,DeepSeek的开源策略与成本控制能力正在打破AI领域的资源垄断。长江证券研报认为,此次开源将通过开源模式与低成本路径,改变此前“大力出奇迹”——即堆算力、堆数据的AI开发逻辑,加速技术普惠化。
| 项目 | 数值 | 备注 |
|---|---|---|
| 平均节点占用 | 226.75个 | 每节点8个H800 GPU |
| GPU租赁成本 | 2美元/小时/GPU | 行业标准假设 |
| 日总成本 | 87,072美元 | 226.75×8×2×24 |
| 输入token处理量 | 6,080亿 | 缓存命中率56.3% |
| 输出token处理量 | 1,680亿 | 平均输出速度20-22 token/秒 |
| 理论日收入 | 561,975美元 | 按R1定价计算 |
| 理论成本利润率 | 545% | 刷新全球AI盈利天花板 |
推理效率革命的产业意义与未来展望
545%的理论成本利润率具有深远的产业意义。它首次向市场证明,大模型推理服务在技术优化到位的情况下可以产生极高的商业回报。这一发现可能加速AI应用层的爆发——当推理成本大幅降低、服务效率显著提升时,更多开发者和企业将有能力部署和应用大模型。
DeepSeek所有模型均为开源模型,即所有应用厂商都拥有了可以比肩顶级AI的大模型,而且还可自行二次开发、灵活部署。当模型的成本越低,AI应用的创新门槛就越低。DeepSeek的推理系统优化经验——跨节点专家并行、三种负载均衡器、动态资源调度——为整个行业提供了可复用的技术范式。未来,随着更多企业采用类似优化策略,大模型推理的整体成本有望持续下降,推动AI从“奢侈品”走向“基础设施”。
DeepSeek所有模型均为开源模型,即所有应用厂商都拥有了可以比肩顶级AI的大模型,而且还可自行二次开发、灵活部署。当模型的成本越低,AI应用的创新门槛就越低。DeepSeek的推理系统优化经验——跨节点专家并行、三种负载均衡器、动态资源调度——为整个行业提供了可复用的技术范式。未来,随着更多企业采用类似优化策略,大模型推理的整体成本有望持续下降,推动AI从“奢侈品”走向“基础设施”。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
18页
15张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录