您的当前位置:首页 > 标签 > AI算力效率
计算机行业:DeepSeek开启盈利新时代!关注应用、云厂及国产算力、数据库投资机遇-250303(16页).pdf
AI算力效率:杰文斯悖论下需求扩张,国产算力机遇分析|中泰证券
中泰证券分析AI算力效率:DeepSeek单卡达8倍效率,V3训练成本557万美元,推理成本利润率545%,杰文斯悖论下效率提升反而驱动算力需求扩张,多模态智能体提升单任务算力消耗,国产算力结合算法创新有望弯道超车,AI算力效率趋势与投资机会分析。
 2026-07-30
 计算机产业
 16页
23张图表
数据来源:
计算机行业:DeepSeek开启盈利新时代!关注应用、云厂及国产算力、数据库投资机遇-250303(16页) 查看报告
DeepSeek开源周最反直觉的发现是——算力效率的提升并未抑制算力需求,反而在杰文斯悖论框架下推动全球算力消耗进入加速扩张周期。FlashMLA使单卡效率达行业平均8倍,V3训练成本仅557万美元,但推理服务峰值时仍占用278个H800节点、日处理token超776亿。中泰证券认为,AI应用爆发催生庞大推理需求,多模态智能体提升单任务算力消耗,国产算力结合算法创新有望弯道超车。

杰文斯悖论:效率越高,需求越大

19世纪经济学家杰文斯发现,蒸汽机效率提升后煤炭消耗量反而增加。类似现象正发生在AI算力领域——DeepSeek将H800算力效率提升至行业平均8倍,但AI应用爆发催生的推理需求使算力消耗总量持续攀升。单H800节点日处理prefill 73.7k tokens/s、decode 14.8k tokens/s,推理服务峰值占278个节点、日处理token超776亿。效率提升降低单位算力成本,扩大AI应用覆盖面,驱动算力需求总量增长。

多模态智能体提升单任务算力消耗

当前AI以文本交互为核心,但未来图像识别、音视频生成、3D场景建模的复合型Agent将显著提升单任务算力消耗强度。DeepSeek开源周展示的3FS并行文件系统(180节点6.6TiB/s吞吐)和Smallpond分布式排序能力(110.5TiB数据30分钟完成),正是为支撑多模态海量数据训练与推理而设计。多模态智能体的普及将使同等规模业务场景的算力需求呈指数级跃升。

国产算力:算法创新结合硬件有望弯道超车

DeepSeek通过优化Hopper架构适配策略释放了国际主流算卡潜力,更为国产GPU厂商提供了可复现的算法优化路径。DeepGEMM的JIT编译技术可动态适配不同硬件配置,无需预编译即可生成优化内核;EPLB负载均衡策略可适配国产芯片的异构计算架构。海外高性能芯片供应受限背景下,国产算力结合算法架构创新有望在训练/推理效率上逼近国际水平。

投资建议:公有云与国产算力标的

大型云厂商具备规模与infra优势,能以更低成本支持高并发业务需求。阿里巴巴未来三年计划投入超3800亿元强化云计算基础设施。国产算力方面,DeepSeek已证明算法优化可弥补硬件差距,建议关注海光信息、中科曙光、神州数码。R2模型有望于5月前发布,进一步验证国产算力+算法创新的可持续性。
表:DeepSeek算力效率关键数据
指标数据
FlashMLA单卡效率行业平均8倍
V3训练成本557万美元
单H800 Prefill吞吐73.7k tokens/s
单H800 Decode吞吐14.8k tokens/s
推理服务峰值节点278个H800节点
日处理输入token608B
日处理输出token168B
成本利润率545%(理论值)
客服
商务合作
小程序
服务号
折叠