您的当前位置:首页 > 标签 > 推理算力需求前景
计算机行业年度策略:AI应用元年看好Agent、豆包链及推理算力三大主线-250218(38页).pdf
2026推理算力需求前景:o1开启Inference Scaling Law,2025年推理算力有望主导AI需求|山西证券
山西证券研报显示OpenAI o3模型单任务成本高达数千美元(o1不到10美元),北美四大CSP 24Q3资本开支同比增61%,英伟达推理收入占比已超40%。2025年推理算力如何成为AI算力需求主力?
 2026-07-30
 计算机产业
 38页
33张图表
数据来源:
计算机行业年度策略:AI应用元年看好Agent、豆包链及推理算力三大主线-250218(38页) 查看报告
AI算力需求的结构正在发生根本性变化。山西证券《计算机行业年度策略》报告指出,过去Scaling Law主要指向模型预训练阶段的扩展特性,而OpenAI o1模型指向了新的Inference Scaling Law——增加推理时间和计算资源可以改善模型输出质量。随着AI应用用户数持续增长、多模态与Agent等新形态应用不断涌现,2025年推理侧算力需求有望全面爆发并逐渐占据主导。本文从Inference Scaling Law的机理、o1/o3的算力消耗、北美CSP资本开支结构三个层面,解析推理算力需求前景。

Inference Scaling Law——o1模型开启算力需求新范式

过去大模型的Scaling Law主要指模型在预训练阶段呈现的扩展特性——参数量越大、训练数据越多,模型性能越好。但2024年以来Pre-training的Scaling Law正在放缓,OpenAI于9月发布的o1模型带来了新的Inference Scaling Law:增加推理阶段的时间和计算资源可以持续改善模型输出质量。o1模型在回答问题前会进行"思考",通过扩大思维链搜索范围、增加迭代优化次数来提升性能,为此需要分配更多算力。从定价看,o1-preview的输入价格是GPT-4o的3倍、输出价格是GPT-4o的4倍;o1-mini的输入和输出价格均为GPT-4o的20倍。12月OpenAI推出o3模型,具备自我核实事实能力,并可调整推理时间(低/中/高三档),计算时间越长任务表现越好。

o3单任务成本高达数千美元,算力消耗指数级攀升

在ARC-AGI测试中,o3模型展示了Inference Scaling Law的极致表现。o1在ARC-AGI测试中每个任务的成本不到10美元,而o3在低计算设置下每个任务成本即达20美元,在高计算设置下每个任务成本高达数千美元——相差数百倍。o3证明了通过分配更多推理算力可以持续提升模型在复杂推理任务上的表现,为推理算力需求打开了新的增长空间。这一趋势将推动大模型厂商将算力资源从预训练向推理侧倾斜。英伟达在FY25Q2财报电话会上披露,过去4个季度推理收入在数据中心收入中占比已超过40%,预计2025年AI推理将逐渐成为算力需求的主要来源。
o1与o3模型推理成本对比
模型ARC-AGI单任务成本输入价格(相对GPT-4o)输出价格(相对GPT-4o)
GPT-4o1倍1倍
o1-preview<10美元3倍4倍
o1-mini20倍20倍
o3(低计算)20美元
o3(高计算)数千美元

AI应用用户增长+多模态/Agent普及,推理需求双重驱动

推理算力需求增长受两大因素驱动。一是用户规模和访问量的持续增长——GPT-4月活用户从23年11月的17.25亿增至24年11月的39.2亿,GPT-4o旗舰模型发布后24Q2月活环比增速显著提升;豆包等新兴AI应用用户量同样快速增长。二是单次任务算力消耗的提升——多模态和Agent形态的AI应用对推理算力的需求显著高于基于语言大模型的Chatbot和Copilot。以谷歌搜索为例,传统搜索单次电耗0.3Wh,而ChatGPT单次搜索电耗达2.9Wh,差距近10倍;Agent类应用涉及多轮推理和工具调用,算力消耗将数倍于简单问答。根据英伟达披露,推理收入已在数据中心收入中占比超40%,2025年推理有望成为AI算力需求的主导力量。

ASIC受益推理占比提升,2028年市场份额有望达25%

随着AI负载从训练向推理过渡,ASIC有望凭借更高能效比和推理效率抢占GPU部分份额。AI训练需要高算力,GPU凭借强大并行计算能力占据主导。AI推理更关注效率和性价比——ASIC为特定任务定制,具有更高能效比和更低单位算力成本,且通过定制优化内存和算子可实现更快数据处理。Marvell预测2023年ASIC市场规模66亿美元、数据中心加速芯片占比16%,2028年将增至429亿美元(CAGR 45%)、占比提升至25%。北美四大CSP均已布局AI ASIC:谷歌TPU已迭代6代、AWS Trainium2 FP16算力667TFLOPS、微软Maia 100 FP16算力800TFLOPS、Meta MTIA已部署16个数据中心。国内寒武纪、海光信息、昆仑芯等国产AI芯片同样采用ASIC或GPGPU架构,有望在推理需求爆发中持续受益。
客服
商务合作
小程序
服务号
折叠