您的当前位置:首页 > 标签 > AI Infra技术趋势
人工智能行业GenAI系列报告之五十四:AI云计算新范式规模效应+AIInfra+ASIC芯片-250328(60页).pdf
AI Infra技术趋势:DeepSeek推理成本优化545%利润率,算力性能挖潜关键|申万宏源
申万宏源研报指出AI Infra能力正拉开推理成本差距,DeepSeek通过算法工程优化实现理论545%成本利润率。字节MegaScale万卡集群MFU达55.2%(相对英伟达Megatron-LM提升1.34倍),阿里PAI-ChatLearn训练加速208%,点击查看AI Infra技术趋势。
 2026-07-29
 AI产业
 60页
8张图表
数据来源:
人工智能行业GenAI系列报告之五十四:AI云计算新范式规模效应+AIInfra+ASIC芯片-250328(60页) 查看报告
申万宏源报告重点分析了AI Infra(AI基础设施软件)对计算效能挖潜的关键作用。AI Infra定位于算力与应用之间的“桥梁”角色,包括硬件集群组网、算力调度、大模型训练/推理优化工具等。DeepSeek通过深入AI工程栈全环节优化,实现理论545%的成本利润率,验证了AI Infra能力对推理成本的重大影响。字节MegaScale训练框架在万卡集群实现55.2%的MFU(模型计算利用率),相对英伟达Megatron-LM提升1.34倍。AI Infra能力正成为云厂之间差异化竞争的核心壁垒。

AI Infra:从算力到应用的“桥梁”,决定计算效率差距

AI Infra定位于算力与应用之间的基础软件设施层,具体包括:1)算力硬件层面的组网构建、算力资源调度,实现集群高效率;2)大模型+AI开发工具(框架库、工具库),增强大模型对算力计算效率的挖潜;3)针对具体应用的定向优化,降低推理成本。

各厂商间AI Infra能力有较大差距。不同于开发生态已十分成熟、潜能充分挖掘的CPU,GPU/ASIC硬件的开发生态仍在不断迭代丰富中,不同AI Infra工程能力的团队对算力硬件的利用率有明显差距。英伟达CUDA生态提供众多AI Infra工具,但以出售硬件产品为目的的英伟达,在AI Infra优化上进一步算力挖潜的动机略显不足。因此,云厂商/互联网/大模型厂商将承担主要的AI Infra优化、计算效能挖潜任务。

从硬件到大模型的训练推理,仍有AI框架库、AI资源库、底层算子等生态层次。英伟达GPU提供的开发工具适用于标准化通用需求,易开发性出色,但大模型至硬件调用间仍有多个步骤可实现成本优化。优化与否将直接拉开推理成本差距。
AI Infra能力分层及代表厂商工作
能力层所处层次主要工作典型代表
应用程序层算力负载针对具体应用定向优化,降低推理成本谷歌NotebookLM等
MaaS/PaaS层模型开发工具提供AI框架库、资源库;针对大模型计算效率优化谷歌TensorFlow/JAX、DeepSeek专家并行优化
硬件平台层计算资源通信组网、异构计算协调、弹性部署谷歌OCS组网、DeepSeek Fire-Flyer集群

DeepSeek启示:AI Infra优化深入工程栈全环节

DeepSeek在2025年开源周发布了多项AI Infra优化工具,展现了从算力硬件到大模型API调用的全环节优化能力。DeepSeek理论测算显示,针对特定DeepSeek R1大模型进行充分优化后,可实现成本利润率545%的理论水平(利润/成本=545%),其核心在于深入AI工程栈全环节的优化。

具体优化方向包括:1)改善存储瓶颈:通过更高效的数据存取策略减少I/O等待;2)提升通信效率:针对专家并行、流水线并行等优化集合通信;3)提升计算单元效率:在PTX层定制算子,针对具体GPU微架构设计实现针对性优化。

值得注意的是,同为DeepSeek R1模型搭载于第三方大模型平台,若未进行充分优化,其推理成本仍将相对较高。例如大模型平台公司路晨科技停用DeepSeek R1 API接口,即为成本侧难以复制DeepSeek的优化措施,AI Infra能力正成为拉开AI应用/大模型API单次推理成本差距的核心变量。

字节/阿里/腾讯在AI Infra领域的技术积累

大模型厂商/互联网云已积累较强的AI Infra能力,并发布较多成果:

字节跳动:MegaScale训练框架在12,288个GPU上训练175B LLM模型时,模型FLOPs利用率(MFU)达到55.2%,相对英伟达Megatron-LM提升1.34倍。Gödel调度器在高峰期提供>60%的CPU利用率和>95%的GPU利用率。通过优化网络拓扑、降低ECMP哈希冲突、改进拥塞控制实现大规模集群高效训练。

阿里巴巴:PAI-ChatLearn对齐训练框架通过对Alignment训练流程进行合理抽象和解耦,在7B+7B规模有115%的加速,70B+70B规模有208%的加速。灵骏计算集群可扩容到10万张GPU卡规模,万卡规模下性能线性增长率达96%。

腾讯:TACO-LLM大模型推理加速套件以Llama-3.1 70B为例,部署成本低至<0.5美元/百万Tokens,相比直接调用MaaS API的成本节约超过60%。单集群支持万卡规模,单机支持3.2T大带宽,通信占比低至6%,训练效率提升20%。

AI Infra对云厂竞争格局的影响

AI Infra能力将深刻影响云厂竞争格局。在GPU硬件趋同的背景下,云厂之间AI Infra能力的差异将决定:1)同一开源模型在不同平台上的推理成本差异——未优化平台成本可能是优化平台的数倍;2)大模型训练效率差异——MFU从40%到55%意味着算力有效利用率提升37.5%;3)AI应用开发效率差异——丰富的工具链可大幅降低云客户的开发门槛。

拥有前沿大模型开发经验的云厂(完成了“构建AI算力集群→基于集群的大模型训练→提供大模型API推理服务→构建上层AI应用”的全工作栈)已积累较强AI Infra能力。字节、阿里、腾讯、谷歌等厂商在AI Infra领域的布局正在形成差异化竞争壁垒。AI Infra能力将成为云厂在AI时代实现“同等算力、更低成本、更高效率”的关键抓手。
客服
商务合作
小程序
服务号
折叠