2025年底英伟达以200亿美元收购Groq,2026年GTC即推出LPU产品,推理Token成本降至传统方案的十分之一——AI芯片行业正在经历一场从“单芯霸权”到“异构共生”的深刻变革。鼎惟咨询这份188页的报告预测,推理市场规模将超越训练,CPU价值被重新评估,ASIC在边缘端成为必然选择。GPU+LPU的异构协同正在定义下一代AI算力基础设施的标准。
行业拐点——推理超越训练,异构芯片时代开启
2025年,推理需求占比首次超过50%
2025年是AI芯片行业的分水岭。报告明确指出,推理需求占比首次超过50%,标志着AI产业的重心正从“训练”向“推理”加速转移。这一拐点对芯片行业的影响远超预期:训练是集中式、可预判的“重体力活”,而推理是分散式、不可预测的“长尾场景”,两者对芯片架构的要求截然不同。
报告分析,推动这一拐点的三大驱动力包括:DeepSeek等开源模型带来的算法效率革命、OpenClaw等AI智能体平台对低延迟推理的刚性需求、以及TPU等ASIC量产为推理场景提供的专用计算替代方案。AI芯片行业正从“训练芯片主导”走向“训练+推理双轮驱动”的新格局。
报告分析,推动这一拐点的三大驱动力包括:DeepSeek等开源模型带来的算法效率革命、OpenClaw等AI智能体平台对低延迟推理的刚性需求、以及TPU等ASIC量产为推理场景提供的专用计算替代方案。AI芯片行业正从“训练芯片主导”走向“训练+推理双轮驱动”的新格局。
GPU与LPU的分工:预填充vs解码
报告将推理过程拆解为两个关键子阶段,并清晰界定了GPU与LPU的分工。预填充阶段(Prefill)是当用户请求到达时,系统将其转换为Token序列,并由GPU集群进行并行、密集的计算,以生成整个序列的上下文理解。这一阶段需要大规模并行计算,对算力、内存、通信要求高,是GPU的主场。
解码阶段(Decode)是基于预填充的结果,模型以自回归方式逐个预测并生成下一个Token,直至输出完成。此阶段对延迟极其敏感,需要快速响应,是LPU的主场。报告指出,英伟达通过AFD架构将两者分离,让Rubin GPU主导预填充、Groq LPU专攻解码,系统整体推理效率(吞吐量/瓦特)最高可提升35倍。
解码阶段(Decode)是基于预填充的结果,模型以自回归方式逐个预测并生成下一个Token,直至输出完成。此阶段对延迟极其敏感,需要快速响应,是LPU的主场。报告指出,英伟达通过AFD架构将两者分离,让Rubin GPU主导预填充、Groq LPU专攻解码,系统整体推理效率(吞吐量/瓦特)最高可提升35倍。
GPU前景——架构迭代与生态护城河的双轮驱动
三年三级跳:从Blackwell到Rubin到Feynman
英伟达的GPU架构迭代速度正在空前加快。报告详细梳理了从2024年到2028年的GPU路线图:2024年Blackwell启动双芯封装,晶体管数达2080亿;2026年Rubin引入Vera CPU与HBM4,FP4稠密算力达50 PFLOPs,内存带宽超22TB/s;2028年Feynman架构首用3D逻辑堆叠替代2.5D拼接,配合定制HBM,并前瞻性引入CPO光电共封装与全光互联。
报告特别指出,Feynman架构的3D逻辑堆叠将彻底颠覆存算路径,打破传统电互联的物理瓶颈,为超大规模算力集群铺就底层高速公路。GPU的未来不仅在于算力的提升,更在于存算架构的物理级重构。
报告特别指出,Feynman架构的3D逻辑堆叠将彻底颠覆存算路径,打破传统电互联的物理瓶颈,为超大规模算力集群铺就底层高速公路。GPU的未来不仅在于算力的提升,更在于存算架构的物理级重构。
CUDA生态:最深的护城河与最大的变数
报告指出,CUDA生态是英伟达GPU最深的护城河——90%+的AI框架原生支持CUDA,客户迁移成本极高。但DeepSeek带来的底层代码从CUDA向CANN迁移的趋势,对这条护城河构成了前所未有的挑战。
英伟达的应对策略是软硬件协同,将DeepSeek的算法红利转化为自身系统演进的驱动力。依托Dynamo等软件层实现单GPU产出数量级的提升,形成“算法冲击-系统优化-生态固化”的闭环。报告认为,CUDA生态仍将是GPU领域的统治性力量,但其统治力正在从“绝对垄断”向“相对优势”转变。
英伟达的应对策略是软硬件协同,将DeepSeek的算法红利转化为自身系统演进的驱动力。依托Dynamo等软件层实现单GPU产出数量级的提升,形成“算法冲击-系统优化-生态固化”的闭环。报告认为,CUDA生态仍将是GPU领域的统治性力量,但其统治力正在从“绝对垄断”向“相对优势”转变。
GPU的不可替代性:训练与预填充的绝对主导
尽管ASIC和LPU在特定场景展现出优势,但报告指出GPU在训练和预填充阶段具有不可替代性。训练大模型高度依赖密集的矩阵运算和灵活的编程模型,这正是GPU最擅长的领域。英伟达的Rubin GPU将训练大模型所需GPU数量减少至四分之一,AI推理Token成本降低至十分之一。
在预填充阶段,大规模并行计算对算力、内存、通信的要求极高,通用GPU的灵活性使其能够适应不断变化的模型架构和算法创新。报告认为,只要AI模型架构仍在快速演进,通用GPU就仍将是训练和预填充阶段的最优选择。
在预填充阶段,大规模并行计算对算力、内存、通信的要求极高,通用GPU的灵活性使其能够适应不断变化的模型架构和算法创新。报告认为,只要AI模型架构仍在快速演进,通用GPU就仍将是训练和预填充阶段的最优选择。
LPU前景——推理专用芯片的黄金赛道
200亿美元收购Groq:买下推理时代的“关键生产力”
2025年底,英伟达以约200亿美元获得Groq的LPU技术非独占授权并吸纳其核心团队,这是AI芯片行业标志性的事件。报告用“不是买公司,而是买下一个时代的关键生产力”来形容这一收购的战略意义。
Groq LPU采用片上大容量SRAM作为主存,带宽达150TB/s,延迟仅5-20纳秒,远低于HBM的100-150纳秒。LPU将延迟敏感的解码任务从GPU卸载至专用流水线,Token生成速度达H100的6倍,单Token成本降至四分之一,推理能耗降至三分之一。报告指出,这一收购在推理范式转移的前夜完成了战略卡位,使英伟达从“训练霸主”跃升为“训练+推理双范式控制者”。
Groq LPU采用片上大容量SRAM作为主存,带宽达150TB/s,延迟仅5-20纳秒,远低于HBM的100-150纳秒。LPU将延迟敏感的解码任务从GPU卸载至专用流水线,Token生成速度达H100的6倍,单Token成本降至四分之一,推理能耗降至三分之一。报告指出,这一收购在推理范式转移的前夜完成了战略卡位,使英伟达从“训练霸主”跃升为“训练+推理双范式控制者”。
LPU产品路线图:从独立机架到原生融合
报告详细梳理了英伟达LPU的产品路线图。短期策略以独立LPX机架验证市场、证明高性能推理可行。2026年推出的LP30和LP35采用三星4nm工艺,LP30单片集成500MB SRAM,单芯片提供1.2 PFLOPs FP8算力。LP35新增NVFP4数值格式支持,优先保障上市时间。
远期策略是在Feynman平台通过3D堆叠实现LPU与GPU的原生架构融合。LP40采用台积电N3P工艺与CoWoS-R封装,原生支持NVLink协议,直接与Feynman平台完成全链路协同设计。报告认为,英伟达正在构筑“芯片级确定性执行”取代“系统级调度”的下一代推理架构。
远期策略是在Feynman平台通过3D堆叠实现LPU与GPU的原生架构融合。LP40采用台积电N3P工艺与CoWoS-R封装,原生支持NVLink协议,直接与Feynman平台完成全链路协同设计。报告认为,英伟达正在构筑“芯片级确定性执行”取代“系统级调度”的下一代推理架构。
LPU对芯片行业格局的深远影响
报告指出,LPU的出现正在深刻改变AI芯片行业的竞争格局。首先,LPU的SRAM架构开辟了绕开HBM与CoWoS的全新技术路径,对传统存储器和先进封装产业链产生深远影响。其次,LPU将推理成本压缩至传统方案的十分之一,将大幅降低AI应用的商业化门槛,加速AI智能体的规模化落地。
更深远的影响在于竞争维度的升维。英伟达通过“GPU+LPU”的异构协同,将竞争从单一芯片性能比拼拉升到系统级架构与全栈优化能力之争。竞争对手若只关注单芯片性能提升,将难以在系统级的Token成本竞争中胜出。
更深远的影响在于竞争维度的升维。英伟达通过“GPU+LPU”的异构协同,将竞争从单一芯片性能比拼拉升到系统级架构与全栈优化能力之争。竞争对手若只关注单芯片性能提升,将难以在系统级的Token成本竞争中胜出。
CPU与ASIC——重构中的算力三角
CPU价值重估:从“配角”到“超级周期”
报告指出,推理时代正在重新评估CPU的价值。Agentic AI的兴起使CPU不再只是“配角”——在Agent工作负载中,CPU消耗了50%至90%的总延迟。AI推理引发了服务器CPU的供需倒挂,行业配置比例向1:1~1:2靠拢,CPU成为算力新瓶颈,定价权与稀缺性强势回归。
英伟达Vera CPU首次独立销售,切入英特尔、AMD主导的服务器CPU直销市场。报告认为,传统x86双寡头格局正在瓦解,CPU市场正进入“群雄割据”的新阶段。英伟达有望借助Grace平台积累的协同设计经验,将Vera打造成下一代AI基础设施的通用计算底座。
英伟达Vera CPU首次独立销售,切入英特尔、AMD主导的服务器CPU直销市场。报告认为,传统x86双寡头格局正在瓦解,CPU市场正进入“群雄割据”的新阶段。英伟达有望借助Grace平台积累的协同设计经验,将Vera打造成下一代AI基础设施的通用计算底座。
ASIC:云端补充者,边缘必然选择
报告对ASIC的前景给出了清晰判断。在云端市场,ASIC的核心价值是优化推理侧成本,但始终是英伟达GPU的“成本补充者”,受限于系统级TCO和技术迭代速度,无法撼动英伟达的主导地位。
在边缘端市场,ASIC则是“核心主场”。AI向手机、机器人、物联网设备渗透时,对实时性、低功耗、低成本的要求使ASIC成为必然选择。报告指出,英伟达的策略是“GPU主导+ASIC补充”,通过云端“芯片-系统-生态”三层防御构筑壁垒,同时边缘端布局自研ASIC与物理AI主动反攻。
在边缘端市场,ASIC则是“核心主场”。AI向手机、机器人、物联网设备渗透时,对实时性、低功耗、低成本的要求使ASIC成为必然选择。报告指出,英伟达的策略是“GPU主导+ASIC补充”,通过云端“芯片-系统-生态”三层防御构筑壁垒,同时边缘端布局自研ASIC与物理AI主动反攻。
行业前景与投资逻辑
2026-2028年的三大趋势预判
报告基于对GPU、LPU、CPU、ASIC四类芯片的深入分析,提出了2026-2028年AI芯片行业的三大趋势。
趋势一是异构计算成为标配。单一芯片类型的方案将难以满足AI推理的多样化需求,CPU+GPU+DPU+LPU的四芯协同将成为高端AI算力基础设施的标配架构。
趋势二是推理成本持续下降。LPU的引入将推理Token成本降至传统方案的十分之一,AI智能体的商业化门槛大幅降低,有望催生新一轮应用爆发。
趋势三是边缘计算加速渗透。ASIC在边缘端的“必然选择”地位将推动AI从云端向终端设备下沉,手机、汽车、机器人、物联网设备的AI芯片需求将迎来爆发式增长。
趋势一是异构计算成为标配。单一芯片类型的方案将难以满足AI推理的多样化需求,CPU+GPU+DPU+LPU的四芯协同将成为高端AI算力基础设施的标配架构。
趋势二是推理成本持续下降。LPU的引入将推理Token成本降至传统方案的十分之一,AI智能体的商业化门槛大幅降低,有望催生新一轮应用爆发。
趋势三是边缘计算加速渗透。ASIC在边缘端的“必然选择”地位将推动AI从云端向终端设备下沉,手机、汽车、机器人、物联网设备的AI芯片需求将迎来爆发式增长。
产业链投资的关键环节
报告隐含的投资线索包括五个关键环节。其一,LPU的SRAM架构将开辟绕开HBM与CoWoS的全新技术路径,SRAM相关产业链将受益于推理芯片需求的爆发。其二,CPO光互联技术落地将推动硅光芯片、光引擎、ELS光源等上游环节的价值重估。其三,800V HVDC供电架构将推动第三代半导体(GaN、SiC)在数据中心领域的规模化应用。其四,太空计算将推动太空光伏产业链从百亿级向万亿级跃迁。其五,量子计算的Ising模型为AI控制面与量子硬件的融合提供了新的产业方向。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-08-01
AI产业
188页
48张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录