您的当前位置:首页 > 标签 > 国产AI算力生态
计算机行业人工智能系列深度报告:DeepSeek研究框架-250214(52页).pdf
2026国产AI算力生态:昇腾海光适配DeepSeek,国产AI芯片市占率升至20%|国海证券
国海证券研报显示2024H1国产AI芯片出货量近20万张、市占率20%,华为昇腾、海光DCU完成DeepSeek适配,ASIC服务器占比升至26%。推理化+中美博弈加剧,国产AI算力生态如何加速发展?
 2026-07-30
 计算机产业
 52页
2张图表
数据来源:
计算机行业人工智能系列深度报告:DeepSeek研究框架-250214(52页) 查看报告
DeepSeek不仅是AI模型的突破,更是国产AI算力生态的“催化剂”。国海证券《DeepSeek研究框架》报告显示,2024H1中国AI芯片出货中,国产化比例已达20%(近20万张)。华为昇腾、海光DCU相继完成DeepSeek-V3/R1模型的适配与上线。在美国持续加码AI芯片出口管制的背景下,推理算力需求增长+国产芯片单卡性能提升+软件生态完善三重驱动下,国产AI算力生态正迎来历史性发展机遇。本文从国产适配进展、芯片性能对比、生态构建三个维度,解析国产AI算力生态的发展趋势。

昇腾+海光率先适配DeepSeek,国产算力生态迎来标杆案例

DeepSeek的开源属性使其成为国产AI芯片生态聚合的核心载体。2025年2月1日,硅基流动与华为云联合首发基于昇腾云的DeepSeek R1/V3推理服务,昇腾910B芯片在DeepSeek推理场景中实现了与国际领先GPU相当的性能表现,形成“训练用昇腾+推理用昇腾”的完整国产算力闭环。2月2日,海光信息宣布DeepSeek V3和R1模型完成海光DCU适配并正式上线,用户可通过光谷开发者社区基于DCU平台快速部署使用。天数智芯一天内完成DeepSeek R1模型适配上线,燧原科技实现全国各地智算中心DeepSeek全量推理服务器部署,昆仑芯全版本适配DeepSeek。约10家国产AI芯片厂商(华为昇腾、海光、寒武纪、昆仑芯、沐曦、天数智芯、摩尔线程、壁仞、太初元基、云天励飞、燧原科技)相继适配DeepSeek。DeepSeek通过统一模型接口使各家AI芯片可在同一生态下验证性能、优化适配,大幅加速了国产芯片从“能用”向“好用”演进。

国产AI芯片硬件性能持续提升,市占率升至20%

2024H1中国加速芯片市场规模超90万张,GPU卡占据80%市场份额,国产AI芯片出货量已接近20万张,占比约20%。华为昇腾910B FP16算力320TFLOPS(超越A100 312TFLOPS),昇腾910C预计2025年量产(FP16算力790T)。海光深算二号FP16算力350T,深算三号研发中;寒武纪思元590综合性能接近A100的80%;壁仞BR100、燧原i20、沐曦C500等均具备量产能力。对比英伟达H20(FP16算力148T),国产头部芯片在算力指标上已实现超越,但在生态(CUDA兼容性)和互联带宽上仍有差距。DeepSeek绕过CUDA直接使用PTX编程的方式,为国产芯片在软件层面实现性能优化提供了新思路。国产AI芯片通过兼容CUDA(海光)和自建生态(华为昇腾CANN、寒武纪Neuware)两条路径并行发展,在推理场景中ASIC架构的国产芯片凭借更高能效比有望率先放量。
国产AI芯片与英伟达H20对比
厂商型号FP16算力(T)量产时间DeepSeek适配
华为昇腾910B/910C320/790已量产/1H25
海光深算二号350已量产
寒武纪思元590315已发布
英伟达H20(特供)148在售

推理算力需求增长适配国产芯片优势,ASIC服务器占比升至26%

模型推理对大型集群的要求弱于训练,这与目前国产算力单卡实力较强但互联能力不足的现状匹配。推理场景更关注能效比和性价比,ASIC架构的国产芯片(昇腾、寒武纪、昆仑芯)具备天然优势。据TrendForce预估,2024年ASIC服务器占整体AI服务器比重将升至26%(主流GPU服务器占比约71%)。北美CSP(AWS、Meta等)持续扩大自研ASIC,中国阿里巴巴、百度、华为等积极扩大自主ASIC方案。DeepSeek推理服务积极适配H20(内存与带宽容量高于H100,推理效率更具优势),并同步适配昇腾、海光等国产芯片。2024H1中国Top5 GenAI IaaS服务厂商中,字节火山引擎排名居前。美国出口管制持续加码——2022年10月、2023年10月、2024年12月、2025年1月四轮限制步步收紧,国产AI芯片采购从“备选”变为“必选”。推理需求增长+国产芯片性能提升+政策驱动三重共振,国产AI芯片在推理场景的市占率有望从20%持续提升。

软件生态+PTX编程为国产芯片指明新方向

DeepSeek-V3在模型训练中绕过CUDA直接使用PTX(Parallel Thread Execution)编程,编写和调用PTX代码能更精确地控制底层硬件,实现更高效的计算。PTX是英伟达专门为其GPU设计的中间指令集架构,位于CUDA与机器代码之间。国内AI工作者在AI芯片底层软件能力的增强,为国产AI芯片的性能提升指明了新方向——通过优化底层指令实现更高效的计算资源利用。海光持续拓展软件栈DTK(DCU Toolkit),寒武纪自建Neuware软件生态,华为昇腾发展AI框架CANN 8.0版。DeepSeek绕开CUDA直接调用PTX的方式表明,软件层面的优化同样可以带来显著的性能提升,这对于在CUDA生态上处于追赶地位的国产芯片具有重要意义。推荐关注国产算力龙头:海光信息(DCU适配DeepSeek+兼容CUDA生态)、寒武纪(思元590+自研Neuware)、中科曙光、神州数码、软通动力、广电运通、拓维信息(华为昇腾生态合作伙伴)。
客服
商务合作
小程序
服务号
折叠