大模型能力提升的路径正在被重新定义。兴证国际《大模型深度:DeepSeek带来互联网新格局》报告指出,2024H2海外头部大模型推出节奏明显放缓,根本原因在于预训练阶段的算力提升陷入瓶颈——GPT-4到GPT-5需要100倍算力提升,10万卡超算中心物料成本高达40亿美元。DeepSeek-R1的开源则指明了另一条路:在后训练阶段通过强化学习显著提升模型能力,R1-Zero在AIME 2024中的得分从15.6%跃升至71.0%。本文从算力瓶颈、技术突破、产业影响三个维度,解析大模型强化学习训练的行业意义。
预训练算力瓶颈显现,算力集群建设成本与时间双重制约
2024H2,全球头部大模型的上新动力明显放缓。OpenAI选择将o1-pro模型保密,利用计算资源训练o3等更高级模型;Anthropic完成了Claude3.5 Opus训练但未公开发布,转而利用其生成合成数据改进Claude3.5 Sonnet。放缓的深层原因是算力瓶颈。根据SemiAnalysis数据,GPT-4训练算力约为2.15e25 FLOPS,谷歌Gemini、Llama、Claude等最新模型所用算力提升有限。OpenAI前首席科学家Bob McGrew指出,从GPT-4到GPT-5预计需要100倍的算力提升,但在GPT-5正式发布之前,市场会先迎来算力提升10倍的过渡版本。算力集群的建设面临巨大挑战——10万卡超算中心的物料成本高达40亿美元(不含土地、建筑外壳),从芯片发货到组网耗时近1年。高昂的成本和漫长的建设周期,使单纯依靠预训练堆算力的路径面临边际效益递减的困境,为新的技术路径的出现创造了条件。
DeepSeek证明强化学习是模型能力提升的第二条路
OpenAI在2024年9月推出的o1模型首次证明了后训练端强化学习的价值:“在足够强大的模型上应用强化学习进行训练,能够使该模型学会推理,并实现性能提升。”然而o1的闭源使行业复现难度极大,OpenAI隐藏了思维链细节。2025年1月,DeepSeek-R1发布并开源,真正意义上实现了“技术平权”。DeepSeek不仅开源了R1推理模型,还同步开源了R1-Zero(通过大规模强化学习训练,完全没有监督微调作为初始步骤)。R1-Zero在AIME 2024中的pass@1得分从15.6%提高到71.0%,多数投票下进一步升至86.7%,可与OpenAI-o1-0912媲美。R1-Zero在训练过程中自动出现了“顿悟时刻”——模型自行学会了用更长的思维链进行深度思考,响应平均时长从约150 token提升至约1,800 token。DeepSeek-R1在Chatbot Arena排行榜已排名第三,成为首个登顶全球前三的国产大模型。
强化学习是性价比极高的路径,微调成本通常小于预训练1%
后训练阶段的强化学习投入具有极高的性价比。根据论文《AI capabilities can be significantly improved without expensive retraining》的论述,微调成本通常小于原始训练成本的1%,但能显著增强模型能力。从DeepSeek-V3的训练成本结构可见——预训练花费约532.8万美元,后训练仅1万美元。业界在训练模型时后训练阶段投入极低,但随着强化学习方式的普及,资金投入将向后训练阶段倾斜。GRPO方法(Group Relative Policy Optimization)是DeepSeek在强化学习上的创新,省去了传统PPO方法中需要额外训练价值网络的步骤,利用“组内比较”评估表现,节省计算资源的同时使训练更稳定高效。Kimi在1月22日发布的k1.5也证明了强化学习之路的可行性,在AIME上达到77.5,在MATH 500上达到96.2,与OpenAI的o1相媲美。DeepSeek-R1的开源让全球开发者可免费获取强化学习训练的技术细节,大幅降低了大模型能力提升的技术门槛和资金门槛,预计2025年将迎来大模型能力的新一轮爆发。
| 阶段 | DeepSeek-V3成本 | 占训练总成本比例 |
|---|---|---|
| 预训练(Pre-Training) | 约532.8万美元 | 约95.5% |
| 上下文扩展 | 约23.8万美元 | 约4.3% |
| 后训练(Post-Training) | 约1万美元 | 约0.2% |
| 总计 | 约557.6万美元 | 100% |
强化学习新范式下的行业格局变化——“技术之争”转向“生态之争”
强化学习新范式并不意味着预训练的结束。由于后训练能力仍很大程度取决于基座模型(预训练),头部科技公司仍将兼顾“预训练”与“强化学习”。马斯克2025年1月表示Grok 3预训练阶段已结束,发布在即;Meta在2024Q4业绩会上表示Llama4或于本季度发布;Sam Altman表示OpenAI将持续推动开发小型高性能推理模型,同时推进GPT-6/7研发。但对于AI后发者而言,提高强化学习投入成为性价比更高的策略。大模型技术差距正在快速缩短,互联网厂商在AI领域的竞争将从“技术之争”转向“生态之争”和“应用之争”。看好具有生态优势的互联网平台——腾讯(微信入口)、阿里巴巴(电商与云)、小米(人车家生态)等通过这一策略进一步提升其模型能力和应用场景。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
AI产业
23页
8张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录