您的当前位置:首页 > 标签 > 大模型强化学习训练
资讯科技行业大模型深度:DeepSeek带来互联网新格局-250215(23页).pdf
2026大模型强化学习训练:DeepSeek-R1训练成本仅1万美元,技术平权开启新范式|兴证国际
兴证国际研报显示DeepSeek-V3后训练仅1万美元,R1-Zero在AIME得分从15.6%升至71%。强化学习+开源,大模型训练从万亿级预训练转向低成本后训练,行业格局如何重塑?
 2026-07-30
 AI产业
 23页
8张图表
数据来源:
资讯科技行业大模型深度:DeepSeek带来互联网新格局-250215(23页) 查看报告
大模型能力提升的路径正在被重新定义。兴证国际《大模型深度:DeepSeek带来互联网新格局》报告指出,2024H2海外头部大模型推出节奏明显放缓,根本原因在于预训练阶段的算力提升陷入瓶颈——GPT-4到GPT-5需要100倍算力提升,10万卡超算中心物料成本高达40亿美元。DeepSeek-R1的开源则指明了另一条路:在后训练阶段通过强化学习显著提升模型能力,R1-Zero在AIME 2024中的得分从15.6%跃升至71.0%。本文从算力瓶颈、技术突破、产业影响三个维度,解析大模型强化学习训练的行业意义。

预训练算力瓶颈显现,算力集群建设成本与时间双重制约

2024H2,全球头部大模型的上新动力明显放缓。OpenAI选择将o1-pro模型保密,利用计算资源训练o3等更高级模型;Anthropic完成了Claude3.5 Opus训练但未公开发布,转而利用其生成合成数据改进Claude3.5 Sonnet。放缓的深层原因是算力瓶颈。根据SemiAnalysis数据,GPT-4训练算力约为2.15e25 FLOPS,谷歌Gemini、Llama、Claude等最新模型所用算力提升有限。OpenAI前首席科学家Bob McGrew指出,从GPT-4到GPT-5预计需要100倍的算力提升,但在GPT-5正式发布之前,市场会先迎来算力提升10倍的过渡版本。算力集群的建设面临巨大挑战——10万卡超算中心的物料成本高达40亿美元(不含土地、建筑外壳),从芯片发货到组网耗时近1年。高昂的成本和漫长的建设周期,使单纯依靠预训练堆算力的路径面临边际效益递减的困境,为新的技术路径的出现创造了条件。

DeepSeek证明强化学习是模型能力提升的第二条路

OpenAI在2024年9月推出的o1模型首次证明了后训练端强化学习的价值:“在足够强大的模型上应用强化学习进行训练,能够使该模型学会推理,并实现性能提升。”然而o1的闭源使行业复现难度极大,OpenAI隐藏了思维链细节。2025年1月,DeepSeek-R1发布并开源,真正意义上实现了“技术平权”。DeepSeek不仅开源了R1推理模型,还同步开源了R1-Zero(通过大规模强化学习训练,完全没有监督微调作为初始步骤)。R1-Zero在AIME 2024中的pass@1得分从15.6%提高到71.0%,多数投票下进一步升至86.7%,可与OpenAI-o1-0912媲美。R1-Zero在训练过程中自动出现了“顿悟时刻”——模型自行学会了用更长的思维链进行深度思考,响应平均时长从约150 token提升至约1,800 token。DeepSeek-R1在Chatbot Arena排行榜已排名第三,成为首个登顶全球前三的国产大模型。

强化学习是性价比极高的路径,微调成本通常小于预训练1%

后训练阶段的强化学习投入具有极高的性价比。根据论文《AI capabilities can be significantly improved without expensive retraining》的论述,微调成本通常小于原始训练成本的1%,但能显著增强模型能力。从DeepSeek-V3的训练成本结构可见——预训练花费约532.8万美元,后训练仅1万美元。业界在训练模型时后训练阶段投入极低,但随着强化学习方式的普及,资金投入将向后训练阶段倾斜。GRPO方法(Group Relative Policy Optimization)是DeepSeek在强化学习上的创新,省去了传统PPO方法中需要额外训练价值网络的步骤,利用“组内比较”评估表现,节省计算资源的同时使训练更稳定高效。Kimi在1月22日发布的k1.5也证明了强化学习之路的可行性,在AIME上达到77.5,在MATH 500上达到96.2,与OpenAI的o1相媲美。DeepSeek-R1的开源让全球开发者可免费获取强化学习训练的技术细节,大幅降低了大模型能力提升的技术门槛和资金门槛,预计2025年将迎来大模型能力的新一轮爆发。
DeepSeek-V3与DeepSeek-R1成本结构对比
阶段DeepSeek-V3成本占训练总成本比例
预训练(Pre-Training)约532.8万美元约95.5%
上下文扩展约23.8万美元约4.3%
后训练(Post-Training)约1万美元约0.2%
总计约557.6万美元100%

强化学习新范式下的行业格局变化——“技术之争”转向“生态之争”

强化学习新范式并不意味着预训练的结束。由于后训练能力仍很大程度取决于基座模型(预训练),头部科技公司仍将兼顾“预训练”与“强化学习”。马斯克2025年1月表示Grok 3预训练阶段已结束,发布在即;Meta在2024Q4业绩会上表示Llama4或于本季度发布;Sam Altman表示OpenAI将持续推动开发小型高性能推理模型,同时推进GPT-6/7研发。但对于AI后发者而言,提高强化学习投入成为性价比更高的策略。大模型技术差距正在快速缩短,互联网厂商在AI领域的竞争将从“技术之争”转向“生态之争”和“应用之争”。看好具有生态优势的互联网平台——腾讯(微信入口)、阿里巴巴(电商与云)、小米(人车家生态)等通过这一策略进一步提升其模型能力和应用场景。
客服
商务合作
小程序
服务号
折叠