您的当前位置:首页 > 标签 > 强化学习训练范式
财通证券:计算机行业专题报告DeepSeek-R1强化学习知识蒸馏比肩o1(13页).pdf
2026强化学习训练范式:GRPO算法驱动R1-Zero从15.6%升至71.0%,无SFT推理突破|财通证券
财通证券报告显示,DeepSeek-R1-Zero成为首个完全摒弃监督微调、纯强化学习训练的大模型。GRPO算法驱动AIME 2024得分从15.6%持续升至71.0%。训练中出现“顿悟现象”——模型自主反思与修正推理路径,为减少对标注数据依赖提供了新范式。
 2026-07-31
 券商
 13页
12张图表
数据来源:
财通证券:计算机行业专题报告DeepSeek-R1强化学习知识蒸馏比肩o1(13页) 查看报告
大模型训练范式正在被DeepSeek-R1-Zero重新定义。财通证券报告指出,R1-Zero成为首个完全摒弃监督微调环节、完全依赖强化学习训练的大语言模型。在没有任何人类标注数据教导“如何推理”的情况下,模型通过群组相对策略优化(GRPO)算法自主演化了强大的推理能力——AIME 2024基准测试得分从初始的15.6%持续提升至71.0%,达到与OpenAI-o1-0912相当的水平。训练过程中自发涌现的“顿悟现象”更揭示了AI自主推理能力形成的全新机制。

GRPO算法——无需SFT的强化学习新范式

DeepSeek-R1-Zero的技术突破建立在群组相对策略优化算法之上。GRPO通过构建智能体群体间的相对优势评估机制,在策略优化过程中最大化群体得分,实现了训练效率与模型性能的双重提升。

与传统强化学习算法(如PPO)需要单独训练价值网络不同,GRPO通过群体内相对比较来估算优势函数,大幅降低了训练的计算开销。同时,DeepSeek团队设计了多维度奖励模型——包含准确性奖励(评估模型输出的正确性)和格式规范奖励(确保生成内容具备清晰的推理逻辑),两者共同引导模型向高质量推理方向演化。

GRPO算法的核心创新在于:不是明确地教模型如何解决问题,而是只为其提供正确的激励,让它自主地开发先进的问题解决策略。这一思路的转变,使模型从“被动学习”转向“主动探索”,为AI自主学习能力的提升开辟了新路径。
表:GRPO vs 传统RL算法对比
对比维度GRPO传统PPO
价值网络无需单独训练需要训练Critic网络
优势评估群体内相对比较基于价值函数估计
计算开销较低较高
适用场景推理能力优化通用RL任务

训练曲线实证——从15.6%到71.0%的持续跃升

DeepSeek-R1-Zero的训练过程提供了强化学习有效性的有力实证。在AIME 2024基准测试中,模型平均pass@1得分从初始的15.6%持续提升至71.0%,呈现稳定且持续的增长曲线,最终达到与OpenAI-o1-0912相当的性能水平。

这一提升轨迹的关键在于:模型在训练过程中没有接触任何人类标注的“标准答案”或“推理范例”,纯粹通过试错和奖励信号的引导,自主探索出了有效的推理策略。训练初期的得分提升较慢,模型需要先建立基本的推理模式;随着训练的深入,模型逐步掌握了更复杂的推理技巧,得分增长速度加快。

更重要的是,R1-Zero在cons@64指标上达到86.7%,意味着模型能够通过多次采样找到正确答案的能力极强。这一指标对于需要高可靠性的实际应用场景尤为重要——即使单次推理不能保证完全正确,模型通过多次推理和投票机制能够达到极高的准确率。

“顿悟现象”——AI推理中的自我反思与纠错

DeepSeek-R1-Zero训练过程中出现的“顿悟现象”是理解AI自主学习能力的关键线索。在训练的中间阶段,模型展现出了类似人类“灵光一现”的行为模式——自发地重新评估之前的推理步骤,发现错误并进行修正,甚至探索解决问题的替代方法。

报告中的典型案例显示,模型在求解复杂方程的过程中,当发现之前的推导可能有误时,主动暂停并反思:“Wait, wait. Wait. That's an aha moment I can flag here. Let's reevaluate this step-by-step.”随后模型重新审视了每个推导步骤,修正了错误方向,最终得出了正确答案。

这种行为的涌现具有重要的研究意义。它表明,在适当的强化学习框架下,AI模型可以自主发展出“元认知”能力——即对自己的思考过程进行监控、评估和调整的能力。这种能力在过去被认为需要复杂的架构设计或人类示范才能实现,而R1-Zero证明纯RL训练也能激发出类似的行为。

无监督学习的产业意义——减少对标注数据的依赖

DeepSeek-R1-Zero的成功对AI产业具有深远影响。传统大模型训练高度依赖大规模高质量标注数据,获取这些数据的成本极高,尤其对于需要专业知识的领域(如医疗、法律、高等数学等),标注难度和成本更是呈指数级增长。

R1-Zero证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,对于难以获取大量高质量标注数据的领域具有重要意义。通过强化学习,模型可以利用相对容易获取的“结果正确性”信号(而非过程标注)来学习复杂的推理能力。

这一技术突破有望降低大模型训练的数据门槛,使更多组织和开发者能够参与到先进AI模型的训练中来。同时,R1-Zero展示的纯强化学习路径为大模型的scaling提供了新的工程化方向——不仅仅依靠更大的数据和更多的参数,还可以通过更智能的训练范式来提升模型能力。
客服
商务合作
小程序
服务号
折叠