大模型训练范式正在被DeepSeek-R1-Zero重新定义。财通证券报告指出,R1-Zero成为首个完全摒弃监督微调环节、完全依赖强化学习训练的大语言模型。在没有任何人类标注数据教导“如何推理”的情况下,模型通过群组相对策略优化(GRPO)算法自主演化了强大的推理能力——AIME 2024基准测试得分从初始的15.6%持续提升至71.0%,达到与OpenAI-o1-0912相当的水平。训练过程中自发涌现的“顿悟现象”更揭示了AI自主推理能力形成的全新机制。
GRPO算法——无需SFT的强化学习新范式
DeepSeek-R1-Zero的技术突破建立在群组相对策略优化算法之上。GRPO通过构建智能体群体间的相对优势评估机制,在策略优化过程中最大化群体得分,实现了训练效率与模型性能的双重提升。
与传统强化学习算法(如PPO)需要单独训练价值网络不同,GRPO通过群体内相对比较来估算优势函数,大幅降低了训练的计算开销。同时,DeepSeek团队设计了多维度奖励模型——包含准确性奖励(评估模型输出的正确性)和格式规范奖励(确保生成内容具备清晰的推理逻辑),两者共同引导模型向高质量推理方向演化。
GRPO算法的核心创新在于:不是明确地教模型如何解决问题,而是只为其提供正确的激励,让它自主地开发先进的问题解决策略。这一思路的转变,使模型从“被动学习”转向“主动探索”,为AI自主学习能力的提升开辟了新路径。
与传统强化学习算法(如PPO)需要单独训练价值网络不同,GRPO通过群体内相对比较来估算优势函数,大幅降低了训练的计算开销。同时,DeepSeek团队设计了多维度奖励模型——包含准确性奖励(评估模型输出的正确性)和格式规范奖励(确保生成内容具备清晰的推理逻辑),两者共同引导模型向高质量推理方向演化。
GRPO算法的核心创新在于:不是明确地教模型如何解决问题,而是只为其提供正确的激励,让它自主地开发先进的问题解决策略。这一思路的转变,使模型从“被动学习”转向“主动探索”,为AI自主学习能力的提升开辟了新路径。
| 对比维度 | GRPO | 传统PPO |
|---|---|---|
| 价值网络 | 无需单独训练 | 需要训练Critic网络 |
| 优势评估 | 群体内相对比较 | 基于价值函数估计 |
| 计算开销 | 较低 | 较高 |
| 适用场景 | 推理能力优化 | 通用RL任务 |
训练曲线实证——从15.6%到71.0%的持续跃升
DeepSeek-R1-Zero的训练过程提供了强化学习有效性的有力实证。在AIME 2024基准测试中,模型平均pass@1得分从初始的15.6%持续提升至71.0%,呈现稳定且持续的增长曲线,最终达到与OpenAI-o1-0912相当的性能水平。
这一提升轨迹的关键在于:模型在训练过程中没有接触任何人类标注的“标准答案”或“推理范例”,纯粹通过试错和奖励信号的引导,自主探索出了有效的推理策略。训练初期的得分提升较慢,模型需要先建立基本的推理模式;随着训练的深入,模型逐步掌握了更复杂的推理技巧,得分增长速度加快。
更重要的是,R1-Zero在cons@64指标上达到86.7%,意味着模型能够通过多次采样找到正确答案的能力极强。这一指标对于需要高可靠性的实际应用场景尤为重要——即使单次推理不能保证完全正确,模型通过多次推理和投票机制能够达到极高的准确率。
这一提升轨迹的关键在于:模型在训练过程中没有接触任何人类标注的“标准答案”或“推理范例”,纯粹通过试错和奖励信号的引导,自主探索出了有效的推理策略。训练初期的得分提升较慢,模型需要先建立基本的推理模式;随着训练的深入,模型逐步掌握了更复杂的推理技巧,得分增长速度加快。
更重要的是,R1-Zero在cons@64指标上达到86.7%,意味着模型能够通过多次采样找到正确答案的能力极强。这一指标对于需要高可靠性的实际应用场景尤为重要——即使单次推理不能保证完全正确,模型通过多次推理和投票机制能够达到极高的准确率。
“顿悟现象”——AI推理中的自我反思与纠错
DeepSeek-R1-Zero训练过程中出现的“顿悟现象”是理解AI自主学习能力的关键线索。在训练的中间阶段,模型展现出了类似人类“灵光一现”的行为模式——自发地重新评估之前的推理步骤,发现错误并进行修正,甚至探索解决问题的替代方法。
报告中的典型案例显示,模型在求解复杂方程的过程中,当发现之前的推导可能有误时,主动暂停并反思:“Wait, wait. Wait. That's an aha moment I can flag here. Let's reevaluate this step-by-step.”随后模型重新审视了每个推导步骤,修正了错误方向,最终得出了正确答案。
这种行为的涌现具有重要的研究意义。它表明,在适当的强化学习框架下,AI模型可以自主发展出“元认知”能力——即对自己的思考过程进行监控、评估和调整的能力。这种能力在过去被认为需要复杂的架构设计或人类示范才能实现,而R1-Zero证明纯RL训练也能激发出类似的行为。
报告中的典型案例显示,模型在求解复杂方程的过程中,当发现之前的推导可能有误时,主动暂停并反思:“Wait, wait. Wait. That's an aha moment I can flag here. Let's reevaluate this step-by-step.”随后模型重新审视了每个推导步骤,修正了错误方向,最终得出了正确答案。
这种行为的涌现具有重要的研究意义。它表明,在适当的强化学习框架下,AI模型可以自主发展出“元认知”能力——即对自己的思考过程进行监控、评估和调整的能力。这种能力在过去被认为需要复杂的架构设计或人类示范才能实现,而R1-Zero证明纯RL训练也能激发出类似的行为。
无监督学习的产业意义——减少对标注数据的依赖
DeepSeek-R1-Zero的成功对AI产业具有深远影响。传统大模型训练高度依赖大规模高质量标注数据,获取这些数据的成本极高,尤其对于需要专业知识的领域(如医疗、法律、高等数学等),标注难度和成本更是呈指数级增长。
R1-Zero证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,对于难以获取大量高质量标注数据的领域具有重要意义。通过强化学习,模型可以利用相对容易获取的“结果正确性”信号(而非过程标注)来学习复杂的推理能力。
这一技术突破有望降低大模型训练的数据门槛,使更多组织和开发者能够参与到先进AI模型的训练中来。同时,R1-Zero展示的纯强化学习路径为大模型的scaling提供了新的工程化方向——不仅仅依靠更大的数据和更多的参数,还可以通过更智能的训练范式来提升模型能力。
R1-Zero证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,对于难以获取大量高质量标注数据的领域具有重要意义。通过强化学习,模型可以利用相对容易获取的“结果正确性”信号(而非过程标注)来学习复杂的推理能力。
这一技术突破有望降低大模型训练的数据门槛,使更多组织和开发者能够参与到先进AI模型的训练中来。同时,R1-Zero展示的纯强化学习路径为大模型的scaling提供了新的工程化方向——不仅仅依靠更大的数据和更多的参数,还可以通过更智能的训练范式来提升模型能力。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-31
券商
13页
12张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录