Scaling Law并未失效,而是正在向后训练和推理阶段转移。财通证券研报显示,o3模型在FrontierMath基准测试中将准确率从<2%提升至25.2%,证明了推理阶段Scaling Law的巨大潜力。DeepSeek-R1-Zero成为首个完全摒弃监督微调、完全依赖强化学习训练的大模型,AIME 2024成绩随RL训练持续提升。强化学习与测试时间缩放正在成为Scaling Law的新方向,AI产业正从“更大模型”转向“更聪明模型”的探索。
Scaling Law向后训练和推理阶段转移
英伟达CEO黄仁勋在CES 2025提出大模型三阶段框架:预训练、后训练和推理。此前业界讨论的Scaling Law主要指向预训练阶段——随着计算量、数据和参数增加模型性能幂律提升。OpenAI o1模型的推出带来LLM推理能力的重大飞跃,让研究者关注到新阶段同样存在Scaling Law。
OpenAI的公开课提出,不同任务的觉醒时间不同,存在快慢之分。部分任务对于高质量数据或算法的需求更高,但这并不意味着Scaling Law失效。Scaling Law更像指数衰减——随着时间的推移,研发人员将不得不更加努力才能获得进一步性能提升,这是Scaling Law的自然特征。
o3模型在Epoch AI FrontierMath基准测试中展现出突破性表现。所有现有产品在该测试中准确率均低于2%,而o3在激进测试时间设置下能达到25.2%的准确率。o3相较o1的巨大提升证明推理阶段Scaling Law仍有充足空间,LLM推理能力存在巨大的待挖掘潜力。
OpenAI的公开课提出,不同任务的觉醒时间不同,存在快慢之分。部分任务对于高质量数据或算法的需求更高,但这并不意味着Scaling Law失效。Scaling Law更像指数衰减——随着时间的推移,研发人员将不得不更加努力才能获得进一步性能提升,这是Scaling Law的自然特征。
o3模型在Epoch AI FrontierMath基准测试中展现出突破性表现。所有现有产品在该测试中准确率均低于2%,而o3在激进测试时间设置下能达到25.2%的准确率。o3相较o1的巨大提升证明推理阶段Scaling Law仍有充足空间,LLM推理能力存在巨大的待挖掘潜力。
| 阶段 | 核心变量 | Scaling Law表现 | 代表模型 |
|---|---|---|---|
| 预训练 | 计算量、数据量、参数规模 | 边际放缓 | GPT-4 |
| 后训练 | 强化学习训练时间 | 持续提升 | DeepSeek-R1-Zero |
| 推理 | 测试时间计算(思考时间) | 巨大潜力 | o3(FrontierMath 25.2%) |
DeepSeek-R1-Zero:纯强化学习训练验证新路径
DeepSeek-R1-Zero在技术路线上实现了突破性创新,成为首个完全摒弃监督微调环节、完全依赖强化学习训练的大语言模型。传统上,SFT作为大模型训练的核心环节,需要先通过人工标注数据进行监督训练,再结合强化学习优化。DeepSeek-R1-Zero创新性地采用纯强化学习训练框架,以DeepSeek-V3-Base为基础,通过群组相对策略优化算法实现训练效率与模型性能的双重提升。
随着RL训练推进,DeepSeek-R1-Zero的AIME 2024基准测试成绩稳定且持续提升。这证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,验证了后训练阶段强化学习Scaling Law的有效性。
DeepSeek团队进一步探索了将R1推理能力蒸馏到更小模型中的潜力。利用DeepSeek-R1生成的800K数据对Qwen和Llama系列小模型进行微调,发现经R1蒸馏的Qwen-32B在AIME 2024达72.6%,远超直接强化学习的版本(47.0%)。对小模型而言,蒸馏优于直接强化学习,大模型学到的推理模式在蒸馏中得到了有效传递。
随着RL训练推进,DeepSeek-R1-Zero的AIME 2024基准测试成绩稳定且持续提升。这证明了无监督或弱监督学习方法在提升模型推理能力方面的巨大潜力,验证了后训练阶段强化学习Scaling Law的有效性。
DeepSeek团队进一步探索了将R1推理能力蒸馏到更小模型中的潜力。利用DeepSeek-R1生成的800K数据对Qwen和Llama系列小模型进行微调,发现经R1蒸馏的Qwen-32B在AIME 2024达72.6%,远超直接强化学习的版本(47.0%)。对小模型而言,蒸馏优于直接强化学习,大模型学到的推理模式在蒸馏中得到了有效传递。
测试时间缩放:s1-32B以50美元成本验证新范式
斯坦福大学与华盛顿大学联合研究团队在李飞飞带领下,成功以低于50美元的训练成本开发出高性能AI推理模型s1-32B。团队运用“测试时缩放”技术,选择开源预训练模型Qwen2.5-32B-Instruct作为基座模型,使用仅1000个样本的蒸馏数据进行监督微调,最终获得s1-32B模型。
同日,上海交大团队提出LIMO“少即是多”观点,认为大模型的推理能力本质上是“潜伏”于预训练模型中的,关键在于如何通过精确的认知模板来“激活”这些内在能力。LIMO直接挑战了“监督式微调主要导致记忆而非泛化”的传统观点,证明高质量、小规模的数据远比低效的海量数据训练更能激发LLM的真正推理能力。
s1-32B与LIMO的共同启示:利用高质量数据集微调预训练模型,在小样本条件下可实现高性能的模型推理能力。研究重点正从“更多数据”转向“更高质量数据”和“更聪明的训练方法”,这是Scaling Law新范式探索的核心方向。
同日,上海交大团队提出LIMO“少即是多”观点,认为大模型的推理能力本质上是“潜伏”于预训练模型中的,关键在于如何通过精确的认知模板来“激活”这些内在能力。LIMO直接挑战了“监督式微调主要导致记忆而非泛化”的传统观点,证明高质量、小规模的数据远比低效的海量数据训练更能激发LLM的真正推理能力。
s1-32B与LIMO的共同启示:利用高质量数据集微调预训练模型,在小样本条件下可实现高性能的模型推理能力。研究重点正从“更多数据”转向“更高质量数据”和“更聪明的训练方法”,这是Scaling Law新范式探索的核心方向。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
15页
18张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录