大模型的推理能力能否有效传递给小模型?DeepSeek-R1-Distill系列给出了肯定的答案。财通证券报告显示,DeepSeek团队利用R1生成的800K数据对Qwen和Llama系列小模型进行微调,发布了覆盖1.5B至70B参数规模的R1-Distill系列模型。实验证明,经过R1蒸馏的小模型在推理能力上实现了显著提升,甚至超过了在这些小模型上直接进行强化学习的效果。Qwen-32B蒸馏模型在AIME 2024上取得72.6%的成绩,与o1-mini相当,而直接在Qwen-32B-Base上强化学习仅达到47.0%。
蒸馏 vs 直接RL训练——实证对比的颠覆性结论
DeepSeek团队进行了一项关键对比实验:在Qwen-32B模型上,分别采用直接强化学习和R1知识蒸馏两种方式训练,比较其在推理任务上的表现。
实验结果极具说服力。直接在Qwen-32B-Base上进行强化学习的DeepSeek-R1-Zero-Qwen-32B在AIME 2024上仅取得47.0%的成绩,达到QwQ-32B-Preview(50.0%)的水平。而经过R1蒸馏的Qwen-32B模型(DeepSeek-R1-Distill-Qwen-32B)在AIME 2024上取得72.6%的惊人成绩,在MATH-500上达94.3%,在LiveCodeBench上达57.2%,在GPQA Diamond上达62.1%。
这一结论的颠覆性在于:对于小模型而言,蒸馏优于直接强化学习。这意味着,与其在小模型上投入大量计算资源进行强化学习训练,不如利用大模型已经学到的推理模式通过蒸馏进行传递。R1学到的推理模式具有很强的通用性和可迁移性,能够通过蒸馏有效传递给其他模型。
实验结果极具说服力。直接在Qwen-32B-Base上进行强化学习的DeepSeek-R1-Zero-Qwen-32B在AIME 2024上仅取得47.0%的成绩,达到QwQ-32B-Preview(50.0%)的水平。而经过R1蒸馏的Qwen-32B模型(DeepSeek-R1-Distill-Qwen-32B)在AIME 2024上取得72.6%的惊人成绩,在MATH-500上达94.3%,在LiveCodeBench上达57.2%,在GPQA Diamond上达62.1%。
这一结论的颠覆性在于:对于小模型而言,蒸馏优于直接强化学习。这意味着,与其在小模型上投入大量计算资源进行强化学习训练,不如利用大模型已经学到的推理模式通过蒸馏进行传递。R1学到的推理模式具有很强的通用性和可迁移性,能够通过蒸馏有效传递给其他模型。
| 模型 | AIME 2024 | MATH-500 | GPQA Diamond |
|---|---|---|---|
| QwQ-32B-Preview | 50.0% | 90.6% | 54.5% |
| 直接RL训练 (R1-Zero-Qwen-32B) | 47.0% | 91.6% | 55.0% |
| R1蒸馏 (R1-Distill-Qwen-32B) | 72.6% | 94.3% | 62.1% |
R1-Distill系列——覆盖1.5B到70B的完整产品矩阵
DeepSeek-R1-Distill系列包含了6个不同参数规模的模型,覆盖了从边缘计算到云端部署的多种应用场景。
最小的是Qwen-1.5B蒸馏模型,在AIME 2024上取得28.9%,虽然绝对数值不高,但考虑到仅1.5B的参数规模,这一表现已经相当出色,适合在资源极度受限的设备上运行。Qwen-7B蒸馏模型在AIME 2024上达55.5%,MATH-500达92.8%,已经超过了GPT-4o的数学能力(MATH-500 74.6%)。Llama-8B蒸馏模型在AIME 2024上达50.4%,Codeforces评分达1205。
中大规模模型表现更为突出。Qwen-14B在AIME 2024上达69.7%,MATH-500达93.9%,LiveCodeBench达53.1%。Llama-70B在AIME 2024上达70.0%,GPQA Diamond达65.2%,Codeforces评分达1633。Qwen-32B则是系列中的性能冠军,AIME 2024 72.6%,MATH-500 94.3%,Codeforces 1691评分,与o1-mini性能相当。
最小的是Qwen-1.5B蒸馏模型,在AIME 2024上取得28.9%,虽然绝对数值不高,但考虑到仅1.5B的参数规模,这一表现已经相当出色,适合在资源极度受限的设备上运行。Qwen-7B蒸馏模型在AIME 2024上达55.5%,MATH-500达92.8%,已经超过了GPT-4o的数学能力(MATH-500 74.6%)。Llama-8B蒸馏模型在AIME 2024上达50.4%,Codeforces评分达1205。
中大规模模型表现更为突出。Qwen-14B在AIME 2024上达69.7%,MATH-500达93.9%,LiveCodeBench达53.1%。Llama-70B在AIME 2024上达70.0%,GPQA Diamond达65.2%,Codeforces评分达1633。Qwen-32B则是系列中的性能冠军,AIME 2024 72.6%,MATH-500 94.3%,Codeforces 1691评分,与o1-mini性能相当。
小模型应用场景——从边缘计算到实时推理
R1-Distill系列为小模型的应用开辟了新的可能性。传统上,小模型由于参数量限制,在复杂推理任务上表现不佳,只能用于简单的分类、生成等任务。R1-Distill证明了小模型也可以具备较强的推理能力。
在实时应用场景中,小模型的低延迟优势与R1蒸馏带来的推理能力相结合,可以支持更复杂的实时交互应用(如实时语音助手、在线编程辅助等)。在边缘计算场景中,1.5B和7B模型可以在手机、IoT设备等端侧运行,将大模型的推理能力带到本地,无需依赖云端API。在成本敏感场景中,32B和70B模型可以在保持与o1-mini相当推理能力的同时,大幅降低部署成本。
R1-Distill系列的成功验证了一条清晰的技术路径:先用大规模强化学习训练出具有强大推理能力的“教师模型”,再通过知识蒸馏将推理能力传递给参数更小、部署成本更低的“学生模型”。这种“大模型训练、小模型部署”的范式,可能是大模型商业化落地的最优解。
在实时应用场景中,小模型的低延迟优势与R1蒸馏带来的推理能力相结合,可以支持更复杂的实时交互应用(如实时语音助手、在线编程辅助等)。在边缘计算场景中,1.5B和7B模型可以在手机、IoT设备等端侧运行,将大模型的推理能力带到本地,无需依赖云端API。在成本敏感场景中,32B和70B模型可以在保持与o1-mini相当推理能力的同时,大幅降低部署成本。
R1-Distill系列的成功验证了一条清晰的技术路径:先用大规模强化学习训练出具有强大推理能力的“教师模型”,再通过知识蒸馏将推理能力传递给参数更小、部署成本更低的“学生模型”。这种“大模型训练、小模型部署”的范式,可能是大模型商业化落地的最优解。
R1蒸馏的技术细节——800K数据驱动的小模型进化
DeepSeek团队利用R1生成的800K数据对Qwen和Llama系列模型进行了微调,数据量虽不及一些大模型预训练所用的数十亿tokens,但经过筛选和精心设计的推理数据质量极高。
推理数据涵盖了多种类型的推理任务,包括数学、编程、科学、逻辑等,以长推理链(CoT)的形式呈现,包含了详细的推理步骤和解释。这些数据不仅包含了“正确答案”,更重要的是包含了“正确的推理过程”,使小模型能够学习到大模型的推理模式和方法论。
蒸馏训练的核心在于:小模型通过学习大模型生成的推理链,可以快速掌握复杂的推理技巧,避免了自己从零开始探索的高昂成本。这也解释了为什么蒸馏的效果优于在小模型上直接进行强化学习——蒸馏相当于让小模型站在巨人的肩膀上,直接学习已经验证有效的推理模式。
推理数据涵盖了多种类型的推理任务,包括数学、编程、科学、逻辑等,以长推理链(CoT)的形式呈现,包含了详细的推理步骤和解释。这些数据不仅包含了“正确答案”,更重要的是包含了“正确的推理过程”,使小模型能够学习到大模型的推理模式和方法论。
蒸馏训练的核心在于:小模型通过学习大模型生成的推理链,可以快速掌握复杂的推理技巧,避免了自己从零开始探索的高昂成本。这也解释了为什么蒸馏的效果优于在小模型上直接进行强化学习——蒸馏相当于让小模型站在巨人的肩膀上,直接学习已经验证有效的推理模式。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-31
券商
13页
12张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录