您的当前位置:首页 > 标签 > 知识蒸馏技术
财通证券:计算机行业专题报告DeepSeek-R1强化学习知识蒸馏比肩o1(13页).pdf
2026知识蒸馏技术:R1蒸馏Qwen-32B达72.6%超直接RL训练,小模型推理跃升趋势|财通证券
财通证券报告显示,DeepSeek-R1蒸馏Qwen-32B在AIME 2024达72.6%,远超直接强化学习的47.0%。R1-Distill系列覆盖1.5B-70B模型,Qwen-32B达o1-mini水平,证明蒸馏优于直接RL训练,为小模型部署提供新路径。
 2026-07-31
 券商
 13页
12张图表
数据来源:
财通证券:计算机行业专题报告DeepSeek-R1强化学习知识蒸馏比肩o1(13页) 查看报告
大模型的推理能力能否有效传递给小模型?DeepSeek-R1-Distill系列给出了肯定的答案。财通证券报告显示,DeepSeek团队利用R1生成的800K数据对Qwen和Llama系列小模型进行微调,发布了覆盖1.5B至70B参数规模的R1-Distill系列模型。实验证明,经过R1蒸馏的小模型在推理能力上实现了显著提升,甚至超过了在这些小模型上直接进行强化学习的效果。Qwen-32B蒸馏模型在AIME 2024上取得72.6%的成绩,与o1-mini相当,而直接在Qwen-32B-Base上强化学习仅达到47.0%。

蒸馏 vs 直接RL训练——实证对比的颠覆性结论

DeepSeek团队进行了一项关键对比实验:在Qwen-32B模型上,分别采用直接强化学习和R1知识蒸馏两种方式训练,比较其在推理任务上的表现。

实验结果极具说服力。直接在Qwen-32B-Base上进行强化学习的DeepSeek-R1-Zero-Qwen-32B在AIME 2024上仅取得47.0%的成绩,达到QwQ-32B-Preview(50.0%)的水平。而经过R1蒸馏的Qwen-32B模型(DeepSeek-R1-Distill-Qwen-32B)在AIME 2024上取得72.6%的惊人成绩,在MATH-500上达94.3%,在LiveCodeBench上达57.2%,在GPQA Diamond上达62.1%。

这一结论的颠覆性在于:对于小模型而言,蒸馏优于直接强化学习。这意味着,与其在小模型上投入大量计算资源进行强化学习训练,不如利用大模型已经学到的推理模式通过蒸馏进行传递。R1学到的推理模式具有很强的通用性和可迁移性,能够通过蒸馏有效传递给其他模型。
表:蒸馏 vs 直接RL训练在Qwen-32B上的对比
模型AIME 2024MATH-500GPQA Diamond
QwQ-32B-Preview50.0%90.6%54.5%
直接RL训练 (R1-Zero-Qwen-32B)47.0%91.6%55.0%
R1蒸馏 (R1-Distill-Qwen-32B)72.6%94.3%62.1%

R1-Distill系列——覆盖1.5B到70B的完整产品矩阵

DeepSeek-R1-Distill系列包含了6个不同参数规模的模型,覆盖了从边缘计算到云端部署的多种应用场景。

最小的是Qwen-1.5B蒸馏模型,在AIME 2024上取得28.9%,虽然绝对数值不高,但考虑到仅1.5B的参数规模,这一表现已经相当出色,适合在资源极度受限的设备上运行。Qwen-7B蒸馏模型在AIME 2024上达55.5%,MATH-500达92.8%,已经超过了GPT-4o的数学能力(MATH-500 74.6%)。Llama-8B蒸馏模型在AIME 2024上达50.4%,Codeforces评分达1205。

中大规模模型表现更为突出。Qwen-14B在AIME 2024上达69.7%,MATH-500达93.9%,LiveCodeBench达53.1%。Llama-70B在AIME 2024上达70.0%,GPQA Diamond达65.2%,Codeforces评分达1633。Qwen-32B则是系列中的性能冠军,AIME 2024 72.6%,MATH-500 94.3%,Codeforces 1691评分,与o1-mini性能相当。

小模型应用场景——从边缘计算到实时推理

R1-Distill系列为小模型的应用开辟了新的可能性。传统上,小模型由于参数量限制,在复杂推理任务上表现不佳,只能用于简单的分类、生成等任务。R1-Distill证明了小模型也可以具备较强的推理能力。

在实时应用场景中,小模型的低延迟优势与R1蒸馏带来的推理能力相结合,可以支持更复杂的实时交互应用(如实时语音助手、在线编程辅助等)。在边缘计算场景中,1.5B和7B模型可以在手机、IoT设备等端侧运行,将大模型的推理能力带到本地,无需依赖云端API。在成本敏感场景中,32B和70B模型可以在保持与o1-mini相当推理能力的同时,大幅降低部署成本。

R1-Distill系列的成功验证了一条清晰的技术路径:先用大规模强化学习训练出具有强大推理能力的“教师模型”,再通过知识蒸馏将推理能力传递给参数更小、部署成本更低的“学生模型”。这种“大模型训练、小模型部署”的范式,可能是大模型商业化落地的最优解。

R1蒸馏的技术细节——800K数据驱动的小模型进化

DeepSeek团队利用R1生成的800K数据对Qwen和Llama系列模型进行了微调,数据量虽不及一些大模型预训练所用的数十亿tokens,但经过筛选和精心设计的推理数据质量极高。

推理数据涵盖了多种类型的推理任务,包括数学、编程、科学、逻辑等,以长推理链(CoT)的形式呈现,包含了详细的推理步骤和解释。这些数据不仅包含了“正确答案”,更重要的是包含了“正确的推理过程”,使小模型能够学习到大模型的推理模式和方法论。

蒸馏训练的核心在于:小模型通过学习大模型生成的推理链,可以快速掌握复杂的推理技巧,避免了自己从零开始探索的高昂成本。这也解释了为什么蒸馏的效果优于在小模型上直接进行强化学习——蒸馏相当于让小模型站在巨人的肩膀上,直接学习已经验证有效的推理模式。
客服
商务合作
小程序
服务号
折叠