您的当前位置:首页 > 标签 > DeepSeek模型技术创新
【信达证券】电子行业专题研究(普通):Deepseek R1是AGI的里程碑,中长期利好算力硬件-250204(17页).pdf
DeepSeek模型技术创新:纯RL训练突破推理能力,2.664M GPU小时低成本路径|信达证券
信达证券研报显示,DeepSeek-R1-Zero首次验证纯RL可激励LLM推理能力、无需SFT,671B MoE模型仅2.664M GPU小时训练。蒸馏小模型超越o1-mini,开源社区迎来里程碑。
 2026-07-30
 电子行业
 17页
1张图表
数据来源:
【信达证券】电子行业专题研究(普通):Deepseek R1是AGI的里程碑,中长期利好算力硬件-250204(17页) 查看报告
DeepSeek-R1的发布正在重塑AI开源社区的格局。信达证券研报指出,DeepSeek-R1-Zero首次验证了可通过纯粹强化学习(RL)激励大语言模型推理能力、而无需监督微调(SFT)的路径,这是研究界的重要里程碑。DeepSeek-V3仅以2.664M H800 GPU小时在14.8T tokens上完成预训练,总参数671B、每个令牌激活37B。DeepSeek开源了R1-Zero、R1及六个蒸馏小模型,部分测试上性能超越OpenAI o1-mini。算法创新为算力相对受限的团队开辟了新的追赶路径。

DeepSeek-V3——低成本高效训练的典范

DeepSeek-V3是强大的专家混合(MoE)语言模型,总参数671B,每个令牌激活37B参数。架构层面采用多头潜在注意力(MLA)和DeepSeekMoE架构,创新负载均衡策略和多标记预测(MTP)训练目标。预训练层面设计了FP8混合精度训练框架,首次在超大规模模型上验证了FP8训练的可行性。通过算法、框架和硬件协同设计,克服了跨节点MoE训练通信瓶颈,实现了近乎全计算通信折叠。

训练成本仅为2.664M H800 GPU小时,在14.8T tokens上完成预训练,经济成本极低。这一成本仅为Llama3系列模型的约7%,为算力相对匮乏的团队提供了可复制的低成本训练路径。

DeepSeek-R1-Zero——纯RL激励推理能力的里程碑

DeepSeek-R1-Zero通过大规模强化学习(RL)训练,没有监督微调(SFT)作为初步步骤。通过强化学习,模型自然而然地出现了许多强大而有趣的推理行为,包括自我验证、反射和生成长CoT等功能。这是第一个验证的开放研究——可以纯粹通过RL来激励LLMs推理能力而无需SFT,突破有望为该领域未来发展铺平道路。

DeepSeek-R1在RL之前结合了多阶段训练和冷启动数据,解决了R1-Zero在可读性和语言混合方面的挑战,在推理任务上实现了与OpenAI-o1-1217相当的性能。DeepSeek团队开源了R1-Zero、R1及基于Qwen和Llama的六个密集模型(1.5B-70B)。

蒸馏小模型——推理能力的高效迁移

DeepSeek证明较大模型的推理模式可以提炼成较小的模型,与通过RL在小型模型上发现的推理模式相比性能更好。DeepSeek-R1-Distill-Qwen-7B在AIME 2024取得55.5%,超过QwQ-32B-Preview。DeepSeek-R1-Distill-Qwen-32B在AIME 2024得分72.6%、MATH-500达94.3%、LiveCodeBench达57.2%,可与o1-mini相媲美。

开源检查点覆盖1.5B、7B、8B、14B、32B和70B六个规模,使研究社区能够在不同资源约束下部署高性能推理模型。蒸馏路线的成功意味着大模型推理能力可以高效迁移至小模型,降低了推理部署成本。

算法创新的产业意义

DeepSeek的成功是开源模型相对闭源模型的一次飞跃。在地缘政治等因素激励下,算法层面的追赶由算力相对匮乏的中国团队唱响号角。在通向AGI的道路上,算法创新和算力资源都是不可或缺的。

DeepSeek团队成功地大幅度降低了推理成本,推进了AI产业化。推理有望快速放量,文生文、文生视频、图生视频各类功能或快速迭代,使AI真正理解物理世界。大模型厂商的淘汰也将加速,无法超越开源模型的闭源大模型厂商或快速出清。
表:DeepSeek模型关键参数与性能
模型参数量训练成本AIME 2024MATH-500
DeepSeek-V3671B(激活37B)2.664M GPU小时
DeepSeek-R1671B79.8%97.3%
R1-Distill-Qwen-32B32B72.6%94.3%
R1-Distill-Llama-70B70B70.0%94.5%
客服
商务合作
小程序
服务号
折叠