DeepSeek-R1的发布正在重塑AI开源社区的格局。信达证券研报指出,DeepSeek-R1-Zero首次验证了可通过纯粹强化学习(RL)激励大语言模型推理能力、而无需监督微调(SFT)的路径,这是研究界的重要里程碑。DeepSeek-V3仅以2.664M H800 GPU小时在14.8T tokens上完成预训练,总参数671B、每个令牌激活37B。DeepSeek开源了R1-Zero、R1及六个蒸馏小模型,部分测试上性能超越OpenAI o1-mini。算法创新为算力相对受限的团队开辟了新的追赶路径。
DeepSeek-V3——低成本高效训练的典范
DeepSeek-V3是强大的专家混合(MoE)语言模型,总参数671B,每个令牌激活37B参数。架构层面采用多头潜在注意力(MLA)和DeepSeekMoE架构,创新负载均衡策略和多标记预测(MTP)训练目标。预训练层面设计了FP8混合精度训练框架,首次在超大规模模型上验证了FP8训练的可行性。通过算法、框架和硬件协同设计,克服了跨节点MoE训练通信瓶颈,实现了近乎全计算通信折叠。
训练成本仅为2.664M H800 GPU小时,在14.8T tokens上完成预训练,经济成本极低。这一成本仅为Llama3系列模型的约7%,为算力相对匮乏的团队提供了可复制的低成本训练路径。
训练成本仅为2.664M H800 GPU小时,在14.8T tokens上完成预训练,经济成本极低。这一成本仅为Llama3系列模型的约7%,为算力相对匮乏的团队提供了可复制的低成本训练路径。
DeepSeek-R1-Zero——纯RL激励推理能力的里程碑
DeepSeek-R1-Zero通过大规模强化学习(RL)训练,没有监督微调(SFT)作为初步步骤。通过强化学习,模型自然而然地出现了许多强大而有趣的推理行为,包括自我验证、反射和生成长CoT等功能。这是第一个验证的开放研究——可以纯粹通过RL来激励LLMs推理能力而无需SFT,突破有望为该领域未来发展铺平道路。
DeepSeek-R1在RL之前结合了多阶段训练和冷启动数据,解决了R1-Zero在可读性和语言混合方面的挑战,在推理任务上实现了与OpenAI-o1-1217相当的性能。DeepSeek团队开源了R1-Zero、R1及基于Qwen和Llama的六个密集模型(1.5B-70B)。
DeepSeek-R1在RL之前结合了多阶段训练和冷启动数据,解决了R1-Zero在可读性和语言混合方面的挑战,在推理任务上实现了与OpenAI-o1-1217相当的性能。DeepSeek团队开源了R1-Zero、R1及基于Qwen和Llama的六个密集模型(1.5B-70B)。
蒸馏小模型——推理能力的高效迁移
DeepSeek证明较大模型的推理模式可以提炼成较小的模型,与通过RL在小型模型上发现的推理模式相比性能更好。DeepSeek-R1-Distill-Qwen-7B在AIME 2024取得55.5%,超过QwQ-32B-Preview。DeepSeek-R1-Distill-Qwen-32B在AIME 2024得分72.6%、MATH-500达94.3%、LiveCodeBench达57.2%,可与o1-mini相媲美。
开源检查点覆盖1.5B、7B、8B、14B、32B和70B六个规模,使研究社区能够在不同资源约束下部署高性能推理模型。蒸馏路线的成功意味着大模型推理能力可以高效迁移至小模型,降低了推理部署成本。
开源检查点覆盖1.5B、7B、8B、14B、32B和70B六个规模,使研究社区能够在不同资源约束下部署高性能推理模型。蒸馏路线的成功意味着大模型推理能力可以高效迁移至小模型,降低了推理部署成本。
算法创新的产业意义
DeepSeek的成功是开源模型相对闭源模型的一次飞跃。在地缘政治等因素激励下,算法层面的追赶由算力相对匮乏的中国团队唱响号角。在通向AGI的道路上,算法创新和算力资源都是不可或缺的。
DeepSeek团队成功地大幅度降低了推理成本,推进了AI产业化。推理有望快速放量,文生文、文生视频、图生视频各类功能或快速迭代,使AI真正理解物理世界。大模型厂商的淘汰也将加速,无法超越开源模型的闭源大模型厂商或快速出清。
DeepSeek团队成功地大幅度降低了推理成本,推进了AI产业化。推理有望快速放量,文生文、文生视频、图生视频各类功能或快速迭代,使AI真正理解物理世界。大模型厂商的淘汰也将加速,无法超越开源模型的闭源大模型厂商或快速出清。
| 模型 | 参数量 | 训练成本 | AIME 2024 | MATH-500 |
|---|---|---|---|---|
| DeepSeek-V3 | 671B(激活37B) | 2.664M GPU小时 | — | — |
| DeepSeek-R1 | 671B | — | 79.8% | 97.3% |
| R1-Distill-Qwen-32B | 32B | — | 72.6% | 94.3% |
| R1-Distill-Llama-70B | 70B | — | 70.0% | 94.5% |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
17页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录