AI编程能力的飞跃正由“推理模型”驱动。财通证券报告指出,OpenAI o1在2024年9月开启大模型推理时代后,推理模型通过强化学习实现Codeforces编程竞赛得分显著跃升——相比基础通用模型提升2-3倍。2025年1月,DeepSeek R1发布,作为首个通过纯强化学习训练且无需监督微调的推理模型,性能比肩o1且成本显著更低。在BigCodeBench代码能力评估中,DeepSeek R1(第4)、DeepSeek V3(第8)等三家中国开源模型跻身前十,开源生态正加速追赶闭源前沿。
推理时代开启——从预训练到后训练的范式转移
大模型技术发展正进入“预训练放缓、后训练加速”的新阶段。2024年9月,OpenAI发布o1-preview与o1-mini,首次验证了强化学习(RL)与思维链(CoT)在大模型推理能力提升上的巨大潜力。模型厂商更重视思维链的延长、强化学习算法的创新、以及通过算法优化降低推理成本。
2024年12月,OpenAI发布o1正式版,比o1-preview更擅长编码、数学和写作,新增多模态功能(支持图片上传)。2025年1月,DeepSeek发布R1-Zero和R1,其中R1-Zero是首个通过纯强化学习训练且无需任何监督微调数据的模型,验证了强化学习Scaling在模型训练中的潜力。DeepSeek R1在问题解决能力上与OpenAI o1正式版相当,但API成本显著更低——输入token约o1的4%、输出token约o1的25%。
2025年1-2月,阿里Qwen2.5-Max在11项基准测试中优于DeepSeek V3和Meta Llama 3.1,OpenAI o3-mini比o1-mini响应速度提升24%、答案准确性也有所提高。推理模型已成为大模型迭代的主基调。
2024年12月,OpenAI发布o1正式版,比o1-preview更擅长编码、数学和写作,新增多模态功能(支持图片上传)。2025年1月,DeepSeek发布R1-Zero和R1,其中R1-Zero是首个通过纯强化学习训练且无需任何监督微调数据的模型,验证了强化学习Scaling在模型训练中的潜力。DeepSeek R1在问题解决能力上与OpenAI o1正式版相当,但API成本显著更低——输入token约o1的4%、输出token约o1的25%。
2025年1-2月,阿里Qwen2.5-Max在11项基准测试中优于DeepSeek V3和Meta Llama 3.1,OpenAI o3-mini比o1-mini响应速度提升24%、答案准确性也有所提高。推理模型已成为大模型迭代的主基调。
Codeforces得分验证——推理模型编程能力质的提升
Codeforces是全球程序员的在线编程竞赛平台,大模型在该平台的得分能直观反映算法设计、数据结构运用、代码实现等编程核心技能水平。数据显示,推理模型(通过强化学习实现推理能力提升)的Codeforces得分相比基础通用模型有显著跃升。
OpenAI o1系列模型的Codeforces得分约为前代GPT-4o的2-3倍,DeepSeek R1得分与o1系列接近。推理模型在编程竞赛中的优异表现,意味着其在复杂算法问题理解、多步骤逻辑推理、代码实现准确性等关键维度上实现了质的突破。推理性能的提升直接转化为AI编程产品的基座能力优化。
这一能力跃升的产业含义深远——AI编程工具从“代码补全”走向“智能编程”。o1系列在物理、化学和生物学基准任务上的表现超过人类博士生水平,Claude 3.5 Sonnet更新版新增“computer control”功能使AI能像人类一样与计算机交互,DeepSeek R1在数学、编码、逻辑能力上显著提升。AI编程产品正从辅助代码生成走向自主任务执行。
OpenAI o1系列模型的Codeforces得分约为前代GPT-4o的2-3倍,DeepSeek R1得分与o1系列接近。推理模型在编程竞赛中的优异表现,意味着其在复杂算法问题理解、多步骤逻辑推理、代码实现准确性等关键维度上实现了质的突破。推理性能的提升直接转化为AI编程产品的基座能力优化。
这一能力跃升的产业含义深远——AI编程工具从“代码补全”走向“智能编程”。o1系列在物理、化学和生物学基准任务上的表现超过人类博士生水平,Claude 3.5 Sonnet更新版新增“computer control”功能使AI能像人类一样与计算机交互,DeepSeek R1在数学、编码、逻辑能力上显著提升。AI编程产品正从辅助代码生成走向自主任务执行。
开源生态追赶——DeepSeek带动开源上限跃升
BigCodeBench是评估LLMs解决实际编程任务能力的权威基准,包含1140个函数级任务,考察LLMs遵循指令并将多个函数调用作为工具组合的能力。截至2025年2月4日,排名前十的模型中,DeepSeek R1(第4)、DeepSeek V3-Chat(第8)、Athene-V2-Chat(第10)均为开源大模型且来自中国,其余主要为o1、o3系列闭源模型。
当前闭源模型整体性能仍优于开源,基于闭源模型的产品优先实现了商业化。但DeepSeek R1遵循MIT开源协议(授予所有人免费使用、修改、再发布的权力),带动了开源能力上限的跃升。更多参与者加入生态将加速开源能力迭代,国内AI编程有望借开源生态实现弯道超车。
国内在软件生态融合与场景丰富度相比海外仍有差距,当前的软件生态需进行大量融合工作以提升对不同工程场景的适应力。但DeepSeek等开源模型的兴起可能改变AI编程产品格局——开源模型分离了底层模型训练与产品开发两个阶段,垂直行业公司与创业公司有望在AI编码市场获得更多机会。
当前闭源模型整体性能仍优于开源,基于闭源模型的产品优先实现了商业化。但DeepSeek R1遵循MIT开源协议(授予所有人免费使用、修改、再发布的权力),带动了开源能力上限的跃升。更多参与者加入生态将加速开源能力迭代,国内AI编程有望借开源生态实现弯道超车。
国内在软件生态融合与场景丰富度相比海外仍有差距,当前的软件生态需进行大量融合工作以提升对不同工程场景的适应力。但DeepSeek等开源模型的兴起可能改变AI编程产品格局——开源模型分离了底层模型训练与产品开发两个阶段,垂直行业公司与创业公司有望在AI编码市场获得更多机会。
推理模型的投资含义
推理模型的编程能力提升有两个层面的投资含义:第一,推理模型成本降低加速AI应用落地——o3-mini比o1-mini响应速度提升24%,DeepSeek R1 API定价仅为o1的4%,成本下降将推动AI编程工具在更广泛的场景中普及;第二,中长期推理算力需求持续增长——强化学习阶段Scaling继续演绎,推理任务对算力的消耗远高于训练阶段,国产算力链将持续受益。
| 排名 | 模型名称 | 代码完成得分 | 指令调整得分 | 平均得分 | 模型类型 |
|---|---|---|---|---|---|
| 1 | o1-2024-12-17 (high) | 38.5 | 32.4 | 35.5 | 闭源 |
| 2 | o3-mini-2025-01-31 (high) | 37.8 | 33.1 | 35.5 | 闭源 |
| 4 | DeepSeek-R1 | 40.5 | 29.7 | 35.1 | 开源(中国) |
| 8 | DeepSeek-V3-Chat | 39.9 | 27.7 | 33.8 | 开源(中国) |
| 10 | Athene-V2-Chat | 37.2 | 27.0 | 32.1 | 开源(中国) |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
计算机产业
18页
22张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录