大模型的编程能力正在以超预期的速度进化。开源证券研究所报告显示,Claude 3.5 Sonnet (new)在HumanEval代码生成测试中得分高达93.7%,OpenAI o3推理模型Codeforces得分2727、编程能力超过99%的人类程序员。国产大模型同步快速追赶——DeepSeek-V3代码场景比肩GPT-4o,豆包通用模型pro代码能力提升58%。大模型编程能力的持续跃升,为AI编程应用的繁荣奠定了坚实的基础底座。
海外大模型编程能力持续刷新纪录
2023年以来,国内外大模型的编程能力提升尤为显著,代码正确性和编程速度等方面快速改善。Claude系列模型是这一趋势的典型代表——2023年Claude 1.3的HumanEval代码生成测试得分仅为56%,Claude 2提升至71.2%,而2024年10月发布的Claude 3.5 Sonnet (new)版本得分飙升至93.7%,较Claude 1.3提升近38个百分点。
OpenAI在编程能力上的突破同样令人瞩目。2024年12月,OpenAI发布下一代推理模型o3,其Codeforces编程测评系统得分为2727,编程能力超过99%的人类程序员。o3-mini版本同样具备强大的编程能力,为开发者提供了不同成本与性能的选择。此前发布的o1-preview在编程任务中已展现出超越人类专家的能力,o3在此基础上进一步提升了推理深度和代码生成的准确性。
大模型编程能力的提升已从代码补全扩展到复杂工程任务处理。METR研究显示,在2个小时内的编程任务中,Claude 3.5 Sonnet和o1-preview在7项具有挑战性的研究工程任务中击败了50多名人类专家。在需要编写自定义内核优化前缀和运算的任务中,o1-preview不仅完成任务,还将运行时间压缩到0.64毫秒,超越最优秀人类专家解决方案的0.67毫秒。
OpenAI在编程能力上的突破同样令人瞩目。2024年12月,OpenAI发布下一代推理模型o3,其Codeforces编程测评系统得分为2727,编程能力超过99%的人类程序员。o3-mini版本同样具备强大的编程能力,为开发者提供了不同成本与性能的选择。此前发布的o1-preview在编程任务中已展现出超越人类专家的能力,o3在此基础上进一步提升了推理深度和代码生成的准确性。
大模型编程能力的提升已从代码补全扩展到复杂工程任务处理。METR研究显示,在2个小时内的编程任务中,Claude 3.5 Sonnet和o1-preview在7项具有挑战性的研究工程任务中击败了50多名人类专家。在需要编写自定义内核优化前缀和运算的任务中,o1-preview不仅完成任务,还将运行时间压缩到0.64毫秒,超越最优秀人类专家解决方案的0.67毫秒。
| 模型 | 评测基准 | 得分 | 发布时间 |
|---|---|---|---|
| Claude 1.3 | HumanEval | 56% | 2023年 |
| Claude 2 | HumanEval | 71.2% | 2023年 |
| GPT-4o | HumanEval | 90.2% | 2024年 |
| Claude 3.5 Sonnet | HumanEval | 92.0% | 2024年 |
| Claude 3.5 Sonnet (new) | HumanEval | 93.7% | 2024年10月 |
| OpenAI o3 | Codeforces | 2727分 | 2024年12月 |
国产大模型代码能力快速补齐
国产大模型的编程能力在2024年下半年实现了显著跃升。2024年12月发布的DeepSeek-V3在算法类代码场景Codeforces测评中表现领先于市面上全部非o1类模型,在工程类代码场景SWE-Bench Verified中逼近Claude-3.5-Sonnet-1022。DeepSeek-V3的多项评测成绩超越了Qwen2.5-72B和Llama-3.1-405B等开源模型,性能上与GPT-4o和Claude-3.5-Sonnet不分伯仲。
字节跳动的豆包大模型同样在代码能力上实现了质的突破。2024年12月火山引擎FORCE原动力大会上,豆包通用模型pro完成新版本迭代,代码能力提升最为显著——较5月份版本代码能力提升58%,综合任务处理能力提升32%,推理能力提升13%,数学能力提升43%,专业知识领域能力提升54%。
2025年1月,豆包全新基础模型Doubao-1.5-pro正式发布,代码等方面的能力在多个公开评测基准上表现优异。讯飞星火4.0 Turbo底座同步全面升级,代码等七大核心能力全面提升,底座能力已全面对标OpenAI最新版GPT-4o。国产大模型已从"追赶者"转变为全球编程能力第一梯队的有力竞争者。
字节跳动的豆包大模型同样在代码能力上实现了质的突破。2024年12月火山引擎FORCE原动力大会上,豆包通用模型pro完成新版本迭代,代码能力提升最为显著——较5月份版本代码能力提升58%,综合任务处理能力提升32%,推理能力提升13%,数学能力提升43%,专业知识领域能力提升54%。
2025年1月,豆包全新基础模型Doubao-1.5-pro正式发布,代码等方面的能力在多个公开评测基准上表现优异。讯飞星火4.0 Turbo底座同步全面升级,代码等七大核心能力全面提升,底座能力已全面对标OpenAI最新版GPT-4o。国产大模型已从"追赶者"转变为全球编程能力第一梯队的有力竞争者。
编程能力跃升驱动AI编程应用生态繁荣
大模型编程能力的持续提升正在催生丰富的AI编程应用生态。GitHub 2024年Octoverse报告显示,GitHub上的开发人员创建了7万多个新的公共和开源生成式AI项目,对GitHub上所有生成式AI项目的总贡献增加了近60%。开发者社区对AI编程工具的接受度正在快速提升。
编程能力的提升也直接推动了AI编程工具的商业化落地。GitHub Copilot生成的代码在Java和C++中的成功率超过90%,平均水平比人类更有效率。Cursor凭借流畅的产品体验,ARR从近乎零增长至6500万美元。Cognition推出的编程Agent Devin在SWE-bench测试中正确解决13.86%的真实世界GitHub问题,远超此前大模型最好表现。
国产AI编程应用同步涌现。字节跳动基于豆包大模型推出MarsCode和Trae,科大讯飞iFlyCode代码采纳率从30%提升至52%,卓易信息旗下艾普阳低代码IDE新品SnapDevelop已积累超2000户免费用户。大模型编程能力的持续跃升与AI编程应用的加速落地,正在形成正向循环的产业生态。
编程能力的提升也直接推动了AI编程工具的商业化落地。GitHub Copilot生成的代码在Java和C++中的成功率超过90%,平均水平比人类更有效率。Cursor凭借流畅的产品体验,ARR从近乎零增长至6500万美元。Cognition推出的编程Agent Devin在SWE-bench测试中正确解决13.86%的真实世界GitHub问题,远超此前大模型最好表现。
国产AI编程应用同步涌现。字节跳动基于豆包大模型推出MarsCode和Trae,科大讯飞iFlyCode代码采纳率从30%提升至52%,卓易信息旗下艾普阳低代码IDE新品SnapDevelop已积累超2000户免费用户。大模型编程能力的持续跃升与AI编程应用的加速落地,正在形成正向循环的产业生态。
编程能力迭代的前瞻方向
大模型编程能力的迭代方向正从"代码生成正确率"向"复杂任务自主完成"演进。HumanEval等代码生成基准测试的得分差距正在收窄,头部模型已普遍达到90%以上,未来的竞争焦点将转向更复杂的工程任务处理能力。
SWE-Bench等真实世界GitHub问题解决基准正成为新的评测标准。Devin在该基准上13.86%的解决率虽远超此前4.80%的最好表现,但距离人类专家的水平仍有巨大差距。推理模型o3在Codeforces上超过99%人类程序员的表现,预示着大模型在算法竞赛级编程任务中已具备超越人类的能力。
国产大模型在编程能力上的追赶速度超出预期。DeepSeek-V3和豆包1.5-pro在多个评测基准上比肩全球前沿模型,为国产AI编程应用提供了自主可控的大模型底座。随着模型能力的持续迭代和训练成本的不断下降,AI编程有望从开发者工具演变为软件开发流程中的核心生产力引擎。
SWE-Bench等真实世界GitHub问题解决基准正成为新的评测标准。Devin在该基准上13.86%的解决率虽远超此前4.80%的最好表现,但距离人类专家的水平仍有巨大差距。推理模型o3在Codeforces上超过99%人类程序员的表现,预示着大模型在算法竞赛级编程任务中已具备超越人类的能力。
国产大模型在编程能力上的追赶速度超出预期。DeepSeek-V3和豆包1.5-pro在多个评测基准上比肩全球前沿模型,为国产AI编程应用提供了自主可控的大模型底座。随着模型能力的持续迭代和训练成本的不断下降,AI编程有望从开发者工具演变为软件开发流程中的核心生产力引擎。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
信息技术
25页
1张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录