您的当前位置:首页 > 标签 > 大模型编程能力趋势
【开源证券】计算机行业深度报告:AI编程,未来已来-250217(25页).pdf
大模型编程能力趋势:Claude 3.5达93.7%,o3超99%程序员|开源证券研究所
开源证券报告显示大模型编程能力持续跃升:Claude 3.5 Sonnet HumanEval得分93.7%,OpenAI o3 Codeforces达2727分。DeepSeek-V3比肩GPT-4o,豆包代码能力提升58%。长尾关键词:大模型编程能力趋势,Claude 3.5代码测试得分,OpenAI o3编程能力,国产大模型代码能力。
 2026-07-30
 信息技术
 25页
1张图表
数据来源:
【开源证券】计算机行业深度报告:AI编程,未来已来-250217(25页) 查看报告
大模型的编程能力正在以超预期的速度进化。开源证券研究所报告显示,Claude 3.5 Sonnet (new)在HumanEval代码生成测试中得分高达93.7%,OpenAI o3推理模型Codeforces得分2727、编程能力超过99%的人类程序员。国产大模型同步快速追赶——DeepSeek-V3代码场景比肩GPT-4o,豆包通用模型pro代码能力提升58%。大模型编程能力的持续跃升,为AI编程应用的繁荣奠定了坚实的基础底座。

海外大模型编程能力持续刷新纪录

2023年以来,国内外大模型的编程能力提升尤为显著,代码正确性和编程速度等方面快速改善。Claude系列模型是这一趋势的典型代表——2023年Claude 1.3的HumanEval代码生成测试得分仅为56%,Claude 2提升至71.2%,而2024年10月发布的Claude 3.5 Sonnet (new)版本得分飙升至93.7%,较Claude 1.3提升近38个百分点。

OpenAI在编程能力上的突破同样令人瞩目。2024年12月,OpenAI发布下一代推理模型o3,其Codeforces编程测评系统得分为2727,编程能力超过99%的人类程序员。o3-mini版本同样具备强大的编程能力,为开发者提供了不同成本与性能的选择。此前发布的o1-preview在编程任务中已展现出超越人类专家的能力,o3在此基础上进一步提升了推理深度和代码生成的准确性。

大模型编程能力的提升已从代码补全扩展到复杂工程任务处理。METR研究显示,在2个小时内的编程任务中,Claude 3.5 Sonnet和o1-preview在7项具有挑战性的研究工程任务中击败了50多名人类专家。在需要编写自定义内核优化前缀和运算的任务中,o1-preview不仅完成任务,还将运行时间压缩到0.64毫秒,超越最优秀人类专家解决方案的0.67毫秒。
主流大模型编程能力评测对比
模型评测基准得分发布时间
Claude 1.3HumanEval56%2023年
Claude 2HumanEval71.2%2023年
GPT-4oHumanEval90.2%2024年
Claude 3.5 SonnetHumanEval92.0%2024年
Claude 3.5 Sonnet (new)HumanEval93.7%2024年10月
OpenAI o3Codeforces2727分2024年12月

国产大模型代码能力快速补齐

国产大模型的编程能力在2024年下半年实现了显著跃升。2024年12月发布的DeepSeek-V3在算法类代码场景Codeforces测评中表现领先于市面上全部非o1类模型,在工程类代码场景SWE-Bench Verified中逼近Claude-3.5-Sonnet-1022。DeepSeek-V3的多项评测成绩超越了Qwen2.5-72B和Llama-3.1-405B等开源模型,性能上与GPT-4o和Claude-3.5-Sonnet不分伯仲。

字节跳动的豆包大模型同样在代码能力上实现了质的突破。2024年12月火山引擎FORCE原动力大会上,豆包通用模型pro完成新版本迭代,代码能力提升最为显著——较5月份版本代码能力提升58%,综合任务处理能力提升32%,推理能力提升13%,数学能力提升43%,专业知识领域能力提升54%。

2025年1月,豆包全新基础模型Doubao-1.5-pro正式发布,代码等方面的能力在多个公开评测基准上表现优异。讯飞星火4.0 Turbo底座同步全面升级,代码等七大核心能力全面提升,底座能力已全面对标OpenAI最新版GPT-4o。国产大模型已从"追赶者"转变为全球编程能力第一梯队的有力竞争者。

编程能力跃升驱动AI编程应用生态繁荣

大模型编程能力的持续提升正在催生丰富的AI编程应用生态。GitHub 2024年Octoverse报告显示,GitHub上的开发人员创建了7万多个新的公共和开源生成式AI项目,对GitHub上所有生成式AI项目的总贡献增加了近60%。开发者社区对AI编程工具的接受度正在快速提升。

编程能力的提升也直接推动了AI编程工具的商业化落地。GitHub Copilot生成的代码在Java和C++中的成功率超过90%,平均水平比人类更有效率。Cursor凭借流畅的产品体验,ARR从近乎零增长至6500万美元。Cognition推出的编程Agent Devin在SWE-bench测试中正确解决13.86%的真实世界GitHub问题,远超此前大模型最好表现。

国产AI编程应用同步涌现。字节跳动基于豆包大模型推出MarsCode和Trae,科大讯飞iFlyCode代码采纳率从30%提升至52%,卓易信息旗下艾普阳低代码IDE新品SnapDevelop已积累超2000户免费用户。大模型编程能力的持续跃升与AI编程应用的加速落地,正在形成正向循环的产业生态。

编程能力迭代的前瞻方向

大模型编程能力的迭代方向正从"代码生成正确率"向"复杂任务自主完成"演进。HumanEval等代码生成基准测试的得分差距正在收窄,头部模型已普遍达到90%以上,未来的竞争焦点将转向更复杂的工程任务处理能力。

SWE-Bench等真实世界GitHub问题解决基准正成为新的评测标准。Devin在该基准上13.86%的解决率虽远超此前4.80%的最好表现,但距离人类专家的水平仍有巨大差距。推理模型o3在Codeforces上超过99%人类程序员的表现,预示着大模型在算法竞赛级编程任务中已具备超越人类的能力。

国产大模型在编程能力上的追赶速度超出预期。DeepSeek-V3和豆包1.5-pro在多个评测基准上比肩全球前沿模型,为国产AI编程应用提供了自主可控的大模型底座。随着模型能力的持续迭代和训练成本的不断下降,AI编程有望从开发者工具演变为软件开发流程中的核心生产力引擎。
客服
商务合作
小程序
服务号
折叠