您的当前位置:首页 > 标签 > LLM代码生成能力对比
【海通国际】AI+编程:生成式AI带来颠覆式生产力跃迁-250611(149页).pdf
LLM代码生成能力对比:Claude 4.0 SWE-bench 80%,Qwen3开源70.7分超越GPT-4o|海通国际
海通国际对比LLM代码生成能力,Claude 4.0 SWE-bench达80%准确率,Qwen3开源模型70.7分超越GPT-4o,DeepSeek R1成本仅为GPT-01的3%。
 2026-07-27
 电子行业
 149页
1张图表
数据来源:
【海通国际】AI+编程:生成式AI带来颠覆式生产力跃迁-250611(149页) 查看报告
海通国际报告全面对比全球主流大模型代码生成能力。Anthropic Claude 4.0在SWE-bench verified测试中达80.2%准确率,领先OpenAI GPT-4.1(69.1%)和Gemini 2.5 Pro(63.2%)。国内Qwen3-235B-A22B以70.7分刷新开源模型历史最佳,超越Gemini 2.5 Pro的70.4分。DeepSeek R1推理成本仅为OpenAI GPT-01的3%。本报告深入解析各模型的技术优势与适用场景。

Claude 4.0领跑软件工程任务,准确率达80.2%

Anthropic Claude 4.0在软件工程任务中表现卓越,Claude Opus 4和Sonnet 4在SWE-bench verified测试分别达72.5%和72.7%准确率,启用并行测试后进一步提升至79.4%和80.2%,显著优于Claude Sonnet 3.7(62.3%)、OpenAI GPT-4.1(69.1%)和Gemini 2.5 Pro(63.2%)。Claude 4具备长记忆编码能力,可连续稳定运行长达数小时,适合复杂且持续时间长的Agent工作流。

OpenAI GPT-4.1上下文窗口达100万Token,SWE-bench 54.6%

GPT-4.1在SWE-bench Verified测试中得分54.6%,相比GPT-4o的33.2%大幅跃升。在HumanEval编码评估中接近人类高级工程师水准。GPT-4.1支持最长100万Token的上下文窗口,增强处理长任务和多文件工程能力。OpenAI以30亿美元收购Windsurf,强化超大规模代码库处理能力,目标实现“代理式”IDE体验。

Qwen3开源模型超越GPT-4o,支持119种编程语言

通义千问Qwen3-235B-A22B在LiveCodeBench v5编码基准中以70.7分刷新开源模型历史最佳,超过Gemini 2.5 Pro(70.4分)和GPT-4o(63.9分)。在HumanEval中取得87.6%准确率,生成代码冗余编辑率降至2%。Qwen3支持多达119种编程语言,在MultiIF多语言评估中以71.9分大幅领先LLaMA3(48.4)。部署资源仅为DeepSeek-R1的25%,性价比优势显著。

DeepSeek R1成本仅为GPT-01的3%,训练成本557万美元

DeepSeek R1模型每百万输入/输出token成本为0.55/2.19美元,仅为OpenAI GPT-01价格的3%。DeepSeek V3训练成本557.6万美元(278.8万H800 GPU小时),效率显著高于同行。通过低精度训练和MOE架构优化,推理成本下降82.5%,内存需求下降30%。DeepSeek R1在LiveCodeBench v5中以73.1%准确率排名前列,在Aider代码修复测试中准确率达61.8%。
表2:主流大模型代码生成能力对比
模型SWE-bench VerifiedLiveCodeBench v5HumanEval输入价格($/百万tokens)
Claude Sonnet 472.7% / 80.2%3.00
GPT-4.154.6%87.6%1.25-2.50
Gemini 2.5 Pro63.2%63.40.15-0.60
Qwen3-235B70.787.6%0.20-0.80
DeepSeek R149.2%73.183.5%0.55-2.19


并行测试模式
客服
商务合作
小程序
服务号
折叠