您的当前位置:首页 > 标签 > AI推理能力突破
【信达证券】电子行业专题研究(普通):Deepseek R1是AGI的里程碑,中长期利好算力硬件-250204(17页).pdf
AI推理能力突破:DeepSeek R1比肩o1,o3-mini八秒克隆应用与DeepResearch发布|信达证券
信达证券研报显示,DeepSeek R1性能对标OpenAI o1,o3-mini仅8秒克隆应用、物理推理能力突出。DeepResearch得分26.6%远超GPT-4o,AI推理能力持续突破。
 2026-07-30
 电子行业
 17页
1张图表
数据来源:
【信达证券】电子行业专题研究(普通):Deepseek R1是AGI的里程碑,中长期利好算力硬件-250204(17页) 查看报告
AI推理能力的突破正在加速。信达证券研报指出,DeepSeek-R1在推理任务上实现与OpenAI-o1-1217相当的性能。面对DeepSeek的挑战,OpenAI发布了o3-mini——仅8秒时间就可克隆一个应用、物理推理能力突出、能生成四维空间物理模拟。此外,OpenAI还发布了DeepResearch,在“人类终极考试”中得分26.6%,远超GPT-4o的3.3%和o1的9.1%。AI推理能力的提升正推动AGI商业化奇点临近。

DeepSeek-R1——推理能力比肩OpenAI o1

DeepSeek-R1在推理任务上实现与OpenAI-o1-1217相当的性能。在AIME 2024、MATH-500、GPQA Diamond等多项基准测试中,DeepSeek-R1表现接近或超越o1模型。蒸馏小模型DeepSeek-R1-Distill-Qwen-32B在AIME 2024得分72.6%、MATH-500达94.3%、LiveCodeBench达57.2%,可与o1-mini相媲美。

DeepSeek证明较大模型的推理模式可以提炼成较小的模型,性能更好。开源检查点覆盖1.5B到70B六个规模,使研究社区能够在不同资源约束下部署高性能推理模型。

o3-mini——物理推理与编程能力的飞跃

为了应对DeepSeek的挑战,OpenAI发布了o3-mini。在物理模拟高难度挑战中,o3-mini展现惊人实力。在模拟小球转动时,o3-mini具备更强的物理推理能力,而DeepSeek R1出现了反重力现象。o3-mini能生成四维空间内小球的弹射程序,展现很高潜力。

编程能力方面,用户仅需一个提示,o3-mini就能在8秒内用单个Python文件写一个Twitter克隆应用。此外,o3-mini还可以用单个提示生成贪吃蛇、射击等游戏,编程能力让人惊叹。o3-mini理解物理世界的能力突出,是AI从“语言模型”走向“世界模型”的关键一步。

DeepResearch——研究分析级别AI代理

DeepResearch是OpenAI新发布的代理——仅需一个提示,ChatGPT可查找、分析和综合数百个在线资源,创建研究分析师级别的综合报告。由针对Web浏览和数据分析优化的o3模型版本支持,利用推理搜索、解释和分析互联网上的大量文本、图像和PDF。

在“人类终极考试”中,DeepResearch得分26.6%,远超GPT-4o的3.3%、o1的9.1%、o3-mini的13.0%。专家级别任务通过率同样显著领先。DeepResearch的发布标志着AI从“问答工具”向“研究助理”的跃迁。

推理能力突破的产业意义

推理能力的持续突破正推动AI从“简单问答”走向“深度推理”。DeepSeek与OpenAI的竞争表明推理能力是当前大模型竞争的核心战场。o3-mini在物理世界理解方面的突破,为AI在自动驾驶、机器人等物理世界交互场景的应用奠定了基础。

DeepResearch则展示了AI在知识工作领域的巨大潜力——研究分析、报告撰写、信息综合等知识密集型工作正面临AI的深度渗透。扎克伯格预测,未来每个企业都将拥有客户可交互的AI代理,这一时点正在逐步临近。
表:主要推理模型性能与定价对比
模型AIME 2024输入定价(百万tokens)输出定价(百万tokens)
DeepSeek-R179.8%$0.55(缓存未命中)$2.19
OpenAI o3-mini$1.10(缓存未命中)$4.40
OpenAI o1$15.00(缓存未命中)$60.00
GPT-4o13.4%$2.50(缓存未命中)$10.00
客服
商务合作
小程序
服务号
折叠