当前位置:首页 > 报告详情

广发证券:计算机行业比较试用DeepSeek看模型走向应用的新迹象(37页).pdf

上传人: AG 编号:605790 2024-12-29 37页 4.44MB

1、 识别风险,发现价值 请务必阅读末页的免责声明 1 1/3737 Table_Page 深度分析|计算机 证券研究报告 计算机行业计算机行业 比较试用比较试用 DeepSeek 看模型走向应用的新迹象看模型走向应用的新迹象 核心观点核心观点:DeepSeek-V3 上线,模型性能提升较快。上线,模型性能提升较快。2024 年 12 月,幻方旗下深度求索公司上线 DeepSeek-V3 系列模型首个版本,较前代模型DeepSeek-V2.5 有显著提升。为了深入探索该模型的能力,我们采用了覆盖逻辑、数学、代码、文本等领域的多个问题对模型进行测试,将其生成结果与豆包、Kimi 以及通义千问大模型生

2、成的结果进行比较。通过有限的实测通过有限的实测结果,结果,我们发现,我们发现,DeepSeek 总体能力与其他大模型总体能力与其他大模型相当,但在逻辑推理和代码生成领域具有自身特点相当,但在逻辑推理和代码生成领域具有自身特点。例如,在密文解码任务中,DeepSeek 是唯一给出正确答案的大模型;而在代码生成的任务中,DeepSeek 给出的代码注释、算法原理解释以及开发流程的指引最为全面。在文本生成和数学计算能力方面,DeepSeek 并未展现出明显优于其他大模型之处。DeepSeek-V3 通过数据与算法层面的优化,大幅提升算力利用效率,通过数据与算法层面的优化,大幅提升算力利用效率,实现了

3、协同效应。实现了协同效应。在大规模 MoE 模型的训练中,DeepSeek-V3 采用了高效的负载均衡策略、FP8 混合精度训练框架以及通信优化等一系列优化措施,显著降低了训练成本,以及通过优化 MoE 专家调度、引入冗余专家策略、以及通过长上下文蒸馏提升推理性能。证明了模型效果不仅依赖于算力投入,即使在硬件资源有限的情况下,依托数据与算法层面的优化创新,仍然可以高效利用算力,实现较好的模型效果。DeepSeek-V3 算力成本降低的原因有两点。算力成本降低的原因有两点。第一,DeepSeek-V3 采用的 DeepSeekMoE 是通过参考了各类训练方法后优化得到的,避开了行业内 AI 大模

4、型训练过程中的各类问题。第二,DeepSeek-V3 采用的 MLA 架构可以降低推理过程中的 kv 缓存开销,其训练方法在特定方向的选择也使得其算力成本有所降低。算力依然是推动大模型发展的核心驱动力。算力依然是推动大模型发展的核心驱动力。DeepSeek-V3 通过技术创新和资源优化,大幅降低了成本,展现了算力的高效性。在该技术路线得到充分验证后,有望驱动相关 AI 应用的快速发展,应用推理驱动算力需求增长的因素也有望得到增强。以大规模通用模型为基础,聚焦特定领域突出自身特点的模型应用开以大规模通用模型为基础,聚焦特定领域突出自身特点的模型应用开发或许是下一阶段的商业化探索方向。发或许是下一

5、阶段的商业化探索方向。DeepSeek-V3 为未来大模型技术的发展提供了重要启发,未来或将从依赖大规模通用模型转向发展一些更具特色、成本更低、更适合具体应用场景的模型,随着这些特色模型的不断成熟,AI 商业化的边际成本有望降低,应用前景更为广阔。风险提示风险提示:AI 大模型技术追赶和竞争加剧的风险。由于下游生态和使用环境的差异,商业化成功有不确定性。AI 生成内容存在知识版权纠纷的风险。行业评级行业评级 买入买入 前次评级 买入 报告日期 2024-12-29 相对市场表现相对市场表现 分析师:分析师:刘雪峰 SAC 执证号:S0260514030002 SFC CE No.BNX004

6、021-38003675 分析师:分析师:周源 SAC 执证号:S0260523040001 0755-23948351 请注意,周源并非香港证券及期货事务监察委员会的注册持牌人,不可在香港从事受监管活动。相关研究:相关研究:计算机行业:主题趋势轮动抢跑背景下的更多选择方向 2024-12-22 计算机行业:券商新一代核心交易系统招标打破僵局 2024-12-19 计算机行业:鸿蒙生态构建、代表性行业规模测算及推进节奏判断 2024-12-18 联系人:戴亚敏 021-38003697 -34%-22%-11%1%13%24%12/2302/2404/2406/2408/2410/24计算机沪

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
本文主要对DeepSeek-V3模型进行了深度分析。DeepSeek-V3是幻方旗下深度求索公司于2024年12月上线的新一代大模型,采用了MLA+MoE架构,总参数量为671B,每个token激活37B参数,在14.8T token上进行了预训练。 DeepSeek-V3在多项评测中超越了Qwen2.5-72B和Llama-3.1-405B等开源模型,并与全球顶尖闭源模型如GPT-4o和Claude-3.5-Sonnet处于同一水平。例如,在知识类任务(如MMLU、MMLU-Pro、GPQA、SimpleQA)上的表现较前代模型DeepSeek-V2.5有显著提升,接近当前最优模型Claude-3.5-Sonnet-1022。而在算法类代码任务(如Codeforces)中,DeepSeek-V3远超市面上所有非o1类模型,并在工程类代码任务(如SWE-Bench Verified)上接近Claude-3.5-Sonnet-1022的水平。 DeepSeek-V3通过数据与算法层面的优化,大幅提升算力利用效率,实现了协同效应。在大规模MoE模型的训练中,DeepSeek-V3采用了高效的负载均衡策略、FP8混合精度训练框架以及通信优化等一系列优化措施,显著降低了训练成本,以及通过优化MoE专家调度、引入冗余专家策略、以及通过长上下文蒸馏提升推理性能。证明了模型效果不仅依赖于算力投入,即使在硬件资源有限的情况下,依托数据与算法层面的优化创新,仍然可以高效利用算力,实现较好的模型效果。 DeepSeek-V3算力成本降低的原因有两点。第一,DeepSeek-V3采用的DeepSeekMoE是通过参考了各类训练方法后优化得到的,避开了行业内AI大模型训练过程中的各类问题。第二,DeepSeek-V3采用的MLA架构可以降低推理过程中的kv缓存开销,其训练方法在特定方向的选择也使得其算力成本有所降低。 算力依然是推动大模型发展的核心驱动力。DeepSeek-V3通过技术创新和资源优化,大幅降低了成本,展现了算力的高效性。在该技术路线得到充分验证后,有望驱动相关AI应用的快速发展,应用推理驱动算力需求增长的因素也有望得到增强。
DeepSeek-V3模型性能如何? DeepSeek-V3在哪些领域表现突出? DeepSeek-V3的训练成本如何?
客服
商务合作
小程序
服务号
折叠