1、07解码DeepSeek,?构建医药业新质产腾讯健康李慧录 从DeepSeek看智能发展趋势 模型及DeepSeek潜在应场景探索从DeepSeek看智能发展趋势AI离我们越来越近,越来越密集的“加速”信号4“AI”概念世1950s2012CNN,?脸识别Alpha,战李世20172022Chatgpt,?C端破圈DS,?“Aha”时刻2024数据来源:1.?甲光年智库梳理,2023年;DeepSeek-R1 1987-2020年之前的主导是“数据、算、专决策范式”。2020年后,GPT-3代表技术路线“数据、算、通范式”,验证语模型的可性。GPT3/4在深度推理和问题解决有所缺,OpenAI
2、-o1通过思维链(Chain?of?Thought)增强推理能,将复杂问题分解成更、更易处理的步骤;DeepSeek R1在展现卓越推理能同时,训练和推理成本极低BERTBERT在文本分类、命名实体识别等语言理解任务表现出色。也是医疗AI小模型年代主要技术路线“大数据、小算力、专用决策”GPT 为内容创造和自动推理开辟可能性“大数据、大算力、通用模式”基于DS-v3构建推理模型,通过强化学习提升推理能力,且训练成本极低AI技术演变路线5理解Chatgpt,?个AI领域的“程奇迹”Chatbot:本交互式应Gpt3:预训练模型Prompt engineering提词程RLHF强化学习Nvidia
3、 A100(A800)性能卡SFT监督微调RDMA解决数据处理的延迟顶尖的AI才数TB质量数据数万对质量prompt增长:破圈,两个到亿户的速度“创新落后”的机会成本被不断放体验:哎哟 不错噢低成本,超出户预期的“智能”产品:典型的2B能集合?快速推出全家桶和云服务矩阵市场:典型的B端商业模式?快速市场预热和商业化6再看DeepSeek,个“程奇迹”7DeepSeek?是“深度求索”开发的系列智能模型。DeepSeek?通过持续的技术创新和市场拓展,在然语处理和型语模型取得了显著进展,在国际市场上获得了泛认可。其中:DeepSeek-V3 是在14.8万亿质量 token 上完成预训练的个强的
4、混合专家(MoE)语模型,拥有6710亿参数(激活参数370亿)。作为通语模型,其在在知识类任务(知识问答、内容成等)领域表现出DeepSeek-R1 是基于 DeepSeek-V3-Base 训练成的强化推理能模型,在数学、代码成和逻辑推断等复杂推理任务上表现优异更低的研发成本*更效资源利$5.5M?vs.?OpenAIs?$100M+使2,000?GPUs,?竞品使?10,000+?GPUs开源模型肩头部闭源60%+?指标优于Llama3.1 Claude-3.5?GPT-4o?打破模型技术壁垒重挫美国科技公司股价,英伟达市值下跌5,900亿AI的斯普特尼克时刻被美国及其盟友列各种限制数据
5、来源:*仅涵盖预训练成本,不包含研发、推理、后训练、员等其他成本;2.?Sputnik?时刻,指1957年104苏联抢先美国成功发射斯普特尼克1号造卫星,是冷战中的其中个重事件及转捩点DeepSeek的创新突破每次推理仅激活相关专家,“术业有专攻”“专事专办、要事要办 事不办 尽量不跨组解决”节省42.5%训练成本MoE?Sparse?(稀疏专家混合模型)注意机制作图书检索系统MLA?建个智能分类系统,不记具体信息,是个“简单”标签模型的占率降低传统的MHA?5-13%MLA?(多头潜在注意机制)像学霸样把注意消耗降到最低“跳记重 记住题点”“NSA?(原稀疏注意)?传统模型需要32位或者16
6、位数记录数字“机号码,记最后4位”提升训练速度同时保持精度,降低硬件门槛FPB?混合精度训练从海量数据中提炼价值信息,提升模型学习效率蒸馏垂类模型能,不输于全尺模型数据蒸馏技术道简,强化学习跳出题海和测让模型学会思考GRPO(群体相对策略优化)效果体验惊艳,成本极致压缩8为什么都爱DeepSeek?成本优势550万美元预训练成本达到GPT-4级别性能,打破“算军备竞赛”魔咒技术成本的下降,为业上下游带来更多创新的可能技术震撼算法、训练范式、推理、算利全创新DeepSeek?V3?通过快速迭代新技术,幅降低了训练和推理的成本。且它是个拥有推理能的模型,全球可开源引爆开源的论和库,以及提供简易的蒸