1、DeepSeek:重塑全球重塑全球AI格局的中国力量格局的中国力量国盛计算机国盛计算机2025.52顶尖大模型发布进展不断顶尖大模型发布进展不断AI应用:MCP驱动Agent生态加速构建AI应用:端侧/智驾/机器人/军工等AI驱动中国科技资产重估AI基建带动国产算力、云厂商需求目录目录DeepSeek震撼科技圈:一月时间差并肩最强推理模型震撼科技圈:一月时间差并肩最强推理模型o132024.5DeepSeek-V2发布发布提出MLA和DeepSeekMoE架构相比第一代DeepSeek67B实现了更强的性能,节省了42.5%的训练成本,减少了93.3%的KV缓存2024.11推理模型推理模型D
2、eepSeek-R1.Lite预览版预览版发布发布媲美01-preview的推理效果并为用户展现了o1没有公开的思考过程2024.12DeepSeek-V3发布发布DeepSeek-V3671B在在2048块块NVIDIAH800集群上训练集群上训练2个月,个月,训练成本仅训练成本仅558万美元,万美元,达到GPT-4o和ClaudeSonnet3.5水准2025.1.20DeepSeek-R1发布发布从数学(AIME/MATH)、编程(Codeforces/SWE)、学科推理(GPQA)的各个高难度benchmark结果来看,DeepSeek-R1推理能力比肩OpenAI-o1-1217版本
3、。同时DeepSeek-R1蒸馏得到的Qwen和llama小模型也与OpenAI-o1-mini相当的效果。2025.1.28Janus-Pro、JanusFlow发布发布Janus-Pro是一款统一多模态理解与生成的创新框架,解耦视觉编码。JanusFlow是一款通过生成流与自回归语言模型融合实现统一的框架,能生成高质量图像。数学、代码能力追平数学、代码能力追平o1蒸馏小模型效果超越蒸馏小模型效果超越o1-miniDeepSeek震撼科技圈:震撼科技圈:开源、低成本倒逼开源、低成本倒逼OpenAI加速发布加速发布4开放的许可证和用户协议开放的许可证和用户协议:DeepSeek-R1统一采用标
4、准化、宽松的MITLicense,完全开源,不限制商用,无需申请。产品协议明确可“模型蒸馏”。OpenAI加速发布:加速发布:2月月1日,日,OpenAI推出推出o3-mini,Plus和Team用户的速率限制从原来o1-mini的每天50条消息增加3倍到o3-mini的每天150条消息。2月月3日,日,OpenAI发布了基于发布了基于OpenAI的的o3模型之上开发而成的模型之上开发而成的DeepResearch。能够像人类分析师一样,对复杂的任务进行逐步分解,并在互联网上进行多轮的信息搜索与验证,直到找到最合适的答案2月月13日,日,OpenAI宣布将在未来几个月内推出宣布将在未来几个月内
5、推出GPT-5,该模型将整合OpenAI的大量技术,包括o3,在GPT-5推出之前,OpenAI计划在未来几周内先发布GPT-4.5代号“Orion”,这将是OpenAI最后一个“非思维链模型DeepSeek震撼科技圈:算法优化彰显创新能力震撼科技圈:算法优化彰显创新能力5美国总统特朗普美国总统特朗普在佛罗里达表示:在佛罗里达表示:“中国公司发布中国公司发布DeepSeekAI应该给我们的行业敲响警钟,我们需要集中精力进行竞争。应该给我们的行业敲响警钟,我们需要集中精力进行竞争。”DeepSeek提出大量算法创新,中国从提出大量算法创新,中国从AI跟随者走到前沿探索贡献者跟随者走到前沿探索贡献
6、者DeepSeek-R1:DeepSeek-R1-Zero提出不用监督微调直接进行强化学习,也能取得不错的效果。DeepSeek-R1加入少量CoT数据进行监督微调作为冷启动,然后再进行多阶段强化学习,可以取得更优的性能,同时回答更符合人类偏好。强化学习不需要进行过程监督和MCTS搜索,直接进行基于规则的奖励DeepSeek-V3:注意力层状态压缩(Multi-HeadLatentAttention):对attention层隐向量降维,减少推理时显存,提高推理效率细粒度稀疏MoE架构:671B总参数,平均激活参数37B多词元前瞻性预测(Multi-TokenPrediction):丰富训练监督