当前位置:首页 > 报告详情

【国金证券】计算机行业研究:国产模型持续闪耀-260718(7页).pdf

上传人: 向** 编号:1279471 2026-07-19 7页 1.46MB

核心结论速览: Kimi K3正式发布,2.8万亿参数成为全球参数最大的开源模型:2026年7月16日,月之暗面在WAIC前夕推出Kimi K3,总参数达2.8万亿、100万token超长上下文、原生支持视觉理解。完整模型权重将于7月27日前公开,是全球首个开源的近3万亿参数大模型。 综合性能跻身全球第一梯队,多项基准测试登顶:据Artificial Analysis第三方独立评测,K3综合智能评分57分位列全球第三,仅次于Claude Fable 5与GPT-5.6 Sol。在Frontend Code Arena前端开发测试中以1679分登顶全球第一,超越Claude Fable 5的1631分和GPT-5.6 Sol的1618分。 自研KDA混合线性注意力架构,扩展效率较K2提升2.5倍:K3基于KDA(Kimi Delta Attention)混合线性注意力与注意力残差(Attention Residuals)构建。KDA可将KV缓存需求降低高达75%,1M上下文解码吞吐量提升至6倍。配合896专家仅激活16个的高稀疏MoE与量化感知训练,整体扩展效率相较K2提升约2.5倍。 API定价对标海外前沿模型,ARR突破3亿美元:K3 API定价为每百万token输入缓存命中2元、未命中20元,输出100元。依托Mooncake分离式推理架构,编程场景缓存命中率超90%,大幅降低实际调用成本。截至6月中旬,月之暗面ARR突破3亿美元,API收入占总收入七成以上。 估值半年翻超7倍,月之暗面启动港股IPO筹备:公司估值从2025年底的43亿美元攀升至2026年6月的315亿美元,半年内翻超7倍。公司已向投资人发送上市议案,预计最快6个月内完成港股上市。 K3发布48小时后因需求过载暂停C端新用户订阅:K3上线48小时内用户请求量大幅超出预估并逼近现有集群承载极限,月之暗面宣布暂停C端新用户订阅,将有限算力优先保障现有订阅用户。 DeepSeek同步启动大额融资,国产头部模型进入“性能变现”正向循环:DeepSeek计划以约5000亿元估值启动新一轮融资,年化收入达4亿至5亿美元。行业正形成技术迭代、API增收、估值抬升的正向循环,国产头部大模型从低价获客转向靠硬核能力兑现价值。研究背景与行业全景图谱。2026年7月,全球大模型竞争进入新阶段。OpenAI于6月率先向全用户开放GPT-5.6系列三款模型,Anthropic同步延长Claude Fable 5推广期,海外闭源模型持续巩固领先地位。在这一背景下,月之暗面于7月16日发布Kimi K3,以2.8万亿参数的规模成为全球参数最大的开源模型,标志着国产大模型首次在参数规模、性能上限与定价体系三个维度同时向海外前沿模型发起正面挑战。过去一年,全球大模型竞争逐步从单一榜单成绩转向预训练规模、架构效率、复杂任务能力和工程可用性的综合较量。K3的研发重点并非简单扩大参数规模,而是通过模型架构、训练方法等协同优化,将规模优势进一步转化为能力提升。在评测中,其综合智能水平接近全球前沿的闭源模型。商业化层面,国产头部大模型正在经历从“低价获客”到“价值变现”的范式转变。月之暗面ARR从3月的1亿美元快速增长至6月的3亿美元,三个月内实现三倍跃升。DeepSeek年化收入达4亿至5亿美元,计划以5000亿元估值启动新一轮融资。行业形成技术迭代、API增收、估值抬升的正向循环,国产大模型正式从依靠性价比优势获客,转向依靠模型能力提升实现API价值量增长。技术架构创新深度解析。KDA混合线性注意力:攻克百万token长文本瓶颈。Transformer架构的标准缩放点积注意力存在绕不开的瓶颈——计算复杂度为O(n²),当上下文窗口扩展到100万tokens时几乎是一堵墙。业界此前尝试了FlashAttention(硬件级算子融合)、Ring Attention(序列并行分摊)等工程优化方案,但均未改变平方复杂度的数学本质。KDA(Kimi Delta Attention)走了一条不同的路——在注意力计算的核心环节做架构级替换。其核心思路分为三步:Delta压缩——不直接计算完整的QKT矩阵,而是通过Delta函数对Query和Key之间的交互进行稀疏化压缩;线性近似——在保持关键注意力模式的前提下将复杂度降至O(n);残差补偿——对压缩过程中丢失的高频细节通过轻量级残差连接进行补偿。KDA的关键突破在于:它不是简单地用线性函数替代softmax,而是通过Delta压缩保留注意力矩阵中的关键模式,再用残差补回细节,使得K3在100万token上下文下的注意力质量明显优于纯线性注意力方案。根据月之暗面技术报告,在实验模型上采用KDA与MLA混合比例,KV缓存占用最高削减75%,100万上下文长度下的解码吞吐量提升至原来的6倍。注意力残差与高稀疏MoE:训练效率与推理成本的双重优化。K3采用了注意力残差(Attention Residuals)技术。传统残差连接以固定权重累加所有层输出,随深度增加会稀释各层贡献并导致隐状态幅值无界增长。K3的工程化版本BlockAttnRes以约8个块即可恢复FullAttnRes的大部分收益,开销微小,可达到用1.25倍算力训练的基线模型的loss水平。在MoE架构方面,K3进一步扩大了稀疏度,结合Stable LatentMoE框架后,模型可以在896个专家中高效激活16个。这意味着虽然模型总参数量达到2.8万亿,但单次推理仅调用其中一小部分参数,在控制计算成本的同时扩大了模型容量。K3从SFT阶段开始应用量化感知训练,使用MXFP4权重和MXFP8激活函数以实现广泛的硬件兼容性。叠加训练方法和数据配方的优化,这些结构性改进使Kimi K3相比K2的整体扩展效率提升约2.5倍,能更有效地把算力转化为能力。评测表现:多项基准登顶,逼近闭源前沿。综合智能:全球第三,改写“开源落后闭源半年”格局。据Artificial Analysis第三方独立评测,K3综合智能评分57分位列全球第三,仅次于Claude Fable 5与GPT-5.6 Sol,与Claude Opus 4.8、GPT-5.5处于同一档次。其核心长板集中于长程Agent与知识工作场景。在AA-Briefcase基准测试中,K3得分1543分,仅次于Claude Fable 5的1574分,超过GPT-5.6 Sol的1501分、Claude Sonnet 5的1388分和Claude Opus 4.8的1347分。相比之下,Kimi K2.6在该榜单上的成绩仅为816分。前端开发:开源模型首次超越闭源登顶。在Arena.ai前端代码竞技场(Frontend Code Arena)中,K3以1679分登顶全球第一,超越Claude Fable 5的1631分和GPT-5.6 Sol的1618分。K2.6此前仅排第18位,K3直接跃升17位。在七个细分领域中,K3拿下了品牌营销、参考图设计、数据分析、消费产品、模拟和内容创作工具六项第一。Arena榜单运营负责人安杰洛普洛斯表示,K3或将倒逼投资者重新审视整个AI行业,此次发布很可能“引发资本市场的重新洗牌”,因为它“动摇了OpenAI、Anthropic等美国闭源模型的主导地位”。编程与推理能力:紧追海外头部。在DeepSWE长程开发测试中,K3任务完成率67.5%,排名第三。Program Bench上得分77.8,略超Fable 5的76.8。Terminal Bench 2.1得分88.3,仅落后GPT-5.6 Sol的88.8。SWE Marathon上42.0分则位居所有模型中的最高分。更值得关注的是K3在自主编程任务中的表现——在GPU kernel优化任务中,K3在24小时内独立完成AttnRes、KDA和512头维度MLA kernel在NVIDIA H200上的性能优化,在AttnRes任务中将前向+反向时间从283.6ms压缩到114.4ms。K3还从零构建了名为MiniTriton的GPU编译器,在roofline基准测试中性能持平甚至超越Triton和torch.compile。在芯片设计测试中,K3在48小时自主运行中完成了一颗芯片的设计、优化和验证。商业化:从“低价获客”到“价值变现”。API定价跃升,对标海外旗舰。K3的API定价跃升至美国前沿模型收费区间。输入/输出每百万token收费3/15美元,较K2.6高出3.2倍/3.8倍,定价相当于GPT-5.6 Sol/Fable 5的60%及30%。K3的输出价格远超DeepSeek V4-Pro、小米MiMoV2、智谱GLM-5.2以及Qwen3.7-Max。但高定价背后有三层支撑逻辑:第一层是自研推理架构带来的真实成本摊薄。依托Mooncake分离式推理架构,K3在编程高频场景下缓存命中率超90%,企业用户实际输入成本仅为未缓存标准标价的四分之一。第二层是性能溢价。Artificial Analysis测算数据显示,K3单任务平均调用成本约0.94美元,与GPT-5.6 Sol的1.04美元基本持平。第三层是行业定价回归。摩根士丹利将K3高定价定性为国内大模型行业“定价回归”的标志性正面信号,认为K3率先锚定海外闭源模型价格带,将打开全行业盈利空间。ARR三倍跃升,B端收入占比突破70%。月之暗面的年度经常性收入在2026年3月首次突破1亿美元,5月达到2亿美元,6月站稳3亿美元关口——三个月内翻了3倍。API收入已占整体收入的七成以上,公司彻底告别了早期依赖C端个人订阅的单一模式,进入B端规模化变现周期。K3发布后ARR实现数倍增长。中信建投将此定义为“另一个DeepSeek时刻”,称中国大模型第一次以竞争威胁身份进入全球叙事。估值半年翻超7倍,港股IPO加速。月之暗面的融资节奏堪称国产大模型企业中最密集的一轮。2026年1至2月,公司连续完成三轮融资,估值从100亿美元攀升至180亿美元。5月D轮融资投后估值达200亿美元。6月底,新一轮融资投前估值升至315亿美元。从2025年底C轮的43亿美元到当前315亿美元,私募估值在半年内翻了超过7倍。公司已向投资人发送上市议案,同步启动VIE架构拆除,中金公司与高盛担任联席保荐机构,预计最快六个月内完成港股挂牌。K3发布48小时即“熔断”:需求远超预期。K3上线48小时内,用户请求量大幅超出预估并逼近现有集群承载极限。月之暗面宣布暂停C端新用户订阅,将有限算力优先保障现有订阅用户。会员体系随之拆分为Kimi主权益与Code权益以精准分配资源。一款国产大模型因需求过载而主动限流,在国内AI行业中实属罕见。未来3-6个月机会洞察。海外算力产业链:K3的发布验证了AI算力需求的持续爆发。随着国产大模型参数规模跃升和推理需求爆发,海外算力产业链持续受益。推荐关注中际旭创、新易盛、天孚通信等光通信龙头,以及工业富联、胜宏科技等算力基础设施标的。国产算力产业链:国产大模型加速迭代将驱动国产算力与交换芯片需求高速增长。3万亿参数模型将竞争从单卡性能延伸至芯片、高速互联、整机集群、推理软件栈一体化系统能力。推荐关注寒武纪、海光信息、盛科通信等国产算力芯片标的。大模型与云服务:K3验证了国产大模型从“技术突破”到“商业变现”的闭环能力。月之暗面、DeepSeek等头部模型厂商的商业化加速,将带动整个AI产业链的估值重估。关注智谱、MiniMax、阿里巴巴、腾讯控股、金山云等。延伸阅读:以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ。Q1:Kimi K3的参数规模有多大?A1:Kimi K3总参数达2.8万亿,是当前全球参数最大的开源模型。模型采用MoE稀疏架构,896个专家中每次推理仅激活16个。Q2:Kimi K3的性能处于什么水平?A2:据Artificial Analysis评测,K3综合智能评分57分位列全球第三,仅次于Claude Fable 5与GPT-5.6 Sol。在Frontend Code Arena前端开发测试中以1679分登顶全球第一。Q3:Kimi K3的API定价是多少?A3:每百万token输入缓存命中2元、未命中20元,输出100元。依托Mooncake分离式推理架构,编程场景缓存命中率超90%,实际输入成本仅为标准价格的1/4。Q4:月之暗面的商业化进展如何?A4:截至6月,月之暗面ARR达3亿美元,三个月内从1亿增至3亿。API收入占总收入七成以上。公司估值从2025年底的43亿美元升至315亿美元。Q5:K3发布后为何暂停C端新用户订阅?A5:K3上线48小时内用户请求量大幅超出预估并逼近现有集群承载极限,公司暂停C端新用户订阅以优先保障现有用户体验。数据来源说明:本报告数据主要来源于国金证券研究所相关研究报告、月之暗面官方公告、Artificial Analysis、Arena.ai等第三方评测平台,以及科技日报、澎湃新闻、21世纪经济报道等公开媒体报道。
word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
客服
商务合作
小程序
服务号
折叠