【国金证券】大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?-投研Agent模型能力对比评测-260719(26页).pdf

编号:1279646 PDF 26页 3.65MB 下载积分:VIP专享
下载报告请您先登录!
核心数据速览: Artificial Analysis综合得分:GPT 5.6 Sol 59分(第2)、Kimi K3 57分(第3)、GLM-5.2 51分(第10)。 估值工作表数:GPT 12个、Kimi 10个、GLM 10个。 Kimi K3参数规模:2.8万亿(全球最大开源模型之一)。 GLM-5.2行业覆盖:20家公司实体页(三款最多)。 GPT回测区间:2020-2026年(78个截面)。 GLM回测区间:2016-2026年(最长)。 Kimi K3上下文长度:100万Token。 GPT 5.6 Sol API价格:输入5美元/百万Token,输出30美元/百万Token。H2:报告核心数据解读。H3:三模型综合排名——GPT第一,Kimi第二,GLM第三。GPT 5.6 Sol在三类任务中表现最均衡:估值模型支持假设联动更新全表,回测明确区分信号日与执行日,行业研究来源管理最规范。Kimi K3报告逻辑清晰但底稿联动弱,GLM覆盖最广但逻辑与底稿问题较多。Artificial Analysis Intelligence Index排名:GPT 59分/第2,Kimi 57分/第3,GLM 51分/第10。H3:估值建模——GPT联动最好,Kimi逻辑自洽,GLM公式错误。GPT 5.6 Sol:12工作表+检查表+来源表,修改假设自动联动全表,投资评级与目标价一致。Kimi K3:10工作表,“销量×单价”拆解收入,报告自洽但ExcelVALUE!错误,无法联动。GLM-5.2:10工作表,DIV/0!和REF!错误,目标价980元低于股价1194.90元仍给“增持”,逻辑冲突。H3:回测与行业研究——GPT最严谨,Kimi最详细,GLM覆盖最广。GPT回测明确“月末信号、下月执行”,避免前视偏差,底稿可完整追溯。Kimi保留代码、每期选股和组合净值,可检查性最好,但未区分信号日与执行日。GLM回测区间最长(2016-2026年)但未披露调仓记录,结果难复核。行业研究:GPT来源管理最规范(4个来源摘要页),Kimi六维评分框架清晰但Wiki实体少,GLM覆盖20家公司但逻辑支撑较弱。H2:报告独有数据价值——模型能力级颗粒度。 Artificial Analysis综合排名:GPT 5.6 Sol 59分(第2)、Kimi K3 57分(第3)、GLM-5.2 51分(第10)。 模型规格对比:Kimi K3总参数2.8T/上下文1M/输出价格15美元;GPT 5.6 Sol上下文1.05M/输出30美元;GLM-5.2总参数744B/上下文1M/输出28元。 估值任务:GPT 12工作表(含检查表+来源表),修改假设联动全表;Kimi 10工作表,“销量×单价”拆解,但VALUE!错误致营收增速/净利润/EPS为0;GLM 10工作表,DIV/0!和REF!错误,目标价980元<股价1194.90元仍给“增持”。 回测任务:GPT区间2020-2026(78截面),明确“月末信号/次月执行”,处理停牌/涨停/缺失值;Kimi保留代码+每期选股+组合净值,但未区分信号日与执行日;GLM区间2016-2026最长,但“组合净”与“组合毛”收益一致(未扣成本),未披露调仓记录。 行业研究:GPT 4个来源摘要页(来源管理最规范)+四层公司筛选;Kimi六维评分(20%/20%/20%/15%/15%/10%),但Wiki仅2个实体页;GLM 10个实体页(覆盖最广),但无来源层可追溯。 公开基准成绩:DeepSWE(GPT 73.0/Kimi 67.5/GLM 46.2)、ProgramBench(GPT 77.8/Kimi 77.8/GLM 63.7)、FrontierSWE(GPT 71.3/Kimi 81.2/GLM 74.4)。 API价格:GPT输入5美元/百万Token/输出30美元;Kimi输入3美元/缓存0.3美元/输出15美元;GLM输入8元/输出28元。H2:谁需要这份报告? 金融科技与量化研究员:需要全面了解大模型在金融投研场景中的实际能力表现。 资管机构IT与数字化转型部门:需要评估大模型投研工具的选型与部署方案。 AI投研产品开发者:需要了解不同模型在估值、回测、研究三类任务中的优劣势。 量化策略研究员:需要评估大模型在多因子回测中的数据处理与逻辑严谨性。 行业研究员与投资经理:需要了解大模型辅助生成研究报告和估值模型的质量水平。FAQ。Q1:报告包含哪些核心数据模块?报告涵盖三模型综合能力排名、Artificial Analysis得分、三类投研任务详细对比(估值工作表数/联动能力/回测区间/交易时点处理/行业覆盖数/来源管理)、公开基准成绩、API价格与规格对比等五大模块。Q2:GPT 5.6 Sol在哪些方面表现最好?估值建模中Excel模型修改假设可联动更新全表,设检查表和来源表,可复算性最强;回测中明确采用“月末信号、下一交易日执行”避免前视偏差,交易时点最严谨;行业研究中来源管理最规范,建立来源摘要页和综合研究页。Q3:Kimi K3的主要优势和不足是什么?优势:估值任务“销量×单价”预测逻辑直观、报告自洽;回测保留代码和每期选股明细可检查性好;行业六维评分框架清晰可复算。不足:Excel缺少联动致VALUE!错误;回测未区分信号日与执行日;Wiki仅2个实体页,知识库沉淀不足。测试在发布首日进行,响应速度可能受服务负载影响。Q4:GLM-5.2在哪些方面有改进空间?估值模型公式异常(DIV/0!/REF!)致核心数据无法计算;目标价低于股价仍给“增持”,逻辑冲突。回测未披露调仓记录和组合净值,结果难以复核。行业研究覆盖20家公司但投资框架逻辑不够清楚,未建立来源摘要页。覆盖内容丰富但可靠性需提升。Q5:金融机构如何选择合适的大模型?建议根据具体场景选择:需要高质量可复核交付物(估值模型、深度研究)选GPT 5.6 Sol;需要快速构建研究框架和投资逻辑选Kimi K3;需要广覆盖概览选GLM-5.2。所有模型交付物均需人工复核,不可完全替代专业分析师。完整PDF报告包含内容。以下为报告完整版包含的核心内容模块(基于国金证券《Kimi K3超越GPT5.6了吗?——投研Agent模型能力对比评测》研究报告): Kimi K3与GPT 5.6 Sol发布背景与能力升级。 三模型公开规格与API价格对比。 Artificial Analysis Intelligence Index排名。 估值建模任务完整对比(工作簿结构/预测逻辑/Excel质量/投资报告)。 多因子回测任务完整对比(交付结果/数据处理/回测逻辑/底稿质量)。 行业研究任务完整对比(报告覆盖/Wiki知识库/投资框架/来源管理)。 三模型综合排名与各任务表现总结。 金融机构应用建议与风险提示。延伸阅读:如需了解行业趋势与战略洞察,可返回查看本报告深度分析页面。数据来源说明:以上内容基于国金证券《Kimi K3超越GPT5.6了吗?——投研Agent模型能力对比评测》(2026年7月18日)研究报告。
友情提示

1、下载报告失败解决办法
2、PDF文件下载后,可能会被浏览器默认打开,此种情况可以点击浏览器菜单,保存网页到桌面,就可以正常下载了。
3、本站不支持迅雷下载,请使用电脑自带的IE浏览器,或者360浏览器、谷歌浏览器下载即可。
4、本站报告下载后的文档和图纸-无水印,预览文档经过压缩,下载后原文更清晰。

本文(【国金证券】大模型赋能投研系列之二十三:Kimi K3超越GPT 5.6了吗?-投研Agent模型能力对比评测-260719(26页).pdf)为本站 (向书波) 主动上传,三个皮匠报告文库仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对上载内容本身不做任何修改或编辑。 若此文所含内容侵犯了您的版权或隐私,请立即通知三个皮匠报告文库(点击联系客服),我们立即给予删除!

温馨提示:如果因为网速或其他原因下载失败请重新下载,重复下载不扣分。
客服
商务合作
小程序
服务号
折叠