当前位置:首页 > 报告详情

蚂蚁数科-金融AI智能体评测体系实践.pdf

上传人: 外** 编号:1275215 2026-07-04 30页 3.81MB

1、蚂蚁数科金融蚂蚁数科金融AIAI智能体评测体系实践智能体评测体系实践蚂蚁数科AI评测组 尘予目录目录 1.智能体评测的重要性&挑战 2.智能体评测目标&策略 3.智能体评测体系建设和实践 4.SmartEval一站式智能体评测平台02智能体评测重要性和挑战量化智能体是否实现其目标评测 可观测性、安全机制评测=衡量智能体性能、追踪优化目标达成度什么是智能体评测?蚂蚁数科面临的挑战商业化产品快速交付场景化的领域知识构建标准化接入和集成覆盖更多场景,避免人工遗漏标准化衡量,避免主观偏差数据化沟通,提升协作效率智能体评测的重要性智能体评测的重要性智能体评测的重要性&挑战挑战“一周出demo,半年不好用

2、”智能体场景智能体场景评测痛点评测痛点现状现状智能体评测痛点智能体评测痛点02智能体评测目标&策略扩大智能体表现良好的场景覆盖面识别并压缩智能体失败场景量化整体表现,提供决策依据建立评测闭环,驱动持续优化动态反映生产环境真实分布智能体评测策略智能体评测策略智能体评测策略智能体评测策略核心策略:让评测成为牵引智能体优化的”引擎”03智能体评测体系建设与实践智能体评测三要素数据数据“巧妇难为无米之炊”,没有代表性的数据,就无法真实还原智能体的能力边界0101“量体裁衣”,有合适的尺子才能准确“度量”智能体的性能0202自动化自动化“磨刀不误砍柴工”,高效的自动化工具才能支撑大规模、可复现的智能体评

3、测0303要素 1要素 2要素 3标准评测体数据构造在智能体评测过程中人工准备数据集不仅效率低下、耗时费力,而且难以满足高精度与全面性要求。因此,开发自动化评测数据集生成策略变得至关重要迫切。所以我们构建了以下方法来解决评测数据的问题:1.Rewrite2.Self-QA3.Agent As Data Builder智能体评测数据构造复杂性 关键句段提取 关键句段同义重写 模糊化改写 rouge_l相似度过滤 原始问题改写评测数据构造方式:Rewrite(问题改写)初版问答对生成 口语化改写 三段式生成 rouge_l相似度过滤 Self-QA生成评测数据构造方式:Self-QA(自动生成问答

4、对)评测数据构造方式:Agent as Data Builder多轮对话构造:多轮对话构造:根据要求进行 N 轮对话的构造真实用户模拟:真实用户模拟:支持不同用户画像的数据模拟覆盖多业务场景:覆盖多业务场景:支持多业务场景的数据构造全流程自动化:全流程自动化:全流程自动化 多轮智能对话数据构造多轮智能对话数据构造评测体评测标准制定通用版评测标准多维度拆解:多维度拆解:从内容相关性到表达结构,全面拆解智能体回答构成要素标准统一量化:标准统一量化:采用 05 分评分机制,确保不同评估者间判断标准一致兼顾内容与形式:兼顾内容与形式:同时关注信息准确性与表达方式,符合真实业务评判标准支持问题定位:支持

5、问题定位:通过维度分项得分,精准发现智能体在不同能力点上的短板增强优化闭环:增强优化闭环:结合评分数据回流模型训练,支撑能力精细化迭代提升维度维度标准标准评分评分相关性回答准确率05专业性 数据事实性05数据时效性05逻辑合理性05框架全面性05表达层 整体打分05结构化表达05自动化评测方案Planning agent:策划Executing agent:执行数据真实性 sub-agent逻辑连贯性 sub-agent数据时效性 sub-agent整体表达分 sub-agent答案准确率 sub-agent框架全面性 sub-agent结构化表达 sub-agentExpress agent

6、:总结Review agent:反思整体架构 V1智能体效果评测方案-Agent as Evaluator智能体效果评测方案-Agent as Evaluator(示例)LOWMIDHIGH打分标准数据错误,不符合事实个别数据不准确,但不影响整体事实性解读内容中所有引用数据真实可信,数据来源官方可信解释数据内容与客观现实存在根本性偏差,直接影响结论可信度。局部数据存在误差,但未改变整体结论的有效性。数据来源权威、透明且可追溯,确保全链条真实性。举例比如:某报告称“2025年全国人口18亿”,而国家统计局官方数据显示实际为14.1亿,核心指标严重失实某股票型基金季度持仓报告中,前十大重仓股中9只

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **智能体评测重要性**:量化目标达成度,区别于可观测性与安全机制,解决“一周出demo,半年不好用”痛点,需标准化衡量避免主观偏差。 2. **评测三要素**:代表性数据(通过Rewrite、Self-QA、Agent As Data Builder自动化生成)、标准评测体(多维度0~5分评分)、自动化工具(支撑大规模评测)。 3. **SmartEval平台**:一站式解决方案,支持数据构造、自动化评测(Agent as Evaluator)、问题归因、轻量化部署,覆盖金融多场景(基金、保险等)。 4. **核心策略**:以评测为优化引擎,通过双轨制(通过率/评分)与归因体系驱动迭代,联合信通院发布标准,提升效能闭环。
**评测引擎是什么?** **数据构造三法?** **归因如何闭环?**
客服
商务合作
小程序
服务号
折叠