当前位置:首页 > 报告详情

A3--胡应广--华为应用开发Agent自动化评测实践.pdf

上传人: B**** 编号:963850 2025-11-02 33页 3.67MB

1、胡应广华为胡应广华为 GTS AI原生应用评估专家华为ICT软件测试工程与自动化五级专家,10年以上云原生软件测试开发相关工作经验,长期致力于GTS产品线AI原生应用评估和自动化评测系统的构建,以及AI辅助研发质效提升项目探索与实践。目录CONTENTS华为ADC应用开发平台介绍0102CodeAgent评测挑战与总体思路Agent评测标准与体验一致性优化03AI原生应用自动评测系统构建思路04总结与展望05PART 01华为ADC应用开发平台介绍从低码到智码,华为ADC应用开发平台ADC(Agent Development Center)是一个面向业务开发者低代码、安全可信的全场景开发平台,

2、具备完整的资产生命周期管理工具链,提供以业务资产为核心的高效复用的新开发模式。企业场景生态伙伴低码开发应用智能运维智慧运营5G行业应用网络集成支撑多场景基于低码编排快速实现业务应用ADC 一体化编排应用开发平台低门槛、高效率安全可信生态开放支持以图形化、拖拉拽的方式构造应用服务开放流程、界面、数据、大屏等多种编排能力,所见即所得提供APP质量评估系统,保障APP高质量交付提供端到端可信工具链,轻松构建可信APP资产支持多协议、多引擎,随心构建、极速集成扩展API集成图形编排,集成资产全面复用共享从低码到智码,ADC业务开发者低码开发痛点学习资料多,高能耗集中开发者求助开销大华为 ADC Cod

3、e Agent 智能化演进之路写代码拖拉拽1高码2低码3智码输入简单不懂开发自然语言开发多模态设计即开发需求即应用Next智能推荐CUI/LUI0码进入智码时代,体验变革:1.输入更简单:从代码 自然语言 多模态2.不需要懂开发:从懂开发 懂业务now多轮澄清式开发运行即应用Level 4Level 4Level 3Level 3Level 2Level 2Level 1Level 1Level 0Level 0无智能化低码拖拉拽,无智能化智能辅助单一开发元素的智能辅助场景级智能辅助跨元素智能辅助,仍以人工开发为主有条件智能化以智能开发为主,人工做必要的辅助高度智能化限定的场景下,不需开发者完

4、全智能化全部不需开发者,自动完成开发智码等级当前目标L5PART 02CodeAgent 评测挑战与实践总体思路Code Agent 评测面临的挑战评测集构建困难测试集应覆盖的范围和边界不明确;测试集输入输出质量,理想态Ground Truth构建困难;测试集规模和完备性如何界定和评估。评估标准定义难通用评估基准(如CLUE),领域Agent不适用;评估指标如何量化,如何与用户体验对齐;评估标准如何保证可执行性,并进一步实现自动化。评测成本高人工评测成本高、耗时长、难以规模化评估结果容易受测试人员主观偏见的影响;自动化评测实现难度大;不同版本和模型对比评估。010302相较于传统软件,AI原生

5、应用的行为和输出是非确定性和概率性的,而且其故障模式往往无法通过修改特定代码来修复,所以要做好AI智能体的评估对于测试来说挑战非常大。Code Agent 测评分层E2E全景基础模型选型L0/L1模型领域模型过程评测L2模型E2E商用发布评测ADC Code Agent模型入围测评标准选型测评集选型评估报告训练语料测评测评标准领域业务测评集测评自动化测评与问题提单问题关闭标准测评问题定级发布标准010302040103020401030204Code Agent 评测试集构建总体思路以业务能力评测为主,兼顾评测通用能力对业务能力的基础影响,同时具备快速开展全量评估能力(自动化)应对不同版本不同

6、模型下测试结果对比。业务场景驱动测试集参考架构业务场景(用户视角)用户TASK+系统功能质量属性维度评估标准(指标)输入输入支撑支撑业务场景/价值流业务目标业务流程/用户活动用户TASK质量属性维度评估标准(内/外在)业务类别/用户活动/业务目标功能维、安全维、性能维、可靠性维、易用维、效率维评估维度:正确性、相关性、完整性、流畅性、隐私保护、偏见性、鲁棒性测试集三大要素Code Agent 智码整体评测框架自然语言建模*生成大屏图表*Python函数服务辅助*自然语言生成流程框架*知识问答产品文档*原始需求描述*准确性性能效率鲁棒性一致性安全性正确性相关性完整性可执行流畅性支持并发流式响应耗

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
根据报告的内容,全文主要内容概括如下: 1. 华为ADC应用开发平台(ADC)介绍:ADC是一个面向业务开发者的低代码、安全可信的全场景开发平台,支持图形化编排和高效复用。 2. CodeAgent评测挑战与实践:面临评测集构建困难、评估标准定义难、评测成本高等挑战,采用分层评测框架和多种评测方法。 3. Agent评测标准与体验一致性优化:强调评测结果与用户体验一致,采用多种评估方式,如代码静态检查、可执行性评估等。 4. AI原生应用自动评测系统构建思路:构建快速响应的全自动评测系统,包括评测集管理、辅助测试设计、评测任务管理、裁判评分模型等。 5. 总结与展望:强调评测集构建、评估体系、用户体验的重要性,提出未来发展方向。
"AI评测挑战,你了解多少?" "华为ADC,智码时代新篇章?" "CodeAgent评测,揭秘AI应用评估!"
客服
商务合作
小程序
服务号
折叠