当前位置:首页 > 报告详情

AICon北京2025-赵庆杰-数据驱动的智能诊断系统:多智能体系统在生产环境中的技术落地与实践 .pdf

上传人: bu****ng 编号:1188887 2026-03-31 34页 3.36MB

1、数据驱动的智能诊断系统:多智能体系统在生产环境中的技术落地与实践演讲人:赵庆杰目录目录010203引言:智能体实践背景与挑战实践路线:运维智能体的探索路径总结与展望01引言:智能体实践背景与挑战实践背景承载百万级别的应用的容器 PaaS 系统业务应用通过 war/jar/php zip源码包/Docker 镜像等多种方式部署微服务应用单体Web 应用移动APP 后台小程序后台SaaS类服务定时/xxl-Job Serverless应用引擎(SAE)平台提供的 K8s 集群+微服务引擎+ARMS应用监控+SLS Logtail阿里云沙箱容器 2.0IaaS 资源层(神龙+ECI+VPC+)Jav

2、a 冷启动加速应用管理分批/金丝雀发布自动构建镜像权限隔离/审批全套微服务治理无损上下线Spring Cloud/Dubbo 无缝迁移微服务流量灰度一键启停环境运维配套事件中心自动弹性伸缩端云联调CICD集成生命周期管理服务鉴权限流降级日志&链路监控日志管理.实例健康检测OOM物理机故障网络故障实例重启机器负载过高过保机型机器组件故障机型不匹配性能问题P2 报警过多无法发现问题没有有效的总结和处理报警处理传统协议改造成本高交互模块太多中间过程步骤多Chat Ops重复的疑难问题耗费人力重复的疑难问题耗费人力Serverless:智能诊断智能体01运维智能体的探索路径三个关键阶段24年开始探索初

3、探=静态流程25 年下半年初见成果=A2A接下来未来=强化学习25 年上半年小试牛刀=AI AgentP P快速定位快速定位提高人效提高人效C CD DA A01阶段一:静态工作流数据丰富度不足通用思考模式不成熟在 RAG之上做补充LLM 未成熟各类数据查询不统一数据的连接性无法表达数十种不同数据来源RAG 的补充数据查询不统一挑战挑战原始状态,简单处理日常的答疑架构方案报警触发手动触发问题分析下钻分析获取数据生成报告LLM客户触发RAG痛点模型 LLM能力偏弱,不具备plan的能力 重点在优化提示词 依赖 Token 数,无法继续提升体验数据 数据之间的联系描述复杂,只能靠流程代码保证 数据

4、源很多,如何收敛能覆盖35%左右的场景,远不够完美流程 流程固定,无法适应后查询诉求 无法回溯历史,无法自行进行进化02阶段二:单 Agent 架构架构方案输入问题实例服务基于 RAG,数据库,获取信息主 AgentContext监控Tools生成报告用户返回Agent 接收指令后,进行思考推理,并生成步骤:ToDo List,每一个步骤,可以使用已经安装的工具(MCP)调用,以及 sandbox:浏览器等能力去获取所需的信息,当执行完所有步骤,综合评估分析生成指令要求的报告。主 Agent工具 ToolSandbox初期使用 FunctionCall的能力去扩展实时查询的需求,逐步演变到 M

5、CP工具,通过统一的 MCP协议,对接了服务,实例,监控,日志等等 MCP工具,MCP工具替代了“search”片段,提供了更完整的信息给大模型做参考。沙箱也是非常好用的工具,特别是在文章中有链接但没有具体信息的场景下,通过浏览器沙箱获取到网页内容,并且可以并发执行,相互不影响,用完后删除。但是要依赖强大的弹性算力基建。痛点能覆盖50%左右的场景,上下文管理是最大瓶颈03阶段三:Multi-Agents尝试初始方案输入问题实例服务基于 RAG,数据库,获取信息主 AgentContext监控subAgent as tool生成报告用户返回ContextContextContextContext

6、第一个Agent 最好使用具备思考推理能力的大模型,接收指令后,先进行思考推理,并生成 Plan,根据当前注册的 SubAgent进行分配,并依次发送指令给 subAgent 进行执行返回,主Agent 结合返回信息继续推进完成整个任务。主 Agent工具 Tool挑战每一个 SubAgent有自己的大脑(LLM),但不都是相同的 LLM,根据需求选择符合的LLM,防止大材小用浪费成本,SubAgent与 主Agent 是贡献上下文的,以此减轻传递负担。流程设计比较理想,但是落地存在很大不足,整个流程不可控,尝尝出现时间超时,或者步骤丢失,导致整体的效果相比静态的工作流效果还差,如何解决 Wo

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
客服
商务合作
小程序
服务号
折叠