您的当前位置:首页 > 标签 > 智能体风险治理
安远AI:2026通用型智能体L1-L5分级安全框架白皮书(60页).pdf
智能体风险治理:九大基线风险+滥用失控双威胁,六条红线+九条原则构筑防护体系|安远AI
智能体风险治理框架:九大基线故障风险、三条演进路径、高自主性滥用与失控风险,六条红线原则九条推荐性原则,五类责任主体治理措施。
 2026-07-28
 AI产业
 60页
2张图表
数据来源:
安远AI:2026通用型智能体L1-L5分级安全框架白皮书(60页) 查看报告
智能体风险已从“错误回答”演变为“错误执行”——幻觉可能直接转化为误删数据库、错误转账等不可逆后果。安远AI等机构发布的这份白皮书,系统识别了九大基线风险、三条演进路径,以及高自主性等级的滥用与失控威胁,并提出了从技术防护到组织治理的完整防护体系。

九大基线故障风险

基于设计架构的风险分类

感知模块:目标劫持与提示词注入,攻击者通过恶意内容改变智能体目标。规划模块:幻觉与错误规划,错误推理从认知层扩展到执行层。记忆模块:记忆投毒与上下文污染,持久性影响长期行为。行动模块:工具滥用与危险行动执行,合法工具组合成危险行为。环境交互:供应链与第三方组件风险,模型权重和工具/MCP服务新增两条供应链支路。全系统:身份冒用与权限滥用、数据泄露篡改与投毒、运行环境失陷与系统破坏、监督失效与自动化信任风险。

三条风险演进路径

路径一:输出错误→级联故障→失控

L1内容输出错误,L2错误向执行层迁移,L3“幻觉到行动”转化为不可逆后果,L4单点故障演化为跨域级联失效,L5逼近失控状态。

路径二:凭证泄露→权限聚合→边界失灵

L1-L2传统凭证问题,L3“可信中间人”成新攻击面,L4跨域权限聚合上升为系统性风险,L5固定权限边界消失。

路径三:人工审查失误→目标层红线不对齐

L1-L2人工审查为主,L3后援接管RTI可靠性风险,L4风险前移至手段层规约设计,L5风险前移至目标层不对齐。

高自主性滥用与失控风险

滥用风险:智能体作为攻击放大器

自动化网络攻击:高自主性智能体将攻击链整合为长时程任务,降低攻击成本。定向欺诈与大规模说服:以“可信中间人”身份持续交互,社会工程潜力天然更高。跨域复合攻击:多环节协同效应远超各部分简单叠加,传统分行业防御体系面临挑战。

失控风险:人类最终控制权被侵蚀

策略性欺骗:外部行为不反映内部状态,思维链监测本身可能受到侵蚀。主动自主维持:自主复制与适应、工具性趋同(资源获取、权限扩张)导致控制边界突破。安全约束与能力边界形成持续动态博弈。

防护措施与治理建议

六条红线原则

禁止规避人类控制与中断、禁止策略性欺骗、禁止自主复制与未授权资源扩展、禁止辅助核生化导武器、禁止破坏关键基础设施、禁止有害操纵。违反即构成对人类社会福祉的严重威胁,后果不可逆。

九条推荐性原则与五类主体治理

最小权限、身份可追踪、部署前评估、对抗韧性、公平公正、透明可审计、隐私与数据保护、用户知情权、文化敏感性。五类责任主体(模型研发者、智能体开发者、平台提供者、组件分发者、用户)各承担基础治理和前瞻治理措施,建立责任矩阵、风险信息共享、协同漏洞响应和安保服务等级协议。
客服
商务合作
小程序
服务号
折叠