智能体风险已从“错误回答”演变为“错误执行”——幻觉可能直接转化为误删数据库、错误转账等不可逆后果。安远AI等机构发布的这份白皮书,系统识别了九大基线风险、三条演进路径,以及高自主性等级的滥用与失控威胁,并提出了从技术防护到组织治理的完整防护体系。
九大基线故障风险
基于设计架构的风险分类
感知模块:目标劫持与提示词注入,攻击者通过恶意内容改变智能体目标。规划模块:幻觉与错误规划,错误推理从认知层扩展到执行层。记忆模块:记忆投毒与上下文污染,持久性影响长期行为。行动模块:工具滥用与危险行动执行,合法工具组合成危险行为。环境交互:供应链与第三方组件风险,模型权重和工具/MCP服务新增两条供应链支路。全系统:身份冒用与权限滥用、数据泄露篡改与投毒、运行环境失陷与系统破坏、监督失效与自动化信任风险。
三条风险演进路径
路径一:输出错误→级联故障→失控
L1内容输出错误,L2错误向执行层迁移,L3“幻觉到行动”转化为不可逆后果,L4单点故障演化为跨域级联失效,L5逼近失控状态。
路径二:凭证泄露→权限聚合→边界失灵
L1-L2传统凭证问题,L3“可信中间人”成新攻击面,L4跨域权限聚合上升为系统性风险,L5固定权限边界消失。
路径三:人工审查失误→目标层红线不对齐
L1-L2人工审查为主,L3后援接管RTI可靠性风险,L4风险前移至手段层规约设计,L5风险前移至目标层不对齐。
高自主性滥用与失控风险
滥用风险:智能体作为攻击放大器
自动化网络攻击:高自主性智能体将攻击链整合为长时程任务,降低攻击成本。定向欺诈与大规模说服:以“可信中间人”身份持续交互,社会工程潜力天然更高。跨域复合攻击:多环节协同效应远超各部分简单叠加,传统分行业防御体系面临挑战。
失控风险:人类最终控制权被侵蚀
策略性欺骗:外部行为不反映内部状态,思维链监测本身可能受到侵蚀。主动自主维持:自主复制与适应、工具性趋同(资源获取、权限扩张)导致控制边界突破。安全约束与能力边界形成持续动态博弈。
防护措施与治理建议
六条红线原则
禁止规避人类控制与中断、禁止策略性欺骗、禁止自主复制与未授权资源扩展、禁止辅助核生化导武器、禁止破坏关键基础设施、禁止有害操纵。违反即构成对人类社会福祉的严重威胁,后果不可逆。
九条推荐性原则与五类主体治理
最小权限、身份可追踪、部署前评估、对抗韧性、公平公正、透明可审计、隐私与数据保护、用户知情权、文化敏感性。五类责任主体(模型研发者、智能体开发者、平台提供者、组件分发者、用户)各承担基础治理和前瞻治理措施,建立责任矩阵、风险信息共享、协同漏洞响应和安保服务等级协议。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-28
AI产业
60页
2张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录