您的当前位置:首页 > 标签 > AI安全风险分类
国际数据和人工智能管理协会(DAiMA):治变2026·人工智能治理白皮书(96页).pdf
AI安全风险分类:对抗性攻击、模型漂移、深度伪造与AI Agent四大威胁|IDAMA
IDAMA白皮书详解AI安全风险分类:对抗性攻击(规避/中毒/后门/提取)、模型漂移与退化、幻觉与有害输出、系统安全与AI Agent自主性风险。红队测试、差分隐私、可信执行环境等17项技术治理工具。
 2026-07-29
 AI产业
 96页
10张图表
数据来源:
国际数据和人工智能管理协会(DAiMA):治变2026·人工智能治理白皮书(96页) 查看报告
AI系统的安全威胁已经超越了传统网络安全的范畴——对抗性攻击可以在熊猫图片上加几个像素就让模型识别为长臂猿;模型漂移让部署后的AI性能随时间悄然退化;深度伪造正在颠覆“眼见为实”的社会信任基础;AI Agent被授权执行真实世界操作时,任何越权都可能造成不可逆的损失。IDAMA白皮书系统梳理了四大类安全威胁与17项技术治理工具,为构建AI安全防线提供了完整框架。

对抗性攻击:规避、中毒、后门与模型提取

对抗性攻击是AI安全领域最严峻的威胁之一,攻击者通过精心设计的输入诱导AI模型产生错误或有害输出。规避攻击是最常见的形式——在图像识别场景中,通过在熊猫图片上添加精心计算的噪声扰动,可以使模型将“熊猫”误分类为“长臂猿”,而人类仍能正确识别。FGSM(快速梯度符号法)和PGD(投影梯度下降)是常用的规避攻击方法。
中毒攻击在训练阶段对训练数据进行污染,植入后门或导致模型性能下降。攻击者可以在训练数据中注入带有特定触发器的样本,使模型在遇到包含触发器的输入时产生攻击者预期的错误行为。后门攻击在模型中植入隐蔽的“后门”,在正常输入下不会触发,只有当输入包含特定触发器模式时才会激活恶意行为。提取攻击通过反复查询目标AI系统,利用返回的预测结果重建功能相似的替代模型。
防御策略需采用“纵深防御”方法:对抗性训练(在训练过程中将对抗样本纳入训练集)、输入验证和清洗、模型蒸馏(使用大模型指导小模型学习增强鲁棒性)、同态加密和差分隐私(增加攻击者获取有用信息的难度)。

模型漂移与退化:数据漂移、模型退化与灾难性遗忘

模型漂移与退化是AI系统长期运行中面临的核心挑战。数据漂移指输入数据的分布随时间发生变化,包括概念漂移(目标变量与输入特征关系发生变化)和协变量漂移(输入特征分布变化但条件概率不变)。模型退化指模型本身性能随使用时间逐渐下降。灾难性遗忘是持续学习场景中特有的问题——模型在学习新知识时会忘记之前学到的知识。
监控指标包括准确率、召回率、F1分数变化、数据分布统计特征、预测置信度分布。缓解措施包括定期重新训练、持续监控系统、在线学习和自适应更新。

幻觉与输出安全性:生成式AI的独特挑战

生成式AI常常产生看似合理但实际上错误或虚构的内容,这种现象被称为“幻觉”——事实性错误(编造不存在的事件或数据)、逻辑矛盾(前后不一致的陈述)、虚构引用(伪造的文献引用)。大型语言模型在回答问题时可能自信地给出错误事实,或引用并不存在的研究论文。
有害输出风险包括生成仇恨言论、歧视性内容、危险指令(如制毒、自杀方法)、虚假信息和深度伪造内容。这些有害输出可能被用于恶意目的——传播虚假信息、网络攻击、引导自杀、实施欺诈。
安全护栏措施包括:内容过滤和分类(通过关键词过滤、语义分析识别有害内容)、提示词工程和对齐训练(引导模型生成安全合规的输出)、人工审核机制(高风险场景进行人工复核)。

AI Agent自主性风险与智能体安全治理

AI Agent作为一种全新的委托-代理关系,被授权代表人或组织在真实环境中规划、决策、执行,面临四大风险。
自主权边界决定风险敞口,一旦从咨询延伸到签约付款就易引发法律与资金风险。权限粒度风险方面,被劫持或出错的Agent会以过高权限造成破坏,需实施最小权限原则。上下文的实时性风险方面,Agent在某个时刻被授权执行某类行动,不代表它在所有时刻都应该执行同类行动,授权失效后有执行危险动作的风险。操作的可逆性风险方面,Agent产生的效果有些是可逆的,有些完全不可逆,没有人工监督会造成无法逆转的损失。
治理策略包括:对Agent自主权进行分级管理、实施最小权限原则、建立AI Agent资产台账、对高等级授权设置不可绕过的人工检查点、构建Agent行为审计链。

系统安全与基础设施威胁

AI系统安全性还取决于其运行的基础设施和部署环境。模型部署环境面临服务器入侵、配置错误、权限管理不当等威胁。API接口面临身份验证绕过、SQL注入、拒绝服务攻击。数据传输和存储需要加密保护。供应链安全涉及第三方组件的漏洞风险。
“AI中转站”风险值得关注——介于用户和AI模型厂商官方服务之间的代理层,因整合多国大模型接口而受追捧,但其粗放发展模式已引发多起安全事件:隐私泄露(缺乏数据加密机制)、模型造假(以低配模型冒充高端产品)、恶意控制(植入后门窃取账号或远程监控设备)、数据违规出境(未履行安全评估程序)。
防护措施包括安全开发生命周期(SDL)、渗透测试和红队演练、零信任架构、安全审计和合规认证、选择官方授权平台、对敏感数据脱敏处理。
客服
商务合作
小程序
服务号
折叠