AI系统的安全威胁已经超越了传统网络安全的范畴——对抗性攻击可以在熊猫图片上加几个像素就让模型识别为长臂猿;模型漂移让部署后的AI性能随时间悄然退化;深度伪造正在颠覆“眼见为实”的社会信任基础;AI Agent被授权执行真实世界操作时,任何越权都可能造成不可逆的损失。IDAMA白皮书系统梳理了四大类安全威胁与17项技术治理工具,为构建AI安全防线提供了完整框架。
对抗性攻击:规避、中毒、后门与模型提取
对抗性攻击是AI安全领域最严峻的威胁之一,攻击者通过精心设计的输入诱导AI模型产生错误或有害输出。规避攻击是最常见的形式——在图像识别场景中,通过在熊猫图片上添加精心计算的噪声扰动,可以使模型将“熊猫”误分类为“长臂猿”,而人类仍能正确识别。FGSM(快速梯度符号法)和PGD(投影梯度下降)是常用的规避攻击方法。
中毒攻击在训练阶段对训练数据进行污染,植入后门或导致模型性能下降。攻击者可以在训练数据中注入带有特定触发器的样本,使模型在遇到包含触发器的输入时产生攻击者预期的错误行为。后门攻击在模型中植入隐蔽的“后门”,在正常输入下不会触发,只有当输入包含特定触发器模式时才会激活恶意行为。提取攻击通过反复查询目标AI系统,利用返回的预测结果重建功能相似的替代模型。
防御策略需采用“纵深防御”方法:对抗性训练(在训练过程中将对抗样本纳入训练集)、输入验证和清洗、模型蒸馏(使用大模型指导小模型学习增强鲁棒性)、同态加密和差分隐私(增加攻击者获取有用信息的难度)。
中毒攻击在训练阶段对训练数据进行污染,植入后门或导致模型性能下降。攻击者可以在训练数据中注入带有特定触发器的样本,使模型在遇到包含触发器的输入时产生攻击者预期的错误行为。后门攻击在模型中植入隐蔽的“后门”,在正常输入下不会触发,只有当输入包含特定触发器模式时才会激活恶意行为。提取攻击通过反复查询目标AI系统,利用返回的预测结果重建功能相似的替代模型。
防御策略需采用“纵深防御”方法:对抗性训练(在训练过程中将对抗样本纳入训练集)、输入验证和清洗、模型蒸馏(使用大模型指导小模型学习增强鲁棒性)、同态加密和差分隐私(增加攻击者获取有用信息的难度)。
模型漂移与退化:数据漂移、模型退化与灾难性遗忘
模型漂移与退化是AI系统长期运行中面临的核心挑战。数据漂移指输入数据的分布随时间发生变化,包括概念漂移(目标变量与输入特征关系发生变化)和协变量漂移(输入特征分布变化但条件概率不变)。模型退化指模型本身性能随使用时间逐渐下降。灾难性遗忘是持续学习场景中特有的问题——模型在学习新知识时会忘记之前学到的知识。
监控指标包括准确率、召回率、F1分数变化、数据分布统计特征、预测置信度分布。缓解措施包括定期重新训练、持续监控系统、在线学习和自适应更新。
监控指标包括准确率、召回率、F1分数变化、数据分布统计特征、预测置信度分布。缓解措施包括定期重新训练、持续监控系统、在线学习和自适应更新。
幻觉与输出安全性:生成式AI的独特挑战
生成式AI常常产生看似合理但实际上错误或虚构的内容,这种现象被称为“幻觉”——事实性错误(编造不存在的事件或数据)、逻辑矛盾(前后不一致的陈述)、虚构引用(伪造的文献引用)。大型语言模型在回答问题时可能自信地给出错误事实,或引用并不存在的研究论文。
有害输出风险包括生成仇恨言论、歧视性内容、危险指令(如制毒、自杀方法)、虚假信息和深度伪造内容。这些有害输出可能被用于恶意目的——传播虚假信息、网络攻击、引导自杀、实施欺诈。
安全护栏措施包括:内容过滤和分类(通过关键词过滤、语义分析识别有害内容)、提示词工程和对齐训练(引导模型生成安全合规的输出)、人工审核机制(高风险场景进行人工复核)。
有害输出风险包括生成仇恨言论、歧视性内容、危险指令(如制毒、自杀方法)、虚假信息和深度伪造内容。这些有害输出可能被用于恶意目的——传播虚假信息、网络攻击、引导自杀、实施欺诈。
安全护栏措施包括:内容过滤和分类(通过关键词过滤、语义分析识别有害内容)、提示词工程和对齐训练(引导模型生成安全合规的输出)、人工审核机制(高风险场景进行人工复核)。
AI Agent自主性风险与智能体安全治理
AI Agent作为一种全新的委托-代理关系,被授权代表人或组织在真实环境中规划、决策、执行,面临四大风险。
自主权边界决定风险敞口,一旦从咨询延伸到签约付款就易引发法律与资金风险。权限粒度风险方面,被劫持或出错的Agent会以过高权限造成破坏,需实施最小权限原则。上下文的实时性风险方面,Agent在某个时刻被授权执行某类行动,不代表它在所有时刻都应该执行同类行动,授权失效后有执行危险动作的风险。操作的可逆性风险方面,Agent产生的效果有些是可逆的,有些完全不可逆,没有人工监督会造成无法逆转的损失。
治理策略包括:对Agent自主权进行分级管理、实施最小权限原则、建立AI Agent资产台账、对高等级授权设置不可绕过的人工检查点、构建Agent行为审计链。
自主权边界决定风险敞口,一旦从咨询延伸到签约付款就易引发法律与资金风险。权限粒度风险方面,被劫持或出错的Agent会以过高权限造成破坏,需实施最小权限原则。上下文的实时性风险方面,Agent在某个时刻被授权执行某类行动,不代表它在所有时刻都应该执行同类行动,授权失效后有执行危险动作的风险。操作的可逆性风险方面,Agent产生的效果有些是可逆的,有些完全不可逆,没有人工监督会造成无法逆转的损失。
治理策略包括:对Agent自主权进行分级管理、实施最小权限原则、建立AI Agent资产台账、对高等级授权设置不可绕过的人工检查点、构建Agent行为审计链。
系统安全与基础设施威胁
AI系统安全性还取决于其运行的基础设施和部署环境。模型部署环境面临服务器入侵、配置错误、权限管理不当等威胁。API接口面临身份验证绕过、SQL注入、拒绝服务攻击。数据传输和存储需要加密保护。供应链安全涉及第三方组件的漏洞风险。
“AI中转站”风险值得关注——介于用户和AI模型厂商官方服务之间的代理层,因整合多国大模型接口而受追捧,但其粗放发展模式已引发多起安全事件:隐私泄露(缺乏数据加密机制)、模型造假(以低配模型冒充高端产品)、恶意控制(植入后门窃取账号或远程监控设备)、数据违规出境(未履行安全评估程序)。
防护措施包括安全开发生命周期(SDL)、渗透测试和红队演练、零信任架构、安全审计和合规认证、选择官方授权平台、对敏感数据脱敏处理。
“AI中转站”风险值得关注——介于用户和AI模型厂商官方服务之间的代理层,因整合多国大模型接口而受追捧,但其粗放发展模式已引发多起安全事件:隐私泄露(缺乏数据加密机制)、模型造假(以低配模型冒充高端产品)、恶意控制(植入后门窃取账号或远程监控设备)、数据违规出境(未履行安全评估程序)。
防护措施包括安全开发生命周期(SDL)、渗透测试和红队演练、零信任架构、安全审计和合规认证、选择官方授权平台、对敏感数据脱敏处理。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-29
AI产业
96页
10张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录