机器学习中的一些有趣点【Attack 和 Defence】

什么是机器学习中的攻击

"攻击机器学习模型" 指的是试图危害或操纵机器学习模型的概念。有各种类型的攻击机器学习模型的方法,它们可以广泛分为几类:

  • 对抗攻击:
    • 定义: 对抗攻击涉及对输入数据进行微小的、通常是难以察觉的更改,目的是使机器学习模型对数据进行错误分类。
    • 目标: 了解模型的脆弱性,并探索使其产生不正确预测的方法。
  • 模型反演:
    • 定义: 模型反演攻击试图通过观察其输出,反向工程或提取机器学习模型中的敏感信息。
    • 目标:从模型中获取训练数据或模型结构的洞察,潜在地揭示机密信息。
  • 规避攻击:
    • 定义: 规避攻击的目的是通过操纵输入数据来规避机器学习模型的检测或分类。
    • 目标: 通过精心制作输入样本,愚弄模型以产生不正确的预测。
  • 数据污染:
    • 定义: 数据污染攻击涉及向训练集注入恶意数据,以影响模型的行为。 目标:
    • 在训练期间微妙地改变模型的学习参数,导致在未来真实数据上性能受损。
  • 模型提取:
    • 定义: 模型提取攻击旨在提取机器学习模型的内部详细信息或参数。 目标:
    • 获取训练模型的副本,潜在地允许攻击者以恶意方式使用模型或深入了解专有算法。

攻击相对于防御来说是容易的。

攻击的类型

在训练的时候是调整Network的参数,而在攻击的时候是调整x'使预测的结果越错越好。且这张图片和原图片(可以被正确分类的图片)十分相似

  • 没有目标的攻击类型
    • 找到一张图片可以被识别错误,
  • 有特定目标的攻击类型
    • 找到一张图片可以被识别为指定的类型

      常用的Constraint公式
相关推荐
陈天伟教授1 分钟前
【30天学会机械制图 第4天】项目一 从平面图形开始 任务1 按标准来画图,秒懂!
人工智能·平面·ai编程·具身智能机器人技术·机械制图
PC2005-cloud8 分钟前
分享一个我发现的免费 AI 资讯 API:AI HOT,无需注册、无需 Token、开箱即用
人工智能
天涯明月19938 分钟前
SGLang深度研究报告
人工智能·后端·推理·sglang
liutao84120417 分钟前
TrainEye源码解读-02. 登录认证 · 后端篇
人工智能
AI导出鸭21 分钟前
怎么让文心做表格?AI导出鸭苹果版将文心输出的管道表格智能解析为二维结构,一键导出为Excel或Word标准表格
人工智能·chatgpt·word·excel·ai导出鸭
ZJU_统一阿萨姆25 分钟前
【算子开发】Reduction算子完全指南
人工智能·算法·语言模型
迪康coolmu27 分钟前
企业文件外发防泄漏实践:从通道封堵到三层全链路管控
大数据·运维·网络·人工智能·安全·阿里云
苦猿的大模型日记28 分钟前
Day49|投机解码:小模型帮大模型提速,为什么不一定更快?
人工智能
听你说3228 分钟前
三诺动态血糖仪i6搭载L5级小诺智能体,开启AI控糖新时代
人工智能
TMT星球32 分钟前
AI智融·场景共生,奥维云网2026数字AI生态大会在南京圆满举办
人工智能