人工智能:数据与模型安全(个人笔记)

人工智能:数据与模型安全

人工智能:数据与模型安全(个人笔记)

电子版链接:https://ai-data-model-safety.github.io,以下属于个人笔记,如有不当描述或错误的表达,请自行参考原书籍。

本博客只做了重点的概述,书中的很多例子并没有陈列出来。如有需要可自行查看书籍。

1.人工智能与安全概述

数据与模型安全

人工智能安全大致可以分为三类方向,人工智能内生安全、人工智能衍生安全、以及人工智能助力安全。(AI赋能安全、AI自身安全(人工智能内生安全、人工智能衍生安全)),参考视频:【重生之我在修仙世界学AI安全:从 0 到 1 AI安全入门指南】

  1. 人工智能内生安全指的是由于技术本身的脆弱性所引发的智能系统本身出现的安全问题,其作用对象是系统本身。理论上,任何一个智能系统的组件,如训练所使用的人工智能框架、训练数据、模型结构等,都有可能出现安全问题。
  2. 人工智能衍生安全指的是由于智能模型的不安全性而给其他领域带来的安全问题,其作用对象是智能系统以外的其他领域。
  3. 人工智能助力安全指的是利用人工智能技术为其他领域提升安全性。

数据安全

训练数据攻击方式
  1. 数据投毒:通过操纵数据收集或标注过程来污染(毒化)部分训练样本,从而大幅降低最终模型的性能。
  2. 数据窃取:从已训练好的模型中逆向工程出训练样本,从而达到窃取原始训练数据的目的。
  3. 隐私攻击:利用模型的记忆能力,挖掘模型对特定用户的预测偏好,从而推理出用户的隐私信息。
  4. 数据篡改:利用模型的特征学习和数据生成能力,对已有数据进行篡改或者合成全新的虚假数据。
针对模型攻击发布方式
  1. 对抗攻击:在测试阶段向测试样本中添加对抗噪声,让模型作出错误预测结果,从而破坏模型在实际应用中的性能。
  2. 后门攻击:以数据投毒或者修改训练算法的方式,向模型中安插精心设计的后门触发器,从而在测试阶段操纵模型的预测结果。
  3. 模型窃取:通过与目标模型交互的方式,训练一个窃取模型来模拟目标模型的结构、功能和性能。

后门攻击参考视频:【后门攻击入门】,建立使用数据投毒的方式,在训练的数据集上建立一些数据(这些数据带有后面触发器,触发器类似与一个小方块什么的,同时该别这个数据的标注信息),将这些数据与原数据一起交给神经网络学习,这是神经元的参数就会被污染,当测试集干净的数据(不带触发器的数据)在测试的时候就依然可以被正确的识别,带触发器的数据因为触发器的原因会被识别错误的信息。具体可以参考上述学习链接。

2.机器学习基础

参考书籍

3.人工智能安全基础

基本概念

  1. 攻击者 是指对数据、模型及其相关过程,包括数据收集、模型训练和模型部署等,发起恶意监听、窃取、干扰、甚至破坏行为的个人或组织。一方面,攻击者可以在不破坏现有数据和模型的情况下,通过监听和窃取获得关键信息,并从中获利。例如在联邦学习中,攻击者可以通过监听其他用户上传的模型(或梯度)信息而窃取对方的隐私数据。另一方面,攻击者也可以干扰和破坏模型的正常训练或部署使用,导致其发生性能下降和大规模决策错误。这些攻击严重时甚至可能会给大量用户带来生命和财产损失。攻击方法是指攻击者用来对数据、模型及其相关过程,包括数据收集、模型训练和模型部署等,发起攻击的具体手段。攻击方法(attack method)是攻击者所使用的具体攻击手段,可能是一个软件、一段程序、一个算法。攻击方法往往受到现实条件的约束,在实际场景中,攻击者所掌握的信息往往是有限的,所以攻击者需要设计"精明"的攻击方法,最大化利用已有条件来完成高效的攻击。高效攻击方法的设计毋庸置疑是攻击研究中最核心的部分,此外,还需要确保攻击的隐秘性,避免暴漏给防御者。
  2. 受害者是指由于受到数据或模型攻击而利益受到损害的数据或模型所有者、使用者或其他利益相关者。与受害者密切相关的两个概念是:受害数据(受到恶意攻击的训练或测试数据。)和受害模型(受到恶意攻击的人工智能模型)。
  3. 防御者是指通过一定的防御措施保护数据或者模型免受潜在恶意攻击的个人或组织。防御方法是指防御者用来对数据、模型及其相关过程,包括数据收集、模型训练和模型部署等进行保护,使其免受潜在攻击的具体手段。

威胁模型

(白盒威胁模型、灰盒威胁模型和黑盒威胁模型)定义了系统的运行环境、安全需求、所面临的安全风险、潜在攻击者、攻击目标和攻击方法、可能的防御策略、防御者可利用的资源等攻防相关的关键设置信息。

  1. 目标数据是指攻击者在进行攻击时的数据对象。于数据攻击来说,攻击者是无法接触整个目标数据集的,攻击者最多也只能访问极小一部分目标数据,比如1%或0.1%的训练数据,甚至不能访问任何目标数据。
  2. 目标模型是指攻击者在进行攻击时的模型对象。判断攻击的目标是数据还是模型本身就是一件有难度的事情。有些模型攻击方法,比如后门攻击,也可以通过数据投毒进行,但是它们攻击的终极目标是操纵模型的预测结果,所以最终的攻击目标应该是模型,而数据只是一种手段。再比如,对抗攻击通过扰动测试数据来让模型犯错,也是对数据进行了攻击,但最终的目标还是模型。相反,数据窃取攻击通过跟模型交互来达到数据窃取的目的,所以攻击目标是数据而不是模型。在实际的研究过程中,我们先要弄清楚攻击的真正目标是什么,才能制定对应的防御策略。
  3. 替代数据是指攻击者自己收集的、可以用来替代目标数据的傀儡数据。不能访问的原始数据
  4. 替代模型是指攻击者自己拥有的、可以用来替代目标模型的攻傀儡模型。
    替代数据类似与我在网上找了一些数据集D,将接着数据集D通过询问的原始模型f(已经训练好的模型),逐渐调整数据集,使其达到与原始数据集类似,在使用替代数据D去训练模型得到替代模型,以此实现模型窃取
白盒威胁模型

白盒威胁模型主要是对攻击目标对象来说的,是指攻击者具有对目标数据或目标模型的完全访问权限。"白盒"一般指的是访问权限,并不意味着攻击者就可以随意修改目标数据或目标模型。白盒威胁模型主要被模型攻击所采用。白盒模型攻击假设攻击者可以获得模型参数、训练数据、训练方法以及训练超参数等所有关键信息。白盒模型攻击往往用来揭示模型的脆弱性,评估模型的安全风险,衡量模型在"最坏"情况下的表现。

黑盒威胁模型

黑盒威胁模型假设攻击者只能通过API(application programming interface)对模型发起查询请求并获得返回结果,而无法获取训练数据、训练方法、模型参数等其他信息。黑盒攻击只能使用模型,而无法知道模型背后的细节信息。黑盒威胁模型是最接近现实场景的一种攻防假设,即模型和训练数据都是保密的,只有模型在部署使用后,攻击者才有机会通过API进行攻击。

灰盒威胁模型

灰盒威胁模型介于白盒威胁模型和黑盒威胁模型之间,假设攻击者可以知道攻击目标的部分信息,如任务类型、数据类型、模型结构等,但是无法获得具体的训练数据或模型参数。因为攻击者所知道的先验信息往往可以通过开源信息获得,尤其是当今人工智能大量采用类似开源数据集和预训练模型,正在发生严重的趋同效应,这也导致先验信息更容易获得。

有点抽象,大概理解就是,三种模型的作用方式不一样,白盒可以知道数据集,训练参数,训练过程具体信息,黑盒什么都不知道,攻击作用在利用模型的返回结果设计攻击方法,有点像前面提到了傀儡模型那个思想,灰盒知道部分的信息。

4.数据安全:攻击

数据投毒

数据投毒(也称投毒攻击)是一种训练阶段的攻击,其通过污染训练数据来干扰模型的训练,从而达到降低模型的推理性能的目的。在实际场景中,投毒者可以通过两种方式实施投毒攻击,即被动攻击和主动攻击。被动攻击是指攻击者可通过在线社交媒体上传有毒数据到网上,等待受害者利用网络爬虫下载使用;主动攻击则可以直接将有毒数据发送到数据集收集器中(如聊天机器人、垃圾邮件过滤器或用户信息数据库)。

数据投毒可大致分为六类:标签投毒攻击、在线投毒攻击、特征空间攻击、双层优化攻击、生成式攻击和差别化攻击。

标签投毒攻击

改变训练集的label

在线投毒攻击

在线投毒攻击假设攻击者可以对训练样本进行在线的修改、注入等,但对标签不做改动。

特征空间攻击

特征空间投毒(feature space poisoning)攻击通过修改毒化样本的深度特征来完成攻击。通过基于替代模型的深度特征修改,特征空间攻击几乎可以随意修改样本与类别之间的对应关系,即能让一个类别为A的样本跟任意非A类别的深度特征匹配。在特征空间进行对应关系的修改并不需要修改标签,具有很高的隐蔽性。

改变投毒数据集的深度信息,这些信息会影响数据的特征提取,进一步影响神经网络的权重参数。

特征碰撞攻击的优化目标定义如下:

双层优化攻击

双层优化的方式去实现数据投毒,其也可以与其他攻击方式结合产生更大效益

具体一些算法公式可以参考:https://ai-data-model-safety.github.io/source/chap4.html

生成式攻击

上述数据投毒攻击都在毒化数据生成和使用效率上有所受限,而基于生成模型的生成式攻击(generative attack)则可避免基于优化攻击的高昂计算代价,大大提高毒化数据的生成和使用效率。生成式攻击的核心是生成模型的训练(如生成对抗网络和自动编码器)。生成模型可以通过学习毒化噪声分布进而大规模生成毒化数据。生成式攻击一般需要攻击者知晓目标模型的相关知识,对应灰盒或白盒威胁模型。

具体一些算法公式可以参考:https://ai-data-model-safety.github.io/source/chap4.html

差别化攻击

上述几类攻击方法在投毒的过程中随机选取少量训练样本进行毒化,可以被认为是一种无差别化攻击。然而,研究发现毒化样本的选择会大大影响攻击效果。由此引出了基于样本影响力的差别化攻击(influence-based attack)。基于样本影响力的投毒攻击通过选择影响力大的样本来投毒,以此来提高攻击的强度。

简单的理解,样本投毒是随机找的样本的集合,有些样本的特征太少了,而差别化攻击目的就是为了提取出特征样本多的样本,和在双层优化在攻击在数据集攻击的思想一致。

隐私攻击

目前针对数据的隐私攻击主要是针对深度神经网络的推理攻击,攻击者在白盒或黑盒威胁模型下试图从模型中推理或逆向出有关训练数据的信息或者训练数据本身。以医学图像分析场景为例,展示了在白盒和黑盒两种不同威胁模型下的隐私攻击。

参考视频:隐私攻击和鲁棒性攻击的未来研究方向

成员推理攻击

成员推理攻击(membership inference attack,MIA)的主要思想是利用目标模型在训练数据和测试数据上的不一致性来推理某一样本是否在目标模型的训练数据中。通过判定某个样本是否存在于训练数据集中,攻击者可以进一步猜测样本所属的类别以及其他一些隐私信息,如推断某人是否去过某个地方、是否患有某种疾病等。

黑盒模型只能得到神经网络模型的输出结果,根据输出结果使用别的样本,来推训练集的数据。

属性推理攻击

属性推理攻击(attribute inference attack,AIA)来源于模型逆向攻击(model inversion attack),是针对个体属性的隐私攻击。攻击者基于已发布的目标模型,从给定样本的非敏感属性中推断其敏感属性。

成员推理和属性推理的差别,成员推理是利用模型去推训练集样本数据或者检查样本是否存在训练集中,属性推理就是使用一些嵌套词去骗模型信息。

数据窃取

数据窃取攻击(data stealing attack)从已训练模型中逆向得到模型的原始训练数据,所以也称为数据抽取攻击(data extraction attack)或模型逆向攻击(model inversion attack)。

篡改与伪造

篡改和伪造主要是指利用深度伪造(deepfake)等多种技术对图像和视频进行篡改。根据被篡改数据的内容和类型,又可分为普通篡改和人脸伪造。 深度伪造技术可以轻松地对图像进行编辑和修改,生成具有误导性或欺骗性的内容,被恶意篡改的内容在经过传播后,会造成误导舆论、扰乱秩序、损坏名誉、骗取钱财等恶性事件的发生。与其他技术不同,现在有很多工具都提供了深度伪造的功能,这些工具的使用门槛很低,使得伪造多媒体(图像、视频、演讲等)能够以极低的成本进行大规模制造。

5.数据安全:防御

鲁棒性训练

应对数据投毒最直接的一种防御方法就是鲁棒训练,即提高训练算法的鲁棒性,使其能够在训练过程中检测并抛弃毒化样本,从而避免模型被攻击。可惜的是此方面的研究工作并不是很多。我们在很多时候并不知道数据是否被投毒,也无法估计被投毒的比例有多大、样本有哪些,所以也就很难设计高效的鲁棒训练方法。但随着大规模预训练的流行,此类的鲁棒训练算法将会变的格外重要。

差分隐私

差分隐私其来源于密码学中的语义安全(semantic security),即明文完成加密后攻击者无法区分不同明文对应的密文。差分隐私保护的主体并不是数据集整体的隐私,而是其中单个个体的隐私,因此,差分隐私要求数据集中单个个体对相关函数的输出影响都在一定的限度之内。

参考视频:差分隐私:原理、应用与展望-哔哩哔哩

差分隐私数据防御,机器学习系统中,成员推断攻击通过比较目标模型对候选样本的置信度、损失或行为差异,推断该样本是否参与训练;其本质是利用模型对训练样本的过度记忆。

同态加密

同态加密的概念:数据经过加密之后,对密文进行一定计算,后将密文的计算结果进行解密的过程,等同于直接对明文数据进行对应计算。

参考视频:【同态加密】,同态加密允许直接对加密数据执行计算(如加法、乘法),而计算过程不会泄露原文的任何信息。对密文计算后的结果,拥有密钥的用户对处理过的密文数据进行解密后,得到原文进行对应计算(如加法、乘法)后的结果。

类型 支持的操作 局限
部分同态加密(PHE) 只支持加法 乘法(如 Paillier 支持加法) 只能做单一运算
somewhat 同态加密(SHE) 加法和乘法都可以,但次数有限 做多了会积累"噪声"导致无法解密
全同态加密(FHE) 任意次数的加法+乘法 → 理论上可计算任意函数 计算开销大,密钥/密文膨胀明显

联邦学习

典型联邦学习框架是一种"参与方-服务器"结构。参与方利用本地数据更新本地模型,服务器则负责聚合不同参与方的梯度信息并完成对全局模型的更新。服务器端通常由可信第三方机构或者数据体量最大的参与方来担任。参与方上传的梯度信息中仍然包含大量参与方本地数据的隐私信息,可以使用差分隐私 (Abadi et al., 2016) 和同态加密 (Aono et al., 2017) 进行保护。

参考视频:【前置知识】FedAvg:联邦学习创世纪算法】

6.模型安全:对抗攻击

对抗攻击(adversarial attack)是一种针对机器学习模型的测试阶段攻击。对抗攻击一般通过向干净测试样本中添加细微的、人眼无法察觉(对图像数据来说)的噪声来构造对抗样本进而误导模型在对抗样本上做出错误的预测。

首先,对抗攻击的目标是一个已经训练完成的模型,所以是一种测试阶段攻击。这也就意味着对抗攻击扰动的样本是测试样本(示例图中的测试图片)。其次,对抗攻击改变的是输入样本而模型训练改变的是模型参数,所以对抗攻击需要计算(白盒攻击)或者估计(黑盒攻击)模型损失相对输入的梯度信息。第三,对抗攻击通过梯度上升最大化模型的错误而模型训练通过梯度下降最小化模型的错误。上述三个区别通常用来解释对抗样本与对抗攻击的初始设计思想。

对抗样本攻击之所以在测试阶段,是因为它利用的是已学习决策边界的非稳健性,通过输入扰动让模型在推理时出错,而不是通过训练过程改写模型。

参考视频:【AI安全-对抗攻击与防御】

7.模型安全:对抗防御

对抗样本检测(adversarial example detection,AED)是一种很直接也很实用的对抗防御策略,在实际应用场景下可以检测对抗攻击并拒绝服务。对抗样本检测任务本身是一个二分类问题,检测器需要对输入进行"正常"还是"对抗"的判别。我们可以收集一定数量的正常样本和其对应的对抗样本,然后基于要保护的模型抽取不同类型的特征,比如中间层特征、激活分布等。最后将两类样本的特征标记为"正常"和"对抗"类别,组成对抗检测训练数据集D。我们可以在D上训练一个任意的分类模型作为最终的检测器g。在测试阶段,我们先将待检测的样本送入模型抽取特征,然后以抽取的特征为检测器g的输入进行检测

六大类经典的对抗样本检测方法:二级分类法、主成分分析法、异常分布检测法、预测不一致性、重建不一致性和诱捕检测法。

8.模型安全:后门攻击

后门攻击与对抗攻击不同,是一种训练阶段的攻击,攻击者在训练开始前或者训练过程中通过某种方式往目标模型中安插后门触发器,从而可以在测试阶段精准的控制模型的预测结果。后门攻击的目标是:(1)后门模型在干净测试样本上具有正常的准确率;(2)当且仅当测试样本中包含预先设定的后门触发器时,后门模型才会产生由攻击者预先指定的预测结果。其中,目标(1)保证了后门攻击的隐蔽性,目标(2)保证了后门模型能够被攻击者任意操纵。

后门攻击通过两个操作来完成:后门植入和后门激活。后门植入是指在训练阶段,攻击者将预先定义的后门触发器植入目标模型中,从而获得一个后门模型。后门激活是指在推理阶段,任何包含后门触发器的测试样本都会激活后门,并控制模型输出攻击者指定的预测结果。后门攻击往往具备低攻击门槛、高攻击成功率、高隐蔽性等特点。一方面,这是因为后门触发器一旦被注入目标模型则很容易被用来发起攻击。另一方面,后门模型在干净样本上表现正常,当且仅当后门触发器出现时模型才会产生恶意行为,这使后门攻击很难通过普通的模型测试发现。

后门攻击参考:【后门攻击入门】

特征空间攻击

这是后门攻击快速发展过程中衍生出来的一种比较流形的攻击,这类攻击假设训练过程都是可以操纵的,攻击者掌握训练数据、超参、训练过程等几乎所有信息。大部分情况下,模型训练者就是攻击者(比如第三方模型训练平台或模型发布者)。这种攻击的兴起源于当前人工智能对第三方训练平台和预训练大模型的依赖。

隐藏触发器后门攻击。Saha等人 (Saha et al., 2020) 提出隐藏触发器后门攻击(hidden trigger backdoor attack),该攻击不仅保证了图像与标签的一致性(即净标签设定),还保证了后门触发器的隐蔽性。与此前方法不同,隐藏后门攻击基于目标和源样本在模型的特征空间优化生成后门样本。生成的后门样本在特征空间中与后门类别的干净样本具有相同的表征。

迁移学习攻击

迁移学习(transfer learning)旨在将某个领域或任务上学习到的知识迁移应用到其他相关领域中,避免了每次在新领域都需要从头训练模型的应用难题。大家常用的微调技术即是一种经典的迁移学习方法。以深度模型为例,用户可以通过开源平台下载预训练模型权重,然后利用本地数据对预训练模型进行微调,从而使其适配本地下游任务。迁移学习极大的缩短了训练模型的时间和计算成本,在当今人工智能中扮演了重要的角色。

潜在后门攻击。 针对迁移学习场景,Yao等人 (Yao et al., 2019) 首次提出了潜在后门攻击(latent backdoor attack)。攻击者预先在教师模型中安插特定的后门样式,将其与后门类别关联。在此教师模型上微调得到的学生模型就会继承教师模型中的后门。潜在后门攻击的流程如图 图8.4.2 所示,主要由以下四个步骤完成:

联邦学习攻击

联邦学习是一种分布式机器学习技术,允许用户在本地数据不公开的条件下,多方联合训练一个强大的全局模型。联邦学习技术有利于打破"数据孤岛",解决隐私泄露等问题,在诸多实际场景中得到了广泛的应用。

参考视频:【前置知识】FedAvg:联邦学习创世纪算法

联邦学习的后门攻击威胁模型与传统后门攻击有一定的区别。对于联邦学习而言,一方面为了保证全局模型的性能,参与者数量往往很庞大,无法避免参与者中包含恶意的攻击者;另一方面,考虑到每个参与者的训练数据与训练过程等隐私信息都受到保护,因此难以通过投毒数据检测等手段来防御联邦学习中的后门攻击。所以,一旦参与者中包含恶意的攻击者,攻击者可以向服务器上传包含后门的本地模型梯度,从而污染全局模型训练,导致在联邦学习结束后所有参与者拿到的全局模型都有后门。

9.模型安全:后门防御

目前针对后门攻击的防御策略主要有三种:(1)后门模型检测、(2)后门样本检测 和(3)后门移除。参考视频:【神经网络后门攻击与防御 Ting Wng 宾州州立大学-哔哩哔哩】

  1. 后门模型检测的目标是判断给定模型是否包含后门触发器,可以根据模型在某种情况下展现出来的后门表现来判断。
  2. 后门样本检测的目标是识别训练数据集或者测试数据集中的后门样本,其中对训练样本的检测可以帮助防御者清洗训练数据,而对测试样本的检测可以在模型部署阶段发现并拒绝后门攻击行为。
  3. 后门检测之后需要后门移除方法将检测出来的后门从模型中清除掉,以完成模型净化。

10.模型窃取攻击

模型窃取攻击的目标是通过一定手段窃取得到一个跟{受害者模型}功能和性能相近的窃取模型,从而避开昂贵的模型训练并从中获益。模型窃取是一种侵犯人工智能模型知识产权的恶意攻击行为。实际上,对人工智能模型知识产权的侵犯不仅限于模型窃取技术,未经授权的模型复制、微调、迁移学习(微小模型修改+微调)、水印去除等也属于模型知识产权侵犯行为。相比之下,模型窃取攻击更有针对性、威胁更大,即使目标模型是非公开的,很多窃取方法也能通过模型服务API完成窃取。

模型窃取防御

模型窃取防御的目的是让攻击者无法通过简单的查询就能窃取模型参数。一般来说,模型参数的泄露是因为参数过于精确,对每一个不同的输入样本都呈现出特定的激活状态。所以可以使用模糊化技术进行防御,模糊模型参数、模糊决策边界、模糊输入概率等等,都会对窃取攻击起到一定的防御作用。当然,一定程度的"性能-安全性权衡"也是在所难免的。另外一种简单有效的防御方式是查询控制,通过直接限制用户的查询方式、查询次数等恶意查询行为来阻止模型窃取的发生。此外,在窃取发生以后,我们也需要模型溯源技术,对窃取模型进行溯源追踪、调查取证,从而可以通过法律手段来保护模型所有者的权益。下面我们将简要介绍这三类模型窃取防御技术。

  1. 信息模糊防御旨在保证模型性能的前提下,对模型的输出进行模糊化处理,尽可能的扰动输出向量中的敏感信息,从而保护模型隐私。根据具体防御方法的不同,信息模糊防御又可以分为截断混淆(通过对受害者模型的输出概率向量进行模糊化操作,使得输出的向量包含更少、更粗糙的信息,从而实现窃取防御)和差分隐私(通过添加噪声,使得差别只有一条记录的相邻数据集经过模型推理获得相同结果的概率非常接近,即抹除单个样本在模型中的区分度,从而保护模型隐私)。
  2. 查询控制防御在保证用户正常使用模型API接口的情况下,根据用户查询行为进行判别,分辨出正常用户和攻击者,从而在模型输入阶段实现精准控制与防御。直观来讲,模型窃取者需要不断的变换输入样本来刺探模型的参数和决策边界,需要多样的输入来覆盖更大的测试空间,这种行为与普通的API接口使用有很大的区别,可以利用这种区别来检测模型窃取行为,即所有尝试完成"拼图"的查询行为都有可能是窃取。一种最简单的防御策略就是控制所有用户的查询次数和查询频率,一方面可以降低被且窃取的风险,另一方面可以降低服务器的计算压力,一举两得。实际上,很多国际互联网公司就是通过这种策略来控制免费用户的查询权限的。当然,这会带来很不好的用户体验,尤其是针对付费用户时。更灵活一点,那就是按照查询行为进行检测,根据每个用户自己的行为特点进行查询控制。
  3. 当模型泄露已经发生时,模型所有者需要通过溯源技术证明窃取者所拥有的模型来自于防御者,即两个模型是同源的且窃取模型是受害者模型的衍生品,以此帮助模型拥有者在知识产权诉讼过程中掌握主动权。目前领域内还没有工作能同时达到这两个目标。现有模型溯源方面的方法大致可以分为两类:模型水印(向模型中添加所有者印记(如公司logo)是一种最直接的模型版权保护方法,这样就可以通过验证所有者印记来对模型进行溯源)和模型指纹(模型所有者通过提取模型指纹,使其与其它模型区分开来,从而验证模型的版权)。
相关推荐
Allen_LVyingbo1 小时前
2026医疗AI编程:医院信息工程部规模化编程与代码审核路径(上)
网络·人工智能·cnn·transformer·知识图谱·ai编程
Wang's Blog1 小时前
Java框架快速入门: Spring Security+OAuth2之安全配置基础及函数式风格对比
java·安全·spring
云上工程笔记1 小时前
四柱记账法和复式记账法有什么区别?复式记账为什么更适合查错和对账
大数据·前端·人工智能
TonyLee0171 小时前
AI制作PPT(codex+ppt-master skills)
人工智能·powerpoint
梦想的初衷~1 小时前
Agent2.0驱动的科研全链路实战营;LLM×NotebookLM×本地部署,从数据分析到Sora级视频产出,“圆桌会议“
人工智能·ai科研教程·notebooklm科研·科研agent开发·python科研自动化·文献智能管理
明航咨询_贾老师1 小时前
AI智能体供应链投毒事件深度剖析|从OpenClaw技能包攻击到91% Agent漏洞,企业安全架构必须重构
人工智能·重构·安全架构
小道士写程序1 小时前
自然语言处理NLP - 第11章 从概率到回答:推理与提示词
人工智能·自然语言处理
147API1 小时前
学生模型和教师模型怎样做路由,阈值应该看哪些指标
网络·人工智能·深度学习·机器学习·智能路由器
该逃避避1 小时前
Copilot 能换成本地吗?本地化 AI 编程助手可行性全解析
人工智能·copilot