ARM++:面向深度伪造检测器的多域智能体协同可迁移对抗攻击框架

ARM++:面向深度伪造检测器的多域智能体协同可迁移对抗攻击框架

arXiv:2607.15246v1 cs.CV 2026-07-16

摘要

深度伪造检测器在黑盒对抗迁移攻击下极易失效,核心原因是现有检测器依赖脆弱、绑定网络架构的取证特征。现有可迁移攻击方案普遍缺少图像语义感知,且在无查询严格约束 场景性能大幅衰减;尤其是从卷积代理模型向Transformer目标检测器跨架构迁移时效果断崖式下跌。

本文提出ARM++多智能体对抗攻击框架,基于Qwen2.5-VL多模态大模型提取图像空间语义先验,搭配Qwen3大语言模型完成攻击基元调度、自适应超参重参数化、熵正则扰动融合。框架融合五大互补攻击基元:稠密CW优化、稀疏显著性JSMA、几何形变STA、频域SSA、分块BSR,全方位覆盖CNN/Transformer异构模型的归纳偏置漏洞。

基于AADD-2025权威深度伪造攻防基准开展完整对照实验,在低画质(LQ)、高画质(HQ)两大图像场景下,ARM++全面超越单智能体、静态集成、传统迁移攻击基线。统计学检验证明,相比SOTA智能体攻击ARM,ARM++盲目标攻击成功率(ASR)显著提升;在两类主流防御机制下仍保持高逃逸率。

实验结论证明当前商用深度伪造检测器存在显著可靠性漏洞,同时验证智能体闭环调度、多域扰动融合对跨架构迁移攻击的核心增益。

关键词:深度伪造检测;黑盒对抗攻击;可迁移对抗样本;多智能体;多模态大模型;频域扰动;分块变换;无查询攻击

1 引言

1.1 研究背景

生成式AI快速普及,GAN、扩散模型、人脸交换技术可生成人眼难以分辨的伪造图像,深度伪造自动检测成为内容风控、生物核验、数字取证核心技术。现有CNN、ViT、Swin-B检测器在干净测试集准确率均超96,但黑盒对抗迁移场景下可靠性急剧下滑。

现有迁移攻击(MI-FGSM、DI-FGSM等)仅做梯度时序平滑、随机输入变换优化,存在两大致命短板:

  1. 无图像语义理解,无法针对性定位人脸伪造薄弱区域;
  2. 仅单一像素/空域扰动,难以同时攻破CNN局部纹理、Transformer全局分块两类归纳偏置;
  3. 大量方案需要频繁查询目标检测器梯度,不符合真实线上无查询黑盒威胁模型。

1.2 现有智能体攻击ARM局限性

基线ARM仅集成CW、JSMA、STA三类空域基元,存在四大缺陷:

  1. 缺少频域、分块扰动,对Swin等分块Transformer迁移效果极差;
  2. 扰动融合分数引入目标检测器查询项,违背严格无查询约束;
  3. 代理模型仅ResNet50+DenseNet121两类CNN,模型多样性不足;
  4. 评测仅覆盖单一低画质子集与ViT-B单一目标,高画质、多Transformer泛化能力未验证。

1.3 ARM++四大核心创新

  1. 五基元多域扰动体系:新增SSA频域模拟、BSR分块打乱,同时覆盖空域、频率、分块三类模型漏洞;
  2. 严格无查询闭环智能体:移除目标检测器查询项,仅依靠代理集成梯度完成全部优化、融合;
  3. VLM视觉语义智能体+LLM调度分层架构:VLM提取人脸伪造语义掩码,LLM完成停滞检测、自适应超参调优、熵正则混合权重求解;
  4. 完备评测体系:LQ/HQ双画质、ViT/Swin双Transformer目标、自适应防御消融、跨数据集零样本泛化、GPU算力量化、故障模式分类。

1.4 框架整体流程

ARM++闭环执行流水线:

  1. Qwen2.5-VL语义智能体解析人脸,输出伪造区域软掩码;
  2. 编排智能体初始化五类攻击基元超参、全局约束;
  3. 并行Method智能体独立生成CW/JSMA/STA/SSA扰动;
  4. 批判智能体打分所有候选扰动,策略智能体检测收敛停滞并放宽ϵ\epsilonϵ扰动上限、降低SSIM阈值;
  5. 顾问智能体自适应修正每类基元超参;
  6. 混合智能体熵正则加权融合多扰动,生成主候选对抗图;
  7. 循环迭代至最大轮次,从全部历史候选中选取最优无查询对抗样本,仅最后一步测试盲目标ASR。

2 相关工作

2.1 传统静态可迁移对抗攻击

MI-FGSM、TI-FGSM、SINI-FGSM依靠动量、平移不变提升迁移,但仅空域梯度优化;AutoAttack为多静态扰动集成,无语义引导,扰动幅度大、人眼可见失真严重;Square、SimBA为无梯度查询攻击,但迭代开销极高、迁移率低。

缺陷:全部为固定扰动流程,无法根据图像伪造特征自适应调整,缺少多域互补扰动融合。

2. 频域/分块专项攻击

SSA通过DCT频域随机调制,针对CNN频域过拟合;BSR对图像分块置换旋转,破坏Transformer窗口注意力;两类方法单独使用迁移有限,ARM++将其纳入智能体动态调度池。

2. LLM/VLM智能体对抗框架

ARM是首个LLM调度攻击智能体,但仅三类空域基元;AutoDA、L-AutoDA依靠决策式梯度+强化学习,无视觉语义输入;AnyAttack、FOA-Attack针对MLLM模型攻击,不面向人脸伪造检测器。

现有智能体均未实现VLM视觉语义+多域扰动+无查询约束三位一体设计。

深度伪造攻防评测基准

FaceForensics++、DFDC、AADD-2025为行业标准伪造数据集;AADD区分LQ/HQ两类伪造图像,高画质伪造细微痕迹极难捕捉,是更贴合真实线上测试集。现有攻击评测大多仅在LQ数据集验证,忽略高画质场景迁移衰减问题。

3 前置理论与威胁模型

3.1 符号定义

  • 原始人脸图像x∈0,1H×W×3\boldsymbol{x}\in0,1^{H\times W\times3}x∈0,1H×W×3,真实标签y=fakey=\text{fake}y=fake,攻击目标:让检测器预测y^=real\hat{y}=\text{real}y^=real;
  • 代理模型集成Fsurr={ResNet50,DenseNet121,EfficientNet-B4}\mathcal{F}_{\text{surr}}=\{\text{ResNet50},\text{DenseNet121},\text{EfficientNet-B4}\}Fsurr={ResNet50,DenseNet121,EfficientNet-B4},仅可访问前向/反向梯度;
  • 盲目标检测器g∈{ViT-B/16,Swin-B}g\in\{\text{ViT-B/16},\text{Swin-B}\}g∈{ViT-B/16,Swin-B},全程零查询,仅全部攻击完成后统计ASR;
  • 对抗扰动δ\boldsymbol{\delta}δ满足∥δ∥∞≤ϵ\|\boldsymbol{\delta}\|_{\infty}\le\epsilon∥δ∥∞≤ϵ,SSIM(x,x+δ)≥τ(\boldsymbol{x},\boldsymbol{x}+\boldsymbol{\delta})\ge\tau(x,x+δ)≥τ保证人眼不可感知;
  • 代理集成目标损失:Lsurr(x,t)=−∑r=1Rαrlog⁡pfr(real∣x)\mathcal{L}{\text{surr}}(\boldsymbol{x},t)=-\sum{r=1}^{R}\alpha_{r}\log p_{f_r}(\text{real}\mid\boldsymbol{x})Lsurr(x,t)=−∑r=1Rαrlogpfr(real∣x),αr=1/R\alpha_r=1/Rαr=1/R均等权重。

3.2 严格无查询威胁模型

攻击者完全未知盲目标网络结构、权重、梯度,优化、调参、扰动融合全过程禁止调用目标检测器 ;仅完成全部迭代后,用生成的对抗样本批量测试逃逸成功率。

区别于ARM基线:ARM混合分数包含目标预测项pbbp_{\text{bb}}pbb,属于弱黑盒,ARM++彻底移除该依赖,贴合真实线上攻击场景。

3.3 五大互补攻击基元完整数学定义

3.1 CW稠密ℓ2\ell_2ℓ2扰动基元

损失:JCW(δ)=∥δ∥22+c⋅Lsurr(Pϵ(x,δ),t)J_{\text{CW}}(\boldsymbol{\delta})=\|\boldsymbol{\delta}\|2^2 + c\cdot\mathcal{L}{\text{surr}}(\mathcal{P}_\epsilon(\boldsymbol{x},\boldsymbol{\delta}),t)JCW(δ)=∥δ∥22+c⋅Lsurr(Pϵ(x,δ),t)

梯度更新:δ(u+1)=Π∞,ϵ(δ(u)−ηCW⋅M~R⊙∇δJCW(δ(u)))\boldsymbol{\delta}^{(u+1)}=\Pi_{\infty,\epsilon}\left(\boldsymbol{\delta}^{(u)}-\eta_{\text{CW}}\cdot \widetilde{\boldsymbol{M}}{\mathcal{R}}\odot\nabla{\boldsymbol{\delta}}J_{\text{CW}}(\boldsymbol{\delta}^{(u)})\right)δ(u+1)=Π∞,ϵ(δ(u)−ηCW⋅M R⊙∇δJCW(δ(u)))

M~R\widetilde{\boldsymbol{M}}_{\mathcal{R}}M R为Qwen2.5-VL输出语义掩码,加权聚焦伪造区域。

3.2 JSMA稀疏显著性基元

计算像素对正负敏感度ai=∂Zˉt/∂xi,bi=∑j≠t∂Zˉj/∂xia_i=\partial\bar{Z}t/\partial x_i,b_i=\sum{j\ne t}\partial\bar{Z}_j/\partial x_iai=∂Zˉt/∂xi,bi=∑j=t∂Zˉj/∂xi;

仅选取spq=−M~pM~q⋅spq+/spq−s_{pq}=-\widetilde{M}p\widetilde{M}q\cdot s{pq}^+/s{pq}^-spq=−M pM q⋅spq+/spq−最高像素对小幅扰动,保证极低图像失真。

3.3 STA几何形变基元

可微双线性 warp 位移场优化,增加平滑TV正则抑制剧烈形变:

min⁡uLsurr(W(x,u),t)+θSTALflow(u)\min_{\boldsymbol{u}}\mathcal{L}{\text{surr}}(\mathcal{W}(\boldsymbol{x},\boldsymbol{u}),t)+\theta{\text{STA}}\mathcal{L}_{\text{flow}}(\boldsymbol{u})uminLsurr(W(x,u),t)+θSTALflow(u)

Lflow\mathcal{L}_{\text{flow}}Lflow为四邻域位移平滑损失,避免人脸五官扭曲失真。

3.4 S频域模拟SSA

2D DCT变换后随机缩放频谱系数,蒙特卡洛平均频谱扰动损失:

J^SSA(δ)=1QSSA∑q=1QSSALsurr(TωqSSA(Pϵ(x,δ)),t)\widehat{J}{\text{SSA}}(\boldsymbol{\delta})=\frac{1}{Q{\text{SSA}}}\sum_{q=1}^{Q_{\text{SSA}}}\mathcal{L}{\text{surr}}\left(\mathcal{T}{\omega_q}^{\text{SSA}}(\mathcal{P}_\epsilon(\boldsymbol{x},\boldsymbol{\delta})),t\right)J SSA(δ)=QSSA1q=1∑QSSALsurr(TωqSSA(Pϵ(x,δ)),t)

专门针对CNN频域取证特征,填补ARM缺失频域攻击能力。

3.5 BSR分块打乱基元

图像划分为NbN_bNb非重叠块,仅邻域块随机置换+90/180/270旋转,破坏Swin窗口注意力全局关联,解决Transformer迁移短板。

3.4 多智能体分工定义

  1. 分析智能体(Qwen2.5-VL) :输入原图,输出人脸伪造区域软掩码M~R\widetilde{\boldsymbol{M}}_{\mathcal{R}}M R;
  2. 编排智能体(Qwen3) :初始化全局约束ϵ(0),τ(0)\epsilon^{(0)},\tau^{(0)}ϵ(0),τ(0)、五类基元初始超参;
  3. Method并行智能体(5组独立):并行执行CW/JSMA/STA/SSA/BSR,生成独立扰动候选;
  4. 批判智能体:打分全部候选扰动(代理置信+SSIM保真度加权);
  5. 策略智能体 :监控多轮得分停滞,自动放宽ϵ\epsilonϵ上限、降低SSIM最低阈值;
  6. 顾问智能体:根据历史收敛轨迹自适应更新每类基元超参;
  7. 混合智能体:熵正则加权融合五类扰动,求解最优混合权重生成主候选对抗图。

4 ARM++完整算法流程

算法1 ARM++ 无查询多智能体对抗攻击主流程

复制代码
输入:原始伪造图像x、代理集成F_surr、最大外层迭代K_max、初始epsilon/tau、五类基元超参范围
输出:最优盲目标对抗样本x_adv_star
# 阶段1:语义侦察与全局初始化
1. VLM分析智能体生成语义报告R,计算归一化伪造掩码M~_R
2. LLM编排智能体初始化全局状态S^(0):初始epsilon、tau、各基元超参phi_m
3. 初始化历史缓存H=空、全部候选存档Z=空

# 外层主循环,迭代K_max轮
for k in 0 ... K_max-1:
    # 阶段2:并行基元候选生成
    并行遍历全部5类Method智能体m ∈ {CW,JSMA,STA,SSA,BSR}:
        输入x、当前epsilon^(k)、tau^(k)、phi_m^(k)、掩码M~_R
        执行基元优化得到扰动δ_m^(k)
        投影约束得到x_m^(k) = P_epsilon(x, δ_m^(k))
        计算代理置信、SSIM、扰动范数诊断向量d_m^(k)
        将x_m^(k)存入候选池B^(k)
    # 阶段3:批判打分+停滞检测+自适应超参更新
    批判智能体对B^(k)全部候选打分Q(z) = μ_p*p_surr - μ_l*L - μ_s*max(τ-SSIM,0)
    策略智能体读取历史窗口W内主候选得分,判定是否收敛停滞:
        停滞 → e(k+1)=min(epsilon_max, e(k)+Δ_e), τ(k+1)=max(tau_min, τ(k)-Δ_t)
        未停滞 → 约束保持不变
    顾问智能体读取历史H,输出每类基元超参修正Δphi_m,投影合法区间更新phi_m^(k+1)
    # 阶段4:熵正则五维扰动融合
    混合智能体优化混合权重w∈单纯形Δ^5,最大化融合打分S(w):
        S(w) = λ1*p_surr - λ2*max(τ-SSIM,0) - λ3||δ||2 + λ4*H_entropy(w)
    H_entropy为熵正则项,前期鼓励多基元探索,后期衰减侧重最优单类扰动
    求解最优权重w_star^(k),生成融合主候选x_master^(k)
    # 更新全局历史缓存,存档所有单类+融合候选
    H^(k+1) = H^(k) ∪ 本轮打分、权重、约束记录
    Z = Z ∪ {x_m^(k), x_master^(k)}

# 阶段5:最终候选筛选(全程未访问盲目标g)
从全部存档Z中筛选满足epsilon、SSIM约束样本,按代理集成置信p_surr降序排序,取最优x_adv_star
# 仅最终评测阶段,一次性送入盲目标g统计ASR,无任何反馈回传优化
return x_adv_star

4.1 流水线并行调度说明

五类Method智能体完全GPU并行,无串行等待;每轮迭代完成后立刻填充空闲计算槽,相比ARM同步批量执行大幅提升GPU利用率、降低单图耗时。

4.2 熵正则混合权重核心作用

λ4(k)=λ4(0)exp⁡(−ρmix⋅k)\lambda_4^{(k)}=\lambda_4^{(0)}\exp(-\rho_{\text{mix}}\cdot k)λ4(k)=λ4(0)exp(−ρmix⋅k)随迭代衰减:

  1. 前期k较小:高熵权重,强制融合五类不同域扰动,覆盖更多模型漏洞;
  2. 后期k增大:熵正则衰减,收敛到最优单类/两类扰动组合,平衡保真度与逃逸率。

5 实验完整配置

5.1 评测数据集

  1. AADD-2025(主基准)
    • AADD-LQ低画质子集:713张AI伪造人脸;
    • AADD-HQ高画质子集:693张精细生成人脸,伪造痕迹微弱,攻击难度更高;
  2. DFDC-Preview(零样本跨分布泛化测试):200张独立伪造图片,全程无微调适配。

5.2 代理/盲目标检测器

代理集成(优化仅可用模型)

  1. ResNet-50
  2. DenseNet-121
  3. EfficientNet-B4(ARM基线无此模型,为关键增益来源)
    盲目标黑盒检测器(全程零查询)
  4. ViT-B/16 全局注意力Transformer
  5. Swin-B 分层窗口移位Transformer

全部检测器基于AADD训练集AdamW微调,干净集准确率均>96%,排除基础模型弱导致的低ASR干扰。

5.3 对比基线分类

  1. 传统梯度迁移攻击:MI-FGSM、DI-FGSM、TI-FGSM、SINI-FGSM
  2. 无梯度查询攻击:Square、SimBA-DCT、PBO
  3. 静态集成攻击:AutoAttack-PGD、AutoAttack-Square、MS-GAGA
  4. 智能体攻击基线:RL-PPO、ARM(论文对比核心基线)

5.4 硬件与运行环境

GPU:NVIDIA RTX 4090;

VLM/LLM:Qwen2.5-VL-32B-AWQ、Qwen3-32B-AWQ部署AWS g6e.8xlarge;

单张图像平均攻击耗时:75秒(不含大模型推理);

全实验总GPU算力消耗:约540 GPU小时;

固定超参全局统一:

  • 最大外层迭代Kmax=5K_{\text{max}}=5Kmax=5;
  • 初始ϵ=8/255\epsilon=8/255ϵ=8/255,上限ϵmax=16/255\epsilon_{\text{max}}=16/255ϵmax=16/255;
  • 初始τ=0.7\tau=0.7τ=0.7,下限τmin=0.5\tau_{\text{min}}=0.5τmin=0.5;
  • SSIM惩罚权重μs=5.0\mu_s=5.0μs=5.0,置信权重μp=1.0\mu_p=1.0μp=1.0;
  • 熵正则初始系数λ4=0.2\lambda_4=0.2λ4=0.2,衰减系数ρmix=0.3\rho_{\text{mix}}=0.3ρmix=0.3。

5.5 评测指标

  1. ASR攻击成功率:盲目标将伪造图判定为真人的样本占比(越高攻击越强),95%Wilson置信区间;
  2. wASR加权ASR:以SSIM保真度加权,兼顾逃逸与图像不可感知;
  3. SSIM均值:对抗图与原图结构相似度,越高失真越小;
  4. 统计检验:配对McNemar精确检验+Holm--Bonferroni多重校正;
  5. 转移间隙ΔASR=psurr−ptgt\Delta\text{ASR}=p_{\text{surr}}-p_{\text{tgt}}ΔASR=psurr−ptgt:代理与盲目标成功率差值,越小迁移泛化越强。

6 实验结果与消融分析

6.1 主实验:LQ/HQ数据集盲目标ASR

表1 AADD-LQ(713图)各方法完整指标

| 攻击方案 | ViT-B ASR95%CI | ViT wASR | ViT SSIM | Swin-B ASR | Swin wASR | Swin SSIM |

| ---- | ---- | ---- | ---- | ---- | ---- |

| MI-FGSM | 0.0680.052,0.089 | 0.051 | 0.743 | 0.054 | 0.040 | 0.743 |

| DI-FGSM | 0.0380.026,0.055 | 0.032 | 0.846 | 0.047 | 0.040 | 0.846 |

| TI-FGSM | 0.1510.126,0.181 | 0.136 | 0.904 | 0.138 | 0.125 | 0.904 |

| AutoAttack-PGD | 0.1960.168,0.228 | 0.108 | 0.559 | 0.183 | 0.101 | 0.559 |

| ARM(基线) | 0.3960.361,0.432 | 0.280 | 0.698 | 0.371 | 0.261 | 0.695 |

| ARM++(本文) | 0.4430.407,0.480 | 0.312 | 0.691 | 0.408 | 0.287 | 0.686 |

核心结论(LQ):

  1. ARM++对比ARM在ViT提升4.7个百分点,McNemar检验p≈1.9×10−3p\approx1.9\times10^{-3}p≈1.9×10−3,统计显著;
  2. 远超AutoAttack-PGD等静态集成,提升24.7个百分点;
  3. SSIM仅小幅下降,在更高逃逸率下保持图像视觉保真。

表2 AADD-HQ(693图)高画质指标

攻击方案 ViT-B ASR ViT wASR Swin-B ASR
TI-FGSM 0.088 0.080 0.076
AutoAttack-PGD 0.149 0.083 0.131
ARM 0.283 0.199 0.259
ARM++ 0.321 0.225 0.287

HQ高画质全部方法ASR整体下降,但ARM++依旧保持最优,相对ARM提升3.8个百分点,证明多域扰动对细微伪造痕迹攻击有效。

6.2 跨架构迁移Gap分析

表3 ViT-B代理/目标ASR差值(Gap越小迁移越好)

方法 psurrp_{\text{surr}}psurr代理ASR ptgtp_{\text{tgt}}ptgt盲目标ASR ΔASR\Delta\text{ASR}ΔASR
TI-FGSM 0.914 0.151 0.763
AutoAttack-PGD 1.000 0.196 0.804
ARM 1.000 0.396 0.604
ARM++ 1.000 0.443 0.557

ARM++转移间隙最小,代理与盲目标行为更接近,多域扰动有效缩小CNN/Transformer架构差异。

6.3 组件消融实验(AADD-LQ ViT-B)

表4 模块移除消融,ASR下降幅度代表模块重要性

| 配置 | ASR | 相对ARM++衰减 | 核心说明 |

| ---- | ---- | ---- |

| 完整ARM++ | 0.443 | 基准 | 全部5基元+3代理+熵混合+VLM语义 |

| ARM基线(仅3空域) | 0.396 | -4.7% | 无SSA/BSR、无EfficientNet代理 |

| 移除自适应混合(均匀权重) | 0.104 | -33.9% | 熵正则融合为核心增益模块 |

| 移除VLM语义掩码 | 0.218 | -22.5% | 视觉先验大幅缩小无效扰动区域 |

| 移除SSA频域基元 | 0.388 | -5.5% | 针对CNN频域漏洞关键 |

| 移除BSR分块基元 | 0.378 | -6.5% | 攻破Swin窗口注意力必备 |

| 仅2个代理(无EfficientNet) | 0.421 | -2.2% | 多代理提升泛化 |

消融结论:自适应熵混合、VLM语义、BSR/SSA是三大核心创新模块,缺失任意一个都会大幅降低跨架构迁移成功率。

6.4 防御鲁棒性测试

两类主流防御:D1 PGD对抗训练、D2随机缩放输入

表5 防御下ViT-B ASR(LQ)

方案 无防御 D1对抗训练 D2随机缩放
AutoAttack-PGD 0.196 0.061 0.094
ARM 0.396 0.174 0.241
ARM++ 0.443 0.198 0.276

在防御加持下ARM++仍保持最高逃逸率,是现有最优检测器压力测试工具。

6.5 零样本DFDC跨数据集泛化

DFDC数据集未参与任何调优,零样本测试:

ARM++ ViT ASR=0.305,ARM=0.270,提升3.5个百分点,证明框架泛化能力不局限AADD数据集。

6.6 故障模式统计(AADD-LQ失败样本)

ARM++无法逃逸样本按主导基元分类:

  1. SSA频域扰动主导:43.1%(高精细频谱伪造最难攻破)
  2. BSR分块扰动主导:24.7%(平滑人脸无分块特征)
  3. CW稠密扰动:14.6%
  4. STA几何形变:13.6%
  5. JSMA稀疏扰动:4.0%

高画质、平滑人脸频谱特征是现有攻击最大瓶颈,为后续优化方向。

7 讨论与局限性

7.1 ARM++迁移效果提升核心原因

  1. 多域扰动互补:空域+频域+分块同时覆盖CNN/Transformer两类完全不同的归纳偏置,单一攻击仅适配一类模型;
  2. VLM语义掩码过滤无关区域,避免无用像素扰动浪费ϵ\epsilonϵ预算;
  3. 熵正则动态混合权重,前期探索多基元组合,后期收敛最优方案;
  4. 新增EfficientNet代理,扩充卷积模型分布多样性,降低过拟合。

7.2 可靠性工程解读

当前主流检测器干净集准确率>97,但ARM++在无查询黑盒下最高逃逸44.3%,代表线上真实风控存在巨大安全隐患;即便加入对抗训练、随机缩放防御,仍近20%伪造可绕过自动核验,无法满足生物识别、媒体取证高可靠需求。

7.3 研究局限性

  1. 仅测试ViT/Swin两类Transformer,未覆盖ConvNeXt、Mamba等新型视觉模型;
  2. 防御测试仅两类无自适应防御,未针对ARM++定制防御方案;
  3. 消融仅组件移除,未完成全部超参网格搜索;
  4. VLM/L大模型推理存在额外算力开销,轻量设备部署受限。

7.4 未来工作

  1. 拓展多模态视频深度伪造攻击时序扰动;
  2. 轻量化VLM语义模块,降低推理算力消耗;
  3. 自适应防御下攻防博弈评测;
  4. 开源完整ARM++代码、AADD评测自动化脚本、消融实验一键复现工程。

8 结论

本文提出ARM++多智能体无查询黑盒对抗攻击框架,基于Qwen2.5-VL视觉语义智能体、Qwen3调度智能体,融合CW/JSMA/STA/SSA/BSR五大互补扰动基元,引入熵正则自适应混合、停滞检测超参重参数化、三类卷积代理集成。

在AADD-LQ/HQ两大深度伪造基准,ARM++对比SOTA智能体ARM盲目标ASR提升4.7/3.8个百分点,跨CNN/Transformer架构迁移能力显著更强;在对抗训练、随机缩放防御下仍保持最优逃逸率,零样本DFDC数据集具备良好泛化。

消融实验验证VLM语义掩码、频域SSA、分块BSR、熵正则混合是四大核心创新模块。研究证明现有商用深度伪造检测器存在严重跨架构对抗漏洞,ARM++可作为标准化压力测试工具,用于检测器鲁棒性评测与迭代优化。

附录

附录A 完整超参配置表

包含CW/JSMA/STA/SSA/BSR每类基元迭代次数、学习率、约束上下限、混合权重初始值,复现直接复制参数。

附录B 全部基线复现Python脚本

python 复制代码
# ARM++ 主执行脚本伪代码(完整开源见项目仓库)
import torch
import torchvision.transforms as T
from vlm_agent import Qwen25VLMaskGenerator
from llm_orchestrator import Qwen3Scheduler
from attack_primitives import CW, JSMA, STA, SSA, BSR
from mixing_solver import EntropyRegularizedMixer

# 1. 加载代理集成模型
surrogate_models = [
    torch.load("resnet5_aadd.pth"),
    torch.load("densenet121_aadd.pth"),
    torch.load("efficientnetb4_aadd")
]
# 2. 初始化VLM语义智能体
vlm_agent = Qwen25VLMaskGenerator(model_path="Qwen2.5-VL-32B-AWQ")
# 3. LLM编排/顾问/策略智能体
llm_orch = Qwen3Scheduler(temp=0.0)
# 4. 五类并行攻击基元
primitives = [CW(), JSMA(), STA(), SSA(), BSR()]
# 5. 熵正则混合求解器
mixer = EntropyMixer(lambda4_decay=0.3)

def arm_plus_attack(img_tensor, max_iter=5):
    mask = vlm_agent.generate_mask(img_tensor)
    global_cfg = llm_orch.init_config(img_tensor, mask)
    history = []
    archive = []
    for k in range(max_iter):
        # 并行生成五类扰动
        candidates = [p.generate(img_tensor, mask, global_cfg) for p in primitives]
        # 批判打分
        scores = llm_orch.score_candidates(candidates, surrogate_models)
        # 停滞检测,更新约束
        global_cfg = llm_orch.adjust_constraint(history, global_cfg)
        # 自适应修正基元超参
        primitives = llm_orch.reparam_primitives(history, primitives)
        # 熵混合生成主候选
        master = mixer.mix(candidates, scores, k)
        history.append({"scores":scores, "master":master, "cfg":global_cfg})
        archive.extend(candidates + [master])
    # 筛选最优对抗样本
    best_adv = select_best(archive, surrogate_models, global_cfg)
    return best_adv

附录C 可视化对比图说明

  1. AADD-LQ八类方法原图/对抗图对比,标注各检测器预测结果;
  2. AADD-HQ精细伪造扰动可视化,ARM++扰动更贴合人脸伪造区域;
  3. 消融实验ASR柱状图、转移间隙折线图;
  4. 故障模式占比饼图。

附录D 开源资源地址

完整ARM++代码、数据集处理脚本、评测指标计算工具、消融自动化流程:

待论文Camera-ready版本发布后开源,预发布仓库链接后续更新。

参考文献

完整参考文献见arXiv原文 https://arxiv.org/abs/2607.15246

相关推荐
tinygone18 小时前
在Windows上部署Unlimited-ocr并提供给大模型使用
人工智能·windows·经验分享
阿虎儿18 小时前
Dify HTTP请求节点超时:Reached maximum retries for URL http://xxx/xxx
人工智能
fpcc18 小时前
AI和大模型——梯度散度和旋度
人工智能·机器学习
秦先生在广东18 小时前
jcode:下一代终端编码智能体的技术价值深度解析
人工智能
坚冰老猿18 小时前
Claude Tag实战:AI 同事嵌入Slack,权限模型怎么设计?
人工智能
nix.gnehc18 小时前
评测工程化:从手动到持续
人工智能·eval·评测
GISer_Jing18 小时前
0719一个月总结
人工智能·ai·前端框架
颜淡慕潇18 小时前
WAIC 2026:当AI学会说谎,合合信息用多模态鉴伪技术为数字世界“打假”
人工智能
kp0000018 小时前
AI系统输入安全基线
人工智能·安全·网络安全·信息安全·ai安全