文声图防御框架原理笔记:Interpret then Deactivate(ItD)随着多模态大模型(如文本、语音、图像生成模型)在现实场景中的广泛应用,针对这些模型的对抗攻击(adversarial attacks)也日益增多。攻击者通过精心设计的输入(例如带有微小扰动的图像、嵌入恶意指令的文本、隐藏后门的语音)来欺骗模型,导致输出错误或有害内容。为了应对这一挑战,研究者提出了“Interpret then Deactivate”(ItD)防御框架,其核心理念是:先解释(interpret)输入中的潜在威胁,再主动去激活(deactivate)威胁信号,从而在不牺牲模型性能的前提下增强