前言:近期收获了一批较为专业的审稿意见,折射出当前取证领域关注的痛点和需要长期解决的问题,特开一篇博客记录,便于之后投稿参考,避免再次出现类似问题。以下情况适用于AI生成图像溯源(Synthetic Image Attribution,SIA)任务,部分意见同样可供生成图像检测(Synthetic Image Detection,SID)任务借鉴。
关于实验设置
- 对于溯源任务而言,首先要明确对真实图像如何处理,当前主流方法可分为两种处理方式:1)将真实图像作为单独的一类,与其他的生成模型的标签并行进入标签空间(N+1,N为训练样本中对应的生成模型种类,1为真实图像类别);2)在实验设置中明确实验范围只考虑AI生成图像。本人认为,生成图像检测应该是生成图像溯源的前置任务,只有在确定图像为AI生成图像时,才会进一步进入SIA任务中,因为真实图像同样有很多来源(不同的相机设备等),如果将真实图像作为单独的一类,会造成真实图像的标签空间粒度和AI生成图像的标签粒度不平衡、任务层级混乱等后果,因为这一类其实是多个真实类别的集合。
- 溯源方法可以大致分为基于分类器训练的溯源和基于参考集构建的溯源,前者通常需要一定规模的训练图像完成溯源分类器的有监督训练,后者通常需要提前设定一个用于图像比较的表征空间(可能是通过训练得到,也可能直接使用预训练模型的表征空间),在推理阶段无需分类器。这两类方法的适用场景和各自的优势需要进一步探讨。比如,相较于基于分类器训练的方法,基于参考集构建的方法具有更加优越的可扩展性 ------ 随着生成模型的增多,在标签空间不断增加的背景下,基于分类器训练的方法需要使用新增生成模型的样本对分类器进行微调,同时避免对已有已知生成模型类别的灾难性遗忘。类似地,标签空间的扩增也会影响基于参考集构建方法的预测性能,尤其是在表征空间没有针对扩增的模型样本进行进一步适应性重构的情况下,干扰项增多,溯源性能就会降低。
- 在开放集溯源场景下,在闭集分类之前还要增加一个未知模型样本的拒识机制(可以理解为一个二分类问题 ------ 拒识 / 接收,若接收则进一步闭集分类),这涉及到拒识的准确性。此外,面对训练分布外的图像,如何确保拒识阈值依然有效,或如何进行适应性调整,是现实中需要考虑的一个重要问题。
- 在实际评估场景下,在设计溯源方法时,尤其是基于参考集构建的溯源方法,需要同时考虑溯源方法的计算成本、时间开销以及存储消耗。对于不同的参考集构建方式,时间成本和存储开销不尽相同。
- 对于基于参考集构建的溯源,表征空间非常重要,在筛选合适的表征空间时,需多方比较,更加全面地评估表征空间对于溯源性能的影响。
- 对于溯源方法而言,不同未知来源的图像带来的挑战也有所不同。往往是当测试图像来自与已知训练模型血缘相近的模型时,拒识阶段会面临更加巨大的挑战,因为血缘相近模型的的生成痕迹可能会更加相似,可就这一点进行针对性分析。
- 在选择baseline进行比较时,要阐明选择依据(代码的可获得性、代表性以及计算可行性),并确保所选baseline与所提出方法的强关联性。一般情况下,这些方法应用的前提假设要相同:例如,都需要获取生成模型的(白盒/黑盒)访问权限、都是为few-shot场景所设计等,保证对比的公平性。
- 为了避免实验的随机性对实验结论的影响,在实验设计时需考虑使用更多随机种子,使用均值和标准差报告实验结果。
- 对实验结果的分析要围绕真实的实验结果,在确保实验设计可靠、实验结果可信的前提下,对实验结果进行合理分析,不夸大结论。要尽可能挖掘实验结果背后的原因,而不只是对实验结果的简单堆砌。要思考:基于实验结果,我们能够受到什么启发,后续的研究该如何开展,如何推动该领域前进。
关于论文撰写
- 一篇论文的篇幅有限,这就导致每一项研究工作都不可能做到面面俱到,因此,在论文撰写过程中,要围绕本研究工作研究的核心问题展开,而不是尽可能涵盖更多的研究维度。我们要基于自己的研究成果,理清当前研究工作的局限性,避免夸大其词,然后在此基础上最大化研究工作的优势,凸显研究亮点。从摘要、引言、相关工作到结论,各章节如何铺陈、表达如何引人入胜,章节间如何衔接,都是我们需要考虑的问题。
- 对于待提交的论文初稿,尤其是篇幅过长的论文,要确保通篇使用的术语一致。在某些情况下,由于版本迭代等原因,方法框架的某个术语可能更换了表述,导致前后文理解难度增加甚至产生偏颇,降低论文质量。(本人之前在审稿过程中遇到过类似的情况)
写在最后:在科研流程中把AI当做工具无可厚非,切记要对AI输出的内容进行审核,把握住科研主要方向,毕竟论文的最终责任人还是我们自己。不然,我们就会和科研渐行渐远。