2022CVPR

0.摘要

尽管现有的面部伪造分类器在检测虚假图像方面取得了可喜的成绩,但这些方法对于注入像素中难以察觉扰动的对抗样本非常脆弱。同时,许多面部伪造检测器通常利用真实与伪造面孔之间的频率差异作为关键线索。(面部伪造检测器,在面对经过精心设计、添加了微小、几乎不可见扰动的输入数据时表现出了高度的敏感性和易受攻击性。这些微小的扰动被称为对抗扰动)

本文中,我们没有将对抗性扰动注入空间域,而是提出了一种针对面部伪造检测器的频率对抗攻击方法。具体来说,我们在输入图像上应用离散余弦变换(DCT),并引入一个融合模块来捕捉频率域中的对抗显著区域。

此外,受元学习思想的启发,我们还提出了一种在空间域和频率域都进行攻击的混合对抗攻击。广泛的实验表明,所提出的方法不仅能够欺骗基于空间的检测器,也能有效愚弄最先进的基于频率的检测器。另外,所提出的频率攻击增强了跨面部伪造检测器的迁移能力,作为黑盒攻击也表现出色。

1. 引言

我们提出了一种频率对抗攻击方法,在频率域添加对抗扰动。

具体如下:

首先,我们将离散余弦变换(DCT)应用于输入图像以转换到频率域。具体来说,我们利用融合模块通过对抗损失轻微修改不同频率带的能量。这种间接注入对抗样本到频率域的方式避免了空间域攻击(如FGSM , PGD )中的冗余噪声,并且不会降低原始图像的视觉质量。之后,我们应用逆DCT回到空间域并获得最终的对抗样本。

对于面部伪造检测器,一些现有方法仅考虑空间域中的噪声模式来检测伪造面孔,而其他方法则利用频率信息作为线索。此外,有些方法结合了两个域的判别特征来学习真实和伪造面孔之间的边界。因此,为了增强所提出的攻击方法的泛化能力,我们提出了一种混合对抗攻击,将空间对抗攻击和频率对抗攻击整合到一个整体框架中。受元学习思想的启发[35],我们基于不同域中的对抗梯度交替优化扰动。这种兼容的对抗攻击组合保留了两个域攻击的优点。图1展示了不同攻击下的对抗样本示例。

图1. 由FGSM [15]、PGD [31]和我们方法生成的对抗样本示例。

原始图像是被面部伪造检测器分类为伪造面孔的。在实施这些攻击之后,对抗样本被错误地分类为真实面孔。与FGSM [15]和PGD [31]相比,我们结合频率对抗攻击的方法生成了更加自然的扰动,其中对抗样本的图像质量更接近于原始图像。

我们的主要贡献可以总结如下:

  • 对于面部伪造检测任务,我们提出了一种新颖的对抗攻击方法,在频率域生成扰动。与之前的攻击相比,我们的方法为人类观察者生成了更加难以察觉的扰动。
  • 为了进一步提升攻击的迁移能力,我们基于元学习策略提出了一种混合对抗攻击,同时对空间域和频率域执行攻击。
  • 我们的方法既适用于基于空间的面部伪造检测器,也适用于最先进的基于频率的检测器。基准测试上的广泛实验表明,无论是在白盒还是黑盒设置下,我们的攻击都是有效的。

2. 相关工作

2.1 面部伪造生成

总的来说,面部伪造生成可分为四类:重现、替换、编辑和合成。重现的一个典型应用是使用一个人的表情或嘴巴驱动另一个人,例如RecycleGAN [3]、STGAN [29]。FaceSwap [25]是最常见的替换类型。Averbuch-Elor等人[2]通过2D变形自动转移主体的表现力到目标上。Face2Face [45]将面部表情视为欠约束问题,用于在源和目标之间传递变形。编辑和合成用于添加或移除包括头发、眼镜、年龄、化妆等属性。在本文中,我们选择了来自公开数据集的伪造面部图像,而不是自己生成。换句话说,我们没有访问具体的操纵伪造面部的方法。

2.2 面部伪造检测

研究人员尝试检测图像是否被篡改以减轻危险,这被视为一个二分类问题。一些研究应用深度神经网络提取用于面部伪造检测的判别特征。这些方法仅利用了空间域的信息,通常会导致分类边界过拟合。(分类边界是指在机器学习和模式识别领域中,用于区分不同类别样本的空间中的一个超平面或分界面)另一方面,一些研究观察到真实面孔与伪造面孔在频率域中的多样性,并提出了基于频率线索的面部伪造检测方法。F3-Net [36]将频率感知分解和局部频率统计整合到一个整体学习框架中,以分类真实和伪造面孔。Luo等人[30]设计了多个模块,充分利用多尺度高频特征以实现更高的准确性。此外,一些方法[5,16–18,27,32]将空间和频率信息整合到一个完整的框架中,以准确检测伪造面孔。LRL [5]采用了一种带有两个输出分支的多任务学习策略,其中一个分支用于学习表面标签,另一个分支专注于修改区域的边缘。Li等人[27]结合频率线索与空间特征,在嵌入空间中扩大真实面孔与伪造面孔之间的差异。受频率域多样性的启发,所提出的混合对抗攻击考虑了对两个域的影响,以学习现有面部伪造检测器的鲁棒性。

2.3 对抗攻击

与面部伪造生成不同,对抗攻击的目标是欺骗机器而非人类。通常情况下,给定一个训练良好的网络,对抗攻击的目标是生成能使网络做出错误预测的对抗样本。根据攻击者是否能够访问受害模型的具体结构和参数,对抗攻击大致可分为白盒攻击[15,31,42]和黑盒攻击[10,47,51]。尽管大多数现有的攻击方法集中在多分类任务上,但对抗攻击已在许多领域得到研究,如对象检测[50]、人脸识别[52]、视觉跟踪[22]等。

对于面部伪造检测中的对抗攻击,一些研究[4,13,21,26,34]探索了在不同设置下模型的鲁棒性。Li等人[26]通过使用梯度操控Style-GAN[48]的噪声向量和潜在向量来欺骗面部伪造模型。Neekhara等人[34]在黑盒设置中对面部伪造检测进行了对抗攻击。Carlini等人[4]展示了面部伪造分类器在各种攻击方法下的鲁棒性。上述方法是在空间域生成对抗样本,而有些研究[19,39]则探索了其他任务中的频率攻击。鉴于面部伪造检测与频率域有高度相关性,我们提出了一种结合频率域特征的新颖攻击方法,以生成更加难以察觉的对抗样本。

3. 方法

概述

3.1 空间对抗攻击

现有的攻击方法大多被视为空间对抗攻击,它们在像素级别上修改对抗样本。由于篇幅限制,这里只介绍用于实验比较的两种空间对抗攻击方法。更多变种可以参考。

  • 快速梯度符号法 (FGSM):FGSM [15]是一种单步攻击方法,基于对抗损失的梯度计算扰动。优化定义为:
  • 投影梯度下降 (PGD):PGSM [31]是FGSM的一个多步变体。同时,它采用首次迭代时对扰动的随机初始化。更新过程定义为
3.2 频域对抗攻击

先前的研究[5, 36]已经证明了真实面孔与伪造面孔在频域中的差异。

图3展示了真实脸和伪造脸在不同频率带中能量分布的多样性。低频区域与图像内容相关,占据了大部分能量,而高频区域与图像边缘和纹理信息相关。相比于真实脸,伪造脸在高频区域显示出更多的能量。受此观察启发,我们提出了一种频域对抗攻击,直接修改频域中的能量。相比空间攻击,我们的攻击方法将对抗隐藏在频段中,并减少了像素级别的冗余噪声,导致更加隐蔽的攻击。

频域对抗攻击的流程如图2所示。

图2. 频域对抗攻击的流程

我们首先将输入图像分割成K×K大小的块,并对每个块应用离散余弦变换(DCT)以将其转换到频域。然后,我们在其中引入频率扰动PN和一个预定义的权重矩阵M,该矩阵用于控制不同频带中的步长。之后,我们执行逆离散余弦变换(IDCT)并将这些块合并成对抗样本。在每次迭代中,我们计算对抗损失,并根据此损失更新扰动PN。

我们将优化过程总结如下:

具体步骤如下: 首先,我们按照[36]实施DCT,将图像从空间域转换到频域。为了平衡转换效率和质量,我们在进行DCT之前将原始图像分割成K×K块。对于每个块,应用DCT公式如下:

当RGB图像转换到频域时,不同频率的能量范围是倾斜的,如图3所示。

图3. 真实面孔与伪造面孔在频域中的多样性

我们从FaceForensics++ [37]中选择了两个具有不同标签的例子,并计算了不同频率带中的能量。结果显示,伪造面孔在高频带中的能量比真实面孔更为丰富。

因此,我们提出一个具有可调节步长的矩阵M,它基于每个频率带的比例来平衡倾斜能量的影响。此外,矩阵M会根据不同的输入动态重置,以保持视觉质量。完整的融合模块定义为:

其中 λ是每次迭代的步长。之后,我们应用IDCT将频域中的每个块转回空间域。注意单独操作DCT和IDCT是非破坏性的,在这个过程中不会引入任何块状伪影。当达到最大迭代次数或分类出错时,我们结束循环并输出最终的对抗样本Xadv。伪代码如算法1所示。

输入:原始图片,鉴别器

输出:对抗样本

第一步:原始图进入鉴别器打上标签

第二步:生成初始扰动

3:初始化对抗样本和预测标签

4:迭代

     5.6.:把对抗样本分成k*k的小块,应用离散余弦变换(得到频域表示)

    7:计算对抗损失

    8。9.10.:更新扰动 融合扰动 应用逆离散余弦变换(频率域转换到空间域)

    11,12:合并所有k*k的块 鉴别器鉴别得到新的预测标签

终止迭代,返回最终对抗样本。

4. 实验

在本节中,我们首先介绍实验设置。然后,我们将评估所提出的攻击方法的性能,包括基于空间模型的单次攻击和组合攻击,并进一步验证基于频率模型的方法的有效性。此外,我们还将对方法的变化和不同的频带进行消融研究。最后,我们将从定性和定量的角度评估我们方法生成的图像质量。

4.1 实验设置

数据集:

  • DFDC [9]:一个具有多种匿名操作和扰动的挑战性数据集。我们从中随机选择了1000张伪造面孔图像。
  • FaceForensics++ [37]:这是一个流行的数据集,包含来自YouTube的真实视频以及对应的伪造视频,其中包括Deepfake [46]、Face2Face [45]、FaceSwap [25] 和 NeuralTextures [44]。我们总共选择了560(140×4)帧来自每个伪造面孔视频的独立帧。

模型:

  • 对于基于空间的面部伪造检测器,我们选择了三种基于空间的分类网络,即EfficientNet b4 [43]、ResNet 50 [20] 和 XceptionNet [6]。
  • 对于基于频率的模型,我们考虑了最先进的面部伪造检测器,即F3-Net [36] 和 LRL [5]。所有这些模型都按照相应的论文进行了训练。表1总结了这些模型在不同数据集选定图像上的准确性。

评价指标:

  • 对于DFDC和FaceForensics++,我们都选择攻击成功率作为评价指标。它被定义为成功攻击的图像占所有被分类为伪造面孔的图像的比例,即(就是本来检测器判别是伪造图像,经过对抗(扰动)之后生成的图像在经过检测器就被判别为真是图像了的这个比例)。对于图像质量评估,我们使用MSE、PSNR和SSIM作为评价指标来展示生成的对抗样本与原始图像之间的差异。

实现细节:

  • 三种基于空间的模型的输入图像大小为320×320×3。F3-Net [36] 和 LRL [5] 的输入大小分别为299×299×3和320×320×3。我们将对抗样本调整到相应大小以进行迁移攻击。至于攻击参数,我们为FGSM和PGD两种方法设定每个像素的最大扰动为ϵ=0.1。我们也使用PGD作为混合攻击的空间攻击部分。

    4.2 对基于空间模型的攻击

    我们比较了所提出的方法与FGSM [15]和PGD [31]在攻击基于空间的模型上的表现。表2和表3分别报告了在DFDC [9]和FaceForensics++ [37]数据集上的攻击成功率。首先使用第一列的基本分类器生成对抗样本,然后将其转移到其他网络上进行评估。对角线块表示白盒攻击,而非对角线块则表示其作为黑盒攻击的可转移性。如表2和表3所示,所提出的方法在白盒攻击方面优于FGSM和PGD,并且在黑盒攻击中获得了更高的攻击成功率。例如,在FaceForensics++ [37]数据集中,通过Res50与我们的方法生成的对抗样本在Eff b4和Xcep上的成功率分别为41.4%和49.6%,比FGSM高出38.2%,比PGD在Eff b4上高出37.5%,在Xcep上分别比FGSM和PGD高出47.5%和47.3%。这表明结合频率攻击的提议方法增强了对抗样本的可转移性。

  • 表2 第一行解释:通过FGSM方法对Eff_b4模型检测的图片进行攻击生成的对抗样本在Eff_b4、Res50、Xcep上的攻击成功率。

    4.3 基于空间模型的组合攻击

           结合多个网络的对抗样本能实现更强的攻击性能。我们利用两个网络的组合以三种方式攻击另一个网络:像素级组合、损失级组合和logits级组合(三种不同的集成攻击方法)。两个数据集上的攻击结果分别总结在表4和表5中。考虑所有三个网络,第一列中的‘-’符号表示未在攻击过程中使用的网络。因此,对角线块表示转移攻击(即黑盒设置),而非对角线块表示白盒攻击。从两个数据集观察到,在大多数情况下,logits级组合实现了最强的攻击性能。在DFDC [9]数据集中,当攻击Res50网络时,Res50和Eff b4的logits级组合在白盒设置下比单个网络Res50高出7.8%的成功率。此外,对于FaceForensics++ [37]数据集,Res50和Eff b4的logits级组合在Xcep上达到了38.2%的成功率,而单个网络Res50在黑盒设置下的成功率仅为8.5%。综上,不同模型的组合可以增加结构的多样性,从而提高对其他模型的可转移性。

  • 第一行解释:通过Pixel这种集成攻击方法对(Res50、Xcep)这两个模型进行攻击生成的对抗样本在Eff_b4、Res50、Xcep上的攻击成功率。(-Eff_b4表示未对该网络进行攻击)

    在对抗攻击的上下文中,"像素级组合"、"损失级组合"和"logits级组合"指的是不同策略或方法来结合多个模型的信息以生成更强大的对抗样本。这些组合方法主要是在进行对抗攻击时,如何整合来自多个神经网络的信息,以提高攻击的效果,特别是攻击的成功率和可转移性。下面是这三个术语的具体含义:

  • 像素级组合(Ensemble in Pixel):

    • 在这种方法中,对抗样本是基于多个模型对输入图像的像素级贡献综合生成的。具体来说,每个模型都会根据其自身的准则提出一些像素级别的修改建议,然后这些修改会通过某种方式(如平均或加权求和)结合起来,形成最终的对抗扰动。这样做的目的是希望生成的对抗样本能够在多个不同的模型上都有效。
  • 损失级组合(Ensemble in Loss):

    • 损失级组合是指在计算对抗扰动时,将多个模型的损失函数值结合起来。每个模型都有自己的损失函数,用于衡量模型输出与目标标签之间的差异。在这种组合方法中,可能会将所有模型的损失函数值相加或者取平均,作为生成对抗样本的目标函数。这样做的好处是可以利用多个模型的知识,使得生成的对抗样本更加鲁棒,能够有效地欺骗多种类型的模型。
  • Logits级组合(Ensemble in Logits):

    • Logits级组合涉及的是在神经网络输出层之前,即logits层的输出结果的组合。Logits是网络最后一层经过激活函数(例如softmax)之前的原始输出值。在这种方法中,通常会对多个模型的logits输出进行某种形式的平均或其他操作,然后再应用激活函数得到最终的概率分布。这种方法考虑了多个模型在决策边界上的共识,因此生成的对抗样本往往具有更高的成功率,尤其是在黑盒设置下,因为它们更能反映出多个模型共同的分类倾向。
  • 4.4 对基于频率模型的攻击

    提出的混合攻击与频域相关。为了进一步说明其有效性,我们也选择了两种基于频率的面部伪造检测方法,即F3-Net [5]和LRL [36]。这两种方法都收集频率信息来区分真实和伪造面孔之间的差异以进行检测。表6和表7分别报告了在DFDC [9]和FaceForensics++ [37]数据集上的攻击结果。为了更好地比较,我们也进行了这两个检测器与FGSM [15]和PGD [31]的实验。此外,我们还测试了当我们攻击基于空间的检测器时,由我们的混合攻击生成的对抗样本的可转移性。简而言之,我们的结合频率域的混合对抗攻击在这两个数据集中实现了良好的白盒攻击,其中约90%的伪造图像被错误地分类为真实面孔。对于转移攻击,我们的方法略优于空间攻击。当使用基于空间的检测器进行转移攻击时,Res50在DFDC [9]上对F3-Net和LRL的成功攻击率分别为12.8%和43.6%,在FaceForensics++ [37]上则分别为7.1%和57.5%。提出的包含频率域的混合攻击同样增强了在网络间针对基于频率模型的可转移性。

  • 4.5 消融研究

    我们对提出的攻击方法进行了一系列消融研究。由于篇幅限制,我们仅使用Res50 [20]作为威胁模型,在FaceForensics++ [37]数据集上生成对抗样本,并展示其在Eff b4 [43]和Xcep [6]上的可转移性。

    方法变体:我们执行了方法的一些变体来分析它们在不同领域的影响。具体来说,首先只应用空间攻击来制作对抗样本。然后,只实施频率攻击。此外,简单地将来自空间和频域的扰动相加。具体的结果总结在表8中。虽然单纯的空间攻击容易过拟合现有模型并产生有限的可转移性,但单纯的频率攻击总是陷入局部优化且保持固定的损失用于二分类,导致攻击能力有限。对于扰动的组合,来自两个领域的扰动简单相加提高了白盒攻击的表现,但削弱了其可转移性。我们的混合对抗攻击在白盒和黑盒攻击上都有更激进的攻击表现,这表明我们的方法同时保留了每个领域的优势并将它们以兼容的方式集成在一起。

  • 频率带:为了研究不同频率带的效果,我们将整个频率带分为三个带,即低频带、中频带和高频带,并仅用混合对抗攻击攻击其中一个带。表9报告了不同频率带的攻击性能。相比于中频带和高频带,低频带上的混合对抗攻击在白盒攻击(如Res50 [20])和黑盒攻击(如Eff b4 [43]和Xcep [6])下表现更好,因为低频带携带了更多的图像内容信息并在空间域中产生了更多的扰动。

4.6 图像质量评估

为了展示我们方法生成的对抗样本具有更优的图像质量,我们从定性和定量两个角度分析了这些生成的对抗样本。在图5中,我们可视化了由FGSM [15]、PGD [31]和我们的方法制作的对抗样本。当放大观察时,FGSM和PGD生成的对抗样本有明显的噪声模式,而通过我们方法生成的对抗样本对观察者来说更加难以察觉。此外,我们使用常见的图像质量评估指标来计算与原始图像之间的差异。表10报告了MSE、PSNR和SSIM的定量结果,其中我们方法的图像质量显著优于其他攻击方法。这表明所提出的混合攻击不仅具有强大的攻击能力,还能很好地保持图像质量。

图5. 对抗样本的定性评估

图5展示了在FaceForensics++ [37]数据集上由FGSM [15]、PGD [31]和我们方法生成的对抗样本的定性评估。这些样本包含了四种类型的面部伪造生成,即Deepfake、Face2Face、FaceSwap和NeuralTextures。尽管所有对抗样本都能成功欺骗检测器,将其误判为真实面孔,但通过我们的混合对抗攻击生成的样本具有更优的图像质量。

结论

在本文中,我们提出了一种用于面部伪造检测的频域对抗攻击方法,相比基于空间的方法,它能够实现更好的图像质量。为了进一步提高其泛化能力,我们提出了一个结合空间域和频率域攻击的混合对抗攻击方法。多域的结合保留了各自的优势,并在基于空间和基于频率的面部伪造检测器上都实现了良好的攻击性能。在两个数据集上的大量实验表明,我们提出的方法不仅能成功攻击白盒模型,而且在黑盒设置下也能增强对其他模型的可转移性。我们希望这项工作能引起更多人对面部伪造检测器鲁棒性的关注。

更多推荐