Multi-Feature Fusion Based Deepfake Face Forgery Video Detection 基于多特征融合的Deepfake人脸伪造视频检测
October 19, 2024
深度伪造[Deep forgery]是一种基于深度学习的图像合成技术。该算法主要使用生成对抗网络、深度卷积神经网络和自动编码器来锻造一组原始人脸和目标人脸作为训练数据。深度伪造的常见应用之一是将视频中的一张人脸替换为另一张人脸,也称为人脸交换。人脸交换的核心思想是将目标视频中的人脸替换为源视频中的人脸,并通过相应的细节处理使替换后的人脸尽可能逼真。
Zhang et al. [13] 首先提出了一种经典的机器学习方法来检测人脸变化图像。他们首先计算加速鲁棒特征 (SURF) 描述符,然后通过 K-means 方法生成词袋 (BOW) 特征,获得码本直方图并将其输入到各种分类器中,例如支持向量机 (SVM)、随机森林 (RF) 和多层感知器,以通过训练区分人脸变化图像和真实人脸图像。由于深锻面生成过程中的缺陷,将生成的面区域拼接到原始图像中会引入误差。
S. Lyu等[14]提出基于头部姿态位置的 3D 姿态差检测方法。该方法以人脸中央区域坐标位置与 Dlib 提取的 68 张人脸关键点的差值为特征,区分真假面孔。提取的特征被标准化(平均值和标准差),然后输入到 SVM 分类器中以获得检测结果。Matern等[15]总结了当前面部篡改及其处理留下的伪影,特别是面部区域缺乏一致的纹理特征,例如眼睛和牙齿区域缺少反射和细节。Koopman等[16]提出了一种使用照片响应不均匀性(PRNU)对真假视频进行分类的方法。PRNU 通常被认为是相机在图像中留下的相机指纹。由于换脸会改变视频帧中人脸区域的局部 PRNU 模式,因此 PRNU 模式可以用作对真实视频和虚假视频进行分类的功能。
德国 Bohongluer 大学 Horst Görtz IT GAN 生成的图像,发现生成的图像与真实图像在频域存在显著差异 [17],这是由上采样操作引起的。由于 GAN 生成图像的本质是将低维噪声向量转换为高维图像,因此无法避免上采样操作。因此,在生成图像的频域中必须存在网格特性。
Habeeba [18] 提出了一种使用神经网络检测非自然图像中面部区域的视觉伪影以区分真假视频的方法。 周 et al. [19] 提出了一种双流网络来检测人脸篡改,并考虑了两个特征的融合:空间图像中的人脸特征和图像块的隐写分析特征。Yu等[20]提出了一种使用可分离卷积神经网络检测人脸变化图像的方法,该方法将块后的特征与整个图像特征相结合,对图像进行分类。Li 等 [21] 使用卷积神经网络 (CNN) 提取视频帧图像的特征,然后将特定数量的连续视频帧的特征输入到递归神经网络 (RNN) 中,以训练 RNN 来区分视频是否为变脸视频。
Dolhansky [22] 提出了三种简单的检测系统:(a) 一个由六个卷积层和一个全连接层组成的小型 CNN 模型,用于检测低级图像篡改,(b) 仅使用人脸图像进行训练的 Xception 网络模型,以及 (c) 使用完整图像训练的 Xception 网络模型 [23]。现有的基于深度学习的方法显示出令人印象深刻的性能。但是,它们中的大多数只是从一个或两个域中提取特征。我们尝试融合从更多领域中提取的特征,以提高检测性能。
与真实人脸相比,深度伪造过程中存在篡改痕迹信息。如何提取这些微小的篡改痕迹是识别深度伪造人脸的关键。深度伪造痕迹强度小,难以有效检测,且基于单一特征的泛化能力有限。为此,本文提出从空间域、时间域、频率域等多个角度进行检测,并设计了一种同时从人脸图像的多个特征空间中提取特征的检测网络,通过多特征融合使网络具有更好的泛化能力。本文主要考虑人脸图像的空域特征、频域特征、PLGF特征和时域特征。Xception网络直接从人脸空间图像中提取人脸图像的空间特征。人脸图像的频域特征需要通过对人脸图像进行离散傅里叶变换得到相应的频谱图,然后通过Xception网络从频谱图中提取。人脸图像的PLGF特征需要先计算人脸图像的PLGF图像,然后通过Xception网络从PLGF图像中提取。最后,将上述连续多帧的三个特征向量合并到LSTM网络中,提取人脸图像的时域特征,最后,LSTM网络的输出特征融合了人脸图像的空间域、频域、PLGF和时域信息,用于最终的分类检测。
本文的检测框架如图2所示,其中人脸图像空间域、频率域和PLGF图像特征提取的异常网络结构基本相同,最终输出2048维特征。这三个特征通过拼接组成6144维特征,分别代表了人脸图像的空间、频率和PLGF融合特征。通过双层LSTM网络从10张人脸图像的融合特征中提取时域特征,输出512维特征[24]。最后,通过全连通层输出二值分类结果。通过实验确定了异常网络和双层LSTM的结构。我们使用Xception、ResNet50、InceptionV3、EfficientNet和DensNet201作为特征提取器,发现其中Xception网络的性能最好。对于LSTM,我们使用了1层、2层和3层结构,发现2层结构的精度比1层结构高2%到3%,而3层结构与2层结构的性能几乎相同。因此,我们选择2层LSTM进行时间特征提取。
结论:针对现有深度网络变脸视频篡改检测算法检测精度低、泛化性能差、抗干扰能力弱等缺陷,提出一种基于多特征融合的深度伪造人脸视频检测方法。人脸图像的时域、频域和 PLGF 特征信息由 Xception 网络提取,人脸图像的时域特征信息由双层 LSTM 网络提取。实验结果表明,所提方法具有良好的库内和跨库检测性能,泛化能力强。