我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

武汉大学学报(理学版)2025年第02期:基于音脸协同对比学习的深度伪造检测算法

来源:期刊VIP网 时间:


作者:李志鲲;叶登攀;

单位:空天信息安全与可信计算教育部重点实验室,武汉大学国家网络安全学院;

摘要:主流的伪造检测方法从视觉单模态出发,通过检测视频帧中的伪影进行伪造检测,然而不同伪造方法会引入不同的伪影,导致这类方法有受限的性能和较差的泛化能力。同时,当前利用音频信息进行伪造检测的工作并没有充分利用音频信息发掘视觉模态的篡改。观察到自然视频中的音频和人脸具有内在协同性,而伪造方法均会对这种特性造成破坏,因此本文提出了一种音脸协同驱动的深度伪造检测算法,称为SFSD(Speech-Face Synergy Detect)。该算法提出了音脸协同对比学习策略,在通用视频数据集上构建样本,模拟伪造方法对音脸协同性的破坏,实现了对大量无标注真实视频的利用,提升了模型性能和泛化能力。算法构建了多模态模型SFformer(Speech-Face Transformer),其通过注意力瓶颈引导音脸模态浓缩并交融必要的信息,减少冗余信息的干扰,提升了模型的特征提取能力并改进了检测性能。在公开数据集FakeAVCeleb上的大量实验表明,SFSD在预训练后准确率为72.12%,超越部分基准方法;在经过迁移训练后准确率达到89.51%,高于先前工作,并且泛化能力有所提升。

关键词:伪造检测;;对比学习;;多模态融合

基金资助:国家自然科学基金(62072343,U1736211);; 国家重点研发计划(2019QY(Y)0206)