来源:期刊VIP网 时间:
作者:范佳丽;赵思佳;司占军;
单位:天津科技大学人工智能学院;
摘要:唇形同步是构建自然、真实的数字虚拟人交互体验的核心技术,但其面临着语音与唇部动作间动态对应不足、图像细节建模不充分等挑战。为解决上述问题,本研究提出了一种融合多项改进的唇形同步优化算法。首先,在Wav2Lip模型的基础上,设计了基于面部关键点的人脸区域提取策略,有效增强了数字虚拟人在唇形同步过程中的面部对齐的鲁棒性。其次,引入了视觉与语音特征之间的跨模态注意力融合模块,提升跨模态信息融合能力,并在生成分支设计了动态感受野卷积模块,提升唇部区域的建模效果。最后,本研究在VFHQ数据集上开展实验,将所提方法与Wav2Lip、VideoRetalking及DI-Net模型进行对比,并采用LSE-C、CSIM和FID三项指标完成性能评估。实验结果表明,本研究所提出方法在同步准确率与图像保真度方面均有明显提升,为数字虚拟人唇形合成任务提供了一种高效可行的解决思路。
关键词:唇形同步;;数字虚拟人;;跨模态注意力;;音视频合成