我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

印刷与数字媒体技术研究2026年第02期:视觉大模型增强的空间特征融合的表情识别方法

来源:期刊VIP网 时间:


作者:宋晨;

单位:南京林业大学信息科学技术学院、人工智能学院;

摘要:在人脸表情识别中,特征提取方法容易受到噪声影响,存在特征提取能力不足和准确度不高的问题。为此,本研究提出了一种视觉大模型增强的空间特征融合的表情识别模型(VCL-EmoNet)。首先,在模型构建阶段,通过迁移学习的方式引入预训练的ViT(Vision Transformer)模型,使其在前期能够获取丰富的通用特征以及全局依赖关系特征。然后,采用不同大小的卷积核以增大感受野,从而提取图像的多尺度特征,并结合Sobel算子和Laplacian算子获取图像的边缘和强纹理特征。接着,引入空间注意力机制和通道注意力机制,使模型能够聚焦于图像的关键区域,有效捕捉关键信息,合理调整模型权重分布。最后,引入视觉大模型预测损失作为约束条件的联合损失函数来辅助优化图像分类任务。本研究模型在AffectNet、FER2013和FERPlus数据集的实验中,分别取得72.5%、74.8%和91.1%的识别准确率。相较于传统算法,该模型在特征提取方面的能力显著提高,面部表情识别结果更加准确。

关键词:人脸表情识别;;视觉大模型;;多尺度残差卷积;;联合损失函数;;Transformer