来源:期刊VIP网 时间:
作者:周启航;丁飞;李蓉;王秉坤;张学军;
单位:南京邮电大学物联网学院;南京邮电大学现代邮政学院;
摘要:针对Transformer在语音情绪识别中对时序特征和局部信息的提取能力存在不足的问题,文章提出双通道时空融合注意力网络的多特征语音情绪识别模型。该模型通过两个独立的通道分别处理不同类型的声学特征:BiLSTM-Transformer通道主要用于捕捉时序依赖性和全局上下文信息,而2D-CNN通道则专注于提取频谱图和梅尔谱图中的空间特征。同时,文章设计一种多特征融合策略,将频谱图、梅尔谱图与eGeMAPS特征集有效融合,从而提升模型的情感识别能力。在CASIA和EMO-DB两个数据集上开展实验,分别达到93.41%和92.46%的准确率,结果优于现有的基于单一声学特征的方法,表明所提的多特征融合策略能够有效提升模型的情感识别性能。
关键词:语音情绪识别;双向长短时记忆网络;多特征融合;Transformer
基金资助:江苏省“六大人才高峰”高层次人才资助项目(DZXX-008); 江苏省研究生科研创新计划(KYCX23_1058)