来源:期刊VIP网 时间:
作者:张少华;冯炎;余仁杰;邢沛然;任艺昊;
单位:西藏大学信息科学技术学院;
摘要:针对语音情感识别无法全面提取语音中的情感特征,导致识别准确率低的问题,提出一种基于SE注意力机制和深度卷积的双通道网络模型。首先利用速度增强对原始数据集进行数据扩增,选取Mel谱图、一阶差分、二阶差分混合特征图作为输入,以获得更全面的语音信号特征;然后在SE注意力机制通道前后添加Ghost卷积提取局部特征,在深度卷积通道前后引入卷积层和逐点卷积提取全局特征,通过特征融合层融合特征;最后利用指数型下降进行训练识别。结果表明,所提模型在扩增后的中文数据集CASIA、英文数据集SAVEE、eNTERFACE05中的准确率均高于其他深度卷积神经网络模型,验证了该模型的有效性及泛化能力。
关键词:语音情感识别;;双通道;;SE注意力机制;;数据扩增;;Ghost卷积;;深度卷积;;逐点卷积;;特征融合