来源:期刊VIP网 时间:
作者:陈伟;詹旭;冯丹彤;任俊红;
单位:四川轻化工大学自动化与信息工程学院;成都工业学院自动化与电气工程学院;
摘要:在智能语音识别系统中,由于同一省份不同地区方言存在发音差异导致表征单一,无法充分提取底层发音特征,因而对不同地区方言识别准确性低、鲁棒性差。本研究提出了基于差异化特征融合的方言声纹识别算法。首先,该算法将MFCC(Mel频率倒谱系数)与GFCC参数(Gammatone频率倒谱系数)采用线性加权融合为MGCC特征,以更全面地捕捉语音信号的静态特性;其次,利用HMM模型捕捉MGCC特征中的动态特征,并与静态特征互补以补充底层特征,从而解决底层发音特征难以提取的问题;最后,通过引入ResNet模型优化卷积神经网络(Convolutional Neural Network,CNN),以解决深层网络中的梯度消失问题,同时增强网络学习深度,以实现高层网络根据方言的特点进行独立训练,从而提高模型对不同地区方言的适应性。对比实验结果表明,该模型在对底层特征的提取时,通过对不同地区方言发音差异化学习可以对方言进行有效识别,识别率达87.49%,同时对其他方言具有一定的泛用性,在识别准确度与抗噪性上也有较好的表现。
关键词:方言识别;;特征融合;;动态特征;;鲁棒性;;残差卷积神经网络