我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

现代电子技术2025年第24期:基于动态时间规整与Transformer的连续语音识别与发音校正算法

来源:期刊VIP网 时间:


作者:潘桂妹;

单位:湛江科技学院;

摘要:针对传统动态时间规整(DTW)算法在大规模语音数据处理中效率低、非特定人识别鲁棒性不足,以及Transformer模型在短时语音时序对齐精度欠佳的问题,提出一种DTW与Transformer融合的连续语音识别与发音校正算法。该算法通过DTW实现短时语音帧的精准时序对齐,利用Transformer的多头注意力机制捕捉长时语音序列的全局依赖关系,构建“局部对齐-全局建模”的双层处理架构。在公开语音数据集TIMIT和自建语言学习发音数据集上的实验结果表明:所提算法的连续语音识别词错误率(WER)较传统DTW算法降低18.9%,较单一Transformer模型降低5.7%;发音校正的音素错误检出率达95.3%,实时响应延迟控制在280 ms以内,可以满足语言教育、智能评测等场景的应用需求。

关键词:连续语音识别;;发音校正;;动态时间规整;;Transformer;;时序对齐;;注意力机制

基金资助:广东省教育厅项目(粤教高函[2023]4号-1097);; 中国民办教育协会2025年度规划课题(青年课题)(CANQN250851);; 湛江市哲学社会科学2025年度规划项目(ZJ25YB47)