我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

印刷与数字媒体技术研究2025年第06期:基于BERT的Fast Speech2语音合成系统韵律增强研究(英文)

来源:期刊VIP网 时间:


作者:魏毅;赵思佳;司占军;

单位:天津科技大学人工智能学院;

摘要:传统的FastSpeech2虽然具有较高的生成效率和语音自然度,但在韵律建模方面仍有局限,尤其是缺乏语义和韵律之间的有效联系。为了提高合成语音在节奏表达方面的性能,本研究基于BERT预训练语言模型,提出了ProsodySpeech语音合成系统。通过引入了预训练语言模型适配器(Pre-trained Language Model Adapter,PLM Adapter)和语义-韵律映射网络(Semantic-Prosody Mapping Network,SPMN),并充分利用BERT提取的深层语义信息,增强对音高、能量和时长等韵律特征的控制能力。所提出的模型通过引入共享语义处理层、全局自注意机制和专门设计的拟声映射分支,实现了语义信息与拟声参数之间的有效对齐和映射。实验结果表明,本研究模型的平均意见得分(Mean Opinion Score,MOS)优于VITS和StyleTTS2,合成语音在节奏自然度和表现力丰富度方面具有较为明显的优势,更接近自然人语音的表达,语音节奏表达的有效性得到增强。

关键词:语音合成;;BERT;;FastSpeech2;;韵律增强