来源:期刊VIP网 时间:
作者:余正涛;文永华;高盛祥;
单位:昆明理工大学信息工程与自动化学院;云南省人工智能重点实验室;
摘要:针对东南亚低资源语言在神经机器翻译中面临的语料资源匮乏和语言结构复杂等挑战,本文系统梳理了该领域的最新研究进展与技术趋势.基于Flores-101多语言平行语料库,对Google翻译、云岭翻译及GPT大模型在泰语、老挝语等8种东南亚语言与中、英文互译任务中的表现进行了对比评估.实验结果表明,预训练模型与数据增强技术的结合显著提升了翻译质量,但泰语、老挝语、缅甸语和柬埔寨语因数据稀缺、语法结构复杂及非拉丁文字等因素,翻译质量仍落后于马来语、菲律宾语、印尼语及越南语.研究表明,大模型技术与本地化语料库建设是提升低资源语言翻译性能的关键.未来研究应深度融合多语言预训练、迁移学习及跨领域数据增强技术,着重攻克东南亚语言的多样性与文化适配机制瓶颈,构建更加鲁棒的低资源语言翻译系统.
关键词:机器翻译;;神经机器翻译;;低资源语言;;东南亚语言
基金资助:国家自然科学基金项目(U24A20334,U21B2027,U23A20388,62366027);; 云南省基础研究重大项目(202401BC070021);; 云南省重大科技专项计划项目(202502AD080014,202203AA080004,202302AD080003);; 云南省重点研发计划(202303AP140008)