来源:期刊VIP网 时间:
作者:李文博;高盛祥;张勇丙;
单位:昆明理工大学信息工程与自动化学院;昆明理工大学云南省人工智能重点实验室;
摘要:零样本跨语言文本分类任务是指仅依赖源语言标注数据训练模型,并将其迁移到目标语言上,不需要目标语言的标注数据.而传统的跨语言文本分类方法通常需要一定规模的目标语言标注数据,且在跨语言迁移过程中往往忽略以类别标签相关联的关键词,导致跨语言迁移效果不佳.针对以上问题,提出了一种基于注意力自适应迁移的零样本跨语言文本分类方法,在完全不依赖目标语言标注数据的情况下,通过对种子词重要性建模和自适应迁移解决零样本跨语言文本分类的难题.首先,基于文本的词分布特征在源语言上抽取种子词,并对其进行重要性建模,生成重要性矩阵.在此基础上,利用大规模源语言标注数据训练教师模型,在训练过程中通过种子词的词概率分布进一步强调关键性信息.其次,将教师模型捕获的重要词通过跨双语词典映射关系映射到目标语言上.再次,利用教师模型为目标语言中包含种子词的无标注数据生成伪标签,这些伪标签构成了学生模型的初始训练数据,并以此训练学生.最后,学生模型进一步对目标语言的无标注数据进行预测,生成新的标注数据并扩充训练集,通过迭代优化最终得到用于目标语言分类任务的学生模型.实验表明,提出的方法在MLDoc和CLS数据集上与基线模型对比,准确率分别提高了10.5%、6.7%.
关键词:跨语言文本分类;;零样本;;自适应迁移学习;;自注意力;;自适应方法
基金资助:国家自然科学基金项目(U23A20388,U21B2027,62266028);; 云南省重大科技专项计划项目(202303AP140008,202302AD080003,202201BE070001-021);; 云南省科技攻关计划项目(201606);; 云南省基础研究计划重点项目(202001AS070014);; 云南省中青年学术和技术带头人培养基金项目(202105AC160018)