我们的服务符合学术规范和道德
专业 高端让您使用时没有后顾之忧

武汉大学学报(理学版)2024年第03期:基于双步抽取的低资源中文工业领域术语抽取方法

来源:期刊VIP网 时间:


作者:邢季;刘瑾;张建伟;

单位:上海工程技术大学电子电气学院;

摘要:工业领域数据集由各类操作文档、维修文档、设备图纸,以及不断增加的工单和工作记录等数据组成。现有的通用术语抽取方法在中文情景下效果受限,同时先验资源的匮乏也导致了传统的监督学习流程难以实现,因此业内常见模型在工业垂直领域术语抽取任务中的效果并不理想。为了解决上述问题,提出了一种基于预抽取和细化微调的双步抽取策略。在XLNet预训练模型的基础上,结合字符、字形和字音特征,增强了模型捕获语义信息的能力。采用LSTM编码器-解码器模型,生成含有错别字的负样本扩充数据集,旨在提升模型对噪音文本的鲁棒性。将本文方法应用于汽车工业领域,实验结果显示,本方法在该垂直领域的性能比现有传统方法提高了17%,充分证明了其有效性。

关键词:深度学习;;自然语言处理;;术语抽取;;低资源抽取;;XLNet

基金资助:科技部科技创新2030“新一代人工智能”重大项目(2020AAA0109300)