来源:期刊VIP网 时间:
作者:张建伟;刘瑾;杨海马;曾国辉;邢季;张锐;
单位:上海工程技术大学电子电气工程学院;上海理工大学光电信息与计算机工程学院;
摘要:工业领域数据由于其非结构化、领域特定性和数据稀缺性等特点,传统的中文命名实体识别技术在工业领域的应用并不理想。本文以汽车产业数据为依托,提出一种将标签语义与字形拼音信息相融合的自注意网络算法,结合字符级和标签级特征进行多维特征提取。模型引入自注意机制获得文本长距离依赖关系,将分词特征整合到字符级,并结合标签语义特征的上下文进行预测,提高了字符词边界的识别性能。在一定程度上解决了词边界分割歧义及短语组合上下文依赖问题。本文方法在MSRA和Weibo数据集及自构建工业维修文档数据集上进行了实验,结果表明所提方法能够提高实体识别准确性,并在工业领域汽车零配件数据集上实现了工业场景化应用。
关键词:中文命名实体识别;;自注意机制;;多特征融合;;标签语义
基金资助:科技部科技创新2030“新一代人工智能”重大项目(2020AAA0109300)