来源:期刊VIP网 时间:
作者:田地;邵玉斌;杜庆治;龙华;马迪南;
单位:昆明理工大学信息工程与自动化学院;云南省媒体融合重点实验室;
摘要:针对中文词语边界不明确,词语和句子上下文关系被忽略的问题,设计一种基于多种分词情况的歧义分词信息抑制算法.在预处理中根据预训练的词汇频率表计算语句中不同分词的权重,将最有可能的分词情况与其他分词情况进行区分,合并至语句中,在自注意力机制提取语句上下文信息时加入分词权重信息,添加正确分词有效的边界信息,抑制歧义分词错误的前后文关系.对比MarkBert与W2NER算法,在公开数据集Resume、 MSRA、 Weibo、 OntoNotes中的试验结果表明,歧义分词信息抑制算法的预测准确率、句子长度增加时的鲁棒性、数据集增大时的预测准确率均有更好的表现.
关键词:命名实体识别;;预训练模型;;自注意力;;词边界信息
基金资助:云南省媒体融合重点实验室项目(320225403)