来源:期刊VIP网 时间:
作者:李小松;
单位:西华师范大学计算机学院;
摘要:在多任务变换和扩充下,对文本信息理解和分析能力要求较高,存在复杂文本结构可扩展性差、标注数据稀缺的问题,对此,文中提出自然语言处理技术下文本信息语义抽取方法。对原始文本进行严格的清洗与净化、实体位置定位、实体邻近词截取、序列长度标准化、Token(分词)化以及特殊标记添加等预处理后,利用BERT模型的多层双向Transformer结构映射为语义词向量序列,有效提取和表示文本中的语义信息和实体关系,扩展复杂文本结构。采用BiGRU(双向门控循环单元)模型对BERT输出的向量序列进行处理后,引入多头注意力机制,并行计算多个注意力权重集合,捕捉句子内部词与词之间的复杂依赖关系,通过Softmax分类器对多头注意力机制的输出进行分类,反复标注实体之间的关系类型,实现下文本信息的语义抽取。实现结果表明:经文中方法处理后的文本数据质量显著提升,对于文本信息的语义抽取F_1高达0.99;且更细致地刻画了输入与输出之间的多种相关性,从而有效捕捉句子内部词与词之间的复杂依赖关系,文本信息语义抽取效果较优。
关键词:NLP;;文本信息;;Token化;;BERT模型;;向量表示;;BiGRU模型;;多头注意力机制;;语义抽取