来源:期刊VIP网 时间:
作者:张晓燕;
单位:西安财经大学;
摘要:针对日益增长的自然语言敏感信息分析问题,提出一种基于LSTM和CNN的综合处理算法。该算法对输入数据编码后划分重点词汇,并对所有词汇进行统计汇总,构建生成敏感词汇表,进而采用排序算法将敏感词汇按照出现的频率进行排序和存储管理。通过BiLSTM对敏感信息表的表征向量进行提取,从而表征出样本中的敏感信息特征度。基于Transformer结构中的矩阵计算方法,设置查询向量Q为提取出的文本表征向量,设置值矩阵V为所提取的敏感信息的相关参数值,用于计算注意力值,并进一步引入基于特征位置表达的注意力特征,综合提升算法的识别准确率。实验结果表明:所提算法的识别准确率相较于最优的对比算法提高了约2.319%;消融实验对比结果显示,改进算法的识别准确率相较于原始算法提升了约6.941%。
关键词:自然语言处理;;敏感信息;;语义感知;;特征提取;;信息识别;;长短期记忆模型;;Transformer
基金资助:教育部人文社会科学研究一般项目(23YJA740058);; 陕西省社会科学基金项目(2021K005)