来源:期刊VIP网 时间:
作者:王董祺;杨洪山;黄勃;何传鹏;高志荣;刘瑾;
单位:上海工程技术大学电子电气工程学院;星环信息科技(上海)股份有限公司;中南民族大学计算机科学学院;
摘要:当前基于深度学习的文本情感分类方法尚未充分利用字符级信息和情感来源信息,仍有改进空间。因此,提出了一种基于预训练模型BERT的面向多情感字符级信息的注意力方法(Character-BERT-Sentiment-Attention, CBSA)。该方法通过捕捉字符级信息丰富文本语义信息,拼接融合BERT预训练的单词级向量,得到语义向量,然后将上下文词与4种情感来源信息(情感词、否定词、程度副词、连接词)整合到门控循环单元(Gated Recurrent Unit, GRU)神经网络中,通过注意力机制构建融合情感资源信息的句子表示,最后通过Softmax分类层预测情感极性。该方法对字符级信息与多情感来源信息进行提取,获得来自不同表示子空间的情感相关信息,从而使情感预测更加准确。在5个数据集上的实验结果表明,本文提出的方法在分类准确性上有了明显的提高。
关键词:情感分类;;BERT;;字符级信息;;融合向量;;注意力
基金资助:国家重点研发计划“先进计算与新兴软件”重点专项(2023YFB4502904);; 上海市“科技创新行动计划”生物医药科技支撑专项(22S31903700)