来源:期刊VIP网 时间:
作者:徐洋;张月义;周涵婷;胡静;
单位:中国计量大学经济与管理学院;杭州电子科技大学管理学院;
摘要:为解决传统NMF主题模型难以处理短文本数据稀疏性,以及随机初始化导致聚类结果不稳定的问题,提出一种基于语义相似和变分自编码器的非负矩阵分解主题模型(VSNMF)。该模型在传统的NMF基础上引入单词共现和文本相似度的正则化约束,保证因子矩阵的近似正交性,从而缓解数据稀疏性的缺点,使模型适应不同长度的文本数据集。同时,利用变分自编码器(VAE)初始化因子矩阵,将编码器最后一层输出的直接作为因子矩阵,以增强模型的收敛性和稳定性。在4个不同长度的文本数据集上,将所提出的VSNMF模型与其他模型进行对比,得出该模型优于对比模型,在BBCNews、BBCsport、AGNews、Snippets数据集上的聚类准确率(ACC)分别为94.3%、96.1%、81.5%、93.8%;基于VAE的初始化方法具有良好的收敛性和稳定性,模型分别经过30、40、40、40次的迭代就已经收敛,聚类准确率的标准差分别为0.3、0.0、1.0、0.0。实验结果表明,VSNMF模型对不同长度的文本数据集具有良好适应性和泛化能力,VAE的初始化方法加快了模型的收敛性,提高了聚类的稳定性。
关键词:主题模型;;非负矩阵分解;;变分自编码器;;文本相似度;;正则化约束;;因子矩阵
基金资助:国家自然科学基金项目(72401080);; 国家社科基金项目(23BGL079)