来源:期刊VIP网 时间:
作者:钱宇华;杨瑜;王婕婷;
单位:山西大学大数据科学与产业研究院;山西大学计算智能与中文信息处理教育部重点实验室;
摘要:在机器学习领域中,样本随机性及随机一致性现象广泛存在于分类、聚类等任务中。当样本有限时,由于样本随机性的存在,样本协方差矩阵的特征值分解可能会具有随机一致性,使用样本特征值与特征向量来估计总体特征值与特征向量时会存在误差。类似地,多维缩放(Multidimensional Scaling,MDS)方法中涉及内积矩阵B的特征值分解,结果也可能具有随机一致性,最后得到的样本低维坐标可能会存在误差,导致模型性能下降。为了提高模型的估计准确度和算法的稳定性,聚焦于研究MDS内积矩阵B的特征值分解中的随机一致性问题,并引入平均思想,使用平均特征向量表示总体特征向量。为了更好地拟合数据真实分布,首先对数据进行多次均匀抽样,其次分析在协方差分解过程中缓解随机一致性的意义及必要性,最后提出缓解随机一致性的多维缩放方法(Expectation-based Multiple Dimensional Scaling, EMDS)。在6个公开UCI数据集上进行分类实验验证,实验结果表明,相比于原始MDS方法,EMDS降维后的数据具有更高的分类准确率。
关键词:随机一致性;;多维缩放;;分类
基金资助:国家自然科学基金青年基金(62106132;62306170);; 山西省科技重大专项(202201020101006);; 山西省基础研究计划(20210302124271;202103021223026);; 山西省科技创新人才团队专项资助(202304051001001)