来源:期刊VIP网 时间:
作者:胡文琪;李永博;王晓彤;孟路稳;
单位:北京师范大学经济与资源管理研究院;中国人民解放军92020部队;中国人民解放军军事科学院国防科技创新研究院;
摘要:针对簇间密度具有较大差异的数据集,密度峰值聚类算法对这类数据集聚类效果不理想的问题,文章从类簇中心的选取和剩余样本的分配两个方面进行优化,提出一种面向簇间密度不均匀数据的密度峰值聚类优化算法。先在定义样本点的局部密度时引入K近邻思想,充分考虑样本的空间分布特征,均衡簇间密度差异较大的数据集中样本之间的密度差距,从而提高类簇中心选择的准确性;再对K近邻、自然近邻和共享近邻信息进行混合加权,构造样本的加权相似性,加强同一类簇中样本点之间的关联性,以实现对簇间密度不均匀数据集中剩余样本的正确分配。与DPC、K-means、DBSCAN算法的对比实验结果表明,所提算法对簇间密度差异较大的数据集有较好的聚类效果。
关键词:密度峰值聚类;;K近邻;;混合近邻;;样本相似性
基金资助:国家自然科学基金青年科学基金项目(51809274);; 国家社会科学基金重大项目(19ZDA100)