来源:期刊VIP网 时间:
作者:王丙参;王国长;魏艳华;
单位:天水师范学院数学与统计学院;暨南大学经济学院;
摘要:文章基于k-means算法探讨了最优聚类个数k~*的确定方法:第一类是统计量方法;第二类是聚类算法不稳定性方法,即基于两次聚类结果间的距离,利用交叉验证、随机抽样取交集、自助法来构建聚类算法估计不稳定性指标,并根据投票、最小化均值方法确定k~*。数值模拟结果显示:在给定k~*的情况下,聚类结果与标签的距离或相似度可作为评价聚类结果的指标,为聚类算法评价提供了新的借鉴;基于k-means算法确定k~*的前提是数据集根据欧氏距离可明显分为几簇,相对而言,聚类算法不稳定性方法优于统计量方法;对于不稳定性指标,交叉验证估计方法与随机抽样取交集估计方法对抽样个数稳健,抽样个数依次建议略少于样本容量的1/3、80%;自助抽样估计方法由于利用了全部样本,因此效率更高;4种不稳定性指标没有显著差异,投票与最小化均值方法也没有显著差异。
关键词:k-means算法;;聚类个数;;统计量;;不稳定性
基金资助:国家自然科学基金资助项目(11665019;11671268);; 天水师范学院高层次人才科研项目(KYQ2023-13)