《计算机技术与发展杂志》发表论文赏析

基于核密度估计的K-means聚类优化

来源:计算机技术与发展杂志2017年第02期北京时间:

作者:熊开玲;彭俊杰;杨晓飞;黄俊

摘要:K-means聚类算法作为一种经典的聚类算法,应用领域十分广泛;但是K-means在处理高维及大数据集的情况下性能较差.核密度估计是一种用来估计未知分布密度函数的非参数估计方法,能够有效地获取数据集的分布情况.抽样是针对大数据集的数据挖掘的常用手段.密度偏差抽样是一种针对简单随机抽样在分布不均匀的数据集下容易丢失重要信息问题的改进方法.提出一种利用核密度估计结果的方法,选取数据集中密度分布函数极值点附近的样本点作为K-means初始中心参数,并使用核密度估计的分布结果,对数据集进行密度偏差抽样,然后对抽样的样本集进行K-means聚类.实验结果表明,使用核密度估计进行初始参数选择和密度偏差抽样能够有效加速K-means聚类过程.

关键词:K-means聚类;密度偏差抽样;核密度估计;数据挖掘

填文献完整题目 获取完整文献

填写需求
联系方式
注:学术顾问会在1小时内联系您,请留意!