国内刊号:44-1251/T
国际刊号:1000-565X
发布日期:
作者:纪霞 张涛 朱建磊 刘诗诚 李学俊
单位:1. 安徽大学 计算机科学与技术学院,安徽 合肥 230601; 2. 安徽大学 计算智能与信号处理教育部重点实验室,安徽 合肥 230039
关键词:DPC 算法,近邻,密度分布,聚类
基金:国家自然科学基金资助项目( 61602004, 61672034) ; 安徽省自然科学基金资助项目( 1708085MF160, 1508085MF127, 1408085MF122) ;安徽省重点研究和研发计划项目( 1804d8020309) ;安徽省高校自然科学研究重点资助项目 ( KJ2016A041, KJ2017A011) ;安徽大学信息保障技术协同创新中心资助课题( ADXXBZ201605)
DPC 算法是一种能够自动确定类簇数和类簇中心的新型密度聚类算法,但在样 本分配策略上存在聚类质量不稳定的缺陷. 其改进算法 KNN-DPC 虽然具有较好的聚类 效果,但效率不高而影响实用. 针对以上问题,文中提出了一种近邻密度分布优化的 DPC 算法. 该算法在 DPC 算法搜索和发现样本的初始类簇中心的基础上,基于样本的密度分 布采用两种样本类簇分配策略,依次将各样本分配到相应的类簇. 理论分析和在经典人工 数据集以及 UCI 真实数据集上的实验结果表明: 文中提出的聚类算法能快速确定任意形 状数据的类簇中心和有效地进行样本类簇分配;与 DPC 算法和 KNN-DPC 算法相比,文中 算法在聚类效果与时间性能上有更好的平衡,聚类稳定性高,可适用于大规模数据集的自 适应聚类分析.
来源:2019年第2期
《华南理工大学学报(自然科学版)》期刊编辑部