机器学习——利用K-均值聚类算法对未标注数据分组

时间：2016-12-26 11:56:13 阅读：215 评论：0 收藏：0 [点我收藏+]

聚类是一种无监督的学习，它将相似的对象归到同一簇中。它有点像全自动分类。聚类方法几乎可以应用到所有对象，簇内的对象越相似，聚类的效果越好。

K-均值（K-means）聚类算法，之所以称之为K-均值是因为它可以发现k个不同的簇，且每个簇的中心采用簇中所含值的均值计算而成。

簇识别（cluster identification）给出簇类结果的含义。假定有一些数据，现在将相似数据归到一起，簇识别会告诉我们这些簇到底都是些什么。

K-均值聚类算法

优点：容易实现

缺点：可能收敛到局部最小值，在大规模数据集上收敛较慢

使用数据类型：数值型数据

K-均值是发现给定数据集的k个簇的算法。簇个数k是用户给定的，每一个簇通过其质心（centroid），即簇中所有点的中心来描述。

K-均值算法的工作流程是：

1.随机确定k个初始点作为质心

2.然后将数据集中的每个点分配到一个簇中，具体来讲，为每个点找到其最近的质心，并将其分配给该质心所对应的簇。

3.完成之后，每个簇的质心更新为该簇所有点的平均值。

技术分享

原文地址：http://www.cnblogs.com/tonglin0325/p/6221652.html

踩

(0)

评论一句话评论（0）

分享档案

更多>

周排行