Skip to content

ML Basic Knowledge

一、经典算法

1. KNN 聚类算法

作为一种有监督算法,它需要样本点类别已知,来判断新的样本点属于哪类。K代表的是根据临近K个点来判断类别。

算法流程:计算已知类别数据集中的点与当前点之间的距离,选取与当前点距离最小的k个点,然后确定前k个点所在类别的出现频率,最后返回前k个点出现频率最高的类别作为当前点的预测分类。

2. K-Means聚类算法

作为一种无监督算法,不需要人工提供数据类别。K代表最后类别个数。

算法流程:随机生成k个中心点,对于N个点,计算自己与中心点的距离,判断自己属于哪一类。然后对于k个中心点,将自己的坐标修改为自己这一类所有数据点的中心点。重复以上流程,直到算法收敛(代价函数的差分值小于一定数值)。