K-平均算法
*k-均值算法*(英文:k-means clustering)源于信号处理中的一种向量量化方法,现在则更多地作为一种聚类分析方法流行于数据挖掘领域。k-平均聚类的目的是:把n个点(可以是样本的一次观察或一个实例)划分到k个聚类中,使得每个点都属于离他最近的均值(此即聚类中心)对应的聚类,以之作为聚类的标准。这个问题将归结为一个把数据空间划分为Voronoi cells的问题。 这个问题在计算上是NP困难的,不过存在高效的启发式算法。一般…
共 5 篇文章
*k-均值算法*(英文:k-means clustering)源于信号处理中的一种向量量化方法,现在则更多地作为一种聚类分析方法流行于数据挖掘领域。k-平均聚类的目的是:把n个点(可以是样本的一次观察或一个实例)划分到k个聚类中,使得每个点都属于离他最近的均值(此即聚类中心)对应的聚类,以之作为聚类的标准。这个问题将归结为一个把数据空间划分为Voronoi cells的问题。 这个问题在计算上是NP困难的,不过存在高效的启发式算法。一般…
模糊聚类(,亦称软聚类或*软k-平均)是聚类的一种形式,在这种聚类中,每个数据点可以属于不止一个聚类簇。 聚类或聚类分析涉及将数据点分配到不同的聚类簇中,使得同一聚类簇中的项尽可能相似,而属于不同聚类簇的项尽可能不同。聚类簇是通过相似性度量来识别的。这些相似性度量包括距离、连通性和强度。可以根据数据或特定的应用选择不同的相似性度量。 与硬聚类的比较 在非模糊聚类(也称为硬聚类)中,数据被划分为完全不同的聚类簇,每个数据点只能严格属于一个…
BIRCH(英文全称:balanced iterative reducing and clustering using hierarchies,中文:利用层次方法的平衡迭代规约和聚类)是一个非监督式分层聚类算法,于1996年由 Tian Zhang 提出。算法的优势在于能够利用有限的内存资源完成对大数据集的高质量的聚类。该算法通过构建聚类特征树(Clustering Feature Tree,简称CF Tree),在接下来的聚类过程中,…
OPTICS()是由米哈伊爾·安克斯特(Mihael Ankerst)、馬庫斯·M·布呂尼希(Markus M. Breunig)、漢斯-彼得·克里戈爾和約爾格·桑德(Jörg Sander)提出的基于密度的聚类分析算法。OPTICS并不依赖全局变量来确定聚类,而是将空间上最接近的点相邻排列,以得到数据集合中的对象的线性排序。排序后生成的序列存储了与相邻点之间的距离,并最终生成了一个 dendrogram 。OPTICS算法的思路与DB…
國立遺傳學研究所學者齋藤成也根據世界上18個人類族群的23種遺傳訊息,以邻接法估算而成的遺傳距離分支图。]] 邻接法(英文:neighbor-joining method;又称 NJ 法),生物信息学术语,是一種用於构建系統發生樹(演化树)的快速聚类方法,由日本遗传学家齋藤成也(平文式罗马字:Saitou Naruya)和日裔美国生物学家根井正利(Nei Masatoshi)二人在1987年創立。使用邻接法構建演化树時,通常需要基於 D…