标签:#聚类分析

共 10 篇文章

最远优先遍历

在计算几何中,紧致度量空间的最远优先遍历()是该空间中的一个点序列。首个点任意选取,此后每次都选取距已有点集最远的点。这个概念也适用于有限几何点集,即只需将候选点限定在该点集中。也可等价地将这些点视为一个有限度量空间。对于有限度量空间或有限几何点集,由此得到的序列是全部点的排列,又称贪心排列。 最远优先遍历的任一前缀都能得到一组彼此疏离、又接近其余各点的点集。更确切地说,任何规模相同的点集,其点间距至多为该点集的两倍。而其余点到点集的最…

聚类分析

聚类分析()亦称-{集群}-分析,是对于统计数据分析的一门技术,在许多领域受到广泛应用,包括机器学习,数据挖掘,模式识别,图像分析以及生物信息。聚类是把相似的对象通过静态分类的方法分成不同的组别或者更多的子集(subset),这样让在同一个子集中的成员对象都有相似的一些属性,常见的包括在坐标系中更加短的空间距离等。 一般把数据聚类归纳为一种非監督式學習。 定义 聚类(clustering)的概念不能精确定义,这也是为什么聚类算法众多的原…

轮廓 (聚类)

在机器学习与数据挖掘领域,轮廓指的是一种反映数据聚类结果一致性的方法,可以用于评估聚类后簇与簇之间的离散程度。轮廓的取值范围为[-1, +1],如果某一样本的轮廓接近1,则说明样本聚类结果合理;如果接近-1,则说明其更应该分类到其他的簇;如果轮廓近似为0,则说明该样本在两个簇的边界上。所有样本轮廓的均值称为聚类结果的轮廓系数(Silhouette Coefficiency),是该聚类是否合理、有效的度量。 定义 假设某一数据集使用如k-…

混合模型

在統計學中,混合模型(Mixture model)是用於表示母體中子母體的存在的機率模型,換句話說,混合模型表示了測量結果在母體中的機率分布,它是一個由數個子母體之機率分布組成的混合分布。混合模型不要求測量結果供關於各個子母體之機率分布的資訊即可計算測量結果在母體分布中的機率。 高斯混合模型(Gaussian Mixture Model) 對一維的隨機變數X的高斯分佈存在以下機率密度函數: F_X(x) = P_{X}(X \leq x…

谱聚类

在多元变量统计中,谱聚类()技术利用数据相似矩阵的谱(特征值),在对数据进行降维后,以较少的维度进行聚类。相似矩阵作为输入,提供了对数据集中每一对点相对相似性的定量评估。 在图像分割中,谱聚类被称为基于分割的物体分类。 算法 ; 基本算法 计算拉普拉斯矩阵 L (或归一化的拉普拉斯矩阵) 计算前 k 个特征向量(这些特征向量对应 L 的 k 个最小的特征值) 考虑由这 k 个特征向量组成的矩阵,矩阵的第 l 行定义了图节点 l 的特征 …

层次聚类

在数据挖掘和统计学中,层次聚类()是一种旨在建立聚类的层次结构的聚类分析方法。层次聚类的策略通常有两种: 凝聚(Agglomerative clustering):一种自底向上方法,从小集群开始,逐渐将其合并,形成更大的集群; 分裂(Divisive clustering):一种自顶向下方法,从单个集群开始,递归地将其拆分成更小的集群。 凝聚和分离的操作通常用贪心算法实现,结果通常用展示。 标准的凝聚层次聚类(Hierarchical …

信息瓶颈

信息瓶颈()是信息论中的一种方法,由、费尔南多·佩雷拉(Fernando C. Pereira)与威廉·比亚莱克于1999年提出。对于一随机变量X,假设已知其与观察变量Y之间的联合概率分布p(X,Y)。此时,当需要概括(聚类)X时,可以通过信息瓶颈方法来分析如何最优化地平衡准确度与复杂度(数据压缩)。该方法的应用还包括分布聚类(distributional clustering)与降维等。此外,信息瓶颈也被用于分析深度学习的过程。 信息…

集群錯覺

集群错觉()是人类的一种错觉,指的是人类会倾向将小样本中随机出现的集群或者条纹认为是非随机的。这种错觉是由于人们低估随机或半随机数据小样本中的变异量所致。 例子 相关课题研究者、社会科学家认为集群错觉在生活中无处不在,甚至人们对二维数据也会有集群错觉:例如第二次世界大战中V-1火箭击中伦敦的位置看起来就像是若干个集群,股票市场价格随时间波动的模式看起来也像是若干个集群。尽管伦敦人对于火箭攻击的情况有许多猜测,数据分析师R.克拉克最初于1…

潜空间 (机器学习)

潜空间()也被称为潜特征空间或嵌入空间,是一组元素在流形内的嵌入,相似的元素在潜空间内的距离较小。潜空间中的位置由一组潜变量定义,这些潜变量产生于元素间的相似性。 大多数情况下,潜空间的维度都要设定得低于数据点特征空间的维度,意味着潜空间的构建实际上是降维,也可看作是数据压缩的一种形式。潜空间通常通过机器学习进行拟合,然后可被用作机器学习模型的特征空间,包括分类器等监督预测器。 对机器学习模型潜空间的解释是一个活跃的研究领域,但很难实现…

霍森-科佩尔曼算法

霍森–科佩尔曼算法基于联合-查找算法,用于标记占据-非占据网格团簇。 此算法最早由霍森和科佩尔曼在1976年的文章《Percolation and Cluster Distribution. I. Cluster Multiple Labeling Technique and Critical Concentration Algorithm》中提出。 逾渗理论 逾渗理论研究格点上团簇的行为和统计性质。设在一个正方格子中每个元胞占据概率为…