K-近邻算法
在模式识别领域中,最近鄰居法(KNN算法,又譯K-近邻算法)是一种用于分类和回归的無母數統計方法,由美国统计学家伊芙琳·费克斯和小約瑟夫·霍奇斯于1951年首次提出,后来由扩展。在这两种情况下,输入包含特徵空間中的k个最接近的训练样本。 : 在k-NN分类中,输出是一个分类族群。一个对象的分类是由其邻居的“多数表决”确定的,k个最近邻居(k为正整数,通常较小)中最常见的分类决定了赋予该对象的类别。若k = 1,则该对象的类别直接由最近的…
共 7 篇文章
在模式识别领域中,最近鄰居法(KNN算法,又譯K-近邻算法)是一种用于分类和回归的無母數統計方法,由美国统计学家伊芙琳·费克斯和小約瑟夫·霍奇斯于1951年首次提出,后来由扩展。在这两种情况下,输入包含特徵空間中的k个最接近的训练样本。 : 在k-NN分类中,输出是一个分类族群。一个对象的分类是由其邻居的“多数表决”确定的,k个最近邻居(k为正整数,通常较小)中最常见的分类决定了赋予该对象的类别。若k = 1,则该对象的类别直接由最近的…
在统计分析中,核(kernel)一词指代窗函数。在统计学的不同分支中,“核”有多种截然不同的含义。 贝叶斯统计 在统计学(尤其是贝叶斯统计)中,機率密度函數(PDF)或概率质量函数(PMF)的核是指原函数中省略掉所有与定义域变量无关的因子后剩余的部分。需要注意的是,这些被省略的因子通常是函数的參數。它们构成概率分布歸一化常數的一部分,且在许多情况下并无必要。例如,在伪随机数抽样中,大多数抽样算法会忽略归一化因子。此外,在共轭先验分布的贝…
置换检验()是统计学上一种基于反证法、重抽样原则的非参数性检验,由罗纳德·艾尔默·费希尔()与()于20世纪30年代最早提出。 置换检验的零假设(虚无假设)为H_0: F=G,即所有样本都服从同一分布。置换检验通过对比样本置换后的检验统计量与置换前的检验统计量来决定是否拒绝零假设H_0: F=G、接受备择假设H_1。 方法 进行置换检验前,首先计算两样本(样本容量设为n_{A}、n_{B})之间原本的检验统计量。检验统计量可以是两样本间…
统计学中,半参数回归包括结合了参数模型和非参数模型的回归模型。它们通常用于完全非参数模型可能表现不佳的情况,或者研究人员希望使用参数模型,但与回归子集有关的函数形式或误差密度不为人知的情况。半参数回归模型是半参数建模的一种特殊类型。半参数模型包含参数成分,依赖于参数假设,可能会出现规范误差与不一致的情况。 方法 目前已有许多不同的半参数回归方法。最流行的方法是部分线性模型、指数模型和变系数模型。 部分线性模型 部分线性模型如下 : Y_…
無母數統計學(),或稱-{zh-cn:无参数; zh-hk:無參數; zh-tw:非母數;}-統計學、無母數統計分析,是統計學的一個分支,適用於总体分布情況未明、小樣本、母體分佈不為常態也不易轉換為常態。特點在於儘量減少或不修改其建立之模型,較具穩健特性;在樣本數不大時,計算過程較簡單。 無母數統計推論時所使用的統計量的抽樣分配通常與母體分配無關,不必推論其中位數、適合度、獨立性、隨機性,更廣義的說,無母數統計又稱為「不受分布限制統計法…
转移熵()是测量两个随机过程之间有向(时间不对称)信息转移量的一种非参数统计量。过程X到另一个过程Y的转移熵可定义为:在已知Y过去值的情况下,了解X的过去值所能减少Y未来值不确定性的程度。更具体地说,假定 X_t 和 Y_t ( t\in \mathbb{N} )表示两个随机过程,并用香农熵来度量信息量,则转移熵可定义为: : T_{X\rightarrow Y} = H\left( Y_t \mid Y_{t-1:t-L}\right…
统计学中,中位数检验是皮尔逊卡方检验的特例,是一种非参数统计检验,用于检验多个抽样的总体中位数是否相同的零假设。每个样本中的数据按是否大于样本中位数分配到两组,然后用皮尔逊卡方检验,确定每个样本中观察到的频率是否异于根据两组数据分布得出的预计频率。 与其他检验的关系 对中大样本量,此检验的功效较低。通常可考虑用Wilcoxon–曼–惠特尼U检验双样本检验或在更多样本中的推广,即克鲁斯卡尔-沃利斯检验。中位数检验的相关性在于,其只考虑每个…