列联表
在统计学中,列联表()描述了样本中不同性质出现的频率,可与、皮爾森卡方檢定等统计工具相结合,用于分析分类变量之间的联系。列联表于20世纪初由卡尔·皮尔逊和提出。 示例 最简单的情况下,样本可以由两种方法分类,每种方法下都只分出两个类别。此时可以使用2×2的表格,每一行和每一列对应一种类别,在单元格中记录满足各个组合的样本数量。例如,以下表格统计了42名婴儿的喂养方式和牙齿出现的情况: 若两种分类方法分别有\, r \,和\, s \,个…
共 5 篇文章
在统计学中,列联表()描述了样本中不同性质出现的频率,可与、皮爾森卡方檢定等统计工具相结合,用于分析分类变量之间的联系。列联表于20世纪初由卡尔·皮尔逊和提出。 示例 最简单的情况下,样本可以由两种方法分类,每种方法下都只分出两个类别。此时可以使用2×2的表格,每一行和每一列对应一种类别,在单元格中记录满足各个组合的样本数量。例如,以下表格统计了42名婴儿的喂养方式和牙齿出现的情况: 若两种分类方法分别有\, r \,和\, s \,个…
零膨胀模型()是人们在社会科学、自然中的计数资料的实际研究中,观察事件发生数中含有大量的零值。例如保险索赔次数,索赔数为0的概率很高,否则保险公司就面临破产风险。这种数据数资料中的零值过多,超出了Poisson分布等一般离散分布的预测能力。零膨胀这个概念首先是由 Lambert在1992年的论文“Zero-Inflated Poisson Regression, with an Application to Defects in Man…
分类变量或称类别变量是统计学中的有限多个取值的变量,其每个值对应于的特定分组(group)或。在计算机科学或一些数学分支中,分类变量对应于列举法或枚举类型。通常,分类变量的每个值成为一个level。其概率分布称为。 分类数据(Categorical data)是一种,由分类变量及其数据组成。具体说,分类数据可从定性数据计数汇总或生成列联表,或从定量数据按照给定的间隔分组得到。 分类变量如果只可能有两个取值,被称为(binary vari…
帕累托圖(Pareto Chart)又稱排列圖法、柏拉圖、主次因素分析法,是一種条形图和折線圖的組合,為品質管理上經常使用的一種圖表方法。1930年由約瑟夫·朱蘭首次應用於品管當中。按照发生的频度排序,显示了多少结果是由每一个识别出来的原因产生。概念上与帕累托法则有关,是品質控制的一个工具。也是品管七大手法的工具之一。 簡介 帕雷托根據「關鍵的少數和次要的多數」的原理而製作,其結構為兩個縱坐標和一個橫坐標,合併長條圖及折線圖所構成。左側…
Good-Turing平滑法可处理N元语法中数据矩阵的稀疏问题,主要思想将非零N元语法的概率均匀分给一些低概率语法,以修改最大似然估计与真实概率之间的偏离。是使用的比较多的一种平滑算法。 应用背景 在自然语言处理的N元模型中,用最大似然估计(MLE)作为某个字符串出现的概率,这样会造成数据稀疏问题,并且使得MLE值偏离真实概率。这个问题与N元语法自身有关,他们不能估计长距离的上下文,总是倾向于过低地估计哪些在训练语料库中不是彼此向邻近出…