标签:#统计学

共 73 篇文章

数据科学

-{zh-cn:数据科学;zh-tw:資料科學}-()又称-{zh-cn:资料科学;zh-tw:數據科學}-,是一门利用数据(-{zh-cn:资料;zh-tw:數據}-)学习知识的學科,其目标是透过从数据中提取出有价值的部分来生产数据产品,学科范围涵盖了:数据取得、数据处理、数据分析等过程,举凡与數據有关的科学均属数据科学。 数据科学结合了诸多领域中的理论和技术,包括应用数学、统计、模式识别、机器学习、数据可视化、数据仓库以及高性能计算…

数量化理论

数量化理论(数量化理論、Hayashi's quantification methods),是日本统计数理研究所的原所长林知己夫在1940年代后期到1950年代开发的日本独自的多维数据分析法。 数量化理论有I类、II类、III类、IV类、V类、VI类共6种方法,现在从I类到IV类比较为人所知。 该方法在日本国内开发并得到普及,但是在日本国内,也有很多人提倡使用海外的本质上是同样的方法;由于该方法开发时并没有注意到名称不同但是本质相同的其…

推論統計學

中变色鸢尾花萼片宽度数据的分布直方图]] 推論統計學,或稱統計推斷(),是利用資料分析推斷機率分布特性的過程。推論統計分析對母體的特性進行推斷,例如通過檢定假設和導出估計量。通常假定觀測到的數據集是從較大母體中抽樣所得。 推論統計可與描述統計相對照。描述統計僅關注觀測數據本身的特性,並不以數據來自更大母體為前提。在機器學習中,「推斷」一詞有時被用來指「通過評估已訓練的模型進行預測」;在此語境下,對模型特性的推斷稱為「訓練」或「學習」(而…

众数 (数学)

众数指一组数据中出现次数最多的数据值。例如{8,7,7,8,6,5,5,8,8,8}中,出現最多的是8,因此眾數是8,众数可能是一個數(數據值),但也可能是多個數(數據值)。若數據的數據值出現次數相同且無其他數據值時,則不存在眾數。例如{5,2,8,2,5,8}中,2、5、8出現次數相同且沒有其他數,因此此數據不存在眾數。 在離散概率分布中,众数是指概率质量函数有最大值的數據,也就是最容易取様到的數據。在連續概率分布中,众数是指機率密度…

偏差 (统计学)

{{about|統計學上导致结果与事实之间存在差异的系统性倾向的偏差()|别称“-{偏差}-”的离差()|离差|心理認知上的偏差|認知偏差|社會學的偏差|偏差行為}} 在统计学中,偏差()是指会导致结果与事实之间存在差异的系统性倾向。数据分析的许多过程,包括数据的来源、选择的估计量和分析数据的方式,都可能存在偏差。偏差具有重要的现实影响,因为数据被用于社会各领域的决策制定——从法律制定、行业监管到企业营销和机构政策。例如,若一家制药公司…

U-统计量

U-统计量是统计学中一类特定的、具有对称性的统计量,它在估计理论中扮演重要角色。名称中的“ U”为无偏(unbiased)之意。在初等统计学中,U-统计量与最小方差无偏估计量 (UMVUE) 有密切联系。 U-统计量的一个重要性是,对概率分布来说,其可估计参数的最小方差无偏估计量 是一个U-统计量。 因此通过研究U-统计量的一般性质,可以系统地了解这些估计量的统计学性质。 U-统计量在非参数统计中尤其重要,不少用于估计和统计检验的统计量…

遍历理论

遍历理论()是研究具有的动力系统及其相关问题的一个数学分支。 遍历理论研究遍历变换,由试图证明统计物理中的而来。 遍历变换 概率空间上的一个保测变换T 称为遍历的,如果在T 下不变的可测集的测度必为0或1。这个性质的一个旧术语是度量推移的。 遍历的定义 考虑适定的函数f的时间平均。这定义为从某个初始点x开始的时间间隔T的取值的平均。 : \hat f(x) = \lim_{n\rightarrow\infty}\; \frac{1}{n…

统计学

统计学是一门收集数据、分析数据,并根据数据进行推断的艺术和科学。最初与政府收集的数据有关,现在包括了范围广泛的方法和理论。該学科自17世纪中叶产生并逐步发展起来,廣泛地應用在各門學科,從自然科学、社會科學到人文學科,甚至被用於工商業及政府的情報決策。隨著大数据時代來臨,統計的面貌也逐漸改變,與資訊、計算等領域密切結合,是數據科學中的重要主軸之一。 譬如自一組數據中,可以摘要並且描述這份數據的集中和離散情形,這個用法稱作為描述統計學。另外…

天花板效应

天花板效应(英语:)是统计学中的一种因果现象,指测量工具设置的最高分限制了能力高者的表现,导致数据过度集中在上限区域,使优秀个体之间的实际差异无法准确测量。 天花板效应会降低统计变量的区分度。当因变量因天花板效应被截断时,高分区域的数据会被压缩导致统计分析的准确性降低,不同数据之间的差异更难比较,从而影响研究结果的可信度。 研究 天花板效应在自然科学和社会科学等多个领域普遍应用。 传播学 在传播学媒体效应研究中,天花板效应是常见的方法论…

经验分布函数

经验分布函数()是统计学中一个与样本经验测度有关的分布函数。该累积分布函数是在所有个数据点上都跳跃的阶跃函数。对被测变量的某个值而言,该值的分布函数值表示所有观测样本中小于或等于该值的样本所占的比例。 经验分布函数是对用于生成样本的累积分布函数的估计。根据可以证明,经验分布函数以概率1收敛至这一累积分布函数。 定义 令为独立同分布的的实随机变量,它们共同的累积分布函数为。于是,经验分布函数可定义为 : \hat F_n(t) = \fr…

費雪線性判別

在模式识别中,费雪线性判别(Fisher's linear discriminant)是一种线性判别方法,其意图是在分类类别为c类时,将d维空间(样品点是d维向量)中的数据点投影到c-1维空间上去,使得不同类的样本点在这个空间上的投影尽量分离,同类的尽量紧凑。 两类情况 在二类判别时,费雪线性判别将d维空间中的数据点投影到一条直线上去,使得不同类的样本点在这条直线上的投影尽量分离,同类的样本点在这条直线上尽量紧凑。假设有两类样本集\ma…

SPSS

SPSS是統計產品與服務解決方案()的簡稱,為IBM公司的一系列用於統計學分析運算、數據挖掘、預測分析和決策支持任務的軟件產品及相關服務的總稱,有Windows和macOS等版本。 簡介 SPSS原名社會科學統計包(英語Statistical Package for the Social Sciences)。1968年,美國斯坦福大學三位研究生開發出最早的SPSS軟件,當時主要面向中小型計算機和企業用戶,產品統稱SPSSx版。1975年…

黑暗數字

黑暗數字()乃指一些在官方數據上未能有效反映出來的統計資料,尤指罪案數字。 很多時,官方所發表的罪案數字皆未能實際反映到社會所發生的罪案數目。其原因包括: 受害一方不曾察覺有關事故(如:超級市場沒有察覺被盜去糖果) 受害一方不願報警處理(常見原因如:怕麻煩,或有關罪案與性有關者) 案件雖已發生,亦已報警,但警方未有確切證據證實有關案件確是一宗罪案(如某人報警聲稱被人盜去錢包,但警方若無確切證據,則僅會視之為失物案件(非罪案)而非盜竊(罪…

零假设

有不同的期望值與相同的變異數]] 在推論統計學中,零假设(,又译-{zh-cn:虚无假设、原假设; zh-tw:零假說;}-,符号:H_0)是做统计检验时的一类假說。 零假设的内容一般是希望能证明为错误的假设,与零假设相对的是對立假說,即希望通过证伪零假设而证明正确的另一种假说。从数学上来看,零假设和备择假设的地位是相等的,但是在统计学的实际运用中,常常需要强调一类假设为应当或期望实现的假设,例如在相关性检验中,一般会取“两者之间无关联…

方差

{{Other uses|subject=變異數,又稱-{zh-cn: 变异数; zh-hk: 變異數; zh-tw:方差}-、變方|other=變異係數(coefficient of variation)|变异系数}} SD=10),而蓝色总体的方差为2500(SD=50)。]] 變異數()又稱-{zh-cn: 变异数; zh-hk: 變異數; zh-tw:方差}-、變方,在概率论及统计学中,描述的是一个随机变量的离散程度,即一组数字…

隐马尔可夫模型

隐马尔可夫模型(;縮寫:),或稱作-{zh-cn:隐性马尔可夫模型;zh-tw:隱性馬可夫模型}-,是统计模型,用来描述一个含有隐含未知参数的马尔可夫过程。其难点是从可观察的参数中确定该过程的隐含参数。然后利用这些参数来作进一步的分析,例如模式识别。 在正常的马尔可夫模型中,状态对于观察者来说是直接可见的。这样状态的转换概率便是全部的参数。而在隐马尔可夫模型中,状态并不是直接可见的,但受状态影响的某些变量则是可见的。每一个状态在可能输出…

分层抽样

分层抽样(),又名層化抽出法,是統計學的一從統計總體(又稱為「母體」)抽取样本方法。将抽样单位按某种特征或某种规则划分为不同的层,然后从不同的层中独立、随机地抽取样本。从而保证样本的结构与总体的结构比较相近,从而提高估计的精度。相對於沒有經過分層的抽樣調查,其數據會被稱為「未分層抽樣」()。 在社会统计调查(),當總體內的「子總體」()之間的差異較大,對每個子總體分別進行分層抽樣調查,會令統計調查結果更為準確。子總體的分層必須為互斥,即…

测量误差

实验科学中,测量误差()或观测误差()简称误差(),是测量结果偏离真值的程度。对任何一个物理量进行的测量都不可能得出一个绝对准确的数值,即使使用测量技术所能达到的最完善的方法,测出的数值也和真实值存在差异,这种测量值和真实值的差异称为误差。誤差根据數值計算方式可分为绝对误差和相对误差,也可以根据误差来源分为系统误差、随机误差和毛誤差。 测量误差(除了毛误差外)并不是“错误”,是事物固有的不确定性因素在量测时的体现。 测量值与真实值 测量…

随机逼近

随机逼近方法是一类迭代方法,通常用于求解方程的根或最佳化問題。随机逼近方法的递归更新规则可用于多种场景,例如在收集的数据受到噪声干扰时求解线性系统,或在函数无法直接计算、只能通过带噪观测估算时近似其极值。 简而言之,随机逼近算法处理的函数通常具有如下形式: f(\theta) = \operatorname E_{\xi} [F(\theta,\xi)] 其中f是依赖随机变量\xi 的函数F(\theta,\xi)的期望值。算法的目标是…

降维

在机器学习和统计学领域,降维(dimensionality reduction)是指在某些限定条件下,降低随机变量个数,得到一组“不相关”主变量的过程。 降维可进一步细分为变量选择和特征提取两大方法。 变量选择 变量选择假定数据中包含大量冗余或无关变量(或称特征、属性、指标等),旨在从原有变量中找出主要变量。现代统计学中对变量选择的研究文献,大多集中于,其中最具代表性的方法包括: Lasso算法 (Robert Tibshirani提出…