标签:#统计学

共 73 篇文章

分位数

分位数(),亦称分位点,是指用分割点(cut point)将一个随机变量的概率分布范围分为几个具有相同概率的连续区间。分割点的数量比划分出的区间少1,例如3个分割点能分出4个区间。 常用的有中位数(即二分位数)、四分位数(quartile)、十分位数(decile )、百分位数等。q-quantile是指将有限值集分为q个接近相同尺寸的子集。 定义 分位数指的就是连续分布函数中的一个点,这个点对应概率p。 参考资料 R.J. Serfl…

四分位距

四分位距()。是描述統計學中的一种方法,以确定第三四分位数和第一四分位数的差(即Q_1,\ Q_3 的差距)。與變異數、標準差一樣,表示統計資料中各變量分散情形,但四分差更多为一种稳健统计()。 四分位差(),是Q_1, Q_3的值差的一半,即\mathrm{QD} = \frac{Q_3 - Q_1}{2}。 定义 四分位距通常是用来构建箱形图,以及对概率分布的简要图表概述。对一个对称性分布数据(其中位数必然等于第三四分位数与第一四分…

信賴區間

在统计学中,一个概率样本的置信区间(,),是对产生这个样本的总体的参数分布()中的某一个未知母數值,以区间形式给出的估计。相对于点估计()用一个样本统计量来估计参数值,置信区间还蕴含了估计的精确度的信息。在现代机器学习中越来越常用的置信集合()概念是置信区间在多维分析的推广。 置信区间在频率学派中间使用,其在贝叶斯统计中的对应概念是()。两者建立在不同的概念基础上的,贝叶斯统计将分布的位置参数视为随机变量,并对给定观测到的数据之后未知参…

似然函数

在数理统计学中,似然函数()是一种关于统计模型中的参数的函数,表示模型参数中的似然性()。似然函数在統計推論中有重大作用,如在最大似然估计和费雪信息之中的应用等等。文字意義上,“似然性”与“或然性”或“概率”意思相近,都是指某种事件发生的可能性,但是在统计学中,“似然性”和“概率”(或然性)有明确的区分:概率,用于在已知一些参数的情況下,预测接下来在观测上所得到的结果;似然性,则是用于在已知某些观测所得到的结果时,对有关事物之性质的参数…

圖模式

在概率论、統計學及機器學習中,概率图模型()是用圖論方法以表現數個獨立隨機變數之關聯的一種建模法。一个p个節點的图中,节点i对应一个隨機變數,记为X_i。概率图模型被广泛地应用于贝叶斯统计与机器学习中。 有向和无向概率图模型的定义 在一个无向概率图模型(Undirected Graphical Model)中,两个节点i和j之间没有边相连,当且仅当它们对应的随机变量X_i和X_j给定其它所有节点上的随机变量条件下条件独立。数学表述为: …

四分位数

四分位数()是统计学中分位数的一种,即把所有数值由小到大排列并分成四等份,处于三个分割点位置的數值就是四分位数。 概念 第一四分位数(Q_1),又称较小四分位数,等于该样本中所有数值由小到大排列后第25%的数字。 第二四分位数(Q_2),又称中位数,等于该样本中所有数值由小到大排列后第50%的数字。 第三四分位数(Q_3),又称较大四分位数,等于该样本中所有数值由小到大排列后第75%的数字。 第三四分位数与第一四分位数的差距又称四分位距…

随机分析

随机分析()是对随机过程进行运算的概率论分支,主要内容有伊藤积分、随机微分方程(又包括随机偏微分方程和倒向随机微分方程)等等。 随机性模型是指含有随机成份的模型。 所以现代自然科学都以统计与归纳法作为理论基础。大体说统计学是適用确定性模型与随机性模型作比较的一门学科。 应用随机分析的最知名的随机过程是维纳过程(得名于诺伯特·维纳),用于模拟Louis Bachelier(1900)和爱因斯坦(1905)描述的布朗运动及受随机力作用的粒子…

观察性研究

观察性研究()为流行病学及统计学中的一种研究方法,又称非实验性研究或对比研究。该研究通过对研究对象在自然状态下根据特定的特征分组后进行观察、记录,并对结果进行描述和对比分析而得出结论。与实验及随机对照试验等研究方法不同,此类研究方法的研究者没有(或未能)人为设置处理因素。 原因 在研究中,可能因為一些原因使得研究者無法控制一些或所有獨立變數: 随机对照试验可能會違反伦理学標準。假設有研究者在研究墮胎-乳癌假說,其中認為墮胎和乳癌之間有因…

收视率

收視率是市場研究和社會調查的一種,用以量度有多少人在直播時間實時收看一個電視節目。 计算方法 中国大陆地区收视率计算方法 基础研究 基础研究是为了得到被调查地区的详细资料而进行的抽样调查,是保证收视率数据质量的重要环节。 通常,中国大陆地区专业收视率统计机构央视-索福瑞媒介研究有限公司(CSM)会在建立一个新的收视率调查固定样本组之前及建立之后每年(个别小型城市隔年)对该地区进行基础研究调查。使用较大的样本量对被调查区域内的各项人口统计…

层别法

層別法(Stratification)也稱為分類法,分組法,是品質管理手法中的一種,是考慮資料的其他特徵或是規則,在記錄資料時一併記錄,後續統計或分析資料(例如製作散布圖、直方圖)時,即可依這些特徵或是規則,將資料分為不同的層,後續可以研究各層之間的差異。 在記錄人的資料時,同時記錄其性別、年齡範圍等資訊。在記錄有問題零件持,同時記錄其金屬、塑膠等材料資訊。後續分析時,就可以依這些分類將資料分為不同的「層」,分開進行分析,以得到更多的資…

样本均值

样本均值是由一個或多個隨機變數中得到的统计量,样本均值是一個向量,其中的每個元素都是針對隨機變數取样後得到的算术平均数。若只考慮一個随机变量,則样本均值為一個純量,是隨機變數觀測值的算术平均。 定義 令x_{ij}為第j個隨機變數(j=1,...,K)在第i次觀測(i=1,...,N)到的值,所有觀測值可以重組為N個K ×1的向量,其中第i次觀測的所有數據用\mathbf{x}_i表示(i=1,...,N)。 算术平均向量\mathbf…

随机数

隨機數這一概念在不同領域有著不同的含義。 密碼學範疇的隨機數 根據密碼學原理,隨機數的隨機性檢驗可以分爲三個標準: #統計學伪隨機性。統計學伪隨機性指的是在給定的随机比特流樣本中,1的數量大致等於0的數量,同理,“10”“01”“00”“11”四者數量大致相等。類似的標準被稱為統計學隨機性。滿足這類要求的數字在人類“一眼看上去”是隨機的。 #密碼學安全偽隨機性。其定義為,給定隨機樣本的一部分和隨機算法,不能有效的演算出隨機樣本的剩餘部分…

误差范围

,表示真實百分比是50%的相對似然函数。下方則误差范围,對應99%的信賴區間。換句話說,別人可以99%的相信以右邊的樣本數據來抽樣,其真實百分比會在此範圍內。樣本數量越大,误差范围越小。若使用越低的信賴區間(例如95%或90%),相同樣本數以下的误差范围也會比較小(24%或36%)。]] 误差范围(margin of error)表达了统计结果中的随机波动的大小。这可以视为同样的问卷调查进行多次,其报告的百分比的变化的衡量。误差范围越大…

AP統計學

大学先修课程统计学 (AP统计学, AP Stat或AP Stats) 是美国大学理事会为高中生准备的大学先修课程中的统计学科目。该课程等同于大学入门统计学,时长一学期,无需微积分基础。本课程一般来说面向高中第三年(11年级)、第四年(12年级)学生,为他们提供选修。 根据美国大学理事会的最新补充消息,AP数学之前只有AP微积分AB和BC两门,作为对数学科目的补充,AP统计学在1996年5月第一次开考。在美国,AP统计学的选修人数大幅提…

谎言,该死的谎言,统计数字

谎言,该死的谎言,统计数字(英文:***),是一句西方谚语。主要描述数字的说服能力,特别是用来讽刺一些使用统计数字支持、但毫无说服力的分析报告,以及人们倾向于贬低那些不支持其立场的统计结论。 简介 其名言部分来自19世纪英国首相本傑明·迪斯雷利,此后经美国著名文豪马克·吐温之笔,被广泛传诵,原句载马克·吐温的《》:“(统计)数字经常欺骗我,特别是我自己整理它们时候。」在此类情况下本杰明·迪斯雷利的评述经常正确有效:‘世界上有三种谎言:谎…

潜在结果模型

由统计学家Donald Rubin在20世纪70年代所发表的一系列论文(Rubin,1974, 1977, 1978, 1980)而引申出的一种统计模型。该模型的意义在于统计意义上的因果推断。Counterfactual model的核心在于从理论上定义了因果效应(causal effects)。Paul Holland在1986年的论文Statistics and Causal中指出,Rubin模型和前人经验最大的不同在于他把重点放在…

参数统计

母數統計(Parametric statistics)是统计学的一个分支,它假设样本数据来自总体,而总体可以透过具有固定参数集的概率分布进行充分建模。 相反,非参数模型的确切区别在于其参数集(或机器学习中的特征集 )不是固定的,如果收集到新的相关信息,则该参数集可能会增加甚至减少。 大多数著名的统计方法都是参数化的。 关于非参数(和半参数)模型, 戴维·考克斯爵士说:“这些模型通常较少涉及结构和分布形式的假设,但通常都包含有关独立性的强…

集中趋势

在統計學中,集中趨勢(central tendency)或中央趨勢,在口語上也經常被稱為平均,表示一個機率分佈的中間值。最常見的幾種集中趨勢包括算數平均數、中位數及眾數。集中趨勢可以由有限的數組(如一群樣本)中或理論上的機率分配(如常態分佈)中求得。有些人使用集中趨勢(或集中性)這個詞以表示「數量化的資料之中央值的趨勢」。在這種意義下,我們可以利用資数据的離散程度(例如標準偏差或四分差等相似的統計量)判別其集中趨勢的程度。 集中趨勢(*…

估计理论

估计理论是统计学和信号处理中的一个分支,主要是通过测量或经验数据来估计概率分布参数的数值。这些参数描述了实质情况或实际对象,它们能够回答估计函数提出的问题。 例如,估计投票人总体中,给特定候选人投票的人的比例。这个比例是一个不可观测的参数,因为投票人总体很大;估计值建立在投票者的一个小的随机采样上。 又如,雷达的目的是物体(飞机、船等)的定位。这种定位是通过分析收到的回声(回波)来实现的,定位提出的问题是“飞机在哪里?”为了回答这个问题…

平均倒数排名

平均倒数排名是统计学中,依据排序的正确性,对查询请求响应结果的评估。查询响应结果的倒数排名是第一个正确答案的倒数积。平均倒数排名是多个查询结果的平均值。: : \text{MRR} = \frac{1} \sum_{i=1}^ \frac{1}{\text{rank}_i}. \! 平均倒数排名和调和平均数有些相似。 例子 比如,想象一下我们有如下三个查询请求,让系统将他们翻译为英语的複数形式。对于每个例子,系统给出三个猜测,结果中第一…