司徒頓t分布

{{機率分佈
|name = 学生t 分布
|type = 密度
|pdf_image =
|cdf_image =
|parameters =\nu > 0\!自由度
|support = x \in (-\infty; +\infty)\!
|pdf = \frac{\Gamma((\nu+1)/2)} {\sqrt{\nu\pi}\,\Gamma(\nu/2)\,(1+x^2/\nu)^{(\nu+1)/2}}\!
|cdf =\frac{1}{2} + \frac{x \Gamma \left( (\nu+1)/2 \right) \,_2F_1 \left ( \frac{1}{2},(\nu+1)/2;\frac{3}{2};-\frac{x^2}{\nu} \right)} {\sqrt{\pi\nu}\,\Gamma (\nu/2)}其中:\,_2F_1 是超几何函数
|mean =\nu>1时为0,\nu=1时未定义
|median =0
|mode =0
|variance =\nu>2时为\frac{\nu}{\nu-2}\!,否则为无穷大
|skewness =\nu>3时为0
|kurtosis =\nu>4时为\frac{6}{\nu-4}\!
|entropy =\begin{matrix}
\frac{\nu+1}{2}\left[
\psi(\frac{1+\nu}{2})

  • \psi(\frac{\nu}{2})

\right] \\[0.5em]

  • \log{\left[\sqrt{\nu}B(\frac{\nu}{2},\frac{1}{2})\right]}

\end{matrix}

  • \psi: 双Γ函数,
  • B: 贝塔函数

|mgf =未定义
|char =\frac{K_{\nu/2}(\sqrt{\nu}|t|)(\sqrt{\nu}|t|)^{\nu/2}}{\Gamma(\nu/2)2^{\nu/2-1}},\;\nu>0

  • K_{\nu}(x): 第二类修正貝塞爾函數

}}
学生t分布(Student's t-distribution),簡稱*t 分布**,在機率論及统计学中用于根据小样本來估計母體呈常態分布且標準差未知的期望值。若母體標準差已知,或是样本数足够大时(依據中央極限定理漸進常態分布),则应使用常態分布來進行估計。其為对两个样本期望值差异进行显著性测试的司徒頓t檢定之基础。

司徒頓t 檢定改進了Z檢定(),因為在小樣本中,Z檢定以母體標準差已知為前提,Z檢定用在小樣本會產生很大的誤差,因此必須改用学生t 檢定以求準確。但若在樣本數足夠大(普遍認為超過30個即足夠)時,可依據中央極限定理近似常態分布,以Z檢定來求得近似值,

在母體標準差數未知的情況下,不論樣本數量大或小皆可應用t檢定。在待比較的數據有三組以上時,因為誤差無法被壓低,此時可以用變異數分析(ANOVA)代替t檢定。

t 分布的推导最早由德國大地测量学家于1876年提出,并由德國数学家证明。

英國人威廉·戈塞于1908年再次发现并发表了t分布,当时他还在愛爾蘭都柏林的吉尼斯啤酒酿酒厂工作。酒廠雖然禁止員工發表一切與釀酒研究有關的成果,但允許他在不提到釀酒的前提下,以筆名發表t 分佈的發現,所以论文使用了「学生」(Student)这一笔名。之后t检定以及相关理论经由羅納德·費雪发扬光大,為了感謝戈塞的功勞,費雪将此分布命名为*学生t 分布(Student's t*)。

描述
假设X是呈正态分布的独立的随机变量(随机变量的期望值為\mu,母體變異數為\sigma^{2}但其值未知)。
令:

:\overline{X}_n=\frac{X_1+\cdots+X_n}{n}

样本期望值

:{S_n}^2=\frac{1}{n-1}\sum_{i=1}^n\left(X_i-\overline{X}_n\right)^2

樣本變異數

:Z=\frac{\overline{X}_n-\mu}{\frac{\sigma}{\sqrt{n}}}
為呈期望值為0變異數為1的常態分布的随机变量,但因母體變異數\sigma^{2}為未知,因此依史拉斯基定理以{S_n}^2替換之:
:T=\frac{\overline{X}_n-\mu}{\frac{S_n}{\sqrt{n}}}
T 的機率密度函數是:

:f(t) = \frac{\Gamma(\frac{\nu+1}{2})}{\sqrt{\nu\pi\,}\,\Gamma(\frac{\nu}{2})} (1+\frac{t^2}{\nu})^{\frac{-(\nu+1)}{2}}

  • \nu 等于n* − 1。

T的分布称为*t 分布*。母數\nu *一般被称为自由度。

\Gamma 是伽玛函数。
如果\nu是偶数,

: \frac{\Gamma(\frac{\nu+1}{2})} {\sqrt{\nu\pi}\,\Gamma(\frac{\nu}{2})} = \frac{(\nu -1)(\nu -3)\cdots 5 \cdot 3} { 2 \sqrt{\nu}(\nu -2)(\nu -4)\cdots 4 \cdot 2\,}\cdot
如果\nu是奇数,

: \frac{\Gamma(\frac{\nu+1}{2})} {\sqrt{\nu\pi}\,\Gamma(\frac{\nu}{2})} = \frac{(\nu -1)(\nu -3)\cdots 4 \cdot 2} {\pi \sqrt{\nu}(\nu -2)(\nu -4)\cdots 5 \cdot 3\,}\cdot\!

T 的機率密度函數的形状类似于期望值为0方差为1的正态分布,但更低更宽。随着自由度\nu的增加,则越来越接近期望值为0方差为1的正态分布。

T分布的概率累计函数,用不完全贝塔函数I表示:
:F(t) = \int_{-\infty}^t f(u)\,du = 1- \tfrac{1}{2} I_{x(t)}\left(\tfrac{\nu}{2}, \tfrac{1}{2}\right),
其中
:x(t) = \frac{\nu}.

T分布的矩为:

:E(T^k)=\begin{cases}
0 & \mbox{k odd}, 0

学生t 分布置信区间的推导
假设数量A在当Tt-分布(T的自由度为n − 1)满足

:\Pr(-A

这与
:\Pr(T 是相同的

A是这个概率分布的第95个百分点

那么

:\Pr\left(-A

等价于

:\Pr\left(\overline{X}_n - A{S_n \over \sqrt{n}}

因此μ的90%置信区间为:

:\overline{X}_n\pm A\frac{S_n}{\sqrt{n}}

计算
现在最方便的计算T分布的办法是使用电子表格软件(如Excel)或查相关在线计算网站。例如,Excel的TDIST(x,v,sides)用来计算自由度为v的T分布,如果第三个参数为1,则给出Pr(T>x);如果第三个参数为2,则计算Pr(T>x Or T\nu的t 分布的單側和雙側區間值。例如,當樣本數量n=5時,則自由度\nu=4,我們就可以查找表中以4開頭的行。該行第5列值為2.132,對應的單側值為95%(雙側值為90%)。這也就是說,T小於2.132的概率為95%(即單側),記為Pr(−∞ −2.132) = 1 − 0.95 = 0.05,

因此,

: Pr(−2.132 \overline{X}_n\pm A\frac{S_n}{\sqrt{n}}

可知,使用該方法統計出來的最大值,平均有90%的概率(即90%置信度/信心水準/confidence level)低於:

:10+1.37218 \frac{\sqrt{2}}{\sqrt{11}}=10.58510.

同理,使用該方法統計出來的最小值,平均有90%的概率(即90%置信度/信心水準/confidence level)高於:

:10-1.37218 \frac{\sqrt{2}}{\sqrt{11}}=9.41490.

因此,使用該方法統計出來的最大值和最小值,平均有80%的概率介於:

:10\pm1.37218 \frac{\sqrt{2}}{\sqrt{11}}=[9.41490,10.58510]

兩值之間。(需注意此非代表數據的真正期望值介於這兩個值之間的機率為80%,詳情請參見置信区间。)

參見

  • 假說檢定

*司徒頓t檢定
*概率分布
*

參考文獻
外部連結

评论 (0)

  • 还没有评论,来抢沙发吧。