顺序统计量

在统计学中,样本的第k顺序统计量()即它从小到大排列时的第k个值,常用于非参数估计与推断中。常见的顺序统计量包括样本的最大值、最小值、中位数等。

记号
任给样本x_1, x_2, \cdots, x_n,将其从小到大排成一列,记为:x_{(1)}, x_{(2)}, \cdots, x_{(n)}.则其第一顺序统计量(即最小值)为x_{(1)},第n顺序统计量(即最大值)为x_{(n)}。

概率
随机变量X_{(k)}的累积分布函数F_k(x)由下式给出F_k(x) = \sum_{j = k}^n \binom{n}{j} (F(x))^j(1-F(x))^{n-j}, \quad x \in \R,
将累积分布函数求导可得其概率密度函数f_k(x)为
f_k(x) = \frac{n!}{(k-1)!(n-k)!}(F(x))^{k-1}(1-F(x))^{n-k}f(x), \quad x \in \R.

連續均勻樣本
從单位区间上的連續型均勻分布取得的樣本,其各順序統計量的边缘分布屬於Β分布族。此外,任意幾個順序統計量的联合分布也有簡單的表示。本節將作介紹。藉賴累积分布函数(cdf),該些結果亦可推廣到任意連續分佈。

本節中,X_1, X_2, \ldots, X_n表示以F_X為cdf的一組隨機樣本。記U_i=F_X(X_i),則U_1,\ldots,U_n是從標準連續均勻分布抽取的對應樣本。由F_X的單調性,後者的順序統計量為U_{(i)}=F_X(X_{(i)})。

順序統計量U_{(k)}的概率密度函數(pdf)等於

:f_{U_{(k)}}(u)={n!\over (k-1)!(n-k)!}u^{k-1}(1-u)^{n-k}.

換言之,均勻分佈的第k順序統計量遵循Β分布

:U_{(k)} \sim \operatorname{Beta}(k,n+1\mathbf{-}k).

證明如下:欲使U_{(k)}介乎u與u + \mathrm du之間,樣本須恰有k - 1個元素小於u,並至少有一個介乎u與u + \mathrm du之間。該區間包含多於一個元素的概率已是O(\mathrm du^2)(使用了大O符號),故衹需計算(0,u)、(u,u+du)、(u+du,1)三區間分別恰有k - 1、1、n-k個元素的概率。此即概率

:{n!\over (k-1)!(n-k)!}u^{k-1}\cdot \mathrm du\cdot(1-u-\mathrm du)^{n-k},

故上述pdf公式成立。該分佈的平均值為k/(n+1)。

参考文献

评论 (0)

  • 还没有评论,来抢沙发吧。