U-统计量

U-统计量是统计学中一类特定的、具有对称性的统计量,它在估计理论中扮演重要角色。名称中的“ U”为无偏(unbiased)之意。在初等统计学中,U-统计量与最小方差无偏估计量 (UMVUE) 有密切联系。

U-统计量的一个重要性是,对概率分布来说,其可估计参数的最小方差无偏估计量 是一个U-统计量。 因此通过研究U-统计量的一般性质,可以系统地了解这些估计量的统计学性质。

U-统计量在非参数统计中尤其重要,不少用于估计和统计检验的统计量,在形式上都是U-统计量。U-统计量通常具有良好的渐近正态性,这方便了基于它的统计推断。 近年来,U-统计量在研究复杂的随机过程和随机网络类型数据的随机性质方面,发挥了作用。

目前,统计学家们对U-统计量性质的了解,几乎全都基于Hoeffding发表于1948年的经典论文。在这篇论文里,Hoeffding给出了U-统计量最重要的性质——它的ANOVA分解。

定义
定义 h(x_1,\ldots,x_r): \mathbb{R}^r \to \mathbb{R} 为一个函数,其具有对称性,即交换任意 x_i,x_j 的位置,h 的值保持不变。对随机变量 X_1,\ldots,X_n ,基于 h 的U-统计量定义如下:

:U_n = \frac1{\binom{n}r}\sum_{1\leq i_1

这里,h(\cdot) 称为U-统计量的核函数(Kernel function),而核函数的维数 r 称为该U-统计量的度(degree)

两样本U-统计量
定义 h(x_1,\ldots,x_r;y_1,\ldots,y_s): \mathbb{R}^{r+s} \to \mathbb{R} 为一个函数,其对 X 和 Y 分别具有对称性,即交换任意 x_{i_1},x_{i_2} 的位置或交换任意 y_{j_1},y_{j_2} 的位置,h 的值保持不变(但不能随意交换 x_i,y_j )。对随机变量 X_1,\ldots,X_m;Y_1,\ldots,Y_n ,基于 h 的两样本U-统计量定义如下:

:U_{m,n} = \frac1{\binom{m}r \binom{n}s} \sum_{1\leq i_1

目前在机器学习中,最常见的情形是 r=s=1,例如能量距离和最大平均差异(MMD)。

Hoeffding的ANOVA分解定理
定理表述
Hoeffding的ANOVA分解定理是现代U-统计量理论的基础。为表述该定理,定义:\mu = \mathbb{E}[h(X_1,\ldots,X_r)]。
对所有 1\leq k\leq r ,定义投影函数

a_k(x_1,\ldots,x_k) = \mathbb{E}[h(X_1,\ldots,X_r)|X_1=x_1,\ldots,X_k=x_k]-\mu

然后定义正交化投影函数

g_1(x_1) = a_1(x_1),g_2(x_1,x_2) = a_2(x_1,x_2) - g_1(x_1) - g_1(x_2),等等,每一个 g_k 都定义为相应的 a_k减去之前定义过的所有 g_1,\ldots,g_{k-1},直至最后一个函数 g_r:

g_r(x_1,\ldots,x_r) = a_r(x_1,\ldots,x_r) - \sum_{j=1}^{r-1} \sum_{1\leq i_1

Hoeffding的ANOVA分解定理的内容是:

U_n - \mu = \binom{n}r^{-1} \sum_{k=1}^r \binom{n-k}{r-k} \cdot \sum_{1\leq i_1

分解项的性质
所有的正交化投影函数 g_k 都满足:

\mathbb{E}[g_k(X_1,\ldots,X_k)|X_1,\ldots,X_{k-1}]=0

因此,所有的分解项之间是互不相关的,并且度为 k 的分解项之平均的阶为 O_p\left(n^{-k/2}\right).

在大多数应用中,一个U-统计量的ANOVA分解中最重要的是前一项或前两项。根据分解项的性质,可以得到如下的两项ANOVA分解式:

U_n - \mu = \frac{r}n\sum_{i=1}^n g_1(X_i)

  • \frac{r(r-1)}{n(n-1)}\sum_{1\leq i

定理应用

  • U-统计量的渐近正态性是Hoeffding的ANOVA分解定理的简单推论。具体而言,有如下结论:记 \xi_1^2 = \mathrm{Var}(g_1(X_1)) ,则:

: n^{1/2}\left(U_n-\mu\right) \ \stackrel{d}\to\ N\left(0,r^2\xi_1^2\right)

同时,分解定理也指出了应该如何正确地一阶逼近U-统计量的方差,和对其进行t-标准化。

  • 由该定理出发,在不同强度的假设条件下,可以用一项或两项的Edgeworth展开来高精度地逼近U-统计量的分布。

具体例子

  • 度为1的例子:令 h(x) = x ,则U-统计量 \frac1n\sum_{i=1}^n h(X_i) = \bar X_n是样本均值。
  • 度为2的例子:令 h(x_1, x_2) = |x_1 - x_2| ,则U-统计量

:\frac1{\binom{n}2}\sum_{1\leq i

称为“平均成对偏差”。

  • 另一个度为2的例子:令 h(x_1, x_2) = (x_1 - x_2)^2/2 ,则U-统计量有如下变形:

:\frac1{\binom{n}2}\sum_{1\leq i

这正是人们熟知的样本方差 S_n^2。

  • 度为3的例子:样本偏度定义中的分子项:

:\frac1n\sum_{i=1}^n (X_i - \bar X)^3

展开后可以写成一个U-统计量。

  • 在机器学习中,用核函数方法进行一样本或两样本非参数统计检验时,检验统计量是一个能量距离或最大平均差异(MMD),两者均为U-统计量或表达式包含两样本U-统计量。

参见

  • V-统计量

参考文献

评论 (0)

  • 还没有评论,来抢沙发吧。