协方差矩阵

,协方差矩阵为 [ 1.00, 0.50 ; 0.50, 1.00 ]。]]

的样本点。由于 xy 分量共变(即相关),xy 的方差不能完全描述该分布;箭头的方向对应的协方差矩阵的特征向量,其长度为特征值的平方根。]]
在统计学与概率论中,协方差矩阵(covariance matrix)是一个方阵,代表著任兩列间的协方差,是协方差的直接推广。

定义
{{Math theorem
| name = 定義
| math_statement =

設 (\Omega,\,\Sigma,\, P) 是機率空間, X = \{x_i\}^{m}_{i=1} 与 Y = \{y_i\}^{n}_{j=1} 是定義在 \Omega 上的兩列实数随机变量序列

若二者对应的期望值分别为:

: E(x_i)
= \int_{\Omega} x_i \,dP
= \mu_i

: E(y_j)
= \int_{\Omega} y_j \,dP
= \nu_j

則这两列隨機变量间的协方差矩阵为:

: \operatorname{\mathbf{cov}}(X, Y)
:= {\left[\,\operatorname{cov}(x_i, y_j)\,\right]}_{m \times n}
= {\bigg[\,\operatorname{E}[(x_i-\mu_i)(y_j-\nu_j)]\,\bigg]}_{m \times n}

}}

將之以矩形表示的話就是:

:
: \operatorname{\mathbf{cov}}(X, Y)
=\begin{bmatrix}
\operatorname{cov}(x_1, y_1) & \operatorname{cov}(x_1, y_2) & \cdots & \operatorname{cov}(x_1, y_n) \\
\operatorname{cov}(x_2, y_1) & \operatorname{cov}(x_2, y_2) & \cdots & \operatorname{cov}(x_2, y_n) \\
\vdots & \vdots & \ddots & \vdots \\
\operatorname{cov}(x_m, y_1) & \operatorname{cov}(x_m, y_2) & \cdots & \operatorname{cov}(x_m, y_n)
\end{bmatrix}
: =
\begin{bmatrix}
\mathrm{E}[(x_1 - \mu_1)(y_1 - \nu_1)] & \mathrm{E}[(x_1 - \mu_1)(y_2 - \nu_2)] & \cdots & \mathrm{E}[(x_1 - \mu_1)(y_n - \nu_n)] \\
\mathrm{E}[(x_2 - \mu_2)(y_1 - \nu_1)] & \mathrm{E}[(x_2 - \mu_2)(y_2 - \nu_2)] & \cdots & \mathrm{E}[(x_2 - \mu_2)(y_n - \nu_n)] \\
\vdots & \vdots & \ddots & \vdots \\
\mathrm{E}[(x_m - \mu_m)(y_1 - \nu_1)] & \mathrm{E}[(x_m - \mu_m)(y_2 - \nu_2)] & \cdots & \mathrm{E}[(x_m - \mu_m)(y_n - \nu_n)]
\end{bmatrix}

根據測度積分的線性性質,协方差矩阵還可以進一步化簡為:

: \operatorname{\mathbf{cov}}(X, Y) = {\left[\,\operatorname{E}(x_i y_j) - \mu_i \nu_j\,\right]}_{n \times n}

矩陣表示法
以上定義所述的隨機變數序列 X 和 Y ,也可分別以用行向量 \mathbf{X}
:= {\left[x_i\right]}_{m} 與 \mathbf{Y}
:= {\left[y_j\right]}_{n} 表示,換句話說:

:\mathbf{X} :=
\begin{bmatrix}
x_1 \\
x_2 \\
\vdots \\
x_m
\end{bmatrix} \mathbf{Y} :=
\begin{bmatrix}
y_1 \\
y_2 \\
\vdots \\
y_n
\end{bmatrix}

這樣的話,對於 m \times n
個定義在 \Omega 上的隨機變數
a_{ij}
所組成的矩陣
\mathbf{A}
= {\left[\,a_{ij}\,\right]}_{m \times n}
, 定義:

:
\mathrm{E}[\mathbf{A}]
:= {\left[\,\operatorname{E}(a_{ij})\,\right]}_{m \times n}

也就是說

:\mathrm{E}[\mathbf{A}] :=
\begin{bmatrix}
\operatorname{E}(a_{11}) & \operatorname{E}(a_{12}) & \cdots & \operatorname{E}(a_{1n}) \\
\operatorname{E}(a_{21}) & \operatorname{E}(a_{22}) & \cdots & \operatorname{E}(a_{2n}) \\
\vdots & \vdots & \ddots & \vdots \\
\operatorname{E}(a_{m1}) & \operatorname{E}(a_{m2}) & \cdots & \operatorname{E}(a_{mn})
\end{bmatrix}

那上小節定義的协方差矩阵就可以記为:

:
\operatorname{\mathbf{cov}}(X, Y)
=\mathrm{E}
\left[
\left(
\mathbf{X} - \mathrm{E}[\mathbf{X}]
\right)
\left(
\mathbf{Y} - \mathrm{E}[\mathbf{Y}]
\right)^{\rm T}
\right]

所以协方差矩阵也可對 \mathbf{X} 與 \mathbf{Y} 來定義:
:
\operatorname{\mathbf{cov}}(\mathbf{X}, \mathbf{Y})
:=\mathrm{E}
\left[
\left(
\mathbf{X} - \mathrm{E}[\mathbf{X}]
\right)
\left(
\mathbf{Y} - \mathrm{E}[\mathbf{Y}]
\right)^{\rm T}
\right]

术语与符号分歧
也有人把以下的 \mathbf{\Sigma}_{X}
稱為协方差矩阵:

: \begin{align}
\mathbf{\Sigma}_{X}
& := {\left[\operatorname{cov}(x_i, x_j)\right]}_{m \times m} \\
& = \operatorname{\mathbf{cov}}(X, X)
\end{align}

但本頁面沿用威廉·费勒的说法,把 \mathbf{\Sigma}_{X}
稱為 X 的方差(variance of random vector),來跟 \operatorname{\mathbf{cov}}(X, Y)
作區別。這是因為:

: \operatorname{cov}(x_i, x_i)
= \operatorname{E}[{(x_i-\mu_i)}^2]
= \operatorname{var}(x_i)

換句話說, \mathbf{\Sigma}_{X}
的對角線由隨機變數 x_i 的方差所組成。據此,也有人也把 \operatorname{\mathbf{cov}}(X, Y)
稱為方差-协方差矩阵(variance–covariance matrix)。

更有人因為方差和离差的相關性,含混的將 \operatorname{\mathbf{cov}}(X, Y)
稱為离差矩阵

性质
\mathbf{\Sigma}
= \operatorname{\mathbf{cov}}(X, X) 有以下的基本性质:

\mathbf{\Sigma} = \mathrm{E}(\mathbf{X}\mathbf{X}^T) - \mathrm{E}(\mathbf{X}){[\mathrm{E}(\mathbf{X})]}^T

\mathbf{\Sigma}是半正定的和对称的矩阵。

\operatorname{var}(\mathbf{a^T}\mathbf{X}) = \mathbf{a^T} \operatorname{var}(\mathbf{X}) \mathbf{a}

\mathbf{\Sigma} \geq 0

\operatorname{var}(\mathbf{A X} + \mathbf{a}) = \mathbf{A} \operatorname{var}(\mathbf{X}) \mathbf{A^T}

\operatorname{cov}(\mathbf{X},\mathbf{Y}) = \operatorname{cov}(\mathbf{Y},\mathbf{X})^T

\operatorname{cov}(\mathbf{X_1} + \mathbf{X_2},\mathbf{Y}) = \operatorname{cov}(\mathbf{X_1},\mathbf{Y}) + \operatorname{cov}(\mathbf{X_2}, \mathbf{Y})

若 p = q,則有\operatorname{var}(\mathbf{X} + \mathbf{Y}) = \operatorname{var}(\mathbf{X}) + \operatorname{cov}(\mathbf{X},\mathbf{Y}) + \operatorname{cov}(\mathbf{Y}, \mathbf{X}) + \operatorname{var}(\mathbf{Y})

\operatorname{cov}(\mathbf{AX}, \mathbf{BX}) = \mathbf{A} \operatorname{cov}(\mathbf{X}, \mathbf{X}) \mathbf{B}^T

若\mathbf{X} 与\mathbf{Y} 是独立的,則有\operatorname{cov}(\mathbf{X}, \mathbf{Y}) = 0

\mathbf{\Sigma} = \mathbf{\Sigma}^T

尽管共變異數矩阵很简单,可它却是很多领域里的非常有力的工具。它能导出一个变换矩阵,这个矩阵能使数据完全去相关(decorrelation)。从不同的角度看,也就是说能够找出一组最佳的基以紧凑的方式来表达数据。(完整的证明请参考瑞利商)。
这个方法在统计学中被称为主成分分析(principal components analysis),在图像处理中称为Karhunen-Loève 变换(KL-变换)。

複随机向量
均值为\mu的複随机标量变量的方差定义如下(使用共轭複数):

:
\operatorname{var}(z)
=
\operatorname{E}
\left[
(z-\mu)(z-\mu)^{*}
\right]

其中复数z的共轭记为z^{*}。

如果Z 是一个复列向量,则取其共轭转置,得到一个方阵:

:
\operatorname{E}
\left[
(Z-\mu)(Z-\mu)^{*}
\right]

其中Z^{*}为共轭转置, 它对于标量也成立,因为标量的转置还是标量。

估计
多元正态分布的共變異數矩阵的估计的推导非常精致. 它需要用到谱定义以及为什么把标量看做1 \times 1矩阵的迹更好的原因。参见共變異數矩阵的估计。

外部链接
*[http://mathworld.wolfram.com/CovarianceMatrix.html Covariance Matrix] at Mathworld

评论 (0)

  • 还没有评论,来抢沙发吧。