皮尔逊积矩相关系数

在统计学中,皮尔逊积矩相关系数(,缩写:PPMCC,或PCCs,有时简称相关系数)用于度量兩組數據的变量X和Y之间的線性相關的程度。它是兩個變量的協方差與其標準差的乘積之比; 因此,它本質上是協方差的歸一化度量,因此結果始終具有介於-1和1之間的值。與協方差本身一樣,該度量只能反映變量的線性相關性,而忽略了許多其他類型的關係或相關性。舉個簡單的例子,可以預期高中青少年樣本的年齡和身高的皮尔逊积矩相关系数顯著大於0,但小於1(因為1表示不切實際的完美相關性)。

命名和歷史
它是由卡尔·皮尔逊从弗朗西斯·高尔顿在1880年代提出的一个相似却又稍有不同的想法演变而来,并且其数学公式由奥古斯特·布拉菲(Auguste Bravais)于1844年推导出和发表。系数的命名因此是史蒂格勒名字由來法則的一个例子。

这个相关系数也称作“皮尔森相关系数r”。

定义
两个变量之间的皮尔逊相关系数定义为两个变量的协方差}-除以它们标准差的乘积:
:\rho_{X,Y}={\mathrm{cov}(X,Y) \over \sigma_X \sigma_Y} ={E[(X-\mu_X)(Y-\mu_Y)] \over \sigma_X\sigma_Y}

上式定义了总体相关系数,常用希腊小寫字母 ρ (rho) 作為代表符號。估算样本的-{zh-hans:协方差; zh-hant:共變異數; zh-cn:协方差; zh-tw:共變異數; zh-hk:共變異數; zh-sg:协方差}-和标准差,可得到样本相关系数(样本皮尔逊系数),常用英文小寫字母 r 表示:

:r = \frac{\sum\limits ^n _{i=1}(X_i - \overline{X})(Y_i - \overline{Y})}{\sqrt{\sum\limits ^n _{i=1}(X_i - \overline{X})^2} \sqrt{\sum\limits ^n _{i=1}(Y_i - \overline{Y})^2}}

r 亦可由(X_i,Y_i)样本点的標準分數均值估算,得到與上式等價的表達式:

:r = \frac{1}{n-1} \sum\limits ^n _{i=1} \left( \frac{X_i - \overline{X}}{\sigma_X} \right) \left( \frac{Y_i - \overline{Y}}{\sigma_Y} \right)

其中 \frac{X_i - \overline{X}}{\sigma_X}、 \overline{X} 及 \sigma_X 分别是 X_i 样本的標準分數、样本平均值和样本标准差。

数学特性
总体和样本皮尔逊系数的绝对值小于或等于1。如果样本数据点精确的落在直线上,或者双变量分布完全在直线上(计算总体皮尔逊系数的情况),则相关系数等于1或-1。皮尔逊系数是对称的:corr(X,Y) = corr(Y,X)。

皮尔逊相关系数有一个重要的数学特性是,因两个变量的位置和尺度的变化并不会引起该系数的改变,即它该变化的不变量 (由符号确定)。也就是说,我们如果把X移动到a + bX和把Y移动到c + dY,其中a、b、c和d是常数,并不会改变两个变量的相关系数。我们发现更一般的线性变换则会改变相关系数:参见之后章节对该特性应用的介绍。

由于μX = E(X), σX2 = E[(X − E(X))2] = E(X2) − E2(X),Y也类似, 并且

:E[(X-E(X))(Y-E(Y))]=E(XY)-E(X)E(Y),\,

故相关系数也可以表示成

:\rho_{X,Y}=\frac{E(XY)-E(X)E(Y)}{\sqrt{E(X^2)-(E(X))^2}~\sqrt{E(Y^2)- (E(Y))^2}}.

对于样本皮尔逊相关系数:

:
r_{xy}=\frac{\sum x_iy_i-n \bar{x} \bar{y}}{(n-1) s_x s_y}=\frac{n\sum x_iy_i-\sum x_i\sum y_i}
{\sqrt{n\sum x_i^2-(\sum x_i)^2}~\sqrt{n\sum y_i^2-(\sum y_i)^2}}.

以上方程给出了计算样本皮尔逊相关系数简单的单流程算法,但是其依赖于涉及到的数据,有时它可能是数值不稳定的。

解释
皮尔逊相关系数的变化范围为-1到1。系数的值为1意味着XY可以很好的由直线方程来描述,所有的数据点都很好的落在一条直线上,且 Y 随着 X 的增加而增加。系数的值为−1意味着所有的数据点都落在直线上,且 Y 随着 X 的增加而减少。系数的值为0意味着两个变量之间没有线性关系。

更一般的, 我们发现,当且仅当 XiYi 均落在他们各自的均值的同一侧, 则(Xi − X)(Yi − Y) 的值为正。 也就是说,如果XiYi 同时趋向于大于, 或同时趋向于小于他们各自的均值,则相关系数为正。 如果 XiYi 趋向于落在他们均值的相反一侧,则相关系数为负。

几何学角度的解释
[[File:Regression lines.png|thumb|upright=1.5|回归直线:y=gx(x) [红色] 和 x=gy(y) [蓝色]]]

对于没有进行中心化的数据, 相关系数与两条可能的回归线y=gx(x) 和 x=gy(y) 夹角的余弦值一致。

对于中心化过的数据(也就是说, 数据移动一个样本平均值以使其均值为0),相关系数也可以被视作由两个随机变量向量夹角\ \theta 的余弦值(见下方)。

从一个数据集中可以确定出非中心化的相关系数 (non-Pearson-compliant) 和中心化的相关系数二者。例如,有5个国家的国民生产总值分别为 10, 20, 30, 50 和 80 亿美元。 假设这5个国家 (顺序相同) 的贫困百分比分别为 11%, 12%, 13%, 15%, 和 18% 。 令 xy 分别等于包含上述5个数据的向量: x = (1, 2, 3, 5, 8) 和 y = (0.11, 0.12, 0.13, 0.15, 0.18)。

利用通常的方法计算两个向量之间的夹角 \ \theta (参见 数量积), 未中心化 的相关系数是:

: \cos \theta = \frac { \mathbf{x} \cdot \mathbf{y} } { \left\| \mathbf{x} \right\| \left\| \mathbf{y} \right\| } = \frac { 2.93 } { \sqrt { 103 } \sqrt { 0.0983 } } = 0.920814711.

我们发现以上的数据特意选定为完全相关: y = 0.10 + 0.01 x。 于是,皮尔逊相关系数应该等于1。将数据中心化 (通过E(x) = 3.8移动 x 和通过 E(y) = 0.138 移动 y ) 得到 x = (−2.8, −1.8, −0.8, 1.2, 4.2) 和 y = (−0.028, −0.018, −0.008, 0.012, 0.042), 从中,

: \cos \theta = \frac { \mathbf{x} \cdot \mathbf{y} } { \left\| \mathbf{x} \right\| \left\| \mathbf{y} \right\| } = \frac { 0.308 } { \sqrt { 30.8 } \sqrt { 0.00308 } } = 1 = \rho_{xy},

对相关系数大小的解释
一些著作的作者对相关系数的解释是依赖于具体的应用背景和目的的。 例如,若是在运用高性能的仪器来验证一个物理定律实验这样的应用背景下,0.9的相关系数可能是很低的。但如果是应用在社会科学中,由于社会科学受到各种复杂多变因素影响,0.9的相关系数是相当高的。

皮尔逊距离
皮尔逊距离度量的是两个变量X和Y,它可以根据皮尔逊系数定义成
:d_{X,Y}=1-\rho_{X,Y}.
我们可以发现,皮尔逊系数落在[-1, 1],而皮尔逊距离落在[0, 2]。

统计推断:显著性检验与置信区间
基于皮尔逊相关系数的统计推断通常关注以下两个目标。
#验证零假设是否为真,即相关系数 ρ 是否等于 0, 该相关系数使用的是样本相关系数 r
#在給定的置信水平α之下,构建一个围绕r的置信区间。

随机采样方法
提供了一种假设检验和构造置信区间的直接方法。

对皮尔逊相关系数的显著性检验包括以下两个步骤:
#随机地将原始的数据对 (xiyi)重新定义成数据集 (xiyi′), 其中 i′ 表示数列 {1,...,n}。 数列 i′ 的选取是随机的, 以相同的概率落在 n! 种可能的数列中。这等价于随机地"不可重复地"从数列{1,..., n}中选取 i′。一种相近的且合乎情理的方法(自助抽样法)是“可重复地”从数列{1,..., n}中选取 ii′
#由随机数据构造相关系数r

为了完成显著性检验,需要多次重复步骤(i)和(ii) 。显著性检验的P值是由测试数据除以步骤(ii)得到的r,其中r大于由原始数据计算出的皮尔逊相关系数。在这里“大”可能是绝对值比较大或者是数值比较大,这取决于测试使用的是或者是。

自助抽样法
自助抽样法可以被用来构造皮尔逊系数的置信区间。在"非参数"的自助抽样法中,“可重复”地从观测数据集n中重新采样n 对的 (xiyi) 数据,用来计算相关系数r。这个过程重复了大量次数,。重新采样后数据的 r值的分布被用来估计统计学上的。ρ的95%的置信区间可以被定义成重新采样样本 r值的%2.5到%97.5之间。

基于数学近似的方法
对于近似高斯分布的数据,皮尔逊相关系数的*近似於自由度为N − 2的t分布*。特别地,如果两个变量服从双变量正态分布,变量

:t = r\sqrt{\frac{n-2}{1 - r^2}}

也會服从不相关的t分布。如果样本容量不是特别小,这个结论也大致成立,即便观测数据不是正态分布的。如果需要构建置信区间和进行有力的分析,还需要采用如下的可逆变换

:r = \frac{t}{\sqrt{n - 2 + t^2}}.

或者,也可以采用大量采样数据的方法。

早期对样本相关系数的研究得益于R. A. Fisher和A. K. Gayen.的工作。
另一篇早期的论文给出了在小样本的情况下总体相关系数 ρ的图表, 并讨论了相关的计算方法。

准确服从高斯分布的数据
准确的双变量样本相关系数的分布是

:f\left(r\right) = \frac{\left(n - 2\right)\, \mathbf{\Gamma}\left(n - 1\right) \left(1 - \rho^2\right)^{\frac{n - 1}{2}} \left(1 - r^2\right)^{\frac{n - 4}{2}}}{\sqrt{2\pi}\, \mathbf{\Gamma}\left(n - \frac{1}{2}\right) \left(1 - \rho r\right)^{n - \frac{3}{2}}} \,\mathbf{_2F_1}\left(\frac{1}{2}, \frac{1}{2}; \frac{2n - 1}{2}; \frac{\rho r + 1}{2}\right)

其中 \mathbf{\Gamma}是伽玛函数,\,\mathbf{_2F_1}(a,b;c;z) 是高斯超几何函数。

注意到 E\left(r\right) = \rho - \frac{\rho \left(1 - \rho^2\right)}{2 \left(n - 1\right)} + \cdots , 因此 r 是\,\rho的一个有偏估计。一种获得无偏估计的方法是解\,\rho的方程 r = E\left(r\right) = \rho - \frac{\rho \left(1 - \rho^2\right)}{2 \left(n - 1\right)} 。 然而,解 \breve{\rho} = r \left[1 + \frac{1 - r^2}{2\left(n - 1\right)}\right]是次优的。 一种无偏估计, 可以从 n较大情况下的最小方差和有偏序列 \frac{1}{n - 1}, 通过最大化 \log{f\left(r\right)}, 也就是\hat{\rho} = r \left[1 - \frac{1 - r^2}{2\left(n - 1\right)}\right]获得。

特殊情况下,当 \,\rho = 0时,分布可以被写成
:f\left(r\right) = \frac{\left(1 - r^2\right)^{\frac{n - 4}{2}}}{\mathbf{B}\left(\frac{1}{2}, \frac{n - 2}{2}\right)}
其中 \mathbf{B}是贝塔函数。

費雪轉換
实际应用中, 与ρ相关的置信区间和假设检验通常是通过費雪轉換获得

: F(r) = {1 \over 2}\ln{1 + r \over 1 - r} = \operatorname{arctanh}(r).

如果F(r)是r的費雪轉換,n 是样本容量,那么F(r)近似服从正态分布

:\text{mean} = F(\rho) = \operatorname{arctanh}(\rho)    and standard error    \text{SE} = \frac{1}{\sqrt{n - 3}}.

也就是Z-分數是

:z = \frac{x - \text{mean}}{\text{SE}} = [F(r) - F(\rho_0)]\sqrt{n - 3}

对\rho = \rho_0 进行零假设,可以设想样本数据对是独立同分布并且服从双变量正态分布。因此P值估计可以从正态分布概率表中获得。比如,如果观测数据 z = 2.2,并且要用双尾p值对 \rho = 0进行零假设检验,p值是 2·Φ(−2.2) = 0.028, 其中Φ是正态分布的累积分布函数。

置信区间
为了获得ρ的置信区间,首先,我们应该计算 F(\rho)的置信区间:
:100(1 - \alpha)\%\text{CI}: \operatorname{arctanh}(\rho) \in [\operatorname{arctanh}(r) \pm z_{\alpha/2}SE]

通过可逆Fisher变换可以获得相关尺度上的区间。
:100(1 - \alpha)\%\text{CI}: \rho \in [\operatorname{tanh}(\operatorname{arctanh}(r) - z_{\alpha/2}SE), \operatorname{tanh}(\operatorname{arctanh}(r) + z_{\alpha/2}SE)]

举例来说,假设我们观测到 r = 0.3,样本容量 n=50,并且我们期望获得ρ的95%的置信区间。变换后的值是artanh(r) = 0.30952,所以在变换尺度上的置信区间是 0.30952 ± 1.96/√47,或者 (0.023624, 0.595415)。变换回相关尺度上是 (0.024, 0.534)。

皮尔逊相关系数和最小方差回归分析
样本相关系数的平方,亦称作决定系数,利用简单线性回归估计由X引起的Y的变化。一开始,Yi围绕它们平均值上的变化可以分解成

:
\sum_i (Y_i - \bar{Y})^2 = \sum_i (Y_i-\hat{Y}_i)^2 + \sum_i (\hat{Y}_i-\bar{Y})^2,

其中 \hat{Y}_i 是作回归分析时的适应值。 整理后得

:
1 = \frac{\sum_i (Y_i-\hat{Y}_i)^2}{\sum_i (Y_i - \bar{Y})^2} + \frac{\sum_i (\hat{Y}_i-\bar{Y})^2}{\sum_i (Y_i - \bar{Y})^2}.

两个被加数是由X (右边)引起的Y的变化和不是由X(左边)引起的变化。

接下来, 我们利用最小方差回归模型, 使 \hat{Y}_i 和 Y_i-\hat{Y}_i 的样本协方差为0。 于是, 观测数据和适应值的样本相关系数可以被写成

\begin{align}
r(Y,\hat{Y}) &= \frac{\sum_i(Y_i-\bar{Y})(\hat{Y}_i-\bar{Y})}{\sqrt{\sum_i(Y_i-\bar{Y})^2\cdot \sum_i(\hat{Y}_i-\bar{Y})^2}}\\
&= \frac{\sum_i(Y_i-\hat{Y}_i+\hat{Y}_i-\bar{Y})(\hat{Y}_i-\bar{Y})}{\sqrt{\sum_i(Y_i-\bar{Y})^2\cdot \sum_i(\hat{Y}_i-\bar{Y})^2}}\\
&= \frac{ \sum_i [(Y_i-\hat{Y}_i)(\hat{Y}_i-\bar{Y}) +(\hat{Y}_i-\bar{Y})^2 ]}{\sqrt{\sum_i(Y_i-\bar{Y})^2\cdot \sum_i(\hat{Y}_i-\bar{Y})^2}}\\
&= \frac{ \sum_i (\hat{Y}_i-\bar{Y})^2 }{\sqrt{\sum_i(Y_i-\bar{Y})^2\cdot \sum_i(\hat{Y}_i-\bar{Y})^2}}\\

&= \sqrt{\frac{\sum_i(\hat{Y}_i-\bar{Y})^2}{\sum_i(Y_i-\bar{Y})^2}}.
\end{align}

于是

:
r(Y,\hat{Y})^2 = \frac{\sum_i(\hat{Y}_i-\bar{Y})^2}{\sum_i(Y_i-\bar{Y})^2}

是由X的线性方程引起的Y的平均变化。

数据分布的敏感度
存在性
总体皮尔逊相关系数被定义成 矩,因此任意的双变量概率分布是非零的,也就是说是由总体协方差和边缘总体方差定义的。一些概率分布,如柯西分布的方差未定义,因此若XY服从这种分布,ρ便是未定义的。在实际应用中,若有懷疑数据服从重尾分布,就需要重视這个条件。然而,相关系数的存在性通常無關緊要,例如若分布有界,則ρ必有意义。

大样本的特性
在双变量正态分布的案例中,只要边缘均值和方差是已知的,总体相关系数描述的是便是联合分布。在其他的双变量分布中,这个结论并不正确。总之,不论两个随机变量的联合分布是不是正态的,相关系数都對研究它们之间的线性依赖性有帮助。。因此如果由離群值,这个指标是有误导性的。特别地,PMCC既不是稳健分布的,也不是异常值稳健的

计算加权相关系数
假设我们要计算关联性的观测数据有着不同的重要程度,表示成权值向量 w。 利用权值向量w (总长度 n)计算向量 xy 的相关系数,

  • 加权均值:

:: \operatorname{m}(x; w) = {\sum_i w_i x_i \over \sum_i w_i}.

  • 加权协方差

:: \operatorname{cov}(x,y;w) = {\sum_i w_i (x_i - \operatorname{m}(x; w)) (y_i - \operatorname{m}(y; w)) \over \sum_i w_i }.

  • 加权相关系数

:: \operatorname{corr}(x,y;w) = {\operatorname{cov}(x,y;w) \over \sqrt{\operatorname{cov}(x,x;w) \operatorname{cov}(y,y;w)}}.

去除相关性
我们总是可以通过一定的线性变换去除随机变量之间的相关性, 即便变量间的关系是非线性的。 Cox & Hinkley给出了在总体相关系数中的表达形式。

与此相应的,样本相关系数也存在这样的结论,使得样本相关系数变为0。假设长度为 n 的随机变量被随机采样 m 次。 令 X 是一个矩阵,其中 X_{i,j} 是第i次采样的第 j个变量。 令 Z_{m,m} 是一个所有元素都为1的 m m 的方阵。 那么 D 是变换后的数据,使得随机变量的均值为0, 并且 T 是变换后的数据,使得所有的变量均值为0和与除自身外的其他变量的相关系数为0 - T*的矩作为身份矩阵。 为了得到单位方差,还需要除以标准差。 虽然变换后的数据有可能不是独立的,但他们一定是不相关的。

:D = X -\frac{1}{m} Z_{m,m} X

:T = D (D^T D)^{-\frac{1}{2}}

其中,指数-1/2表示矩阵置换后的矩阵方根。T的协方差被当做身份矩阵。如果新的样本数据x是n个元素的向量, 那么相同的变换可以应用到x中以获得变换向量d和t:

:d = x - \frac{1}{m} Z_{1,m} X

:t = d (D^T D)^{-\frac{1}{2}}
这个去相关性的方法被应用到多变量的主成分分析中。

反射相关性
反射相关系数是皮尔逊相关系数的变体,数据并不是以他们的均值为中心。总体反射相关系数是

:
\text{Corr}_r(X,Y) = \frac{E[XY]}{\sqrt{EX^2\cdot EY^2}}.

反射相关系数是对称的, 但在如下的变换中并不是不变的

:
\text{Corr}_r(X, Y) = \text{Corr}_r(Y, X) = \text{Corr}_r(X, bY) \neq \text{Corr}_r(X, a + b Y), \quad a \neq 0, b > 0.

样本反射相关系数是

:
rr_{xy} = \frac{\sum x_i y_i}{\sqrt{(\sum x_i^2)(\sum y_i^2)}}.

样本加权相关系数是

:
rr_{xy, w} = \frac{\sum w_i x_i y_i}{\sqrt{(\sum w_i x_i^2)(\sum w_i y_i^2)}}.

比例关系
规模的相关性是一个变种的皮尔森相关数据的范围限制故意以受控的方式揭示时间序列之间的快速成分的相关性。比例相关的定义是在短数据段的平均相关性。
对于给定规模S,令K为可以适应信号的总长度的段数:
:
\mathbf{K}=\mathbf{Sound}\left( \frac{T}{s} \right)

比例相关的整个信号的rs的计算公式为
:
\overrightarrow{r_s}=\frac{1}{K}\sum_{k=1}^K r_k

rs为k的部分皮尔森相关系数。
通过对参数s的选择,减少值的范围和较长的时间尺度上的相关性被过滤掉,只有在很短的时间尺度上的相关性被发现。因此,慢分量的贡献被删除,快分量被保留。

强噪声条件下
强噪声条件下,提取相关系数两个随机变量之间的是平凡的,特别是在典型相关分析报告在退化的相关值的情况下,由于存在大量噪声。一种概括的方法在其他地方给出。

相關條目

  • 安斯库姆四重奏
  • 相关 (概率论)
  • 斯皮尔曼等级相关系数(Spearman's rank correlation coefficient)

*
*

  • 圖模式
  • 马尔可夫链
  • 马尔可夫逻辑网络

註釋
参考文献
外部連結

Корреляция#Линейный коэффициент корреляции

评论 (0)

  • 还没有评论,来抢沙发吧。