并不完美。]]
斯皮尔曼等级相关系数(简称等级相关系数,或称秩相关系数,或),在统计学中,常以希腊字母\rho(rho)或以r_s表示,這一相關係數以查尔斯·斯皮尔曼之名命名。它是衡量两个变量的相关性的無母數指标。它利用单调函数评价两个统计变量的相关性。若数据中没有重复值,且当两变量完全单调相关时,斯皮尔曼相关系数为+1或−1。
定义和计算
斯皮尔曼相关系数的定义为等级变量之间的皮尔逊相关系数。
对于样本容量为的样本,将个原始数据X_i, Y_i转换成等级数据\operatorname{R}({X_i}), \operatorname{R}({Y_i}),则相关系数r_s为
:
r_s =
\rho_{\operatorname{R}(X),\operatorname{R}(Y)} =
\frac{\operatorname{cov}(\operatorname{R}(X), \operatorname{R}(Y))}
{\sigma_{\operatorname{R}(X)} \sigma_{\operatorname{R}(Y)}},
其中
: \rho是皮尔逊积矩相关系数,但使用等级变量来计算,
: \operatorname{cov}(\operatorname{R}(X), \operatorname{R}(Y))为等级变量的协方差,
: \sigma_{\operatorname{R}(X)}和\sigma_{\operatorname{R}(Y)}为等级变量的标准差。
通常,对于数据中相同的值,其等级数等于它们按值升序排列的所处位置的平均值。如下表所示:
当所有的等级数值都为整数时,可以通过以下简单的步骤计算等级相关系数:
: r_s = 1 - \frac{6 \sum d_i^2}{n(n^2 - 1)},
其中
: d_i = \operatorname{R}(X_i) - \operatorname{R}(Y_i)为每组观测中两个变量的等级差值,
: n为观测数。
考虑一个双变量样本(x_i, y_i),\, i=1\dots, n,其相应的位次为(R(X_i), R(Y_i)) = (R_i, S_i)。则x,y的斯皮尔曼等级相关系数为:
:
r_{s} =
\frac{
\frac{1}{n}\sum_{i=1}^{n}R_{i}S_{i}
- \overline{R}\,\overline{S}
}{
\sqrt{\sigma_{R}}
\sqrt{\sigma_{S}}
},
其中:
\overline{R} = \textstyle\frac{1}{n}\textstyle\sum_{i=1}^{n}R_{i},
\overline{S} = \textstyle\frac{1}{n}\textstyle\sum_{i=1}^{n}S_{i},
\sigma_{R}^{2} = \textstyle\frac{1}{n}\textstyle\sum_{i=1}^{n}(R_{i} - \overline{R})^{2},
\sigma_{S}^{2} = \textstyle\frac{1}{n}\textstyle\sum_{i=1}^{n}(S_{i} - \overline{S})^{2},
若假定样本中两变量均没有重复数值,则r_{s}可只用d_{i} := R_{i} - S_{i}来给出。
在此假定下,R,S可视为随机变量,其分布类似于均匀分布随机变量,U,其自变量取值为\{1,2,\ldots,n\}。
因此
\overline{R}=\overline{S}=\mathbb{E}[U]
且
\sigma_{R}^{2}=\sigma_{S}^{2}=\mathrm{Var}(U)=\mathbb{E}[U^{2}]-\mathbb{E}[U]^{2},
其中
\mathbb{E}[U] = \textstyle\frac{1}{n}\textstyle\sum_{i=1}^{n} i = \textstyle\frac{(n+1)}{2},
\mathbb{E}[U^{2}] = \textstyle\frac{1}{n}\textstyle\sum_{i=1}^{n} i^{2} = \textstyle\frac{(n+1)(2n+1)}{6},
故有
\mathrm{Var}(U) = \textstyle\frac{(n+1)(2n+1)}{6} - \left(\textstyle\frac{(n+1)}{2}\right)^{2} = \textstyle\frac{n^{2}-1}{12}。
(这些求和可以用三角形數和四角錐數的公式来计算,也可以用离散数学的基本求和结果来计算。)
既然
:
\begin{align}
\frac{1}{n}\sum_{i=1}^{n}R_{i}S_{i}
- \overline{R}\overline{S}
&= \frac{1}{n}\sum_{i=1}^{n}\frac{1}{2}(R_{i}^{2} + S_{i}^{2} - d_{i}^{2})
- \overline{R}^{2}\\
&= \frac{1}{2}\frac{1}{n}\sum_{i=1}^{n}R_{i}^{2}
+
\frac{1}{2}\frac{1}{n}\sum_{i=1}^{n}S_{i}^{2}
- \frac{1}{2n}\sum_{i=1}^{n}d_{i}^{2}
- \overline{R}^{2}\\
&= (\frac{1}{n}\sum_{i=1}^{n}R_{i}^{2} - \overline{R}^{2})
- \frac{1}{2n}\sum_{i=1}^{n}d_{i}^{2}\\
&= \sigma_{R}^{2} - \frac{1}{2n}\sum_{i=1}^{n}d_{i}^{2}\\
&= \sigma_{R}\sigma_{S} - \frac{1}{2n}\sum_{i=1}^{n}d_{i}^{2}\\
\end{align}
则综上可得
:
r_s = \frac{
\sigma_{R}\sigma_{S} - \frac{1}{2n}\sum_{i=1}^{n}d_{i}^{2}
}{
\sigma_{R}\sigma_{S}
}
= 1 - \frac{
\sum_{i=1}^{n}d_{i}^{2}
}{
2n \cdot \frac{n^{2}-1}{12}
}
= 1 - \frac{
6\sum_{i=1}^{n}d_{i}^{2}
}{n(n^{2} - 1)}.
当数据中存在相等的数值时,使用该简化公式会得到错误结果:只有在两组变量中所有数值不重复时,才有\sigma_{\operatorname{R}(X)} \sigma_{\operatorname{R}(Y)} = \operatorname{Var}{(\operatorname{R}(X))} = \operatorname{Var}{(\operatorname{R}(Y))} = (n^2 - 1)/12(根据有偏方差计算)。第一个方程(通过标准差进行归一化)即使在排名标准化为[0, 1](“相对排名”)的情况下仍可使用,因为它对平移和线性缩放都不敏感。
对于截取的数据也不应使用简化公式。即,当希望计算前X条记录的等级相关系数时,应当使用前述的皮尔逊积矩相关系数公式。
相关度量
度量一对观测数据的统计相关性还有其他的几种度量指标。其中最常用的是皮尔逊积矩相关系数。
斯皮尔曼相关也可称为「级别相关」(grade correlation);也就是说, 被观测数据的「等级」被替换成 「级别」。在连续的分布中, 被观测数据的级别,通常总是小于等级的一半。然而,在这个案例中,级别和等级相关系数是一致的。更一般的, 被观测数据的「级别」 与估计的总体样本的比值小于给定的值,即被观测值的一半。也就是说,它是相应的等级系数的一种可能的解决方案。虽然不常用,「级别相关」还是仍然有被使用。
解释
斯皮尔曼相关系数表明(自变量)和(因变量)的相关方向。如果当增加时,趋向于增加,则斯皮尔曼相关系数为正。如果当增加时,趋向于减少,则斯皮尔曼相关系数为负。斯皮尔曼相关系数为0表明当增加时没有任何趋向性。当和越来越接近完全的单调相关时,斯皮尔曼相关系数会在绝对值上增加。当和完全单调相关时,斯皮尔曼相关系数的绝对值为1。完全的单调递增关系意味着对任意两对数据和,有和总是同号。完全的单调递减关系意味着对任意两对数据和,有和总是异号。
斯皮尔曼相关系数经常被称作“非参数”的,其中有两层含义。首先,当和的关系由任意单调函数描述时,则它们是完全皮尔逊相关的。与此相应的,皮尔逊相关系数只能给出由线性方程描述的和的相关性。其次,斯皮尔曼不需要先验知识(也就是说,知道其参数)便可以准确获取和的采样概率分布。
示例
在此例中,我们要使用下表所给出的原始数据计算一个人的智商和其每周看电视的小时数的相关性(数据为虚构)。
首先,我们必须根据以下步骤计算出d^2_i,如下表所示。
排列第一列数据(X_i)。创建新列 x_i 并赋以等级值1、2、3......n。
然后,排列第二列数据(Y_i)。创建第四列 y_i 并相似地赋以等级值1、2、3......n。
创建第五列d_i,填入两个等级列(x_i和y_i)的差值。
创建最后一列d^2_i填入d_i的平方。
根据d^2_i计算\sum d_i^2 = 194。样本容量为10。将这些值带入方程
: \rho = 1- {\frac {6\times194}{10(10^2 - 1)}}
得ρ = −0.175757575...,p-value = 0.627188(使用t分布)
该数值接近0,表明尽管看电视时间和智商似乎呈负相关,但两个变量之间的关系很弱。在原始数据中存在相同数值的情况下,不应使用此公式,而应当用排名计算皮尔逊相关系数(如上文所述)。
显著性的确定
一种确定被观测数据的值是否显著不为零(总是有)的方法是计算它是否大于的概率,作为零假设,并使用排列检验。这种方法的优势在于它考虑了样本中的重复出现的数据个数,以及在计算等级相关性时处理它们的方式。
另一种方法是使用皮尔逊积矩中使用到的费雪变换。也就是,的置信区间和假說檢定可以通过费雪变换获得
: F(r) = {1 \over 2}\ln{1+r \over 1-r} = \operatorname{arctanh}(r).
如果是的费雪变换,则
:z = \sqrt{\frac{n-3}{1.06}}F(r)
是的z-值,其中,在统计独立性()的零假设下近似服从标准正态分布。
显著性为
:t = r \sqrt{\frac{n-2}{1-r^2}}
其在零假设下近似服从自由度为的t分布。A justification for this result relies on a permutation argument.
一般地,斯皮尔曼相关系数在有三个或更多条件的情况下是有用的。并且,它预测观测数据有一个特定的顺序。例如,在同一任务中,一系列的个体会被尝试多次,并预测在多次尝试过程中,性能会得到提升。在这种情况下,对条件间趋势的显著性检验由E. B. Page发展了,并通常称为给定序列下的Page趋势检验。
基于斯皮尔曼相关系数的一致性分析
经典的是一种统计方法,它给两个标称变量赋给一个分数。通过这种方法,两个变量间的皮尔逊相关系数被最大化了。
有一种被称为级别相关分析的等价方法,它能够最大化斯皮尔曼相关系数或。
参见
*
*
- 切比雪夫總和不等式、排序不等式
- 皮尔逊积矩相关系数
- 圖模式
- 马尔可夫链
- 马尔可夫逻辑网络
参考文献
- G.W. Corder, D.I. Foreman, "Nonparametric Statistics for Non-Statisticians: A Step-by-Step Approach", Wiley (2009)
- C. Spearman, "The proof and measurement of association between two things" Amer. J. Psychol., 15 (1904) pp. 72–101
- M.G. Kendall, "Rank correlation methods", Griffin (1962)
- M. Hollander, D.A. Wolfe, "Nonparametric statistical methods", Wiley (1973)
- J. C. Caruso, N. Cliff, "Empirical Size, Coverage, and Power of Confidence Intervals for Spearman's Rho", Ed. and Psy. Meas., 57 (1997) pp. 637–654
外部链接
- [http://www.crystalballservices.com/Resources/ConsultantsCornerBlog/EntryId/73/Copulas-Vs-Correlation.aspx "Understanding Correlation vs. Copulas in Excel"] by Eric Torkia, Technology Partnerz 2011
*[http://www.sussex.ac.uk/Users/grahamh/RM1web/Rhotable.htm Table of critical values of ρ for significance with small samples]
*[http://statistics.laerd.com/calculators/spearmans-rank-order-correlation-calculator.php A calculator that shows the working out for Spearman's correlation]
*[http://www.maccery.com/maths Spearman's rank online calculator]
*[https://web.archive.org/web/20120420220419/http://faculty.vassar.edu/lowry/webtext.html Chapter 3 part 1 shows the formula to be used when there are ties]
[http://udel.edu/~mcdonald/statspearman.html Spearman's rank correlation] : Simple notes for students with an example of usage by biologists and a spreadsheet for Microsoft Excel for calculating it (a part of materials for a Research Methods in Biology* course).
评论 (0)