戴尔指数

戴尔指数()又稱為泰爾指數,是一个衡量经济不平等的统计量。它也曾經用來衡量其他社會不平等現象,如種族隔離。

戴尔指数主要是利用資訊理論中的資訊熵的概念導出的。戴尔指数等於資訊冗餘,也就是資料最大可能資訊熵減去觀測到的資訊熵,它是的特例,可以被視為冗餘度、單樣性、不平等、非隨機性和可壓縮性的度量。:
:
T_T=T_{\alpha=1} = \frac{1}{N}\sum_{i=1}^N \frac{x_i}{\mu} \ln\left(\frac{x_i}{\mu} \right)

而戴爾指數L則定義為
:
T_L = T_{\alpha=0}=\frac{1}{N}\sum_{i=1}^N \ln\left(\frac{\mu}{x_i}\right)

其中x_i为第i个人的收入,{\mu}为平均收入,N为人口数量。加总符号中的第一项可以理解为个人在总收入中所占的比例,第二项为该个人相对于均值的收入。

如果收入分布是個離散分布函數 fk (k = 0,...,W),其中fk是收入為k的人口比例,而W = 代表總收入,可以得知 \sum_{k=0}^W f_k=1 。
它的戴爾指數T定義為:
:
T_T=\sum_{k=0}^W\, f_k\, \frac k \mu \ln\left(\frac k \mu \right)

這裡的\mu一樣是收入平均
:
\mu=\sum_{k=0}^W k f_k

其中應注意到收入k是一個整數,k=1代表最小收入增量(比如新台幣1元)。

如果收入分布是個連續分布函數f(k),k取值0到無窮,其中f(kdk 是收入為kk + dk的人口數量,那戴爾指數T定義為:

:T_T=\int_0^\infty f(k) \frac k \mu \ln\left(\frac k \mu \right) dk

其中平均\mu為:

:
\mu=\int_0^\infty k f(k) \, dk

一些常見連續概率分佈的戴尔指數如下表所示:

:

如果每一个人都有相同的收入,即等于均值,则指数为零。如果某个个人拥有所有的收入,则指数为\ln{N}。TT 除以\ln N 可以將方程歸一化到0到1的範圍,但這樣違反: T[x\cup x]\ne T[x]並不符合衡量不平等的標準。

信息論推導
戴尔指数导自克勞德·夏農的信息熵,他的一般數學形式為:

:S = k \sum_{i=1}^N \left( p_i \log{\frac{1}{p_i}} \right) = - k \sum_{i=1}^N \left( p_i \log{p_i} \right)

其中 p_i是從人群裡找到i的機率。k是玻爾茲曼常數。在信息論中,當信息以二進制數字給出時,k=1並且對數基底為2。在物理學和戴爾指數的計算中,選擇自然對數作為對數基底。當p_i替換成人均收入x_i時,需要除以總收入達到歸一化N\overline{x}。那可以導出,觀察到的信息熵為:

: S_\text{Theil} = \sum_{i=1}^N \left( \frac{x_i}{N \overline{x}} \ln{\frac{N \overline{x}}{x_i}} \right)

设T为戴尔指数,S为夏農熵,则有

T=\ln(N)-S

其中,ln(N)是理論最大熵。香濃根据事件发生概率导出的其熵测度。它可以用戴尔系数解释为自某个特定个人处随机取得一块钱的概率。并与其第一项,即总收入中个人所占份额相同。

可分解性
戴尔指数的一个优点是它是某个子群体中不平等的加权和。例如,美国国内的不平等就是每个州的不平等的加权和,由该州收入相对于国家总收入的比值来加权。

如果人口被划分为m个子群体,s_k 为群体k 的收入比例,T_k为该子群体的戴尔指数,而 \overline{x}_k 为子群体 k的平均收入,则戴尔指数为

:
T = \sum_{k=1}^m s_k T_{T_k} + \sum_{k=1}^m s_k \ln{\frac{\overline{x}_k}{\overline{x}}}

因此,我们可以说某个特定群体给总体“贡献了”一定数量的不平等。

另外一个被广泛使用的不平等度量为基尼系数,该系数对于很多人来说由于基于劳伦茨曲线而非常直观。但是它却没有戴尔指数容易分解。

參考文獻
外部連結
*[http://utip.gov.utexas.edu/papers/utip_14.pdf 德克萨斯大学戴尔指数简介] (英文)
*試算表: 收入不平等指标#电子表格计算

评论 (0)

  • 还没有评论,来抢沙发吧。