正态分布

{{機率分佈
|name = 正态分布
|type = 密度
|pdf_image =
紅線代表標準常態分布
|cdf_image =
顏色與機率密度函數相同
|parameters =\mu数学期望(实数)
\sigma^2>0方差(实数)
|support =x \in (-\infty;+\infty)\!
|pdf = \frac1{\sigma\sqrt{2\pi}}\; \exp\left(-\frac{\left(x-\mu\right)^2}{2\sigma^2} \right) \!
|cdf = \frac12 \left(1 + \operatorname{erf} \frac{x-\mu}{\sigma\sqrt2}\right) \!
|mean = \mu
|median =\mu
|mode = \mu
|variance =\sigma^2
|skewness = 0
|kurtosis = 0
|entropy =\ln\left(\sigma\sqrt{2\,\pi\,e}\right)\!
|mgf = M_X(t)= \exp\left(\mu\,t+\sigma^2 \frac{t^2}{2}\right)
|char = \phi_X(t)=\exp\left(\mu\,i\,t-\frac{\sigma^2 t^2}{2}\right)
|notation=N(\mu, \sigma^2)}}

,物理学中通称高斯分佈(),是一個非常常見的連續機率分布。正态分布在统计学上十分重要,經常用在自然和社会科学來代表一個不明的隨機變量。

若隨機變數X服從一個平均数為\mu、标准差為\sigma的正态分布,则記為:
:X \sim N(\mu,\sigma^2),
則其機率密度函數為
f(x) = \frac1{\sigma\sqrt{2\pi}}\; e^{-\frac{\left(x-\mu\right)^2}{2\sigma^2} } \!

中心极限定理指出,在特定条件下,一个具有有限均值和方差的随机变量的多个样本(观察值)的平均值本身就是一个随机变量,其分布随着样本数量的增加而收敛于正态分布。因此,许多与独立过程总和有关的物理量,例如测量误差,通常可被近似为正态分布。

正态分布的機率密度函數曲線呈鐘形,因此人們又經常稱之為鐘形曲線(类似于寺庙里的大钟,因此得名)。我們通常所說的標準正态分布是位置參數\mu = 0,尺度參數\sigma^2 = 1的正态分布(見右圖中紅色曲線)。

概要
正态分布是自然科學與行為科學中的定量現象的一個方便模型。各種各樣的心理學測試分數和物理現象比如光子計數都被發現近似地服從正态分布。儘管這些現象的根本原因經常是未知的,理論上可以證明:如果把許多小作用加起來看做一個變量,那麼這個變量服從正态分布(在R.N.Bracewell的Fourier transform and its application中可以找到一種簡單的證明)。正态分布出現在許多區域統計:例如,採樣分布均值是近似正态分布的,即使被採樣的樣本的原始群體分布並不服從正态分布。另外,正态分布信息熵在所有的已知均值及方差的分布中最大,這使得它作為一種均值以及方差已知的分布的自然選擇。正态分布是在統計以及許多統計測試中最廣泛應用的一類分布。在概率論,正态分布是幾種連續以及離散分布的極限分布。

歷史
正态分布最早由棣莫弗于1733年在研究二项分布时提出,相关内容后收录于其著作《机会论》(1718年初版,后续版本增补)。當二項隨機變數的位置參數n很大及形狀參數 p 為 \frac{1}{2} 時,則所推導出二項分布的近似分布函數就是正态分布。拉普拉斯在1812年发表的《分析概率论》()中對棣莫佛的結論作了擴展到二項分布的位置參數為 n 及形狀參數為 1>p>0 時。現在这一结论通常被稱為棣莫佛-拉普拉斯定理。

拉普拉斯在誤差分析試驗中使用了正态分布。勒讓德於1805年引入最小二乘法這一重要方法;而高斯則宣稱他早在1794年就使用了該方法,並通過假設誤差服從常態分布給出了嚴格的證明。

将正态分布称作「鐘形曲線」的习惯可以追溯到Jouffret他在1872年首次提出此術語(Bell curve)用來指代二元常態分布。正态分布這個名字也在1875分别被查爾斯·皮爾士、法蘭西斯·高爾頓、威爾赫姆·萊克希斯獨立地使用。然而這個術語具有误导性,因為它反映和鼓勵了一種謬誤,即很多概率分布都是常態的。(請參考下面的「實例」)

這個分布被稱為「常態」或者「高斯」正好是史蒂格勒名字由來法則的一個例子,這個法則說「沒有科學發現是以它最初的發現者命名的」。

正态分布的定義
有幾種不同的方法用來說明一個隨機變量。最直觀的方法是概率密度函數,這種方法能表示隨機變量每個取值有多大的可能性。累積分布函數是一種概率上更加清楚的方法,請看下邊的例子。還有一些其他的等價方法,例如cumulant、特徵函數、動差生成函數以及cumulant-生成函數。這些方法中有一些對於理論工作非常有用,但是不夠直觀。請參考關於概率分布的討論。

機率密度函數
正态分布的概率密度函數均值為\mu 方差為\sigma^2 (或標準差\sigma)是高斯函數的一個實例:
:
f(x;\mu,\sigma)
=
\frac{1}{\sigma\sqrt{2\pi}} \, \exp \left( -\frac{(x- \mu)^2}{2\sigma^2} \right)。

(請看指數函數以及\pi.)

如果一個隨機變量X服從這個分布,我們寫作
X ~ N(\mu, \sigma^2).
如果\mu = 0並且\sigma = 1,這個分布被稱為標準正态分布,這個分布能夠簡化為

:f(x) = \frac{1}{\sqrt{2\pi}} \, \exp\left(-\frac{x^2}{2} \right)。

右邊是給出了不同參數的正态分布的函數圖。

正态分布中一些值得注意的量:

  • 密度函數關於平均值對稱
  • 平均值與它的眾數(statistical mode)以及中位數(median)同一數值。
  • 函數曲線下68.268949%的面積在平均數左右的一個標準差範圍內。
  • 95.449974%的面積在平均數左右兩個標準差2 \sigma的範圍內。
  • 99.730020%的面積在平均數左右三個標準差3 \sigma的範圍內。
  • 99.993666%的面積在平均數左右四個標準差4 \sigma的範圍內。
  • 函數曲線的拐點(inflection point)為離平均數一個標準差距離的位置。

累積分布函數
累積分布函數是指隨機變數X小於或等於x的機率,用機率密度函數表示為

:
F(x;\mu,\sigma)
=
\frac{1}{\sigma\sqrt{2\pi}}
\int_{-\infty}^x
\exp
\left( -\frac{(t - \mu)^2}{2\sigma^2}
\ \right)\, dt.

正态分布的累積分布函数能够由一個叫做误差函数的特殊函数表示:
:
\Phi(z)=
\frac12 \left[1 + \operatorname{erf}\left(\frac{z-\mu}{\sigma\sqrt2}\right)\right] .

標準正态分布的累積分布函數習慣上記為\Phi,它僅僅是指\mu=0,\sigma=1時的值,

:
\Phi(x)
F(x;0,1)
\frac{1}{\sqrt{2\pi}}
\int_{-\infty}^x
\exp\left(-\frac{t^2}{2}\right)
\, dt.

將一般正态分布用誤差函數表示的公式简化,可得:

:\Phi(z)
=
\frac{1}{2} \left[ 1 + \operatorname{erf} \left( \frac{z}{\sqrt{2}} \right) \right]
.

它的反函數被稱為反誤差函數,為:

:
\Phi^{-1}(p)
=
\sqrt2
\;
\operatorname{erf}^{-1} \left(2p - 1 \right)
.

該分位數函數有時也被稱為probit函數。probit函數已被證明沒有初等原函数。

正态分布的分布函數\Phi(x)沒有解析表達式,它的值可以通過數值積分、泰勒級數或者漸進序列近似得到。

生成函數
動差母函數
動差生成函數,或稱動差母函數被定義為\exp(tX)的期望值。

正态分布的動差產生函數如下:
:
可以通過在指數函數內配平方得到。

特徵函數
特徵函數被定義為\exp (i t X)的期望值,其中i是虛數單位。對於一個常态分布來講,特徵函數是:
:
把矩生成函數中的t換成i t就能得到特徵函數。

性質
常態分布的一些性質:

线性变换不变性:若X \sim N(\mu, \sigma^2) \,且a與b是實數,那麼aX+b\sim N(a\mu+b,a^2\sigma^2) (參見期望值和方差).

独立可加性:如果X\sim N(\mu_1,\sigma_1^2)與Y\sim N(\mu_2,\sigma_2^2)是統計獨立的常態隨機變量,那麼:

#* X+Y\sim N(\mu_1+\mu_2,\sigma_1^2+\sigma_2^2)
#* 特别地,若 X 与 Y 的方差相等,则U = X + Y与V = X - Y相互獨立。

如果X \sim N(0, \sigma^2_1)和Y \sim N(0, \sigma^2_2)是獨立常態隨機變量,那麼:

#* 它們的積X Y服從機率密度函數為p的分布
#*:p(z) = \frac{1}{\pi\,\sigma_1\,\sigma_2} \; K_0\left(\frac{\sigma_1\,\sigma_2}\right),其中K_0是修正貝塞爾函數(modified Bessel function)
#* 它們的比符合柯西分布,滿足X/Y \sim \mathrm{Cauchy}(0, \sigma_1/\sigma_2).

如果X_1, \cdots, X_n為獨立標準常態隨機變量,那麼X_1^2 + \cdots + X_n^2服從自由度為n的卡方分布,记作 X_1^2 + \cdots + X_n^2\ \sim\ \chi^2(n) \,。

標準化常態隨機變量
動差()
一些常態分布的一階動差如下:

標準常態的所有二階以上的累積量為零。

生成常態隨機變數
中央極限定理
的概率質量函數。]]

常態分布有一個非常重要的性質:在特定條件下,大量統計獨立的隨機變量的平均值的分布趨於正态分布,這就是中央極限定理。中央極限定理的重要意義在於,根據這一定理的結論,其他概率分布可以用正态分布作為近似。

  • 參數為n和p的二項分布,在n相當大而且p接近0.5時近似於正态分布(有的參考書建議僅在n p與n(1 - p)至少為5時才能使用這一近似)。

近似正态分布平均數為\mu = n p且方差為\sigma^2 = n p (1 - p).

  • 一泊松分布帶有參數\lambda當取樣樣本數很大時將近似正态分布\lambda.

近似正态分布平均數為\mu = \lambda且方差為\sigma^2 = \lambda.

這些近似值是否完全充分正確取決於使用者的使用需求

无穷可微性
正态分布是无穷可微的概率分布。

穩定性
正态分布是嚴格穩定的概率分布。

標準偏差
中,此範圍所佔比率為全部數值之68%,根據常態分布,兩個標準差之內的比率合起來為95%;三個標準差之內的比率合起來為99%。]]

在實際應用上,常考慮一組數據具有近似於常態分布的機率分布。若其假設正確,則約68.3%數值分布在距離平均值有1個標準差之內的範圍,約95.4%數值分布在距離平均值有2個標準差之內的範圍,以及約99.7%數值分布在距離平均值有3個標準差之內的範圍。稱為「68-95-99.7法則」或「經驗法則」。

相關分布

  • R \sim \mathrm{Rayleigh}(\sigma)是瑞利分布,如果R = \sqrt{X^2 + Y^2},这里 X \sim N(0, \sigma^2) 和Y \sim N(0, \sigma^2)是两个独立正态分布。
  • Y \sim \chi_{\nu}^2是卡方分布具有\nu自由度,如果Y = \sum_{k=1}^{\nu} X_k^2这里X_k \sim N(0,1)其中k=1,\dots,\nu是独立的。
  • Y \sim \mathrm{Cauchy}(\mu = 0, \theta = 1)是柯西分布,如果Y =\frac{X_1}{X_2},其中X_1 \sim N(0,1)并且X_2 \sim N(0,1)是两个独立的正态分布。
  • Y \sim \mbox{Log-N}(\mu, \sigma^2)是对数正态分布如果Y = e^X并且X \sim N(\mu, \sigma^2).
  • 与Lévy skew alpha-stable分布相关:如果X\sim \textrm{Levy-S}\alpha\textrm{S}(2,\beta,\frac{\sigma}{\sqrt{2}},\mu)因而X \sim N(\mu,\sigma^2).

估計
母數的最大概似估計
概念一般化
多元正态分布的協方差矩陣的估計的推導是比較難於理解的。它需要瞭解譜原理(spectral theorem)以及為什麼把一個標量看做一個1×1矩阵的迹(trace)而不僅僅是一個標量更合理的原因。請參考協方差矩陣的估計(estimation of covariance matrices)。
母數的動差估計
常見實例
光子計數
計量誤差
飲料裝填量不足與超量的機率
某飲料公司裝瓶流程嚴謹,每罐飲料裝填量符合平均600毫升,標準差3毫升的常態分配法則。隨機選取一罐,求(1)容量超過605毫升的機率;(2)容量小於590毫升的機率。

容量超過605毫升的機率 =p(X>605)=p(\frac{X-\mu}{\sigma}>\frac{605-600}{3})=p(Z>\frac{5}{3})=p(Z>1.67)=1-0.9525=0.0475

容量小於590毫升的機率=p(X

6-標準差(6-sigma或6-σ)的品質管制標準

6-標準差(6-sigma或6-σ),是製造業流行的品質管制標準。在這個標準之下,一個標準常態分配的變數值出現在正負三個標準差之外,只有2\times 0.0013= 0.0026 (p (Z 以及 p(Z > 3) = 0.0013)。也就是說,這種品質管制標準的產品不良率只有萬分之二十六。假設例中的飲料公司裝瓶流程採用這個標準,而每罐飲料裝填量符合平均600毫升,標準差3毫升的常態分配。那么預期裝填容量的範圍應該多少?

6-標準差的範圍=p(-3
因此,預期裝填容量應該介於591至609毫升之間。

生物標本的物理特性
金融變量
壽命
測試和智力分布
計算學生智商高低的機率
假設某校入學新生的智力測驗平均分數與标准差分別為100與12。那麼隨機抽取50個學生,他們智力測驗平均分數大於105的機率?小於90的機率?

本例沒有常態分配的假設,還好中央極限定理提供一個可行解,那就是當隨機樣本長度超過30,樣本平均數\bar{x}近似於一個常態變數,

因此標準常態變數Z=\frac{\bar{X}-\mu}{\frac{\sigma}{\sqrt{n}}}。

平均分數大於105的機率 P(Z>\frac{105-100}{\frac{12}{\sqrt{50}}}) =P(Z>\frac{5}{1.7}) =P(Z>2.94) =0.0016

平均分數小於90的機率 P(Z

计算统计应用
生成正态分布随机变量
在计算机模拟中,经常需要生成正态分布的数值。最基本的一个方法是使用标准的正态累积分布函数的反函数。除此之外还有其他更加高效的方法,Box-Muller变换就是其中之一。另一个更加快捷的方法是ziggurat算法。下面将介绍这两种方法。一个简单可行的并且容易编程的方法是:求12个在(0,1)上均匀分布的和,然后减6(12的一半)。这种方法可以用在很多应用中。这12个数的和是Irwin-Hall分布;选择一个方差12。这个随即推导的结果限制在(-6,6)之间,并且密度为12,是用11次多项式估计正态分布。

Box-Muller方法是以两组独立的随机数U和V,这两组数在(0,1]上均匀分布,用U和V生成两组独立的标准常态分布随机变量X和Y:

: X = \sqrt{- 2 \ln U} \, \cos(2 \pi V) ,

: Y = \sqrt{- 2 \ln U} \, \sin(2 \pi V)。
这个方程的提出是因为二自由度的卡方分布(见性质4)很容易由指数随机变量(方程中的lnU)生成。因而通过随机变量V可以选择一个均匀环绕圆圈的角度,用指数分布选择半径然后变换成(正态分布的)x,y坐标。

参考文献

外部链接

參見

  • 中心極限定理
  • 概率論
  • 伽玛分布
  • 多元常態分布

评论 (0)

  • 还没有评论,来抢沙发吧。