卜瓦松分布

{{機率分佈
| name = 泊松分布
| type = 質量
| pdf_image =
横轴是索引k,发生次数。该函数只定义在k为整数的时候。连接线是只为了指导视觉。
| cdf_image =
横轴是索引k,发生次数。CDF在整数k处不连续,且在其他任何地方都是水平的,因为服从泊松分布的变量只针对整数值。
| parameters = λ > 0(实数)
| support = k \in \{0, 1, 2, 3, \cdots\}
| pdf = \frac{\lambda^k}{k!} e^{-\lambda}
| cdf = \frac{\Gamma(\lfloor k+1\rfloor, \lambda)}{\lfloor k\rfloor !},或e^{-\lambda} \sum_{i=0}^{\lfloor k\rfloor} \frac{\lambda^i}{i!}\ ,或Q(\lfloor k+1\rfloor,\lambda)
(对于k\ge 0,其中\Gamma(x, y)是不完全Γ函数,\lfloor k\rfloor是高斯符号,Q是规则化Γ函数)
| mean = \lambda
| median = \approx\lfloor\lambda+1/3-0.02/\lambda\rfloor
| mode =
| variance = \lambda
| skewness = \lambda^{-1/2}
| kurtosis = \lambda^{-1}
| entropy = \lambda[1 - \log(\lambda)] + e^{-\lambda}\sum_{k=0}^\infty \frac{\lambda^k\log(k!)}{k!}
(假设\lambda较大)
\frac{1}{2}\log(2 \pi e \lambda) - \frac{1}{12 \lambda} - \frac{1}{24 \lambda^2} -
\qquad \frac{19}{360 \lambda^3} + O\left(\frac{1}{\lambda^4}\right)
| pgf = \exp(\lambda(z - 1))
| mgf = \exp(\lambda (e^{t} - 1))
| char = \exp(\lambda (e^{it} - 1))
}}

泊松分布(;)又稱Poisson分布-{zh-cn:帕松; zh-tw:泊松; zh-hk:帕松;}-分布布瓦松分布布阿松分布普阿松分布波以松分布卜氏分布帕松小數法則(Poisson law of small numbers),是一種統計與概率學裡常見到的離散機率分布,由法國數學家西莫恩·德尼·泊松在1838年時發表。

泊松分布适合于描述单位时间内随机事件发生的次数的概率分布。如某一服务设施在一定时间内受到的服务请求的次数,电话交换机接到呼叫的次数、汽车站台的候客人数、机器出现的故障数、自然灾害发生的次数、DNA序列的变异数、放射性原子核的衰变数、雷射的光子數分布等等。(單位時間內發生的次數,可以看作事件發生的頻率,類似物理的頻率f)。

泊松分布的機率質量函数为:
: P(X=k)=\frac{e^{-\lambda}\lambda^k}{k!}

泊松分布的参数\lambda是随机事件发生次数的数学期望值。

记号
若X服从参数为\lambda的泊松分布,记为X \sim \pi(\lambda),或记为X \sim \text{Poisson}(\lambda).

假设
如果以下假设成立,则适用泊松分布:

k是一个非负整数,是某个事件在某个时间间隔内发生的次数。

一个事件的发生不会影响第二个事件的概率。

事件发生的平均速率与任何事件的发生无关。

两个事件不可能在同一时刻发生。

如果这些条件成立,则k是泊松随机变量;k的分布是泊松分布。

性质

服从泊松分布的随机变量,其数学期望与方差相等,同为参数\lambda : E(X) = V(X)= \lambda

兩個獨立且服从泊松分布的随机变量,其和仍然服从泊松分布。更精確地說,若 X \sim \text{Poisson}(\lambda_1)且 Y \sim \text{Poisson}(\lambda_2),則X+Y \sim \text{Poisson}(\lambda_1+\lambda_2)。反過來若兩個獨立隨機變量的和服從卜瓦松分布,則這兩個隨機變量經平移後皆服從卜瓦松分布()。

其動差母函數为:

:M_X(t)=E[e^{tX}]=\sum_{x=0}^\infty e^{tx}\frac{e^{-\lambda}\lambda^x}{x!}=e^{-\lambda}\sum_{x=0}^\infty\frac{({e^t}\lambda)^x}{x!}=e^{{\lambda}(e^t-1)}

推導
期望值:(倒數第三至第二是使用泰勒展開式)

\begin{align}
\Epsilon(X) & =\sum_{i=0}^\infty \displaystyle i P(X = i) \\
& = \sum_{i=1}^\infty \displaystyle i {e^{-\lambda} \lambda^i \over i!} \\
& = \lambda e^{-\lambda} \sum_{i=1}^\infty \displaystyle {\lambda^{i-1} \over (i-1)!} \\
& = \lambda e^{-\lambda} \sum_{i=0}^\infty \displaystyle {\lambda^i \over i!} \\
& = \lambda e^{-\lambda} e^{\lambda} \\
& = \lambda
\end{align}

\begin{align}
\Epsilon(X^2) & =\sum_{i=0}^\infty \displaystyle i^2 P(X = i) \\
& = \sum_{i=1}^\infty \displaystyle i^2 {e^{-\lambda} \lambda^i \over i!}\\
& = \lambda e^{-\lambda} \sum_{i=1}^\infty \displaystyle {i \lambda^{i-1} \over (i-1)!}\\
& = \lambda e^{-\lambda} \sum_{i=1}^\infty \displaystyle {1 \over (i-1)!} {d \over d \lambda}(\lambda ^ i)\\
& = \lambda e^ {- \lambda}{d \over d \lambda}\left[\sum_{i=1}^\infty \displaystyle {\lambda^i \over (i-1)!}\right]\\
& = \lambda e^ {- \lambda}{d \over d \lambda}\left[\lambda \sum_{i=1}^\infty \displaystyle {\lambda^{i-1} \over (i-1)!}\right]\\
& = \lambda e^ {- \lambda}{d \over d \lambda} (\lambda e^{\lambda}) = \lambda e^ {- \lambda} (e^ {\lambda} + \lambda e ^{\lambda}) = \lambda + \lambda^2
\end{align}

我們可以得到:Var(X) = (\lambda + \lambda ^2) - \lambda ^2 = \lambda

如同性質:E(X) = Var(X) = \lambda、\sigma_X = \sqrt{\lambda}

相互獨立的卜瓦松分佈隨機變數之和仍服從卜瓦松分佈:

X\sim \text{Poisson}(\lambda_1), Y\sim \text{Poisson}(\lambda_2).

P(X=k_1)=\dfrac{\lambda_1^{k_1}e^{-\lambda_1}}{k_1!}, P(Y=k_2)=\dfrac{\lambda_2^{k_2}e^{-\lambda_2}}{k_2!}.

\begin{align}
P(X+Y=k) & = \sum_{i=0}^k P(X=i)P(Y=k-i) \\
& = \sum_{i=0}^k \frac{\lambda_1^i \lambda_2^{k-i}e^{-(\lambda_1+\lambda_2)}}{i! (k-i)!}\\
& = \frac{e^{-(\lambda_1+\lambda_2)}}{k!} \sum_{i=0}^k C_k^i \lambda_1^i \lambda_2^{k-i}\\
& = \frac{e^{-(\lambda_1+\lambda_2)}(\lambda_1+\lambda_2)^k}{k!}
\end{align}

X+Y\sim \text{Poisson}(\lambda_1+\lambda_2)

泊松分布的来源(泊松小数定律)
在二项分布的伯努利试验中,如果试验次数n很大,二项分布的概率p很小,且乘积\lambda= np比较适中,则事件出现的次数的概率可以用泊松分布来逼近。事实上,二项分布可以看作泊松分布在离散時間上的对应物。

证明如下。首先,回顾自然對數e的定义:
:\lim_{n\to\infty}\left(1-{\lambda \over n}\right)^n=e^{-\lambda},

二项分布的定义:
:P(X=k)={n \choose k} p^k (1-p)^{n-k}。

如果令p = \frac{\lambda}{n}, n趋于无穷时P的极限:

:
\begin{align}

\lim_{n\to\infty} P(X=k)&=\lim_{n\to\infty}{n \choose k} p^k (1-p)^{n-k} \\
&=\lim_{n\to\infty}{n! \over (n-k)!k!} \left({\lambda \over n}\right)^k \left(1-{\lambda\over n}\right)^{n-k}\\
&=\lim_{n\to\infty}
\underbrace{\left[\frac{n!}{n^k\left(n-k\right)!}\right]}_F
\left(\frac{\lambda^k}{k!}\right)
\underbrace{\left(1-\frac{\lambda}{n}\right)^n}_{\to\exp\left(-\lambda\right)}
\underbrace{\left(1-\frac{\lambda}{n}\right)^{-k}}_{\to 1} \\
&= \lim_{n\to\infty}
\underbrace{\left[ \left(1-\frac{1}{n}\right)\left(1-\frac{2}{n}\right) \ldots \left(1-\frac{k-1}{n}\right) \right]}_{\to 1}
\left(\frac{\lambda^k}{k!}\right)
\underbrace{\left(1-\frac{\lambda}{n}\right)^n}_{\to\exp\left(-\lambda\right)}
\underbrace{\left(1-\frac{\lambda}{n}\right)^{-k}}_{\to 1} \\
&= \left(\frac{\lambda^k}{k!}\right)\exp\left(-\lambda\right)
\end{align}

最大似然估計(MLE)
给定n个样本值k_i,希望得到从中推测出总体的泊松分布参数\lambda的估计。为计算最大似然估计值,列出对数似然函数:
:
\begin{align}
L(\lambda) & = \ln \prod_{i=1}^n f(k_i \mid \lambda) \\
& = \sum_{i=1}^n \ln\!\left(\frac{e^{-\lambda}\lambda^{k_i}}{k_i!}\right) \\
& = -n\lambda + \left(\sum_{i=1}^n k_i\right) \ln(\lambda) - \sum_{i=1}^n \ln(k_i!). \end{align}

:\frac{\mathrm{d}}{\mathrm{d}\lambda} L(\lambda) = 0
\iff -n + \left(\sum_{i=1}^n k_i\right) \frac{1}{\lambda} = 0. \!

解得λ从而得到一个驻点(stationary point):
:\widehat{\lambda}_\mathrm{MLE}=\frac{1}{n}\sum_{i=1}^n k_i. \!

检查函数L的二阶导数,发现对所有的\lambda与k_i大于零的情况二阶导数都为负。因此求得的驻点是对数似然函数L的极大值点:
:\frac{\partial^2 L}{\partial \lambda^2} = \sum_{i=1}^n -\lambda^{-2} k_i

例子
对某公共汽车站的客流做调查,统计了某天上午10:30到11:47来到候车的乘客情况。假定来到候车的乘客各批(每批可以是1人也可以是多人)是互相独立发生的。观察每20秒区间来到候车的乘客批次,共观察77分钟*3=231次,共得到230个观察记录。其中来到0批、1批、2批、3批、4批及4批以上的观察记录分别是100次、81次、34次、9次、6次。使用极大似真估计(MLE),得到\lambda的估计为\frac{81\times 1+34\times 2+9\times 3+6\times 4}{230}\approx 0.87。

生成泊松分布的随机变量
一个用来生成随机泊松分布的数字(伪随机数抽样)的简单算法,已经由高德纳给出(见下文参考):

algorithm poisson random number (Knuth):
init:
Let L ← e−λ, k ← 0 and p ← 1.
do:
k ← k + 1.
Generate uniform random number u in [0,1] and let p ← p×u.
while p > L.
return k − 1.

尽管简单,但复杂度是线性的,在返回的值k,平均是\lambda。还有许多其他算法来克服这一点。有些人由Ahrens和Dieter给出,请参阅下面的参考资料。同样,对于较大的\lambda值,e^{-\lambda}可能导致数值稳定性问题。对于较大\lambda值的一种解决方案是拒绝采样,另一种是采用泊松分布的高斯近似。

对于很小的\lambda值,逆变换取样简单而且高效,每个样本只需要一个均匀随机数u。直到有超过u的样本,才需要检查累积概率。

algorithm Poisson generator based upon the inversion by sequential search:
init:
Let x ← 0, p ← e−λ, s ← p.
Generate uniform random number u in [0,1].
do:
x ← x + 1.
p ← p * λ / x.
s ← s + p.
while u > s.
return x.

参见

  • 泊松过程
  • 概率论
  • 泊松回归

*概率分布

参考文献
引用
来源
*
*
*
*
*

评论 (0)

  • 还没有评论,来抢沙发吧。