二項式分布

{{Infobox 機率分佈
| name = 二項分布
| type = 質量
| pdf_image =
| cdf_image =
| notation = \operatorname{B} (n, p)
| parameters = n > 0
0 \leq p \leq 1
| support = k \in \{0, \dots, n\}
| pdf = {n \choose k} p^k (1 - p)^{n - k}
| cdf = I_{1 - p}(n - \lfloor k \rfloor, \lfloor k \rfloor + 1)
| mean = np
| median = \lfloor np \rfloor或\lceil np \rceil
| mode = \lfloor (n + 1)p \rfloor
| variance = np(1 - p)
| skewness = \frac {1 - 2p} {\sqrt {np(1 - p)}}
| kurtosis = \frac {1 - 6p(1 - p)} {np(1 - p)}
| entropy = \frac{1}{2} \ln \left( 2 \pi nep (1-p) \right) + O \left( \frac{1}{n} \right)
| pgf = (1 - p + pz)^n
| mgf = (1 - p + pe^t)^n
| char = (1 - p + pe^{it})^n
}}

在概率论和统计学中,二项分布()是一种离散概率分布,描述在进行独立随机试验时,每次试验都有相同概率“成功”的情况下,获得成功的总次数。掷硬币十次出现五次正面的概率、产品合格率\, 99 \% \,时抽出一百件样本没有发现一件次品的概率等等,都可以由二项分布给出。

只有“成功”和“失败”两种可能结果,每次重复时成功概率不变的独立随机试验称作伯努利试验,例如上述的掷硬币出现正面或反面、对产品进行抽样检查时抽到正品或次品。伯努利试验作为理论模型,其前提在现实中无法完全得到满足,比如生产线会磨损,因此每件产品合格的概率并非固定。尽管如此,二项分布给出的概率通常足以用于提供有用的推断;即使在已知前提没有满足的场合,二项分布也能用于参考和比较。二项分布的应用出现在遗传学、质量控制等领域之中。

定义
若随机变量\, X \,有概率质量函数
:\Pr(X = k) = {n \choose k} p^k (1 - p)^{n - k} \quad (k = 0, 1, \ldots, n),
其中\, n \,为正整数、\, 0 \leq p \leq 1 \,,则称\, X \,服从参数为\, n, p \,的二项分布,记为\, X \sim \operatorname{B} (n, p) \,或\, X \sim \operatorname{Bin} (n, p) \,。习惯上\, 1 - p \,也用\, q \,表示。

推导
进行\, n \,次独立伯努利试验的结果可以由\, n \,个字母表示,例如用\, S \,表示成功,\, F \,表示失败,则
:SSFSF
表示五次试验中第一、二、四次的结果为成功,其余为失败。设每次试验成功的概率为\, p \,,失败的概率为\, 1 - p \,。因为试验相互独立,每一种排列\, k \,个\, S \,、\, n - k \,个\, F \,的方式对应的概率为\, p^k (1 - p)^{n - k} \,。

从\, n \,个不同元素中选出含\, k \,个元素的子集的方法数量等于二项式系数
:{n \choose k} = \frac {n!} {k! (n-k)!}.
而每种对\, k \,个\, S \,、\, n - k \,个\, F \,的排列都可理解为从\, n \,个位置中选出\, k \,个作为字母\, S \,的位置的方法,这种方法的数量即为\, {n \choose k} \,。与每种排列方式对应的概率相乘,便得到定义中的概率
:{n \choose k} p^k (1 - p)^{n - k}.

历史
二项分布是最早得到研究的概率分布之一。丹麦统计学家安德斯·哈爾德认为其历史可以追溯至布莱兹·帕斯卡与皮埃尔·德·费马于1654年对点数分配问题的讨论:两名玩家赢得每局游戏的机会相同,赢得一定局数的胜者可获得奖金,但比赛仅进行了数局,尚未分出胜负就被迫中断,则奖金该如何分配?帕斯卡认为,奖金的分配应当基于玩家距离胜利所差的局数:若一名玩家还需\, r \,局获胜,另一名玩家还需\, s \,局获胜,则应考虑在\, r + s - 1 \,局比赛的\, 2^{r + s - 1} \,种结果中,两名玩家分别在多少种情况中获胜。两人的讨论限于这一问题本身,并未推导出二项分布的概率,但这一解法可被视作基于参数\, p = 1/2 \,的二项分布。

对二项分布概率的推导为雅各布·伯努利于《》中作出。该著作在他去世后,于1713年得到出版,被视作概率论的奠基性作品。伯努利还在其中首次给出了弱大数定律的严格证明。对二项分布的正态近似则是由亞伯拉罕·棣莫弗发现,这一工作于1733年完成,于1738年出版在其著作《》的第二版中。

性质
参数为\, n, p \,的二项分布的期望值为\, np \,,方差为\, np(1 - p) \,。其概率母函数为
:G(z) = (1 - p + pz)^n,
矩母函数为
:M_X(t) = (1 - p + pe^t)^n,
特征函数为
:\varphi_X(t) = (1 - p + pe^{it})^n.

参数\, n = 1 \,的二项分布称作伯努利分布。是二项分布的拓展,描述重复进行不限于两种结果、可能有多种可能结果的随机试验时的概率。二项分布本身是超几何分布的极限形式。

二项分布的和
若\, X_1, X_2 \,两个随机变量独立,分别服从参数为\, n_1, p \,和\, n_2, p \,的二项分布,则\, X_1 + X_2 \,即是在\, n_1 + n_2 \,次独立伯努利试验中取得成功的次数,所以\, X_1 + X_2 \,服从参数为\, n_1 + n_2,p \,的二项分布。这一结论亦可通过将两者的概率母函数相乘而得出。在条件\, X_1 + X_2 = k \,之下,随机变量\, X_1 \,的条件概率分布是参数为\, k, n_1, n_1 + n_2 \,的超几何分布。

众数
计算\, \Pr(X = k) \,和\, \Pr(X = k + 1) \,的比值可以得到
:\frac{\Pr(X = k + 1)}{\Pr(X = k)} = \frac{(n - k)p}{(k + 1)(1 - p)} \quad (k = 0, 1, \ldots, n - 1),
因此,当\, k 时,\, \Pr(X = k) \,随\, k \,增加而上升;当\, k > (n + 1)p - 1 \,时,\, \Pr(X = k) \,随\, k \,增加而下降。故二项分布的众数为\, (n + 1)p \,的下取整\, \lfloor (n + 1)p \rfloor \,。若\, (n + 1)p \,本身是整数,则\, (n + 1)p \,和\, (n + 1)p - 1 \,均是众数。若\, p ,则众数为\, 0 \,。

中位数
二项分布的中位数\, m \,位于\, np \,的上下取整之间,即\, \lfloor np \rfloor \leq m \leq \lceil np \rceil \,;若\, np \,为整数,则中位数\, m = np \,。中位数\, m \,和期望值\, np \,之间的差满足
:|m - np|
若\, p > \ln 2 \,或\, p ,则该上界可进一步缩减为
:|m - np|
若\, n \,为奇数、\, p = 1/2 \,,则\, (n - 1)/2 \,和\, (n + 1)/2 \,均为中位数。

累积分布函数
二项分布的累积分布函数和尾概率可以用正则化不完全贝塔函数表示为
:\Pr(X \leq k) = I_{1 - p} (n - \lfloor k \rfloor, \lfloor k \rfloor + 1),
:\Pr(X \geq k) = I_p (\lceil k \rceil, n - \lceil k \rceil + 1).


二项分布的\, r \,阶原点矩满足
:\mu'_r = E[X^r] = \sum_{j = 0}^r \frac {S(r,j) n! p^j} {(n-j)!},
其中\, S(r,j) \,表示斯特林数。具体而言,
:\mu'_1 = np,
:\mu'_2 = np + n(n - 1)p^2,
:\mu'_3 = np + 3n(n - 1)p^2 + n(n - 1)(n - 2)p^3,
:\mu'_4 = np + 7n(n - 1)p^2 + 6n(n - 1)(n - 2)p^3 + n(n - 1)(n - 2)(n - 3)p^4.
其低阶中心矩为
:\mu_2 = np(1 - p),
:\mu_3 = np(1 - p) (1 - 2p),
:\mu_4 = 3[np(1 - p)]^2 + np(1 - p)[1 - 6p(1 - p)].

近似
正态近似
及其正态近似]]

标准二项分布
:X' = \frac {X - np} {\sqrt {np(1 - p)}}
在\, n \to \infty \,时趋近于标准正态分布。这一结果称作,为中心极限定理的特殊形式。基于这一定理可以得到
:\Pr(\alpha
其中\, \Phi \,为标准正态分布的累积分布函数。

正态分布为连续概率分布,在近似二项分布这类离散概率分布时,可将端点向外偏移\, 0.5 \,得到
:\Pr(X \leq k) \approx \Phi \left( \frac {k + 0.5 - np} {\sqrt {np(1 - p)}}\right),
从而提升近似的准确性,这种技巧称作。何时能采用这一近似依赖于使用经验法则,例如要求\, np(1 - p) > 9 \,,或是在\, p \leq 0.5 \,时要求\, np > 5 \,、在\, p > 0.5 \,时要求\, n(1 - p) > 5 \,。

泊松近似
当\, n \to \infty, p \to 0 \,,而\, np \,保持不变时,二项分布趋近于参数为\, np \,的泊松分布。以此为基础可以得到
:\Pr(X \leq k) \approx e^{-np} \sum_{j = 0}^k \frac {(np)^j} {j!}.

二项分布与其泊松近似之间的绝对误差存在上界。若随机变量\, X \,服从参数为\, n, p \,的二项分布,随机变量\, Y \,服从参数为\, np \,的泊松分布,则
:\sum_{k = 0}^{\infty} \| \Pr(X = k) - \Pr(Y = k) \| \leq \min \{ 2np^2, 3p \}.

参数估计
点估计
通常参数\, n \,为已知。假设随机变量\, X \,服从二项分布,其参数\, p \,未知。若观测到\, X \,的值为\, x \,,采用矩估计和最大似然估计对参数\, p \,的估计量均为\, \frac {x} {n} \,,这一估计量为无偏的。

参数\, p \,的取决于使用的先验分布。若使用连续型均匀分布作为先验分布,即假设\, 0 \,和\, 1 \,之间任意等长的区间包含\, p \,的概率都相同,则后验均值估计量为
:\widehat {p} = \frac {x + 1} {n + 2}.
这被称作,曾被皮埃尔-西蒙·拉普拉斯用于估计在太阳连续升起\, n \,天之后,太阳明天还会升起的概率。由于人类知道太阳在过去五千年,即1,826,213天都正常升起,拉普拉斯愿意以1,826,214比1的赔率赌太阳明天继续升起。

若使用参数为\, \alpha,\beta \,的贝塔分布作为先验分布,则后验均值估计量为
:\widehat {p} = \frac {\alpha + x + 1} {\alpha + \beta + n + 2}.
采用贝塔分布作为先验分布时,后验分布亦是贝塔分布,即贝塔分布为二项分布的共轭先验。

区间估计
若要对参数\, p \,以区间形式给出估计,通过求解
:\sum_{j = x}^n {n \choose j} p_L^j (1 - p_L)^{n - j} = \frac {\alpha} {2},
:\sum_{j = 0}^x {n \choose j} p_U^j (1 - p_U)^{n - j} = \frac {\alpha} {2},
所得的区间\, (p_L, p_U) \,为一个置信水平近似为\, 1 - \alpha \,的置信区间,称作克洛珀-皮尔逊区间()。

正态分布可以用于推导近似的置信区间。若用\, \lambda_{\alpha/2} \,表示标准正态分布的第\, 1 - \frac {\alpha} {2} \,分位数,即\, \Phi (\lambda_{\alpha/2}) = 1 - \frac {\alpha} {2} \,,则区间两端的近似值为
:\frac {x} {n} \pm \frac {\lambda_{\alpha/2}} {\sqrt n} \sqrt{\frac {x} {n} \left(1 - \frac {x} {n}\right)}.

参见

  • 概率论
  • 機率分布
  • 正态分布
  • 卜瓦松分布
  • 伯努利分布
  • 负二项分布

*

注释
参考文献
*
*
*
*
*
*
*
*
*
*

评论 (0)

  • 还没有评论,来抢沙发吧。