狄利克雷分布

{{Probability distribution |
name =狄利克雷分布|
type =密度|
pdf_image =||
cdf_image =|
parameters =K \geq 2 分类数 (整数)
\alpha_1, \ldots, \alpha_K concentration parameters,\alpha_i > 0|
support =x_1, \ldots, x_K,x_i \in (0,1),\sum_{i=1}^K x_i = 1|
pdf =\frac{1}{\mathrm{B}(\boldsymbol\alpha)} \prod_{i=1}^K x_i^{\alpha_i - 1}
\mathrm{B}(\boldsymbol\alpha) = \frac{\prod_{i=1}^K \Gamma(\alpha_i)}{\Gamma\bigl(\sum_{i=1}^K \alpha_i\bigr)}

\boldsymbol\alpha=(\alpha_1,\ldots,\alpha_K)|
cdf =|
mean =\operatorname{E}[X_i] = \frac{\alpha_i}{\sum_k \alpha_k}
\operatorname{E}[\ln X_i] = \psi(\alpha_i)-\psi(\textstyle\sum_k \alpha_k)
(试看 digamma function)|
median =|
mode =x_i = \frac{\alpha_i - 1}{\sum_{k=1}^K\alpha_k - K}, \quad \alpha_i > 1. |
variance =\operatorname{Var}[X_i] = \frac{\tilde{\alpha}_i(1-\tilde{\alpha}_i)}{\bar{\alpha}+1},

其中\tilde{\alpha}_i = \frac{\alpha_i}{\sum_{i=1}^K\alpha_i}

而且\bar{\alpha} = \sum_{i=1}^K\alpha_i
\operatorname{Cov}[X_i,X_j] = \frac{-\tilde{\alpha}_i \tilde{\alpha}_j}{\bar{\alpha}+1}~~(i\neq j) |
skewness =|
kurtosis =|
entropy = H(X) = \log \mathrm{B}(\alpha) + (\alpha_0-K)\psi(\alpha_0) - \sum_{j=1}^K (\alpha_j-1)\psi(\alpha_j)
|
}}

狄利克雷分布是一组连续多变量概率分布,是多变量普遍化的Β分布。为了纪念德国数学家約翰·彼得·古斯塔夫·勒熱納·狄利克雷(Peter Gustav Lejeune Dirichlet)而命名。狄利克雷分布常作为贝叶斯统计的先验概率。当狄利克雷分布维度趋向无限时,这过程便称为狄利克雷过程(Dirichlet process)。

狄利克雷分布奠定了狄利克雷过程的基础,被广泛应用于自然语言处理特别是主题模型(topic model)的研究。

概率密度函数
维度K ≥ 2的狄利克雷分布在参数α1, ..., αK > 0上、基于欧几里得空间RK-1里的勒贝格测度有个概率密度函数,定义为:

:f(x_1,\dots, x_{K}; \alpha_1,\dots, \alpha_K) = \frac{1}{\mathrm{B}(\alpha)} \prod_{i=1}^K x_i^{\alpha_i - 1}

其中\boldsymbol x满足\sum_{i=1}^{K} x_i = 1,同时对于任意i \in \{1,\dots,K\},都有x_i \ge 0。即\boldsymbol x在(K − 1)维的单纯形开集上密度为0。

归一化衡量B(α)是多项Β函数,可以用Γ函数(gamma function)表示:

:\mathrm{B}(\alpha) = \frac{\prod_{i=1}^K \Gamma(\alpha_i)}{\Gamma\bigl(\sum_{i=1}^K \alpha_i\bigr)},\qquad\alpha=(\alpha_1,\dots,\alpha_K).

参见

  • 約翰·彼得·古斯塔夫·勒熱納·狄利克雷
  • 狄利克雷过程
  • 隐含狄利克雷分布

參考

评论 (0)

  • 还没有评论,来抢沙发吧。