核 (统计学)
在统计分析中,核(kernel)一词指代窗函数。在统计学的不同分支中,“核”有多种截然不同的含义。 贝叶斯统计 在统计学(尤其是贝叶斯统计)中,機率密度函數(PDF)或概率质量函数(PMF)的核是指原函数中省略掉所有与定义域变量无关的因子后剩余的部分。需要注意的是,这些被省略的因子通常是函数的參數。它们构成概率分布歸一化常數的一部分,且在许多情况下并无必要。例如,在伪随机数抽样中,大多数抽样算法会忽略归一化因子。此外,在共轭先验分布的贝…
共 20 篇文章
在统计分析中,核(kernel)一词指代窗函数。在统计学的不同分支中,“核”有多种截然不同的含义。 贝叶斯统计 在统计学(尤其是贝叶斯统计)中,機率密度函數(PDF)或概率质量函数(PMF)的核是指原函数中省略掉所有与定义域变量无关的因子后剩余的部分。需要注意的是,这些被省略的因子通常是函数的參數。它们构成概率分布歸一化常數的一部分,且在许多情况下并无必要。例如,在伪随机数抽样中,大多数抽样算法会忽略归一化因子。此外,在共轭先验分布的贝…
并行退火(Parallel tempering),也称作replica exchange MCMC sampling,是一种用于动态改进蒙特卡罗方法的模拟算法。该算法用于模拟物理过程。同时更普遍地应用于蒙特卡罗马可夫链(Markov chain Monte Carlo,MCMC)抽样方法。 Sugita和Okamoto数学定义了一种分子动力学描述的并行退火算法:通常被称为replica-exchange molecular dynami…
变分贝叶斯方法是近似贝叶斯推理与机器学习中较难积分的一系列技术,通常用于由观测变量及未知参数、潜变量组成的复杂统计模型,之间存在的各种关系可用图模式描述。贝叶斯推理中,参数和潜变量一般归为“未观察变量”。变分贝叶斯方法主要用于两个目的: 提供未观测变量后验概率的分析近似,以便对变量统计推断 得出观测数据的边缘似然的下界(即给定模型的数据的边缘概率,边缘化未观测变量)。通常用于模型选择,一般認為给定模型的边缘似然越高,拟合效果越好,产生数…
机器学习中,变分自编码器(,縮寫:VAE)是由杜克·金瑪和馬克斯·威靈提出的一种人工神经网络结构,属于概率图模式和变分贝叶斯方法。 VAE与自编码器模型有关,因为两者在结构上有一定亲和力,但在目标和数学表述上有很大区别。VAE属于概率生成模型(Probabilistic Generative Model),神经网络仅是其中的一个组件,依照功能的不同又可分为编码器和解码器。编码器可将输入变量映射到与变分分布的参数相对应的潜空间(Laten…
在贝叶斯统计中,一个随机事件或者一个不确定事件的后验概率(Posterior probability)是在考虑和给出相关证据或数据后所得到的条件概率。同样,后验概率分布是一个未知量(视为随机变量)基于试验和调查后得到的概率分布。“后验”在本文中代表考虑了被测试事件的相关证据。 定义 后验概率是在给定证据X后,参数\theta的概率:p(\theta|X)。 与似然函数相对,其为在给定了参数\theta后,证据X的概率:p(X|\thet…
溯因法或溯因推理(英语:,也译作反绎推理、反向推理),是從事實推理到最佳解释的过程。换句话说,它是开始于事实的集合-{}-,并推导出其最佳解释的推理过程。有时使用术语溯因(abduction)意味生成假设来解释观察或结论,但是前者定义在哲学和计算二者中更常见。 演绎和溯因区别在于推理中使用“a 蕴涵b”这种规则的方向(与归纳的比较请参见逻辑推理): (以下b=结果)。(a=原因) :演绎:允许推导b作为a的结论,换句话说,演绎是推导已知…
贝叶斯统计是一种基于贝叶斯概率的统计学理论,以贝叶斯统计的开创人,数学家、长老会牧师托马斯·贝叶斯命名。法国数学家皮埃尔-西蒙·拉普拉斯后来在托马斯·贝叶斯工作的基础上进一步发展了贝叶斯统计,并发明了拉普拉斯平滑等现代贝叶斯统计中常用的方法。 贝叶斯统计学认为概率是一种基于个人经验、之前的相关实验结果等先验信息而得出的(),没有必要经由反复实验验证。这一点也是贝叶斯学派与频率学派的主要不同之处,因为频率学派认为概率是经反复的实验后频率应…
PyMC(曾叫做PyMC3。 概述 PyMC曾经叫做PyMC3,不同于早先的使用Fortran扩展进行计算的PyMC2,它依靠Theano来进行自动微分、计算优化和动态C语言编译。从版本3.8开始PyMC依据来进行数据可视化和贝叶斯推断的。PyMC和是两个最流行的概率编程工具。 PyMC是开源项目,由社区开发并在财务上得到NumFocus赞助。PyMC已经在很多领域中被用于解决推断问题,包括天文学、流行病学、分子生物学、晶体学、化学、生…
神经网络高斯过程(,简称) 是一种特殊的高斯过程,可以看作一类特定人工神经网络序列的极限。具体而言,当多种神经网络架构的宽度趋于无穷时,其函数分布会收敛到一个高斯过程。 背景 贝叶斯网络是一种建模工具,它通过为事件分配概,来量化模型预测中的不确定性。深度学习和人工神经网络则是机器学习中的主流方法,用于构建能从训练样本中学习的计算模型。贝叶斯神经网络则将二者相融合,是一种参数与预测都具有概率性的神经网络。标准的神经网络常会对错误的预测赋予…
偏差信息量准则(,DIC)是等级模型化的赤池信息量准则(AIC),被广泛应用于由马尔可夫链蒙特卡洛(MCMC)所模拟的后验分布的贝叶斯模型选择问题。然而,該項准則由於與赤池信息量准则同为僅随样本容量增加的渐近近似,因此只可应用于后验分布呈多元正态分布的情况。 定义 定义偏差()为 D(\theta)=-2\log(p(y|\theta))+C,其中 y 为数据,\theta 是模型中的未知参量,p(y|\theta) 是似然函数,C 是…
马尔可夫逻辑网络(Markov logic network (MLN))是由一阶逻辑公式及其对应的权值组成的二元组集合。马尔可夫逻辑网络的基本思想是将一阶逻辑的限制放松,即一个事件违反公式越多,其发生概率越小,但未必为0。 马尔可夫逻辑网络(MLNs)提供了一种紧凑的语言来描述超大规模的马尔可夫网络,并能灵活地将各类领域知识模块化地整合其中。从一阶逻辑的角度看,MLNs具备可靠处理不确定性、容忍不完善与矛盾知识的能力,从而降低了系统脆弱…
貝葉斯定理()是概率論中的一個定理,描述在已知一些条件下,某事件的发生機率。比如,如果已知某種健康問題与寿命有关,使用贝叶斯定理则可以通过得知某人年龄,来更加准确地计算出某人有某種健康問題的機率。 通常,事件A在事件B已發生的條件下发生的機率,與事件B在事件A已發生的條件下发生的機率是不一樣的。然而,這兩者是有確定的關係的,貝葉斯定理就是這種關係的陳述。貝葉斯公式的一個用途,即透過已知的三個機率而推出第四個機率。贝叶斯定理跟隨機變量的條…
在数理统计学中,似然函数()是一种关于统计模型中的参数的函数,表示模型参数中的似然性()。似然函数在統計推論中有重大作用,如在最大似然估计和费雪信息之中的应用等等。文字意義上,“似然性”与“或然性”或“概率”意思相近,都是指某种事件发生的可能性,但是在统计学中,“似然性”和“概率”(或然性)有明确的区分:概率,用于在已知一些参数的情況下,预测接下来在观测上所得到的结果;似然性,则是用于在已知某些观测所得到的结果时,对有关事物之性质的参数…
在贝叶斯统计中,某一不确定量p的先验概率()分布是在考虑「观测数据」前,能表达p不确定性的概率分布。它旨在描述这个不确定量的不确定程度,而不是这个不确定量的随机性。这个不确定量可以是一个参数,或者是一个隐含变量()。依據應用領域的不同,事前機率又叫做先驗機率、先驗概率、事前先驗機率、居先機率。 在使用贝叶斯定理时,我们通过将先验概率与似然函数相乘,随后标准化,来得到后验概率分布,也就是给出某数据,该不确定量的条件分布。 先验概率通常是主…
主观主義主張“我们的思想活动是我们经验中唯一毋庸置疑的事实”,它不能共享,不是公共的。没有外部和客观的真理。 这个主張主要歸功于勒内·笛卡尔及其技术——方法的怀疑。在唯我論的极端形式中,這思想认为每个性質仅取决于某人对其的主观意识。然而,乔治·贝克莱則認為上帝是人类感知的主要來源,那可以视為经验主义。 形而上学的主观主义 形而上学的主观主义認為,我们认为現實是真实的,并且不存在独立于感知的潜在真实现实。人们會认为,意识就是现实,而不是主…
在贝叶斯统计中,如果后验分布与先验分布属于同类,则先验分布与后验分布被称为共轭分布,而先验分布被称为似然函数的共轭先验(Conjugate prior)。比如,高斯分布家族在高斯似然函数下与其自身共轭 (自共轭)。这个概念,以及「共轭先验」这个说法,由和在他们关于贝叶斯决策理论的工作中提出。 类似的概念也曾由独立提出。 具体地说,就是给定贝叶斯公式 p(\theta | x) = \frac{p(x | \theta) p(\theta…
数据同化,或稱資料同化,是通过数学模型拟合观测数据的一种渐进方式,通常用于复杂系统的建模和動態預測。这类系统通常具有复杂的数学模型,自由度有时达到10^6,且因为观测数据体量庞大,使得对全体观测进行静态拟合成为不可能。 “分析-预报”循环 数据同化过程主要为两个步骤的循环。第一步可以称为分析,其中实际系统的观测量与模型产生的预报值相比较/融合,得到系统现在状态的最佳估计。在第二步,根据观测数据和模型两者包含的不确定度性信息,平衡二者得到…
在统计学中, 边缘似然函数(marginal likelihood function),或积分似然(integrated likelihood),是一个某些参数变量边缘化的似然函数(likelihood function) 。在贝叶斯统计范畴,它也可以被称作为 证据 或者 模型证据的。 概念 给出一组 独立同分布的数据点\mathbb{X}=(x_1,\ldots,x_n),, x_i \sim p(x_i|\theta), 其中θ 是…
贝叶斯错误率(Bayes error rate)是应用贝叶斯分类规则的分类器的错误率。贝叶斯分类规则的一个性质是:在最小化分类错误率上是最优的。所以在分类问题中,贝叶斯错误率是一个分类器对某个类别所能达到的最低的分类错误率。 错误测定 定义 :p_e = \sum_{i = 1}^M \int_{R_i}\left(\sum_{j = 1}^M \lambda_{ki}p(x|\omega_{k})P(\omega_{k})\, \ri…
所罗门诺夫的归纳推理理论(Solomonoff's theory of inductive inference)是对奥卡姆剃刀叙述的数学化描述。该理论指出:在所有能够完全描述的已观测的可计算类中,较短的可计算理论在估计下一次观测结果的概率时具有较大的权重。简而言之,在几组可以给出的答案的假设论述中,假设越少的越被大家选择。引申为“越简单的越易行”。 参考资料