神经网络高斯过程

神经网络高斯过程(,简称) 是一种特殊的高斯过程,可以看作一类特定人工神经网络序列的极限。具体而言,当多种神经网络架构的宽度趋于无穷时,其函数分布会收敛到一个高斯过程。

背景
贝叶斯网络是一种建模工具,它通过为事件分配概,来量化模型预测中的不确定性。深度学习和人工神经网络则是机器学习中的主流方法,用于构建能从训练样本中学习的计算模型。贝叶斯神经网络则将二者相融合,是一种参数与预测都具有概率性的神经网络。标准的神经网络常会对错误的预测赋予较高的置信度,而贝叶斯神经网络能够更准确地评估自身预测正确的可能性。

,该网络将三维输入(下)转换为二维输出(y_1, y_2)(上)。右图:网络输出的概率密度函数p(y_1, y_2),由网络的随机权重所决定。视频:随着网络宽度的增加,输出分布变得简单,最终在无限宽度极限下收敛到多元正态分布。]]

人工神经网络的计算可以表示成人工神经元构成的层序列,其中每一层的神经元数量称为层的宽度。当我们考察一个贝叶斯神经网络序列(见图),其所有层的宽度不断增加时,这个序列在函数分布上最终会收敛到一个神经网络高斯过程。这种无限宽度下的极限具有现实意义,因为在实践中更宽的网络通常会有更好的性能。同时,这一极限也为我们提供了一种评估网络性能的闭式方法。

除了作为贝叶斯神经网络的极限,神经网络高斯过程还出现在其他几种场景下:它描述了一个非贝叶斯宽人工神经网络在参数随机初始化之后、训练之前的输出函数分布;它可以作为神经正切核预测方程中的关键组成部分;它在深度信息传播中用以表征超参数和架构是否可以训练。它还与神经网络的其他大宽度极限有关。

适用范围
关于神经网络与高斯过程的第一个对应关系,最早可以追溯到Radford M. Neal在其1995年博士论文中的结果,当时他的导师是多伦多大学教授杰弗里·辛顿。Neal表示他的研究灵感来源于从事贝叶斯学习研究的戴维·J·C·麦凯。

如今,这一对应关系已被证明适用于多种架构,如单隐藏层贝叶斯神经网络、单元数趋于无穷时的循环网络、ELU、GELU或误差函数

参考文献

评论 (0)

  • 还没有评论,来抢沙发吧。