注意力机制

注意力机制()是人工神经网络中一种模仿认知注意力的技术。这种机制可以增强神经网络输入数据中某些部分的权重,同时减弱其他部分的权重,以此将网络的关注点聚焦于数据中最重要的一小部分。数据中哪些部分比其他部分更重要取决于上下文。可以通过梯度下降法对注意力机制进行训练。

类似于注意力机制的架构最早于1990年代提出,当时提出的名称包括乘法模块(multiplicative module)、sigma pi单元、超网络(hypernetwork)等。等。这些变体重新组合编码器端的输入,以将注意力效果重新分配到每个目标输出。通常而言,由点积得到的相关式矩阵提供了重新加权系数(参见图例)。

{| class="wikitable"
!1. 编码器-解码器点积
!2. 编解码器QKV
!3. 编码器点积
!4. 编码器QKV
!5. Pytorch示例
|-
|[[File:Attn-xy-dot.png|缩略图|同时需要编码器与解码器来计算注意力。

}}

评论 (0)

  • 还没有评论,来抢沙发吧。