Attention Is All You Need

Attention Is All You Need》机器学习研究论文。该论文提出了一种基于注意力机制的新型深度学习架构——Transformer,其灵感源自2014年德米特里·巴達納烏(Dzmitry Bahdanau)等人提出的机制。这篇论文被视为现代人工智能的奠基性文献,也是人工智能热潮的主要推动者之一,因为Transformer架构已成为大语言模型等多种AI的核心基础。

论文标题致敬了披头士乐队的歌曲《All You Need Is Love》。“Transformer”这一名称由论文作者之一雅各布·烏什科雷特(Jakob Uszkoreit)选定,因其喜欢该词的发音。

早期设计文档曾命名为《Transformers:面向多任务的迭代式自注意力与处理》,并包含《变形金刚》(Transformers)系列六个角色的插图,团队亦命名为“Team Transformer”

截至2025年,该论文被引用次数超过17.3万次。

作者
论文作者包括:阿西什·瓦斯瓦尼、諾姆·沙澤爾、妮琪·帕瑪(Niki Parmar)、雅各布·烏什科雷特、艾丹·高梅茲、盧卡什·凱澤(Łukasz Kaiser)与伊利亞·波洛蘇金(Illia Polosukhin)。八位作者均为“平等贡献者”,署名顺序随机排列。《连线》文章强调了团队的多样性。

提出的方法
论文最著名的贡献是提出了Transformer架构,该架构构成现代大语言模型的基础。其核心优势在于比前代模型更强的并行计算能力,可通过GPU加速训练过程,从而缩短训练时间并支持更大规模模型。

论文为Transformer架构引入了以下机制:
缩放点积注意力与自注意力
采用缩放点积注意力及自注意力机制取代循环神经网络或长短期记忆网络(依赖递归结构),显著提升性能。论文将缩放点积注意力定义为:
{\rm Attention}(Q,K,V) := {\rm softmax}\left(\frac{Q\times K^T}{\sqrt{d_{k}}}\right)\times V
其中Q、K、V分别为查询、键、值矩阵,d_k为值向量的维度。

由于该机制基于同源(输入序列/上下文窗口)產生的Q、K、V矩阵,完全消除了对RNN的依赖,确保架构可并行化。此设计区别于2014年原始注意力机制。论文还讨论了针对键向量维度(d_{k},初始设为64)的缩放因子优化。

在翻译任务中,Q、K矩阵通常对应源语言嵌入,而V矩阵对应目标语言。

多头注意力
自注意力机制中,Q、K、V矩阵动态產生(受上下文窗口限制),使模型能分步聚焦输入序列的不同部分。多头注意力通过并行多组注意力头增强此过程,每组学习Q、K、V矩阵的不同线性投影,从而同步捕获词间关系的多维特征。

多头输出经拼接和线性变换后產生最终结果。

位置编码
因Transformer非序列模型,论文采用正弦/余弦函数将词序信息编码至嵌入向量:
PE_{({\rm pos},2i)} = \sin({\rm pos}/{10000}^{2i/d_{\rm model}})
PE_{({\rm pos},2i+1)} = \cos({\rm pos}/{10000}^{2i/d_{\rm model}})
其中{\rm pos}、i、{d_{\rm model}}分别表示词位置、当前维度索引和模型维度。正弦函数用于偶数索引,余弦函数用于奇数索引。產生的PE嵌入会加入对应位置的词向量。论文解释选择此方法的原因:
“正弦编码可使模型外推至训练时未见的更长序列。”。基础模型训练10万步(每步约0.4秒),大型模型训练30万步(每步约1秒)。基础模型总耗时12小时,大型模型耗时3.5天。两者均以较低训练成本超越2017年英德/英法翻译的当时最优水平

}}

外部链接

  • 谷歌研究博客的同期文章。

评论 (0)

  • 还没有评论,来抢沙发吧。