GPT-J

GPT-J,又称GPT-J-6B,是由开放人工智能研究团体EleutherAI开发的大型语言模型。该模型于2021年公开发布,是一个基于Transformer架构的自回归文本生成模型,主要用于根据输入提示预测后续文本。名称中的“6B”表示模型约有60亿个可训练参数。GPT-J使用Ben Wang开发的Mesh Transformer JAX训练,权重以Apache License 2.0发布,是早期具有公开权重的GPT-3类大型语言模型之一。

GPT-J的发布出现在闭源大型语言模型迅速扩张的背景下。OpenAI在2020年发布GPT-3后,没有公开其完整模型权重,而EleutherAI等开放研究社群试图复现类似规模和能力的语言模型。GPT-J继承了GPT-Neo项目的开放路线,进一步扩大模型规模,并使研究人员、开发者和小型团队能够直接下载、运行和微调GPT类模型。

背景
GPT-J的开发者来自EleutherAI及其周边开源社区。EleutherAI最初以复现和开放GPT-3类模型为目标,先后建设了The Pile数据集、GPT-Neo系列模型和GPT-J。与依赖API访问的商业模型不同,GPT-J提供了模型代码和预训练权重,因而在开源大语言模型发展早期具有代表性。

架构与训练
GPT-J是解码器式自回归语言模型,核心任务是根据已有文本预测下一个标记。模型有6,053,381,344个参数,包含28层Transformer,每层包含一个自注意力模块和一个前馈模块;隐藏维度为4096,前馈层维度为16384,注意力头数为16,每个注意力头维度为256,最大上下文长度为2048个标记。模型使用与 GPT-2、GPT-3相同的 BPE 分词表,词表实际使用50257个条目,嵌入矩阵大小为50400。GPT-J的 RoPE 应用于每个注意力头的64个维度。模型还将注意力层和前馈层并行放置,以降低通信开销。根据模型卡,GPT-J在 TPU v3-256 pod上训练了4020亿个标记、383,500个步骤,训练目标为自回归语言建模,并使用交叉熵损失最大化正确预测下一个标记的概率。GPT-J也出现在后续学术研究中。Meta AI Research的Toolformer研究以GPT-J为基础模型,研究语言模型如何通过少量示例自监督学习调用外部工具,包括问答系统、搜索引擎、计算器、日历和翻译系统。模型可以学习在何时调用工具、调用哪些工具、传入什么参数,以及如何把工具返回结果纳入后续标记预测。

GPT-J还被文学创作者用于实验性写作。英国作家汉娜·席尔瓦(Hannah Silva)在回忆录《My Child, the Algorithm》中使用GPT-J生成部分文本,并通过斜体区分AI生成内容。席尔瓦将GPT-J的输出与自己的文字并置,模型既作为写作素材来源,也作为关于学习、智能和爱的反思对象。

局限
GPT-J不是面向最终用户的完整产品。模型卡指出,GPT-J-6B不应在缺少微调、监督或内容审核的情况下直接部署到面向人的交互场景中。模型可能生成有害、冒犯性或社会上不可接受的文本,也不应被依赖为事实准确的信息来源。《衛報》随后报道,查蒂·史密斯、斯蒂芬·金、、埃琳娜·費蘭特等作者的作品出现在Books3中,并指出Books3也被用于训练GPT-J。

衍生与滥用
GPT-J的开放权重方便研究与微调,也带来双重用途问题。2023年,网络安全研究者和媒体报道了WormGPT等用于网络犯罪的恶意语言模型。有观点将WormGPT描述为GPT-J的微调版本,称其被作为没有内容过滤的ChatGPT替代品出售,可生成钓鱼邮件、恶意脚本和漏洞利用说明。

影响
GPT-J在开源大语言模型史上具有承前启后的意义。它继GPT-Neo之后扩大了公开权重GPT类模型的规模,并在LLaMA、Falcon、Mistral、Pythia、GPT-NeoX等后续开放或开放权重模型出现前,为研究者提供了可直接下载和实验的60亿参数级语言模型。InfoQ在2021年的报道中将GPT-J描述为一个六十亿参数的开源NLP模型,指出其训练于The Pile,并在相近规模任务上达到与GPT-36.7B模型相近的表现。
参考资料
外部链接
*
*

评论 (0)

  • 还没有评论,来抢沙发吧。