标签:#语言模型

共 3 篇文章

OpenAI Codex

OpenAI Codex是OpenAI开发的人工智能代码生成模型,主要用于根据自然语言提示生成、补全和修改程序代码。OpenAI于2021年8月发布Codex,并通过API私人测试版提供访问。Codex基于GPT-3系列模型进一步训练,训练数据包括自然语言文本以及来自公开来源的源代码;OpenAI称,该模型在Python上的表现最强,同时也能处理JavaScript、Go、PHP、Ruby、Swift、TypeScript和Shell等…

概率潜在语义分析

概率的潜在语义分析(PLSA),也称为概率潜在语义索引(PLSI,尤其是在信息检索领域),是用于分析双模和共现数据的统计方法。 实际上,人们可以根据对某些隐变量的亲和性来推导出观测变量的低维表示,就像PLSA是从潜在语义分析中演化而来。 与源于线性代数并缩小发生表(通常通过奇异值分解)的标准潜在语义分析所不同的是,概率潜在语义分析基于从潜类模型导出的混合分解。 模型 ,主题 c是一个潜变量。]] 考虑到以单词和文档的共现 (w,d)形式…

词嵌入

词嵌入()是自然语言处理(NLP)中语言模型与表征学习技术的统称。概念上而言,它是指把一个维数为所有词的数量的高维空间嵌入到一个维数低得多的连续向量空间中,每个单词或词组被映射为实数域上的向量。 词嵌入的方法包括人工神经网络、对词语降维、機率模型以及单词所在上下文的显式表示等。 在底层输入中,使用词嵌入来表示词组的方法极大提升了NLP中语法分析器和文本情感分析等的效果。 发展历程 词嵌入技术起源于2000年。约书亚·本希奥等人在一系列论…