Gemini (语言模型)
Gemini()是由谷歌DeepMind開發的多模态大型语言模型系列,是LaMDA和PaLM 2系列的继承者。Gemini 1.0于2023年12月6日面世,被定位为与OpenAI的GPT-4抗衡的产品系列。Gemini家族目前包含Gemini Deep Think、Gemini Pro、Gemini Flash和Gemimi Flash-Lite。 历史 開發 Google在2023年5月10日的Google I/O上發布由其子公司G…
共 29 篇文章
Gemini()是由谷歌DeepMind開發的多模态大型语言模型系列,是LaMDA和PaLM 2系列的继承者。Gemini 1.0于2023年12月6日面世,被定位为与OpenAI的GPT-4抗衡的产品系列。Gemini家族目前包含Gemini Deep Think、Gemini Pro、Gemini Flash和Gemimi Flash-Lite。 历史 開發 Google在2023年5月10日的Google I/O上發布由其子公司G…
文本分割(Text segmentation)将书面文本分割成有意义单位的过程,如单词、句子或主题。这个术语既适用于人类阅读文本时的心理过程,也适用于在计算机中实现的人工过程,后者属于自然语言处理的领域。一些书面语言有明确的单词分界标记,例如英语的词之间有空格标识,阿拉伯语有独特的首、中、末字母形状,但这种标记不是所有书面语言都有。 分割问题 分词 分词(Word segmentation)是将一串书面语言分成其组成词的问题。中文分词指…
文生视频模型生成的视频,提示词为:A stylish woman walks down a Tokyo street filled with warm glowing neon and animated city signage. She wears a black leather jacket, a long red dress, and black boots, and carries a black purse. She wear…
机器学习(,简称ML)是人工智能的一个分支。机器学习理论主要是设计和分析一些让计算机可以自动“学习”的算法。机器学习算法是一类从数据中自动分析获得规律,并利用规律对未知数据进行预测的算法。因为学习算法中涉及了大量的统计学理论,机器学习与推断统计学联系尤为密切,也被称为统计学习理论。算法设计方面,机器学习理论关注可以实现的,行之有效的学习算法(要防止錯誤累積)。很多推论问题属于非程序化決策,所以部分的机器学习研究是开发容易处理的近似算法。…
大型-{}-语言模型(),也称大-{}-语言模型,简称大模型,是一種基於人工神经网络的语言模型。其名稱中的「大型」指模型具有龐大的參數量(通常在數十億至數萬億級別,如GPT-3含1750亿参数)以及巨大的訓練數據規模。大語言模型通常采用自监督机器学习方法,從而能夠基于海量無標註的文本進行训练。大语言模型专为自然语言处理任务而设计,尤其适用于语言生成。 此外,基於其跨任务泛化能力,也可以针对特定任务對LLM进行微调,或通过提示工程进行引导…
GPT-J,又称GPT-J-6B,是由开放人工智能研究团体EleutherAI开发的大型语言模型。该模型于2021年公开发布,是一个基于Transformer架构的自回归文本生成模型,主要用于根据输入提示预测后续文本。名称中的“6B”表示模型约有60亿个可训练参数。GPT-J使用Ben Wang开发的Mesh Transformer JAX训练,权重以Apache License 2.0发布,是早期具有公开权重的GPT-3类大型语言模型…
LLM-as-a-Judge(意为“大型语言模型作为评估器”,亦称基于大型语言模型的评估)是自然语言处理中的一种技术,即用大型语言模型(LLM)依据预先设定的标准,评估一段文本输出(通常由另一个模型生成)的质量、相关性或正确性。它被用作人工标注以及 BLEU、ROUGE 等基于参考、只衡量词面重叠而非语义的指标的一种可扩展、低成本替代方案。 该方法不再仅依赖人类标注者,而是利用大型语言模型的通用语言能力来充当自动评估器。 评估器通常返回…
语料库一詞在語言學上意指大量的文本,通常經過整理,具有既定格式與標記,可用於人工智能的基礎訓練。根据语料库的特征,可以分为单语语料库、双语语料库、平行语料库等;根据语料的来源,可以分为书面语语料库、口语语料库、作文语料库、学习者语料库、古文书语料库等。语料库被广泛运用在语言研究、外语教学科研与实践、翻译研究、历史与人文学研究等领域,随着人工智能的发展,语料库也成为了人工智能研究的重要工具。 語種 多語 [https://archive.…
n元语法()指文本中连续出现的n个语词。n元语法模型是基于(n-1)阶马尔可夫链的一种概率语言模型,通过n个语词出现的概率来推断语句的结构。这一模型被广泛应用于概率论、通信理论、计算语言学(如基于统计的自然语言处理)、计算生物学(如序列分析)、数据压缩等领域。 当n分别为1、2、3时,又分别称为一元语法()、二元语法()与三元语法()。 示例 参考文献
零样本学习(,简称:)是机器学习中的一种问题设定,指模型在没有目标类别或目标任务标注样本的情况下,对这些“未见”类别或任务作出预测。经典零样本学习通常以类别为单位划分训练和测试:训练集只包含“见过类”()的标注样本,测试阶段则要求模型识别训练时没有出现过的“未见类”()。为了实现这种迁移,模型通常需要借助类别属性、文本描述、词向量、知识图谱或其他语义表示,把训练类别和测试类别联系起来。 零样本学习与小样本学习、单一样本学习相近,但含义不…
自监督学习(,缩写:)是机器学习中的一种学习范式,指模型在没有人工标注标签的情况下,从输入数据本身构造监督信号,并通过这种自动生成的任务学习可迁移的表示。自监督学习通常被视为无监督学习的一类,但训练过程又具有监督学习的形式。及模型会根据数据内部结构生成目标标签,例如预测被遮蔽的词、还原被遮挡的图像块、判断两个增强视图是否来自同一图像,或预测音频片段中被遮蔽的潜在表示。 自监督学习的目标通常不是直接完成预训练时设置的任务,而是借助这些任务…
人工智能检测软件旨在确定某些内容(文本、图像、视频或音频)是否是使用人工智能(AI)生成的。 截至2023年,这方面的典型案例有诸如GPTZero这样的软件,该软件声称可以检测文本是否是由人工智能生成,有时被大学和高校用于防范学生的学术抄袭。然而,关于这类软件是否可靠的争论不断,同时也存在对教育工作者可能误用AI检测软件担忧。 准确性问题 事实证明,多个人工智能检测工具在准确和全面检测生成的人工智能生成文本方面表现不可靠。在韦伯·伍尔夫…
通用依存关系(英语:,常缩写为UD,又译普遍依存关系、通用依存句法)是一个国际性的合作项目,旨在为世界各语言创建一套统一的语法标注框架和。这些树库以开放获取的形式发布,并采用非商业许可协议。 其核心应用领域包括自然语言处理(NLP)中的自动,以及自然语言句法与语法的研究,特别是语言学中语言类型学视角下的研究。该项目的主要目标是实现跨语言标注的一致性,同时在必要时允许语言特有的扩展。该标注体系源于三个相关项目:、Google univer…
开源人工智能(),根据开放源代码促进会(OSI)的定义,是一种可以自由使用、研究、修改和共享的AI系统。这包括用于训练模型的数据集、源代码以及,旨在促进一种协作且透明的人工智能开发方式,使他人能够重现基本相似的结果。 关于何种程度的开放才应被视为“开源”的争论十分激烈。一些仅发布模型权重(而不公开训练数据和代码)的大型语言模型被批评为(openwashing),实际上是封闭系统。流行的开源人工智能项目类别包括大型语言模型、机器翻译工具和…
基于变换器的双向编码器表示技术(,BERT)是用于自然语言处理(NLP)的预训练技术,由Google提出。2018年,雅各布·德夫林和同事创建并发布了BERT。Google正在利用BERT来更好地理解用户搜索语句的语义。2020年的一项文献调查得出结论:「在一年多一点的时间里,BERT已经成为NLP实验中无处不在的基线」,算上分析和改进模型的研究出版物超过150篇。 最初的英语BERT发布时提供两种类型的预训练模型以及英語維基百科语料,…
词元()是自然语言处理中用于表示文本的基本单位之一,可解释为“通常所说的词元”,“处理文本的最小数据单元”或“大模型处理信息的最小信息单元”。词元可以是词、子词、字符,或其他按规则切分的字符串片段。将输入文本切分为词元序列的过程則称为词元化();在现代语言模型中,文本通常先经过词元化,再映射为词汇表索引与向量表示后进入模型计算。 原理 词元化的作用,是将连续文本转换为模型可处理的离散单位。经过切分后,每个词元会与词汇表中的一个索引相对应…
提示工程()是人工智能中的一个概念,特别是自然语言处理(NLP)。 在提示工程中,任务的描述会被嵌入到输入中。例如,不是隐含地给予模型一定的参数,而是以问题的形式直接输入。 提示工程的典型工作方式是将一个或多个任务转换为基于提示的数据集,并通过所谓的“基于提示的学习(prompt-based learning)”来训练语言模型。 提示工程可以从一个大型的“冻结”预训练语言模型开始工作,其中只学习了提示的表示方法,即所谓的“前缀调整(pr…
文档分类是图书馆学, 信息学和计算机科学中的一个问题。其任务是将一个文档分配到一个或者多个类别中。它可以是通过人工分类完成的,也可以是通过计算机算法实现的。多数通过人工的文档分类问题一直属于图书馆学的领域,而通过算法实现的文档分类问题则多属于信息学和计算机科学的领域。这些问题之间是有相同的部分的,所以有一些对文档分类的跨学科研究。 需要被分类的文档有可能是纯文本,图片,音乐等等。每一种文档都有其独特分类问题。根据特殊的文档做研究,文档分…
在机器学习中,知识截止(或数据截止)是指模型未基于新数据进行训练的时间。 该术语主要使用在大型语言模型(LLM)。 所以,它无法获取更新事件的信息,除非有像检索增强生成 (RAG) 这類的实时数据採訪系统。 虽然令训练和调整大型语言模型變得較為簡單,但知识截止点引入了新的限制,例如幻觉、信息空隙和时间偏差。 值得注意的知識截止日期包括: GPT-4 模型的知识截止日期为2021年9月。 GPT-4 Turbo 模型的知识截日期为 202…
文本情感分析(也称为意见挖掘)是指用自然语言处理、文本挖掘以及计算机语言学等方法来识别和提取原素材中的主观訊息。 通常来说,情感分析的目的是为了找出说话者/作者在某些话题上或者针对一个文本两极的观点的态度。这个态度或许是他或她的个人判断或是评估,也许是他当时的情感状态(就是说,作者在做出这个言论时的情绪状态),或是作者有意向的情感交流(就是作者想要读者所体验的情绪)。 研究领域 文本情感分析的一个基本步骤是对文本中的某段已知文字的两极性…