标签:#自然語言處理

共 34 篇文章

Stable Diffusion

Stable Diffusion是2022年發布的深度學習文本到图像生成模型。它主要用於根據文本的描述產生詳細圖像,儘管它也可以應用於其他任務,如內補繪製、外補繪製,以及在提示詞指導下產生圖生圖的转变。 它是一種擴散模型,由慕尼黑大學的CompVis研究團體開發的各種生成性人工神經網絡之一。 截至2022年10月,StabilityAI籌集了1.01億美元的資金。 Stable Diffusion的源代碼和模型權重已分别公開發布在Git…

基础模型

基础模型(或)指一类大型机器学习模型,它们经大规模数据训练而成(通常以自监督学习或半监督学习方式进行),以适应各种下游任务。基础模型帮助实现了人工智能系统构建方式的重大革新,例如为聊天机器人和其他面向用户的人工智能提供支持。斯坦福人类中心人工智能研究所()旗下的基础模型研究中心(,简称)推广了“基础模型”这一术语的使用。 除文本模型外,还先后诞生了各种视觉或多模式的基础模型,如DALL-E、Flamingo、Florence和NOOR等…

推理語言模型

推理語言模型(),或稱推理大模型或大型推理模型,是一個進階的大型語言模型,它能經過進一步訓練,可以解決多步驟推理任務。推理語言模型在邏輯、數學或程式任務上的表現,一般都比傳統的自我迴歸的大型語言模型更好,具有回溯能力,並使用時間測試計算作為訓練範例、參數計數。 歷史 Open AI 在2024年9月推出o1-preview,為首個擁有高階推理能力的大型語言模型. 2024年12月, Open AI 推出 o1 正式版,並宣佈推出o3 推…

詞彙標示框架

詞彙標示框架(Lexical Markup Framework,簡稱LMF)是國際標準組織(ISO/TC37)進行中的一項工作,目的在為自然語言處理與機讀字典的詞彙庫描述建立一個標準化框架。計畫範疇涵蓋對牽涉到多語溝通及文化差異的語言資源,對建立與交換這些資源的準則與方法做標準化處理。 目標 詞彙標示框架的目標有三。其一,為詞彙資源的創造與使用提供共用模型。其二,管理詞彙資源間的資料交換。其三,促進個別電子資源的整合以形成大規模的全球性…

自动作文评分

自动作文评分(,缩写为AES)是运用统计方法、机器学习和自然语言处理技术预测作文分数的教育评价方法。 自动作文评分系统通常以人工评定的作文为训练或校准资料,从作文中提取语言特征或学习文本表示,再预测整体分数或若干写作分项的得分。在高风险考试中,自动评分也可与人工评分共同使用,而不由计算机单独决定考生成绩。后来的综述将佩奇开发的作文评分计划()列为早期自动作文评分系统。 2003年,《底特律自由新闻》报道,采用e-rater的Criter…

DALL-E

。]] DALL-E是一个可以通过文本描述生成图像的人工智能程序,於2021年1月5日由OpenAI發布。 簡介 DALL-E通过120亿参数版本的GPT-3 Transformer模型来理解自然语言输入(例如“五边形形状的绿色皮革钱包”或“一只悲伤水豚的等距视图”)并生成相应的图片。它既可以生成现实的对象(例如“带有蓝色草莓图像的彩色玻璃窗”),也能够生成现实中不存在的对象(例如“具有豪猪纹理的立方体”)。它的名字是2008年動畫電影…

Powerset

Powerset 是一家位于加州圣弗朗西斯科的公司,正在开发互联网上的自然语言搜索引擎。 Powerset致力于构建一个能回答用户问题的自然语言搜索引擎(区别于基于关键字的搜索)。举个例子,当用户输入一个问题,"Which United Statesstate has the highest income tax?",通常搜索引擎会忽略掉疑问词,进而使用关键字 "state"、 "highest"、"income"和"tax"来搜索。P…

自然语言处理

自然語言處理(,缩写作 *')是人工智慧和語言學領域的交叉學科,研究计算机处理、理解与生成人类语言的技術。此領域探討如何處理及運用自然語言;自然語言處理包括多方面和步骤,基本有认知、理解、生成等部分。 自然語言認知和理解是讓電腦把输入的語言变成结构化符号与语义关系,然后根据目的再處理。自然語言生成系統则是把計算機數據轉化為自然語言。 自然语言处理要研制表示语言能力和语言应用的模型, 建立计算框架来实现并完善语言模型,并根据语言模型设计各…

Seq2Seq模型

Seq2seq()模型,是将序列()映射到序列的神經網絡機器學習模型。這個模型最初設計用於改進機器翻譯技術,可容許機器通過此模型發現及學習將一種語言的語句(詞語序列)映射到另一種語言的對應語句上。除此之外,Seq2Seq也能廣泛地應用到各種不同的技術上,如聊天機器人、Inbox by Gmail等,但需要有配對好的文本集才能訓練出對應的模型。应用领域包括机器翻译,图像描述,对话模型和文本摘要。 历史 此算法最初由Google开发,并用于…

SCIgen

SCIgen是一个计算机程序,能够自动生成无意义的英文计算机科学研究论文,并且包含图片、表格、流程图和参考文献等。这个程序使用用户定制的上下文无关文法来生成论文的各类组成元素。 简介 SCIgen由美国麻省理工学院计算机科学与人工智能实验室的三位研究生杰里米·斯特里布林(Jeremy Stribling)、马克斯·克伦(Max Krohn)和达纳·阿瓜约(Dan Aguayo)编写,源代码以GPL协议发布。 影响 2005年,SCIge…

主题模型

主题模型(Topic Model)在机器学习和自然语言处理等领域是用来在一系列文档中发现抽象主题的一种统计模型。直观来讲,如果一篇文章有一个中心思想,那么一些特定词语会更频繁的出现。比方说,如果一篇文章是在讲狗的,那“狗”和“骨头”等词出现的频率会高些。如果一篇文章是在讲猫的,那“猫”和“鱼”等词出现的频率会高些。而有些词例如“这个”、“和”大概在两篇文章中出现的频率会大致相等。但真实的情况是,一篇文章通常包含多种主题,而且每个主题所占…

檢索增強生成

检索增强生成(,縮寫:)是一种使大语言模型(LLM)能够从外部数据源中检索并整合新信息的技术。 在RAG框架下,大语言模型首先查阅指定的文档集合,再对用户查询作出回应。这些文档补充了模型预训练数据中已有的信息,使模型能够利用训练数据中未包含的领域特定信息和/或最新信息。 RAG还降低了为纳入新数据而重新训练大语言模型的需求,从而节省计算资源与资金成本。 RAG与LLM的局限性 大语言模型可能提供错误信息。例如,谷歌首次演示其大语言模型工…

生成式引擎优化

生成式引擎优化(英文:Generative Engine Optimization,简称:GEO)是指为了提升在生成式人工智能中的可见性、引用率和推荐质量,而对内容、结构、表达方式等进行有针对性优化的一种内容策略。 其核心思想是在精细掌控生成内容的影响因素(例如语义相关性、生成算法调优、用户交互反馈等)的情况下,提高内容的匹配程度和展现机会。伴随着人工智能与机器学习技术的高速发展,GEO 亦具备广阔的成长空间,应用尤可望聚焦于个性化推荐…

词袋模型

在自然語言處理和信息檢索裏,词袋模型()是一個簡化的表達模型。在此模型下,一段文本(比如一个句子或是一个文档)可以用一個装着这些词的袋子来表示,這種表示方式不考慮文法以及詞的順序。最近词袋模型也被應用在電腦視覺領域。 词袋模型被廣泛應用在文件分類,詞語出現的頻率可以用來當作訓練分類器的特徵。 關於「词袋」這個用字的由來可追溯到於1954年在《Distributional Structure》的文章。 範例 下列文件可用词袋表示: 以下是…

跨語檢索

跨語檢索,或稱「跨語資訊檢索」(Cross-Language Information Retrieval,CLIR),其定義採用 Oard, D. W.在1997年發表的文章《Cross-Language Information Retrieval Defined》。跨語檢索意指使用者使用某種自然語言的檢索詞彙檢索由另一種語言表達的文件。 舉例來說,使用者使用(自己熟悉的)中文產生一組檢索詞彙進行檢索,而其檢索結果皆以(使用者完全不懂或…

自然语言

自然语言()通常是指一种自然地随文化演化的语言。汉语、英语、法語、西班牙語、葡萄牙文、日语、韓語、義大利文、德文为自然语言的例子。而世界语则为人工语言,即是一种由人特意为某些特定目的而创造的语言。 不过,有时所有人类使用的语言(包括上述自然地随文化演化的语言,以及人工语言)都会被视为“自然”语言,以相对于如编程语言等为计算机理解用而设的“人造”语言。这一种用法可见于自然语言处理一词中。自然语言是人类交流和思维的主要工具。 參看 语言列表…

隐含狄利克雷分布

隐含狄利克雷分布(,简称LDA),是一种主题模型,它可以将文档集中每篇文档的主题按照概率分布的形式给出。同时它是一种无监督学习算法,在训练时不需要手工标注的训练集,需要的仅仅是文档集以及指定主题的数量k即可。此外LDA的另一个优点则是,对于每一个主题均可找出一些词语来描述它。 LDA首先由 David M. Blei、吴恩达和迈克尔·I·乔丹于2003年提出,目前在文本挖掘领域包括文本主题识别、文本分类以及文本相似度计算方面都有应用。 …

词嵌入

词嵌入()是自然语言处理(NLP)中语言模型与表征学习技术的统称。概念上而言,它是指把一个维数为所有词的数量的高维空间嵌入到一个维数低得多的连续向量空间中,每个单词或词组被映射为实数域上的向量。 词嵌入的方法包括人工神经网络、对词语降维、機率模型以及单词所在上下文的显式表示等。 在底层输入中,使用词嵌入来表示词组的方法极大提升了NLP中语法分析器和文本情感分析等的效果。 发展历程 词嵌入技术起源于2000年。约书亚·本希奥等人在一系列论…

詞形還原

語言學中的詞形還原()是將一個單詞的屈折形式組合在一起的過程,以便可以將它們作為單個項目進行分析,由該單詞的或詞典形式進行識別。 在計算語言學中,詞形還原是根據一個單詞的預期含義來確定其詞形的算法過程。與詞幹提取不同的是,詞形還原取決於正確識別一個單詞在句子中的詞類和意義,以及在該句子周圍更大的語境中,例如鄰近的句子甚至整個文件中。因此,開發高效的詞義分析算法是一個開放的研究領域。 描述 在許多語言中,單詞會以多種屈折形式出現。例如在英…