标签:#计算语言学

共 41 篇文章

Stable Diffusion

Stable Diffusion是2022年發布的深度學習文本到图像生成模型。它主要用於根據文本的描述產生詳細圖像,儘管它也可以應用於其他任務,如內補繪製、外補繪製,以及在提示詞指導下產生圖生圖的转变。 它是一種擴散模型,由慕尼黑大學的CompVis研究團體開發的各種生成性人工神經網絡之一。 截至2022年10月,StabilityAI籌集了1.01億美元的資金。 Stable Diffusion的源代碼和模型權重已分别公開發布在Git…

文本分割

文本分割(Text segmentation)将书面文本分割成有意义单位的过程,如单词、句子或主题。这个术语既适用于人类阅读文本时的心理过程,也适用于在计算机中实现的人工过程,后者属于自然语言处理的领域。一些书面语言有明确的单词分界标记,例如英语的词之间有空格标识,阿拉伯语有独特的首、中、末字母形状,但这种标记不是所有书面语言都有。 分割问题 分词 分词(Word segmentation)是将一串书面语言分成其组成词的问题。中文分词指…

語文規劃

語文規劃,又称「語言計画」,是对语言进行规范化的一种工作。 語文規劃是指有意識地影響他人的行為,對收購、結構或功能分配語言。通常這將涉及發展的目的,目標和戰略,以改變語言的使用。在政府一級,語文規劃的形式語言政策。許多國家的語言管理機構是專門負責制定和實施語文規劃政策。 世界各国的語文規劃各不相同。有些国家是在政府领导下有计划地进行的,有些则是自发的。 特徵 語文規劃的任期往往被等同於一個第三世界背景,被視為一種工具,建立統一的民族語言…

基础模型

基础模型(或)指一类大型机器学习模型,它们经大规模数据训练而成(通常以自监督学习或半监督学习方式进行),以适应各种下游任务。基础模型帮助实现了人工智能系统构建方式的重大革新,例如为聊天机器人和其他面向用户的人工智能提供支持。斯坦福人类中心人工智能研究所()旗下的基础模型研究中心(,简称)推广了“基础模型”这一术语的使用。 除文本模型外,还先后诞生了各种视觉或多模式的基础模型,如DALL-E、Flamingo、Florence和NOOR等…

齊夫定律

{{Probability distribution |name = 齐夫定律 |type = 質量 |pdf_image = 的图像,其中N = 10]] 横纵坐标均为对数比例下,齐夫定律的概率质量函数的图像,其中N = 10。横坐标是指数k 。(注意,函数仅在k为整数时有定义,图上的连线不代表函数连续。) |cdf_image = 的图像,其中N = 10]] 横纵坐标均为对数比例下,齐夫定律的累积分布函数的图像,其中N = 10。…

自动作文评分

自动作文评分(,缩写为AES)是运用统计方法、机器学习和自然语言处理技术预测作文分数的教育评价方法。 自动作文评分系统通常以人工评定的作文为训练或校准资料,从作文中提取语言特征或学习文本表示,再预测整体分数或若干写作分项的得分。在高风险考试中,自动评分也可与人工评分共同使用,而不由计算机单独决定考生成绩。后来的综述将佩奇开发的作文评分计划()列为早期自动作文评分系统。 2003年,《底特律自由新闻》报道,采用e-rater的Criter…

DALL-E

。]] DALL-E是一个可以通过文本描述生成图像的人工智能程序,於2021年1月5日由OpenAI發布。 簡介 DALL-E通过120亿参数版本的GPT-3 Transformer模型来理解自然语言输入(例如“五边形形状的绿色皮革钱包”或“一只悲伤水豚的等距视图”)并生成相应的图片。它既可以生成现实的对象(例如“带有蓝色草莓图像的彩色玻璃窗”),也能够生成现实中不存在的对象(例如“具有豪猪纹理的立方体”)。它的名字是2008年動畫電影…

语义角色标注

在自然語言處理中,语义角色标注 (,SRL) 是一种浅层的语义分析技术,由标注句子中某些短语为给定谓词的论元 (语义角色) ,如施事、受事、时间和地点等。其能够对问答系统、信息抽取和机器翻译等应用产生推动作用。 此用於找到句子的含義,檢測句子的謂語或動詞相關的引數,以及如何被分類到其特定角色中。舉例來說,「瑪麗把書賣給了約翰」這句話。 代理人是「瑪麗」,謂詞是「已售」(或者更確切地說,「出售」),主題是「書」,接收者是「約翰」。 另一個…

DreamBooth

DreamBooth是一個深度學習模型,用於微調現有的,由Google Research和波士頓大學的研究人員於2022年開發。最初利用谷歌开发的的Imagen文生圖模型開發,DreamBooth可以應用到其他文生圖模型,在使用指定主題的三到五張圖像進行演算、訓練後,可以讓模型產生更精細和個性化的輸出圖像。 技術 預先訓練的文生圖,雖然通常能夠提供多種不同的圖像輸出,但缺乏生成不太知名的主題圖像所需的特異性,並且在不同情況和背景下呈現已…

N元语法

n元语法()指文本中连续出现的n个语词。n元语法模型是基于(n-1)阶马尔可夫链的一种概率语言模型,通过n个语词出现的概率来推断语句的结构。这一模型被广泛应用于概率论、通信理论、计算语言学(如基于统计的自然语言处理)、计算生物学(如序列分析)、数据压缩等领域。 当n分别为1、2、3时,又分别称为一元语法()、二元语法()与三元语法()。 示例 参考文献

文本挖掘

文本挖掘(Text mining)有时也被称为文字探勘、文本数据挖掘等,大致相当于文字分析,一般指文本处理过程中产生高质量的信息。高质量的信息通常通过分类和预测来产生,如模式识别。文本挖掘通常涉及输入文本的处理过程(通常进行分析,同时加上一些衍生语言特征以及消除杂音,随后插入到数据库中) ,产生结构化数据,并最终评价和解释输出。'高品质'的文本挖掘通常是指某种组合的相关性,新颖性和趣味性。典型的文本挖掘方法包括文本分类,文本聚类,概念/…

人工智能内容检测

人工智能检测软件旨在确定某些内容(文本、图像、视频或音频)是否是使用人工智能(AI)生成的。 截至2023年,这方面的典型案例有诸如GPTZero这样的软件,该软件声称可以检测文本是否是由人工智能生成,有时被大学和高校用于防范学生的学术抄袭。然而,关于这类软件是否可靠的争论不断,同时也存在对教育工作者可能误用AI检测软件担忧。 准确性问题 事实证明,多个人工智能检测工具在准确和全面检测生成的人工智能生成文本方面表现不可靠。在韦伯·伍尔夫…

BERT

基于变换器的双向编码器表示技术(,BERT)是用于自然语言处理(NLP)的预训练技术,由Google提出。2018年,雅各布·德夫林和同事创建并发布了BERT。Google正在利用BERT来更好地理解用户搜索语句的语义。2020年的一项文献调查得出结论:「在一年多一点的时间里,BERT已经成为NLP实验中无处不在的基线」,算上分析和改进模型的研究出版物超过150篇。 最初的英语BERT发布时提供两种类型的预训练模型以及英語維基百科语料,…

词元

词元()是自然语言处理中用于表示文本的基本单位之一,可解释为“通常所说的词元”,“处理文本的最小数据单元”或“大模型处理信息的最小信息单元”。词元可以是词、子词、字符,或其他按规则切分的字符串片段。将输入文本切分为词元序列的过程則称为词元化();在现代语言模型中,文本通常先经过词元化,再映射为词汇表索引与向量表示后进入模型计算。 原理 词元化的作用,是将连续文本转换为模型可处理的离散单位。经过切分后,每个词元会与词汇表中的一个索引相对应…

计算语言学

計算語言學,亦稱電腦語言學()是一門跨學科的研究領域,試圖找出自然語言的規律,建立運算模型,最終讓電腦能夠像人類般分析,理解和處理自然語言。 過去,計算語言學的研究一般由專門負責利用電腦處理自然語言的计算机科学家進行。由於近年的研究顯示人類語言是超乎想像的複雜,現在的計算語言學研究多由來自不同學科的專家共同進行。一般來說,研究隊伍的成員有電腦學家、語言學家、語言專家(熟悉有關研究項目所要處理的語言的人),以至研究人工智能、認知心理學、數…

自然语言处理

自然語言處理(,缩写作 *')是人工智慧和語言學領域的交叉學科,研究计算机处理、理解与生成人类语言的技術。此領域探討如何處理及運用自然語言;自然語言處理包括多方面和步骤,基本有认知、理解、生成等部分。 自然語言認知和理解是讓電腦把输入的語言变成结构化符号与语义关系,然后根据目的再處理。自然語言生成系統则是把計算機數據轉化為自然語言。 自然语言处理要研制表示语言能力和语言应用的模型, 建立计算框架来实现并完善语言模型,并根据语言模型设计各…

机器翻译

機器翻譯(,經常簡寫為,簡稱機譯或機翻)屬於計算語言學的範疇,其研究藉由计算机程序}-將文字或演說從一種自然語言翻譯成另一種自然語言。簡單來說,機器翻譯是-{zh-hant:透過;zh-hans:通过}-將一個自然語言的字辭取代成另一個自然語言的字辭。早期的方法大多基于规则或统计,如電腦輔助翻譯工具。藉由使用語料庫的技術,可達成更加複雜的自動翻譯,包含可更佳的處理不同的文法結構、辭彙辨識、慣用語的對應等。这些方法后来被神经机器翻译和大型…

手写识别

手写识别()是计算机在纸、照片、触摸屏或其他设备中接收并识别人手写的文字等信息的技术,主要应用于光学字符识别(OCR)。 脱机手写识别 离线手写识别涉及到将图像中的文本自动转换成是计算机可以使用的字符代码。离线手写识别是比较困难的,因为不同的人有不同的书写风格。离线手写识别主要应用在打印出来的文字识别上。 减少识别错误的技术 常常使用缩小识别范围,例如邮政编码只包含1~9的数字,识别这种数字可以减少错误的可能。 主要的技术: 指定特定的…

正弦波合成

正弦波合成()是一种用纯音代替共振峰的语音合成方法。哈斯金斯实验室的于1970年代开发了第一个正弦波合成程序,用于自动创建感知实验的刺激物。随后,、魯賓、大衛·皮索尼(David Pisoni)及其他同事利用该程序证明,听者可以在没有传统语音线索(音高、重音和语气)时感知连续语音。这项研究说明,可将语音看做通过发音-声学空间的轨迹的动态模式。 书目 Rubin, P.E. Sinewave synthesis. Internal mem…

語言模型

語言模型是一個自然語言中的詞語機率分佈模型,例如提供一个长度为 m 的字詞序列 w_1, w_2, ..., w_m,計算這些字詞的概率:P(w_1,\ldots,w_m)。通過语言模型,可以确定哪个词语出现的可能性更大,或者通過若干上文语境词来预测下一个最可能出现的词语。 語言模型經常使用在許多自然語言處理方面的應用,如語音識別,機器翻譯,詞性標註,句法分析,手写体识别和資訊檢索。由於字詞與句子都是任意組合的長度,因此在訓練過的語言模…