标签:#计算语言学

共 41 篇文章

词义消歧

计算机语言学中,词义消歧是一个自然语言处理和本体论的开放问题。歧义与消歧是自然语言理解中最核心的问题,在词义、句义、篇章含义层次都会出现语言在上下文语义不同的现象,消歧即根据上下文确定对象语义的过程。词义消歧即在词语层次上的语义消歧。语义消歧(词义消歧) 是自然语言处理任务的一个核心与难点,影响了几乎所有任务的性能,比如搜索引擎、意见挖掘、文本理解与产生、推理等。 在语言学长期发展的过程中,语言本身积累了许多一词多义的用法。语言的产生是…

問答系統

問答系統(Question Answering System,QA System),是應用自然語言處理與資訊檢索技術回答自然語言提問的電腦系統。問答系統外部的行為上來看,其與目前主流資訊檢索技術有兩點不同:首先是查詢方式為完整而口語化的問句,再來則是其回傳的為高精準度網頁結果或明確的答案字串。以Ask Jeeves為例,使用者不需要思考該使用甚麼樣的問法才能夠得到理想的答案,只需要用口語化的方式直接提問如「請問誰是美國總統?」即可。而系…

乔治敦-IBM实验

乔治敦-IBM实验(Georgetown–IBM experiment)是1954年1月7日由喬治城大學和IBM进行的一场实验,以展示机器翻译的潜能。实验人员将60多个俄语句子使用机器翻译翻译成了英文。 这60个来基於政治因素,實驗展示以俄翻英為主,但只運用了六種規則、250個字彙與有限的句型,並以IBM原提供美國國防部使用的IBM701系列電腦進行運算。 自政治、法律、数学、科学领域的句子都已经提前进行了罗马化,并经过了精心挑选。翻译…

词嵌入

词嵌入()是自然语言处理(NLP)中语言模型与表征学习技术的统称。概念上而言,它是指把一个维数为所有词的数量的高维空间嵌入到一个维数低得多的连续向量空间中,每个单词或词组被映射为实数域上的向量。 词嵌入的方法包括人工神经网络、对词语降维、機率模型以及单词所在上下文的显式表示等。 在底层输入中,使用词嵌入来表示词组的方法极大提升了NLP中语法分析器和文本情感分析等的效果。 发展历程 词嵌入技术起源于2000年。约书亚·本希奥等人在一系列论…

计算语言学协会

国际计算语言学协会(,缩写ACL)是自然语言处理领域影响力最大的主流学术组织。该协会主办或者联合主办一系列学术会议,例如ACL学术年会(或称ACL大会,Annual Meeting of the ACL)、(EMNLP)等。 历史 1954年,乔治城-IBM实验被展示并被媒体大量报道,和诸多研究人员对该实验的宣传方式持反对意见。英韦认为这类实验需要经过明确的假设、慎重的测试和后续的审核。为了以更科学的态度研究这一全新领域,英韦找来威廉·…

神经机器翻译

神经机器翻译(,縮寫:NMT)是一种直接使用人工神经网络以端到端方式进行翻译建模的机器翻译方法。 2014年出现了第一篇关于在机器翻译中使用神经网络的科学论文,随后几年神经机器翻译又取得了一些进展和Sutskever等人提出了端到端的神經網路翻譯模型,正式使用了「神經機器翻譯」一詞。2015年,百度推出了第一個大規模的NMT系統,隔年Google亦推出其NMT系統,其他公司隨後也陸續跟進。該領域在接下來幾年取得許多進展,如大詞表NMT、…

文化组学

文化组学()是指通过电子化文本的量化分析研究人类行为与文化趋势的方法。研究者对海量数字档案进行数据挖掘以研究人们使用的语言与词汇,进而揭示其中反应出来的文化现象。“文化组学”一词是2010年创造的新词,由英文中的“文化”()与“组学”()二词合并而成,当年《自然》上发表的《通过海量电子化书籍对文化进行量化分析》(Quantitative Analysis of Culture Using Millions of Digitized Bo…

基準真相

基准真相()又称地面实况,是一个相对概念,是指相对于新的测量方式得到的测量值,作为基准的,由已有的、可靠的测量方式得到的测量值。人们往往会利用基准真相,对新的测量方式进行校准,以降低新测量方式的误差和提高新测量方式的准确性。 机器学习领域借用了这一概念。使用训练所得模型对样本进行推理的过程,可以当做是一种广义上的测量行为。 概述 在广义上,测量是指通过恰当的方法(工具和手段),用数据来描述观察到的现象,对事物作出量化描述的过程;亦即,广…

命名实体识别

具命實體辨識(,简称NER),又称作专名识别、命名实体,是指识别文本中具有特定意义的实体,主要包括人名、地名、机构名、专有名词等,以及時間、數量、貨幣、比例數值等文字。指的是可以用专有名词(名称)标识的事物,一个命名实体一般代表唯一一个具体事物个体,包括人名、地名等。 NER属于从非结构化文本中分类和定位命名实体感情的子任务,其过程是从是非结构化文本表达式中产生专有名词标注信息的命名实体表达式,目前NER有两个显著的问题,即识别和分类。…

Google神經機器翻譯系統

Google神經機器翻譯系統(,简写:GNMT),是Google開發的神經機器翻譯(NMT)系統,於2016年11月推出,它使用人工神经网络來提高Google翻譯的流暢度和準確性。Google神經機器翻譯系統通過應用(EBMT)機器翻譯方法來改進翻譯品質,系統會從數百萬個示例中學習。 历史 谷歌大脑項目於2011年由Google研究員傑夫·迪恩,格雷戈·科拉多和斯坦福大學計算機科學教授吴恩达在Google X秘密實驗室成立。吴恩达的工作…

自然语言理解

自然語言理解是研究如何讓電腦理解自然語言的一門技術,是自然語言處理技術中最困難的一項。一般来说,是将自然语言转换成一种形式化的表示结构。 研究問題 #What?:何謂理解? #How?:電腦如何能理解人類語言。 #When?:電腦瞭解到何種程度才算理解。 #Where?:自然語言如何轉換成電腦可理解的結構,如何儲存。 #Why?:電腦真的能理解嗎?為何能、為何不能。 範疇與脈絡 自然語言理解這個概括的術語,適用於多樣的電腦應用,從小型、…

WordNet

WordNet是一个由普林斯顿大学认识科学实验室在心理学教授乔治·A·米勒的指导下建立和维护的英语字典。开发工作从1985年开始,从此以后该项目接受了超过300万美元的资助(主要来源于对机器翻译有兴趣的政府机构)。 由于它包含了语义信息,所以有别于通常意义上的字典。WordNet根据词条的意义将它们分组,每一个具有相同意义的字条组称为一个synset(同义词集合)。WordNet为每一个synset提供了简短,概要的定义,并记录不同sy…

Google Ngram Viewer

Google Ngram Viewer是一个线上搜索引擎,其能根据用户输入的词语或短语,在从1500到2019年间的大量印刷书籍中,以n元語法按年统计词语或短语出现的频率所组成的语料库中检索其使用频率,若搜索的詞語搜錄於超過40本書籍,將以图表的形式展现。可选择的语料库语言有:简体中文、英语、法语、德语、希伯来语、意大利语与俄语。本軟體經常用於學術研究方面。 歷史 該計畫由Jon Orwant和Will Brockman開發,於2010…

语言资源

語言資源是指語言處理(自然語言處理)時所要用到的資源。除此之外,語言資源亦是語言學的研究材料。一種語言的文字材料以及其被錄下的發音都是它的資源,例如用粵語白話文寫成的文字材料是粵語的語言資源,但白話文基於官話,白話文文字材料就不是粵語的資源。某種語言的語料庫、維基百科以及社交媒體等都可以視為某種語言的語言資源。 語言資源對於自然語言處理以及生成式人工智能來講不可或缺,因為讓電腦處理一門語言,通常都要讓電腦讀取大量文字。例如OpenAI在…

深度学习语音合成

深度学习语音合成用深度神经网络(DNN)从文本(TTS)或频谱(声码器)生成人工语音。DNN使用大量录制语音进行训练,若是TTS系统,则要使用相关标签和/或输入文本。 有些基于DNN的语音合成器已经接近人声的自然度。 表述 给定输入文本或语言单位序列Y,目标语音X可如下求得 X=\arg\max P(X|Y, \theta) 其中\theta是模型参数。 一般来说输入文本会先传给声学特征生成器,声学特征再传给神经声码器。对前者,损失函数…

声学模型

声学模型(Acoustic model)是语音识别系统中最为重要的部分之一,目前的主流系统多采用隐马尔科夫模型进行建模。 隐马尔可夫模型的概念是一个离散时域有限状态自动机,隐马尔可夫模型HMM是指这一马尔可夫模型的内部状态外界不可见,外界只能看到各个时刻的输出值。对语音识别系统,输出值通常就是从各个帧计算而得的声学特征。用HMM刻画语音信号需作出两个假设,一是内部状态的转移只与上一状态有关,另一是输出值只与当前状态(或当前的状态转移)有…

BabelNet

BabelNet是一个多语词汇语义网络和本体,由罗马萨皮恩扎大学(罗马大学)计算机科学系的计算语言学实验室所创建。 BabelNet是自动构建的,其将最大的多语Web百科全书维基百科链接到最常用的英语计算词典WordNet。这种链接整合,以自动映射的方式完成;对于资源匮乏的语言所存在的词汇空缺,借助于统计机器翻译来补充。其结果是一个“百科词典”,提供了多种语言的概念和,并包含了它们之间的丰富的语义关系。通过与免费授权使用的、英语维基词典…

数理语言学

数理语言学(Mathematical linguistics)又稱數學語言學,是运用数学的理论和方法来研究和说明语言的一门语言学分支学科。 分支学科 按照数学方法分类 数理语言学按照运用的数学方法可以分为: 组合语言学(又称为非数值语言学或质量语言学):主要运用数学中的集论、数理逻辑、算法等研究语言 定量语言学或数值语言学或数量语言学:主要运用统计学、概率论、信息论、数理分析等研究语言 按照研究领域分类 数理语言学按照研究领域的不同可以…

Lesk演算法

Lesk演算法是迈克·莱斯克於1986年提出的词义消歧演算法。 概述 Lesk演算法是基於詞彙會與上下文有相同的主題這個假設,簡化版的演算法將有歧義的詞彙在字典中的定義與上下文進行比較。修改後的演算法被用於WordNet。以下為一個實作範例: 對於有歧義的單字,計算同時出現在上下文與字典定義中詞彙的數量。 選擇次數最高的詞彙解釋。 用於說明該演算法的常見的範例是詞彙「pine cone」,以下提供的字典定義: PINE 1. kinds…

汉语自动句法分析

汉语自动句法分析包含对汉语句法的定义以及自动分析方法。 对于如何定义,从汉语语言学家的角度来看,往往是考虑如何生成句子的问题;从计算语言学家的角度来看,则往往是一个思考如何拆分句子的问题。计算语言学家需要为输入的句子实现一个自动拆分方法,这是句法分析的实现形式。 句子的拆分 指定义拆分单元的集合,将输入的句子拆分为该集合的一个子集。一个拆分单元由两部分组成,一个部分是载体,是句子的片段;另一个是载体承载的信息,用于将载体组合成句子。例如…