标签:#语料库

共 5 篇文章

布朗语料库

布朗语料库(英语:),全称布朗大学标准现代美国英语语料库(英语:),是1961年由布朗大学的和编制、1964年正式发布的美国英语语料库,也是第一个经过结构化处理的大规模英语语料库,对语料库语言学的形成和发展产生了深远影响。 历史 布朗语料库的设计受到了伦敦大学学院(SEU)的启发。SEU自1950年代末起便尝试建立电子化语料库,但项目直到1980年代末才完成。1960年代初,库切拉和弗朗西斯决定在美国建立类似的语料库。 语料库的设计得到…

美国当代英语语料库

美国当代英语语料库(,简称COCA)是一个十亿词的当代美国英语语料库 。它由楊百翰大學(BYU)语料库语言学退休教授马克·戴维斯创建。 内容 截至2021年11月,美国当代英语语料库 (COCA)由10亿个单词组成。语料库的数据还在不断更新:截至2009年已包含超过3.85亿个单词;截至2010年已增长到4亿个单词;到2019年3月已增长到5.6亿个单词。 同时参照 美国国家语料库 英国国家语料库 英语银行 布朗语料库 参考 延伸阅读 …

TIMIT

TIMIT(),是由德州仪器、麻省理工学院和SRI International合作构建的声学-音素连续语音语料库。 TIMIT数据集的语音采样频率为16kHz,一共包含6300个句子,由来自美国八个主要方言地区的630个人每人说出给定的10个句子,所有的句子都在音素级别(phone level)上进行了手动分割,标记。70%的说话人是男性;大多数说话者是成年白人。 外部連結 *

波恩大全

《拜占庭历史文献大全》(拉丁语:Corpus Scriptorum Historiae Byzantinae,CSHB),或称《波恩大全》是一部重要的拜占庭史一次文献集,共有50卷,1828-1897年在德国波恩陆续出版。其中的每一卷都包含拜占庭历史文本的希腊文批评版本,并有相应的拉丁文翻译。这一项目由德国历史学家巴特霍尔德·格奥尔格·尼布尔倡导,旨在修订并拓展原有的《拜占庭历史大全》(Corpus Byzantinae Histori…

口语语料库

口语语料库为语言音频文件和文字副本的数据库。在里,口语语料库可用于创建声学模型,配合语音识别引擎使用。在语言学里,口语语料库可用于语音学、、方言学等方面的研究。 口语语料库主要分为朗读语料和自然口语两类。 参考文献 Edwards, Jane / Lampert, Martin (eds.) (1992): Talking Data – Transcription and Coding in Discourse Research. Hi…