布朗语料库(英语:),全称布朗大学标准现代美国英语语料库(英语:),是1961年由布朗大学的和编制、1964年正式发布的美国英语语料库,也是第一个经过结构化处理的大规模英语语料库,对语料库语言学的形成和发展产生了深远影响。
历史
布朗语料库的设计受到了伦敦大学学院(SEU)的启发。SEU自1950年代末起便尝试建立电子化语料库,但项目直到1980年代末才完成。1960年代初,库切拉和弗朗西斯决定在美国建立类似的语料库。
语料库的设计得到了多位专家的协助:SEU的创始人、后来主编《韦氏第三版新国际英语词典》的菲利普·巴布科克·戈夫,以及心理学家。经过多次会议,他们决定:语料库由1961年在美国出版的500篇文本组成,每篇约2000词,覆盖15个体裁类别。
语料库的构建工作于1963至1964年间进行,得到美国教育部约23000美元的资助。 文本以IBM 7070数据处理系统处理后存储在7轨或9轨磁带上。 1967年,库切拉和弗朗西斯出版了《现代美国英语的计量分析》(Computational Analysis of Present-Day American English),对语料库进行了系统的统计分析。 1971年和1979年,语料库的内容又经过了修订和扩充。
构成
布朗语料库由500个文本样本组成,每个样本约2000词,总计1,014,312词。所有样本均来自1961年由美国英语母语者首次出版的散文作品。诗歌和戏剧因体裁特殊未被纳入,但散文中引用的短诗段落予以保留。
词性标注
布朗语料库最初仅包含词本身和位置标识。1970年代起,研究人员开始为语料库添加。Greene和Rubin开发的早期标注程序在工作中贡献巨大,但由于错误率较高,仍需大量人工校对。
经过标注的布朗语料库(Form C)采用了约80个词性标签,覆盖名词、动词、形容词等主要词类,并包含合成词、缩写词、外来词等特殊标记。这些标签成为后来多个语料库的参照标准,如1978年的(LOB语料库,遵循布朗方法构建的英国英语语料库)以及1990年代的(FROWN)。
影响
布朗语料库是第一个经过结构化处理的大规模电子化英语语料库,开启了语料库语言学这一新领域。1969年出版的《美国传统词典》在编纂过程中参考了布朗语料库的词频统计,是第一部基于语料库方法编纂的大型英语词典。
布朗语料库的构建方法——按特定年份收集某地区英语文本,每2000词为一个采样单位,按体裁类别随机采样——被后来的多个语料库沿用,这些语料库合称为"布朗家族"(Brown Family)。(LOB语料库,1978)和(1990年代)是其中的代表。
布朗语料库已被纳入Natural Language Toolkit(NLTK),21世纪以来仍被广泛应用于语言学研究中。
参考资料
外部链接
- [https://www.nltk.org/nltk_data/ NLTK语料库下载]
- [https://listings.lib.msu.edu/public-corpora/cd421/manuals/brown/INDEX.HTM 布朗语料库使用手册(MSU镜像)]
评论 (0)