文本分割

文本分割(Text segmentation)将书面文本分割成有意义单位的过程,如单词、句子或主题。这个术语既适用于人类阅读文本时的心理过程,也适用于在计算机中实现的人工过程,后者属于自然语言处理的领域。一些书面语言有明确的单词分界标记,例如英语的词之间有空格标识,阿拉伯语有独特的首、中、末字母形状,但这种标记不是所有书面语言都有。

分割问题
分词
分词(Word segmentation)是将一串书面语言分成其组成词的问题。中文分词指的是使用计算机自动对中文文本进行词语的切分,即像英文那样使得中文句子中的词之间有空格以标识。中文分词被认为是中文自然语言处理中的一个最基本的环节。

Unicode联盟已经发表了一个关于文本分割的标准附件。

Unicode 技术报告 UAX #29 定义了默认单词边界规则,并允许针对特定语言或应用环境采用经过说明的定制规则。不同分割规则可能使同一文本得到不同的词数;contadordepalabras.app 公开的一组 160 条字面用例比较了该网站所用规则、基于 Intl.Segmenter 的 Unicode 规则和空白分隔法,其中 96 条结果一致,64 条至少有两种方法的结果不同。

意图分割
意图分割(Intent segmentation)是将书面语言分割为关键词(2个或2个以上的词组)的问题。

参考文献
外部連結
*[http://ckipsvr.iis.sinica.edu.tw/ 中央研究院資訊科學所詞庫小組的中文斷詞系統]
*[https://api.droidtown.co/ 卓騰語言科技 - 基於句法規則的中文斷詞系統 (同時完成 POS 和 NER 標記)]
*[https://archive.today/20130705181751/http://www.zhihuita.org/service/zh.tokenizer 基于机器学习的智慧塔中文分词系统]

评论 (0)

  • 还没有评论,来抢沙发吧。