漢字描述語言

漢字描述语言是指可以完整且準確地描述漢字字符和信息的计算机语言,它們包含了字符的组成、(基本和複雜的)笔画、顺序以及位置,旨在克服在使用點陣圖來描述字形時所遇到的信息缺乏。其所包含的訊息可以來識別字符(統一碼和通用字符集统一为一个碼位)的異體字,或一些統一碼和通用字符集尚未收錄的罕見字。

它們的工作,大多是基於楷書和宋體,來提供字符的汉字结构,因而可以藉由索引字符的内部結構和相似字符,從而更容易地查找字符。

字形描述語言
字形描述语言(,簡稱:CDL),或稱字描語,是基於XML的字型技術,由畢曉普()和 曲理查() 为文林研究所所共同創建。其目的在描述任何CJK 字符,但可用于描述任何字形。

这种基于 XML 的宣告式语言定义了每個組件(字形的一个子单元,类似于部首,但不一定具有真正部首的语义意义)的筆順,以及使用先前定义的组件所构建更复杂的字符。除了用作构建组件之外,这些组件中的许多组件本身就是字符。

背景看起来像一个每边128 像素的正方形。在这个背景下:

使用可縮放向量圖形,可繪製 50 个笔画。

一个基本组件是通过调用數个笔画来组成的。在此组件中,每个笔画都由其左下角和右上角描述。可以进行转换(缩小、放大等) 。有 1,000 多个基本组件。

一个字符是通过调用几个组件组成的。在这个字符中,每个组件都由其左下角和右上角描述。为了使组件适合汉字矩形块的适当部分,在將部分嵌入構建方塊時,可以轉換(如:水平、重直或放大、縮小)。

因此,一组少于 50 个笔画允许构建一组大约 1,000 个组件 ,这些组件又可以嵌入到数万个字符的描述中。

HanGlyph
用于在文檔中提供缺失的罕見字(即外字问题)的漢字描述語言。 文档可以包含缺失字符的标记,这将自动触发生成小字体以提供字符。语言本身是一个简单的后缀符号,描述了笔画和组合它们的方式。原型软件使用Metapost来描給字符并将它们嵌入到LaTeX文档中。该语言由 Wai Wong 于 1997 年提出 ,2003年的 TeX使用者會議上,則有關於實作的論文。

表意文字描述序列
統一碼第 12 章定義了“表意文字描述序列”(IDS) 的语法,旨在用于描述标准中未包含的字符,即根据具有代码点的组件组合。 U+2FF0 到 U+2FFB 范围内的十二个特殊字符充当前缀运算符,以组合其他字符或序列以形成更大的字符。

这些序列对于向读者描述無法直接顯示的字符很有用,因为它在给定字体中不存在,或者完全不存在于統一碼标准中。例如,方塊壯字 字符“”(在中日韩统一表意文字扩展 F 中编码为 U+2DA21 𭨡),可以描述成“⿰-{書史}-”。另一个用途是用于查找字典,即作为用來輸入查询的一种簡略输入法。

这些序列的呈現方式,可以是分別地保留所有字符,或通过解析序列後來繪製目標字符。 它们本身并不能为所有字符提供明确的描繪。例如,序列「⿱十一」代表「土」和「士」。方式

这些序列的統一碼规范基于早期GBK标准的字符和语法。

Matthew Skala 提供的自由软件包 IDSgrep 扩展了統一碼的表意文字描述序列语法,包括用于字典查找的附加功能;它能够将 KanjiVG 的数据库转换为它自己的扩展 IDS 格式,或者針對由相关的 Tsukurimashou 字体所生成的 EIDS 文件來搜尋。

KanjiVG
KanjiVG 是一种自由 (CC-by-sa-3.0) 日语字符描述语言(旨在最终扩展到中文),它是基于SVG和維基編輯系统。

SCML
2007年,结构字符建模语言是另一個基于XML的汉字描述语言,其定位不像字描語和HanGlyph那样基于数字网格。其資料庫所使用的筆畫、部件是以 SCML 编码。其資料庫儘用于原理演示,目前没有已知的尝试將 SCML 套用在所有的統一碼,為 CJK 字符进行编码。

參見

  • 動態組字

*統一碼

  • 說文解字部首列表,許慎(公元 147 年)在《说文解字》中使用 540 個部首
  • 康熙部首,在康熙皇帝時期所編纂的康熙字典(1716)所列出的 214 個部首
  • 統一碼部首列表,由統一碼所滙整的 CJK 部首。
  • 倉頡輸入法
  • 部首
  • 筆劃
  • 笔画顺序

外部链接
; 文林学院CDL语言

*
*
*
*
** 2003/12/31 更正:
*
*

; SCML

*

; 字形

*
*

參考資料

评论 (0)

  • 还没有评论,来抢沙发吧。