标签:#中文漢字處理

共 4 篇文章

漢字描述語言

漢字描述语言是指可以完整且準確地描述漢字字符和信息的计算机语言,它們包含了字符的组成、(基本和複雜的)笔画、顺序以及位置,旨在克服在使用點陣圖來描述字形時所遇到的信息缺乏。其所包含的訊息可以來識別字符(統一碼和通用字符集统一为一个碼位)的異體字,或一些統一碼和通用字符集尚未收錄的罕見字。 它們的工作,大多是基於楷書和宋體,來提供字符的汉字结构,因而可以藉由索引字符的内部結構和相似字符,從而更容易地查找字符。 字形描述語言 字形描述语言(…

動態組字

動態組字是一種汉字在電腦等領域的編碼理論及技術。 拼音文字如英文字母,一套字型只要製作26個字母和一些標點符號就足夠使用。但漢字是一種意音文字,若無數千到數萬個字符數量,便不足以應付基本的訊息交換。即便已有數萬個字符,往往在面對古籍時還有缺字的問題。這造成漢字無論是製作、儲存、使用、或交流,成本都遠高於表音文字。 因此,中國大陸和臺灣都有人在研究「動態組字」技術,這個技術的目的是解除電腦系統對漢字的束縛。作法是,只在記憶體中儲存少量(約…

繁簡轉換

繁-{}-简转换,或稱正-{}-簡轉換,指繁体字与简体字的互相转换,实际使用时通常包括台灣、香港、澳门、中国大陆、新加坡、马来西亚地區所使用的標準中文之中不同字、词的相互轉換。中国大陆对汉字简化并非全部採用“一对一”方式,有部分用字採用“一对多”方式,准确转换汉字相当困难。目前已经有相当多的专业人士正利用各种方法解决此难题。 「简繁转换」可以认为是从简体中文向繁体中文的转换,又称「简繁体转换」、「简繁翻译」等;相反方向的转换则是「繁简转…

小學堂文字學資料庫

小學堂文字學資料庫於2013年4月25日開始運作,現由中央研究院數位文化中心維護運行。該資料庫承襲了中央研究院2005年至2013年的漢字構形資料庫,以及中研院資訊科學研究所和台大中文系共同開發的漢字古今音資料庫,是提供中文研究所需、查詢文字學演變與釋義的跨資料庫整合查詢工具。此資料庫由行政院國家科學委員會經費補助,中央研究院歷史語言研究所、資訊科學研究所、以及台灣大學中國文學系所共同開發。 小學堂收錄內容主要分為「字形」(漢字古今字資…