中文資訊交換碼(Chinese Character Code for Information Interchange,簡稱CCCII),又名全漢字標準交換碼,是由中華民國政府發展的字符集和編碼方案,由獲得中研院中美科學學術合作委員會與文建會(後升格為文化部)贊助的「國字整理小組」(全名為:資訊應用國字整理小組)所提出。開發目的是將其作為中文交換碼,使中文資訊交換更加便利。
此交換碼每個字用三個位元組存儲,在節約空間方面不如大五碼,又不像中文標準交換碼成為官方標準,所以未被電腦業界廣泛採納。香港各大學圖書館在2003年由舊有的CCCII系統換成UTF-8。故現僅臺灣和美國仍在使用,且只用於大學圖書館的線上目錄檢索系統。
簡介
1979年11月,加州史丹佛大學召開一場籌劃東亞圖書館自動化的會議,希望訂定中文交換碼的標準作為自動化之根據,以解決使用電腦處理東亞語文資料的問題。那時的漢字碼標準只有日本產業規格訂定的JIS C6226,但由於日本漢字的數目、字型皆與中文有相當程度的差異,難以作為代表,經臺灣和美國東亞圖書館華裔與會者強力反對後,決定先擱置決議,由臺灣代表謝清俊在次年三月亞洲研究學會年會,提出臺灣方面的漢字編碼方案互作比較。
臺灣於次屆亞洲學會年會上,提出共4,808字的「中文資訊交換碼」;「中文資訊交換碼」的架構為美方接受,但要求擴大編碼字集。「國字整理小組」在1981年完成第二批,包括17,032個正體字、11,517個異體字;1987年再發表第三批,包括20,583個正體字。前後二次共計擴編至53,940個漢字字碼,並完成64×64,32×32的機讀字型;此外,為了方便電腦上的文字處理,又編製了「中國文字資料庫」(Chinese Character Database,簡稱CCDB),其中列出每個字屬性如部首、筆畫、讀音以及各種對應和輸入碼。
「國字整理小組」從1979至1989十年間,共計整理、蒐集了75,684個漢字(正體字44,167、異體字31,517)。
編碼結構
該編碼以三個位元組來代表一個中文字,每位元組為7位元,並根據ISO 2022規格以94×94×94的編碼空間安放字符,最多可收納830,584個。
一個94段(Section)×94位(Position)的編碼空間稱為面(Plane)。CCCII共有94個面。以6個面組合成為1個層(Layer)。因此CCCII共有16個層,除第16層僅含4面外,其餘各層均含有6個面(即15×6+4=94)。這16個層相疊,形成一個向下延伸的三度空間,由此形成關聯。
第1個層放置正體字(正體字按常用、備用、罕用的順序分群並依序排列,各字群再按先部首、次筆畫數、最後筆順的次序排列);第2至第13個層,於同段且同位處放置與正體字對應的異體字,其中第2層專放簡體字,第13層放置日文漢字。這樣的三度空間設計使檢索某一漢字的異體字變得容易,如:-{強、强、彊}-三字的後兩個位元組是一樣的。
版本
第一冊
中文資訊交換碼第一冊於1980年4月出版,僅使用了第1面的一部分,編定的字碼包括:
本冊字表所用的字體主要採用上海印刷廠的鉛字,但仍有二十餘字缺字,則以照相打字後再拆解拼湊補足。
第二冊
中文資訊交換碼第二冊、中文資訊交換碼異體字表皆於1981年2月出版。
中文資訊交換碼第二冊第二版、中文資訊交換碼異體字表第二冊第二版先後於1982年11月、12月出版,修訂內容包含:
- 發現1982年修訂並正式啟用的教育部《常用國字標準字體表》相較於1979年版刪去7字並加入8字,刪去的7字不隨之從最常用字區中移出,而加入的8字除了「芈」字補收入最常用字區(216330)以外,其餘7字均已編入次常用字區而維持不動,不隨之自移入最常用字區;
- 刪除100組重複出現字;
- 有4字互為異體字,移入異體字表;
- 有4字位置排錯(垮、垢;躡、躪),兩兩一組互換字碼;
- 部首列錯,更正7字;字形修正152字;筆劃錯誤204字。
本次修訂後,整套中文資訊交換碼於中文字部分計收最常用字4,808字、次常用字17,077字、自最常用字或次常用字衍生之異體字11,660字(其中含簡體字3,752字),總計33,545個中文字。
中文資訊交換碼第二冊第三版、中文資訊交換碼異體字表第二冊第三版皆於1985年5月出版,修訂內容包含:
- 根據1982年《常用國字標準字體表》、《次常用國字標準字體表》修訂字形;
- 第二冊第二版曾刪除的字當中有37字符合教育部標準,填回原位;
- 刪除34組重複出現字;
- 有異體字47字誤編入正體字區,改移入異體字表;
- 第二冊、第二冊第二版字表所用的字體皆為手寫楷體,本次修訂時改用電腦製版之明體。
本次修訂後,整套中文資訊交換碼於中文字部分計收「常用字集」4,808字、「備用字集」17,032字、自最常用字或次常用字衍生之異體字11,517字(其中含簡體字3,625字),總計33,357個中文字。
第三冊
中文資訊交換碼第三冊於1987年2月出版,稱為「罕用字集」,編定的字碼包括:
修訂內容則包含:
- 部首列錯,更正75字,字碼則不變;
- 刪除26組重複出現字;
- 更正第二冊字表中錯誤的字形5字。
中文資訊交換碼異體字表第一次綜合修訂稿於1989年6月出版,修訂內容包含:
}}
外部連結
- [https://www.cns11643.gov.tw/pageView.jsp?ID=9&SN=&lang=tw#encode6 認識全字庫- 中文碼介紹 【 CCCII 碼 】]
- [https://terms.naer.edu.tw/detail/066d66a638d69cf57f0b6eb8e81d7d6e/ 《圖書館學與資訊科學大辭典》 中文資訊交換碼]
- [http://rportal.lib.ntnu.edu.tw/items/114f3e26-9eb2-4851-b76f-c87b8ca6b718 美國國會圖書電腦編目中日韓文字集]
- [https://books.google.com.tw/books?id=vsb3DwAAQBAJ&lpg=PT113&ots=eYRRNKAG9a&hl=zh-TW&pg=PT114 國家圖書館故事. 卷二, 館藏發展與整理 第四章〈館藏整理自動化〉 第一節 編定中文資訊交換碼]
- [https://www.taiwan-panorama.com/Articles/Details?Guid=B6E76D8A-E753-430A-B928-9516B80B1D40&CatId=7 台灣光華雜誌 - 中文電腦標準交換碼公佈]
- [https://www.iis.sinica.edu.tw/file/20thAnniversary/i05.html 謝清俊先生之簡介與訪談簡要(出自《中央研究院資訊科學研究所二十週年慶特刊》)]
评论 (0)