标签:#Unicode

共 45 篇文章

统一码

Unicode,全稱為Unicode標準(The Unicode Standard),其官方機構Unicode聯盟所用的中文名称为統一-{}-碼,又译作萬國-{}-碼、統一字元碼、统一字符编码,是信息技术領域的一種字符编码標準,其整理了世界上大部分的文字系統,使得電腦能以通用劃一的字符集來字元編碼以及處理和顯示文字,不但減輕在不同字符編碼間切換和轉換的困擾,更提供了一種跨平臺的亂碼問題解決方案。Unicode由非營利機構Unicode聯…

Unicode等價性

Unicode等價性()是為和許多現存的標準能夠相容,Unicode(統一碼)包含了許多特殊字符。在這些字符中,有些在功能上會和其它字符或字符序列等價。因此,Unicode將一些碼位序列定義成相等的。Unicode提供了兩種等價概念:標準等價和相容等價。前者是後者的一個子集。例如,字符n後接著組合字符~標準等價和相容等價於Unicode字符ñ。而合字ff則只有相容等價於兩個f字符。 Unicode正規化()是文字正規化的一種形式,是指將彼…

Uniscribe

Uniscribe是微軟公司開發的Windows作業系統為正確演示Unicode文字而開發的組件。系統的核心是一個名為USP10.DLL的DLL。它從Windows 2000開始連同Windows一起綑綁;Win9x的用戶在更新至Internet Explorer 5.0之後,系統亦會安裝有本組件。此外,Windows CE從5.0開始亦支援Uniscribe。 其實從Windows 7開始,Uniscribe已經隨着功能更多的Dire…

Unicode字符平面映射

目前的統一碼字元分為17組編排,每組稱為平面(Plane),每平面有65536(216)點代碼,但目前只用了少數平面。 以下為基本多文种平面的編碼表: 基本第一第二第三…第十四第十五第十六 第一輔助平面 第一輔助平面又稱多文種補充平面(Supplementary Multilingual Plane,縮寫SMP,或簡稱Plane 1),主要擺放絕大多數古代文字,現時已不再使用或很少使用文字、速記、数学字母符号、音符、圖形符號及用于学者的…

Unicode字型

Unicode字型(或称 UCS字体、Unicode字体)指的是字符(字母、数字、符号、字形等)收录范围较为广泛的-{ zh-cn:计算机字体; zh-tw:電腦字型;}-。这些字符都被集入通用字符集(UCS),来自全世界的各种语言和书写系统。不像大部分传统的电脑字型,Unicode字型并不局限于某几种语言或某种老旧字符集,收录的字符数也远超传统字体中UCS小子集的数量。Unicode字型尝试收录几千种可能的字形,以便可在多种语言的文稿…

Unicode區段

在Unicode中,字区或區段(block),也译为码块或統一-{}-碼塊,是一組連續碼位的範圍;區段會給予唯一的名稱,且區段與區段間不會重疊。通常一個最小的區段至少包含16個碼位,即 hhh0到hhhF。 一個區段可以明確地包含未分配的碼位和非字符。 不屬於任何已命名區段的碼位(例如尚未正式使用的第4-第13平面),上面碼位關於區段的值會被設為 block="No_block".。相反地,每個分配的代碼點都有一個「區段名稱」的屬性,表…

國際音標

{{Selfref|關於国际音标在维基百科中的-{zh-hans:帮助; zh-hant:說明;}-,請見國際音標。}} 國際音標(,)是一种以拉丁字母為基礎的標音系統,19世纪末由國際語音學學會設計。 國際音標可以用来表示口語中詞彙(也包括有限的韵律)的发音的一部分话语特性:音位、語調、声调和音節的分隔。,共有107個單獨字母、52個變音符號和4個超音段成分符號。 读者可參見國際音標表(有声国际音标肺部气流音表、元音表)或國際語音學學…

Unicode字符列表

本條目以列表形式展示並介紹Unicode字符。如果字母顯示模糊,可將瀏覽器字型改為「Arial Unicode MS」等支援較完整的字型,或調高瀏覽器的放大比率。 若要依照編碼查詢Unicode字符,請參見Unicode一覽表。 控制代码 共有65个字符,包含删除命令但不含空格。 拉丁字母 Unicode标准(7.0版本)将1338个字符归为拉丁字母。 基本拉丁字母 共有95个字符,其中52个属于拉丁字母,剩下的43个属于基本字符。 有…

XML与HTML字符实体引用列表

在SGML、HTML与XML文档中,如果某些Unicode字符无法由文档当前使用的编码方式(如ISO-8859-1)直接表示,可以通过字符值引用或字符实体引用这两种转义序列表示。下文列出HTML与XML文档中有效的字符实体引用。 XML中的预定义实体 XML规范并不使用“字符实体”(character entity)或“字符实体引用”(character entity reference)。 XML规范定义了5个“预定义实体”来表示特殊…

CSUR

CSUR(,人工文字Unicode登記庫)是一个协调Unicode私人使用区中分配给的码位的志愿项目。这个项目由创立,并由他和叶密豪维护。这个项目与统一码联盟官方并无关联。 自2008年以來,CSUR基本上處於未受維護的狀態;當年科文表示,由於叶密豪忙於其他事務,無法繼續管理這個專案。由於該專案的停滯,蕾貝卡·貝滕科特(Rebecca Bettencourt)創建了UCSUR(,非正式人工文字Unicode登記庫),旨在協調構造語言的字…

Unicode拉丁字母預組字符列表

Unicode拉丁字母預組字符列表: 變音符號 大寫 以下列表是帶有變音符號的大寫拉丁字母版本。大多數這些變音字母都有兩種:大寫字母和小寫字母,有些只有大寫(如İ),一些則只有小寫(如ẗ)。 小寫 以下列表是帶有變音符號的小寫拉丁字母版本: 連字 大寫 以下列表是連字的大寫字母版本: 小寫 以下列表是連字的小寫字母版本: 混合 以下列表是連字的混合大小寫版本: 其它 參見 合字 死键 拉丁字母 组合字符 Unicode等价性 复杂文字编…

零宽不连字

零宽不连字 (英文:zero-width non-joiner,縮寫:ZWNJ)是一个不打印字符,放在电子文本的两个字符之间,抑制本来会发生的连字,而是以这两个字符原本的字形来绘制。Unicode中的零宽不连字字符映射为,HTML字符值引用为: ‌ 零宽不连字用于矫正文本中的连字的出现 例子: 在德语中,连字不能跨越复合词组成成分的边界。所以分属两个复合成分的f与l不能形成连字fl. ZWNJ用于替代性字形显示 在印度系文字中,带hal…

箭号

箭号(arrow symbol,arrow),俗称“箭头”(arrowhead),是一种图形符号(graphical symbol)或象形图用于指明方向、表达趋势或其他抽象用途。 在最简单的形式中,箭号是由三角形、(chevron)或凹面筝形(concave kite)构成的,通常附着在一条线段或矩形上(例如 ←、↑、⇨ 或 ⇩);而在更复杂的形式中,它则是对真实箭矢的具象化表示(例如 ➵ U+27B5)。箭号所指示的方向,是沿直线或矩…

國際表意文字核心

國際表意文字核心(',簡稱'或易擴)是現時漢字編碼的最小標準。它總共記載了東亞地區的一萬個常用字,包括東亞地區各個國家及地區的第一常用字平面。這一萬字的組合如下: 中國大陸(6944字) 台灣(6608字) 香港(5139字) 澳門(4960字) 日本(4593字) 南韓(4759字) 朝鮮(4653字) 其他被收入Unicode的字(7772字) 這一萬個字所包含的,並不單單限於中日韓統一表意文字基本字面的漢字。當中有42個字位於擴展…

中日韓統一表意文字

中日韓統一表意文字(),又稱統漢碼、統一漢字集(),是指在ISO 10646與統一碼標準中經過「漢字等同」處理的漢字。漢字等同()是指將中文、日文、韓文、越南文、壮文、琉球文等書寫系統共通的中日韩汉字賦予相同編碼的做法;被合併編碼的漢字,往往起源相同、本義相通、形狀大同小異。 中日韓認同表意文字 中日韓統一漢字集 中日韓統合漢字 除了「漢字等同」,Han Unification 又譯為: 漢字認同 漢字統一 漢字統合 歷史 1978年,…

右至左符號

右至左符號(,缩写RLM)是一種控制字符,用于計算機的雙向文稿排版中。 右至左符號的Unicode字符是U+200F,亦可在HTML中表現為‏ ‏或者‏. 參見 Unicode 左至右符號 双向文稿 外部連結 [http://unicode.org/reports/tr9/ Unicode standard annex 雙向算法] * [http://www.fileformat.info/info/unicode/char/200f/…

变体 (Unicode)

在Unicode中,字符变体指通过编码字符序列显示同一字符的不同字形。这种变体序列()由一个基本字符后紧跟一个变体选择符(variation selector)组成。 一个字符的变体通常与它的基本字符有非常相像的外观和涵义。这项技术旨在当一个字符的变体字形不可用时,仍显示其基本字符,却不改变文本本身的涵义。 Unicode定义了两种变体序列: 标准变体序列():由统一码字符数据库()文件StandardizedVariants.txt收…

XeTeX

XeTeX(或,風格化後写作)是一种使用Unicode的TeX排版引擎,并支持一些现代字体技术,例如OpenType、Graphite和(AAT)。其作者和维护者是Jonathan Kew,并以X11自由软件许可证发布。 虽然最初只是为Mac OS X所开发,但它现在在各主要平台上都可以运作。它原生支持Unicode,并默认其输入文件为UTF-8编码。可以在不进行额外設定的情况下直接使用操作系统中安装的字体,因此可以直接利用OpenTy…

統一碼技術委員會

統一碼技術委員會(,簡稱UTC)負責發展和維護統一碼標準,包括:統一碼字符數據庫、統一碼技術標準、統一碼技術報告。每隔一段時間,委員會會發佈最新的「[http://www.unicode.org/errata/index.html 更新和正誤表] 」。 統一碼技術委員會會每年會有4次集會。議程會在開會前兩星期通知各會員。 外部連結 *[http://www.unicode.org/consortium/utc.html 官方網站]

Z-变体

在 Unicode 中日韓統一表意文字中,如果两个字形共享相同的词源,但外观和 Unicode 字符编码稍有不同,则两个字形互为Z-变体( 或 )。 Z轴上的区别 統一碼對中日韓統一表意文字的分配通过三个“轴”来组织。X-变体表示语义上的差异;例如,拉丁大写字母“”和希腊大写字母“”互为X-变体(尽管这个术语并不常见)。Y-变体表示外观上的显著差异,语义上差异不大;例如,繁体字“{{SetTitle|U+8C93|-{貓}-}}”和简体…