标签:#字符编码

共 16 篇文章

码位

在字符编码术语中,码位或称编码位置,即英文的code point或code position,是组成码空间(或代码页)的数值。 例如,ASCII码包含128个码位,范围是016进制到7F16进制,扩展ASCII码包含256个码位,范围是016进制到FF16进制,而Unicode包含1,114,112个码位,范围是016进制到10FFFF16进制。Unicode码空间划分为17个Unicode字符平面(基本多文种平面,16个辅助平面),每…

亂碼

编码编译UTF-8编码的“乱码”日文維基百科條目()]] 乱码指的是電腦系統不能顯示正確的字符而顯示其他無意義的字符或空白,通常是使用非预期的字符编码对文本进行解码的结果。这样所顯示出來的文字統稱為亂碼。此外,将非文本的数据以文本方式解码得到的无意义字符也称为乱码。 由于缺少字体或字体中缺少字形而导致字形渲染失败是一个不同的问题,文字通常显示为虚缺号(□)或者十六进制编码,不应与乱码混淆。 例如,微软编译器产生“-{烫烫烫}-”“-{屯…

代码页

代码页是字符编码的别名,是特定语言的字符集的一张表。 历史 早期,代码页是IBM称呼计算机的BIOS所支持的字符集编码。当时通用的操作系统都是命令行界面,这些操作系统直接使用BIOS提供的字符绘制功能来显示字符(或者是一组嵌入在显卡字符生成器中的字形)。这些BIOS代码页也被称为OEM代码页。图形操作系统使用自己的字符呈现引擎(rendering engine),可以支持多个不同的字符集编码,这类代码页被称作ANSI代码页。 早期IBM…

空白字元

在電腦程式設計中,空白字元是一個代表空位的字元。人們在键盘上按下(空格键)後就會產生空白字元。在键盘上按下键後輸入的則是製表符,不過兩者之間輸入的空格的长度可能会有所不同。人們按下後输入的則是換行符。 参考文献

動態組字

動態組字是一種汉字在電腦等領域的編碼理論及技術。 拼音文字如英文字母,一套字型只要製作26個字母和一些標點符號就足夠使用。但漢字是一種意音文字,若無數千到數萬個字符數量,便不足以應付基本的訊息交換。即便已有數萬個字符,往往在面對古籍時還有缺字的問題。這造成漢字無論是製作、儲存、使用、或交流,成本都遠高於表音文字。 因此,中國大陸和臺灣都有人在研究「動態組字」技術,這個技術的目的是解除電腦系統對漢字的束縛。作法是,只在記憶體中儲存少量(約…

Z-变体

在 Unicode 中日韓統一表意文字中,如果两个字形共享相同的词源,但外观和 Unicode 字符编码稍有不同,则两个字形互为Z-变体( 或 )。 Z轴上的区别 統一碼對中日韓統一表意文字的分配通过三个“轴”来组织。X-变体表示语义上的差异;例如,拉丁大写字母“”和希腊大写字母“”互为X-变体(尽管这个术语并不常见)。Y-变体表示外观上的显著差异,语义上差异不大;例如,繁体字“{{SetTitle|U+8C93|-{貓}-}}”和简体…

百分号编码

百分号编码(),又稱URL编码()是特定上下文的统一资源定位符(URL)的编码机制,实际上也适用于统一资源标志符(URI)的编码。也用于为application/x-www-form-urlencoded MIME准备数据,因为它用于通过HTTP的请求操作(request)提交HTML表单数据。 URI的百分号编码 URI的字符类型 URI所允许的字符分作保留与未保留。保留字符是那些具有特殊含义的字符,例如:斜线字符用于URL(或URI…

Alt码

Alt码(Alt code)即在IBM兼容个人电脑上,许多字符没有直接对应的按键,此时就可通过Alt-数字键盘输入法(Alt码)输入,方法是按住Alt键再通过数字键区输入字符代码。DOS、Microsoft Windows等许多操作系统也有类似或增强的功能。 參見 用在其它的作業系統的 組合鍵 字符值引用 Unicode輸入法 組合字符 Unicode字符列表 外部連結 [http://www.fileformat.info/tip/m…

字符编码

字符编码()、、字集碼是把字符集中的字符为指定集合中某一对象(例如:位元模式、自然数序列、八位元或者电脉冲),以便文本在计算机中存储和通过通信网络的传递。 純就字面解釋,這些術語是有不同的概念,但在許多的中文語境,這些術語會混用,有相同的概念。字符集,是指「字符的集合」,如中文字符集、英文字符集,不牽涉到編碼。字符編碼、字集碼、字碼,則是「對於某個字符集,為其字符編碼」,根據語義,有時指單一字符的編碼,有時是指全部字符的編碼。 在計算機…

博多式电报机

-{H|zh-hant:位元; zh-cn:比特;}- 博多式电报机是法国人于1874年发明的“”。主要特点是字符用5比特编码,采用两个字符集。 博多码 博多于1872年开发了他的第一台多路复用电报机,并在1874年申请专利。1876年,他按照卡爾·弗里德里希·高斯和威廉·爱德华·韦伯的建议将6位编码修改为5位编码 |- ! colspan="2"| Pattern of impulses 1=mark 0=space ! rowspa…

字符串

字符串(),是由零个或多个字符组成的有限序列。一般记为s=a_1 a_2\dots a_n(0\leq n \lneq\infty)。它是编程语言中表示文本的資料型別;}-。 通常以串的整体作为操作对象,如:在串中查找某个子串、求取一个子串、在串的某个位置上插入一个子串以及删除一个子串等。两个字符串相等的充要条件是:长度相等,并且各个对应位置上的字符都相等。设p、q是两个串,求q在p中首次出现的位置的运算叫做模式匹配。串的两种最基本的存…

從右至左書寫

仍然使用從右至左的書寫方向从右到左、从上到下]] 從右至左書寫(通常缩写为RTL、 RL-TB或R2L),书写从页面右侧开始向左,从上到下进行逐行書寫。使用希伯來字母的希伯来语和使用阿拉伯-波斯字母的阿拉伯语、波斯语、乌尔都语、克什米尔语、普什图语、维吾尔语、索拉尼库尔德语和信德语是现代广泛使用的從右至左書寫的文字系统。而馬來語不常使用的爪夷文因屬於阿拉伯-波斯字母,故也從右到左書寫。 採用直書從右至左的書寫从上到下,从右到左方式]] …

Base58

Base58是用于比特幣(Bitcoin)中使用的一种独特的编码方式,主要用于产生Bitcoin的钱包地址。相比Base64,Base58不使用数字"0",字母大写"O",字母大写"I",和字母小写"l",以及"+"和"/"符号。 设计Base58主要的目的是: 避免混淆。在某些字体下,数字0和字母大写O,以及字母大写I和字母小写l会非常相似。 不使用"+"和"/"的原因是非字母或数字的字符串作为帐号较难被接受。 没有标点符号,通常不会…

今昔文字鏡

今昔文字鏡()是日本AINet開發、出版发行的一款東亞文字檢索軟件,在Windows平臺上運行。收字量龐大,最新版本收錄文字達17萬以上。所收字類型有諸橋轍次編《大漢和辭典》中的全部漢字、和製漢字、簡化字、方言字、甲骨文、篆書等各類漢字,喃字、水族文字、悉曇文字、西夏文字、變體假名、臺灣語假名等其他文字。由石川忠久担任主席的文字鏡研究會最初将其字符集、相关软件及数据以CD-ROM形式由纪伊国屋书店重新分发。 目标 今昔文字鏡编码本为提供…

Uuencode

uuencode這個名字是衍生自"Unix-to-Unix encoding",原先是Unix系統下將二進位的資料藉由uucp郵件系統傳輸的一個編碼程式,是一種二進位到文字的編碼。uudecode是與uuencode搭配的解碼程式,uuencode/decode常見於電子郵件中的檔案傳送以及usenet新聞群組和BBS的貼文等等。近來已被MIME所大量取代。 編碼程序 Uuencode的編碼結果輸出檔案格式如下: begin [] [.…

Beta Code

Beta Code 是數位化古希臘語文獻時,爲無法正確顯示、輸入或儲存統一碼的系統設計的 ASCII 古希臘語文字編碼方案,最早由 於1970年代設計,自1981年起在加州大學爾灣分校的 研究中心作爲標準編碼開始使用,目前是學界數位化古希臘語最爲廣泛使用的編碼方案。 編碼 希臘字母表 備註 第一版 Beta Code 全部使用大寫拉丁字母作爲編碼;由於該編碼不區分大小寫,亦可以以小寫字母書寫(例:a 代表 α/a 代表 Α)。 現代通用…