隨筆 - 6  文章 - 129  trackbacks - 0
          <2025年6月>
          25262728293031
          1234567
          891011121314
          15161718192021
          22232425262728
          293012345

          常用鏈接

          留言簿(14)

          隨筆檔案(6)

          文章分類(467)

          文章檔案(423)

          相冊

          收藏夾(18)

          JAVA

          搜索

          •  

          積分與排名

          • 積分 - 827240
          • 排名 - 49

          最新評論

          閱讀排行榜

          評論排行榜

          BIG5

          Big5是雙字節(jié)編碼,高字節(jié)編碼范圍是0x81-0xFE,低字節(jié)編碼范圍是0x40-0x7E和0xA1-0xFE。和GBK相比,少了低字節(jié)是0x80-0xA0的組合。0x8140-0xA0FE是保留區(qū)域,用于用戶造字區(qū)。

          Big5收錄的漢字只包括繁體漢字,不包括簡體漢字,一些生僻的漢字也沒有收錄。GBK收錄的日文假名字符、俄文字符Big5也沒有收錄。因為Big5當(dāng)中收錄的字符有限,因此有很多在Big5基礎(chǔ)上擴展的編碼,如倚天中文系統(tǒng)。Windows系統(tǒng)上使用的代碼頁CP950也可以理解為是對Big5的擴展,在Big5的基礎(chǔ)上增加了7個漢字和一些符號。Big5編碼對應(yīng)的字符集是GBK字符集的子集,也就是說Big5收錄的字符是GBK收錄字符的一部分,但相同字符的編碼不同。

          因為Big5也占用了ASCII的編碼空間(低字節(jié)所使用的0x40-0x7E),所以Big5編碼在一些環(huán)境下存在和GBK編碼相同的問題,即低字節(jié)范圍為0x40-0x7E的字符有可能會被誤處理,尤其是低字節(jié)是0x5C("/")和0x7C("|")的字符。可以參考GBK一節(jié)相應(yīng)說明。

          盡管有些區(qū)別,大多數(shù)情況下可以把CP950當(dāng)作Big5的別名。

          ISO-8859-1

          ISO-8859-1編碼是單字節(jié)編碼,向下兼容ASCII,其編碼范圍是0x00-0xFF,0x00-0x7F之間完全和ASCII一致,0x80-0x9F之間是控制字符,0xA0-0xFF之間是文字符號。

          ISO-8859-1收錄的字符除ASCII收錄的字符外,還包括西歐語言、希臘語、泰語、阿拉伯語、希伯來語對應(yīng)的文字符號。歐元符號出現(xiàn)的比較晚,沒有被收錄在ISO-8859-1當(dāng)中。

          因為ISO-8859-1編碼范圍使用了單字節(jié)內(nèi)的所有空間,在支持ISO-8859-1的系統(tǒng)中傳輸和存儲其他任何編碼的字節(jié)流都不會被拋棄。換言之,把其他任何編碼的字節(jié)流當(dāng)作ISO-8859-1編碼看待都沒有問題。這是個很重要的特性,MySQL數(shù)據(jù)庫默認編碼是Latin1就是利用了這個特性。ASCII編碼是一個7位的容器,ISO-8859-1編碼是一個8位的容器。

          Latin1是ISO-8859-1的別名,有些環(huán)境下寫作Latin-1。

          UCS-2和UTF-16

          Unicode組織和ISO組織都試圖定義一個超大字符集,目的是要涵蓋所有語言使用的字符以及其他學(xué)科使用的一些特殊符號,這個字符集就是通用字符集(UCS,Universal Character Set)。這兩個組織經(jīng)過協(xié)調(diào),雖然在各自發(fā)展,但定義的字符位置是完全一致的。ISO相應(yīng)的標準是ISO 10646。Unicode和ISO 10646都在不斷的發(fā)展過程中,所以會有不同的版本號來標明不同的發(fā)展階段,每個Unicode版本號都能找到相對應(yīng)的ISO 10646版本號。

          ISO 10646標準定義了一個31位的字符集。前兩個字節(jié)的位置(0x0000-0xFFFD)被稱為基本多語言面(Basic Multilingual Plane, BMP) ,超出兩個字節(jié)的范圍稱作輔助語言面。BMP基本包括了所有語言中絕大多數(shù)字符,所以只要支持BMP就可以支持絕大多數(shù)場合下的應(yīng)用。Unicode 3.0對應(yīng)的字符集在BMP范圍內(nèi)。

          UCS字符集為每個字符分配了一個位置,通常用“U”再加上某個字符在UCS中位置的16進制數(shù)作為這個字符的UCS表示,例如“U+0041”表示字符“A”。UCS字符U+0000到U+00FF與ISO-8859-1完全一致。

          UCS-2、UTF-16是UCS字符集(或者說是Unicode字符集)實際應(yīng)用中的具體編碼方式。UCS-2是兩個字節(jié)的等寬編碼,因為只是使用了兩個字節(jié)的編碼空間,所以只能對BMP中的字符做編碼。UTF-16是變長編碼,用兩個字節(jié)對BMP內(nèi)的字符編碼,用4個字節(jié)對超出BMP范圍的輔助平面內(nèi)的字符作編碼。

          UCS-2不同于GBK和Big5,它是真正的等寬編碼,每個字符都使用兩個字節(jié),這個特性在字符串截斷和字符數(shù)計算時非常方便。

          UTF-16是UCS-2的超集,UTF-16編碼的兩字節(jié)編碼方式完全和UCS-2相同,也就是說在BMP的框架內(nèi)UCS-2完全等同與UTF-16。實際情況當(dāng)中常常把UCS-16當(dāng)作UCS-2的別名。

          UCS-2和UTF-16在存儲和傳輸時會使用兩種不同的字節(jié)序,分別是big endian和little endian(大尾和小尾)。例如“啊”(U+554A)用big endian表示就是0x554A,用little endian表示就是0x4A55。UCS-2和UTF-16默認的字節(jié)序是big endian方式。在傳輸過程中為了說明字節(jié)序需要在字節(jié)流前加上BOM(Byte order Mark),0xFEFF表示是big endian,0xFFFE表示是little endian。UCS-2BE、UCS-2LE是實際應(yīng)用中使用的編碼名稱,對應(yīng)著big endian和little endian,UTF-16BE、UTF-16LE也是如此。因為默認是BE字節(jié)序,所以可以把UCS-2當(dāng)做是UCS-2BE的別名。

          在UCS編碼中有一個叫做“ZERO WIDTH NO-BREAK SPACE”的字符,它的編碼是U+FEFF,是個沒有實際意義的字符。UCS規(guī)范建議我們在傳輸字節(jié)流前,先傳輸字符“ZERO WIDTH NO-BREAK SPACE”,如果傳輸?shù)腪ERO WIDTH NO-BREAK SPACE是0xFEFF就說明是big endian,反之就是little endian。

          UCS-2和UTF-16也可以理解為和ASCII以及ISO-8859-1兼容,在ASCII編碼或者ISO-8859-1編碼的每個字節(jié)前加上0x00,就得到相應(yīng)字符的UCS-2編碼。

          UCS-2和UTF-16中會使用0x00作為某個字符編碼的一部分,某些系統(tǒng)會把0x00當(dāng)作字符串結(jié)束的標志,在處理UCS-2或UTF-16編碼時會出現(xiàn)問題。

          UTF-8

          UTF-8是UCS字符集的另一種編碼方式,UTF-16的每個單元是兩個字節(jié)(16位),而UTF-8的每個單元是一個字節(jié)(8位)。UTF-16中用一個或兩個雙字節(jié)表示一個字符,UTF-8中用一個或幾個單字節(jié)表示一個字符。

          可以認為UTF-8編碼是根據(jù)一定規(guī)律從UCS-2轉(zhuǎn)換得到的,從UCS-2到UTF-8之間有以下轉(zhuǎn)換關(guān)系:

          UCS-2 UTF-8
          U+0000 - U+007F 0xxxxxxx
          U+0080 - U+07FF 110xxxxx 10xxxxxx
          U+0800 - U+FFFF 1110xxxx 10xxxxxx 10xxxxxx

          例如“啊”字的UCS-2編碼是0x554A,對應(yīng)的二進制是0101 0101 0100 1010,轉(zhuǎn)成UTF-8編碼之后的二進制是1110 0101 10 010101 10 001010,對應(yīng)的十六進制是0xE5958A。

          UCS-4也是一種UCS字符集的編碼方式,是使用4個字節(jié)的等寬編碼,可以用UCS-4來表示BMP之外的輔助面字符。UCS-2中每兩個字節(jié)前再加上0x0000就得到了BMP字符的UCS-4編碼。從UCS-4到UTF-8也存在轉(zhuǎn)換關(guān)系,根據(jù)這種轉(zhuǎn)換關(guān)系,UTF-8最多可以使用六個字節(jié)來編碼UCS-4。

          根據(jù)UTF-8的生成規(guī)律和UCS字符集的特性,可以看到UTF-8具有的特性:

          1. UTF-8完全和ASCII兼容,也就是說ASCII對應(yīng)的字符在UTF-8中和ASCII編碼完全一致。范圍在0x00-0x7F之內(nèi)的字符一定是ASCII字符,不可能是其他字符的一部分。GBK和Big5都存在的缺陷在UTF-8中是不存在的。
          2. 大于U+007F的UCS字符,在UTF-8編碼中至少是兩個字節(jié)。
          3. UTF-8中的每個字符編碼的首字節(jié)總在0x00-0xFD之間(不考慮UCS-4支持的情況,首字節(jié)在0x00-0xEF之間)。根據(jù)首字節(jié)就可以判斷之后連續(xù)幾個字節(jié)。
          4. 非首字節(jié)的其他字節(jié)都在0x80-0xBF之間;0xFE和0xFF在UTF-8中沒有被用到。
          5. GBK編碼中的漢字字符都在UCS-2中的范圍都在U+0800 - U+FFFF之間,所以每個GBK編碼中的漢字字符的UTF-8編碼都是3個字節(jié)。但GBK中包含的其他字符的UTF-8編碼就不一定是3個字節(jié)了,如GBK中的俄文字符。

          在UTF-8的編碼的傳輸過程中即使丟掉一個字節(jié),根據(jù)編碼規(guī)律也很容易定位丟掉的位置,不會影響到其他字符。在其他雙字節(jié)編碼中,一旦損失一個字節(jié),就會影響到此字節(jié)之后的所有字符。從這點可以看出UTF-8編碼非常適合作為傳輸編碼。



          posted on 2007-09-13 15:01 Ke 閱讀(1050) 評論(0)  編輯  收藏 所屬分類: encoding
          主站蜘蛛池模板: 任丘市| 同德县| 攀枝花市| 太仆寺旗| 正阳县| 屯门区| 原阳县| 象州县| 淳化县| 白银市| 哈尔滨市| 河池市| 钦州市| 普宁市| 六盘水市| 桓仁| 安平县| 榆中县| 弥勒县| 达州市| 永泰县| 白城市| 闻喜县| 秦安县| 涟源市| 尤溪县| 山丹县| 巨野县| 泾川县| 西华县| 墨江| 韶关市| 博乐市| 丹东市| 枝江市| 连平县| 米脂县| 灵寿县| 庄河市| 达拉特旗| 洞头县|