Unicode 和 UTF-8 有何区别

 我来答

4个回答

#热议# 应届生在签三方时要注意什么？

yayahehedq
2018-04-12 · TA获得超过1.7万个赞

知道小有建树答主

回答量：269

采纳率：100%

帮助的人：4.6万

我也去答题访问个人页

关注

展开全部

二者区别如下：

Unicode是指每一个字符对应一个十六进制数字。计算机只懂二进制，严格按照unicode的方式(UCS-2)。
而UTF-8是指单字节的字符，字节的第一位设为0，对于英语文本，UTF-8码只占用一个字节，和ASCII码完全相同；n个字节的字符(n>1)，第一个字节的前n位设为1，第n+1位设为0，后面字节的前两位都设为10，这n个字节的其余空位填充该字符unicode码，高位用0补足。

一、Unicode简介：

Unicode（统一码、万国码、单一码）是计算机科学领域里的一项业界标准,包括字符集、编码方案等。Unicode 是为了解决传统的字符编码方案的局限而产生的，它为每种语言中的每个字符设定了统一并且唯一的二进制编码，以满足跨语言、跨平台进行文本转换、处理的要求。1990年开始研发，1994年正式公布。

二、UTF-8简介：

UTF-8（8-bit Unicode Transformation Format）是一种针对Unicode的可变长度字符编码，也是一种前缀码，又称万国码。由Ken Thompson于1992年创建。它可以用来表示Unicode标准中的任何字符，且其编码中的第一个字节仍与ASCII兼容，这使得原来处理ASCII字符的软件无须或只须做少部份修改，即可继续使用。因此，它逐渐成为电子邮件、网页及其他存储或传送文字的应用中，优先采用的编码。

已赞过 已踩过<

评论收起

szlproche
2016-06-24 · TA获得超过654个赞

知道小有建树答主

回答量：396

采纳率：50%

帮助的人：212万

我也去答题访问个人页

关注

展开全部

Unicode包含UTF-8 。
狭义Unicode指UTF-16，即文档所有字符均用Unicode编码，每个字符2字节。有UTF-16 LE（windows或Linux）和BE（Macintosh）两种，取决于从高位还是低位字节读取。
UTF-8指能用ASCII编码的字符用ASCII编码，其它字符均用Unicode编码，每个字符大小可变。一般UTF-8用于标记语言（比如XML之类），所以不用担心高低字节的问题。

已赞过 已踩过<

评论收起

百度网友fb4dd75
2016-06-23 · 超过16用户采纳过TA的回答

知道答主

回答量：48

采纳率：0%

帮助的人：16.9万

我也去答题访问个人页

关注

展开全部

unicode是字符集，utf8是unicode的一种编码方式

本回答被网友采纳

已赞过已踩过<

你对这个回答的评价是？
评论收起

huanglenzhi
2016-06-23 · 知道合伙人数码行家

huanglenzhi
知道合伙人数码行家

采纳数：117538 获赞数：517195

长期从事计算机组装，维护，网络组建及管理。对计算机硬件、操作系统安装、典型网络设备具有详细认知。

向TA提问私信TA

关注

展开全部

你看到的unicode字符集是这样的编码表：

I 0049
t 0074
' 0027
s 0073
  0020
知 77e5
乎 4e4e
日 65e5
报 62a5

每一个字符对应一个十六进制数字。

计算机只懂二进制，因此，严格按照unicode的方式(UCS-2)，应该这样存储：

I 00000000 01001001
t 00000000 01110100
' 00000000 00100111
s 00000000 01110011
  00000000 00100000
知 01110111 11100101
乎 01001110 01001110
日 01100101 11100101
报 01100010 10100101

这个字符串总共占用了18个字节，但是对比中英文的二进制码，可以发现，英文前9位都是0！浪费啊，浪费硬盘，浪费流量。

怎么办？

UTF。

UTF-8是这样做的：

1. 单字节的字符，字节的第一位设为0，对于英语文本，UTF-8码只占用一个字节，和ASCII码完全相同；

2. n个字节的字符(n>1)，第一个字节的前n位设为1，第n+1位设为0，后面字节的前两位都设为10，这n个字节的其余空位填充该字符unicode码，高位用0补足。

这样就形成了如下的UTF-8标记位：

0xxxxxxx
110xxxxx 10xxxxxx
1110xxxx 10xxxxxx 10xxxxxx
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx
111110xx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
1111110x 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx 10xxxxxx
... ...

于是，”It's 知乎日报“就变成了：

I 01001001
t 01110100
' 00100111
s 01110011
  00100000
知 11100111 10011111 10100101
乎 11100100 10111001 10001110
日 11100110 10010111 10100101
报 11100110 10001010 10100101

和上边的方案对比一下，英文短了，每个中文字符却多用了一个字节。但是整个字符串只用了17个字节，比上边的18个短了一点点。

下边是课后作业：

请将”It's 知乎日报“的GB2312和GBK码(自行google)转成二进制。不考虑历史因素，从技术角度解释为什么在unicode和UTF-8大行其道的同时，GB2312和GBK仍在广泛使用。

剧透：一切都是为了节省你的硬盘和流量。


本回答被网友采纳






已赞过已踩过<

你对这个回答的评价是？
评论收起

1条折叠回答

更多回答（2）

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

Unicode 和 UTF-8 有何区别

其他类似问题

为你推荐：