网站高手帮帮忙.关于编码的问题..GBK 和utf8 和gb2312之间的关系....

情况是这样的,这段时间我在做一个网站.在中途我发现gb2312的编码不能显示一些特称称号,于是我将以前的网站改成了utf8..今天突然又发现一个新问题。我发现utf8编码... 情况是这样的,这段时间我在做一个网站.在中途我发现gb2312的编码不能显示一些特称称号,于是我将以前的网站改成了utf8..

今天突然又发现一个新问题。我发现utf8编码的文本文件比gb2312编码的文本文件占的空间大.每个大十几K 几十K 算下来就成了一笔不小的流量开支.

我看百度的网页用的是GBK的编码.我想知道 GBK和GB2312有什么区别.
在GBK和gb2312和utf8之间我应该怎么选择?

还有gb2312怎么显示特殊符号?
-------
我就是想知道怎么在表单提交的时候把特殊符号转换成实体如以下: & #9617; & #9618; & #9644; & #9830;

不要告诉我用server.htmlencode 这个只能转换一部分符号到实体.我是知道的
不要告诉我自己编写函数. 符号太多了.我无法收集齐全部符号.实在太我了.
麻烦懂行的朋友帮帮忙谢了~~~~~~~~

怎么没人知道啊?

................. 展开

 我来答

4个回答

#热议# 生活中有哪些实用的心理学知识？

匿名用户
2009-10-10

展开全部

首先个人建议用GB2312

GB2312 字符集

GB2312又称为GB2312-80字符集，全称为《信息交换用汉字编码字符集·基本集》，由原中国国家标准总局发布，1981年5月1日实施，是中国国家标准的简体中文字符集。它所收录的汉字已经覆盖99.75%的使用频率，基本满足了汉字的计算机处理需要。在中国大陆和新加坡获广泛使用。

GB2312收录简化汉字及一般符号、序号、数字、拉丁字母、日文假名、希腊字母、俄文字母、汉语拼音符号、汉语注音字母，共 7445 个图形字符。其中包括6763个汉字，其中一级汉字3755个，二级汉字3008个；包括拉丁字母、希腊字母、日文平假名及片假名字母、俄语西里尔字母在内的682个全角字符。

GB2312中对所收汉字进行了“分区”处理，每区含有94个汉字/符号。这种表示方式也称为区位码。

它是用双字节表示的，两个字节中前面的字节为第一字节，后面的字节为第二字节。习惯上称第一字节为“高字节” ，而称第二字节为“低字节”。“高位字节”使用了0xA1-0xF7(把01-87区的区号加上0xA0)，“低位字节”使用了0xA1-0xFE(把01-94加上0xA0)。

以GB2312字符集的第一个汉字“啊”字为例，它的区号16，位号01，则区位码是1601，在大多数计算机程序中，高字节和低字节分别加0xA0得到程序的汉字处理编码0xB0A1。计算公式是：0xB0=0xA0+16, 0xA1=0xA0+1。

GBK字符集
GBK字符集是GB2312的扩展(K)，GBK1.0收录了21886个符号，它分为汉字区和图形符号区，汉字区包括21003个字符。GBK字符集主要扩展了繁体中文字的支持。

BIG5 字符集

BIG5又称大五码或五大码，1984年由台湾财团法人信息工业策进会和五间软件公司宏碁 (Acer)、神通 (MiTAC)、佳佳、零壹 (Zero One)、大众 (FIC)创立，故称大五码。Big5码的产生，是因为当时台湾不同厂商各自推出不同的编码，如倚天码、IBM PS55、王安码等，彼此不能兼容；另一方面，台湾政府当时尚未推出官方的汉字编码，而中国大陆的GB2312编码亦未有收录繁体中文字。

Big5字符集共收录13,053个中文字，该字符集在中国台湾使用。耐人寻味的是该字符集重复地收录了两个相同的字：“兀”(0xA461及0xC94A)、“嗀”(0xDCD1及0xDDFC)。

Big5码使用了双字节储存方法，以两个字节来编码一个字。第一个字节称为“高位字节”，第二个字节称为“低位字节”。高位字节的编码范围0xA1-0xF9，低位字节的编码范围0x40-0x7E及0xA1-0xFE。

尽管Big5码内包含一万多个字符，但是没有考虑社会上流通的人名、地名用字、方言用字、化学及生物科等用字，没有包含日文平假名及片假字母。

例如台湾视“着”为“著”的异体字，故没有收录“着”字。康熙字典中的一些部首用字(如“亠”、“疒”、“辵”、“癶”等)、常见的人名用字(如“堃”、“煊”、“栢”、“喆”等) 也没有收录到Big5之中。

GB18030 字符集

GB18030的全称是GB18030-2000《信息交换用汉字编码字符集基本集的扩充》，是我国政府于2000年3月17日发布的新的汉字编码国家标准，2001年8月31日后在中国市场上发布的软件必须符合本标准。GB 18030字符集标准的出台经过广泛参与和论证，来自国内外知名信息技术行业的公司，信息产业部和原国家质量技术监督局联合实施。

GB 18030字符集标准解决汉字、日文假名、朝鲜语和中国少数民族文字组成的大字符集计算机编码问题。该标准的字符总编码空间超过150万个编码位，收录了27484个汉字，覆盖中文、日文、朝鲜语和中国少数民族文字。满足中国大陆、香港、台湾、日本和韩国等东亚地区信息交换多文种、大字量、多用途、统一编码格式的要求。并且与Unicode 3.0版本兼容，填补Unicode扩展字符字汇“统一汉字扩展A”的内容。并且与以前的国家字符编码标准（GB2312，GB13000.1）兼容。

编码方法：
GB 18030标准采用单字节、双字节和四字节三种方式对字符编码。单字节部分使用0×00至0×7F码(对应于ASCII码的相应码)。双字节部分，首字节码从0×81至0×FE，尾字节码位分别是0×40至0×7E和0×80至0×FE。四字节部分采用GB/T 11383未采用的0×30到0×39作为对双字节编码扩充的后缀，这样扩充的四字节编码，其范围为0×81308130到0×FE39FE39。其中第一、三个字节编码码位均为0×81至0×FE，第二、四个字节编码码位均为0×30至0×39。

按照程序员的称呼，GB2312、GBK到GB18030都属于双字节字符集 (DBCS)。

接着是国际通用的unicode字符集

Unicode字符集（简称为UCS）播我吧高清电影bo58com

参考资料：播我吧

已赞过 已踩过<

评论收起

上海巴鲁图工程机械科技有限公司_
2022-05-15 广告

增量编码器一般输出信号是两路正交脉冲信号和一路参考信号,之所以叫增量是因为它的位置信号是通过对脉冲计数累加得到,依靠计数设备的内部记忆来记住位置,并且同每圈输出的参考信号来清除累计误差. 缺点就是断电后,需要重新寻找初始位置. 例如打印机扫... 点击进入详情页

本回答由上海巴鲁图工程机械科技有限公司_提供

magicmeteor
2009-10-09 · TA获得超过181个赞

知道小有建树答主

回答量：298

采纳率：0%

帮助的人：245万

我也去答题访问个人页

关注

展开全部

GB2312的范围比GBK少很多，也就是说所涵盖的中文字符会比GBK格式的少，一旦遇到没办法识别的繁体字或者特殊符号就会乱码。所以一般来说我会选GBK格式来写页面。
至于UTF-8嘛，一般我写java的时候才会用到，这种一般适用于大型系统，或者跨语言系统，跨服务器等情况下使用。也就是说国外的ie浏览器也可以直接浏览到中文，而不需要安装中文语言支持包。
主要是看你的使用范围，还有就是数据库支持那种编码，这个要跟你数据库的编码对应上来，否则一样会存在乱码的情况。

本回答被提问者采纳

已赞过已踩过<

你对这个回答的评价是？
评论收起

skingyang
2009-10-09 · TA获得超过586个赞

知道小有建树答主

回答量：767

采纳率：60%

帮助的人：327万

我也去答题访问个人页

关注

展开全部

这些编码最大的区别就是对中文和特殊符号的支持不同，虽然UTF-8占用空间比较大些，我觉得还是挺好的，文件中都统一用UTF-8编码。有些中文网站为了限制中文繁体，就设置成gb2312或gbk编码。

已赞过 已踩过<

评论收起

yanhanyu123
2009-10-09

知道答主

回答量：14

采纳率：0%

帮助的人：0

我也去答题访问个人页

关注

展开全部

GB2312的范围比GBK少很多，也就是说所涵盖的中文字符会比GBK格式的少，一旦遇到没办法识别的繁体字或者特殊符号就会乱码。所以一般来说我会选GBK格式来写页面

已赞过 已踩过<

评论收起

更多回答（2）

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

网站高手帮帮忙.关于编码的问题..GBK 和utf8 和gb2312之间的关系....

其他类似问题

为你推荐：