网站代备,软件开发合同模板范本1,长沙网站制作哪里好,公司变更登记申请书常见字符集介绍
字符集基础知识#xff1a;
计算机底层不可以直接存储字符的。
计算机中底层只能存储二进制(0、1) 。
二进制是可以转换成十进制的。
结论#xff1a;计算机底层可以表示成十进制编号。计算机可以给人类字符进行编号存储#xff0c;这套编号规则就是字符…常见字符集介绍
字符集基础知识
计算机底层不可以直接存储字符的。
计算机中底层只能存储二进制(0、1) 。
二进制是可以转换成十进制的。
结论计算机底层可以表示成十进制编号。计算机可以给人类字符进行编号存储这套编号规则就是字符集。
ASCII字符集
ASCII(American Standard Code for Information Interchange美国信息交换标准代码)包括了数字、英文、符号。
ASCII使用1个字节存储一个字符一个字节是8位首位为0总共可以表示128个字符信息对于英文数字来说是够用的。
GBK
window系统默认的码表。兼容ASCII码表也包含了几万个汉字并支持繁体汉字以及部分日韩文字。
注意GBK是中国的码表一个中文以两个字节的形式存储。但不包含世界上所有国家的文字。
Unicode码表 unicode又称统一码、万国码、单一码是计算机科学领域里的一项业界字符编码标准。
容纳世界上大多数国家的所有常见文字和符号。
Unicode会先通过UTF-8UTF-16以及 UTF-32编码成二进制后再存储到计算机其中最为常见的就是UTF-8。
注意
Unicode是万国码以UTF-8编码后一个中文一般以三个字节的形式存储。
UTF-8也要兼容ASCII编码表。
技术人员都应该使用UTF-8的字符集编码。
编码前和编码后的字符集需要一致否则会出现中文乱码。
汉字存储和展示过程解析 总结
1、字符串常见的字符底层组成是什么样的
英文和数字等在任何国家的字符集中都占1个字节。
GBK字符中一个中文字符占2个字节。
UTF-8编码中一个中文1般占3个字节。
2、编码前的字符集和编码好的字符集有什么要求
必须一致否则会出现中文字符乱码。
英文和数字在任何国家的编码中都不会乱码 。
字符集的编码、解码操作
String编码
byte[] getBytes() 使用平台的默认字符集将该 String编码为一系列字节将结果存储到新的字节数组中。
byte[] getBytes(String charsetName)
String解码
String(byte[] bytes) 通过使用平台的默认字符集解码指定的字节数组来构造新的 String。
String(byte[] bytes, String charsetName)
案例
public class Test {public static void main(String[] args) throws Exception {// 1、编码把文字转换成字节使用指定的编码String name abc我爱你中国;// byte[] bytes name.getBytes(); // 以当前代码默认字符集进行编码 UTF-8byte[] bytes name.getBytes(GBK); // 指定编码System.out.println(bytes.length);System.out.println(Arrays.toString(bytes));// 2、解码把字节转换成对应的中文形式编码前 和 编码后的字符集必须一致否则乱码 // String rs new String(bytes); // 默认的UTF-8String rs new String(bytes, GBK); // 指定GBK解码System.out.println(rs);}
}