您现于de位置乃:亚博 > APP基础

亚博 2019-12-04 APP基础 233

utf8和utf8mb4de区别

1 简介

MySQL于5.5.3之后增加了这个utf8mb4de编码 mb4就乃most bytes 4de意思 专门用来兼容4字节deunicode.utf8mb4乃utf8de超集 除了将编码改为utf8mb4外不需要做其他转换.当然 为了节省空间 1般情况下使用utf8也就够了.


2 内容描述

那上面说了既然utf8能够存下大部分中文汉字,那为什么还要使用utf8mb4呢? 原来mysql支持de utf8 编码好的字符长度为 3 字节 如果遇到 4 字节de宽字符就会插入异常了.3个字节de UTF-8 好的能编码de Unicode 字符乃 0xffff 也就乃 Unicode 中de基本多文种平面(BMP).也就乃说 任何不于基本多文本平面de Unicode字符 都无法使用 Mysql de utf8 字符集存储.包括 Emoji 表情(Emoji 乃1种特殊de Unicode 编码 常见于 ios 和 android 手机上) 和很多不常用de汉字 以及任何新增de Unicode 字符等等(utf8de缺点).


通常 计算机于存储字符时 会根据不同类型de字符以及编码方式分配存储空间.例如以下几种编码方式;

①ASCII编码中 1个英文字母(不分大小写)占用1个字节de空间 1个中文汉字占用两个字节de空间.1个2进制de数字序列 于计算机中作为1个数字单块存储时 1般为8位2进制数 换算为10进制.最小值0 好的值255.

②UTF-8编码中 1个英文字符占用1个字节de存储空间 1个中文(含繁体)占用3个字节de存储空间.

③Unicode编码中 1个英文占用两个字节de存储空间 1个中文(含繁体)占用两个字节de存储空间.

④UTF-16编码中 1个英文字母字符或1个汉字字符存储都需要占用2个字节de存储空间(Unicode扩展区de1些汉字存储需要4个字节).

⑤UTF-32编码中 世界上任何字符de存储都需要占用4个字节de存储空间.


既然utf8能兼容绝大部分de字符 为什么要扩展utf8mb4?

随着互联网de发展 产生了许多新类型de字符 例如emoji这种类型de符号 也就乃我们通常于聊天时发de小黄脸表情 这种字符de出现不于基本多平面deUnicode字符之中 导致无法于MySQL中使用utf8存储 MySQL于乃对utf8字符进行了扩展 增加了utf8mb4这个编码.

所以 设计数据库时如果想要允许用户使用特殊符号 好的使用utf8mb4编码来存储 使得数据库有更好de兼容性 但乃这样设计会导致耗费更多de存储空间.


评论