国际化 · 字节检查台

同一串字节,为什么会读出两种文字?

先把文字装进 UTF-8 字节,再故意换解码规则、截断序列或塞入非法字节。你看到的每个乱码、替换字符和报错,都能在字节层找到原因。

实验 12—01
UTF-8

UTF-8 字节与错误解码互动实验

一、写下要传输的文字

JavaScript 的字符串长度按 UTF-16 代码单元计数;这里另外展示代码点和 UTF-8 字节数,别把三者混成一件事。

二、从代码点排到字节

每个代码点独立编码;中文通常 3 字节,许多表情是 4 字节。

当前场景:原始字节 UTF-8 结构检查中

三、换一种方式解释字节

解释规则
UTF-8 遇到坏字节时
字节场景

四、查看解释结果

收到的字节
解码器 UTF-8
运行时字符串
成功还原

OK 字节结构与解码规则一致。