UTF-8 asigna a cada valor Unicode una secuencia única de uno, dos, tres o cuatro bytes. ASCII conserva el mismo byte y los valores mayores reparten bits entre un byte inicial y continuaciones. Por eso igual cantidad de valores puede ocupar tamaños distintos. UnicodeLens calcula la secuencia después de validar el escalar.

El rango determina los bytes

U+0000–U+007F usa un byte; U+0080–U+07FF dos; U+0800–U+FFFF tres salvo sustitutos; y U+10000–U+10FFFF cuatro. El primer byte indica longitud y los demás siguen el patrón de continuación. UnicodeLens imprime cada byte con dos dígitos hexadecimales en mayúscula y un espacio exacto.

A, é y 😀 ocupan 1, 2 y 4 bytes

El caso Aé😀 muestra el ancho variable. A es U+0041 y byte 41; é precompuesta es U+00E9 y C3 A9; el emoji es U+1F600 y F0 9F 98 80. Juntos son tres valores, cuatro unidades UTF-16 y siete bytes UTF-8. La copia agregada es exactamente 41 C3 A9 F0 9F 98 80.

Los bytes no determinan el significado visual

Una secuencia UTF-8 válida solo demuestra los valores codificados. Las fuentes pueden mostrar un valor distinto, varios valores pueden parecer un símbolo y escrituras relacionadas usar bytes diferentes. UnicodeLens informa representación, no llama al tamaño recuento de caracteres, ancho visual ni resultado de seguridad. Usa el sistema destino y datos Unicode versionados para otras propiedades.