UTF-8 associe chaque valeur Unicode à une séquence unique d’un à quatre octets. ASCII conserve le même octet ; les valeurs supérieures répartissent leurs bits entre un octet initial et des continuations. Un même nombre de valeurs peut donc occuper des tailles différentes. UnicodeLens calcule la séquence après validation du scalaire.

La plage détermine le nombre d’octets

U+0000–U+007F utilise un octet, U+0080–U+07FF deux, U+0800–U+FFFF trois sauf substituts, et U+10000–U+10FFFF quatre. Le premier octet indique la longueur, les suivants portent le motif de continuation. UnicodeLens imprime deux chiffres hexadécimaux majuscules par octet et un espace exact.

A, é et 😀 occupent 1, 2 et 4 octets

Le cas Aé😀 montre la largeur variable. A vaut U+0041 et 41 ; é précomposé vaut U+00E9 et C3 A9 ; l’emoji vaut U+1F600 et F0 9F 98 80. Ensemble : trois valeurs, quatre unités UTF-16 et sept octets UTF-8. La copie agrégée est exactement 41 C3 A9 F0 9F 98 80.

Les octets ne déterminent pas le sens visuel

Une séquence UTF-8 valide prouve seulement les valeurs encodées. Les polices peuvent varier, plusieurs valeurs peuvent former un symbole perçu et des écritures canoniques employer des octets différents. UnicodeLens décrit donc la représentation sans appeler la taille nombre de caractères, largeur visuelle ou résultat de sécurité. Utilisez le système cible et des données Unicode versionnées pour le reste.