Unicode-текст может содержать разные последовательности, канонически связанные и часто одинаково выглядящие. Готовая буква é — одно значение U+00E9. Разложенная запись — U+0065 и U+0301. Считать их одинаковыми при поиске иногда полезно, но преобразование между ними — отдельная нормализация, уничтожающая точные данные исходного ввода.
Две записи дают разные данные
В UTF-8 U+00E9 превращается в C3 A9, а U+0065 U+0301 — в 65 CC 81. Число значений равно одному и двум, единиц UTF-16 — одному и двум, байтов — двум и трём. UnicodeLens показывает эти факты, не решая, нарисует ли шрифт их одинаково. Пример помещает обе записи рядом с разделителем, сохраняя видимый порядок строк.
Разбор и нормализация — разные задачи
Инспектор должен сохранять разбираемое значение. UnicodeLens не применяет NFC, NFD, NFKC или NFKD, не меняет регистр и не удаляет variation selector или joiner. Отдельный нормализатор потребовал бы явных форм, сравнения до и после, предупреждений о потере совместимости и исполняемых conformance-данных. Здесь копируемые U+ и байты соответствуют textarea, а не скрытому исправлению.
Правила сравнения задаёт целевая система
Базы данных, языки, файловые и поисковые системы по-разному нормализуют и сравнивают текст. Даже каноническая эквивалентность не решает сортировку по locale, grapheme segmentation, spoofing или правила ID. UnicodeLens фиксирует точную последовательность, а документированную политику применяйте в месте использования. Нельзя считать похожие glyph одинаковыми, взаимозаменяемыми или безопасными только по виду.