Normalizador Unicode

Compare e normalize textos usando NFC, NFD, NFKC e NFKD.

Como interpretar Unicode e segmentação

Normalizador Unicode trabalha com uma camada do texto que nem sempre aparece na tela. Um caractere percebido pode ser formado por vários code points, emojis podem usar sequências com ZWJ e regras de palavras variam por idioma.

  • Diferencie unidades UTF-16, code points e grapheme clusters antes de definir limites de campos ou posições.
  • Use normalização quando precisar comparar textos equivalentes representados por sequências diferentes.
  • Trate os resultados como uma análise padrão: idiomas como tailandês, chinês e japonês podem exigir regras específicas.
Dica prática: Não corte texto no meio de um grapheme cluster e teste sempre com emojis, acentos e diferentes alfabetos.

Como usar este módulo

Normalização Unicode permite comparar sequências canonicamente equivalentes. NFC costuma preservar uma forma composta, enquanto NFD separa marcas; NFKC e NFKD também aplicam compatibilidade.

Dica prática: Documente a forma escolhida para que outros sistemas reproduzam a mesma comparação.