Normalizador Unicode

Compara y normaliza texto usando NFC, NFD, NFKC y NFKD.

Cómo interpretar Unicode y la segmentación

Normalizador Unicode trabaja con una capa del texto que no siempre aparece en pantalla. Un carácter percibido puede tener varios puntos de código, los emojis pueden usar secuencias ZWJ y las reglas de palabras varían por idioma.

  • Distingue unidades UTF-16, puntos de código y clusters de grafemas antes de definir límites o posiciones.
  • Usa normalización al comparar textos equivalentes representados mediante secuencias diferentes.
  • Trata el resultado como un análisis predeterminado: tailandés, chino y japonés pueden necesitar reglas adaptadas.
Consejo práctico: No cortes texto dentro de un cluster de grafemas. Prueba emojis, marcas combinadas y alfabetos distintos.

Como usar este módulo

Normalização Unicode permite comparar sequências canonicamente equivalentes. NFC costuma preservar uma forma composta, enquanto NFD separa marcas; NFKC e NFKD também aplicam compatibilidade.

Dica prática: Documente a forma escolhida para que outros sistemas reproduzam a mesma comparação.