Explorador Unicode
Inspecciona puntos de código, categorías y representaciones Unicode.
Cómo interpretar Unicode y la segmentación
Explorador Unicode trabaja con una capa del texto que no siempre aparece en pantalla. Un carácter percibido puede tener varios puntos de código, los emojis pueden usar secuencias ZWJ y las reglas de palabras varían por idioma.
- Distingue unidades UTF-16, puntos de código y clusters de grafemas antes de definir límites o posiciones.
- Usa normalización al comparar textos equivalentes representados mediante secuencias diferentes.
- Trata el resultado como un análisis predeterminado: tailandés, chino y japonés pueden necesitar reglas adaptadas.
Consejo práctico: No cortes texto dentro de un cluster de grafemas. Prueba emojis, marcas combinadas y alfabetos distintos.