Segmentador de texto
Separa palabras, frases y caracteres percibidos según reglas internacionales.
Cómo interpretar Unicode y la segmentación
Segmentador de texto trabaja con una capa del texto que no siempre aparece en pantalla. Un carácter percibido puede tener varios puntos de código, los emojis pueden usar secuencias ZWJ y las reglas de palabras varían por idioma.
- Distingue unidades UTF-16, puntos de código y clusters de grafemas antes de definir límites o posiciones.
- Usa normalización al comparar textos equivalentes representados mediante secuencias diferentes.
- Trata el resultado como un análisis predeterminado: tailandés, chino y japonés pueden necesitar reglas adaptadas.
Consejo práctico: No cortes texto dentro de un cluster de grafemas. Prueba emojis, marcas combinadas y alfabetos distintos.