Segmentador de texto

Separa palabras, frases y caracteres percibidos según reglas internacionales.

Cómo interpretar Unicode y la segmentación

Segmentador de texto trabaja con una capa del texto que no siempre aparece en pantalla. Un carácter percibido puede tener varios puntos de código, los emojis pueden usar secuencias ZWJ y las reglas de palabras varían por idioma.

  • Distingue unidades UTF-16, puntos de código y clusters de grafemas antes de definir límites o posiciones.
  • Usa normalización al comparar textos equivalentes representados mediante secuencias diferentes.
  • Trata el resultado como un análisis predeterminado: tailandés, chino y japonés pueden necesitar reglas adaptadas.
Consejo práctico: No cortes texto dentro de un cluster de grafemas. Prueba emojis, marcas combinadas y alfabetos distintos.

Como usar este módulo

Segmentar texto por palavras, frases ou grapheme clusters é mais preciso do que separar apenas por espaços. As regras padrão são sensíveis a idioma e contexto.

Dica prática: Trate a segmentação como uma aproximação padrão e teste o idioma do seu conteúdo.