Segmentador de Texto

Separe palavras, frases e caracteres percebidos usando regras internacionais.

Como interpretar Unicode e segmentação

Segmentador de Texto trabalha com uma camada do texto que nem sempre aparece na tela. Um caractere percebido pode ser formado por vários code points, emojis podem usar sequências com ZWJ e regras de palavras variam por idioma.

  • Diferencie unidades UTF-16, code points e grapheme clusters antes de definir limites de campos ou posições.
  • Use normalização quando precisar comparar textos equivalentes representados por sequências diferentes.
  • Trate os resultados como uma análise padrão: idiomas como tailandês, chinês e japonês podem exigir regras específicas.
Dica prática: Não corte texto no meio de um grapheme cluster e teste sempre com emojis, acentos e diferentes alfabetos.

Como usar este módulo

Segmentar texto por palavras, frases ou grapheme clusters é mais preciso do que separar apenas por espaços. As regras padrão são sensíveis a idioma e contexto.

Dica prática: Trate a segmentação como uma aproximação padrão e teste o idioma do seu conteúdo.