Segmentador de Texto
Separe palavras, frases e caracteres percebidos usando regras internacionais.
Como interpretar Unicode e segmentação
Segmentador de Texto trabalha com uma camada do texto que nem sempre aparece na tela. Um caractere percebido pode ser formado por vários code points, emojis podem usar sequências com ZWJ e regras de palavras variam por idioma.
- Diferencie unidades UTF-16, code points e grapheme clusters antes de definir limites de campos ou posições.
- Use normalização quando precisar comparar textos equivalentes representados por sequências diferentes.
- Trate os resultados como uma análise padrão: idiomas como tailandês, chinês e japonês podem exigir regras específicas.
Dica prática: Não corte texto no meio de um grapheme cluster e teste sempre com emojis, acentos e diferentes alfabetos.