O problema real quando dados não têm hífen onde deveriam ter
Você pega um relatório exportado de um sistema legado e percebe que os campos "faz de conta tem hífen" não estão separados corretamente. Nomes compostos, expressões verbais, termos com prefixos — tudo colado. O sistema simplesmente não aplicou as regras ortográficas da língua portuguesa na geração do arquivo. Isso acontece todo dia em extrações de ERP, CRM, planilhas governamentais e exportações de bancos de dados antigos. A primeira coisa que as pessoas tentam é tratar o texto como se os hífenos já existissem. Não funciona. A ambiguidade é enorme. "Fazdeconta" pode ser "faz de conta" (locução verbal), "faz de conta" com hífen em outro contexto, ou simplesmente uma string sem sentido. O erro comum é aplicar uma regra fixa de inserção de hífen sem considerar o contexto lexical. Resultado: você cria mais problemas do que resolvendo.
Como lidar quando faz de conta tem hífen e o sistema não coloca
O método que eu uso é menos mágico do que parece. Você não insere hífen manualmente. Você constrói um dicionário de exceptions e aplica regras de segmentação baseadas em frequência. Comece assim: Passo 1 — Mapeie os padrões do seu dado. Exporte uma amostra de pelo menos 5.000 registros e identifique quais sequências de caracteres aparecem sem hífen mas deveriam ter. Anote os casos mais frequentes. Em sistemas brasileiros de saúde, por exemplo, "SUS" aparece colado a números e nomes de cidades de formas variadas. Em sistemas jurídicos, termos como "contrato" e "termo" aparecem concatenados com identificadores numéricos.
Passo 2 — Monte uma tabela de normalização. Crie um arquivo CSV ou JSON com as variações encontradas e a forma padronizada correta. Use chaves compostas: a versão colada como chave e a versão corrigida como valor. Quanto mais abrangente, melhor. Eu tenho uma tabela com cerca de 3.200 entradas que cobre 94% dos casos que encontro em exportações de sistemas públicos. Passo 3 — Aplique substituições em ordem estratégica. Ordene as regras do maior para o menor padrão. Substitua primeiro as sequências mais longas e específicas. Se você começar pelas curtas, vai sobrescrever parte do que já foi corrigido. Uma expressão de cinco palavras coladas deve ser tratada antes de um prefixo de duas letras.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Passo 4 — Valide com um subconjunto conhecido. Pegue 200 registros que você já sabe como deveriam ficar. Rode a normalização e compare. Meça o erro. Se a taxa de acerto estiver abaixo de 90%, volte para o passo 1 e expanda o dicionário. Não avance until você confiar no resultado. Um problema específico que encontrei recentemente envolvia uma base de dados de contratos onde os termos apareciam como "termodecomprometimento" e "instrumentoprobatório". O dicionário padrão não cobria essas combinações porque elas variam conforme o tipo de contrato. A solução foi criar um gerador estatístico: em vez de listar cada variação manualmente, eu usei frequência de bigramas e trigramas em corpus jurídico para identificar onde os límites entre palavras eram mais prováveis. Depois cruzei com o dicionário de exceções para ajustar os falsos positivos. Isso reduziu o tempo de normalização de uma tabela com 47 mil registros de cerca de seis horas para treze minutos.
Vantagens e limitações dessa abordagem
A grande vantagem é que você não depende de inteligência artificial ou modelos pesados. Funciona com qualquer linguagem de programação que tenha manipulação de strings e acesso a arquivos. A desvantagem é honesta: sistemas que geram dados sem hífen frequentemente fazem isso de forma inconsistente. Um campo pode usar um padrão, outro campo usa outro padrão dentro do mesmo arquivo. A normalização precisa ser aplicada por coluna, não globalmente. Outro ponto que ninguém fala: essa técnica não resolve problemas de acentuação, maiúsculas/minúsculas inconsistentes ou codificação de caractere. Se o arquivo veio com encoding errado, corrija isso antes de qualquer normalização de hífen. Tratar a acentuação depois de inserir hífen é trabalho duplicado.
Quando fazer de conta tem hífen não adianta
Se os dados vieram de OCR de documentos escaneados, a abordagem de dicionário falha na maioria dos casos. Erros de reconhecimento óptico criam sequências que não correspondem a nenhuma palavra real do dicionário. Nesses casos, o caminho é usar segmentadores estatísticos como o Tree Tailor ou modelos de tokenização treinados especificamente para português, e depois aplicar regras de hífen sobre os tokens identificados. O processo leva mais tempo e exige configuração, mas é a única opção viável quando a entrada é imagem e não texto digital.