O guia pragmático de separação silábica em português
A maioria das pessoas acha que separar sílabas é coisa de escola primária e move pra próxima. Mas se você já precisou montar um gerador de métricas para análise poética, ou simplesmente tentar fazer um algoritmo que segmente texto automaticamente, descobre rápido que o assunto é bem mais complicado do que parece. A regra básica existe, mas as exceções aparecem sempre quando você menos espera.
gato tem quantas sílabas
A resposta curta é que gato tem duas sílabas: ga-to. A separação silábica segue a lógica de que cada sílaba precisa ter pelo menos uma vogal, e o 't' isolado entre vogais vai com a segunda sílaba. Isso é padrão do português. Ninguém discute isso. O problema começa nos casos que não são tão óbvios. Vamos citar 'sangue'. Muita gente separaria como san-gue, o que está certo pela norma culta. Mas em pronúncia coloquial, o 'u' muitas vezes vira semivogal e a sílaba soa diferente. Para fins de separação silábica normativa, a regra diz que encontros consonantais que pertencem a famílias de consoantes — como 'ng' aqui — tendem a ficar juntos na mesma sílaba, mas o 's' inicial forma um ataque próprio. Então san-gue mesmo.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Tomei um susto com isso num projeto meu há uns três anos. Estava desenvolvendo um script de silabificação automática para um dicionário de rima, e a palavra 'aguentar' foi me dar trabalho. A separação normativa seria a-guen-tar, mas o script simples de regex que eu tinha escrito quebrava o 'gu' e generava a-gu-en-tar. Precisei criar uma tabela de exclusão específica para dígrafos e encontros consonantais antes de o sistema produzir algo minimamente confiável. Levei umas quatro horas pra ajustar, e o resultado final ainda não era perfeito. Uma coisa que os iniciantes em processamento de linguagem natural costumam ignorar é que sílabas fonológicas e sílabas ortográficas não são a mesma coisa. Em português escrito, a separação silábica obedece a regras ortográficas definidas pelo acordo, mas na fala real você frequentemente ouve sílabas que não batem com a grafia. Palavras como 'pérola' (pe-ró-la) soam diferente de 'pera' (pe-ra) na velocidade natural, mas ambas são separadas da mesma forma na teoria. Essa diferença entre fonologia e ortografia é onde a maioria dos tutoriais simplistas falha.
Outro ponto cego: palavras com hiato. Quando duas vogais ficam juntas mas pertencem a sílabas diferentes, como em 'sa-ú-de' ou 'lu-a', a separação parece contra-intuitiva para quem aprendeu as regras de digrafo e encontro consonantal. O 'u' e o 'a' não formam um ditongo, então eles se separam. Regras de ditongo vs hiato são o verdadeiro filtro de quem entende o assunto de verdade. Você pode passar anos digitando código de silabificação sem tocar nesse conceito e achar que sabe o suficiente. Se o seu objetivo é apenas saber quantas sílabas tem uma palavra específica, a ferramenta mais rápida continua sendo consultar o dicionário ou usar o separador da Wikipedia. Mas se você está construindo algo do zero, saiba que bibliotecas como o NLTK têm suporte limitado para português e frequentemente precisam de ajustes manuais para lidarem com os casos de hiato e dígrafo corretamente. Eu recomendo construir uma lista de exceções baseada no vocabulário do seu domínio específico — leva cerca de uma tarde de trabalho, mas evita retrabalho depois.
Existe também a questão dos prefixos e sufixos. Palavras compostas como 'autoescola' (au-to-es-co-la) parecem respeitar a regra, mas na prática a fronteira morfossintática nem sempre coincide com a fronteira silábica. Dependendo do uso, 'auto' pode ser segmentado separadamente por questões de compreensão, mesmo que fonologicamente a palavra funcione como um todo contínuo. Isso é mais um problema de interpretação do que de regra em si. O único cenários onde a silabificação em português realmente quebra é com loanwords e termos técnicos estrangeiros. 'Google' vira goo-gle na tentativa de adaptação, mas a pronúncia real não respeita nenhuma das regras nativas. Nesses casos, a separação é arbitrária e o melhor a fazer é aceitar a convenção do dicionário ou evitar a segmentação manual e deixar o falante decidir pela pronúncia.