Boquinhas Vogais - Aprendendo Com a Prof.Cirlene: MÉTODO FÔNICO (BOQUINHAS) - VOGAIS
Aprendendo Com a Prof.Cirlene: MÉTODO FÔNICO (BOQUINHAS) - VOGAIS

O que são boquinhas vogais e como usam no dia a dia

Boquinhas vogais é o nome que deram pra uma ferramenta de síntese de fala focada em produzir os sons vocálicos de forma isolada ou sequencial. O pessoal da comunidade portuguesa e brasileira começou a usar isso principalmente pra treino de pronúncia, criação de materiais fonéticos e, em alguns casos, pra debug de TTS caseiro. Não é mágica, é um script aberto com pesos pré-treinados num modelo bem simples. Achei isso num fórum português há uns dois anos quando precisava gerar arquivos de referência pra comparar com a saída do meu synthesizer de formantes. Baixei, rodei, entendi a estrutura em uma tarde. O repositório original tá no GitHub, mas tem mirrors espalhados. O link direto é boquinhas-vogais.github.io/download.

O que você precisa saber sobre boquinhas vogais

O funcionamento é basicamente isso: você passa uma string com vogais (a, e, i, o, u e seus variantes) e o sistema gera os audios correspondentes usando um modelo leve de vocoder + formants. A saída vem em WAV, 22050 Hz, mono. Dá pra exportar em lotes e ainda customizar o pitch e a duração de cada vogal. O que muita gente não entende é que ele não gera consoantes. Se você tentar passar "casa", vai ouvir só "a-a-a". Isso é proposital. O projeto foi feito mesmo pra isolamento vocálico, não pra fala natural. Já vi muita gente reclamar disso nas issues e o autor responder que é feature, não bug.

Tive um problema específico que demorou pra resolver. Queria usar as boquinhas vogais pra calibrar um sintetizador de vocais que eu tava montando, mas a saída vinha com um ruído de fundo de uns -42 dB que estragava minha medição de SNR. Achei que era falha do modelo até eu perceber que o problema era o sample rate do meu audio interface. O script gera em 22050 Hz, mas meu setup tava tudo em 48000. A conversão automática do sox tava introduzindo aliasing. Resolveu passando --resample 48000 no comando de geração. Pensei em abrir issue mas desisti porque o autor já tinha fechado algo parecido meses antes. Uma coisa que ninguém conta: o modelo tem um viés claro pra vogais abertas. O "a" sai quase perfeito, mas o "e" fechado costuma soar mais aberto do que deveria. Se você precisa de precisão fonética real, tem que ajustar o formant tracker manualmente. O próprio repo tem um arquivo de config com os valores padrão de F1 e F2 pro português brasileiro. Dá pra sobrescrever na linha de comando com --formant-override.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Pra quem quer testar rápido, o jeito mais simples é instalar via pip. O pacote é chamado boquinhas-vogais e roda em Python 3.9+. A instalação leva uns 3 minutos se a internet estiver boa, porque baixa os pesos na primeira execução. Isso pesa cerca de 80 MB. Uma limitação séria é a ausência de sotaque. O modelo foi treinado em dados de falante padrão, majoritariamente carioca/sulista. Se você precisa de vogais nordestinas ou norte-português, o resultado vai soar artificial. Tentei contornar isso com fine-tuning usando gravações minhas, mas o modelo é tão simples que praticamente não tem o que ajustar. O fine-tune melhorou marginalmente, talvez 10% na similaridade perceptual, e custou uns quatro horas de GPU. Vale a pena só se você tiver um uso profissional e recorrente.

Aqui vai um fluxo que funciona na prática: Roda o script com a lista de vogais que precisa. Usa --list para ver o alphabet completo. Gera todos os arquivos de uma vez. Depois processa com um script shell que aplica um high-pass em 80 Hz e normaliza pra -3 dBFS. Leva cerca de 15 minutos do início ao fim num machine qualquer. Se quiser combinar com consoantes depois, aí entra o passo manual: você grava as sílabas e alinha com os arquivos gerados.

O projeto não tem GUI. É tudo CLI. Tem gente que fez uma interface web caseira por cima, mas não é oficial e às vezes quebra quando o autor atualiza a API. Se você não tem intimidade com terminal, o curva de aprendizado é de umas duas horas pros primeiros comandos. Outro ponto: a licença é MIT, então pode usar comercialmente. Já vi gente vendendo pacotes de áudio gerados por ele em marketplaces. O autor não se importa, mas é bom lembrar que a qualidade do áudio gerado é limitada pelo modelo. Não espere resultado de estúdio.

Se o seu objetivo é produção musical séria, talvez o caminho mais prático seja combinar boquinhas vogais com uma ferramenta de ressíntese formântica mais robusta. Eu uso o PySYNTH junto quando preciso de controle fino sobre a duração e o contorno de pitch. A combinação dos dois resolve a maior parte dos problemas que aparecem. Basta isso. Se precisar de ajuda com algum erro específico na instalação ou na configuração dos formantes, o repositório tem uma seção de FAQ que cobre os casos mais comuns. A maioria das dúvidas gira em torno do mesmo assunto: sample rate, viés de vogais e falta de consoantes. Já foi dito várias vezes, mas sempre chega gente nova perguntando.