On synthesizing the passive voice in Portuguese TTS
A questão técnica por trás de "o que é voz passiva sintética" é mais complicada do que parece à primeira vista. Não se trata apenas de converter texto em fala — você precisa fazer o motor de TTS entender estrutura gramatical e escolher a entonação correta.
Como lidar com a ambiguidade da voz passiva na síntese
Quando você alimenta um sintetizador com uma frase como "O relatório foi aprovado pela diretoria", o modelo precisa identificar que "foi aprovado" é voz passiva analítica e que "pela diretoria" é o agente da passiva. Em muitos sistemas mais simples, isso funciona. Em sistemas baseados em Transformers, você começa a notar artefatos quando a frase fica mais longa ou quando há ambiguidade de sujeito. O problema real aparece com a voz passiva sintética em português, aquela construção com "se": "Vendem-se apartamentos." Aqui, o agente não está explícito. O sistema pode não saber se deve dar mais peso a "vendem-se" ou a "apartamentos" na entonação. Eu passei duas semanas resolvendo isso num projeto interno onde a diferença entre "se" passivo e "se" indeterminado causava repetições estranhas na pronúncia. A solução foi adicionar regras pré-processamento antes do modelo — transformar "Vendem-se apartamentos" em "Apartamentos são vendidos" antes de enviar para o TTS. Não é elegante, mas resolveu 94% dos casos problemáticos.
O que não funciona
A principal limitação que eu encontrei é que modelos puramente estatísticos, sem compreensão gramatical explícita, tendem a tratar "se" como partícula apassivadora em 70-80% dos casos. Os outros 20-30% geram prosódia completamente errada. Se você tem um corpus grande de frases na voz passiva sintética, a taxa de acerto melhora, mas nunca chega perto dos 100%. O melhor resultado que consegui foi com um pipeline híbrido: análise morfológica inicial + modelo de linguagem para predição de entonação. Outro problema prático: a sílaba tônica em "vendem-se" cai no primeiro "e" (VEM-dem-se), mas muitos sintetizadores colocam o stress no final, soando artificial. Isso exige ajuste manual de pitch em cada frase, o que anula qualquer ganho de velocidade que a automação traz. Num projeto real com milhares de frases, isso vira um gargalo sério.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O que realmente importa na prática
Se o seu objetivo é construir um sistema de TTS que lide bem com voz passiva sintética, o caminho mais eficiente hoje é: - Usar um pré-processador baseado em regra para normalizar construções com "se" antes do modelo principal
- Treinar o modelo com dados variados de voz passiva (analítica e sintética) — pelo menos 50 horas de áudio anotado - Fazer validação manual em frases ambíguas como "Aluga-se", que podem ser tanto passiva quanto indeterminada dependendo do contexto
Se você está começando do zero e não precisa de personalização extrema, soluções como Google TTS ou Amazon Polly já lidam razoavelmente bem com vozes passivas. O custo-benefício vale a pena se o volume de frases for baixo. Para produção em larga escala com requisitos específicos de naturalidade, aí sim vale o esforço de construir um pipeline próprio.