Como funcionam as variáveis que conectam os componentes de um modelo
A maior parte dos modelos estatísticos que eu já vi na prática não funciona de forma direta entre uma variável independente e uma dependente. Existe sempre algo no meio que faz a ponte, e quando você não entende o papel dessa variável intermediária, o modelo se comporta de maneiras estranhas que levam horas para diagnosticar.
a variavel que conecta as duas partes do modelo
Essa variável é frequentemente chamada de mediadora ou interveniente, dependendo do campo e da convenção que você está usando. O conceito é simples: ela recebe influência de uma variável anterior e, por sua vez, influencia a variável final. Se a variável X afeta Y, e esse efeito passa obrigatoriamente por M, então M é a variável que conecta as duas partes do modelo. Na minha experiência trabalhando com modelos de equações estruturais e regressões em série, o problema mais comum não é conceitual. As pessoas sabem o que é. O problema é que elas tentam forçar uma mediação onde ela não existe, ou esquecem de testar se o efeito direto some quando a mediação é incluída.
Aqui vai um exemplo prático que encontrei recentemente. Estávamos analisando dados de desempenho organizacional, com treinamento como variável independente e produtividade como dependente. O modelo inicial mostrava um efeito direto significativo. Aí incluímos a variável de engajamento como mediadora. O coeficiente do treinamento caiu de 0,47 para 0,19, mas ainda era significativo. Isso indicou mediação parcial. Errado seria simplesmente afirmar que o engajamento media a relação sem notar que parte do efeito continua sendo direta. A diferença entre mediação completa e parcial altera completamente a interpretação e as decisões que você toma com base no resultado. Outro detalhe que poucos mencionam: a ordem temporal importa. Se você está lidando com dados transversais, a mediação é essencialmente uma suposição teórica, não uma prova causal. Eu já vi pesquisadores tratarem um efeito estadístico em dados cross-section como se fosse mediação comprovada. Não é. O melhor que você tem é uma argumentação plausível apoiada em evidência correlacional.
Quando trabalhamos com dados longitudinais, a coisa muda de figura. Se você mede X no tempo 1, M no tempo 2 e Y no tempo 3, a inferação causal fica bem mais sólida. O custo é ter dados em três ondas e lidar com missingness ao longo do tempo, que geralmente consome entre 15% e 30% das observações em estudos reais. Não ignore esse drop — use imputação múltipla em vez de completar com média, senão seus intervalos de confiança vão ficar estreitos demais e seus p-valores enganosos. Agora vou falar de um problema específico que enfrentei e que quase me fez abandonar o modelo. Estávamos rodando uma análise de mediação com 800 observações e a variável mediadora tinha uma distribuição fortemente assimétrica. Os testes bootstrap normais estavam dando resultados inconsistentes entre rodadas diferentes. O problema era que a assimetria violava a suposição de normalidade dos resíduos do passo b (X afetando M) na regressão. A solução foi transformar a variável com log(x+1) e, quando mesmo assim a assimetria persistiu, migrar para bootstrapping com 5.000 réplicas em vez das 1.000 padrão. Isso estabilizou os intervalos de confiança e reduziu a variabilidade entre execuções de 8% para menos de 1%.
Se você estiver usando R, o pacote mediation é funcional mas pode ser confuso quando você precisa de modelos multivariados ou com variáveis latentes. Para modelos mais complexos, o pacote lavaan resolve com equações estruturais completas. Se preferir Python, o statsmodels tem suporte básico, mas para bootstrap de mediação você acaba precisando escrever o loop manualmente. Leva cerca de 30 a 50 linhas de código limpo, mas economiza dependências externas. Uma armadilha importante: não teste mediação apenas olhando a significância dos coeficientes individuais. O teste de Sobel tem poder estatístico baixo e é sensível a violações de normalidade. Bootstrap é o padrão atual recomendado pela literatura, e leva de 2 a 5 minutos em datasets de tamanho moderado com as configurações certas. O teste de mediação indireta via produto de coeficientes, com intervalos de confiança assimétricos gerados por bootstrap, é o que você deve reportar.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um insight contraintuitivo que aprendi na prática: às vezes a variável mediadora explica tão bem a relação que o efeito direto se torna insignificante, mas o modelo fica menos previsivo fora da amostra de treino. Isso acontece porque a mediação "limpa" o efeito, mas remove também variância relevante que seria útil para generalização. Se o seu objetivo é previsão e não explicação causal, considere usar a variável intermediária como preditora adicional em vez de tratá-la estritamente como mediadora no modelo. O outro problema prático que vale a pena mencionar é o controle de variáveis de confusão. Se existe uma variável Z que afeta tanto M quanto Y, e você não a inclui no modelo, você está atribuindo a Z efeitos que na verdade são espúrios. Identificar e controlar essas variáveis é frequentemente mais difícil do que o próprio teste de mediação. Eu costumo mapear isso com um diagrama causal antes de qualquer regressão — leva 10 minutos e evita retrabalho significativo depois.
Para rodar a análise básica com bootstrap em R: 1. Carregue os pacotes mediation e lavaan.
2. Especifique o modelo de mediação com dois passos: regressão de M sobre X, e regressão de Y sobre X e M. 3. Use bootstrapping com pelo menos 2.000 réplicas para estabilidade.
4. Verifique se o intervalo de confiança para o efeito indireto não cruza zero. 5. Reporte tanto o efeito indireto quanto o direto, separadamente.
Se o seu modelo tiver mais de uma via de mediação em paralelo, a complexidade aumenta. Cada caminho extra exige mais observações para manter poder estatístico adequado. Como regra prática, conte no mínimo 15 a 20 casos por parâmetro estimado quando houver múltiplas mediações simultâneas. Abaixo disso, os estimadores começam a instabilizar e os resultados passam a depender muito da semente do bootstrap. Não existe solução única que funcione sempre. Dados de painel com efeitos fixos dão inferência mais robusta. Dados de experimentos aleatórios dão a melhor evidência causal possível para mediação. Dados observacionais transversais dão o que dão — interpretação cuidadosa com limitações explícitas. Saber qual cenário você tem e comunicar as limitações adequadamente é parte do trabalho, não um acessório.