A Distribuição De Bernoulli Modela Situações - Grátis: A distribuição de Bernoulli modela situações em que uma ...
Grátis: A distribuição de Bernoulli modela situações em que uma ...

Como usar a distribuição de Bernoulli na prática

Você já precisou modelar algo que só tem dois resultados possíveis e não sabia por onde começar? Eu also trabalho com dados binários há anos — aprovações de crédito, testes de software, campanhas de marketing com click/no-click. A diistribuição de bernoulli modela situações assim desde o século XVIII e ainda é a base de quase qualquer modelo probabilístico que você vê hoje.

O que a distribuição de bernoulli modela situações realmente significa

A distribuição de Bernoulli é simplesmente uma variável aleatória discretas que assume valor 1 com probabilidade p e valor 0 com probabilidade 1-p. Nada mais. Se p = 0,7, você tem 70% de chance de ver um sucesso e 30% de ver um fracasso em cada tentativa independente. A função de probabilidade é f(k) = p^k * (1-p)^(1-k) para k em {0,1}. O esperança é E[X] = p e a variância é Var(X) = p(1-p). Isso é tudo que existe. O que muita gente esquece é que a Bernoulli é o caso especial da Binomial com n=1. Quando você soma n variáveis de Bernoulli independentes com o mesmo p, você obtém uma Binomial(n,p). Essa conexão explica por que tantos modelos começam com Bernoulli e escalam para Binomial depois.

Por que isso importa no dia a dia

Vou ser direto: se você está analisando dados de conversão de um funil de vendas, cada visita ao site é uma tentativa de Bernoulli. O rate de conversão é o seu p. Se você tem 10.000 visitas e 350 conversões, seu estimador de máxima verossimilhança para p é simplesmente 350/10000 = 0,035. Intervalo de confiança de 95% usando Wald: p ± 1,96 * sqrt(p(1-p)/n), que dá aproximadamente [0,031, 0,039]. Eu já vi analistas tentarem ajustar modelos Poisson para dados de taxa de conversão quando o denominador (exposições) era fixo e conhecido. Isso é errado. Poisson modela contagens em janelas de tempo, não proporções com denominador fixo. O correto é usar Binomial com log-link ou simplesmente a Bernoulli direta se cada unidade for independente.

Pegadinhas que ninguém conta

Aqui vai uma que aprendi na marra em 2019. Estava modelando falha de componentes eletrônicos — cada unidade testada era Bernoulli com probabilidade de defeito p. O problema: meus testes não eram independentes. Peças do mesmo lote de fabricação compartilhavam um efeito aleatório. A variância observada era muito maior que p(1-p), o famoso overdispersion. Se eu tivesse usado a Bernoulli pura, meus intervalos de confiança estariam 40% mais estreitos do que deveriam. A solução foi trocar para uma Bernoulli-Beta (modelo hierárquico com prior beta sobre p) ou, mais pragmaticamente, usar um modelo Beta-Binomial que captura a correlação intra-lote. O Beta-Binomial tem variância Var(X) = n*p*(1-p) * (1 + (n-1)*rho), onde rho é o coeficiente de correlação intra-classe. Estimar rho a partir dos dados do lote me deu rho 0,12, o que expandiu meu intervalo de confiança de defeito de [0,021, 0,031] para [0,015, 0,042].

Outra pegadinha: quando p é muito perto de 0 ou 1, a aproximação normal para a Binomial (e portanto para a soma de Bernoullis) falha. Regra prática: se n*p < 5 ou n*(1-p)

5, use a Binomial exata ou a aproximação de Poisson (se p pequeno e n grande). A aproximação de normal começa a dar probabilidades negativas para caudas extremas, o que é absurdos em qualquer contexto real.

Limitações que você precisa aceitar

A distribuição de Bernoulli exige independência entre tentativas. Se seu dados têm autocorrelação temporal (vendas de hoje dependem de vendas de ontem) ou agrregação espacial (clientes do mesmo bairro se influenciam), a Bernoulli pura está errada. Nesse caso, considere modelos de séries temporais com resposta binária (logística autoregressive) ou modelos mistos com efeitos aleatórios. Outro limite: a Bernoulli assume que p é constante. Em campanhas de marketing, p varia ao longo do tempo porque o público-esgotamento reduz a taxa de conversão. Um modelo de Bernoulli com p fixo subestimará a incerteza em projeções de longo prazo. Use processos de Levy ou modelos com p(t) dependente do tempo.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Se você precisa de uma alternativa direta para dados com overdispersion, o Beta-Binomial é a resposta mais simples. Ele mantém a estrutura binária mas permite que p varie entre tentativas segundo uma distribuição beta. Isso captura correlação sem complicar demais o modelo. Implementação em Python com PyMC3 leva cerca de 30 linhas de código e roda em segundos para datasets com até 100 mil observações.

Como implementar rapidamente

Se você quer rodar um modelo de Bernoulli agora, aqui vai o mínimo funcional em Python com statsmodels: import numpy as np\nfrom statsmodels.genmod.generalized_linear_model import GLM\nfrom statsmodels.genmod.families import Binomial\n\ndados: y = resultados (0/1), X = design matrix\ny = np.array([1,0,1,1,0,1,0,0,1,1])\nX = np.column_stack([np.ones(len(y))])\n\nmodel = GLM(y, X, family=Binomial())\nresult = model.fit()\nprint(result.summary())

Isso estima p via máxima verossimilhança com link logit padrão. Se você tem covariáveis, adicione colunas a X. O resultado dá estimação de coeficientes, erro padrão,z e intervalo de confiança de 95%. Para dados com overdispersion, substitua Binomial por QuasiBinomial com dispersion fixo. Caso precise de distribuição de bernoulli modela situações em R, o código equivalente com glm() e family=binomial() leva 3 linhas e roda instantaneamente. A diferença é que R retorna default a análise de deviance residuals, o que é útil para detectar outliers em dados binários.

Quando NÃO usar Bernoulli

Se seus dados são proporções agregadas (ex: taxa de aprovação por região com N grande), não use Bernoulli por observação individual. Use Binomial com pesos igual ao denominador. Isso é mais eficiente computacionalmente e estatisticamente correto. Dados agregados em modelos de Bernoulli inflacionam o número de observações e subestimam variância. Outro caso: se cada "tentativa" na verdade é uma soma de múltiplos eventos Bernoulli (ex: número de cliques por usuário em 24h, onde cada segundo click é uma nova tentativa), o modelo de Bernoulli com p fixo underestima a variância. Use Poisson com offset log(tempo) ou Negative Binomial para capturar a heterogeneidade.

A distribuição de Bernoulli é poderosa mas limitada. Entender esses limites é o que separa quem ajusta modelos mecanicamente de quem escolhe o modelo certo para o problema certo. Na prática, eu gasto cerca de 20% do tempo verificando se a independência e o p constante fazem sentido antes de rodar qualquer modelo. Esse tempo economiza horas de refatoração depois.