Formula Desvio Padrão Amostral - Fórmula De Variância | VARIÂNCIA E DESVIO PADRÃO AMOSTRAL – ATLG
Fórmula De Variância | VARIÂNCIA E DESVIO PADRÃO AMOSTRAL – ATLG

Entendendo o cálculo na prática

A fórmula desvio padrão amostral é uma das primeiras coisas que você aprende em estatística e também uma das mais mal aplicadas no dia a dia. A expressão é S = [(x - x)² / (n - 1)], onde S representa o desvio padrão amostral, indica somatório, x é cada valor individual do conjunto de dados, x é a média aritmética desses valores e n é o tamanho da amostra. O denominador n - 1 é o que todo mundo esquece ou usa errado quando aperta para responder rápido. Já vi engenheiro de qualidade usar n no lugar de n - 1 numa análise de processo de usinagem porque achava que era menos conservador. Na verdade, ele estava subestimando a variabilidade real do processo. Com um lote de 25 peças, a diferença entre usar n ou n - 1 mudou o desvio padrão de 0,47 para 0,49 micrômetros. Pareceu pouco, mas quando você entra esse número num cálculo de capacidade de processo (Cp e Cpk), o resultado muda de "processo aceitável" para "processo inadequado". O problema só apareceu depois que o cliente reclamou de peças fora da especificação.

Formula desvio padrão amostral: passo a passo sem complicação

Vamos direto. Você pega seus dados, calcula a média somando tudo e dividindo por n, depois subtrai a média de cada observação individual, eleva cada diferença ao quadrado, soma esses quadrados e divide por n - 1. Por fim, extrai a raiz quadrada do resultado. Esse último passo é importante porque os quadrados colocam tudo na unidade original ao contrário, e a raiz resolve isso. No Excel, a função é =DESVPAD.A(seus_dados). Em Python com pandas, é dataframe.std(ddof=1), e o ddof=1 é exatamente o ajuste de Bessel que transforma o denominador de n para n - 1. Se você usar ddof=0 por padrão, o resultado será o desvio padrão populacional, não amostral, e aí trava tudo num relatório que precisa ser revisado depois.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Uma coisa que pouca gente comenta é que o desvio padrão amostral é um estimador tendencioso para a distribuição normal. Ele tende a subestimar o verdadeiro sigma populacional, especialmente com amostras pequenas. Para corrigir isso de forma mais precisa, existe o estimador de Chapman, que multiplica S por [(n/2) / ((n-1)/2)] * (n/2), onde é a função gama. Na prática, raramente usei isso fora de simulações Monte Carlo porque o viés já fica abaixo de 1% a partir de n=30. Mas em amostras de 5 a 10 observações, o viés pode atingir 8 a 12%, e isso distorce intervalos de confiança de maneira significativa. Também vale saber que a fórmula pressupõe independência entre as observações. Se você está medindo peças produzidas em sequência numa linha onde há deriva térmica, por exemplo, as observações não são independentes e o desvio padrão vai capturar tanto a variabilidade dentro do lote quanto a deriva temporal. Eu já lidhei com isso num processo de revestimento onde o forno esfriava lentamente entre lotes. O desvio padrão amostral parecia alto demais para o controle de qualidade, mas o problema era a variação entre sub-lotes, não dentro deles. A solução foi decompor a variância usando uma ANOVA de um fator, separando o variance between batches do variance within batches. O Sigma dentro dos lotes era 0,3 micrômetros e o entre lotes era 1,2 micrômetros. Só com essa separação ficou claro que o problema estava no aquecimento do forno, não na aplicação do revestimento.

Outro ponto que causa confusão é a diferença entre desvio padrão amostral e erro padrão da média. O primeiro mede a dispersão dos dados brutos, o segundo mede a precisão da média estimada e se calcula como S / n. Usar um no lugar do outro num gráfico de controle é um erro frequente. Eu já vi um analista construir um gráfico Xbar com os limites baseados no desvio padrão amostral em vez do erro padrão, e os pontos pareciam todos fora de controle porque os limites estavam extremamente apertados. Ajustei para usar o erro padrão e o gráfico ficou normal na hora. Se estiver trabalhando com dados de campo e não tiver acesso a um software estatístico, uma alternativa prática é calcular manualmente com uma planilha básica em três etapas: primeira coluna com os valores originais, segunda com (valor - média)², e então somar a segunda coluna, dividir por n - 1 e tirar a raiz. Funciona para amostras de até 50 observações sem dor de cabeça. Acima disso, o risco de erro de digitação aumenta e o tempo de cálculo já compensa automatizar com uma função.