O que são medidas de tendência central na prática
Quando você pega uma planilha com 500 linhas de vendas e quer responder rapidamente "qual é o nível normal aqui", não dá para olhar cada número. Você calcula algo que resume tudo. Isso é medida de tendência central. É o nome chique pra resposta curta de "onde tá o centro desses dados".
A verdade sobre o que é medidas de tendencia central
Existem três formas principais que você vai usar no dia a dia. Média aritmética, mediana e moda. Cada uma serve pra coisa diferente, e trocar uma pela outra sem pensar já causou prejuízo real pra muita gente. Média aritmética é a soma de tudo dividido pela quantidade. Funciona bem quando os dados são simétricos e não têm valores extremos. O problema é que um único outlier pode distorcer completamente o resultado. Se você tem 99 pessoas ganhando R$ 3.000 e uma ganhando R$ 500.000, a média fica em R$ 7.900. Ninguém nessa lista ganha R$ 7.900. A média mentiu.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Mediana é o valor que divide os dados ao meio. Metade acima, metade abaixo. No exemplo anterior, a mediana seria R$ 3.000. Ela não sente o peso do outlier. É por isso que salários, valores imobiliários e renda familiar costumam ser reportados pela mediana e não pela média. Os jornais fazem isso há décadas porque a média soa melhor pro propaganda, mas a mediana é mais honesta. Moda é o valor que mais aparece. É útil quando você trabalha com dados categóricos ou discretos. Quantas vezes um cliente comprou? Qual tamanho de camisa vende mais? A moda responde direto. O problema é que datasets pequenos podem ter múltiplas modas ou nenhuma. Numa distribuição uniforme, todo valor aparece a mesma quantidade de vezes e a moda não existe.
No meu trabalho com análise de métricas de produto, eu lidei com um caso em que a média de tempo de sessão era de 4 minutos, a mediana era de 45 segundos, e a moda era de 12 segundos. Três números diferentes pra mesma coisa. A média era puxada por um punhado de usuários que ficavam horas na plataforma por error de tracking — basicamente sessões que não fechavam. A mediana mostrava o comportamento real da maioria. A moda revelava que o padrão era entrar e sair rápido. Usar só a média levava a decisões erradas sobre onde investir em retenção. A solução foi reportar os três sempre, junto com o desvio padrão e um histograma. Leva dois minutos a mais no relatório, mas evita que você tome uma decisão baseada num número mentiroso. Um detalhe que poucos iniciantes entendem: a escolha entre média e mediana não é subjetiva. Ela depende da distribuição dos seus dados. Teste de Shapiro-Wilk ou simplesmente olhe o histograma. Se for simétrica, média é fine. Se tiver cauda longa, mediana. Dados de receita, duração de tickets de suporte, tempo de carregamento — tudo isso tende a ser assimétrico à direita. Média nesses casos é armadilha.
Outro ponto prático: quando você agrupa dados, a média se soma. A mediana não. Se você tem a média de vendas de 10 filiais, você pode calcular a média geral delas. Com a mediana, não dá. Você precisa dos dados originais. Isso importa quando você está consolidando relatórios de times diferentes que usam formatos distintos. Se os seus dados têm muitos valores faltando, a média e a mediana calculam sem eles automaticamente (no Excel, R, Python), mas a moda pode dar resultado enganoso porque valores ausentes muitas vezes não são ausentes aleatoriamente. Dados que faltam costumam seguir um padrão. Ignorar isso é confundir silêncio com informação.