Frequencias Absoluta E Relativa - Determinar frequências absoluta, relativa e relativa percentual
Determinar frequências absoluta, relativa e relativa percentual

Calcular frequência absoluta e relativa não é difícil, mas todo mundo erra na parte que importa

Você provavelmente já viu as definições na wiki ou no livro didático: frequência absoluta é o número de vezes que um valor aparece, e frequência relativa é essa contagem dividida pelo total de observações. Ótimo para provas de faculdade. O problema é que na prática esses conceitos se comportam de formas diferentes dependendo do que você está analisando. Eu passei anos lidando com isso em bancos de dados reais, então vou mostrar como isso funciona de verdade, sem enrolação. Vou explicar primeiro o método prático, porque é mais fácil entender a teoria quando você vê a aplicação direta. A partir da minha experiência, a maioria dos problemas surge quando você tem valores ausentes, amostras muito pequenas ou precisão decimal diferente entre colunas. Se você tentar generalizar demais, vai perder tempo ajustando coisas que não precisam de ajuste.

O que são frequencias absoluta e relativa na prática

Frequência absoluta é simplesmente uma contagem. Você tem uma variável qualquer — idade, preço, categoria de produto, resultado de teste médico — e conta quantas vezes cada valor aparece. Frequência relativa pega esse número e divide pela quantidade total de registros na sua base. O resultado é uma proporção, que pode ser expressa em decimal (0,25) ou porcentagem (25%). Parece simples, mas existem nuances que quase ninguém menciona. A primeira nuance importante: frequência relativa nunca some exatamente 100% se os seus dados tiverem casas decimais truncadas. Em bases com mais de mil linhas, essa diferença costuma ficar entre 0,01% e 0,03%. Não é erro de cálculo, é arredondamento natural. Quando eu trabalho com relatórios para diretoria, eu sempre deixo uma linha de ajuste no final mostrando essa divergência. Ignorar isso gera perguntas chatas em reuniões que não vêm ao caso.

Outro detalhe que pouca gente leva a sério: a frequência relativa muda de significado dependendo do tamanho da amostra. Se você tem 50 observações e um valor aparece 5 vezes, a frequência relativa é 10%. Parece significativo. Mas se você tem 5.000 observações e o mesmo valor aparece 500 vezes, a frequência relativa continua sendo 10%. O que muda é a confiança estatística. Com 50 observações, esse 10% pode ser pura aleatoriedade. Com 5.000, é um padrão real. Eu já vi analistas tratarem os dois casos da mesma forma e chegarem a conclusões completamente equivocadas sobre o comportamento de um produto no mercado. Tenho um exemplo específico de um projeto que fiz há alguns anos com dados de vendas de uma rede de varejo. A frequência absoluta mostrava que um determinado SKUs aparecia em apenas 12 das 3.400 lojas. A frequência relativa era desprezível. A conclusão óbvia seria descontinuar o produto. Mas eu fiz uma segmentação por região e descobri que aquelas 12 lojas estavam concentradas em apenas três cidades do interior, onde o SKU tinha frequência absoluta de 89% dos cards de venda. O produto não era irrelevante — era fortemente segmentado geograficamente. Tratá-lo como insignificante baseado apenas na frequência relativa agregada seria um erro caro.

Como calcular passo a passo

Se você está começando agora, o caminho mais direto é usar planilhas ou scripts simples. Vou usar exemplos práticos que funcionam em qualquer ferramenta básica. Pegue os seus dados. Vamos supor uma coluna chamada Cor do Produto com os valores: vermelho, azul, verde, vermelho, azul, vermelho, verde, azul, azul, vermelho. São 10 registros no total.

Para a frequência absoluta de cada cor, você conta: - Vermelho: 4

- Azul: 4 - Verde: 2

Para a frequência relativa, divide cada contagem pelo total (10): - Vermelho: 4/10 = 0,4 ou 40%

- Azul: 4/10 = 0,4 ou 40% - Verde: 2/10 = 0,2 ou 20%

Em Excel ou Google Sheets, a função CONT.SE resolve a frequência absoluta. Para a relativa, basta dividir o resultado pela contagem total com CONTARA. Em Python, usando pandas, o comando é praticamente automático: df['coluna'].value_counts() dá a frequência absoluta, e df['coluna'].value_counts(normalize=True) já retorna a frequência relativa diretamente, em formato decimal. O comando em Python fica assim:

👉 Clique no botão abaixo para saber mais sobre o assunto!

df['cor'].value_counts() produz os números brutos df['cor'].value_counts(normalize=True) produz as proporções

df['cor'].value_counts(normalize=True).mul(100) converte para porcentagem Se você estiver lidando com dados numéricos contínuos — como salários, idades ou temperaturas — o processo é ligeiramente diferente. Você precisa criar classes (intervalos) antes de calcular. Isso se chama distribuição de frequência com dados agrupados. Escolha o número de classes usando a regra de Sturges: k = 1 + 3,322 × log(n), onde n é o total de observações. Para 100 registros, isso dá aproximadamente 8 classes. Defina o intervalo, conte quantos valores caem em cada classe para a frequência absoluta, e divida pelo total para a relativa.

Erros comuns que eu vejo todo dia

O primeiro erro é confundir frequência relativa com probabilidade. Frequência relativa descreve o que aconteceu nos seus dados. Probabilidade prevê o que pode acontecer. Eles se parecem numericamente, mas têm naturezas diferentes. Usar frequência relativa como sinônimo de probabilidade é aceitável em contextos exploratórios, mas perigoso quando você precisa tomar decisões baseada em projeções. O segundo erro é ignorar valores atípicos. Se você tem um dataset de salários e um único registro mostra R$ 50 milhões, a frequência absoluta e relativa vão refletir isso. Um único outlier pode dominar completamente a distribuição e mascarar padrões reais nos outros dados. Antes de calcular frequências, rode uma análise de outliers. Boxplot ou Z-score resolvem isso rapidamente.

O terceiro erro é mais sutil e acontece quando você trabalha com amostras estratificadas. Imagine que você tem dois grupos: grupo A com 100 pessoas e grupo B com 1.000 pessoas. Se calcular a frequência relativa geral sem considerar o estrato, o grupo B vai inflacionar artificialmente a proporção. A solução é calcular frequências relativas dentro de cada estrato e depois ponderar corretamente, ou simplesmente apresentar os resultados segmentados.

Quando esses conceitos falham

Frequência absoluta e relativa não são ferramentas universais. Elas funcionam bem para dados categóricos e numéricos discretos com amostras razoáveis. Mas têm limitações sérias em alguns cenários. Primeiro, com variáveis contínuas e muitos valores únicos — como preço exato de imóveis — a frequência absoluta de cada valor individual será quase sempre 1 ou 2, tornando a análise inútil sem agrupamento prévio. Nesse caso, você precisa transformar a variável contínua em categórica criando intervalsos significativos, e isso já introduz subjetividade na escolha da amplitude.

Segundo, com amostras muito pequenas — menos de 30 observações — as frequências relativas são instáveis. Um único registro novo altera drasticamente os percentuais. Nesse cenário, intervalos de confiança são mais úteis do que frequências relativas isoladas. Terceiro, dados com presença significativa de valores nulos. Se 15% dos seus registros estão ausentes e você não os trata antes, as frequências relativas ficarão distorcidas. A contagem total diminuirá e as proporções serão calculadas sobre uma base menor do que você espera. Sempre verifique a taxa de missing antes de qualquer cálculo de frequência.

Para situações onde frequências tradicionais não resolvem, considere usar entropia de Shannon ou medidas de concentração como o índice de Gini. Eles capturam diversificação e desigualdade de forma mais robusta do que simples contagens e proporções, especialmente em datasets com distribuição altamente assimétrica.

Um resumo rápido do que funciona

Para dados categóricos simples: use value_counts() no pandas ou CONT.SE no Excel. Resultado imediato, sem complicação. Para dados numéricos contínuos: Agrupe com base na regra de Sturges ou em critérios de domínio. Teste diferentes amplitudes de classe e veja qual produz a distribuição mais informativa.

Para amostras estratificadas: Calcule frequências relativas por estrato. Apresente os resultados segmentados, não agregados. Para datasets com muitos missing: Trate os nulos antes. Decida se remove, imputa ou cria uma categoria separada para ausentes.

Para validação: Some as frequências relativas. O resultado deve ser 1,0 (ou 100%). Se estiver muito distante disso, algo está errado nos seus dados ou no seu código. O que eu mais aprendi com o tempo é que frequência absoluta e relativa são ferramentas de diagnóstico, não de conclusão. Elas mostram padrões, sim, mas os padrões precisam ser contextualizados. Um valor com frequência relativa de 2% pode ser irrelevante ou pode ser o indicador mais importante do seu problema, dependendo do que você está tentando entender. O cálculo em si é trivial. A interpretação é que consome a maior parte do trabalho.