Distribuição De Frequencia Com Intervalo De Classe - Distribuição De Frequencia Com Intervalo De Classe - FDPLEARN
Distribuição De Frequencia Com Intervalo De Classe - FDPLEARN

O que é e como se constrói na prática

Construir uma distribuição de frequencia com intervalo de classe significa agrupar dados numéricos em faixas (classes) para tornar a análise viável quando o conjunto é grande demais para ser lido linha por linha. Cada classe recebe um limite inferior e um limite superior, e a frequência correspondente é a quantidade de observações que caiu dentro daquele intervalo. O resultado é uma tabela com colunas que geralmente incluem limite inferior, limite superior, amplitude da classe, ponto médio e frequência absoluta, além de frequências relativas e acumuladas conforme a necessidade.

Como fazer a distribuição de frequencia com intervalo de classe passo a passo

Vamos direto ao método. Pegue os dados brutos, encontre o valor mínimo e o máximo, calcule a amplitude total como a diferença entre eles, decida quantas classes usar e distribua os dados nesses intervalos. A regra prática para o número de classes é a regra de Sturges, que em muitos casos costuma funcionar bem: k igual a 1 mais o logaritmo base 2 do número de observações. Para conjuntos entre 50 e 150 valores, isso geralmente resulta em algo entre 7 e 9 classes. Não precisa ser dogmático, mas funciona como ponto de partida. Depois de escolher k, calcule a amplitude de classe dividindo a amplitude total por k. Arredonde esse valor para cima para um número prático, como um múltiplo de 5 ou 10, dependendo da escala dos seus dados. Se a divisão gerar algo como 4,83, use 5. Classifique cada observação na classe correspondente, contando as ocorrências com traços ou com um pequeno script. Some as frequências para validar que o total bate com o número de dados originais. Complete a tabela com ponto médio, frequência relativa e frequência acumulada.

Cálculos envolvidos e como montar a tabela

A amplitude total é simplesmente o valor máximo menos o valor mínimo. Em muitos conjuntos reais, esse cálculo já descarta a necessidade de trabalhar com valores negativos se você subtrair corretamente. A amplitude de classe, chamada de h na literatura, é a divisão da amplitude total pelo número de classes. O ponto médio de cada classe é a média aritmética entre o limite inferior e o limite superior, ou seja, LI mais LS dividido por 2. A frequência relativa é a frequência absoluta da classe dividida pelo total de observações. A frequência acumulada soma as frequências absolutas até a classe atual. Um detalhe que as pessoas costumam perder é a convenção de limites. A regra clássica é que o limite superior de uma classe não pertence àquela classe, mas pertence à seguinte. Isso evita ambiguidade quando um valor é exatamente igual ao divisor. Na prática, isso significa tratar o intervalo como fechado à esquerda e aberto à direita, ou usar notação que deixe isso explícito. Se os dados forem inteiros e você usar limites com casas decimais, certifique-se de que a fronteira seja consistente em toda a tabela.

Vejo muitos erros de arredondamento acontecendo nesse processo. Se você arredondar a amplitude de classe para baixo, o intervalo final pode não cobrir o valor máximo. Se arredondar para cima, pode acabar com uma classe vazia ou com amplitude ligeiramente maior que o necessário. O correto é arredondar para cima e ajustar o último limite superior para incluir o máximo, mantendo todas as outras amplitudes iguais. Um erro desses muda completamente o resultado visual e numérico, especialmente em gráficos de histograma.

Um exemplo simples e direto

Suponha que você tenha 40 notas de alunos e os valores variem de 32 a 88. A amplitude total é 56. Aplicando Sturges, 1 mais log2 de 40 dá aproximadamente 6,32, então arredondo para 7 classes. Dividindo 56 por 7, a amplitude de classe seria 8. Vamos adotar h igual a 8. As classes ficam assim: 32 até 40, 40 até 48, 48 até 56, 56 até 64, 64 até 72, 72 até 80, 80 até 88. Note que o último limite superior precisa ser ajustado se o valor máximo for exatamente 88, porque 88 está na fronteira. Nesse caso, a última classe deve ser tratada como 80 até 88, com a convenção de que o 88 pertence a essa classe. Depois de contar as frequências, a tabela fica parecida com isto:

Classe | LI-LS | Ponto médio | Freq absoluta | Freq relativa | Freq acumulada 32-40 | 36 | 1 | 0,025 | 1

40-48 | 44 | 4 | 0,10 | 5 48-56 | 52 | 12 | 0,30 | 17

👉 Clique no botão abaixo para saber mais sobre o assunto!

56-64 | 60 | 15 | 0,375 | 32 64-72 | 68 | 6 | 0,15 | 38

72-80 | 76 | 2 | 0,05 | 40 80-88 | 84 | 0 | 0,00 | 40

Isso é só um exemplo esquemático. Na prática, você vai contar com cuidado e validar a soma das frequências absolutas contra o total de dados. Se não bater, há erro de classificação ou de contagem.

Distribuição de frequencia com intervalo de classe no dia a dia

Em ambientes reais, o problema mais comum não é o cálculo em si, mas a decisão do número de classes. Poucas classes escondem variações importantes. Muitas classes criam ruído e tornam a leitura improdutiva. Para conjuntos pequenos, abaixo de 30 observações, intervalos de classe muitas vezes não valem a pena porque a tabela já é simples o suficiente para ler os dados brutos. Para conjuntos grandes, acima de 500, você pode começar com Sturges e testar a regra de Freedman-Diaconis como alternativa, que usa a amplitude interquartil e tende a produzir menos classes em dados com muita dispersão. Outro ponto que vejo constantemente mal aplicado é a frequência relativa. Quando se compara distribuições com totais diferentes, usar frequência absoluta leva a conclusões erradas. A frequência relativa normaliza a comparação. Se um grupo tem 200 observações e outro tem 50, a classe com maior frequência absoluta no primeiro grupo pode ter proporção menor no segundo. Isso altera a interpretação visual.

Existe ainda o problema das classes abertas. Às vezes você tem valores extremos que não cabem nas classes propostas, ou a natureza dos dados exige uma primeira classe aberta por baixo ou uma última aberta por cima. Nesse cenário, o cálculo do ponto médio da classe aberta precisa de uma suposição razoável. Eu costumava usar metade da amplitude das classes vizinhas como estimativa, mas isso só funciona se a cauda não for muito distorcida. Se houver outliers fortes, é melhor tratar esses valores separadamente e analisar a distribuição principal sem eles, ou usar transformações antes de agrupar. Um caso específico que me marcou aconteceu com um conjunto de tempos de resposta de servidores onde os valores iam de 12 ms a 1.840 ms. Aplicando Sturges com cerca de 300 observações, saíram 9 classes e a maioria concentrava nos menores intervalos, enquanto a classe final tinha muitos valores agrupados de forma inútil. A solução foi usar uma escala logarítmica antes de construir os intervalos. Converti os dados com log10, recalculei a amplitude e as classes ficaram mais equilibradas, revelando um pico de performance entre 100 e 300 ms que a distribuição linear escondia completamente.

Limitações e quando não usar esse método

A distribuição de frequência com intervalos de classe perde informação. Ao agrupar, você descarta a variação dentro de cada classe. Dois conjuntos podem ter a mesma tabela de frequências e comportamentos completamente diferentes. Isso é particularmente problemático quando a amostra é pequena ou quando a precisão individual importa. Nesses cenários, manter os dados brutos ou usar gráficos de dot plot pode ser mais honesto. Também há problemas com dados discretos que têm muitos valores repetidos. Classes muito estreitas podem gerar muitas classes vazias, e classes muito largas mascaram a estrutura. Se o objetivo é comparar distribuições, métodos não paramétricos como o teste de Kolmogorov-Smirnov ou estatísticas de empilhamento costumam ser mais informativos do que tabelas de frequência sozinhas.

Outra limitação prática é que a escolha do número de classes é subjetiva na maioria das vezes. Sturges é rápido, mas não é ótimo para todas as distribuições. Dados simétricos funcionam bem. Dados assimétricos ou multimodais precisam de ajuste manual. O recomendável é construir a tabela com Sturges, observar o gráfico resultante, e se a forma não fizer sentido, ajustar k ou mudar de abordagem. Não existe um número único que resolva todos os casos. Se você precisa apenas de uma visão geral rápida e o conjunto é pequeno, pule os intervalos de classe. Se o conjunto é grande e a forma da distribuição é o que importa, os intervalos são úteis, mas valide sempre a soma das frequências, a convenção de limites e a representatividade das classes extremas. Erros nesses três pontos são os que mais causam confusão em relatórios e análises subsequentes.