Tipos De Variaveis Em Estatistica - Tipos de Variáveis - Resumo de Estatística | Variáveis estatísticas ...
Tipos de Variáveis - Resumo de Estatística | Variáveis estatísticas ...

Por que você errou a análise outra vez

A maioria das pessoas aprende a classificar variáveis em qualitativas e quantitativas na faculdade, acha que entendeu o assunto e só se dá conta de que erraram quando rodou um modelo e os coeficientes ficaram sem sentido. Eu já vi isso acontecer com frequência suficiente para não ter mais paciência com definições de livro didático. O problema real é que a classificação correta determina o teste estatístico que você pode aplicar, e usar o teste errado porque confundiu ordinal com nominal é a causa número um de revisões em papers.

O básico dos tipos de variaveis em estatistica

Variáveis qualitativas (categóricas) expressem atributos sem magnitude numérica intrínseca. Variáveis quantitativas expressam grandezas mensuráveis. Essa divisão parece óbvia até você encontrar uma variável como "score de satisfação" codificado de 1 a 5, onde alguém pode te convencer de que é numérica e outro te obrigar a tratar como ordinal. Ambos podem estar certos ou errados, dependendo do que você vai fazer com ela depois. As categorias principais são:

Nominal: categorias sem ordem. Gênero, cor do cabelo, tipo sanguíneo, cidade de residência. Trocar a ordem das categorias não altera nada na análise. Usar média aritmética nesse tipo de variável é um erro clássico que eu ainda vejo aparecer em relatórios trimestrais. Ordinal: categorias com ordem definida, mas sem intervalo uniforme entre elas. Estágio da doença (leve, moderado, grave), nível de educação, satisfação em escala Likert. A diferença entre "leve" e "moderado" não é necessariamente a mesma coisa que a diferença entre "moderado" e "grave". Medianas e rank tests funcionam aqui. Médias são questionáveis na melhor das hipóteses.

Discreta: valores numéricos inteiros resultantes de contagem. Número de filhos, quantidade de acidentes, vezes que um cliente comprou. Sempre inteiros. Não faz sentido ter 2,7 filhos no seu dataset. Contínua: valores numéricos que podem assumir qualquer ponto numa faixa. Peso, temperatura, tempo de reação, receita anual. Na prática, toda variável contínua é discretizada pelo instrumento de medição, mas você trata como contínua quando a granularidade é fina o suficiente para não importar.

Como decidir na prática, não na teoria

A primeira coisa que eu faço antes de qualquer análise é montar uma tabela simples no Excel ou no R com cada variável do dataset e uma coluna para o tipo. Isso leva três minutos e evita horas de debugging depois. O processo é: identifique se tem ordem natural, identifique se tem intervalo uniforme, e então decida. Para qualitativas: pergunte se faz sentido ordenar as categorias. Se sim, é ordinal. Se não, é nominal. Para quantitativas: pergunte se os valores são contagens (discreta) ou medições (contínua). A resposta para a maioria das variáveis é clara. A resposta para variáveis de escala Likert com 7 pontos é onde a coisa fica complicada.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Eu já perdi tempo demais achando que podia tratar escala Likert como contínua porque tinha cinco ou mais pontos. A literatura estatística sobre isso é dividida. Alguns autores defendem que com cinco ou mais pontos a aproximação contínua é aceitável, especialmente para fins de estimação de média e variância. Outros mantém que ordinal exige tratamento ordinal. A verdade pragmática é que testes baseados em rank (Mann-Whitney, Kruskal-Wallis) são sempre seguros, enquanto testes paramétricos (t-test, ANOVA) podem inflar falsos positivos dependendo da distribuição dos dados. Se você tiver dúvida, rode ambos e compare os resultados. Se as conclusões forem diferentes, o problema é a variável, não o teste. Outro caso que todo mundo subestima é variável temporária. Data de nascimento parece contínua à primeira vista, mas na verdade é discreta quando medida em anos inteiros e ordinal quando agrupada em faixas etárias. Tratar idade em anos como contínua em modelos lineares geralmente funciona porque o intervalo é grosso o suficiente para mascarar a descontinuidade, mas se você trabalha com saúde pública e faixas etárias de dez anos, isso vira ordinal puro e as análises mudam completamente.

Pegadinhas que ninguém conta nos cursos introdutórios

Uma variável pode mudar de tipo dependendo da transformação que você aplica. Receita anual é contínua. Receita categorizada em "até 5 mil", "5 a 10 mil", "acima de 10 mil" vira ordinal. Binárias (sim/não, 0/1) são qualitativas nominais tecnicamente, mas qualquer manual de regressão logística trata como quantitativas. Ambos os tratamentos estão corretos no contexto adequado. O erro é usar o contexto errado. Variáveis geográficas também causam confusão. Código de área postal (CEP) é nominal, não numérico. Não existe ordem intrínseca e fazer média de CEP não quer dizer absolutamente nada. Já vi analista calcular "média de CEP" em um relatório de segmentação de mercado. A variável só ganha propriedade numérica se você extrair a região ou o município dela, e aí passa a ser nominal com categorias interpretáveis.

Em pesquisa clínica, variáveis de desfecho composto são outro campo minado. Se você cria uma pontuação agregando vários itens, a pontuação total pode se comportar como contínua em algumas situações e ordinal em outras, dependendo da quantidade de itens e da distribuição dos escores. A regra prática que eu uso: se a variável agregada tiver menos de 10 pontos possíveis e distribuição claramente assimétrica, trate como ordinal. Se tiver 20 ou mais e a distribuição se aproximar de normal, pode tratar como contínua com ressalvas.

O que acontece quando você erra

Tratando nominal como ordinário, você introduz uma ordem arbitrária nos dados. O software não reclama, mas seus resultados refletem essa arbitrariedade. Tratar ordinal como contínua, você assume intervalos iguais onde eles não existem, o que distorce médias e desvios padrão. Tratar discreta como contínua em amostras pequenas, você perde poder estatístico porque os testes paramétricos perdem eficiência com dados grosseiramente discretizados. E o pior: em nenhum desses casos o software gera erro de execução. Você só descobre o problema quando revisor ou gestor pergunta "por que esse resultado não faz sentido". A correção mais eficiente que eu descobri foi adotar um fluxograma de decisão simples antes de qualquer análise. Pergunta um: a variável tem categoria? Se não, é quantitativa. Se sim, pergunta dois: essas categorias têm ordem natural? Se não, é nominal. Se sim, é ordinal. Variável quantitativa: é contagem ou medição? Contagem é discreta, medição é contínua. Esse fluxo resolve cerca de 95 por cento dos casos. Os outros 5 por cento são variáveis compostas ou transformadas, onde a decisão exige julgamento contextual.

Só pra deixar claro: não existe método perfeito de classificação. Dados de survey, variáveis derivadas e medidas compostas vão exigir decisão humana. O importante é documentar a decisão, não fingir que o tipo da variável aparece magicamente do nada. Quando você passa um ano analisando dados, percebe que a maior parte do tempo gasto em projetos não é com análise em si, mas com a classificação correta das variáveis desde o início. Fazer isso direito economiza dias de retrabalho.