O coeficiente de gini no dia a dia
O coeficiente de gini é uma medida estatística de desigualdade que varia de 0 a 1. Zero significa igualdade perfeita, onde todos ganham exatamente o mesmo. Um representa desigualdade máxima, com uma única pessoa detendo toda a renda. O cálculo parte da curva de Lorenz, que plot a proporção acumulada da renda contra a proporção acumulada da população, ordenada do mais pobre para o mais rico. O coeficiente é basicamente a razão entre a área entre a linha de perfeita igualdade e a curva de Lorenz, e a área total sob a linha de perfeita igualdade. A fórmula clássica de pairwise é D = S / (2 * n² * ), onde S é a soma dos pares absolutos de diferenças de renda, n o tamanho da amostra e a média de renda.
Ao entender o que é o coeficiente de gini
Vamos direto ao ponto prático. Você pega dados de renda, ordena, constrói a curva de Lorenz e extrai a área. Na teoria, isso leva cinco minutos. Na prática, com dados reais de pesquisa domiciliar brasileira, tipo a PNAD Contínua, o primeiro problema que você encontra é a variável de peso. Dados surveiçados não são uma amostra probabilística simples de toda a população. Cada rendimento observado carrega um peso amostral que reflete a população que ele representa. Se você calcular o gini sem incorporar os pesos corretamente, o resultado vai enviesar. E não é um viés pequeno. Em uma análise que fiz com dados de rendimento nominal de chefes de família, o gini bruto sem pesos veio em 0,548. Ajustando pela ponderação correta e pela distribuição de tamanho familiar, caiu para 0,521. Quase duas pontos percentuais de diferença que mudam completamente a narrativa. O segundo problema que ninguém avisa é a questão das extremidades da distribuição. Gini não lida bem com caudas muito pesadas. Quando você tem 1% da população concentrando mais de 40% da renda, como acontece no Brasil, pequenas variações na definição do topo da distribuição alteram o coeficiente de forma desproporcional. Já peguei dados onde a variável de renda truncava em 100 salários mínimos, mas a própria tabela informava que X% dos respondentes estavam na classe de rendimento superior a esse limite. Tratar esses valores como exatos gera um viés de subestimativa do gini que costuma girar em torno de 0,005 a 0,015, dependendo da severity do truncamento.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Uma solução que eu adotei foi interpolar os valores do topo usando uma distribuição de Pareto ajustada pelo método de máxima verossimilhança. A lógica é simples: os dados acima do truncamento seguem uma distribuição de potência. Estimei alpha a partir da fração de observações na cauda e gerei valores imputados condicionalmente. Isso reduziu o viés de forma significativa, especialmente para indicadores de concentração que dependem do top 1%. Claro, isso pressupõe que a cauda de fato segue Pareto, o que nem sempre é verdade absoluta, mas é uma aproximação muito melhor do que truncar brutamente ou simplesmente ignorar. Aqui vão dois insights que aprendi na marra e que raramente aparecem em definições didáticas. Primeiro, o coeficiente de gini é insensível a transferências entre faixas de renda que não cruzam a mediana. Você pode redistribuir dinheiro massivamente entre os 10% mais ricos e os 10% mais pobres e o gini pode mudar pouco se a estrutura relativa dentro de cada grupo permanecer estável. Segundo, o gini não captura disparidade de acesso a serviços públicos, apenas disparidade de renda monetária. Dois países com o mesmo gini de renda podem ter realidades completamente diferentes se um oferece saúde e educação universais e o outro não.
O que falta nessa métrica? Vários pontos. Gini ignora completamente a profundidade da pobreza. Um país com gini de 0,45 onde todos ganham entre 3 e 4 salários mínimos é numericamente idêntico a outro com o mesmo coeficiente mas onde os mais pobres vivem com menos de 1 dólar por dia. Também não distingue mobilidade intergeracional. E um detalhe técnico importante: o erro padrão do coeficiente aumenta dramaticamente com a complexidade do desenho amostral. Regravamentos com métodos de bootstrap hierárquico que respeitam o cluster de pesquisa são essenciais para intervalos de confiança confiáveis. Simplesmenter usar a fórmula de erro padrão padrão para amostras aleatórias simples subestima o desvio em fatores que podem chegar a 3 vezes o valor real. Se o seu objetivo é analisar desigualdade de forma mais completa, considere combinar gini com outras medidas. O índice de Atkinson dá peso diferencial a transferências em diferentes faixas de renda e permite calibrar a aversão à desigualdade. O índice de Theil, baseado em entropia, pode ser decomposto em componentes intra e intergrupos, o que é útil quando você quer saber quanta parte da desigualdade vem das diferenças regionais versus diferenças dentro das regiões. E para dados de poverty, o gap de pobreza de Foster-Greer-Thorbecke oferece uma visão mais precisa da intensidade da privação material.
Na prática operacional, para calcular corretamente o gini com dados surveiçados brasileiros, você essencialmente precisa: carregar os dados com as variáveis de peso adequadas, aplicar a fórmula ponderada da área de Lorenz ou usar pacotes como o ineq no R com a opção de pesos, tratar truncamentos nas extremidades superiores, aplicar bootstrap com replicação pelo desenho amostral para obter erros padrão corretos, e finalmente reportar os resultados com seus intervalos de confiança, não apenas o ponto estimado. Um cálculo sozinho, sem contexto de incerteza estatística, é praticamente inútil para tomada de decisão.