Como acessar e cruzar dados sobre pobreza em escala global
a pobreza é um fenômeno global e isso significa que existem conjuntos de dados públicos, mas nem todos são fáceis de encontrar ou combinar entre si. O primeiro problema real é que diferentes países usam metodologias distintas para medir a linha de pobreza. O Brasil usa renda domiciliar per capita em reais. O México mede com indicadores multidimensionais no PROGRESA/Oportunidades. Países africanos frequentemente dependem de pesquisas de despesas do consumidor feitas em janelas estreitas, com erros de sobrevivência significativos.
Fontes primárias e como baixá-las
O site mais direto é o World Bank Open Data. Lá você consegue séries históricas de pobreza por US$ 2,15/dia (linha de 2017), US$ 3,65/dia e US$ 6,85/dia. O download é em CSV ou Excel, com cobertura de quase 200 países desde 1981, quando os dados estão disponíveis. Se precisar de dados mais granulares por sub-região, o UNESCO Institute for Statistics entrega indicadores educacionais ligados à pobreza, e o DHS Program disponibiliza microdados de pesquisas demográficas e de saúde com informação sobre riqueza relativa. Uma coisa que poucos mencionam: o portal do Banco Mundial permite exportação via API. Não é obrigatório baixar planilhas manualmente toda vez. Um script Python com a biblioteca WBData consegue puxar variáveis específicas por país e ano sem abrir interface gráfica. Eu escrevi um script simples que baixa dados de pobreza extrema para a América Latina e Central do Sul a cada trimestre. O tempo médio de execução é de 4 minutos em conexão residencial.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Cruzamento com outras bases
O desafio verdadeiro começa quando você quer cruzar dados de pobreza com variables como acesso a água potável, mortalidade infantil ou notas educacionais. O UNICEF MICS (Multiple Indicator Cluster Surveys) é uma das fontes mais completas para isso. Cada rodada cobre entre 50 e 80 países, com questionários padronizados sobre condições domésticas. Os dados estão em formato SPSS, STATA ou ASCII. A versão mais recente, MICS7, inclui módulos sobre saúde mental e violência, mas o arquivo pode ultrapassar 500 MB se você baixar todos os pacotes juntos. Uma armadilha comum é misturar anos diferentes de pesquisas sem verificar a validade comparativa. A linha de pobreza absoluta do Banco Mundial é recalibrada periodicamente. A mudança de paridade de poder de compra de 2005 para 2011 alterou estimativas históricas em vários países africanos. Não é um erro metodológico, é uma atualização intencional, mas ela quebra séries temporais e gera confusão em análises que não explicitam qual base de paridade está sendo usada.
Limitações práticas dos dados
A maioria das pesquisas domiciliares em países de baixa renda é feita por amostragem, não por censo completo. O erro amostral em áreas rurais remotas pode ser grande. No Haiti, por exemplo, a última pesquisa disponível (ENVISS 2012-2013) tem um fator de expansão complexo que nem sempre está bem documentado nos metadados. Se você estiver fazendo modelagem preditiva, ignorar esses fatores de expansão produz estimativas viesadas. Outro ponto cego: a pobreza urbana tende a ser subestimada em pesquisas tradicionais.moradias irregulares, famílias em coabitação, trabalhadores informais sem endereço fixo frequentemente não entram na amostra. O próprio Banco Mundial reconhece isso em seus relatórios, mas os microdados publicados raramente incluem pesos de correção para essa população invisível. Se o seu trabalho depende de precisão em contextos urbanos densos, considere complementar com dados de satélite noturno (NOAA/CEOS) ou com feeds de consumo de energia elétrica como proxy de atividade econômica local.
Um workaround prático
Eu precisei mapear pobreza em distritos urbanos da Índia para um projeto recente. Os dados do NSSO (National Sample Survey Office) são excelentes mas chegam em nível distrital com frequência irregular e formatos divergentes entre rodadas. A solução foi usar dados agregados do NFHS-5 (National Family Health Survey) combinados com dados eletrônicos de vendas de dispositivos móveis da TRAI, normalizando tudo por densidade populacional do Census of India 2011. O processo inteiro levou 3 semanas, desde a coleta até a geração dos mapas em GeoJSON. Ferramentas úteis nesse caminho: QGIS para visualização, R com o pacote tidycensus para tratamento de dados demográficos, e Google Colab para processar arquivos grandes sem gastar infraestrutura própria. Nenhuma fonte única resolve o problema da pobreza. Dados oficiais são úteis mas sempre incompletos. A combinação de múltiplas bases, com transparência sobre as limitações de cada uma, é o único caminho que produz resultados minimamente confiáveis.