PNAD: como baixar os microdados e trabalhar com eles sem dor de cabeça
O IBGE publica os dados brutos da a pesquisa nacional por amostra de domicílios gratuitamente no próprio site deles. O problema é que a interface deles não foi feita para quem faz análise de dados todos os dias. Você tem que passar por um cadastro, escolher a base, baixar alguns arquivos compactados e depois juntar as coisas manualmente.
o que é a pesquisa nacional por amostra de domicílios na prática
A PNAD é uma pesquisa amostral feita pelo IBGE que investiga condições de vida, trabalho, educação e rendimento das famílias brasileiras. O universo cobre os domicílios particulares permanentes, o que já exclui pessoas em instituições como quartéis, albergues e presídios desde o início. Tem versão anual tradicional e a PNAD Contínua, que roda todo trimestre e tem uma amostra menor mas permite acompanhar mudanças mais rápidas no mercado de trabalho. Muita gente começa a usar esses dados achando que os pesos de pesquisa são triviais. Não são. Os peso daPNAD variam conforme a estratégia de amostragem empregada em cada etapa. Se você não aplicar o peso correto, suas estimativas vão enviesar especialmente nos grupos menores, que é exatamente onde você mais precisa de precisão.
onde conseguir os dados
O acesso oficial é pelo site do IBGE, na seção de microdados. Lá estão disponíveis arquivos individuais e domiciliares em formato .csv ou .dta, dependendo da versão. Para a PNAD Contínua, o IBGE disponibiliza também os arquivos de variáveis de cluster e estrato, que você vai precisar se for calcular erros padrão corretos usando métodos de réplica. Se você precisa de bases históricas antigas, como os anos anteriores a 1996, a situação muda um pouco. A padronização das variáveis era outra, e os nomes das colunas no arquivo original não batem com os da base de anos mais recentes. Eu costumo manter um dicionário próprio dessas variações para não perder tempo decifrando nomes de variáveis em dados de 2001 enquanto eu deveria estar analisando.
primeiros passos depois de baixar
O arquivo individual da PNAD vem com identificadores que ligam cada pessoa ao domicílio correspondente. Os dois arquivos que você baixa precisam ser cruzados por esses identificadores para que você consiga usar variáveis de nível domiciliar, como renda total do agregado ou tipo de saneamento, junto com dados individuais de emprego ou escolaridade. Os campos de identificação não são sempre intuitivos. No arquivo individual, você encontra o identificador do domicílio, mas em algumas versões mais antigas o nome da variável muda ligeiramente entre os anos. Você perde uns dez minutos conferindo se os identificadores realmente casam antes de fazer qualquer merge.
Uma coisa que todo mundo esquece no começo: a PNAD usa desenho amostral complexo. Isso significa que os erros padrão precisam ser calculados de forma específica. Se você rodar regressões normais sem considerar a estrutura deCluster e estrato, os intervalos de confiança vão ficar errados. Para resolver isso, os pacotes estatísticos mais usados têm opções que aceitam weights e complex design diretamente, e o procedimento leva alguns minutos a mais, mas faz toda a diferença nos resultados finais.
👉 Clique no botão abaixo para saber mais sobre o assunto!
um problema real que eu tive e como resolvi
No segundo semestre de 2014, eu estava montando uma análise comparativa entre rendimento individual e condições do domicílio usando a PNAD anual. O peso da variável pessoa não combinava com o peso domiciliar quando eu puxava as bases separadamente. As somas davam números diferentes para o mesmo estado, o que quebrava qualquer média ponderada que eu tentasse calcular. A solução foi simples, mas só descobri depois de perder duas horas. Eu precisava usar os pesos já combinados que o IBGE disponibiliza na pasta de documentação. Eles explicam isso nas notas técnicas, mas a explicação fica espalhada em vários documentos e ninguém fala disso de cara quando você baixa os arquivos. Depois que eu apliquei o peso correto, as estimativas por estado ficaram consistentes com os tabelados oficiais do IBGE em menos de quinze minutos.
Se você estiver usando R,Stata ou Python com pandas, o ajuste do peso é uma linha de código. Em Stata, por exemplo, você carrega o dicionário de variáveis, define o peso e roda com a opção de desenho amostral. Em R, o pacote svydesign faz o mesmo trabalho. O tempo extra é pequeno e o erro que você evita é grande.
limitações que ninguém gosta de ouvir
A PNAD não cobre populações institucionais. Se o seu foco é população carcerária, moradores de rua em abrigos ou trabalhadores em grandes acampamentos, os dados não vão te ajudar. Esse é um limite estrutural da pesquisa, não um bug de coleta. Outro ponto importante é que a qualidade da informação sobre renda tende a ser pior nos extremos superiores da distribuição. Autodeclaração tem viés conhecido, e isso se reflete nos dados. Para estudar renda entre os mais ricos, o melhor complemento é usar dados tributários ou pesquisar diretamente fontes fiscais, porque a PNAD não capta bem esse estrato.
A PNAD Contínua tem um problema interno que muitos pesquisadores não consideram na hora de fazer séries temporais curtas. O intervalo entre levantamentos é trimestral, mas a amostra é redesenhada parcialmente a cada rodada. Isso gera uma certa inércia estatística que distorce comparações ano a ano, principalmente em municípios pequenos. Para cidades com menos de cem mil habitantes, os coeficientes de variação podem ficar altos demais para sustentar alguma conclusão sólida.
alternativas e complementos
Se a sua demanda é por indicadores mensais mais recentes, vale a pena olhar a RAIS e o Caged, que são bases administrativas com cobertura quase completa do emprego formal. Elas não têm variáveis de rendimento domiciliar nem questões de educação, mas cobrem o que a PNAD deixa de lado nesse segmento. Para estudos que envolvem mobilidade social e trajetórias educacionais, a PNAD também não é ideal porque é transversal. Nesse caso, pesquisas longitudinais como o PDDE ou o PNAD Contínua com vinculação de painéis oferece uma saída mais direta.
Uma última observação prática. Quando você for escrever sobre resultados da PNAD, cite sempre o ano de referência, a versão dos microdados e o procedimento de cálculo dos pesos. Isso é padrão na literatura e evita que revisores questionem a consistência dos seus números. Dados públicos têm valor alto, mas exigem precisão na referência.