Entendendo os dados de mortalidade no Brasil: uma análise prática
A questão de no Brasil a quantidade de mortes decorrentes de causas variadas é algo que aparece com frequência em pesquisas acadêmicas, debates públicos e análises jornalísticas. O problema é que a maioria das pessoas que consulta esses números não sabe exatamente onde encontrar as fontes confiáveis ou como interpretar corretamente o que está lendo. A confusão é tanta que já vi trabalho acadêmico inteiro ser refutado só porque o autor usou dados do DATASUS sem cruzar com a classificação CID-10 adequada. Existem basicamente três fontes oficiais para esse tipo de informação no Brasil. A primeira é o DATASUS, do Ministério da Saúde, que reúne os registros do Sistema de Informações sobre Mortalidade (SIM). A segunda é a Polícia Federal, que publica estatísticas de homicídios com periodicidade diferente. A terceira são os institutos estaduais de pesquisa, como a FIOCRUZ no Rio de Janeiro ou a SEADE em São Paulo, que às vezes têm dados mais granulares que a fonte federal.
no Brasil a quantidade de mortes decorrentes: fontes e armadilhas
Quando você entra no DATASUS pela primeira vez, a interface parece intimidadora. O sistema Táxi tem filtros que não são intuitivos e os arquivos brutos vêm em formato tabulado que exige processamento. Eu levei uns três meses até conseguir montar um fluxo de trabalho repetível. O que eu fiz foi criar um script básico em Python que baixa os arquivos do SIM automaticamente, aplica a codificação correta de CID-10 e exporta para CSV. Funciona bem, mas você precisa atualizar pelo menos uma vez por ano, pois o Ministério da Saúde costuma fazer retificações nos dados históricos. Um ponto que poucos destacam é que os dados do SIM não são completos até dois anos após o evento. O cartório pode levar meses para enviar a declaração de óbito, e há uma taxa de subnotificação significativa em municípios menores. Se você está analisando dados de 2023, por exemplo, espere que entre 8 e 12 por cento dos óbitos ainda não estejam registrados no sistema. Isso muda bastante a análise se você está tentando comparar estados com diferentes capacidades de registro.
Outra coisa que eu aprendi na prática e que não está em nenhum tutorial oficial: o campo "causa básica" do SIM às vezes vem codificado de forma inconsistente entre anos diferentes. Same cause can have slightly different codes depending on how the medical certifier filled out the form. O que eu fiz foi criar um mapeamento manual das principais categorias usando o manual do CODAM (Programa de Aperfeiçoamento de Óbitos), que é um guia que o Ministério da Saúde mantém atualizado. Economizou horas de depuração depois.
Como cruzar dados de causas externas com dados demográficos
Se o seu interesse é entender no Brasil a quantidade de mortes decorrentes de causas específicas, como acidentes de trânsito ou violência, o próximo passo natural é cruzar com dados demográficos. O IBGE disponibiliza estimativas populacionais anuais que você pode usar para calcular taxas por 100 mil habitantes. Sem essa normalização, você tende a superestimar o impacto em estados grandes como São Paulo simplesmente porque eles têm mais gente, não porque o risco seja maior. O problema real começa quando você quer desagregar por município. O IBGE só publica estimativas municipais até 2022 com margem de erro considerável. Para anos mais recentes, você precisa trabalhar com projeções ou aceitar que a taxa pode ter uma variabilidade de até 5 por cento para mais ou para menos. Em municípios com menos de 50 mil habitantes, isso pode significar diferença de uma ou duas mortes no numerador, o que distorce completamente a taxa.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Uma dica prática que funciona: em vez de calcular taxas por município individualmente, agrupe em regiões de saúde ou em microrregiões do IBGE. Isso dilui a variabilidade do numerador e dá um quadro muito mais estável para análise. Eu usei essa abordagem num projeto sobre mortalidade por acidentes de transporte e o padrão geográfico ficou muito mais claro do que quando eu olhava município por município.
Parmetros que todo mundo esquece de considerar
Aqui vai algo que eu vejo repetir muito e que é um erro grave: pessoas usam dados de um único ano para fazer afirmaes categóricas sobre trends. A mortalidade tem variao natural anual, especialmente para causas externas como homicdios e acidentes. Um ano excepcionalmente ruim ou bom pode empurrar a média e criar a impresso de uma mudana que nao existe. O minimo que se deve fazer é analisar no mnimo trs anos consecutivos e calcular uma mdia movel. Outro ponto negligenciado é a distribio por hora do dia e dia da semana. Mortes por causas externas tm perfis temporais muito claros que ajudam a validar se os dados estão consistentes. Homicdios, por exemplo, tm pico nas noites de sexta e sbado. Acidentes de trnsito tm concentração no horrio de pico e em feridos. Se os seus dados nao mostram esse padro, provavelmente est com problemas de codificao ou subnotificao na sua amostra.
Existe ainda a questao da classificao causal. Uma morte que no boletim médico aparece como "traumatismo cranio" pode ter como causa básica um homicídio no campo de causa externa, ou pode ser uma queda doméstica. O CODAM ajuda nesse processo, mas exige familiaridade. Eu juntei um grupo de estudos com duas pessoas que tinham formação em saúde pública e levamos cerca de uma semana para validar manualmente uma amostra de 500 casos e comparar com a classificação automática do sistema. O acordo interexaminadores ficou em torno de 85 por cento, o que é aceitável mas mostra que quase uma em cada cinco classificações pode estar errada.
Alternativas quando os dados oficiais falham
Em alguns casos, os dados oficiais simplesmente não resolvem. O exemplo mais claro é a mortalidade indígena. O SIM tem cobertura insuficiente em territórios indígenas, especialmente na Amazônia Legal. A Funai e a Conasutiss produzem estimativas próprias, mas os métodos variam e não há padronização nacional. Se você precisa de dados sobre essa população, vá direto para as publicações específicas ou entre em contato com as secretarias estaduais de saúde que atendem essas regiões. Para mortalidade perinatal e infantil, o DATASUS funciona bem, mas a leitura exige cuidado com a definição de óbito fetal versus óbito neonatal. A Organização Mundial da Saúde mudou os critérios de classificação em 2022, e muitos bancos de dados antigos ainda usam a versão anterior. Se você está comparando séries históricas, verifique qual classificação foi aplicada em cada período. Uma mudança de critério pode explicar até 15 por cento da variação que você está vendo, sem que tenha havido qualquer mudança real na saúde da população.
Não existe ferramenta única que resolva todas essas questes de uma vez. O que funciona na prática é ter um fluxo organizado: baixar os dados brutos do SIM, rodar uma validação automática de campos obrigatórios, fazer o cruzamento com CID-10 e com estimativas populacionais, e só então começar a análise. O tempo gasto na limpeza pode ser de duas a quatro horas para um banco de dados nacional completo, dependendo da qualidade dos dados do ano que você está puxando. Anos com retificação posterior exigem refazer todo o processo. A gente fala muito em transparência de dados no Brasil, mas a realidade é que a disponibilidade é boa e a qualidade varia demais de ano para ano e de estado para estado. Trabalhar com esses dados exige paciência e uma dose razoável de ceticismo em relação a números que parecem demais ou de menos. Se o resultado da sua análise contradiz fortemente o que a literaturajá estabeleceu, o mais provável não é que a literatura está errada, mas sim que há algo no seu tratamento dos dados que precisa ser revisado.