O Que Estuda A Epidemiologia Molecular - Epidemiología Molecular by Erick David Aldana on Prezi
Epidemiología Molecular by Erick David Aldana on Prezi

O que é epidemiologia molecular na prática

Epidemiologia molecular é o uso de marcadores genéticos de patógenos para responder perguntas epidemiológicas tradicionais: de onde veio uma infecção, como ela se espalhou, quem infectou quem. A diferença em relação à epidemiologia clássica é que o dado não é mais apenas clínico ou demográfico. É uma sequência de nucleotídeos. Isso muda tudo, e também quebra muita coisa no começo. O campo estuda principalmente a variação genética de microrganismos dentro de populações humanas. Tipos de estudo mais comuns incluem rastreamento de surtos usando sequenciamento do genoma completo (WGS), identificação de linhagens bacterianas resistentes, reconstrução de cadeias de transmissão de vírus como HIV e SARS-CoV-2, e vigilância de variantes emergentes. Ferramentas clássicas incluem PFGE, MLST, sequenciamento de Sanger para genes-alvo e, cada vez mais, WGS com montagem de genomas e análises filogenéticas.

O que estuda a epidemiologia molecular

Na prática, o que se estuda são padrões de variação genética que carregam informação epidemiológica. Um isolate de Mycobacterium tuberculosis com um padrão específico de SNPs pode indicar que dois casos fazem parte do mesmo cluster de transmissão, mesmo que não haja contato conhecido entre os pacientes. Um vírus com uma única mutação no gene da hemaglutinina pode definir uma nova linhagem que está substituindo as anteriores. O trabalho é traduzir esse sinal molecular em inferência epidemiológica válida. O que muita gente não entende direito é que dado genético sozinho não responde nada. Precisa de dados epidemiológicos acoplados: data de coleta, local, informação clínica, histórico de viagem. Sem isso, você tem uma árvore filogenética bonita e completamente inútil. Na minha experiência, o erro mais comum em projetos iniciantes é sequenciar trinta isolados e só depois perceber que faltou coletar a ficha epidemiológica de metade deles. Aí você fica com dados genômicos preciosos e nenhuma história para contar.

Outro ponto que os manuais não enfatizam suficiente: a resolução do método importa. PFGE consegue diferenciar linhagens próximas o suficiente para um surto hospitalar, mas é lenta, subjetiva e difícil de comparar entre laboratórios. WGS resolve isso, mas exige infraestrutura de bioinformática que a maioria dos serviços de saúde pública não tem. MLVA é útil para Vibrio e Listeria, mas não serve para nada além disso. Escolher a técnica errada é mais frequente do que se imagina, e o custo de errar é alto porque revisões depois da coleta de dados praticamente não existem. Tive um caso recente com Salmonella Enteritidis em um surto alimentário. Os perfis de PFGE pareciam idênticos entre doze isolados, mas o questionário epidemiológico era confuso porque os casos tinham consumido o mesmo produto em regiões diferentes. Decidi fazer WGS. As análises de SNP em base showed que na verdade eram dois clusters distintos separados por cerca de quarenta SNPs, o que mudou completamente a investigação. Um estava ligado a uma faixa produtiva específica, o outro a outra. Se tivesse parado no PFGE, teria concluído erroneamente que havia um único veículo de transmissão. O workaround foi terceirizar o sequenciamento em Illumina NovaSeq e rodar a análise de SNP com o snippy em conjunto com o TreeChaser, cruzando depois com os dados temporais no Nextstrain. O custo ficou em torno de trezentos reais por isolate, e o tempo de resposta foi de três semanas, o que foi suficiente para conter o surto antes que mais casos aparecessem.

👉 Clique no botão abaixo para saber mais sobre o assunto!

Limitações existem e são sérias. Sequenciamento de baixa cobertura pode gerar falsos SNPs que parecem diferenciais entre isolados quando na verdade são artefatos de montagem. Contaminação entre amostras durante a extração de DNA é um problema real em laboratórios com alto volume, especialmente quando se trabalha com bactérias de baixa biomassa. Viarismo de seleção também distorce resultados: você sequencia apenas os isolados que crescem em cultura, e isso pode não representar a diversidade real presente no hospedeiro. Para vírus, a derivada do processo de extração e amplificação pode introduzir sesquivocidades que se confundem com variants verdadeiras. Nada disso é fatal, mas exige controle de qualidade rigoroso em cada etapa. O campo também lida com um problema de interpretação que muitos subestimam. Uma árvore filogenética bem construída mostra parentesco, não necessariamente transmissão direta. Dois isolados podem ser irmãos próximos em uma árvore sem que um tenha transmitido para o outro. Inferir cadeia de transmissão a partir de filogenia requer modelos epidemiológicos acoplados, como os do BEAST ou do outbreaker2, e ainda assim as conclusões são probabilísticas, não certezas. Começar uma investigação afirmando que "o paciente A infectou o paciente B" com base apenas em similaridade genética é o tipo de erro que aparece em relatórios e causa prejuízo real.

Se você está começando na área, o caminho mais eficiente é dominar primeiro a parte de bancos de dados e curadoria. O NCBI Pathogen Detection, o PubMLST, o EnteroBase para Salmonella e Shigella, o Nextstrain para vírus respiratórios. Saber navegar nessas plataformas e entender o que cada banco espera em termos de metadados economiza semanas de trabalho. Depois vem a bioinformática básica: controle de qualidade com FastQC, trimming com Trimmomatic ou fastp, montagem com SPAdes ou Unicycler, e chamada de SNP com tools específicos para o patógeno em questão. Para análise filogenética, o IQ-TREE com modelo GTR+G+I é um ponto de partida razoável para a maioria dos cenários. A execução completa, do DNA sequenciado à árvore final, leva entre dois e quatro dias em um servidor decente, dependendo do tamanho do conjunto de dados. A parte mais desgastante costuma ser a integração dos dados genômicos com a linha do tempo epidemiológica. Genes mudam em velocidades diferentes. Bactérias de replicação rápida como Neisseria gonorrhoeae acumulam SNPs visíveis em questão de semanas. Vírus como influenza acumulam mutações de aminoácido significativa em meses. Tuberculose pode levar anos para mostrar diferença detectável por WGS entre isolados de um mesmo cluster. Ignorar essas dinâmicas temporais leva a interpretações equivocadas sobre velocidade de transmissão e janela de infecção. Ajustar o modelo molecular de relógio genético às condições locais do patógeno é algo que precisa ser feito explicitamente, não assumido como padrão.

O que a epidemiologia molecular estuda, no fim, é a interseção entre evolução microbiana e dinâmica de transmissão em populações. Ela não substitui a epidemiologia tradicional. Ela a complementa quando os métodos clássicos atingem seu limite de resolução. E funciona bem quando os dados estão bem coletados, a análise é feita com consciência das limitações técnicas e as conclusões são apresentadas como evidência, não como prova definitiva.