Como classificar e distinguir archaea, bacteria e eukarya na prática
Quando você abre um projeto de sequenciamento de nova geração e chega nos dados de metagenômica, a primeira coisa que precisa fazer é categorizar as leituras nesses três domínios. Não é só marcar botões no QIIME2 ou no Kraken2 e torcer. Cada domínio tem peculiaridades que destroem pipelines padrão se você não ajustar os parâmetros.
Archea bacteria e eukarya: diferenças que importam no laboratório
O sistema de três domínios, proposto por Carl Woese nos anos 1970 baseado em sequências de RNA ribossomal 16S/18S, continua sendo a base de tudo. Mas a teoria é simples, a prática é onde as coisas complicam. Bactérias possuem membrana celular com lipídios éter, parede celular feita de peptidoglicano com ácido murâmico. Archaea também têm ligações éter, mas com unidades de isopreno e sem peptidoglicano. Eukarya têm membrana com esteróis, organelas delimitadas por membrana e histonas similares às arqueanas. Essa última semelhança é frequentemente ignorada e causa confusão em análises filogenéticas.
Um detalhe que poucos consideram: muitos geneiros usados para classificação de bactérias falham miseravelmente com arqueias porque os primers convencionais 515F/806R têm viés conhecido contra certos filos arqueanos, especialmente Thaumarchaeota e Euryarchaeota. Se você está estudando amostras ambientais de solo ou oceano profundo, seus primers padrão vão subestimar drasticamente a diversidade arqueana. A solução que eu uso é aplicar os primers 344F/1058R para arqueias como complemento obrigatório, e rodar ambas as amplificações no mesmo projeto. Também vale notar que a separação entre bactérias e arqueias em sequências curtas de 16S (amplicons de 250-300pb do Illumina) frequentemente resulta em taxonomias duvidosas nos níveis mais baixos. Gênero e espécie são praticamente impossíveis de resolver com confiança com esses comprimentos de leitura. Nível de família já é um esforço. Se você precisa de resolução fino, vá para sequenciamento de genoma completo ou long-reads com PacBio ou Nanopore.
Pipelines práticos e armadilhas comuns
Para classificação rápida de leituras brutas, o Kaiju com índice RefSeq funciona bem porque mapeia diretamente contra proteínas, não contra sequências nucleotídicas. Isso evita problemas de divergência de nucleotídeos que quebram o BLAST e o Kraken2 em dados muito divergentes. O tempo de processamento é maior, mas a acurácia em baixo nível taxonômico é significativamente superior. Se você usar o DADA2 para gerar ASVs, preste atenção ao filtro de qualidade. Arquitas frequentemente têm padrões de erro distintos nos ciclos de sequenciamento, e o default do DADA2 pode descartar leituras arqueanas legítimas por considerar que estão com qualidade baixa. Eu ajusto o params truncLen e maxEE separadamente para cada domínio quando o objetivo é preservar a sensibilidade em arqueias.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Outro ponto que causa dor de cabeça recorrente: contaminação por DNA humano ou de eucariotas do laboratório em bibliotecas de archaea. Já perdi semanas tentando identificar um filo novo até perceber que o "sinal" que eu estava seguindo vinha de um kit de extração contaminado. O controle negativo de extração é obrigatório, não opcional. Sempre inclua um branco de kit e subtraia os táxons presentes nele usando o framework de desconvolução do decontam no R. Há ainda o problema dos eucariotas que aparecem como "ruído" em biblioteciras focadas em procariotos. Fungos, protozoários e restos celulares de eucariotas podem dominar a biblioteca se a lise mecânica for muito agressiva. O protocolo de lise suave com bead beating reduzido e pré-filtração por 0,22 micrômetros ajuda a reduzir esse ruído em amostras ambientais com alta biomassa eucariótica.
Ferramentas e recursos
O GTDB ( Genome Taxonomy Database ) substituuiu o ICTV como padrão ouro para classificação bacteriana e arqueana baseada em genomas completos. A versão atual recomenda relações deANI de 95% para delimitação de espécies, uma diferença importante em relação ao critério clássico de 70% de re hibridização DNA-DNA. Para usuários que trabalham com metagenomos, o GTDB-Tk é a ferramenta padrão para atribuição taxonômica. O SILVA rRNA database continua sendo a referência mais completa para alinhamento e filtragem de sequências 16S/18S/23S. O site oferece downloads segmentados por domínio, e eu recomendo baixar as árvores filtradas por identidade (99%, 97%, 95%) para não perder tempo com alinhamentos desnecessários.
O UNITE é o equivalente para fungos, e o PR2 é a base de referência para protistas e microalgas eucarióticas. Nenhum desses bancos substitui o outro, e projetos robustos precisam consultar múltiplas bases.
Limitações honestas
A classificação por metabarcoding de 16S tem um teto de informação. Você vai perder informação funcional inteira, não conseguir distinguir cepas com diferentes capacidades metabólicas e ter viés de amplificação que distorce abundâncias relativas. Se o objetivo do seu estudo é funcional, vire-se para metagenômica shotgun ou metatranscriptômica. Archaeas são particularmente problemáticas porque uma fração significativa deles não tem representantes cultivados, e os genomas de referência disponíveis no GenBank ainda são desproporcionalmente pequenos e enviesados para organismos de interesse biotecnológico como metanógenos e halófilos. Linhas como CPR (Candidate Phyla Radiation) e DPANN muitas vezes aparecem como "bactéria/incerta sedis" ou "archaea/incerta sedis" em pipelines padrão porque simplesmente não há referência suficiente.
O sequenciamento de long-reads resolve parcialmente isso, mas a taxa de erro ainda é um problema real, especialmente para reads do Nanopore em regiões hipervariáveis do 16S. O DADA2 com o modelo do Nanopore ajuda, mas a precisão de classificação ainda fica abaixo do Illumina para a maioria dos classificações em nível de espécie.