O básico, sem enrolação
Um estudo filogenético nada mais é do que uma tentativa de reconstruir a história evolutiva de um grupo de organismos usando dados biológicos — geralmente sequências de DNA, RNA ou proteínas. O resultado final é uma árvore, chamada árvore filogenética, que mostra as relações de parentesco entre as espécies ou genes em questão. O processo começa com o alinhamento das sequências. Você pega os nucleotídeos ou aminoácidos, coloca lado a lado e tenta identificar quais posições são homólogas, ou seja, derivadas de um ancestral comum. Esse passo é mais crítico do que a maioria dos iniciantes imagina. Um alinhamento ruim destrói qualquer análise que venha depois, não importa quão sofisticado seja o método de inferência.
Entendendo o que é filogenético na prática
Quando alguém pergunta o que é filogenético, a resposta curta é: tudo aquilo que se refere à construção ou interpretação dessas árvores evolutivas. Mas na prática, isso abrange desde o desenho experimental até a escolha de modelos de substituição nucleotídica, passando por questões de bootstrap, suporte de nó e até a decisão de usar máxima verossimilhança em vez de inferência bayesiana. Aqui vai algo que livros didáticos raramente destacam: a árvore que você obtém não é necessariamente a árvore verdadeira. É a árvore mais provável dados os seus dados, o seu modelo e o seu método. Isso faz toda a diferença quando você está trabalhando com linhagens que tiveram taxas de evolução desiguais, ou com genes que passaram por transferência horizontal. Nesse cenário, a árvore de genes e a árvore de espécies podem divergir profundamente.
Eu já perdi duas semanas corrigindo uma topologia estranha porque não estava levando em conta a heterogeneidade composicional. Os genomas das minhas amostras tinham viés extremo de GC, e o modelo GTR+G que eu estava usando simplesmente não conseguia lidar com isso. A solução foi aplicar uma correção de composição usando o modelo CAT do PhyloBayes, e a árvore mudou completamente. O nó que antes tinha suporte de 98% de bootstrap caiu para 42%. Foi um lembrete útil de que suporte estatístico alto não significa correto.
Como se constrói uma análise filogenética
A pipeline padrão envolve algumas etapas encadeadas, e cada uma delas tem suas armadilhas. Coleta e montagem das sequências. Você precisa de sequências homólogas de boa qualidade. O problema é que bancos públicos como o GenBank estão cheios de sequências mal anotadas ou contaminadas. Antes de usar qualquer coisa, eu faço BLAST reverso e verifico se a sequência realmente pertence ao gene que diz ser. Às vezes um simples contaminação bacteriana em uma montagem de transcriptoma pode fazer sua árvore parecer que um invertebrado tem parentesco com E. coli. Isso acontece mais do que você gostaria.
Alinhamento múltiplo. Ferramentas como MAFFT, MUSCLE e PRANK são as mais usadas. O MAFFT com a opção L-INS-i é preciso para conjuntos pequenos com até unas 200 sequências, mas leva tempo. Para conjuntos grandes, o FFT-NS-2 é muito mais rápido e geralmente suficiente. O PRANK é interessante porque leva em conta inserções e deleções como eventos evolutivos, o que evita alinhamentos incorretos em regiões com muitos indels. O problema é que ele é lento e às vezes gera alignments fragmentados que dificultam a filtragem posterior. Seleção do modelo de evolução. Ferramentas como ModelFinder (no IQ-TREE) ou jModelTest fazem essa seleção automaticamente com base no critério BIC ou AICc. O modelo certo importa porque modelos mal ajustados tendem a superestimar ou subestimar distâncias evolutivas, o que distorce os ramos da árvore. Um erro comum é sempre usar o mesmo modelo para todos os genes de uma análise multilocus sem testar individualmente. Cada locus pode ter padrões substitucionais diferentes.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Inferência da árvore. Os dois métodos mais comuns são máxima verossimilhança (ML) e inferência bayesiana (BI). O ML com o IQ-TREE ou RAxML é rápido e lida bem com centenas a milhares de sequências. O BI com MrBayes ou PhyloBayes é mais lento mas fornece probabilidades posteriores diretamente. Para conjuntos grandes, o IQ-TREE com 1000 replicados de bootstrap ultrapercizado costuma ser um bom equilíbrio entre velocidade e confiabilidade. Análises bayesianas com cadeias MCMC exigem verificação de convergência — se o SDS de partições padrão não cair abaixo de 0.01 depois de milhões de gerações, você não pode confiar nos resultados. Filtragem de alinhamento. Isso é crucial e frequentemente negligenciado. Regiões mal alinhadas introduzem ruído que pode gerar agrupamentos artificiais. Ferramentas como TrimAl e BMGE removem colunas com baixa conservação ou alta diversidade. Eu costumo usar o parâmetro -gt 0.7 no TrimAl, que mantém apenas colunas com pelo menos 70% de resíduos bem alinhados. Dependendo do seu alignment, isso pode remover de 20% a 50% das posições, e a árvore resultante quase sempre é mais robusta.
Pegadinhas que ninguém conta
Um dos maiores problemas em filogenética é o atração de longos ramos. Espécies com taxas de evolução aceleradas tendem a se agrupar juntas na árvore, mesmo que não sejam parentes próximas. Isso é um artefato do método, não um sinal de parentesco real. Se você tem algum táxon que se destaca por ter muitas substituições, considere removê-lo temporariamente e ver se a topologia dos demais táxons se mantém estável. Também existem modelos como o LGX no IQ-TREE que tentam corrigir parcialmente esse efeito. Outro problema recorrente é a insuficiência de signal filogenético. Sequências muito conservadas, como ribossomais para relações em nível profundo, ou muito divergentes, como alguns genes mitocondriais para relações em nível de espécie, podem simplesmente não carregar informação suficiente para resolver nós específicos. Nesses casos, adicionar mais loci ou usar dados transcriptômicos completos costuma ser a saída, mas isso aumenta drasticamente o custo computacional.
Quando você trabalha com dados genômicos inteiros, a quantidade de dados pode ser tão grande que a análise de ML pura se torna inviável em um computador padrão. Nesse cenário, métodos de espécies árvore baseados em coalescência, como ASTRAL ou SVDquartets, são alternativas porque primeiro inferem árvores gênicas individuais e depois as consolidam. OTrade-off é que erros em árvores gênicas individuais se propagam para a árvore de espécies.
Quando a filogenética falha
Não tente construir uma árvore filogenética com dados que não têm homologia clara. Sequências curtas demais, com menos de 300 pares de bases para ML ou 500 para BI, geralmente produzem resultados instáveis. A regra prática é: quanto mais próxima a relação evolutiva, mais rápido o gene precisa evoluir para ter signal suficiente, e quanto mais distante, mais conservado o gene precisa ser. Escolher o marcador errado é o erro mais comum de quem está começando. Análises filogenéticas também não são adequadas para grupos com hibridização intensa ou fluxo gênico recentes. Nesse caso, uma rede filogenética, feita com ferramentas como SplitsTree ou PhyloNet, faz muito mais sentido do que uma árvore bifurcante. Uma árvore simplesmente não consegue representar relações reticulares de forma honesta.
Links úteis
O IQ-TREE está disponível gratuitamente em http://www.iqtree.org. O MAFFT no http://mafft.cbrc.jp/alignment/software/. O PhyloBayes MPI, para correção de heterogeneidade composicional, pode ser baixado em http://www.genoscope.cns.fr/agenze/cabrol/PhyloBayes/. O TrimAl está no http://trimal.cgenomics.org. Se você está apenas dando os primeiros passos, comece com um conjunto pequeno e bem documentado, como sequências do gene 16S para bactérias ou COI para animais. A curva de aprendizado é íngreme nos primeiros meses, mas depois de fazer três ou quatro análises completas do início ao fim, o processo passa a fluir naturalmente.