Guia prático de reconstrução ancestral sequencial
A reconstrução de sequências ancestrais não é mágica. Você pega um alinhamento de múltiplas sequências, escolhe uma árvore filogenética, define um modelo de substituição e roda uma inferência bayesiana ou de máxima verossimilhança para obter os aminoácidos mais prováveis nos nós internos. O resultado é um conjunto de sequências restauradas que representam o que seu algoritmo acredita que existed em algum ponto do passado evolutivo.
O que podemos esperar que evoluindo de ancestrais seja preciso de verdade
Dependendo da densidade da sua amostragem, da qualidade do alinhamento e da profundidade dos nós que você está reconstruindo, a acurácia varia muito. Nós próximos às folhas tendem a ter confiança alta, com posterioris acima de 0,95 para a maioria das posições. Nós profundos, perto da raiz, frequentemente caem para 0,6 ou menos em sítios variáveis. Eu sempre recomendo olhar os valores de posteriori por posição antes de qualquer coisa, e não confiar cegamente na sequência pontual mais provável. O método que eu uso no dia a dia é o codeml do pacote PAML combinado com modelos MG94xREV para codões, quando possível. Para proteínas, o LG+G4 ou o WAG+G costumam ser pontos de partida razoáveis. O comando básico roda num loop sobre cada nó interno, e o script me devolve um arquivo FASTA com as sequências reconstruídas e outro com os valores de confiança posteiriores. Leva de 20 minutos a duas horas, dependendo do tamanho do alinhamento e da topologia.
Um problema que eu encontrei recentemente envolveu um alinhamento de cerca de 340 sequências de uma família de quinases com um gap enorme numa região de loop entre os subdomínios HRD e DFG. O codeml interpretou isso como um estado ancestral ambíguo e distribuiu probabilidades uniformes por todas as opções, o que gerava uma sequência reconstruída com resíduos claramente incorretos naquela região. A solução foi mascarar manualmente os sítios com gaps superiores a 30% antes do alinhamento e depois refazer a reconstrução só nas posições bem alinhadas. O tempo de processamento caiu pela metade e os posterioris melhoraram visivelmente.
Pegadinhas que ninguém conta
A primeira é o efeito da topologia. Se a árvore usada na reconstrução estiver errada, mesmo que levemente, os estados ancestrais nos nós afetados serão enviesados. Eu já vi casos em que uma única bipartição trocada mudou completamente o resíduo inferido num sítio catalítico. Sempre valide a árvore combootstrap ou com métodos de conjunção antes de passar para a reconstrução. A segunda é a suposição de independence entre sítios. Modelos com+G4 melhoram o ajuste, mas não capturam dependências epistáticas. Quando dois ou mais resíduos evoluem de forma conjunta, a reconstrução individual ignora essa correlação e tende a superestimar a probabilidade de certos resíduos. No meu trabalho com beta-lactamases,-notei isso claramente: a reconstrução sugeriu uma sequência ancestral com uma combinação de resíduos que, quando sintética, mostrava atividade quase nula, enquanto combinações alternativas, igualmente prováveis estatisticamente, geravam enzimas funcionais. A lição é que a sequência mais provável isoladamente não garante funcionalidade biológica.
Uma terceira armadilha comum é tratar a reconstrução como fato estabelecido. Ela é uma hipótese estatística, não um registro histórico. O resíduo com maior posteriori pode ser o correto, mas a probabilidade de estar errado raramente é zero. Para publicações ou para o design de experimentos, eu sempre reporto a distribuição completa de probabilidade por sítio, não só o resíduo pontual.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Workflow mínimo funcional
Você precisa de três arquivos: o alinhamento multifasta, a árvore filogenética em NEWICK e um arquivo de parâmetros para o software de reconstrução. O alinhamento deve ser feito com MAFFT ou MUSCLE, revisado visualmente no AliView, e os sítios mal alinhados removidos com Gblocks ou uma máscara manual. A árvore deve ser construída com RAxML ou IQ-TREE, com Bootstrap mínimo de 100 réplicas. O modelo de substituição pode ser selecionado automaticamente pelo ModelFinder do IQ-TREE antes de passar para o passo final. Para a reconstrução em si, eu recomendo o FastML quando o foco é velocidade, ou o PAML codeml quando se precisa de controle fino sobre o modelo. No FastML, você sobe o alinhamento e a árvore, marca a opção de reconstrução de todos os nós internos, escolhe o modelo proteico adequado, e baixa os resultados em menos de dez minutos para conjuntos pequenos. Para conjuntos maiores, o código roda localmente com a flag de paralelização ativada.
Depois de obter as sequências, o passo seguinte costuma ser a análise de conservação relativa. Eu comparo a sequência reconstruída contra o alinhamento original usando um score de identidade por posição e gero um mapa de calor simples que mostra onde a confiança é alta e onde ela despenca. Isso direciona diretamente quais posições merecem validação experimental e quais podem ser ignoradas no design.
Alternativas quando a reconstrução tradicional falha
Se o seu alinhamento é muito longo e esparsamente amostrado, métodos baseados em redes filogenéticas podem ser mais honestos do que árvores estritas. Eu já usei o Splitstree para visualizar conflitos e, a partir daí, decidir quais clados confiar e quais descartar da análise ancestral. Quando a questão é especificamente funcional, e não apenas sequencial, simulações de deriva sob restrições funcionais, feitas com códigos como aPRL ou com frameworks de evolução empírica como o EVmutation, costumam dar respostas mais próximas da realidade biológica do que a reconstrução puramente filogenética. Há também a possibilidade de usar modelos de contexto de, como os implementados no site de Adam Ruben e colegas, que consideram pares de sítios coevolutivos. Isso custa mais tempo de computação, mas em famílias com sinal epistático forte, o ganho na acurácia compensa. Meu tempo médio passou de cerca de 45 minutos por reconstrução simples para aproximadamente três horas com o modelo de contexto, e a taxa de sucesso experimental das variantes sintéticas dobrou.
Onde baixar as ferramentas
O PAML está disponível gratuitamente no site do Ziheng Yang, junto com a documentação completa. O FastML funciona via interface web e também permite download local. O IQ-TREE, RAxML-NG e ModelFinder são instaláveis via Conda ou Bioconda com um único comando. Para as máscaras de alinhamento, o Gblocks roda via linha de comando ou como plugin do Mesqua. Nenhum desses pacotes tem licença comercial, e a maioria exige apenas um computador com processador padrão e entre quatro e dezesseis gigabytes de RAM para conjuntos de tamanho moderado. Se você estiver começando agora, não pule a etapa de validação da árvore e não trate a sequência ancestral como verdade absoluta. Os dados mostram claramente que a reconstrução funciona bem sob condições controladas, mas escorrega de forma previsível em regiões de baixa informação filogenética e em nós rasos. Trate cada resultado como um ponto de partida para testes, não como uma conclusão.
A parte mais útil que eu aprendi depois de anos rodando isso em série é simples: mantenha registro rigoroso de cada versão do software, do modelo escolhido e dos parâmetros de entrada. Quando você precisa repetir uma análise seis meses depois, ou comparar com outro grupo, não ter essas anotações transforma tudo num caos. Eu uso um arquivo de texto simples com data, versão, comando completo e link para os dados brutos. Parece trivial, mas evita perda de tempo significativa no longo prazo.