O que acontece quando você para de tratar evolução como desenho animado
Ao analisar dados filogenéticos, a primeira coisa que todo mundo assume é que espécies semelhantes necessariamente compartilham um ancestral recente. Isso está certo às vezes, errado na maioria das vezes. A confusão entre homologia e analogia é o erro mais barato e mais frequente que eu já vi em papers de graduação e até em revisões de mestre. Homoplasia não é defeito de dado. É o padrão.
Entendendo evolução divergente e convergente na prática
Vou começar pelo que menos se ensina e mais se precise: a diferença operacional entre os dois processos quando você está com um alinhamento de sequência na mão. Evolução divergente é quando linhagens que se separaram de um ancestral comum acumulam diferenças morfológicas ou moleculares porque estão sob pressões seletivas distintas. O exemplo de livro é os membros anteriores dos mamíferos — asa de morcego, nadadeira de baleia, braço humano — todos com a mesma arquitetura óssea fundamental, mas remodelados para funções radicalmente diferentes. Evolução convergente, por outro lado, é quando linhagens distantes chegam a soluções parecidas porque enfrentaram problemas ambientais parecidos. Tubarão e golfinho não têm nada a ver filogeneticamente, mas ambos desenvolveram forma hidrodinâmica, nadadeira dorsal e cauda vertical. O resultado visual é enganoso se você não olhar a árvore. O problema é que métodos automáticos de reconstrução filogenética frequentemente agrupam organismos convergentes juntos. Isso se chama atração de longo ramo, ou long-branch attraction, e mata análises de quem não testa suposições. Quando duas linhagens acumulam mutações rápido demais, o algoritmo acha que elas são irmãs. Não são. Elas apenas estão mudando rápido em paralelo.
Minha experiência direta com isso aconteceu em 2023, analisando genes mitocondriais de anfíbios aplimosfários. Dois gêneros que vivem em ambientes hipóxicos semelhantes apresentavam substituições síncronas em posições-chave da cadeia respiratória. A árvore máxima-verossimilhança padrão os agrupava com suporte de 98%. Quando mudei para um modelo que permite heterogeneidade composicional — CAT-GTR no PhyloBayes, que leva em conta que diferentes sítios podem ter padrões de substituição diferentes — o agrupamento colapsou. O suporte caiu para 0.65 de probabilidade posterior. Eles não eram próximos. Estavam apenas resolvendo o mesmo problema metabólico de formas parecidas. Eu gastei três dias rodando análise Bayesiana com amostragem MCMC de 50 milhões de gerações antes de confirmar. O modelo GTR+Gama simples não capturava a heterogeneidade real dos dados. Isso é o que separa quem apenas aperta botões de quem sabe o que o botão faz.
Como identificar cada padrão nos seus dados
O teste prático que eu uso sempre começa simples. Você tem duas hipóteses concorrentes: homologia versus homoplasia. Para diferenciá-las, você não precisa de método único. Precisa de convergência de evidências. O primeiro passo é construir uma filogenia bem ancorada com fósseis ou com genomas completos quando disponíveis. Sequências únicas, especialmente genes individuais com pouca informação filogenética, são terreno fértil para agrupamentos espúrios. Um gene ribossomal 16S pode dizer muita coisa sobre relação intraespecífica e pouquíssima sobre relações interfamiliares. Use dados genômicos quando o orçamento permitir. O custo de sequenciamento caiu para algo em torno de R$ 200 a R$ 400 por amostra em painéis alvo hoje em dia, o que torna phylogenomics acessível para grupos moderados de espécies.
O segundo passo é mapear o caráter de interesse na árvore. Se ele aparece em nodos profundos com herança clara, é provável divergência. Se ele aparece de forma dispersa em ramos longos e distantes, é provável convergência. Ferramentas como o package caudata e diversitas no R facilitam o mapeamento, mas o julgamento final é seu. Software não decide se um traço é homoplásico. Você decide depois de ver o quanto a árvore é sensível a mudanças de modelo. O terceiro passo é quantificar convergência com métricas formais. O método de Hsieh et al. (2019) calcula um índice de convergência baseada na distância filogenética entre os táxons convergentes versus uma distribuição nula gerada por simulação. Se o índice observado fica no topo da distribuição nula, convergência é estatisticamente supportada. Se não fica, o parecido entre as espécies pode ser apenas ruído estrutural. Eu uso esse índice rotineiramente porque testes visuais sozinhos são subjetivos demais para publicação.
O quarto passo é o que a maioria pula e deveria nunca pular: testar sensibilidade do resultado a diferentes modelos evolutivos. Se a convergência ou divergência que você identificou desaparece quando troca GTR por WAG, ou quando adiciona categorias de taxa no modelo CAT, o resultado não é robusto. Resultado não robusto não é resultado. É artefato.
Pegadinhas que ninguém avisa
Aqui estão coisas que eu aprendi na marra e que nunca aparecem em resumos didáticos. Convergência molecular não implica convergência funcional. Duas espécies podem ter a mesma substituição de aminoácido em uma proteína sem que isso signifique que a função mudou da mesma forma em ambas. O contexto estrutural da proteína importa. A mesma mutação em posição 347 da citocromo c oxidase pode ser neutra em um organismo e deletéria em outro, dependendo da rede de interações com outras subunidades. Sempre valide com dados funcionais quando possível. Estruturas de cristalografia de raios-X ou predições de AlphaFold ajudam, mas predição não é validação.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Divergência pode mascarar convergência e vice-versa. Quando você tem um grupo com radiation rápida, os nós profundos ficam mal resolvidos. Nesse cenário, traços que parecem convergentes podem ser remnants de um ancestral que já tinha variação para aquele traço. O que parece convergência adaptativa pode ser perda diferencial de caracteres em linhagens que divergiram rapidamente. Isso é especialmente problemático em radiações de peixes cíclidos e em anfíbios da Nova Guiné, onde os timelines de diversificação são comprimidos em escalas de poucos milhões de anos. Através de dados morfológicos, a convergência é mais frequente do que os dados moleculares sugerem. Morfologia é mais fácil de moldar pela seleção natural do que sequências de DNA. Um osso pode ser alongado, reduzido, fundido ou dividido com relativamente poucas alterações genéticas. Por isso cladísticas morfológicas tradicionais frequentemente superestimam parentesco entre formas similares. A solução moderna é combinar dados morfológicos e moleculares em análises totais-evidência, mas isso exige que você trate caracteres morfológicos com modelos adequados, não como dados fixos e objetivos.
Uma limitação séria que precisa ser dita francamente: evolução convergente e divergente não são fenômenos mutuamente exclusivos no mesmo conjunto de caracteres. Um grupo pode apresentar divergência em estruturas externas e convergência em estruturas internas simultaneamente. O caso clássico são os mamíferos marinhos. Eles divergiram fortemente em formato corporal e ecologia, mas convergiram em adaptações à apneia e ao mergulho profundo em genes como myoglobin e hemoglobina. Tratar isso como um ou outro é simplificação perigosa.
Um fluxo de trabalho que funciona
Se você precisa analisar isso de verdade, não de exposição, aqui está o que eu recomendo sem romantismo. Coleta e montagem: use Illumina paired-end 150pb para genomas alvo ou transcriptomas. Para amplicon sequencing, limpar com trimmomatic e montar com SPAdes. Descarte contigs menores que 500pb e com N50 baixo. Dados ruins produzem árvores ruins independentemente do método.
Alinehamento: MAFFT com opção L-INS-i para conjuntos pequenos até 200 sequências. Se o conjunto for maior, use PRANK para incorporar eventos de inserção-deleção de forma mais realista, mesmo que seja mais lento. PRANK leva em conta a filogenia durante o alinhamento, o que reduz falsos homólogos em regiões variáveis. Seleção de modelo: ModelFinder no IQ-TREE com criterio BIC. Não chute modelo. BIC tende a selecionar modelos mais parcimoniosos e evita overfitting. Se BIC escolher um modelo muito complexo para seu tamanho de amostra, considere reduzir o número de categorias de tasa Gamma para quatro.
Árvore principal: IQ-TREE com ultrafast bootstrap de 1000 réplicas. Leva de 15 minutos a 2 horas dependendo do tamanho dos dados. Não use Neighbor-Joining para publicação. É rápido, mas insuficiente para dados reais com heterogeneidade. Teste de convergência: use o pacote R phytools ou o software convergence em Python. Gere 1000 simulações bajo hipótese nula de ancestral compartilhado e compare. Tempo médio de execução: 30 minutos em com 8 núcleos.
Análise de sensibilidade: repita com PhyloBayes CAT-GTR. Se os topologias principais se mantiverem, seu resultado é sólido. Se mudarem, reporte ambas as topologias e discuta a ambiguidade. Reportar apenas a topologia que favorece sua hipótese sem mencionar a sensibilidade é má ciência. A parte mais honesta que posso dar: nenhum método identifica convergência com 100% de certeza. A melhor prática é transparência. Mostre os resultados sob múltiplos modelos, indique onde há ambiguidade, e não transforme hipótese em fato só porque um software disse que sim. Evolução divergente e convergente são processos reais, mas nossa capacidade de detectá-los em dados reais é limitada por ruído amostral, viés de modelo e histórias evolutivas complexas que não cabem em árvores bifurcantes simples.
Se você está começando, não comece com grupos com radiation rápida. Comece com clados bem estudados, com filogenia de referência confiável, e treine seu olho em casos onde a resposta já é conhecida. A convergência entre morcegos e aves em asas é um bom exercício introdutório. A convergência em genes de resistência a veneno em cobras e golfinhos é um exercício intermediário. O que você encontra quando não sabe a resposta antes de analisar — e essa é a maioria dos casos reais — exige cuidado, não confiança cega em suporte numérico alto.