Como interpretar uma fita de DNA quando você recebe uma sequência para analisar
Você pega um sequenciamento, olha os dados e precisa descobrir o que aquilo significa na prática. Vou direto ao ponto.
Uma fita de DNA apresenta a seguinte sequência: o que fazer primeiro
A primeira coisa que eu faço é verificar se a sequência tem direção definida. DNA é lido 5' para 3'. Se o arquivo veio sem especificação, você perde uns 40 minutos tentando alinhar contra o banco errado. Sempre confiro o cabeçalho FASTA ou as metadados do sequenciador antes de mais nada. Depois, eu rodo uma verificação básica de qualidade. Sequências de Sanger vêm com Q-scores que indicam a confiança de cada base. Coisas como Q20 (99% de precisão) e Q30 (99,9%) são o padrão. Se você tem uma região com Q10 ou abaixo, melhor não confiar na chamada daquela posição até refazer a leitura ou usar consenso de múltiplas leituras inversas e direcionais.
O próximo passo é alinhar contra um reference. Eu uso o NCBI BLAST+ local — roda em segundos contra o nr/nt, ou use blastn com parâmetros ajustados para curto (se for uma oligo ou PCR product). A opção -evalue 10 e -max_hsps 5 já resolve a maioria dos casos. Para alinhar com genomas completos, eu prefiro minimap2 ou Bowtie2, dependendo do tamanho. Se a sequência for de RNA ou cDNA, lembre-se de que você vai precisar mapear contra o genoma considerando splicing. O STAR ou HISAT2 são as escolhas padrão aqui. Sem isso, você perde introns inteiros no alinhamento e seus resultados de variante ficam imprevisíveis.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um problema que eu encontro frequentemente: a fita complementar. Uma fita de DNA apresenta a seguinte sequência 5'-ATGCGTAAC-3' e o analista simplesmente busca a string exata. Mas variantes, mutações, ou até mesmo um primer mal desenhado podem gerar leituras que parecem fora do padrão. A solução rápida é também alinhar a reverse complement — o comando é simples no BLAST: use a opção "Perfect matches" ou gere manualmente a complemento com uma ferramenta como `seqret` do EMBOSS. Quando se trata de variantes, eu sempre cruzo com o dbSNP e o ClinVar. Uma mudança de nucleotídeo isolada pode ser um SNP benigno, um polimorfismo de população ou uma patogênica. Sem consulta aos bancos, você está chutando. A classificação ACMG/AMP é o framework que uso na hora de dar peso a cada variant.
Outro ponto que muita gente deixa passar: a contaminação por adaptadores. Sequenciamento de nova geração (Illumina, Nanopore) sempre deixa restos de adaptador nas extremidades. O Trimmomatic ou o Cutadapt removem isso antes do alinhamento. Correr alinhamento sem.trimming prévio aumenta falsos positivos em até 15% em alguns protocolos, dependendo da plataforma. Para quem trabalha com PCR e sequenciamento de Sanger, a limpeza do produto com exoprotease e shrek exonuclease é o padrão. Mas em amostras de baixa qualidade ou com presença de homopolimeros, o pico pode dobrar e a chamada falhar. Nesse caso, eu recomendo clonagem no vetor e leitura de clones individuais para resolver a ambiguidade, ou então usar um sequenciador de longa leitura se a região for crítica.
Se sua sequência for mitochondrial, o mito de que ela é mais fácil de alinhar é meio enganoso. O D-loop tem regiões hipervariáveis com alta taxa de substituição e repetições curtas. Alinhar contra o rCRS (revised Cambridge Reference Sequence) funciona, mas para populações não-europeias, o rCRS pode ter referência inadequada. Use o SeqMap ou mitoSeek para esses casos. Resumindo: verifique a direção, cheque a qualidade, alinhe contra o reference certo, use reverse complement se necessário, limpe adaptadores, consulte bancos de variante e esteja atento a armadilhas específicas da plataforma que você está usando. Nada disso é difícil, só exige atenção aos detalhes que diferenciam um resultado confiável de um que parece correto mas esconde erro.