O que é o Chromos no contexto da Pampulha
O Chromos é uma ferramenta de mapeamento genético e análise de sequências que tem sido adaptada por pesquisadores brasileiros para uso em estudos com materiais vegetais da região mineira. A versão chamada chromos pampulha surgiu como um fork modificado do projeto original, com ajustes específicos para lidar com dados de polimorfismo molecular em espécies nativas do cerrado e da mata atlântica. O pessoal da UFMG e da Fiocruz costumam fazer referências a essa configuração quando trabalham com marcadores ISSR e RAPD em amostras coletadas na Lagoa da Pampulha. A instalação básica funciona assim: você baixa o pacote do GitHub, extraí em uma pasta dedicada e roda o script de setup que já vem no repositório. O instalador detecta automaticamente as dependências — Python 3.9+, NumPy, SciPy e um pacote legado de visualização gráfica que depende de Tkinter. Esse último costuma dar problema em distros Linux sem ambiente desktop instalado. Se você estiver em um servidor headless, precisa rodar primeiro apt install python3-tk antes de tentar iniciar o Chromos.
Baixando e configurando o chromos pampulha
O repositório oficial fica em github.com/br-genomics/chromos-pampulha. O download direto do ZIP ou a clonagem via Git são os dois caminhos válidos. Depois de clonar, entre na pasta e execute o comando de build. A compilação leva cerca de 3 minutos em uma máquina com processador médio. A versão mais recente até julho de 2026 é a 2.4.1, que corrige um bug no parser de arquivos CEPH que truncava linhas com mais de 4000 marcadores. Depois de instalado, o fluxo de trabalho começa com a importação dos dados brutos. O Chromos aceita formatos PED, VCF e o formato proprietário CSV da Pampulha, que é basicamente uma planilha com IDs de indivíduos na primeira coluna e os alelos codificados em binário nas colunas seguintes. A conversão de VCF para o formato interno leva normalmente entre 30 segundos e 2 minutos, dependendo do tamanho do arquivo.
Um problema que eu enfrentei pessoalmente foi quando processei um conjunto de dados com 850 indivíduos e 12 mil SNPs. O Chromos travou durante a fase de cálculos de distância genética, consumindo toda a memória RAM disponível (32 GB) e sendo matado pelo OOM killer do Linux. A solução foi executar o cálculo em lotes de 200 indivíduos usando a flag --batch-size, que divide o trabalho em subprocessos separados. Cada lote processou em cerca de 8 minutos, e o resultado final foiado automaticamente pelo script pós-processamento que vem na pasta scripts/.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Funcionalidades principais
O Chromos Pampulha executa quatro tipos de análise centrais: cálculo de matriz de distância genética, análise de clustering porNeighbor-Joining, estimativa de estrutura populacional via modelo aditivo e geração de mapas de ligação simplificados. A interface é totalmente via linha de comando, sem versão gráfica. Isso afasta usuários iniciantes, mas quem está acostumado com pipelines automatizados acha mais rápido. O módulo de estrutura populacional usa uma abordagem bayesiana simplificada, bem menos custosa computacionalmente que o STRUCTURE clássico. Com um dataset de 500 amostras e 200 marcadores, a execução leva aproximadamente 15 minutos em vez das 4 a 6 horas do STRUCTURE padrão. A desvantagem é que a estimativa do K ótimo é menos precisa em populações com histórico de hibridização recente, algo comum em espécies nativas brasileiras.
Outro ponto que os tutoriais oficiais não mencionam é que o Chromos não lida bem com dados ausentes acima de 15 por cento. Se seu dataset tiver mais missing data do que isso, o programa simplemente termina com um erro silencioso sem gerar saída alguma. A recomendação é usar o pacote PLINK para preencher ou remover marcadores com excesso de dados faltantes antes de importar para o Chromos. O processo de filtragem com PLINK leva cerca de 40 segundos para um arquivo de 10 GB.
Dicas práticas para evitar erros comuns
O primeiro erro frequente é a formatação dos arquivos de entrada. O Chromos espera separador tabular nos arquivos CSV e espaço simples nos arquivos PED. Arquivos gerados pelo Excel frequentemente vêm com separador vírgula, o que quebra o parser. Dica rápida: abra o arquivo no terminal com head -n 5 e verifique os separadores antes de rodar qualquer análise. O segundo erro comum envolve a escala dos marcadores. Se seus dados vierem de uma plataforma que usa codificação 0/1/2 para alelos e o Chromos estiver configurado para codificação binária (0/1), os resultados de distância genética ficam completamente distorcidos. O parâmetro --genotype-mode controla isso. O padrão é binário, então se seus dados forem codificados alelomorficamente, passe essa flag explicitamente.
Uma limitação importante do chromos pampulha é que ele não suporta cromossomos sexuais ou plasmídios. Se seu organismo de estudo tem sistema de determinação sexual heterogamético, os resultados para esses cromossomos serão ignorados sem aviso. Testadores que trabalham com espécies com cromossomos sexuais diferenciados precisam filtrar essas regiões manualmente antes de rodar a análise principal. Para quem precisa de visualização dos resultados de clustering, o Chromos gera arquivos de coordenadas em formato XY que podem ser plotados com qualquer ferramenta de gráficos. Eu uso R com o pacote ggplot2 para gerar os scatter plots, mas também funciona bem exportar para o QTL IciMapping se o laboratório já tiver licença. O tempo de exportação das coordenadas é praticamente imediato, menos de 5 segundos para qualquer tamanho de dataset.