Como analisar tabelas de dados sem perder tempo
Você já deve ter passado horas olhando planilhas que pareciam não ter resposta. Observe a tabela abaixo com atenção, mas antes de clicar em qualquer coisa, entenda o que está na frente. A maioria das pessoas pula direto para o Excel e começa a fazer fórmulas sem verificar os dados. Isso dá errado frequentemente. A prática de observar tabelas — o que eu chamo de "tabela abaixo" porque é o que todo mundo pede quando manda uma mensagem técnica — é sobre saber ler a estrutura antes de agir. Vou explicar como funciona na prática, com os erros que eu cometi e que faço outros cometerem até hoje.
observe a tabela abaixo antes de qualquer análise
Quando você recebe uma tabela nova, o primeiro passo não é importar para o BI. É abrir em um editor de texto ou numa aba limpa e verificar três coisas: quantas linhas tem, quantas colunas, e se há valores nulos misturados com strings. Já vi gente fazer dashboard inteiro e descobrir no final que 40% dos dados eram texto dentro de coluna numérica. Isso acontece porque o sistema de origem não valida Nothing. No meu trabalho com dados de varejo, tive uma tabela de vendas onde o campo "CPF" vinha preenchido com "N/I" e "00000000000" como valores normais. Passei duas semanas fazendo tratamentos até perceber que a fonte original tinha essa lógica. A solução foi criar um filtro de exclusão baseado em padrão regex antes de qualquer JOIN.
Outra coisa que ninguém ensina: olhe os tipos de dado antes de tudo. Uma coluna que parece data pode ser texto. Uma que parece número pode ser decimal com vírgula. Eu descobri isso quando tentei somar uma coluna de CNPJ e o resultado deu 15 bilhões. A coluna estava como STRING e o banco estava concatenando em vez de somar.
O método prático que eu uso
O processo que eu sigo leva cerca de 15 a 30 minutos para tabelas de até 50 mil linhas. Para tabelas maiores, o tempo sobe porque a verificação manual de amostras é obrigatória. O método tem cinco etapas e não adianta pular nenhuma. A primeira etapa é o inventário visual. Abra a tabela sem ordenar, sem filtrar. Olhe as primeiras 20 linhas e as últimas 20 linhas. Depois pule para o meio. Se os dados mudarem de formato entre o início e o final, você tem problemas de integração na fonte. Isso é mais comum do que parece.
A segunda etapa é a contagem de nulos por coluna. Não confie no "verdadeiro/não" do software. Conte manualmente em pelo menos três colunas críticas. Use uma fórmula simples como =SEERRO(CONTARA(intervalo), 0) para validar. Se o número de nulos não bater com o que o sistema mostra, ignore os dados daquele campo até resolver. A terceira etapa é a verificação de duplicatas. Filtre por ID único ou combinação de campos que deveriam ser únicos. Eu já encontrei tabelas com 12% de duplicatas que não eram visíveis porque os IDs tinham espaços em branco escondidos. Use TRIM() antes de comparar.
👉 Clique no botão abaixo para saber mais sobre o assunto!
A quarta etapa é a sanity check dos valores extremos. Olhe o mínimo e o máximo de cada coluna numérica. Se um salário tiver valor negativo, ou uma idade de 200 anos, algo está errado. Anote e investigue antes de prosseguir. A quinta e última etapa é a amostragem cruzada. Pegue 100 linhas aleatórias e verifique se os dados fazem sentido no contexto do negócio. Isso captura erros que as etapas anteriores não pegam. É aqui que eu acho 90% dos problemas reais.
Pegadinhas que iniciantes nunca veem
O maior erro é confiar em ferramentas automatizadas de limpeza. Elas removem o que parece errado mas podem estar certos. Já vi uma ferramenta remover transações de R$ 0,00 porque "não faziam sentido", quando na verdade eram estornos que precisavam ser rastreados. Outro erro comum é assumir que colunas adjacentes têm o mesmo esquema. Em tabelas unidas de múltiplas fontes, uma coluna pode ter datas no formato DD/MM/AAAA e a vizinha em AAAA-MM-DD. O software trata como texto e você perde a capacidade de filtrar por período corretamente.
Também é frequente encontrar valores de moeda com símbolos diferentes na mesma coluna. R$ 1.000,00 e USD 500,00 misturados. Se você converter direto para número, o resultado é lixo. Precisa separar por moeda antes de qualquer operação.
Quando a técnica não funciona
Este método não serve para tabelas com mais de 10 milhões de linhas em formato bruto. Nesse caso, o tempo de verificação manual se torna impraticável e você precisa de amostragem estatística ou ferramentas de profiling automático como o Apache Griffin ou Great Expectations. Mesmo assim, a verificação visual das primeiras e últimas linhas continua sendo necessária. Também não funciona bem com dados temporais desatualizados. Se a tabela foi exportada há seis meses, as regras de negócio podem ter mudado. Sempre verifique a data de referência dos dados antes de aplicar qualquer análise.
O download do checklist
Eu preparei um checklist em CSV com as cinco etapas descritas acima, incluindo as fórmulas exatas para Excel e Google Sheets. Ele cobre os campos mais críticos que precisam ser verificados em cada etapa. Você pode baixar o arquivo diretamente do repositório interno da equipe de dados. O link é: drive.sapiens.ai/checklist-tabela-abaixo.csv. O arquivo tem 47 linhas e leva cerca de 2 minutos para ser adaptado à sua tabela. Se a sua tabela tiver mais de 20 colunas, recomendo ajustar os intervalos das fórmulas antes de usar.
Se você tiver uma tabela específica e quiser ajuda para identificar os problemas mais prováveis, cole as primeiras 10 linhas no fórum. Eu respondo com os pontos de atenção que eu encontraria ao observar a tabela abaixo da forma correta.