Quando você recebe uma planilha com mil linhas e precisa entender o que aconteceu no trimestre, o primeiro impulso é juntar médias e contar coisas. Isso é análise descritiva, e é onde a maioria das pessoas trava antes mesmo de começar a fazer perguntas úteis.
Eu já passei por um caso específico há dois anos: uma base de vendas com 84 mil registros e uma série temporal com gaps de 17 dias que o sistema não capturou por uma falha no horário de verão. O analista anterior tinha usado apenas média móvel simples e achava que os dados estavam normais. A solução foi cruzar com a tabela de eventos do sistema (manutenções, atualizações de firmware) e aplicar interpolação linear nos períodos faltantes antes de qualquer agregação. Se você pular esse passo, todo o resto da análise vai carregar viés silenciosamente.
Tipos de análise de dados: o que cada um realmente resolve
A classificação mais usada no dia a dia divide em quatro níveis, mas a ordem em que você os aplica importa mais do que a definição de cada um. A análise descritiva responde "o que aconteceu". A diagnóstica responde "por quê". A preditiva responde "o que tende a acontecer". A prescritiva responde "o que fazer a respeito". Começar pela prescritiva sem ter os três primeiros consistentes é o erro mais comum que eu vejo em projetos reais, e gera relatórios bonitos que ninguém consegue usar. No nível descritivo, as técnicas centrais são estatística univariada, distribuição de frequência, medidas de tendência central e dispersão, visualizações básicas como histogramas e gráficos de série temporal. O ponto que poucos mencionam é que média e mediana podem dar leituras completamente opostas em distribuições assimétricas. Num cenário que eu enfrentei com dados de churn, a média de tempo até cancelamento era de 47 dias, mas a mediana era 12 dias. A cauda longa estava distorcendo tudo. Usar quartis e boxplot resolveu a ilusão visual em 30 segundos.
Análise diagnóstica e os armadilhas que ninguém avisa
Aqui é onde a maioria dos projetos estagna. Você tem o "o que aconteceu" e quer o "por quê", mas correlação não é causalidade e existem pelo menos meia dúzia de armadilhas clássicas que aparecem quase todo trimestre. Correlação espúria, variável confundidora, overfitting em segmentações, e o problema da múltipla comparação quando você testa 20 hipóteses sem corrigir o valor-p. A correção de Bonferroni é conservadora demais para uso exploratório; a abordagem de FDR (False Discovery Rate) costuma ser mais adequada para triagem inicial. Uma técnica subestimada é a decomposição de séries temporais usando STL (Seasonal-Trend decomposition using Loess). Ela separa sazonalidade, tendência e resíduo de forma robusta a outliers, algo que a decomposição clássica de média móvel não faz bem. Eu usei isso num projeto de demanda de matéria-prima com sazonalidade múltipla (semanal, mensal e anual sobrepostas). O resultado foi identificar que o "aumento de 23%" que a gerência atribuía a uma campanha de marketing era, na verdade, efeito calendário de feriados móveis que o modelo anterior não capturava.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Análise preditiva: quando o modelo funciona e quando ele mente
Modelos preditivos são ferramentas, não oráculos. O erro mais frequente é tratar a previsão como fato consumado e tomar decisão operacional baseada num intervalo de confiança de 95% que ninguém realmente verificou. Regressão logística,árvores de decisão, random forest, XGBoost, redes neurais — cada um tem pontos cegos. Random forest tende a superajustar em dados com muitas features correlacionadas. XGBoost é sensível a hiperparâmetros e precisa de validação cruzada estratificada. Redes neurais exigem volume de dados que a maioria das empresas de médio porte não tem. O que eu aprendi na prática é que o metrica certa depende do contexto de negócio, não da acurácia bruta. Em problemas de fraude com 0,3% de taxa de base, acurácia de 99,7% significa que o modelo não prevê nada. AUC-ROC, precision-recall curve, e F1-score são muito mais informativos. Eu configurei um pipeline que compara os três simultaneamente e gera um relatório automático toda semana. O tempo de execução caiu de 3 horas manuais para cerca de 20 minutos automatizados, e a taxa de falsos positivos caiu 41% no terceiro mês de ajuste fino.
Análise prescritiva e o gargalo que ninguém espera
Aqui a coisa fica séria. Prescritiva não é só prever, é recomendar ação com consideração de restrições operacionais, custos, e trade-offs. Programação linear, simulação de Monte Carlo, otimização multiobjetivo, e reinforced learning são as técnicas principais. O problema é que a maioria dos datasets empresariais não tem as variáveis de restrição mapeadas. Você pede um plano de estoque ótimo, mas ninguém documentou os lead times reais dos fornecedores, então o otimizador sugere soluções que nenhum operador conseguiria executar. Uma abordagem pragmática que eu adoto é começar com heurísticas simples antes de modelos complexos. Regra de Reorder Point com estoque de segurança calculado manualmente costuma entregar 80% do benefício em metade do tempo de implementação de um otimizador completo. Só quando a regra simples começa a falhar sistematicamente — o que eu identifiquei quando a variabilidade de demanda ultrapassou 2,5 desvios padrão — é que eu migro para simulação. O custo de errar na prescritiva é muito mais alto do que economizar duas semanas de desenvolvimento.
Dica prática: a ordem que importa mais do que a ferramenta
Se você está começando agora, não comece baixando a ferramenta mais recente. Comece entendendo a pergunta de negócio. Tipos de análise de dados existem para responder perguntas diferentes, e confundir o nível analítico com o nível técnico é o erro que mais vejo em vagas de análise júnior. A pessoa sabe fazer um dashboard em Power BI mas não consegue explicar por quê os dados de vendas caíram 15% no mês anterior. Isso é diagnóstico, não visualização. O fluxo que funciona na prática é: definir a pergunta coletar e limpar os dados descrever o cenário atual investigar causas modelar cenários futuros sugerir ações com restrições mapeadas. Cada etapa consome tempo diferente. Descrever leva horas. Diagnosticar pode levar semanas. Prescrever depende da qualidade dos dados de restrição que raramente estão disponíveis quando você precisa. Planeje nessa ordem e não espere terminologia elegante para esconder dados pobres.