Entendendo amostragem aleatória em estudos oncológicos
A maioria das pessoas que começa a mexer com dados de câncer não percebe de cara que o tamanho da amostra define tudo. Quando você lê algo como em um grupo sobre câncer foi coletado aleatoriamente 25 indivíduos, está vendo uma informação extremamente concisa que carrega implicações enormes para qualquer análise estatística posterior.
em um grupo sobre câncer foi coletado aleatoriamente 25 indivíduos
Vou direto ao ponto. Vinte e cinco é pouco. Não é pouco porque a ciência tenha preconceito contra números pequenos, é pouco porque a variabilidade aumenta drasticamente. Com 25 indivíduos, um único outlier pode deslocar uma média de sobrevida em meses. Em estudos maiores, com 500 ou 1000 pacientes, o mesmo outlier simplesmente desaparece na média. O problema real que eu encontrei na prática foi com dados de acompanhamento de pacientes em hospitais públicos. A amostra era de 25 indivíduos selecionados aleatoriamente de um banco de dados com mais de 2000 registros. Na hora da análise, percebi que a distribuição de idades estava severamente enviesada para cima. Quase metade dos pacientes tinha mais de 70 anos, o que distorcia completamente qualquer inferência sobre a população geral. O viés de seleção apareceu porque o hospital de referência captava principalmente casos avançados, e a randomização simples não corrigia isso.
A solução que eu usei foi estratificação por faixa etária antes da randomização. Separei a população em três faixas (40-59, 60-79, 80+), calculei a proporção de cada uma no total, e então tirei uma amostra aleatória proporcional dentro de cada estrato. O resultado foi uma amostra com distribuição etária compatível com a população original. Levou cerca de 40 minutos para configurar o script em Python, mas salvou a análise inteira. O que quem trabalha com dados de saúde precisa entender de imediato é que randomização simples não é sinônimo de representatividade. Randomização garante que cada indivíduo tenha a mesma probabilidade de ser selecionado, mas não garante que as características da amostra reflitam a população. Isso só acontece em esperança, ou seja, se você repetir o processo infinitas vezes. Com 25 indivíduos, a convergência é lenta e o risco de viés permanece alto.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Outro detalhe que pouca gente leva a sério é o poder estatístico. Com uma amostra de 25, detectando diferenças moderadas entre grupos de tratamento, o poder cai para cerca de 40 a 50 por cento. Isso significa que há uma chance real de você não encontrar uma diferença significativa quando ela realmente existe. Um erro do tipo II, basicamente. Em estudos maiores, esse poder sobe para 80 ou 90 por cento, que é o padrão mínimo aceito pela maioria das periódicas. Se o objetivo é apenas descrição, sem inferência populacional, 25 indivíduos podem ser aceitáveis. Pode-se calcular frequências, medianas, intervalos. Mas se você quer generalizar resultados, fazer testes de hipótese ou modelar previsões, precisará de uma amostra maior ou de técnicas que compensem o tamanho reduzido, como modelos bayesianos com priors informativos.
Um erro comum que eu vejo em relatórios de pesquisa oncológica é a apresentação de intervalos de confiança absurdamente amplos como se fossem precisos. Com n=25, o intervalo de confiança para uma proporção de 30 por cento pode facilmente variar de 12 por cento a 52 por cento. Ainda assim, muitos artigos reportam a estimativa pontual e ignoram essa amplitude. É informação enganosa, mesmo que não intencional. Na prática, o melhor caminho é sempre reportar o tamanho da amostra junto com a margem de erro e o poder estimado. Se estiver usando dados secundários, como bancos de dados hospitalares, faça um diagnóstico descritivo da população fonte antes de amostrar. Verifique desbalanceamentos, missing data, e viés de retenção. Esses três fatores combinados são os que mais estragam análises com amostras pequenas.
Se você tem acesso a uma população maior mas está limitado por custo ou tempo, considere métodos de amostragem estratificada ou por conglomerados. Eles oferecem precisão comparável com menos sujeitos, desde que as estratificações sejam bem escolhidas. Variáveis como idade, estágio da doença, e tipo de tratamento são bons candidatos para estratificação em estudos oncológicos. O código que eu uso para isso é básico. Carrego os dados, verifico a distribuição das variáveis-chave com tabelas de frequência e gráficos de densidade, defino os estratos, uso uma função de amostragem estratificada e depois rodo a análise estatística. O R tem pacotes como survey e sampling que facilitam isso. Em Python, a biblioteca pandas combinada com numpy resolve rápido. O tempo total de preparação costuma variar entre 30 minutos e uma hora, dependendo da qualidade dos dados originais.
Existe ainda a questão dos dados faltantes. Em amostras de 25 indivíduos, perder três ou quatro registros por falta de informação crítica pode inviabilizar a análise. Recomendo usar múltiplas imputações ou modelos que lidem naturalmente com missing data, ao invés de simplesmente excluir os casos incompletos. A exclusão reduz ainda mais o poder e introduz viés adicional se os dados não forem completamente aleatórios. No fim, lidar com 25 indivíduos em estudos sobre câncer exige honestidade intelectual sobre as limitações. Não adianta forçar conclusões robustas a partir de números pequenos. O correto é ser transparente, reportar tudo, e deixar claro onde estão as fronteiras do que aqueles dados realmente conseguem sustentar.