O que é e quando finalmente usar
O grau comparativo de superioridade é uma medida que responde a uma pergunta simples, mas que a maioria dos papers esconde atrás de p-valores e intervalos de confiança: se eu pegar uma pessoa aleatória do grupo A e uma do grupo B, qual a probabilidade de o resultado do grupo A ser maior que o do grupo B? Formalmente, isso se chama probabilidade de ordem ou índice de deslocamento, e depende de como você define "melhor". Na prática clínica costuma-se usar o desfecho clínicamente relevante como critério, não a magnitude bruta do valor. Não é o mesmo que um odds ratio, embora alguns Softwares tentem apresentar os dois juntos. Odds ratio é assimétrico e depende da distribuição de base. O grau comparativo de superioridade é diretamente interpretável como probabilidade, o que ajuda a comunicação com clinicians e gestores que não leem artigos com frequência. O problema é que ainda tem gente achando que cálculo de superioridade é sinônimo de teste não paramétrico, e isso gera confusão na hora da análise.
Como calcular grau comparativo de superioridade na prática
Eu prefiro começar pelo método empírico porque ele mostra o que está acontecendo sem mistério. Você junta os dados de ambos os grupos, ranqueia tudo junto, e depois conta quantos pares (i, j) satisfazem a condição de interesse, onde i vem do grupo de referência e j do grupo comparador. A fórmula básica é a proporção desses pares mais metade da proporção de empates, quando aplicável. Em R, packages como ‘survAUC’ e ‘MANNWHITNEY’ oferecem rotinas prontas, mas o código fica transparente em duas linhas de vetorização para tamanhos até 5000 por grupo. Se o seu desfecho for contínuo, use a abordagem de rank-based deslocamento. Se for binário ou ordinal, verifique se a interpretação clínica do "evento favorável" está bem definida antes de rodar qualquer coisa. Eu já vi gente inverter o eixo sem perceber e reportar 0,65 quando na verdade a efetividade era 0,35 porque o critério de sucesso estava definido ao contrário do padrão do guideline local. O fix foi revisar a codificação do desfecho e rodar uma análise de sensibilidade com a definição invertida para confirmar.
Para estimativas de incerteza, bootstrap com 1000 repliques costuma ser suficiente e é rápido em CPU moderna. Intervalo de confiança percentual funciona bem quando a distribuição do estimador não é muito assimétrica; se for, prefira bootstrap bias-corrected ou o método de Hall, que ajusta o viés de forma mais honesta. Relatar apenas ponto sem IC é o que mais gera reclamação em revisões sistemáticas atualmente.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Quando a medida falha e o que fazer
Existem cenários em que o grau comparativo de superioridade não resolve o problema que você acredita que está resolvendo. Um deles é quando as curvas de sobrevivência se cruzam. Nesse caso, a medida perde interpretabilidade porque a vantagem de um grupo muda ao longo do tempo, e o número único que você reporta acaba sendo uma média sem sentido clínico. Nesses casos, sugiro reportar também a probabilidade de sucesso dinâmica no tempo, ou usar medidas de diferença de áreas sob a curva de sobrevivência. O segundo cenário clássico é população com muitos empates estruturais, como escalas Likert com 5 pontos em amostras pequenas, onde a variância do estimador explode e o IC fica tão largo que não discrimina nada útil. Outro ponto que todo mundo esquece é a questão da assimetria do teste. Se você troca a ordem dos grupos, a estimativa deve ser 1 menos o valor original, não o mesmo valor. Já perdi meia hora debugando porque um package antigo retornava simétrico por conveniência interna, e eu estava interpretando errado. Conferir com uma implementação de referência costuma evitar esse tipo de dor de cabeça.
Download e reprodutibilidade
Eu mantenha um script de apoio em Python e um protótipo em R com funções para estimar o grau comparativo de superioridade, calcular bootstrap e gerar tabelas prontas para submissão. O link direto para o repositório público costuma ser atualizado a cada versão, e o README inclui exemplos com dados simulados e um conjunto real de ensaio clínico pequeno para validação. Se você estiver usando ambiente corporativo e precisar de licença ou versão com logging para auditoria, avise nos issues que envio pacote específico. O importante é que o código seja open e documentado, senão vira caixa-preta e a revisão pede réplica que nunca chega.
Erros comuns e armadilhas úteis
Relatar apenas valor pontual sem dizer como definiu sucesso é o erro mais frequente. Outro é misturar abordagem paramétrica com não paramétrica no mesmo paper sem avisar. Se usar AUC como proxy, deixe claro que AUC é caso especial do índice de deslokamento para desfechos binários e que a interpretação muda conforme a prevalência. Finalmente, confiar em p-valor para validar superioridade é contraproducente; o grau comparativo de superioridade serve justamente para fugir dessa lógica binária, então use-o como estimativa principal e trate o teste de hipótese como complemento, não como juiz final. Achei que resumir aqui evitaria redundância, mas melhor deixar claro que a escolha do método depende do desenho do estudo e da natureza do desfecho. Para ensaios pragmaticos com desfechos contínuos assimétricos, rank-based approach costuma ser o mais estável. Para meta-análises com heterogeneidade alta, considere modelo de efeitos aleatórios sobre a distribuição dos índices, senão a média ponderada engana mais do que ajuda.