Plano Cohen O Que Foi - O que foi o Plano Cohen ?me ajudemmm - Brainly.com.br
O que foi o Plano Cohen ?me ajudemmm - Brainly.com.br

O que é o plano Cohen (Kappa de Cohen)

O plano Cohen, mais conhecido como kappa de Cohen, é uma estatística que mede o nível de concordância entre dois avaliadores que classificam os mesmos itens em categorias categóricas. A ideia central é simples: quanto os juízes concordam, e essa concordância vai além do que seria esperado pelo acaso. Não se trata apenas de percentual de acerto. O índice corrige a probabilidade de coincidência aleatória, o que o torna mais rigoroso que um simples cálculo de porcentagem. Eu trabalhei com isso em revisão sistemática onde dois pesquisadores precisavam classificar artigos como "incluso" ou "excluído" com base em critérios de elegibilidade. A concordância bruta era de 88%, mas o kappa ficou em 0,62. Ou seja, parte daquela alta porcentagem era apenas coincidência. Esse tipo de situação acontece com frequência quando os critérios não estão bem definidos desde o início.

plano cohen o que foi

A sigla kappa vem da letra grega . A fórmula é k = (Po - Pe) / (1 - Pe), onde Po representa a proporção observada de acordos e Pe a proporção esperada de acordos pelo acaso. O resultado varia de -1 a +1. Valores próximos de 1 indicam excelente concordância, valores negativos significam discordância pior que o acaso, e 0 equivale a nenhumaaccordância acima do esperado aleatoriamente. Olandês Jacob Cohen publicou o método em 1960. Originalmente, ele surgiu no contexto da psicologia e da pesquisa em sciences sociais, mas rapidamente se espalhou para medicina, ciências da computação e qualquer área que envolvesse classificação humana. Na prática clínica, por exemplo, dois radiologistas que avaliam a mesma radiografia podem usar o kappa para quantificar o quanto confiam um no julgamento do outro antes de adotarem uma norma de decisão em conjunto.

Uma coisa que muitos não percebem na primeira vez que aplicam o método é que o kappa é sensível à prevalência das categorias. Se 90% dos casos caem em uma única classe, mesmo que os avaliadores concordem bastante, o kappa pode ser artificialmente baixo. Eu descobri isso trabalhando com diagnóstico de doenças raras, onde a presença positiva é minoria. Um kappa de 0,35 naquele contexto pode significar algo muito diferente de um kappa de 0,35 em uma população onde as categorias são balanceadas. Quando isso ocorre, o alternativo indicado é o prevalence-adjusted bias-adjusted kappa, conhecido como PABAK, que corrige especificamente esse viés de prevalência e viés de resposta. Outro ponto que passa batido é a questão do peso. Para variáveis nominais sem ordem natural, usa-se kappa simples. Para variáveis ordinais, o kappa ponderado introduz pesos que reconhecem que um erro de uma categoria adjacent é menos grave que um erro de uma categoria distante. Em uma escala Likert de 1 a 5, por exemplo, confundir 2 com 3 é menos sério que confundir 1 com 5. O kappa ponderado reflete isso atribuindo pesos quadráticos ou lineares. Sem pesos, você acaba subestimando a utilidade prática do acordo em escalas polissotômicas.

Como calcular na prática

Para calcular, você precisa de uma tabela de contingência que cruzasse as classificações dos dois avaliadores. Imagine um estudo onde dois avaliadores classificaram 200 prontuários como "poslimite" ou "negativo". A tabela ficaria:

👉 Clique no botão abaixo para saber mais sobre o assunto!

O Po é simplesmente (a + d) dividido pelo total de observações. O Pe se calcula somando os produtos das margens: [(a+b)(a+c) + (c+d)(b+d)] dividido por n². Substituindo na fórmula, chega-se ao kappa. Ferramentas como o R, com o pacote irr, ou o SPSS, calculam isso automaticamente, mas fazer manualmente uma vez ajuda a entender onde cada número entra e por que resultados estranhos aparecem às vezes. Um problema real que eu encontrei foi com amostras pequenas. Quando o número total de observações era inferior a 30, o intervalo de confiança do kappa ficava tão amplo que o resultado praticamente perdia significado. A solução foi aumentar o número de itens avaliados ou adotar bootstrapping para estimação do IC. Eu costumo rodar 1.000 repetições com reposição e extrair os percentis 2,5 e 97,5. Funciona melhor que a fórmula assintótica tradicional nesses cenários.

Limitações e quando não usar

O kappa tem restrições sérias que merecem atenção. Primeiro, ele não lida bem com mais de dois avaliadores. Se você tem três ou mais jurados, o coeficiente que deve ser usado é o kappa de Fleiss, que generaliza a medida para k avaliadores. Segundo, o kappa assume que os avaliadores são trocáveis. Isso significa que ele trata a matriz de discordância como simétrica, mas na prática, um avaliador pode ser sistematicamente mais rigoroso que o outro, e o kappa não captura esse viés direcional. Também não é recomendável para dados contínuos. Se a variável é numérica, aí o correto é usar o coeficiente de correlação intraclasse (CCI) ou a análise de concordância de Bland-Altman, que são adequadas para escalas contínuas. Usar kappa em dados contínuos requer discretização prévia, o que sempre gera perda de informação e pode distorcer a interpretação.

Outra limitação prática é que o kappa não informa sobre a magnitude do desacordo, apenas sobre a existência e intensidade da concordância ajustada. Dois avaliadores podem ter o mesmo kappa, mas um deles cometer erros graves e sistemáticos, enquanto o outro tem erros esporádicos. Para investigar isso, é necessário cruzar a tabela de contingência com análises de resíduos padronizados, o que mostra onde estão concentradas as discordâncias mais frequentes.

Interpretação dos valores

A interpretação mais citada é a escala de Landis e Koch, que classifica: abaixo de 0 como pobre, 0,00 a 0,20 como ligeiro, 0,21 a 0,40 como moderado, 0,41 a 0,60 como moderado a bom, 0,61 a 0,80 como bom a excelente, e 0,81 a 1,00 como quase perfeito. Essa classificação é apenas um guia prático, não uma regra rígida. Em alguns campos, como diagnóstico médico, valores acima de 0,70 já são considerados aceitáveis. Em outras áreas, como revisão qualitativa de conteúdo, abaixo de 0,50 pode indicar necessidade urgente de refinamento dos critérios. Eu recomendo que, além do valor pontual, você sempre apresente o intervalo de confiança. Um kappa de 0,70 com IC de 0,55 a 0,85 tem interpretação muito diferente de um kappa de 0,70 com IC de 0,68 a 0,72. O primeiro revela incerteza considerável; o segundo indica estimativa precisa. Ambientes revisores exigem ambos os números para que a decisão seja informada.

Se o seu objetivo é apenas reportar um número de confiabilidade interavaliadores, o kappa resolve. Se você precisa entender o padrão das discordâncias, ajustar critérios ou preparar treinamento para avaliadores, é preciso ir além e trabalhar com a tabela de contingência, com análise de resíduos e, quando necessário, com métricas complementares como o PABAK ou o CCI, dependendo do tipo de dado e do número de avaliadores.