El coeficiente kappa de Cohen (símbolo κ, kappa griega minúscula ) es una estadística que se utiliza para medir la fiabilidad entre evaluadores en datos cualitativos o categóricos . [ 1 ] Generalmente se considera una medida más robusta que el simple cálculo del porcentaje de acuerdo, ya que κ incorpora la posibilidad de que el acuerdo se produzca por casualidad. Existe controversia en torno al coeficiente kappa de Cohen debido a la dificultad para interpretar los índices de acuerdo. Algunos investigadores han sugerido que es conceptualmente más sencillo evaluar el desacuerdo entre ítems. [ 2 ] El coeficiente kappa de Cohen varía de -1 (desacuerdo total) a 1 (acuerdo total). [ 3 ]
Historia
La primera mención de una estadística similar a kappa se atribuye a Galton en 1892. [ 4 ] [ 5 ]
El artículo fundamental que introdujo kappa como una nueva técnica fue publicado por Jacob Cohen en la revista Educational and Psychological Measurement en 1960. [ 6 ]
Definición
El coeficiente kappa de Cohen mide el acuerdo entre dos evaluadores que clasifican N elementos en C categorías mutuamente excluyentes. La definición dees
donde p o es el acuerdo relativo observado entre los evaluadores, y p e es la probabilidad hipotética de acuerdo por azar, utilizando los datos observados para calcular las probabilidades de que cada observador seleccione aleatoriamente cada categoría. Si los evaluadores están completamente de acuerdo, entonces. Si no hay acuerdo entre los evaluadores más allá de lo que se esperaría por azar (según lo dado por p e ),. Es posible que la estadística sea negativa, [ 7 ] lo cual puede ocurrir por casualidad si no hay relación entre las calificaciones de los dos evaluadores, o puede reflejar una tendencia real de los evaluadores a dar calificaciones diferentes.
Sea O la matriz de confusión C × C , es decir, sea O i,j el número de elementos que el primer evaluador colocó en lacategoría y el segundo evaluador se ubicó en lacategoría. Entonces:
y
dónde
- y
son el número de elementos colocados en la categoría i por el primer y segundo evaluador, respectivamente.
El valor deSe deriva del siguiente razonamiento:
Dóndees la probabilidad estimada de que tanto el evaluador 1 como el evaluador 2 clasifiquen el mismo elemento como k , mientras quees la probabilidad estimada de que el evaluador 1 clasifique un elemento como k (y el evaluador 2 como cualquier cosa), y de manera similares la probabilidad estimada de que el evaluador 2 clasifique un elemento como k . La relaciónSe basa en el supuesto de que la calificación de los dos evaluadores es independiente . El términose estima utilizando la distribución observada empíricamente: el númerode elementos clasificados como k por el evaluador 1, dividido por el número total N de elementos a clasificar:(y de forma similar para el evaluador 2).
Matriz de confusión de clasificación binaria
En la matriz de confusión tradicional de 2 × 2 empleada en el aprendizaje automático y la estadística para evaluar clasificaciones binarias , la fórmula Kappa de Cohen se puede escribir como: [ 8 ]
donde TP son los verdaderos positivos, FP son los falsos positivos, TN son los verdaderos negativos y FN son los falsos negativos. (En este caso, el coeficiente Kappa de Cohen es equivalente al índice de habilidad de Heidke conocido en meteorología ). [ 9 ] La medida fue introducida por primera vez por Myrick Haskell Doolittle en 1888. [ 10 ]
Ejemplos
Ejemplo sencillo
Supongamos que está analizando datos relacionados con un grupo de 50 personas que solicitan una subvención. Cada solicitud de subvención fue leída por dos evaluadores, quienes respondieron "Sí" o "No". Supongamos que los datos de conteo de desacuerdos son los siguientes, donde A y B son los evaluadores, los datos en la diagonal principal de la matriz (a y d) cuentan el número de acuerdos y los datos fuera de la diagonal (b y c) cuentan el número de desacuerdos:
p.ej
El acuerdo proporcional observado es:
Para calcular p e (la probabilidad de acuerdo aleatorio) observamos que:
- El lector A respondió "Sí" a 25 solicitantes y "No" a otros 25. Por lo tanto, el lector A respondió "Sí" el 50% de las veces.
- El lector B respondió "Sí" a 30 solicitantes y "No" a 20. Por lo tanto, el lector B respondió "Sí" el 60% de las veces.
Por lo tanto, la probabilidad esperada de que ambos digan que sí al azar es:
Similarmente:
La probabilidad de acuerdo aleatorio general es la probabilidad de que hayan coincidido en Sí o No, es decir:
Ahora, aplicando nuestra fórmula para el coeficiente Kappa de Cohen, obtenemos:
Los mismos porcentajes pero diferentes números
Un caso que a veces se considera un problema con el coeficiente Kappa de Cohen ocurre al comparar el Kappa calculado para dos pares de evaluadores con los dos evaluadores de cada par teniendo el mismo porcentaje de acuerdo, pero un par da un número similar de calificaciones en cada clase, mientras que el otro par da un número muy diferente de calificaciones en cada clase. [ 11 ] (En los casos siguientes, observe que B tiene 70 síes y 30 noes, en el primer caso, pero esos números están invertidos en el segundo). Por ejemplo, en los dos casos siguientes hay un acuerdo igual entre A y B (60 de 100 en ambos casos) en términos de acuerdo en cada clase, por lo que esperaríamos que los valores relativos del coeficiente Kappa de Cohen reflejaran esto. Sin embargo, al calcular el coeficiente Kappa de Cohen para cada uno:
Observamos que en el segundo caso se aprecia una mayor similitud entre A y B, en comparación con el primero. Esto se debe a que, si bien el porcentaje de coincidencia es el mismo, el porcentaje de coincidencia que se produciría "por casualidad" es significativamente mayor en el primer caso (0,54 frente a 0,46).
Propiedades
Prueba de hipótesis e intervalo de confianza
El valor p para kappa rara vez se informa, probablemente porque incluso valores relativamente bajos de kappa pueden ser significativamente diferentes de cero, pero no de magnitud suficiente para satisfacer a los investigadores. [ 12 ] : 66 Sin embargo, su error estándar ha sido descrito [ 13 ] y es calculado por varios programas informáticos. [ 14 ]
Los intervalos de confianza para Kappa se pueden construir, para los valores esperados de Kappa si tuviéramos un número infinito de elementos verificados, utilizando la siguiente fórmula: [ 1 ]
Dóndees el percentil normal estándar cuando, yse calcula mediante jackknife , bootstrap o la fórmula asintótica descrita por Fleiss y Cohen. [ 13 ]
Interpretación de la magnitud

Si la significación estadística no es una guía útil, ¿qué magnitud de kappa refleja una concordancia adecuada? Sería útil contar con directrices, pero otros factores además de la concordancia pueden influir en su magnitud, lo que dificulta la interpretación de un valor dado. Como señalaron Sim y Wright, dos factores importantes son la prevalencia (¿son los códigos equiprobables o varían sus probabilidades?) y el sesgo (¿son similares o diferentes las probabilidades marginales de los dos observadores?). En igualdad de condiciones, los valores de kappa son mayores cuando los códigos son equiprobables. Por otro lado, los valores de kappa son mayores cuando los códigos se distribuyen de forma asimétrica entre los dos observadores. A diferencia de las variaciones de probabilidad, el efecto del sesgo es mayor cuando kappa es pequeño que cuando es grande. [ 15 ] : 261–262
Otro factor es el número de códigos. A medida que aumenta el número de códigos, los valores de kappa aumentan. Basándose en un estudio de simulación, Bakeman y sus colegas concluyeron que, para observadores falibles, los valores de kappa eran menores cuando había menos códigos. Y, de acuerdo con la afirmación de Sim y Wright sobre la prevalencia, los valores de kappa eran mayores cuando los códigos eran aproximadamente equiprobables. Por lo tanto, Bakeman et al. concluyeron que "ningún valor de kappa puede considerarse universalmente aceptable". [ 16 ] : 357 También proporcionan un programa informático que permite a los usuarios calcular los valores de kappa especificando el número de códigos, su probabilidad y la precisión del observador. Por ejemplo, dados códigos equiprobables y observadores con una precisión del 85%, los valores de kappa son 0,49, 0,60, 0,66 y 0,69 cuando el número de códigos es 2, 3, 5 y 10, respectivamente.
No obstante, han aparecido directrices de magnitud en la literatura. Quizás la primera fue Landis y Koch, [ 17 ] quienes caracterizaron los valores < 0 como indicativos de ninguna concordancia y 0–0,20 como leve, 0,21–0,40 como aceptable, 0,41–0,60 como moderada, 0,61–0,80 como sustancial y 0,81–1 como concordancia casi perfecta. Sin embargo, este conjunto de directrices no es universalmente aceptado; Landis y Koch no aportaron ninguna evidencia que lo respaldara, sino que lo basaron en su opinión personal. Se ha señalado que estas directrices pueden ser más perjudiciales que útiles. [ 18 ] Las directrices igualmente arbitrarias de Fleiss [ 19 ] : 218 caracterizan los kappas superiores a 0,75 como excelentes, de 0,40 a 0,75 como aceptables a buenos y por debajo de 0,40 como deficientes.
Limitaciones
Kappa es un índice que considera la concordancia observada con respecto a una concordancia de referencia. Sin embargo, los investigadores deben considerar cuidadosamente si la concordancia de referencia de Kappa es relevante para la pregunta de investigación en particular. La concordancia de referencia de Kappa se describe frecuentemente como la concordancia debida al azar, lo cual es solo parcialmente correcto. La concordancia de referencia de Kappa es la concordancia que se esperaría debido a una asignación aleatoria, dadas las cantidades especificadas por los totales marginales de la tabla de contingencia cuadrada. Por lo tanto, κ = 0 cuando la asignación observada es aparentemente aleatoria, independientemente del desacuerdo de cantidad restringido por los totales marginales. Sin embargo, para muchas aplicaciones, los investigadores deberían estar más interesados en el desacuerdo de cantidad en los totales marginales que en el desacuerdo de asignación descrito por la información adicional en la diagonal de la tabla de contingencia cuadrada. Por lo tanto, para muchas aplicaciones, la concordancia de referencia de Kappa es más una distracción que una fuente de información. Considere el siguiente ejemplo:

La proporción de desacuerdo es 14/16 o 0,875. El desacuerdo se debe a la cantidad porque la asignación es óptima. κ es 0,01.
La proporción de discrepancia es 2/16 o 0,125. La discrepancia se debe a la asignación, ya que las cantidades son idénticas. El coeficiente Kappa es -0,07.
En este caso, informar sobre la cantidad y la discrepancia en la asignación es informativo, mientras que Kappa oculta información. Además, Kappa presenta algunos desafíos en su cálculo e interpretación, ya que es una razón. Es posible que la razón de Kappa arroje un valor indefinido debido a que el denominador es cero. Asimismo, una razón no revela ni su numerador ni su denominador. Para los investigadores, es más informativo informar sobre la discrepancia en dos componentes: cantidad y asignación. Estos dos componentes describen la relación entre las categorías con mayor claridad que una sola estadística descriptiva. Cuando el objetivo es la precisión predictiva, los investigadores pueden comenzar a pensar más fácilmente en formas de mejorar una predicción utilizando dos componentes (cantidad y asignación) en lugar de una sola razón de Kappa. [ 2 ]
Algunos investigadores han expresado su preocupación por la tendencia de κ a tomar las frecuencias de las categorías observadas como dadas, lo que puede hacerla poco fiable para medir la concordancia en situaciones como el diagnóstico de enfermedades raras. En estas situaciones, κ tiende a subestimar la concordancia en la categoría rara. [ 20 ] Por esta razón, κ se considera una medida de concordancia demasiado conservadora. [ 21 ] Otros [ 22 ] cuestionan la afirmación de que kappa "toma en cuenta" la concordancia por azar. Para hacerlo de manera efectiva se requeriría un modelo explícito de cómo el azar afecta las decisiones de los evaluadores. El llamado ajuste por azar de las estadísticas kappa supone que, cuando no están completamente seguros, los evaluadores simplemente adivinan , un escenario muy poco realista. Además, algunos trabajos [ 23 ] han demostrado cómo las estadísticas kappa pueden llevar a una conclusión errónea para datos desequilibrados.
Estadísticas relacionadas
Pi de Scott
Scott (1955) propuso una estadística similar, llamada pi . El coeficiente kappa de Cohen y el pi de Scott difieren en la forma en que se calcula p e .
kappa de Fleiss
Cabe señalar que el coeficiente kappa de Cohen mide la concordancia solo entre dos evaluadores. Para una medida de concordancia similar (el coeficiente kappa de Fleiss ), utilizada cuando hay más de dos evaluadores, véase Fleiss (1971). Sin embargo, el coeficiente kappa de Fleiss es una generalización para múltiples evaluadores del estadístico pi de Scott , no el coeficiente kappa de Cohen. El coeficiente kappa también se utiliza para comparar el rendimiento en el aprendizaje automático , pero se argumenta que la versión direccional conocida como Informedness o estadístico J de Youden es más apropiada para el aprendizaje supervisado. [ 24 ]
kappa ponderada
El coeficiente kappa ponderado permite ponderar los desacuerdos de manera diferente, según las categorías. [ 25 ] Es especialmente útil cuando las categorías están ordenadas, ya que los desacuerdos mayores pueden ponderarse más. [ 12 ] : 66
Recuerde que dos evaluadores calificansujetos en uno decategorías mutuamente excluyentes. TresEn el cálculo intervienen matrices: la distribución observadala distribución esperaday pesos.
- En la matriz de distribución observada (también conocida como matriz de confusión ), cada celdacuenta los elementos que el primer evaluador colocó en elcategoría y el segundo evaluador se ubicó en lacategoría th. La matriz se normaliza luego por el número de elementos., donación
- En la matriz de distribución esperada , cada celdaestima la probabilidad de que un nuevo elemento se clasifique comoypor los respectivos evaluadores. Aquí, como antes,es la probabilidad estimada de que un nuevo elemento se clasifique comopor el primer evaluador;es lo mismo para el segundo evaluador; y se supone que los evaluadores son independientes. En otras palabras, la matrizes el producto exterior de vectoresy.
- En la matriz de pesos , cada celdase elige para indicar la gravedad de un desacuerdo donde un elemento se clasifica comoypor los respectivos evaluadores. Celdas en la diagonalrepresentan acuerdo y, por lo tanto, se establecen en cero. Lo más común es que las celdas fuera de la diagonal se ponderen linealmente como(es decir, las celdas a una casilla de la diagonal tienen un peso de 1, las que están a dos casillas de la diagonal tienen un peso de 2, etc.); o cuadráticamente como, lo que da como resultado el coeficiente Kappa ponderado cuadrático (QWK).
La ecuación para κ ponderado es:
Elegir pesos uniformes (1 en todas las celdas fuera de la diagonal, 0 en las celdas diagonales outilizando la notación de corchetes de Iverson ), esto produce el mismo valor que el cálculo kappa no ponderado dado anteriormente.
Véase también
Lecturas adicionales
- Banerjee, M.; Capozzoli, Michelle; McSweeney, Laura; Sinha, Debajyoti (1999). "Más allá de Kappa: una revisión de las medidas de acuerdo entre evaluadores" . The Canadian Journal of Statistics . 27 (1): 3– 23. doi : 10.2307/3315487 . JSTOR 3315487. S2CID 37082712 .
- Chicco, D.; Warrens, MJ; Jurman, G. (2021). "El coeficiente de correlación de Matthews (MCC) es más informativo que el coeficiente Kappa de Cohen y la puntuación de Brier en la evaluación de la clasificación binaria" . IEEE Access . 9 : 78368–81. Bibcode : 2021IEEEA...978368C . doi : 10.1109/access.2021.3084050 . hdl : 10281/430460 . S2CID 235308708 .
- Cohen, Jacob (1960). "Un coeficiente de concordancia para escalas nominales". Educational and Psychological Measurement . 20 (1): 37– 46. doi : 10.1177/001316446002000104 . hdl : 1942/28116 . S2CID 15926286 .
- Cohen, J. (1968). "Kappa ponderado: Acuerdo en escala nominal con provisión para desacuerdo escalado o crédito parcial". Psychological Bulletin . 70 (4): 213– 220. doi : 10.1037/h0026256 . PMID 19673146 .
- Fleiss, JL; Cohen, J. (1973). "La equivalencia del coeficiente kappa ponderado y el coeficiente de correlación intraclase como medidas de fiabilidad". Educational and Psychological Measurement . 33 (3): 613– 9. doi : 10.1177/001316447303300309 . S2CID 145183399 .
- Sim, J.; Wright, CC (2005). "El estadístico Kappa en estudios de fiabilidad: uso, interpretación y requisitos de tamaño de muestra". Physical Therapy . 85 (3): 257– 268. doi : 10.1093/ptj/85.3.257 . PMID 15733050 .
- Warrens, J. (2011). "El coeficiente kappa de Cohen es un promedio ponderado". Metodología estadística . 8 (6): 473– 484. doi : 10.1016/j.stamet.2011.06.002 . hdl : 1887/18062 .
Enlaces externos
- Calculadora Kappa en línea
- Ejemplo del estadístico Kappa de Cohen para medir la concordancia con SAS
Referencias
- 1 2 McHugh, Mary L. (2012). " Fiabilidad entre evaluadores: El estadístico kappa" . Biochemia Medica . 22 (3): 276– 282. doi : 10.11613/bm.2012.031 . PMC 3900052. PMID 23092060 .
- 1 2 Pontius, Robert; Millones, Marco (2011). "Muerte a Kappa: nacimiento del desacuerdo cuantitativo y el desacuerdo de asignación para la evaluación de la precisión" . International Journal of Remote Sensing . 32 (15): 4407– 4429. Bibcode : 2011IJRS...32.4407P . doi : 10.1080/01431161.2011.552923 . S2CID 62883674 .
- ↑ McHugh, Mary L. (2012). " Fiabilidad entre evaluadores: el estadístico kappa" . Biochemia Medica . 22 (3): 276– 282. ISSN 1330-0962 . PMC 3900052. PMID 23092060 .
- ↑ Galton, F. (1892) Huellas dactilares Macmillan, Londres.
- ↑ Smeeton, NC (1985). "Historia temprana de la estadística Kappa". Biometrics . 41 (3): 795. JSTOR 2531300 .
- ↑ Cohen, Jacob (1960). "Un coeficiente de concordancia para escalas nominales". Educational and Psychological Measurement . 20 (1): 37– 46. doi : 10.1177/001316446002000104 . hdl : 1942/28116 . S2CID 15926286 .
- ↑ Sim, Julius; Wright, Chris C. (2005). "El estadístico Kappa en estudios de fiabilidad: uso, interpretación y requisitos de tamaño de muestra" . Physical Therapy . 85 (3): 257– 268. doi : 10.1093/ptj/85.3.257 . ISSN 1538-6724 . PMID 15733050 .
- ↑ Chicco D.; Warrens MJ; Jurman G. (junio de 2021). "El coeficiente de correlación de Matthews (MCC) es más informativo que el coeficiente Kappa de Cohen y la puntuación de Brier en la evaluación de la clasificación binaria" . IEEE Access . 9 : 78368 - 78381. Bibcode : 2021IEEEA...978368C . doi : 10.1109/ACCESS.2021.3084050 . hdl : 10281/430460 .
- ^ Heidke, P. (1 de diciembre de 1926). "Berechnung Des Erfolges Und Der Güte Der Windstärkevorhersagen Im Sturmwarnungsdienst". Geografiska Annaler . 8 (4): 301– 349. doi : 10.1080/20014422.1926.11881138 . ISSN 2001-4422 .
- ↑ Sociedad Filosófica de Washington (Washington, DC) (1887). Boletín de la Sociedad Filosófica de Washington . Vol. 10. Washington, DC: Publicado en colaboración con la Institución Smithsoniana. pág. 83.
- ↑ Kilem Gwet (mayo de 2002). "Fiabilidad entre evaluadores: dependencia de la prevalencia de rasgos y la homogeneidad marginal" (PDF) . Métodos estadísticos para la evaluación de la fiabilidad entre evaluadores . 2 : 1–10 . Archivado del original (PDF) el 7 de julio de 2011. Consultado el 2 de febrero de 2011 .
- 1 2 Bakeman, R.; Gottman, JM (1997). Observando la interacción: Una introducción al análisis secuencial (2.ª ed.). Cambridge, Reino Unido: Cambridge University Press. ISBN 978-0-521-27593-4.
- 1 2 Fleiss, JL; Cohen, J.; Everitt, BS (1969). "Errores estándar de muestras grandes de kappa y kappa ponderada". Psychological Bulletin . 72 (5): 323– 327. doi : 10.1037/h0028106 .
- ↑ Robinson, BF; Bakeman, R. (1998). "ComKappa: Un programa para Windows 95 para calcular kappa y estadísticas relacionadas" . Behavior Research Methods, Instruments, and Computers . 30 (4): 731– 732. doi : 10.3758/BF03209495 .
- ↑ Sim, J; Wright, C. C (2005). "El estadístico Kappa en estudios de fiabilidad: uso, interpretación y requisitos de tamaño de muestra" . Physical Therapy . 85 (3): 257– 268. doi : 10.1093/ptj/85.3.257 . PMID 15733050 .
- ↑ Bakeman, R.; Quera, V.; McArthur, D.; Robinson, BF (1997). "Detección de patrones secuenciales y determinación de su fiabilidad con observadores falibles". Métodos Psicológicos . 2 (4): 357– 370. doi : 10.1037/1082-989X.2.4.357 .
- ↑ Landis, JR; Koch, GG (1977). " La medición del acuerdo entre observadores para datos categóricos" . Biometrics . 33 ( 1): 159– 174. doi : 10.2307/2529310 . JSTOR 2529310. PMID 843571. S2CID 11077516 .
- ↑ Gwet, K. (2010). " Manual de fiabilidad entre evaluadores (Segunda edición) " ISBN 978-0-9708062-2-2
- ↑ Fleiss, JL (1981). Métodos estadísticos para tasas y proporciones (2.ª ed.). Nueva York: John Wiley. ISBN 978-0-471-26370-8.
- ↑ Viera, Anthony J.; Garrett, Joanne M. (2005). "Comprensión del acuerdo entre observadores: la estadística kappa". Medicina Familiar . 37 (5): 360– 363. PMID 15883903 .
- ↑ Strijbos, J.; Martens, R.; Prins, F.; Jochems, W. (2006). "Análisis de contenido: ¿De qué están hablando?". Computers & Education . 46 : 29–48 . CiteSeerX 10.1.1.397.5780 . doi : 10.1016/j.compedu.2005.04.002 . S2CID 14183447 .
- ↑ Uebersax, JS. (1987). "Diversidad de modelos de toma de decisiones y medición del acuerdo entre evaluadores" (PDF) . Psychological Bulletin . 101 : 140–146 . CiteSeerX 10.1.1.498.4965 . doi : 10.1037/0033-2909.101.1.140 . S2CID 39240770. Archivado del original (PDF) el 3 de marzo de 2016. Consultado el 16 de octubre de 2010 .
- ↑ Delgado, Rosario; Tibau, Xavier-Andoni (2019-09-26). "Por qué se debe evitar el coeficiente Kappa de Cohen como medida de rendimiento en la clasificación" . PLOS ONE . 14 (9) e0222916. Bibcode : 2019PLoSO..1422916D . doi : 10.1371/journal.pone.0222916 . ISSN 1932-6203 . PMC 6762152. PMID 31557204 .
- ↑ Powers, David MW (2012). "El problema con Kappa" (PDF) . Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional (EACL2012) Taller conjunto ROBUS-UNSUP . Archivado del original (PDF) el 18 de mayo de 2016. Recuperado el 20 de julio de 2012 .
- ↑ Cohen, J. (1968). "Kappa ponderado: Acuerdo en escala nominal con provisión para desacuerdo escalado o crédito parcial". Psychological Bulletin . 70 (4): 213– 220. doi : 10.1037/h0026256 . PMID 19673146 .
- Interacciones de variables categóricas
- estadística no paramétrica
- Fiabilidad entre evaluadores
- Estadísticas descriptivas para tablas de contingencia