En estadística , el coeficiente phi , también conocido como coeficiente de contingencia cuadrática media o coeficiente de correlación de Yule y comúnmente denotado por φ o r φ , es una medida de asociación entre dos variables binarias . En aprendizaje automático y bioinformática , se conoce como coeficiente de correlación de Matthews (MCC) . En meteorología y otros campos, se le denomina medida de asociación de Doolittle o puntuación de habilidad de Doolittle . Descrito por Udny Yule en 1912 [ 1 ] y denominado phi por Karl Pearson en la década de 1930, [ 2 ] es un caso especial del coeficiente de correlación de Pearson .
Definición
Un coeficiente de correlación de Pearson estimado para dos variables binarias devolverá el coeficiente phi. [ 3 ]
Se considera que dos variables binarias están asociadas positivamente si la mayor parte de los datos se encuentran en las celdas de la diagonal. Por el contrario, se considera que dos variables binarias están asociadas negativamente si la mayor parte de los datos se encuentran fuera de la diagonal.
Si tenemos una tabla de 2×2 para dos variables aleatorias x e y
donde n 11 , n 10 , n 01 , n 00 , son recuentos no negativos de números de observaciones que suman n , el número total de observaciones. El coeficiente phi que describe la asociación de x e y es
Phi está relacionado con el coeficiente de correlación biserial puntual y la d de Cohen , y estima el grado de relación entre dos variables (2×2). [ 4 ]
El coeficiente phi también puede expresarse utilizando únicamente,,, y, como
Valores máximos
En general, el coeficiente de correlación de Pearson varía de −1 a +1, donde ±1 indica una concordancia o discordancia perfecta, y 0 indica que no existe relación. El rango del coeficiente phi —un caso especial del coeficiente de correlación de Pearson— está más restringido cuando alguna de las variables binarias presenta un desequilibrio de clases. [ 5 ]
Aprendizaje automático
El coeficiente de correlación de Matthews (MCC) se utiliza ampliamente en los campos de la bioinformática y el aprendizaje automático para evaluar la calidad de las clasificaciones binarias (de dos clases) . Recibe su nombre del bioquímico Brian W. Matthews , quien describió la medida en un artículo fundamental de 1975. [ 6 ] Una cantidad equivalente, la medida de asociación de Doolittle o puntuación de habilidad de Doolittle, fue utilizada por MH Doolittle en la década de 1880 para calificar la precisión de las predicciones de tornados y otros pronósticos meteorológicos del meteorólogo John Park Finley . [ 7 ]
El coeficiente tiene en cuenta los verdaderos y falsos positivos y negativos, y generalmente se considera una medida equilibrada que puede utilizarse incluso si las clases tienen tamaños muy diferentes. [ 8 ] El MCC es esencialmente un coeficiente de correlación entre las clasificaciones binarias observadas y predichas; devuelve un valor entre -1 y +1. Un coeficiente de +1 representa una predicción perfecta, 0 no es mejor que una predicción aleatoria y -1 indica una discrepancia total entre la predicción y la observación. Sin embargo, si el MCC no es igual a -1, 0 o +1, no es un indicador fiable de cuán similar es un predictor a una suposición aleatoria, ya que el MCC depende del conjunto de datos. [ 9 ] El MCC está estrechamente relacionado con la estadística chi-cuadrado para una tabla de contingencia de 2×2.
donde n es el número total de observaciones.
Si bien no existe una forma perfecta de describir la matriz de confusión de verdaderos y falsos positivos y negativos con un solo número, el coeficiente de correlación de Matthews se considera generalmente una de las mejores medidas de este tipo. [ 10 ] Otras medidas, como la proporción de predicciones correctas (también denominada precisión ), no son útiles cuando las dos clases tienen tamaños muy diferentes. Por ejemplo, asignar cada objeto al conjunto más grande logra una alta proporción de predicciones correctas, pero generalmente no es una clasificación útil.
El MCC se puede calcular directamente a partir de la matriz de confusión utilizando la fórmula:
En esta ecuación, TP es el número de verdaderos positivos , TN el número de verdaderos negativos , FP el número de falsos positivos y FN el número de falsos negativos . Si exactamente una de las cuatro sumas del denominador es cero, el denominador puede establecerse arbitrariamente en uno; esto da como resultado un coeficiente de correlación de Matthews de cero, que se puede demostrar que es el valor límite correcto. En caso de que dos o más sumas sean cero (por ejemplo, que tanto las etiquetas como las predicciones del modelo sean todas positivas o negativas), el límite no existe.
El MCC se puede calcular con la fórmula:
utilizando el valor predictivo positivo, la tasa de verdaderos positivos, la tasa de verdaderos negativos, el valor predictivo negativo, la tasa de falsos descubrimientos, la tasa de falsos negativos, la tasa de falsos positivos y la tasa de falsas omisiones.
La fórmula original dada por Matthews era: [ 6 ]
Esto es igual a la fórmula dada anteriormente. Como coeficiente de correlación , el coeficiente de correlación de Matthews es la media geométrica de los coeficientes de regresión del problema y su dual . Los coeficientes de regresión componentes del coeficiente de correlación de Matthews son la marcación (Δ p ) y el estadístico J de Youden ( informado o Δ p ′ ). [ 10 ] [ 11 ] La marcación y el informado corresponden a diferentes direcciones del flujo de información y generalizan el estadístico J de Youden , elestadísticas, mientras que su media geométrica generaliza el coeficiente de correlación de Matthews a más de dos clases. [ 10 ]
Algunos científicos consideran que el coeficiente de correlación de Matthews es la puntuación individual más informativa para establecer la calidad de la predicción de un clasificador binario en un contexto de matriz de confusión. [ 12 ] [ 13 ]
Ejemplo
Dada una muestra de 12 imágenes, 8 de gatos y 4 de perros, donde los gatos pertenecen a la clase 1 y los perros pertenecen a la clase 0,
- actual = [1,1,1,1,1,1,1,1,0,0,0,0],
Supongamos que se entrena un clasificador que distingue entre gatos y perros, tomamos las 12 imágenes y las procesamos con el clasificador, y el clasificador hace 9 predicciones correctas y falla 3: 2 gatos son clasificados erróneamente como perros (las 2 primeras predicciones) y 1 perro es clasificado erróneamente como gato (la última predicción).
- predicción = [0,0, 1 , 1 , 1 , 1 , 1 , 1 , 0 , 0 , 0 ,1]
Con estos dos conjuntos etiquetados (reales y predicciones) podemos crear una matriz de confusión que resumirá los resultados de la prueba del clasificador:
En esta matriz de confusión, de las 8 imágenes de gatos, el sistema determinó que 2 eran perros, y de las 4 imágenes de perros, predijo que 1 era un gato. Todas las predicciones correctas se encuentran en la diagonal de la tabla (resaltadas en negrita), por lo que es fácil inspeccionar visualmente la tabla en busca de errores de predicción, ya que estarán representados por valores fuera de la diagonal.
En términos abstractos, la matriz de confusión es la siguiente:
donde P = positivo; N = negativo; TP = verdadero positivo; FP = falso positivo; TN = verdadero negativo; FN = falso negativo.
Sustituyendo los números de la fórmula:
Matriz de confusión
Definamos un experimento a partir de P casos positivos y N casos negativos para alguna condición. Los cuatro resultados se pueden formular en una tabla de contingencia de 2×2 o matriz de confusión , como sigue:
- ↑ el número de casos positivos reales en los datos
- ↑ Un resultado de prueba que indica correctamente la presencia de una condición o característica.
- ↑ Error de tipo II: Un resultado de prueba que indica erróneamente que una condición o atributo particular está ausente.
- ↑ el número de casos negativos reales en los datos
- ↑ Un resultado de prueba que indica correctamente la ausencia de una condición o característica.
- ↑ Error de tipo I: Un resultado de prueba que indica erróneamente que una condición o atributo particular está presente.
caso multiclase
El coeficiente de correlación de Matthews se ha generalizado al caso multiclase. La generalización se denomina La estadística (para K clases diferentes) se definió en términos de unamatriz de confusión[ 22 ] . [ 23 ]
Cuando hay más de dos clases, el coeficiente de correlación de Matthews (MCC) ya no oscilará entre -1 y +1. En cambio, el valor mínimo estará entre -1 y 0, dependiendo de la distribución real. El valor máximo siempre es +1.
Esta fórmula se puede entender más fácilmente definiendo variables intermedias: [ 24 ]
- es el índice de valor real
- es el índice de valor previsto
- es el número total de clases
- el número de veces que la clase k realmente ocurrió,
- el número de veces que se predijo la clase k,
- el número total de muestras predichas correctamente,
- el número total de muestras. Esto permite expresar la fórmula como:
Utilizando la fórmula anterior para calcular la medida MCC para el ejemplo del perro y el gato discutido anteriormente, donde la matriz de confusión se trata como un ejemplo multiclase de 2 ×:
Powers [ 10 ] dio una generalización alternativa del coeficiente de correlación de Matthews a más de dos clases mediante la definición de correlación como la media geométrica de la información y la marcación .
P. Stoica y P. Babu han presentado varias generalizaciones del coeficiente de correlación de Matthews a más de dos clases junto con nuevas métricas de correlación multivariante para la clasificación multinaria. [ 25 ]
Véase también
- El kappa de Cohen
- Tabla de contingencia
- La V de Cramér , una medida similar de asociación entre variables nominales.
- Puntuación de F1
- Índice de Fowlkes-Mallows
- Correlación policórica (subtipo: correlación tetracórica), cuando las variables se consideran versiones dicotómicas de variables continuas (latentes).
Referencias
- ↑ Yule, G. Udny (1912). "Sobre los métodos para medir la asociación entre dos atributos" . Journal of the Royal Statistical Society . 75 (6): 579– 652. doi : 10.2307/2340126 . JSTOR 2340126 .
- ↑ Cramer, H. (1946). Métodos matemáticos de estadística . Princeton: Princeton University Press, pág. 282 (segundo párrafo). ISBN 0-691-08004-6https://archive.org/details/in.ernet.dli.2015.223699
- ↑ Guilford, J. (1936). Métodos psicométricos . Nueva York: McGraw–Hill Book Company, Inc.
- ↑ Aaron, B., Kromrey, JD y Ferron, JM (1998, noviembre). Igualación de índices de tamaño del efecto basados en r y d: Problemas con una fórmula comúnmente recomendada. Ponencia presentada en la reunión anual de la Asociación de Investigación Educativa de Florida, Orlando, FL. (Servicio de Reproducción de Documentos ERIC n.° ED433353)
- ↑ Davenport, E.; El-Sanhury, N. (1991). "Phi/Phimax: Revisión y síntesis". Medición educativa y psicológica . 51 (4): 821– 8. doi : 10.1177/001316449105100403 .
- 1 2 Matthews, BW (1975). "Comparación de la estructura secundaria predicha y observada de la lisozima del fago T4". Biochimica et Biophysica Acta (BBA) - Protein Structure . 405 (2): 442– 451. doi : 10.1016/0005-2795(75)90109-9 . PMID 1180967 .
- ↑ Armistead, Timothy W. (2016). "Malinterpretado y sin atribución: una revisión de las medidas de asociación de MH Doolittle, con una nota sobre el teorema de Bayes". The American Statistician . 70 (1): 63– 73. doi : 10.1080/00031305.2015.1086686 . JSTOR 45118274 .
- ↑ Boughorbel, SB (2017). "Clasificador óptimo para datos desequilibrados utilizando la métrica del coeficiente de correlación de Matthews" . PLOS ONE . 12 (6) e0177678. Bibcode : 2017PLoSO..1277678B . doi : 10.1371/journal.pone.0177678 . PMC 5456046. PMID 28574989 .
- ↑ Chicco, D.; Tötsch, N.; Jurman, G. (2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (1): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .
- 1 2 3 4 Powers, David MW (10 de octubre de 2020). "Evaluación: de la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación". arXiv : 2010.16061 [ cs.LG ].
- ↑ Perruchet, P.; Peereman, R. (2004). "La explotación de la información distribucional en el procesamiento de sílabas". J. Neurolinguistics . 17 ( 2– 3): 97– 119. doi : 10.1016/s0911-6044(03)00059-9 . S2CID 17104364 .
- ↑ Chicco D (diciembre de 2017). "Diez consejos rápidos para el aprendizaje automático en biología computacional" . BioData Mining . 10 (35) 35. doi : 10.1186/s13040-017-0155-3 . PMC 5721660. PMID 29234465 .
- ↑ Chicco D, Jurman G (febrero de 2023). "El coeficiente de correlación de Matthews (MCC) debería reemplazar al AUC ROC como métrica estándar para evaluar la clasificación binaria" . BioData Min . 16 (1) 4. doi : 10.1186/s13040-023-00322-4 . PMC 9938573. PMID 36800973 .
- ↑ Fawcett, Tom (2006). "Una introducción al análisis ROC" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 .
- ↑ Provost, Foster; Tom Fawcett (1 de agosto de 2013). "Ciencia de datos para los negocios: lo que necesita saber sobre minería de datos y pensamiento analítico de datos" . O'Reilly Media, Inc.
- ↑ Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" . Journal of Machine Learning Technologies . 2 (1): 37– 63.
- ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (eds.). Enciclopedia del aprendizaje automático . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
- ↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (26 de enero de 2015). "Grupo de trabajo conjunto WWRP/WGNE sobre investigación de verificación de pronósticos" . Colaboración para la investigación meteorológica y climática australiana . Organización Meteorológica Mundial . Consultado el 17 de julio de 2019 .
- ↑ Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .
- ↑ Chicco D, Toetsch N, Jurman G (febrero de 2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .
- ↑ Tharwat A. (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
- ↑ Gorodkin, Jan (2004). "Comparación de dos asignaciones de K-categoría mediante un coeficiente de correlación de K-categoría". Computational Biology and Chemistry . 28 (5): 367– 374. doi : 10.1016/j.compbiolchem.2004.09.006 . PMID 15556477 .
- ↑ Gorodkin, Jan. "The Rk Page" . The Rk Page . Consultado el 28 de diciembre de 2016 .
- ↑ "Coeficiente de correlación de Matthew" . scikit-learn.org .
- ↑ Stoica P y Babu P (2024), Coeficientes de correlación de Pearson-Matthews para clasificación binaria y multinaria, Elsevier Signal Processing, 222, 109511, doi = https://doi.org/10.1016/j.sigpro.2024.109511
- Bioinformática
- Quimioinformática
- Química computacional
- evaluación de la recuperación de información
- Aprendizaje automático
- Clasificación estadística
- Razones estadísticas
- Estadísticas descriptivas para tablas de contingencia