Articulo de referencia

Evaluación de clasificadores binarios

A partir de la matriz de confusión se pueden derivar cuatro medidas básicas. La evaluación de un clasificador binario generalmente consiste en asignarle un valor numérico, o var...

A partir de la matriz de confusión se pueden derivar cuatro medidas básicas.

La evaluación de un clasificador binario generalmente consiste en asignarle un valor numérico, o varios, que representan su precisión. Un ejemplo es la tasa de error, que mide la frecuencia con la que el clasificador comete errores.

Existen diversas métricas que se pueden utilizar; cada campo tiene sus propias preferencias. Por ejemplo, en medicina se suelen usar la sensibilidad y la especificidad , mientras que en informática se prefieren la precisión y la exhaustividad .

Una distinción importante radica en la diferencia entre las métricas que son independientes de la prevalencia o la asimetría (la frecuencia con la que aparece cada clase en la población) y las métricas que dependen de la prevalencia; ambos tipos son útiles, pero tienen propiedades muy diferentes.

Con frecuencia, la evaluación se utiliza para comparar dos métodos de clasificación, de modo que se pueda adoptar uno y descartar el otro. Estas comparaciones se logran de forma más directa mediante una forma de evaluación que produce una única métrica unitaria en lugar de un par de métricas .

Tabla de contingencia

Dado un conjunto de datos, una clasificación (el resultado de un clasificador aplicado a dicho conjunto) proporciona dos números: el número de positivos y el número de negativos, que suman el tamaño total del conjunto. Para evaluar un clasificador, se compara su resultado con otra clasificación de referencia (idealmente una clasificación perfecta, pero en la práctica el resultado de otra prueba estándar de oro ) y se tabulan los datos en una tabla de contingencia de 2×2 , comparando las dos clasificaciones. A continuación, se evalúa el clasificador en relación con el estándar de oro calculando las estadísticas descriptivas de estos cuatro números. Generalmente, estas estadísticas serán invariantes a la escala (escalar todos los números por el mismo factor no cambia el resultado), para que sean independientes del tamaño de la población, lo cual se logra utilizando razones de funciones homogéneas , más simplemente funciones lineales homogéneas o funciones cuadráticas homogéneas .

Supongamos que realizamos pruebas a algunas personas para detectar una enfermedad. Algunas de ellas tienen la enfermedad y la prueba da positivo. Se denominan verdaderos positivos (VP). Otras tienen la enfermedad, pero la prueba da negativo. Se denominan falsos negativos (FN). Otras no tienen la enfermedad y la prueba da negativo: verdaderos negativos (VN). Finalmente, puede haber personas sanas con un resultado positivo: falsos positivos (FP). Estos datos se pueden representar en una tabla de contingencia de 2x2 ( matriz de confusión ), donde el resultado de la prueba se representa en el eje vertical y la condición real en el eje horizontal.

Estos números se pueden sumar, obteniendo un total general y totales marginales . Al sumar toda la tabla, el número de verdaderos positivos, falsos negativos, verdaderos negativos y falsos positivos suman el 100% del conjunto. Al sumar las columnas (sumando verticalmente), el número de verdaderos positivos y falsos positivos suman el 100% de los positivos de la prueba, y lo mismo ocurre con los negativos. Al sumar las filas (sumando horizontalmente), el número de verdaderos positivos y falsos negativos suman el 100% de los positivos de la condición (y viceversa para los negativos). Las estadísticas básicas de la razón marginal se obtienen dividiendo los 2×2=4 valores de la tabla por los totales marginales (ya sean filas o columnas), lo que produce 2 tablas auxiliares de 2×2, para un total de 8 razones. Estas razones vienen en 4 pares complementarios, cada par suma 1, por lo que cada una de estas tablas derivadas de 2×2 se puede resumir como un par de 2 números, junto con sus complementos. Se pueden obtener estadísticas adicionales calculando cocientes de estos cocientes, cocientes de cocientes o funciones más complejas.

A continuación se resumen la tabla de contingencia y los ratios derivados más comunes; consulte la continuación para obtener más detalles.

  1. el número de casos positivos reales en los datos
  2. Un resultado de prueba que indica correctamente la presencia de una condición o característica.
  3. Error de tipo II: Un resultado de prueba que indica erróneamente que una condición o atributo particular está ausente.
  4. el número de casos negativos reales en los datos
  5. Un resultado de prueba que indica correctamente la ausencia de una condición o característica.
  6. Error de tipo I: Un resultado de prueba que indica erróneamente que una condición o atributo particular está presente.

Cabe destacar que las filas corresponden a si la condición es positiva o negativa (o está clasificada como tal según el estándar de referencia), como lo indica el código de colores, y las estadísticas asociadas son independientes de la prevalencia, mientras que las columnas corresponden a si la prueba es positiva o negativa, y las estadísticas asociadas dependen de la prevalencia. Existen razones de verosimilitud análogas para los valores de predicción, pero se utilizan con menos frecuencia y no se muestran arriba.

Pares de métricas

A menudo, la precisión se evalúa con un par de métricas que siguen un patrón estándar.

Sensibilidad y especificidad

Las estadísticas fundamentales independientes de la prevalencia son la sensibilidad y la especificidad .

La sensibilidad o tasa de verdaderos positivos (TPR), también conocida como tasa de detección , es la proporción de personas que dieron positivo en la prueba y siguen siendo positivas (verdaderos positivos, VP) respecto del total de personas que realmente son positivas (condición positiva, CP = VP + FN). Puede interpretarse como la probabilidad de que la prueba sea positiva dado que el paciente está enfermo . Con una mayor sensibilidad, se reducen los casos reales de enfermedad que pasan desapercibidos (o, en el caso del control de calidad en fábrica, se reducen los productos defectuosos que llegan al mercado).

La especificidad (EPE) o tasa de verdaderos negativos (TNN) es la proporción de personas que dieron negativo en la prueba y siguen siendo negativas (verdaderos negativos, TN) respecto del total de personas que realmente son negativas (condición negativa, CN = TN + FP). Al igual que la sensibilidad, puede interpretarse como la probabilidad de que el resultado de la prueba sea negativo dado que el paciente no está enfermo . Con una mayor especificidad, se diagnostica erróneamente a menos personas sanas (o, en el caso de la fábrica, se desechan menos productos en buen estado).

La relación entre sensibilidad y especificidad, así como el rendimiento del clasificador, se puede visualizar y estudiar utilizando la curva de características operativas del receptor (curva ROC).

En teoría, la sensibilidad y la especificidad son independientes, en el sentido de que es posible alcanzar el 100 % en ambas (como en el ejemplo de la bola roja/azul mencionado anteriormente). Sin embargo, en situaciones más prácticas y menos artificiales, suele existir una compensación, de modo que son inversamente proporcionales entre sí hasta cierto punto. Esto se debe a que rara vez medimos lo que realmente queremos clasificar; en cambio, generalmente medimos un indicador de lo que queremos clasificar, denominado marcador sustituto . La razón por la que se puede alcanzar el 100 % en el ejemplo de la bola es porque el rojo y el azul se determinan mediante la detección directa de estos colores. Sin embargo, los indicadores a veces se ven comprometidos, como cuando elementos que no son indicadores los imitan o cuando los indicadores dependen del tiempo y solo se hacen evidentes después de un cierto lapso. El siguiente ejemplo de una prueba de embarazo utilizará un indicador de este tipo.

Las pruebas de embarazo modernas no utilizan el embarazo en sí para determinar el estado de gestación; en cambio, emplean la gonadotropina coriónica humana (hCG), presente en la orina de las mujeres embarazadas , como marcador indirecto . Dado que la hCG también puede ser producida por un tumor , la especificidad de las pruebas de embarazo modernas no puede ser del 100 % (debido a la posibilidad de falsos positivos). Asimismo, debido a que la hCG se encuentra en la orina en concentraciones muy bajas tras la fecundación y la embriogénesis temprana , la sensibilidad de las pruebas de embarazo modernas no puede ser del 100 % (debido a la posibilidad de falsos negativos).

Valores predictivos positivos y negativos

Además de la sensibilidad y la especificidad, el rendimiento de una prueba de clasificación binaria se puede medir con el valor predictivo positivo (VPP), también conocido como precisión , y el valor predictivo negativo (VPN). El valor predictivo positivo responde a la pregunta: «Si el resultado de la prueba es positivo , ¿qué tan bien predice la presencia real de la enfermedad?». Se calcula como VP/(VP + FP); es decir, es la proporción de verdaderos positivos respecto al total de resultados positivos. El valor predictivo negativo es similar, pero para los negativos, como es lógico.

Impacto de la prevalencia en los valores predictivos

La prevalencia influye significativamente en los valores predictivos. Por ejemplo, supongamos que existe una prueba para una enfermedad con una sensibilidad del 99 % y una especificidad del 99 %. Si se analizan 2000 personas y la prevalencia (en la muestra) es del 50 %, 1000 de ellas están enfermas y 1000 están sanas. Por lo tanto, es probable que haya aproximadamente 990 verdaderos positivos y 990 verdaderos negativos, con 10 falsos positivos y 10 falsos negativos. Los valores predictivos, tanto positivos como negativos, serían del 99 %, lo que permite una alta confianza en el resultado.

Sin embargo, si la prevalencia es solo del 5%, es decir, de las 2000 personas, solo 100 están realmente enfermas, entonces los valores de predicción cambian significativamente. El resultado probable es 99 verdaderos positivos, 1 falso negativo, 1881 verdaderos negativos y 19 falsos positivos. De las 19+99 personas que dieron positivo, solo 99 realmente tienen la enfermedad; esto significa, intuitivamente, que dado que el resultado de la prueba de un paciente es positivo, hay solo un 84% de probabilidad de que realmente tenga la enfermedad. Por otro lado, dado que el resultado de la prueba del paciente es negativo, hay solo una probabilidad de 1 entre 1882, o un 0,05%, de que el paciente tenga la enfermedad a pesar del resultado de la prueba.

Precisión y recuperación

La precisión y la exhaustividad pueden interpretarse como probabilidades condicionales (estimadas): La precisión viene dada porPAG(do=PAG|do^=PAG){\displaystyle P(C=P|{\hat {C}}=P)}mientras que el recuerdo viene dado porPAG(do^=PAG|do=PAG){\displaystyle P({\sombrero {C}}=P|C=P)}, [ 9 ] dondedo^{\displaystyle {\hat {C}}}es la clase predicha ydo{\displaystyle C}es la clase real. Por lo tanto, ambas cantidades están conectadas por el teorema de Bayes .

Relaciones

Existen diversas relaciones entre estas proporciones.

Si se conocen la prevalencia, la sensibilidad y la especificidad, el valor predictivo positivo se puede obtener a partir de la siguiente identidad:

PPV=(sensibilidad)(predominio)(sensibilidad)(predominio)+(1especificidad)(1predominio){\displaystyle {\text{PPV}}={\frac {({\text{sensibilidad}})({\text{prevalencia}})}{({\text{sensibilidad}})({\text{prevalencia}})+(1-{\text{especificidad}})(1-{\text{prevalencia}})}}}

Si se conocen la prevalencia, la sensibilidad y la especificidad, el valor predictivo negativo se puede obtener a partir de la siguiente identidad:

VPN=(especificidad)(1predominio)(especificidad)(1predominio)+(1sensibilidad)(predominio).{\displaystyle {\text{VPN}}={\frac {({\text{especificidad}})(1-{\text{prevalencia}})}{({\text{especificidad}})(1-{\text{prevalencia}})+(1-{\text{sensibilidad}})({\text{prevalencia}})}}.}

Métricas unitarias

Además de las métricas pareadas, también existen métricas unitarias que proporcionan un único número para evaluar la prueba.

Quizás la estadística más simple sea la precisión o fracción correcta (FC), que mide la fracción de todas las instancias que se categorizan correctamente; es la razón del número de clasificaciones correctas con respecto al número total de clasificaciones correctas o incorrectas: (TP + TN)/población total = (TP + TN)/(TP + TN + FP + FN). Como tal, compara las estimaciones de probabilidad pre y post-prueba . En total ignorancia, se puede comparar una regla con lanzar una moneda (p0=0,5). Esta medida depende de la prevalencia . Si el 90% de las personas con síntomas de COVID no tienen COVID, la probabilidad previa P(-) es 0,9, y la regla simple "Clasificar a todos esos pacientes como libres de COVID" tendría una precisión del 90%. El diagnóstico debería ser mejor que eso. Se puede construir una "prueba z de una proporción" con p0 como max(priors) = max(P(-),P(+)) para un método de diagnóstico que espera superar una regla simple utilizando el resultado más probable. Aquí, las hipótesis son "Ho: p ≤ 0,9 vs. Ha: p > 0,9", rechazando Ho para valores grandes de z. Se podría comparar una regla de diagnóstico con otra si se conoce la precisión de la otra y se sustituye por p0 al calcular el estadístico z. Si no se conoce y se calcula a partir de los datos, se podría realizar una prueba de comparación de precisión utilizando la "Prueba z de dos proporciones, combinada para Ho: p1 = p2" .

La estadística complementaria, la fracción incorrecta (FiC), no se usa mucho : FC + FiC = 1, o (FP + FN)/(TP + TN + FP + FN); esta es la suma de la antidiagonal , dividida por la población total. Las fracciones incorrectas ponderadas por costos podrían comparar los costos esperados de clasificación errónea para diferentes métodos.

La razón de probabilidades diagnóstica (DOR) puede ser una métrica general más útil, que puede definirse directamente como (TP×TN)/(FP×FN) = (TP/FN)/(FP/TN), o indirectamente como una razón de razones de razones (razón de razones de verosimilitud, que a su vez son razones de tasas verdaderas o valores de predicción). Esto tiene una interpretación útil – como razón de probabilidades – y es independiente de la prevalencia. La razón de verosimilitud generalmente se considera independiente de la prevalencia y se interpreta fácilmente como el multiplicador para convertir probabilidades previas en probabilidades posteriores .

Una puntuación F es una combinación de la precisión y la exhaustividad , que proporciona una puntuación única. Existe una familia de estadísticos de un parámetro, con parámetro β, que determina los pesos relativos de la precisión y la exhaustividad. La puntuación F tradicional o equilibrada ( puntuación F1 ) es la media armónica de la precisión y la exhaustividad.

F1=2pagrmidoisionortermidoallpagrmidoisionorte+rmidoall{\displaystyle F_{1}=2\cdot {\frac {\mathrm {precisión} \cdot \mathrm {recall} }{\mathrm {precisión} +\mathrm {recall} }}}.

Las puntuaciones F no tienen en cuenta la tasa de verdaderos negativos y, por lo tanto, son más adecuadas para la evaluación de la recuperación y extracción de información donde los verdaderos negativos son innumerables. En cambio, medidas como el coeficiente phi , el coeficiente de correlación de Matthews , la información o el kappa de Cohen pueden ser preferibles para evaluar el rendimiento de un clasificador binario. [ 10 ] [ 11 ] Como coeficiente de correlación , el coeficiente de correlación de Matthews es la media geométrica de los coeficientes de regresión del problema y su dual . Los coeficientes de regresión componentes del coeficiente de correlación de Matthews son la marcación (deltap) y la información ( estadístico J de Youden o deltap'). [ 12 ]

Elegir la forma de evaluación adecuada

Hand ha resaltado la importancia de elegir un método de evaluación apropiado. Sin embargo, de los muchos métodos diferentes para evaluar la precisión de un clasificador, no existe un método general para determinar qué método debe usarse en cada circunstancia. Diferentes campos han adoptado diferentes enfoques. [ 13 ]

Cullerne Bown ha distinguido tres enfoques básicos para la evaluación:

° Matemático - como el coeficiente de correlación de Matthews, en el que ambos tipos de error se tratan axiomáticamente como igualmente problemáticos;

° Costo-beneficio: en el que se adopta una moneda (por ejemplo, dinero o años de vida ajustados por calidad ) y se asignan valores a los errores y a los éxitos sobre la base de mediciones empíricas;

° De juicio: en el que se realiza un juicio humano sobre la importancia relativa de los dos tipos de error; normalmente esto comienza con la adopción de un par de indicadores como sensibilidad y especificidad, precisión y exhaustividad o valor predictivo positivo y valor predictivo negativo.

En el caso de juicio, ha proporcionado un diagrama de flujo para determinar qué par de indicadores se deben usar en cada caso y, por consiguiente, cómo elegir entre la curva ROC (Receiver Operating Characteristic) y la curva de precisión-exhaustividad. [ 14 ]

Evaluación de las tecnologías subyacentes

A menudo, lo que queremos evaluar no es un clasificador específico que funcione de una manera específica, sino la tecnología subyacente. Normalmente, la tecnología se puede ajustar modificando el umbral de una función de puntuación, que determina si el resultado es positivo o negativo. Para este tipo de evaluaciones, una medida útil es el área bajo la curva ROC (AUC) .

Dejando de lado la precisión

Además de su precisión, los clasificadores binarios pueden evaluarse de muchas otras maneras, por ejemplo, en términos de su velocidad o coste.

Evaluación de clasificadores probabilísticos

Los modelos de clasificación probabilística van más allá de proporcionar resultados binarios y, en su lugar, generan puntuaciones de probabilidad para cada clase. Estos modelos están diseñados para evaluar la probabilidad de que una instancia pertenezca a diferentes clases. En el contexto de la evaluación de clasificadores probabilísticos, se han desarrollado métricas de evaluación alternativas para valorar adecuadamente el rendimiento de estos modelos. Estas métricas tienen en cuenta la naturaleza probabilística de la salida del clasificador y proporcionan una evaluación más completa de su eficacia al asignar probabilidades precisas a las diferentes clases. El objetivo de estas métricas de evaluación es capturar el grado de calibración, discriminación y precisión general de las predicciones del clasificador probabilístico.

En los sistemas de información

Los sistemas de recuperación de información, como las bases de datos y los motores de búsqueda web , se evalúan mediante diversas métricas , algunas de las cuales se derivan de la matriz de confusión , que divide los resultados en verdaderos positivos (documentos recuperados correctamente), verdaderos negativos (documentos no recuperados correctamente), falsos positivos (documentos recuperados incorrectamente) y falsos negativos (documentos no recuperados incorrectamente). Las métricas más utilizadas incluyen la precisión y la exhaustividad . En este contexto, la precisión se define como la fracción de documentos recuperados correctamente en comparación con los documentos recuperados (verdaderos positivos divididos entre verdaderos positivos más falsos positivos), utilizando un conjunto de resultados relevantes de referencia seleccionados por humanos. La exhaustividad se define como la fracción de documentos recuperados correctamente en comparación con los documentos relevantes (verdaderos positivos divididos entre verdaderos positivos más falsos negativos). Con menos frecuencia, se utiliza la métrica de exactitud, que se define como la fracción de documentos clasificados correctamente en comparación con los documentos (verdaderos positivos más verdaderos negativos divididos entre verdaderos positivos más verdaderos negativos más falsos positivos más falsos negativos).

Ninguna de estas métricas considera la clasificación de los resultados. La clasificación es crucial para los motores de búsqueda web, ya que los usuarios rara vez pasan de la primera página de resultados, y la gran cantidad de documentos en la web impide clasificarlos manualmente para determinar si deben incluirse o excluirse de una búsqueda. Establecer un umbral en un número determinado de resultados permite considerar la clasificación hasta cierto punto. La medida de precisión en k , por ejemplo, evalúa la precisión considerando únicamente los diez primeros resultados (k=10). Métricas más sofisticadas, como la ganancia acumulativa descontada , consideran la clasificación de cada resultado individual y se utilizan con mayor frecuencia cuando este aspecto es importante.

Véase también

Referencias

  1. Fawcett, Tom (2006). "Una introducción al análisis ROC" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . 
  2. Provost, Foster; Tom Fawcett (1 de agosto de 2013). "Ciencia de datos para los negocios: lo que necesita saber sobre minería de datos y pensamiento analítico de datos" . O'Reilly Media, Inc.
  3. Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" . Journal of Machine Learning Technologies . 2 (1): 37– 63.
  4. Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (eds.). Enciclopedia del aprendizaje automático . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
  5. Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (26 de enero de 2015). "Grupo de trabajo conjunto WWRP/WGNE sobre investigación de verificación de pronósticos" . Colaboración para la investigación meteorológica y climática australiana . Organización Meteorológica Mundial . Consultado el 17 de julio de 2019 .
  6. Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .  
  7. Chicco D, Toetsch N, Jurman G (febrero de 2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .  
  8. Tharwat A. (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
  9. Roelleke, Thomas (31 de mayo de 2022). Modelos de recuperación de información: fundamentos y relaciones . Springer Nature. ISBN 978-3-031-02328-6.
  10. Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la puntuación F a la curva ROC, la información, la marcación y la correlación". Journal of Machine Learning Technologies . 2 (1): 37– 63. hdl : 2328/27165 .
  11. Powers, David MW (2012). "El problema con Kappa" (PDF) . Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional (EACL2012) Taller conjunto ROBUS-UNSUP . Archivado del original (PDF) el 18 de mayo de 2016. Recuperado el 20 de julio de 2012 .
  12. Perruchet, P.; Peereman, R. (2004). "La explotación de la información distribucional en el procesamiento de sílabas". J. Neurolinguistics . 17 ( 2– 3): 97– 119. doi : 10.1016/S0911-6044(03)00059-9 . S2CID 17104364 . 
  13. David Hand (2012). "Evaluación del rendimiento de los métodos de clasificación". International Statistical Review . 80 (3): 400– 414. doi : 10.1111/j.1751-5823.2012.00183.x .
  14. William Cullerne Bown (2024). "Sensibilidad y especificidad frente a precisión y exhaustividad, y dilemas relacionados" . Journal of Classification . 41 (2): 402– 426. doi : 10.1007/s00357-024-09478-y .
  • Daños causados ​​por la precisión de la clasificación y otras reglas de puntuación de precisión incorrectas y discontinuas.