Articulo de referencia

Precisión y recuperación

Precisión y recuperación En la clasificación , la precisión y la exhaustividad son métricas de rendimiento que se aplican a los datos recuperados de una colección , corpus o esp...

Precisión y recuperación

En la clasificación , la precisión y la exhaustividad son métricas de rendimiento que se aplican a los datos recuperados de una colección , corpus o espacio de muestra .

La precisión (también llamada valor predictivo positivo ) es la fracción de instancias relevantes entre las instancias recuperadas. Escrita como una fórmula:

Precisión=Instancias recuperadas relevantesTodo recuperado instancias{\displaystyle {\text{Precisión}}={\frac {\text{Instancias recuperadas relevantes}}{{\text{Todas las instancias recuperadas}}}}}

La recuperación (también conocida como sensibilidad ) es la fracción de instancias relevantes que se recuperaron. Escrita como una fórmula:

Recordar=Instancias recuperadas relevantesTodo importante instancias{\displaystyle {\text{Recuperación}}={\frac {\text{Instancias recuperadas relevantes}}{{\text{Todas las }}{\textbf {instancias relevantes}}}}}

Por lo tanto, tanto la precisión como la exhaustividad se basan en la relevancia .

Consideremos un programa informático para reconocer perros (el elemento relevante ) en una fotografía digital. Al procesar una imagen que contiene diez gatos y doce perros, el programa identifica ocho perros. De los ocho elementos identificados como perros, solo cinco son realmente perros ( verdaderos positivos ), mientras que los otros tres son gatos ( falsos positivos ). Siete perros no fueron detectados ( falsos negativos ) y siete gatos fueron excluidos correctamente ( verdaderos negativos ). La precisión del programa es entonces de 5/8 (verdaderos positivos / elementos seleccionados), mientras que su exhaustividad es de 5/12 (verdaderos positivos / elementos relevantes).

Adoptando un enfoque de prueba de hipótesis , donde en este caso la hipótesis nula es que un elemento dado es irrelevante (no es un perro), la ausencia de errores de tipo I y tipo II ( especificidad y sensibilidad perfectas ) corresponde respectivamente a una precisión perfecta (sin falsos positivos) y una recuperación perfecta (sin falsos negativos).

En términos más generales, la exhaustividad es simplemente el complemento de la tasa de error de tipo II (es decir, uno menos la tasa de error de tipo II). La precisión está relacionada con la tasa de error de tipo I, pero de una manera un poco más compleja, ya que también depende de la distribución previa de la probabilidad de ver un elemento relevante o irrelevante.

El ejemplo anterior del gato y el perro contenía 8 5 = 3 errores de tipo I (falsos positivos) de un total de 10 gatos (verdaderos negativos), para una tasa de error de tipo I de 3/10, y 12 5 = 7 errores de tipo II (falsos negativos), para una tasa de error de tipo II de 7/12. La precisión puede considerarse una medida de calidad, y la exhaustividad una medida de cantidad. Una mayor precisión significa que un algoritmo devuelve más resultados relevantes que irrelevantes, y una alta exhaustividad significa que un algoritmo devuelve la mayoría de los resultados relevantes (independientemente de si también devuelve resultados irrelevantes).

Introducción

Un ejemplo de clasificador de perros. Este clasificador identificó correctamente 5 imágenes como pertenecientes a un perro, pero identificó erróneamente 3 gatos como perros.

En una tarea de clasificación , la precisión de una clase se define como el número de verdaderos positivos (es decir, el número de elementos correctamente etiquetados como pertenecientes a la clase positiva) dividido por el número total de elementos etiquetados como pertenecientes a la clase positiva (es decir, la suma de verdaderos positivos y falsos positivos , que son elementos etiquetados incorrectamente como pertenecientes a la clase). La exhaustividad, en este contexto, se define como el número de verdaderos positivos dividido por el número total de elementos que realmente pertenecen a la clase positiva (es decir, la suma de verdaderos positivos y falsos negativos , que son elementos que no fueron etiquetados como pertenecientes a la clase positiva, pero deberían haberlo sido).

La precisión y la exhaustividad no son métricas particularmente útiles cuando se utilizan de forma aislada. Por ejemplo, es posible lograr una exhaustividad perfecta recuperando todos y cada uno de los elementos. Del mismo modo, es posible alcanzar una precisión perfecta seleccionando solo un número muy reducido de elementos extremadamente probables.

En una tarea de clasificación, una puntuación de precisión de 1,0 para la clase C significa que cada elemento etiquetado como perteneciente a la clase C pertenece realmente a la clase C (pero no dice nada sobre la cantidad de elementos de la clase C que no fueron etiquetados correctamente), mientras que una exhaustividad de 1,0 significa que cada elemento de la clase C fue etiquetado como perteneciente a la clase C (pero no dice nada sobre cuántos elementos de otras clases también fueron etiquetados incorrectamente como pertenecientes a la clase C).

A menudo, existe una relación inversa entre precisión y exhaustividad, donde es posible aumentar una a costa de reducir la otra, pero el contexto puede determinar si una es más valiosa que la otra en una situación dada:

Un detector de humo generalmente está diseñado para cometer muchos errores de tipo I (alertar en muchas situaciones donde no hay peligro), porque el costo de un error de tipo II (no activar la alarma durante un incendio importante) es prohibitivo. Por lo tanto, los detectores de humo se diseñan pensando en la memoria (para detectar todo peligro real), incluso restando importancia a las pérdidas de precisión (y generando muchas falsas alarmas). En sentido contrario, la proporción de Blackstone , "Es mejor que diez culpables escapen a que un inocente sufra", enfatiza los costos de un error de tipo I (condenar a una persona inocente). Por consiguiente, el sistema de justicia penal está orientado a la precisión (no a condenar a inocentes), incluso a costa de pérdidas de memoria (dejar en libertad a más culpables).

Un neurocirujano que extirpa un tumor canceroso del cerebro de un paciente también ilustra las ventajas y desventajas: el cirujano debe extirpar todas las células tumorales, ya que cualquier célula cancerosa restante regenerará el tumor. Por otro lado, el cirujano no debe extirpar células cerebrales sanas, ya que esto dejaría al paciente con una función cerebral deteriorada. El cirujano puede ser más permisivo en la zona del cerebro que extirpa para asegurarse de haber extraído todas las células cancerosas. Esta decisión aumenta la exhaustividad, pero reduce la precisión. En cambio, el cirujano puede ser más conservador en las células cerebrales que extirpa para asegurarse de extraer solo células cancerosas. Esta decisión aumenta la precisión, pero reduce la exhaustividad. Es decir, una mayor exhaustividad aumenta las probabilidades de extirpar células sanas (resultado negativo) y aumenta las probabilidades de extirpar todas las células cancerosas (resultado positivo). Una mayor precisión disminuye las probabilidades de extirpar células sanas (resultado positivo), pero también disminuye las probabilidades de extirpar todas las células cancerosas (resultado negativo).

Por lo general, las puntuaciones de precisión y exhaustividad no se analizan de forma aislada. Una curva de precisión-exhaustividad representa la precisión en función de la exhaustividad; normalmente, la precisión disminuye a medida que aumenta la exhaustividad. Alternativamente, se pueden comparar los valores de una medida para un nivel fijo en la otra medida (por ejemplo, precisión a un nivel de exhaustividad de 0,75 ) o se pueden combinar ambas en una sola medida. Ejemplos de medidas que son una combinación de precisión y exhaustividad son la medida F (la media armónica ponderada de precisión y exhaustividad), o el coeficiente de correlación de Matthews , que es una media geométrica de las variantes corregidas por azar: los coeficientes de regresión de Informedness (DeltaP') y Markedness (DeltaP). [ 1 ] [ 2 ] La exactitud es una media aritmética ponderada de Precisión y Precisión Inversa (ponderada por Sesgo) así como una media aritmética ponderada de Exhaustividad y Exhaustividad Inversa (ponderada por Prevalencia). [ 1 ] La precisión inversa y la exhaustividad inversa son simplemente la precisión y la exhaustividad del problema inverso donde se intercambian etiquetas positivas y negativas (tanto para clases reales como para etiquetas de predicción). La tasa de verdaderos positivos y la tasa de falsos positivos , o equivalentemente la exhaustividad y 1 - exhaustividad inversa, se grafican frecuentemente una contra la otra como curvas ROC y proporcionan un mecanismo basado en principios para explorar las compensaciones del punto de operación. Fuera de la recuperación de información, se argumenta que la aplicación de la exhaustividad, la precisión y la medida F es defectuosa, ya que ignoran la celda de verdaderos negativos de la tabla de contingencia y se manipulan fácilmente sesgando las predicciones. [ 1 ] El primer problema se "resuelve" utilizando la exactitud y el segundo problema se "resuelve" descontando el componente de azar y renormalizando al kappa de Cohen , pero esto ya no ofrece la oportunidad de explorar las compensaciones gráficamente. Sin embargo, Informedness y Markedness son renormalizaciones tipo Kappa de Recall y Precision, [ 3 ] y su coeficiente de correlación de Matthews de media geométrica actúa como una medida F dessesgada.

Definición

En las tareas de clasificación, los términos verdaderos positivos , verdaderos negativos , falsos positivos y falsos negativos comparan los resultados del clasificador bajo prueba con juicios externos confiables. Los términos positivo y negativo se refieren a la predicción del clasificador (a veces conocida como expectativa ), y los términos verdadero y falso se refieren a si esa predicción se corresponde con el juicio externo (a veces conocido como observación ).

Definamos un experimento a partir de P casos positivos y N casos negativos para alguna condición. Los cuatro resultados se pueden formular en una tabla de contingencia de 2×2 o matriz de confusión , como sigue:

  1. el número de casos positivos reales en los datos
  2. Un resultado de prueba que indica correctamente la presencia de una condición o característica.
  3. Error de tipo II: Un resultado de prueba que indica erróneamente que una condición o atributo particular está ausente.
  4. el número de casos negativos reales en los datos
  5. Un resultado de prueba que indica correctamente la ausencia de una condición o característica.
  6. Error de tipo I: Un resultado de prueba que indica erróneamente que una condición o atributo particular está presente.

La precisión y la exhaustividad se definen entonces como: [ 12 ]

Precisión=tpagtpag+FpagRecordar=tpagtpag+Fnorte{\displaystyle {\begin{aligned}{\text{Precisión}}&={\frac {tp}{tp+fp}}\\{\text{Recuperación}}&={\frac {tp}{tp+fn}}\,\end{aligned}}}

En este contexto, la exhaustividad también se denomina tasa de verdaderos positivos o sensibilidad , y la precisión también se denomina valor predictivo positivo (VPP); otras medidas relacionadas utilizadas en la clasificación incluyen la tasa de verdaderos negativos y la exactitud . [ 12 ] La tasa de verdaderos negativos también se denomina especificidad .

Tasa negativa verdadera=tnortetnorte+Fpag{\displaystyle {\text{Tasa negativa verdadera}}={\frac {tn}{tn+fp}}\,}

Precisión frente a exhaustividad

Tanto la precisión como la exhaustividad pueden ser útiles en casos donde existen datos desequilibrados. Sin embargo, puede ser valioso priorizar una métrica sobre la otra cuando el resultado de un falso positivo o un falso negativo es costoso. Por ejemplo, en el diagnóstico médico, una prueba con falso positivo puede llevar a tratamientos y gastos innecesarios. En esta situación, es útil valorar la precisión sobre la exhaustividad. En otros casos, el costo de un falso negativo es alto, y la exhaustividad puede ser una métrica más valiosa. Por ejemplo, el costo de un falso negativo en la detección de fraude es alto, ya que no detectar una transacción fraudulenta puede resultar en una pérdida financiera significativa. [ 13 ]

Definición probabilística

La precisión y la exhaustividad pueden interpretarse como probabilidades condicionales (estimadas) : [ 14 ] La precisión viene dada porPAG(do=PAG|do^=PAG){\displaystyle \mathbb {P} (C=P|{\hat {C}}=P)}mientras que el recuerdo viene dado porPAG(do^=PAG|do=PAG){\displaystyle \mathbb {P} ({\hat {C}}=P|C=P)}, [ 15 ] dondedo^{\displaystyle {\hat {C}}}es la clase predicha ydo{\displaystyle C}es la clase real (es decir,do=PAG{\displaystyle C=P}significa que la clase real es positiva). Ambas cantidades están, por lo tanto, conectadas por el teorema de Bayes .

Clasificadores sin habilidades

La interpretación probabilística permite derivar fácilmente cómo se desempeñaría un clasificador sin habilidades. Un clasificador sin habilidades se define por la propiedad de que la probabilidad conjuntaPAG(do=PAG,do^=PAG)=PAG(do=PAG)PAG(do^=PAG){\displaystyle \mathbb {P} (C=P,{\hat {C}}=P)=\mathbb {P} (C=P)\mathbb {P} ({\hat {C}}=P)}es simplemente el producto de las probabilidades incondicionales ya que la clasificación y la presencia de la clase son independientes .

Por ejemplo, la precisión de un clasificador sin habilidades es simplemente una constante.PAG(do=PAG|do^=PAG)=PAG(do=PAG,do^=PAG)PAG(do^=PAG)=PAG(do=PAG),{\displaystyle \mathbb {P} (C=P|{\hat {C}}=P)={\frac {\mathbb {P} (C=P,{\hat {C}}=P)}{\mathbb {P} ({\hat {C}}=P)}}=\mathbb {P} (C=P),}es decir, determinado por la probabilidad/frecuencia con la que ocurre la clase P.

Se puede esgrimir un argumento similar para la retirada: PAG(do^=PAG|do=PAG)=PAG(do=PAG,do^=PAG)PAG(do=PAG)=PAG(do^=PAG){\displaystyle \mathbb {P} ({\hat {C}}=P|C=P)={\frac {\mathbb {P} (C=P,{\hat {C}}=P)}{\mathbb {P} (C=P)}}=\mathbb {P} ({\hat {C}}=P)}que es la probabilidad de una clasificación positiva.

Datos desequilibrados

Exactitud=TPAG+TnorteTPAG+Tnorte+FPAG+Fnorte{\displaystyle {\text{Precisión}}={\frac {TP+TN}{TP+TN+FP+FN}}\,}

La precisión puede ser una métrica engañosa para conjuntos de datos desequilibrados. Consideremos una muestra con 95 valores negativos y 5 positivos. Clasificar todos los valores como negativos en este caso da una puntuación de precisión de 0,95. Hay muchas métricas que no sufren este problema. Por ejemplo, la precisión equilibrada [ 16 ] (bACC) normaliza las predicciones de verdaderos positivos y verdaderos negativos por el número de muestras positivas y negativas, respectivamente, y divide su suma por dos:

Precisión equilibrada=TPAGR+TnorteR2{\displaystyle {\text{Precisión equilibrada}}={\frac {TPR+TNR}{2}}\,}

En el ejemplo anterior (95 muestras negativas y 5 positivas), clasificar todas como negativas da como resultado una puntuación de precisión equilibrada de 0,5 (la puntuación máxima de bACC es uno), lo que equivale al valor esperado de una suposición aleatoria en un conjunto de datos equilibrado. La precisión equilibrada puede servir como métrica de rendimiento general para un modelo, independientemente de si las etiquetas reales están desequilibradas en los datos, suponiendo que el coste de los falsos negativos sea el mismo que el de los falsos positivos.

El TPR y el FPR son propiedades de un clasificador dado que opera en un umbral específico. Sin embargo, el número total de TP, FP, etc., depende del desequilibrio de clases en los datos a través de la proporción de clases.r=PAG/norte{\textstyle r=P/N}Como el recuerdo (o TPR) depende solo de los casos positivos, no se ve afectado porr{\textstyle r}, pero la precisión es. Tenemos eso

Precisión=TPAGTPAG+FPAG=PAGTPAGRPAGTPAGR+norteFPAGR=TPAGRTPAGR+1rFPAGR.{\displaystyle {\text{Precisión}}={\frac {TP}{TP+FP}}={\frac {P\cdot TPR}{P\cdot TPR+N\cdot FPR}}={\frac {TPR}{TPR+{\frac {1}{r}}FPR}}.}

Por lo tanto, la precisión tiene una dependencia explícita der{\textstyle r}. [ 17 ] Comenzando con clases equilibradas enr=1{\textstyle r=1}y disminuyendo gradualmenter{\textstyle r}, la precisión correspondiente disminuirá, porque el denominador aumenta.

Otra métrica es la tasa de predicción de condición positiva (PPCR, por sus siglas en inglés), que identifica el porcentaje de la población total que se marca como problemática. Por ejemplo, para un motor de búsqueda que devuelve 30 resultados (documentos recuperados) de un total de 1.000.000 de documentos, la PPCR es del 0,003 %.

Tasa de condición positiva prevista=TPAG+FPAGTPAG+FPAG+Tnorte+Fnorte{\displaystyle {\text{Tasa de condición positiva prevista}}={\frac {TP+FP}{TP+FP+TN+FN}}\,}

Según Saito y Rehmsmeier, los gráficos de precisión-exhaustividad son más informativos que los gráficos ROC al evaluar clasificadores binarios en datos desequilibrados. En tales escenarios, los gráficos ROC pueden ser visualmente engañosos con respecto a las conclusiones sobre la fiabilidad del rendimiento de la clasificación. [ 18 ] [ 19 ]

A diferencia de los enfoques anteriores, si se aplica un escalado de desequilibrio directamente ponderando los elementos de la matriz de confusión, las definiciones de métricas estándar siguen siendo válidas incluso en el caso de conjuntos de datos desequilibrados. [ 20 ] El procedimiento de ponderación relaciona los elementos de la matriz de confusión con el conjunto de soporte de cada clase considerada.

Además, la precisión estándar puede expresarse matemáticamente como una función algebraica directa de la prevalencia (PAG{\textstyle P}), precisión (PAGrmidoisionorte{\textstyle P_{recision}}), y recordar (Rmidoall{\textstyle R_{ecall}}Al sustituir las definiciones de verdaderos positivos y falsos positivos en relación con la prevalencia general de la clase positiva, la precisión de un clasificador viene dada por:

Exactitud=(1PAG)+PAGRmidoall(21PAGrmidoisionorte){\displaystyle {\text{Precisión}}=(1-P)+P\cdot R_{ecall}\cdot \left(2-{\frac {1}{P_{recision}}}\right)}

Esta relación explícita resalta cómo los cambios en la precisión y la exhaustividad impactan la exactitud general de manera desproporcionada, dependiendo de la prevalencia subyacente en un conjunto de datos desequilibrado. Sin embargo, al evaluar el rendimiento hipotético de un clasificador, esta fórmula teórica está limitada por las restricciones físicas del conjunto de datos; solo produce escenarios realistas válidos cuando las entradas corresponden a una matriz de confusión válida con valores verdaderos negativos no negativos.

Medida F

Una medida que combina precisión y exhaustividad es la media armónica de precisión y exhaustividad, la medida F tradicional o puntuación F equilibrada:

F=2pagrmidoisionortermidoallpagrmidoisionorte+rmidoall{\displaystyle F=2\cdot {\frac {\mathrm {precisión} \cdot \mathrm {recall} }{\mathrm {precisión} +\mathrm {recall} }}}

Esta medida es aproximadamente el promedio de los dos cuando están cerca, y es más generalmente la media armónica , que, para el caso de dos números, coincide con el cuadrado de la media geométrica dividido por la media aritmética . Hay varias razones por las que la puntuación F puede ser criticada, en circunstancias particulares, debido a su sesgo como métrica de evaluación. [ 1 ] Esto también se conoce como laF1{\displaystyle F_{1}}medida, porque la exhaustividad y la precisión tienen el mismo peso.

Es un caso especial del generalFβ{\displaystyle F_{\beta }}medida (para valores reales no negativos de β{\displaystyle \beta }):

Fβ=(1+β2)pagrmidoisionortermidoallβ2pagrmidoisionorte+rmidoall{\displaystyle F_{\beta }=(1+\beta ^{2})\cdot {\frac {\mathrm {precisión} \cdot \mathrm {recall} }{\beta ^{2}\cdot \mathrm {precisión} +\mathrm {recall} }}}

Otros dos comúnmente utilizadosF{\displaystyle F}las medidas son lasF2{\displaystyle F_{2}}medida, que pondera la recuperación más que la precisión, y laF0,5{\displaystyle F_{0.5}}medida que pone mayor énfasis en la precisión que en la exhaustividad.

La medida F fue derivada por van Rijsbergen (1979) de modo queFβ{\displaystyle F_{\beta }}"mide la efectividad de la recuperación con respecto a un usuario que adjuntaβ{\displaystyle \beta }"Tanta importancia para recordar como para la precisión". Se basa en la medida de efectividad de van Rijsbergen.miα=11αPAG+1αR{\displaystyle E_{\alpha }=1-{\frac {1}{{\frac {\alpha }{P}}+{\frac {1-\alpha }{R}}}}}, siendo el segundo término la media armónica ponderada de precisión y exhaustividad con ponderaciones(α,1α){\displaystyle (\alpha ,1-\alpha )}Su relación esFβ=1miα{\displaystyle F_{\beta }=1-E_{\alpha }}dóndeα=11+β2{\displaystyle \alpha ={\frac {1}{1+\beta ^{2}}}}.

Limitaciones como objetivos

Existen otros parámetros y estrategias para la métrica de rendimiento de los sistemas de recuperación de información, como el área bajo la curva ROC (AUC) [ 21 ] o el pseudo-R cuadrado .

Evaluación multiclase

También se pueden calcular valores de precisión y exhaustividad para problemas de clasificación con más de dos clases. [ 22 ] Para obtener la precisión de una clase determinada, dividimos el número de verdaderos positivos entre el sesgo del clasificador hacia esa clase (número de veces que el clasificador ha predicho la clase). Para calcular la exhaustividad de una clase determinada, dividimos el número de verdaderos positivos entre la prevalencia de esa clase (número de veces que la clase aparece en la muestra de datos).

Los valores de precisión y exhaustividad por clase se pueden combinar en una puntuación de evaluación multiclase general, por ejemplo, utilizando la métrica macro F1 . [ 22 ]

Generalización a distribuciones continuas

Las definiciones clásicas de precisión, exhaustividad y puntuación F se formulan para la clasificación binaria , donde cada instancia es verdadera o falsa. Sin embargo, muchos ámbitos prácticos producen señales inherentemente continuas en lugar de etiquetas discretas. Generalizar estas métricas a distribuciones continuas permite su aplicación directa a dichos datos sin la pérdida de información introducida por el umbral. [ 23 ]

Dos ejemplos ilustrativos muestran las limitaciones de los marcos binarios:

  • Finanzas cuantitativas. Un modelo puede generar una señal continua de compra/venta proporcional a su convicción para cada activo en un momento dado. Aplicar un umbral fijo (por ejemplo, señal > 0,1 = compra) descarta la magnitud de la convicción y confunde las señales fuertes con las débiles, lo que limita la capacidad del modelo para distinguir correctamente una compra fuerte de una débil.
  • Análisis de metilación del ADN. Las herramientas de secuenciación detectan regiones diferencialmente metiladas cuya señal subyacente es continua, generalmente con valores entre -1 y +1. Forzar esto a un marco binario introduce distorsiones similares al tratar todas las desviaciones positivas como equivalentes, independientemente de su magnitud.

Definiciones

Dejarincógnitai{\displaystyle x_{i}}denotan la señal esperada (verdad fundamental) yyi{\displaystyle y_{i}}la señal observada (predicha) en cada punto de datosi{\displaystyle i}. A continuación, la precisión, la exhaustividad y la puntuación F se pueden calcular de la siguiente manera:

Precisión=2incógnitaiyiincógnitai2+yi2yi2yi2{\displaystyle {\text{Precision}}={\frac {\sum {\frac {2x_{i}y_{i}}{x_{i}^{2}+y_{i}^{2}}}y_{i}^{2}}{\sum y_{i}^{2}}}}
Recordar=2incógnitaiyiincógnitai2+yi2incógnitai2incógnitai2{\displaystyle {\text{Recall}}={\frac {\sum {\frac {2x_{i}y_{i}}{x_{i}^{2}+y_{i}^{2}}}x_{i}^{2}}{\sum x_{i}^{2}}}}
F=2incógnitaiyiincógnitai2+yi2{\displaystyle F={\frac {\sum 2x_{i}y_{i}}{\sum x_{i}^{2}+y_{i}^{2}}}}

Tenga en cuenta que las sumas pueden reemplazarse por integrales para distribuciones continuas que dependen de otras variables continuas (es decir,dξ{\displaystyle \sum \rightarrow \int d\xi },incógnitaiincógnita(ξ){\displaystyle x_{i}\rightarrow x(\xi )},yiy(ξ){\displaystyle y_{i}\rightarrow y(\xi )}).

Estas definiciones se reducen a las versiones binarias clásicas cuandoincógnitai,yi{0,1}{\displaystyle x_{i},y_{i}\in \{0,1\}}Sin embargo, las métricas continuas revelan una elegancia matemática más profunda. Consideremos un modelo de aprendizaje automático completamente erróneo con una señal aleatoria. Las métricas binarias tradicionales, que no tienen en cuenta la magnitud ni el signo, aún pueden otorgarle a dicho modelo una precisión, exhaustividad y/o puntuación F positivas (incluso del 25 % o más para señales densas). Las fórmulas continuas, por el contrario, devuelven exactamente 0 para la precisión, la exhaustividad y la puntuación F en esta situación, porque cuando las señales esperadas y observadas no se correlacionan, los términos del numerador se cancelan y dan como resultado cero.

Véase también

Referencias

  1. 1 2 3 4 Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" (PDF) . Journal of Machine Learning Technologies . 2 (1): 37– 63. Archivado del original (PDF) el 14 de noviembre de 2019.
  2. Perruchet, P.; Peereman, R. (2004). "La explotación de la información distribucional en el procesamiento de sílabas" (PDF) . J. Neurolinguistics . 17 ( 2–3 ): 97–119 . doi : 10.1016/s0911-6044(03)00059-9 . S2CID 17104364 . 
  3. Powers, David MW (2012). "El problema con Kappa" . Conferencia del Capítulo Europeo de la Asociación de Lingüística Computacional (EACL2012) Taller conjunto ROBUS-UNSUP .
  4. Fawcett, Tom (2006). "Una introducción al análisis ROC" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . 
  5. Provost, Foster; Tom Fawcett (1 de agosto de 2013). "Ciencia de datos para los negocios: lo que necesita saber sobre minería de datos y pensamiento analítico de datos" . O'Reilly Media, Inc.
  6. Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" . Journal of Machine Learning Technologies . 2 (1): 37– 63.
  7. Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (eds.). Enciclopedia del aprendizaje automático . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
  8. Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (26 de enero de 2015). "Grupo de trabajo conjunto WWRP/WGNE sobre investigación de verificación de pronósticos" . Colaboración para la investigación meteorológica y climática australiana . Organización Meteorológica Mundial . Consultado el 17 de julio de 2019 .
  9. Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .  
  10. Chicco D, Toetsch N, Jurman G (febrero de 2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .  
  11. Tharwat A. (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
  12. 1 2 Olson, David L.; y Delen, Dursun (2008); Técnicas avanzadas de minería de datos , Springer, 1.ª edición (1 de febrero de 2008), página 138, ISBN 3-540-76916-1
  13. "Precisión vs. Exhaustividad: Diferencias, Casos de Uso y Evaluación" .
  14. Fatih Cakir, Kun He, Xide Xia, Brian Kulis, Stan Sclaroff, Aprendizaje métrico profundo para la clasificación , En Actas de la Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR), 2019.
  15. Roelleke, Thomas (31 de mayo de 2022). Modelos de recuperación de información: fundamentos y relaciones . Springer Nature. ISBN 978-3-031-02328-6.
  16. Mower, Jeffrey P. (12 de abril de 2005). "PREP-Mt: editor predictivo de ARN para genes mitocondriales de plantas" . BMC Bioinformatics . 6 : 96. doi : 10.1186/1471-2105-6-96 . ISSN 1471-2105 . PMC 1087475. PMID 15826309 .   
  17. Williams, Christopher KI (2021-04-01). "El efecto del desequilibrio de clases en las curvas de precisión-exhaustividad". Neural Computation . 33 (4): 853– 857. arXiv : 2007.01905 . doi : 10.1162/neco_a_01362 . hdl : 20.500.11820/8a709831-cbfe-4c8e-a65b-aee5429e5b9b . ISSN 0899-7667 . 
  18. Saito, Takaya; Rehmsmeier, Marc (2015-03-04). Brock, Guy (ed.). "El gráfico de precisión-exhaustividad es más informativo que el gráfico ROC al evaluar clasificadores binarios en conjuntos de datos desequilibrados" . PLOS ONE . 10 (3) e0118432. Bibcode : 2015PLoSO..1018432S . doi : 10.1371/journal.pone.0118432 . ISSN 1932-6203 . PMC 4349800. PMID 25738806 .   
  19. Suzanne Ekelund (marzo de 2017). "Curvas de precisión-exhaustividad: ¿qué son y cómo se utilizan?" . Pruebas de cuidados intensivos .
  20. Tripicchio, Paolo; Camacho-Gonzalez, Gerardo; D'Avella, Salvatore (2020). "Detección de defectos de soldadura: cómo lidiar con artefactos en la línea de producción" . The International Journal of Advanced Manufacturing Technology . 111 (5): 1659– 1669. doi : 10.1007/s00170-020-06146-4 . S2CID 225136860 . 
  21. Zając, Zygmunt (19 de septiembre de 2013). "Lo que querías saber sobre AUC" . FastML .
  22. 1 2 Opitz, Juri (2024). "Una mirada más cercana a las métricas de evaluación de clasificación y una reflexión crítica sobre la práctica de evaluación común". Transactions of the Association for Computational Linguistics . 12 : 820– 836. arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
  23. Solicitud de patente PCT WO 2026/096670.
  • Baeza-Yates, Ricardo; Ribeiro-Neto, Berthier (1999). Recuperación de información moderna . Nueva York, NY: ACM Press, Addison-Wesley, páginas 75 y sigs. ISBN 0-201-39829-X
  • Hjørland, Birger (2010); Los fundamentos del concepto de relevancia , Journal of the American Society for Information Science and Technology, 61(2), 217–237
  • Makhoul, John ; Kubala, Francis; Schwartz, Richard; y Weischedel, Ralph (1999); Medidas de rendimiento para la extracción de información , en Actas del Taller de Noticias de Radiodifusión de DARPA, Herndon, VA, febrero de 1999.
  • van Rijsbergen, Cornelis Joost "Keith" (1979); Recuperación de información , Londres, GB; Boston, MA: Butterworth, segunda edición, ISBN 0-408-70929-4
  • Recuperación de información - CJ van Rijsbergen 1979
  • Cálculo de la precisión y la exhaustividad para un problema de clasificación multiclase.