Articulo de referencia

Puntuación F

Precisión y recuperación En el análisis estadístico de sistemas de clasificación binaria y recuperación de información , la puntuación F o medida F es una medida del rendimiento...

Precisión y recuperación

En el análisis estadístico de sistemas de clasificación binaria y recuperación de información , la puntuación F o medida F es una medida del rendimiento predictivo. Se calcula a partir de la precisión y la exhaustividad de la prueba, donde la precisión es el número de resultados positivos verdaderos dividido por el número total de muestras predichas como positivas, incluidas aquellas no identificadas correctamente, y la exhaustividad es el número de resultados positivos verdaderos dividido por el número total de muestras que deberían haberse identificado como positivas. La precisión también se conoce como valor predictivo positivo , y la exhaustividad como sensibilidad en la clasificación binaria diagnóstica.

La puntuación F1 es la media armónica de la precisión y la exhaustividad. Por lo tanto, representa simétricamente tanto la precisión como la exhaustividad en una sola métrica. La más genéricaFβ{\displaystyle F_{\beta }}La puntuación aplica ponderaciones adicionales, valorando más la precisión o la exhaustividad que la otra.

El valor máximo posible de una puntuación F es 1,0, lo que indica una precisión y exhaustividad perfectas, y el valor mínimo posible es 0, si la precisión o la exhaustividad son cero.

Etimología

Se cree que el nombre de medida F proviene de una función F diferente que aparece en el libro de Van Rijsbergen, cuando se presentó en la Cuarta Conferencia sobre Comprensión de Mensajes (MUC-4, 1992). [ 1 ]

Definición

La medida F tradicional o puntuación F equilibrada ( puntuación F1 ) es la media armónica de precisión y exhaustividad: [ 2 ]

F1=2rmidoall1+pagrmidoisionorte1=2pagrmidoisionortermidoallpagrmidoisionorte+rmidoall=2TPAG2TPAG+FPAG+Fnorte{\displaystyle F_{1}={\frac {2}{\mathrm {recordar} ^{-1}+\mathrm {precisión} ^{-1}}}=2{\frac {\mathrm {precisión} \cdot \mathrm {recordar} }{\mathrm {precisión} +\mathrm {recordar} }}={\frac {2\mathrm {TP} }{2\mathrm {TP} +\mathrm {FP} +\mathrm {FN} }}}

Con precisión = TP / (TP + FP) y exhaustividad = TP / (TP + FN) , se deduce que el numerador de F 1 es la suma de sus numeradores y el denominador de F 1 es la suma de sus denominadores.

Si FP=FN

F1=2TPAG2TPAG+2FPAG=TPAGTPAG+FPAG{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FP} }}={\frac {\mathrm {TP} }{\mathrm {TP} +\mathrm {FP} }}}

o

F1=2TPAG2TPAG+2Fnorte=TPAGTPAG+Fnorte{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FN} }}={\frac {\mathrm {TP} }{\mathrm {TP} +\mathrm {FN} }}}

Por lo tanto, F1 = precisión = exhaustividad

Si TP=FP=FN

F1=2TPAG2TPAG+2FPAG=2TPAG4TPAG=12=0,5{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FP} }}={\frac {2\mathrm {TP} }{4\mathrm {TP} }}={\frac {1}{2}}=0,5}

o

F1=2TPAG2TPAG+2Fnorte=2TPAG4TPAG=12=0,5{\displaystyle F_{1}={\frac {2\mathrm {TP} }{2\mathrm {TP} +2\mathrm {FN} }}={\frac {2\mathrm {TP} }{4\mathrm {TP} }}={\frac {1}{2}}=0,5}

Para verlo como una media armónica, tenga en cuenta queF11=12(rmidoall1+pagrmidoisionorte1){\displaystyle F_{1}^{-1}={\frac {1}{2}}(\mathrm {recall} ^{-1}+\mathrm {precision} ^{-1})}.

Puntuación F β

Una puntuación F más general,Fβ{\displaystyle F_{\beta }}, que utiliza un factor real positivoβ{\displaystyle \beta }, dóndeβ{\displaystyle \beta }se elige de tal manera que se considere el recuerdoβ{\displaystyle \beta }Los tiempos son tan importantes como la precisión, es:

Fβ=β2+1(β2rmidoall1)+pagrmidoisionorte1=(1+β2)pagrmidoisionortermidoall(β2pagrmidoisionorte)+rmidoall{\displaystyle F_{\beta }={\frac {\beta ^{2}+1}{(\beta ^{2}\cdot \mathrm {recall} ^{-1})+\mathrm {precision} ^{-1}}}={\frac {(1+\beta ^{2})\cdot \mathrm {precision} \cdot \mathrm {recall} }{(\beta ^{2}\cdot \mathrm {precision} )+\mathrm {recall} }}}

Para verlo como una media armónica ponderada, tenga en cuenta queFβ1=1β+β1(βrmidoall1+β1pagrmidoisionorte1){\displaystyle F_{\beta }^{-1}={\frac {1}{\beta +\beta ^{-1}}}(\beta \cdot \mathrm {recordar} ^{-1}+\beta ^{-1}\cdot \mathrm {precisión} ^{-1})}.

En términos de errores de tipo I y tipo II, esto se convierte en:

Fβ=(1+β2)TPAG(1+β2)TPAG+β2Fnorte+FPAG=(1+β2)TPAG(TPAG+Fnorte)β2+(TPAG+FPAG){\displaystyle F_{\beta }={\frac {(1+\beta ^{2})\cdot \mathrm {TP} }{(1+\beta ^{2})\cdot \mathrm {TP} +\beta ^{2}\cdot \mathrm {FN} +\mathrm {FP} }}\,={\frac {(1+\beta ^{2})\cdot \mathrm {TP} }{(\mathrm {TP} +\mathrm {FN} )\cdot \beta ^{2}+(\mathrm {TP} +\mathrm {FP} )}}\,}

Dos valores comúnmente utilizados paraβ{\displaystyle \beta }son 2, que da mayor importancia a la exhaustividad que a la precisión, y 1/2, que da menor importancia a la exhaustividad que a la precisión.

La medida F se derivó de manera queFβ{\displaystyle F_{\beta }}"mide la efectividad de la recuperación con respecto a un usuario que adjuntaβ{\displaystyle \beta }veces tanta importancia para recordar como para la precisión". [ 3 ] Se basa en la medida de efectividad de Van Rijsbergen

mi=1(αpag+1αr)1{\displaystyle E=1-\left({\frac {\alpha }{p}}+{\frac {1-\alpha }{r}}\right)^{-1}}

Su relación es:Fβ=1mi{\displaystyle F_{\beta }=1-E}dóndeα=11+β2{\displaystyle \alpha ={\frac {1}{1+\beta ^{2}}}}

Pruebas de diagnóstico

Esto está relacionado con el campo de la clasificación binaria , donde la exhaustividad a menudo se denomina "sensibilidad".

  1. el número de casos positivos reales en los datos
  2. Un resultado de prueba que indica correctamente la presencia de una condición o característica.
  3. Error de tipo II: Un resultado de prueba que indica erróneamente que una condición o atributo particular está ausente.
  4. el número de casos negativos reales en los datos
  5. Un resultado de prueba que indica correctamente la ausencia de una condición o característica.
  6. Error de tipo I: Un resultado de prueba que indica erróneamente que una condición o atributo particular está presente.
Gráfico de media armónica normalizada donde x es la precisión, y es la exhaustividad y el eje vertical es la puntuación F1 , en puntos porcentuales.
Curva de precisión-exhaustividad: los puntos de diferentes umbrales están codificados por colores; el punto con la puntuación F óptima está resaltado en rojo.

Dependencia de la puntuación F del desequilibrio de clases

Curva de precisión-exhaustividad y, por lo tanto, laFβ{\displaystyle F_{\beta }}La puntuación depende explícitamente de la proporción. r{\displaystyle r}de casos de prueba positivos a negativos. [ 12 ] Esto significa que la comparación de la puntuación F entre diferentes problemas con diferentes proporciones de clases es problemática. Una forma de abordar este problema (véase, por ejemplo, Siblini et al., 2020 [ 13 ] ) es utilizar una proporción de clases estándar.r0{\displaystyle r_{0}}al hacer tales comparaciones.

Aplicaciones

La puntuación F se utiliza frecuentemente en el campo de la recuperación de información para medir el rendimiento de la búsqueda , la clasificación de documentos y la clasificación de consultas . [ 14 ] Es particularmente relevante en aplicaciones que se ocupan principalmente de la clase positiva y donde esta es poco frecuente en relación con la clase negativa.

Los trabajos anteriores se centraron principalmente en la puntuación F1 , pero con la proliferación de motores de búsqueda a gran escala, los objetivos de rendimiento cambiaron para poner más énfasis en la precisión o la exhaustividad [ 15 ] y asíFβ{\displaystyle F_{\beta }}Se observa en una amplia aplicación.

La puntuación F también se utiliza en el aprendizaje automático . [ 16 ] Sin embargo, las medidas F no tienen en cuenta los verdaderos negativos, por lo que pueden preferirse medidas como el coeficiente de correlación de Matthews , la información o el coeficiente kappa de Cohen para evaluar el rendimiento de un clasificador binario. [ 17 ]

La puntuación F se ha utilizado ampliamente en la literatura sobre procesamiento del lenguaje natural, [ 18 ] como en la evaluación del reconocimiento de entidades nombradas y la segmentación de palabras .

Propiedades

La puntuación F1 es el coeficiente de Dice del conjunto de elementos recuperados y el conjunto de elementos relevantes. [ 19 ]

  • La puntuación F1 de un clasificador que siempre predice la clase positiva converge a 1 a medida que aumenta la probabilidad de la clase positiva.
  • La puntuación F1 de un clasificador que siempre predice la clase positiva es igual a 2 * proporción_de_clase_positiva / (1 + proporción_de_clase_positiva), ya que la exhaustividad es 1 y la precisión es igual a la proporción de la clase positiva. [ 20 ]
  • Si el modelo de puntuación no es informativo (no puede distinguir entre la clase positiva y la negativa), entonces el umbral óptimo es 0, de modo que siempre se predice la clase positiva.
  • La puntuación F1 es cóncava en la tasa de verdaderos positivos. [ 21 ]

Crítica

David Hand y otros critican el uso generalizado de la puntuación F1, ya que otorga la misma importancia a la precisión y la exhaustividad. En la práctica, los distintos tipos de clasificaciones erróneas conllevan distintos costes. En otras palabras, la importancia relativa de la precisión y la exhaustividad es un aspecto del problema. [ 22 ]

Según Davide Chicco y Giuseppe Jurman, la puntuación F1 es menos veraz e informativa que el coeficiente de correlación de Matthews (MCC) en la clasificación de evaluación binaria. [ 23 ]

David MW Powers ha señalado que F1 ignora los verdaderos negativos y, por lo tanto, resulta engañoso para clases desequilibradas, mientras que las medidas kappa y de correlación son simétricas y evalúan ambas direcciones de predictibilidad: el clasificador predice la clase verdadera y la clase verdadera predice la predicción del clasificador, proponiendo medidas multiclase separadas, Informedness y Markedness, para las dos direcciones, y observando que su media geométrica es la correlación. [ 24 ]

Otra crítica a F1 radica en su falta de simetría. Esto significa que su valor puede cambiar al modificarse el etiquetado de los datos: las muestras "positivas" se denominan "negativas" y viceversa. Esta crítica se aborda con la definición de la métrica P4 , que a veces se presenta como una extensión simétrica de F1 . [ 25 ]

Finalmente, Ferrer [ 26 ] y Dyrland et al. [ 27 ] argumentan que el costo esperado (o su contraparte, la utilidad esperada) es la única métrica fundamentada para evaluar las decisiones de clasificación, con diversas ventajas sobre la puntuación F y el MCC. Ambos trabajos demuestran que la puntuación F puede llevar a conclusiones erróneas sobre la calidad absoluta y relativa de los sistemas.

Diferencia con respecto al índice de Fowlkes-Mallows

Mientras que la medida F es la media armónica de la exhaustividad y la precisión, el índice de Fowlkes-Mallows es su media geométrica . [ 28 ]

Extensión a la clasificación multiclase

La puntuación F también se utiliza para evaluar problemas de clasificación con más de dos clases ( clasificación multiclase ). Un método común consiste en promediar la puntuación F de cada clase, con el objetivo de obtener una medición equilibrada del rendimiento. [ 29 ]

Macro F1

La puntuación F1 macro es una puntuación F1 promediada a nivel macro que busca una medición de rendimiento equilibrada. Para calcular la puntuación F1 macro, se han utilizado dos fórmulas de promedio diferentes: la puntuación F1 de las medias (aritméticas) de precisión y exhaustividad por clase o la media aritmética de las puntuaciones F1 por clase, donde esta última presenta propiedades más deseables. [ 30 ]

Micro F1

Micro F1 es la media armónica de la microprecisión y la microexhaustividad . En la clasificación multiclase de una sola etiqueta, la microprecisión es igual a la microexhaustividad, por lo que micro F1 es igual a ambas. Sin embargo, contrariamente a una idea errónea común, micro F1 generalmente no es igual a la exactitud , ya que la exactitud tiene en cuenta los verdaderos negativos, mientras que micro F1 no. [ 31 ]

Véase también

Referencias

  1. Sasaki, Y. (2007). "La verdad de la medida F" (PDF) . Teach Tutor Mater . Vol.  1, n.º  5, págs. 1-5 . 
  2. Aziz Taha, Abdel (2015). "Métricas para evaluar la segmentación de imágenes médicas 3D: análisis, selección y herramienta" . BMC Medical Imaging . 15 (29) 29: 1– 28. doi : 10.1186/s12880-015-0068- x . PMC 4533825. PMID 26263899 .  
  3. ^ Van Rijsbergen, CJ (1979). Recuperación de información (2ª ed.). Butterworth-Heinemann. 
  4. Fawcett, Tom (2006). "Una introducción al análisis ROC" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 . 
  5. Provost, Foster; Tom Fawcett (1 de agosto de 2013). "Ciencia de datos para los negocios: lo que necesita saber sobre minería de datos y pensamiento analítico de datos" . O'Reilly Media, Inc.
  6. Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" . Journal of Machine Learning Technologies . 2 (1): 37– 63.
  7. Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (eds.). Enciclopedia del aprendizaje automático . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
  8. Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (26 de enero de 2015). "Grupo de trabajo conjunto WWRP/WGNE sobre investigación de verificación de pronósticos" . Colaboración para la investigación meteorológica y climática australiana . Organización Meteorológica Mundial . Consultado el 17 de julio de 2019 .
  9. Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .  
  10. Chicco D, Toetsch N, Jurman G (febrero de 2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .  
  11. Tharwat A. (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
  12. ^ Brabec, enero; Komárek, Tomaš; Franco, Vojtěch; Machlica, Lukáš (2020). "Sobre la evaluación de modelos bajo un desequilibrio de clases no constante". Congreso Internacional de Ciencias Computacionales . Saltador. págs. 74 a 87. arXiv : 2001.05571 . doi : 10.1007/978-3-030-50423-6_6 . 
  13. Siblini, W.; Fréry, J.; He-Guelton, L.; Oblé, F.; Wang, YQ (2020). "Domine sus métricas con calibración". En M. Berthold; A. Feelders; G. Krempl (eds.). Avances en análisis inteligente de datos XVIII . Springer. pp. 457–469 . arXiv : 1909.02827 . doi : 10.1007/978-3-030-44584-3_36 . 
  14. Beitzel., Steven M. (2006). Sobre la comprensión y clasificación de consultas web (tesis doctoral). IIT. CiteSeerX 10.1.1.127.634 . 
  15. X. Li; Y.-Y. Wang; A. Acero (julio de 2008). Aprendizaje de la intención de consulta a partir de grafos de clics regularizados . Actas de la 31.ª Conferencia SIGIR . pág. 339. doi : 10.1145/1390334.1390393 . ISBN  9781605581644. S2CID 8482989 . 
  16. Véase, por ejemplo, la evaluación de la.
  17. Powers, David M. W (2015). "Lo que la medida F no mide". arXiv : 1503.06410 [ cs.IR ].
  18. Derczynski, L. (2016). Complementariedad, puntuación F y evaluación del PLN . Actas de la Conferencia Internacional sobre Recursos y Evaluación del Lenguaje .
  19. Manning, Christopher (1 de abril de 2009). Introducción a la recuperación de información (PDF) . Ejercicio 8.7: Cambridge University Press. pág. 200. Consultado el 18 de julio de 2022 . {{cite book}}: CS1 mantenimiento: ubicación ( enlace )
  20. "¿Cuál es el valor base de la puntuación F1 para un clasificador binario?" .
  21. Zachary Chase Lipton; Elkan, Charles; Narayanaswamy, Balakrishnan (2014). "Umbralización de clasificadores para maximizar la puntuación F1". arXiv : 1402.1892 [ stat.ML ].
  22. Hand, David (mayo de 2018). "Una nota sobre el uso de la medida F para evaluar algoritmos de vinculación de registros - Dimensions" . app.dimensions.ai . 28 (3): 539– 547. doi : 10.1007/s11222-017-9746-6 . hdl : 10044/1/46235 . S2CID 38782128. Recuperado el 8 de diciembre de 2018 . 
  23. Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (6) 6. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .  
  24. Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la puntuación F a la curva ROC, la información, la marcación y la correlación". Journal of Machine Learning Technologies . 2 (1): 37– 63. hdl : 2328/27165 .
  25. Sitarz, Mikolaj (2023). "Extending F1 Metric, Probabilistic Approach". Advances in Artificial Intelligence and Machine Learning . 03 (2): 1025– 1038. arXiv : 2210.11997 . doi : 10.54364/AAIML.2023.1161 .
  26. Ferrer L (febrero de 2025). "No hay necesidad de sustitutos ad hoc: el costo esperado es una métrica de clasificación de propósito general basada en principios" . Transactions on Machine Learning Research .
  27. Dyrland K, Lundervold AS, Porta Mana P (mayo de 2022). "¿La evaluación resiste la evaluación? Un enfoque de primeros principios para la evaluación de clasificadores". arXiv : 2302.12006 [ cs.LG ].
  28. Tharwat A (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
  29. Opitz, Juri (2024). "Una mirada más cercana a las métricas de evaluación de clasificación y una reflexión crítica sobre la práctica de evaluación común" . Transactions of the Association for Computational Linguistics . 12 : 820–836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
  30. J. Opitz; S. Burst (2019). "Macro F1 y Macro F1". arXiv : 1911.03347 [ stat.ML ].
  31. Brownlee, Jason (7 de septiembre de 2021). "4.3 – Puntuación F1 micro". Clasificación desequilibrada con Python: mejores métricas, equilibrio de clases sesgadas, aprendizaje sensible al costo . Machine Learning Mastery. pág. 40. ISBN  979-8468452240.
Obtenido de " https://en.wikipedia.org/w/index.php?title=F-score&oldid=1344848713 "