
En el análisis estadístico de sistemas de clasificación binaria y recuperación de información , la puntuación F o medida F es una medida del rendimiento predictivo. Se calcula a partir de la precisión y la exhaustividad de la prueba, donde la precisión es el número de resultados positivos verdaderos dividido por el número total de muestras predichas como positivas, incluidas aquellas no identificadas correctamente, y la exhaustividad es el número de resultados positivos verdaderos dividido por el número total de muestras que deberían haberse identificado como positivas. La precisión también se conoce como valor predictivo positivo , y la exhaustividad como sensibilidad en la clasificación binaria diagnóstica.
La puntuación F1 es la media armónica de la precisión y la exhaustividad. Por lo tanto, representa simétricamente tanto la precisión como la exhaustividad en una sola métrica. La más genéricaLa puntuación aplica ponderaciones adicionales, valorando más la precisión o la exhaustividad que la otra.
El valor máximo posible de una puntuación F es 1,0, lo que indica una precisión y exhaustividad perfectas, y el valor mínimo posible es 0, si la precisión o la exhaustividad son cero.
Etimología
Se cree que el nombre de medida F proviene de una función F diferente que aparece en el libro de Van Rijsbergen, cuando se presentó en la Cuarta Conferencia sobre Comprensión de Mensajes (MUC-4, 1992). [ 1 ]
Definición
La medida F tradicional o puntuación F equilibrada ( puntuación F1 ) es la media armónica de precisión y exhaustividad: [ 2 ]
Con precisión = TP / (TP + FP) y exhaustividad = TP / (TP + FN) , se deduce que el numerador de F 1 es la suma de sus numeradores y el denominador de F 1 es la suma de sus denominadores.
Si FP=FN
o
Por lo tanto, F1 = precisión = exhaustividad
Si TP=FP=FN
o
Para verlo como una media armónica, tenga en cuenta que.
Puntuación F β
Una puntuación F más general,, que utiliza un factor real positivo, dóndese elige de tal manera que se considere el recuerdoLos tiempos son tan importantes como la precisión, es:
Para verlo como una media armónica ponderada, tenga en cuenta que.
En términos de errores de tipo I y tipo II, esto se convierte en:
Dos valores comúnmente utilizados parason 2, que da mayor importancia a la exhaustividad que a la precisión, y 1/2, que da menor importancia a la exhaustividad que a la precisión.
La medida F se derivó de manera que"mide la efectividad de la recuperación con respecto a un usuario que adjuntaveces tanta importancia para recordar como para la precisión". [ 3 ] Se basa en la medida de efectividad de Van Rijsbergen
Su relación es:dónde
Pruebas de diagnóstico
Esto está relacionado con el campo de la clasificación binaria , donde la exhaustividad a menudo se denomina "sensibilidad".
- ↑ el número de casos positivos reales en los datos
- ↑ Un resultado de prueba que indica correctamente la presencia de una condición o característica.
- ↑ Error de tipo II: Un resultado de prueba que indica erróneamente que una condición o atributo particular está ausente.
- ↑ el número de casos negativos reales en los datos
- ↑ Un resultado de prueba que indica correctamente la ausencia de una condición o característica.
- ↑ Error de tipo I: Un resultado de prueba que indica erróneamente que una condición o atributo particular está presente.


Dependencia de la puntuación F del desequilibrio de clases
Curva de precisión-exhaustividad y, por lo tanto, laLa puntuación depende explícitamente de la proporción. de casos de prueba positivos a negativos. [ 12 ] Esto significa que la comparación de la puntuación F entre diferentes problemas con diferentes proporciones de clases es problemática. Una forma de abordar este problema (véase, por ejemplo, Siblini et al., 2020 [ 13 ] ) es utilizar una proporción de clases estándar.al hacer tales comparaciones.
Aplicaciones
La puntuación F se utiliza frecuentemente en el campo de la recuperación de información para medir el rendimiento de la búsqueda , la clasificación de documentos y la clasificación de consultas . [ 14 ] Es particularmente relevante en aplicaciones que se ocupan principalmente de la clase positiva y donde esta es poco frecuente en relación con la clase negativa.
Los trabajos anteriores se centraron principalmente en la puntuación F1 , pero con la proliferación de motores de búsqueda a gran escala, los objetivos de rendimiento cambiaron para poner más énfasis en la precisión o la exhaustividad [ 15 ] y asíSe observa en una amplia aplicación.
La puntuación F también se utiliza en el aprendizaje automático . [ 16 ] Sin embargo, las medidas F no tienen en cuenta los verdaderos negativos, por lo que pueden preferirse medidas como el coeficiente de correlación de Matthews , la información o el coeficiente kappa de Cohen para evaluar el rendimiento de un clasificador binario. [ 17 ]
La puntuación F se ha utilizado ampliamente en la literatura sobre procesamiento del lenguaje natural, [ 18 ] como en la evaluación del reconocimiento de entidades nombradas y la segmentación de palabras .
Propiedades
La puntuación F1 es el coeficiente de Dice del conjunto de elementos recuperados y el conjunto de elementos relevantes. [ 19 ]
- La puntuación F1 de un clasificador que siempre predice la clase positiva converge a 1 a medida que aumenta la probabilidad de la clase positiva.
- La puntuación F1 de un clasificador que siempre predice la clase positiva es igual a 2 * proporción_de_clase_positiva / (1 + proporción_de_clase_positiva), ya que la exhaustividad es 1 y la precisión es igual a la proporción de la clase positiva. [ 20 ]
- Si el modelo de puntuación no es informativo (no puede distinguir entre la clase positiva y la negativa), entonces el umbral óptimo es 0, de modo que siempre se predice la clase positiva.
- La puntuación F1 es cóncava en la tasa de verdaderos positivos. [ 21 ]
Crítica
David Hand y otros critican el uso generalizado de la puntuación F1, ya que otorga la misma importancia a la precisión y la exhaustividad. En la práctica, los distintos tipos de clasificaciones erróneas conllevan distintos costes. En otras palabras, la importancia relativa de la precisión y la exhaustividad es un aspecto del problema. [ 22 ]
Según Davide Chicco y Giuseppe Jurman, la puntuación F1 es menos veraz e informativa que el coeficiente de correlación de Matthews (MCC) en la clasificación de evaluación binaria. [ 23 ]
David MW Powers ha señalado que F1 ignora los verdaderos negativos y, por lo tanto, resulta engañoso para clases desequilibradas, mientras que las medidas kappa y de correlación son simétricas y evalúan ambas direcciones de predictibilidad: el clasificador predice la clase verdadera y la clase verdadera predice la predicción del clasificador, proponiendo medidas multiclase separadas, Informedness y Markedness, para las dos direcciones, y observando que su media geométrica es la correlación. [ 24 ]
Otra crítica a F1 radica en su falta de simetría. Esto significa que su valor puede cambiar al modificarse el etiquetado de los datos: las muestras "positivas" se denominan "negativas" y viceversa. Esta crítica se aborda con la definición de la métrica P4 , que a veces se presenta como una extensión simétrica de F1 . [ 25 ]
Finalmente, Ferrer [ 26 ] y Dyrland et al. [ 27 ] argumentan que el costo esperado (o su contraparte, la utilidad esperada) es la única métrica fundamentada para evaluar las decisiones de clasificación, con diversas ventajas sobre la puntuación F y el MCC. Ambos trabajos demuestran que la puntuación F puede llevar a conclusiones erróneas sobre la calidad absoluta y relativa de los sistemas.
Diferencia con respecto al índice de Fowlkes-Mallows
Mientras que la medida F es la media armónica de la exhaustividad y la precisión, el índice de Fowlkes-Mallows es su media geométrica . [ 28 ]
Extensión a la clasificación multiclase
La puntuación F también se utiliza para evaluar problemas de clasificación con más de dos clases ( clasificación multiclase ). Un método común consiste en promediar la puntuación F de cada clase, con el objetivo de obtener una medición equilibrada del rendimiento. [ 29 ]
Macro F1
La puntuación F1 macro es una puntuación F1 promediada a nivel macro que busca una medición de rendimiento equilibrada. Para calcular la puntuación F1 macro, se han utilizado dos fórmulas de promedio diferentes: la puntuación F1 de las medias (aritméticas) de precisión y exhaustividad por clase o la media aritmética de las puntuaciones F1 por clase, donde esta última presenta propiedades más deseables. [ 30 ]
Micro F1
Micro F1 es la media armónica de la microprecisión y la microexhaustividad . En la clasificación multiclase de una sola etiqueta, la microprecisión es igual a la microexhaustividad, por lo que micro F1 es igual a ambas. Sin embargo, contrariamente a una idea errónea común, micro F1 generalmente no es igual a la exactitud , ya que la exactitud tiene en cuenta los verdaderos negativos, mientras que micro F1 no. [ 31 ]
Véase también
Referencias
- ↑ Sasaki, Y. (2007). "La verdad de la medida F" (PDF) . Teach Tutor Mater . Vol. 1, n.º 5, págs. 1-5 .
- ↑ Aziz Taha, Abdel (2015). "Métricas para evaluar la segmentación de imágenes médicas 3D: análisis, selección y herramienta" . BMC Medical Imaging . 15 (29) 29: 1– 28. doi : 10.1186/s12880-015-0068- x . PMC 4533825. PMID 26263899 .
- ^ Van Rijsbergen, CJ (1979). Recuperación de información (2ª ed.). Butterworth-Heinemann.
- ↑ Fawcett, Tom (2006). "Una introducción al análisis ROC" (PDF) . Pattern Recognition Letters . 27 (8): 861– 874. doi : 10.1016/j.patrec.2005.10.010 . S2CID 2027090 .
- ↑ Provost, Foster; Tom Fawcett (1 de agosto de 2013). "Ciencia de datos para los negocios: lo que necesita saber sobre minería de datos y pensamiento analítico de datos" . O'Reilly Media, Inc.
- ↑ Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la medida F a la curva ROC, la información, la marcación y la correlación" . Journal of Machine Learning Technologies . 2 (1): 37– 63.
- ↑ Ting, Kai Ming (2011). Sammut, Claude; Webb, Geoffrey I. (eds.). Enciclopedia del aprendizaje automático . Springer. doi : 10.1007/978-0-387-30164-8 . ISBN 978-0-387-30164-8.
- ↑ Brooks, Harold; Brown, Barb; Ebert, Beth; Ferro, Chris; Jolliffe, Ian; Koh, Tieh-Yong; Roebber, Paul; Stephenson, David (26 de enero de 2015). "Grupo de trabajo conjunto WWRP/WGNE sobre investigación de verificación de pronósticos" . Colaboración para la investigación meteorológica y climática australiana . Organización Meteorológica Mundial . Consultado el 17 de julio de 2019 .
- ↑ Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (1): 6-1–6-13. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .
- ↑ Chicco D, Toetsch N, Jurman G (febrero de 2021). "El coeficiente de correlación de Matthews (MCC) es más fiable que la precisión equilibrada, la información del corredor de apuestas y la marcación en la evaluación de matrices de confusión de dos clases" . BioData Mining . 14 (13): 13. doi : 10.1186/s13040-021-00244-z . PMC 7863449. PMID 33541410 .
- ↑ Tharwat A. (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
- ^ Brabec, enero; Komárek, Tomaš; Franco, Vojtěch; Machlica, Lukáš (2020). "Sobre la evaluación de modelos bajo un desequilibrio de clases no constante". Congreso Internacional de Ciencias Computacionales . Saltador. págs. 74 a 87. arXiv : 2001.05571 . doi : 10.1007/978-3-030-50423-6_6 .
- ↑ Siblini, W.; Fréry, J.; He-Guelton, L.; Oblé, F.; Wang, YQ (2020). "Domine sus métricas con calibración". En M. Berthold; A. Feelders; G. Krempl (eds.). Avances en análisis inteligente de datos XVIII . Springer. pp. 457–469 . arXiv : 1909.02827 . doi : 10.1007/978-3-030-44584-3_36 .
- ↑ Beitzel., Steven M. (2006). Sobre la comprensión y clasificación de consultas web (tesis doctoral). IIT. CiteSeerX 10.1.1.127.634 .
- ↑ X. Li; Y.-Y. Wang; A. Acero (julio de 2008). Aprendizaje de la intención de consulta a partir de grafos de clics regularizados . Actas de la 31.ª Conferencia SIGIR . pág. 339. doi : 10.1145/1390334.1390393 . ISBN 9781605581644. S2CID 8482989 .
- ↑ Véase, por ejemplo, la evaluación de la.
- ↑ Powers, David M. W (2015). "Lo que la medida F no mide". arXiv : 1503.06410 [ cs.IR ].
- ↑ Derczynski, L. (2016). Complementariedad, puntuación F y evaluación del PLN . Actas de la Conferencia Internacional sobre Recursos y Evaluación del Lenguaje .
- ↑ Manning, Christopher (1 de abril de 2009). Introducción a la recuperación de información (PDF) . Ejercicio 8.7: Cambridge University Press. pág. 200. Consultado el 18 de julio de 2022 .
{{cite book}}: CS1 mantenimiento: ubicación ( enlace ) - ↑ "¿Cuál es el valor base de la puntuación F1 para un clasificador binario?" .
- ↑ Zachary Chase Lipton; Elkan, Charles; Narayanaswamy, Balakrishnan (2014). "Umbralización de clasificadores para maximizar la puntuación F1". arXiv : 1402.1892 [ stat.ML ].
- ↑ Hand, David (mayo de 2018). "Una nota sobre el uso de la medida F para evaluar algoritmos de vinculación de registros - Dimensions" . app.dimensions.ai . 28 (3): 539– 547. doi : 10.1007/s11222-017-9746-6 . hdl : 10044/1/46235 . S2CID 38782128. Recuperado el 8 de diciembre de 2018 .
- ↑ Chicco D, Jurman G (enero de 2020). "Las ventajas del coeficiente de correlación de Matthews (MCC) sobre la puntuación F1 y la precisión en la evaluación de la clasificación binaria" . BMC Genomics . 21 (6) 6. doi : 10.1186/s12864-019-6413-7 . PMC 6941312. PMID 31898477 .
- ↑ Powers, David MW (2011). "Evaluación: De la precisión, la exhaustividad y la puntuación F a la curva ROC, la información, la marcación y la correlación". Journal of Machine Learning Technologies . 2 (1): 37– 63. hdl : 2328/27165 .
- ↑ Sitarz, Mikolaj (2023). "Extending F1 Metric, Probabilistic Approach". Advances in Artificial Intelligence and Machine Learning . 03 (2): 1025– 1038. arXiv : 2210.11997 . doi : 10.54364/AAIML.2023.1161 .
- ↑ Ferrer L (febrero de 2025). "No hay necesidad de sustitutos ad hoc: el costo esperado es una métrica de clasificación de propósito general basada en principios" . Transactions on Machine Learning Research .
- ↑ Dyrland K, Lundervold AS, Porta Mana P (mayo de 2022). "¿La evaluación resiste la evaluación? Un enfoque de primeros principios para la evaluación de clasificadores". arXiv : 2302.12006 [ cs.LG ].
- ↑ Tharwat A (agosto de 2018). "Métodos de evaluación de clasificación" . Applied Computing and Informatics . 17 : 168–192 . doi : 10.1016/j.aci.2018.08.003 .
- ↑ Opitz, Juri (2024). "Una mirada más cercana a las métricas de evaluación de clasificación y una reflexión crítica sobre la práctica de evaluación común" . Transactions of the Association for Computational Linguistics . 12 : 820–836 . arXiv : 2404.16958 . doi : 10.1162/tacl_a_00675 .
- ↑ J. Opitz; S. Burst (2019). "Macro F1 y Macro F1". arXiv : 1911.03347 [ stat.ML ].
- ↑ Brownlee, Jason (7 de septiembre de 2021). "4.3 – Puntuación F1 micro". Clasificación desequilibrada con Python: mejores métricas, equilibrio de clases sesgadas, aprendizaje sensible al costo . Machine Learning Mastery. pág. 40. ISBN 979-8468452240.
- Procesamiento estadístico del lenguaje natural
- Evaluación de la traducción automática
- Razones estadísticas
- Estadísticas descriptivas para tablas de contingencia
- Criterios de agrupamiento