Articulo de referencia

Medidas de evaluación (recuperación de información)

Las medidas de evaluación de un sistema de recuperación de información (RI) miden la eficacia con la que un índice, motor de búsqueda o base de datos devuelve resultados de un c...

Las medidas de evaluación de un sistema de recuperación de información (RI) miden la eficacia con la que un índice, motor de búsqueda o base de datos devuelve resultados de un conjunto de recursos que satisfacen la consulta del usuario. Por lo tanto, son fundamentales para el éxito de los sistemas de información y las plataformas digitales.

El factor más importante para determinar la efectividad de un sistema para los usuarios es la relevancia general de los resultados recuperados en respuesta a una consulta. [ 1 ] El éxito de un sistema de recuperación de información puede juzgarse mediante una variedad de criterios que incluyen relevancia, velocidad, satisfacción del usuario, usabilidad, eficiencia y confiabilidad. [ 2 ] Las medidas de evaluación pueden categorizarse de varias maneras, incluyendo fuera de línea o en línea, basadas en el usuario o en el sistema, e incluyen métodos como el comportamiento observado del usuario, colecciones de prueba, precisión y exhaustividad, y puntuaciones de conjuntos de prueba de referencia preparados.

La evaluación de un sistema de recuperación de información también debe incluir una validación de las medidas utilizadas, es decir, una evaluación de qué tan bien miden lo que se pretende medir y qué tan bien se ajusta el sistema a su caso de uso previsto. [ 3 ] Las medidas se utilizan generalmente en dos entornos: experimentación en línea, que evalúa las interacciones de los usuarios con el sistema de búsqueda, y evaluación fuera de línea, que mide la efectividad de un sistema de recuperación de información en una colección estática fuera de línea.

Fondo

Los métodos de indexación y clasificación para facilitar la recuperación de información tienen una larga historia que se remonta a las primeras bibliotecas y colecciones. La evaluación sistemática de su eficacia comenzó en serio en la década de 1950 con la rápida expansión de la producción de investigación en los ámbitos militar, gubernamental y educativo, y la introducción de catálogos informatizados. En ese momento, existían varios sistemas de indexación, clasificación y catalogación en funcionamiento, cuya producción era costosa, y no estaba claro cuál era el más eficaz. [ 4 ]

Cyril Cleverdon , bibliotecario del Colegio de Aeronáutica de Cranfield, Inglaterra, inició una serie de experimentos sobre métodos de indexación y recuperación de documentos impresos, conocidos como el paradigma de Cranfield o pruebas de Cranfield, que establecieron el estándar para las medidas de evaluación de los sistemas de recuperación de información durante muchos años. [ 4 ] Cleverdon desarrolló una prueba denominada «búsqueda de elementos conocidos» para comprobar si un sistema de recuperación de información devolvía los documentos que se sabía que eran relevantes o correctos para una búsqueda determinada. Los experimentos de Cleverdon establecieron una serie de aspectos clave necesarios para la evaluación de los sistemas de recuperación de información: una colección de prueba, un conjunto de consultas y un conjunto de elementos relevantes predeterminados que, combinados, determinarían la precisión y la exhaustividad.

El enfoque de Cleverdon sentó las bases para la exitosa serie de conferencias sobre recuperación de texto que comenzó en 1992.

Aplicaciones

La evaluación de los sistemas de recuperación de información (RI) es fundamental para el éxito de cualquier motor de búsqueda, incluyendo la búsqueda en internet, la búsqueda en sitios web, las bases de datos y los catálogos de bibliotecas. Las medidas de evaluación se utilizan en estudios sobre el comportamiento de la información , pruebas de usabilidad , costos empresariales y evaluaciones de eficiencia. Medir la efectividad de los sistemas de RI ha sido el enfoque principal de la investigación en RI, basándose en colecciones de prueba combinadas con medidas de evaluación. [ 5 ] Se han establecido varias conferencias académicas que se centran específicamente en medidas de evaluación, incluyendo la Conferencia de Recuperación de Texto (TREC), la Conferencia y Laboratorios del Foro de Evaluación (CLEF) y NTCIR.

Medidas en línea

Las métricas online generalmente se crean a partir de los registros de búsqueda. Estas métricas se utilizan a menudo para determinar el éxito de una prueba A/B .

Tasa de abandono de sesión

La tasa de abandono de sesión es la proporción de sesiones de búsqueda que no resultan en un clic.

Tasa de clics

La tasa de clics (CTR) es la proporción de usuarios que hacen clic en un enlace específico con respecto al número total de usuarios que ven una página, correo electrónico o anuncio. Se utiliza comúnmente para medir el éxito de una campaña publicitaria en línea para un sitio web en particular, así como la efectividad de las campañas de correo electrónico. [ 6 ]

Tasa de éxito de la sesión

La tasa de éxito de sesión mide la proporción de sesiones de usuario que resultan en un éxito. La definición de "éxito" suele depender del contexto, pero en el caso de las búsquedas, un resultado exitoso se suele medir utilizando el tiempo de permanencia como factor principal, junto con la interacción secundaria del usuario. Por ejemplo, se considera un resultado exitoso que el usuario copie la URL del resultado, al igual que copiar y pegar desde el fragmento.

Tasa de resultados cero

La tasa de resultados cero ( ZRR , por sus siglas en inglés) es la proporción de páginas de resultados de búsqueda (SERP, por sus siglas en inglés) que no arrojan ningún resultado. Esta métrica indica un problema de recuperación de información o que la información buscada no se encuentra en el índice.

Métricas fuera de línea

Las métricas offline generalmente se crean a partir de sesiones de evaluación de relevancia donde los jueces califican la calidad de los resultados de búsqueda. Se pueden usar escalas binarias (relevante/no relevante) y multinivel (por ejemplo, relevancia de 0 a 5) para calificar cada documento devuelto en respuesta a una consulta. En la práctica, las consultas pueden estar mal planteadas y puede haber diferentes matices de relevancia. Por ejemplo, existe ambigüedad en la consulta "mars": el juez no sabe si el usuario está buscando el planeta Marte , la barra de chocolate Mars , el cantante Bruno Mars o la deidad romana Marte .

Precisión

La precisión es la fracción de los documentos recuperados que son relevantes para la necesidad de información del usuario.

precisión=|{documentos pertinentes}{documentos recuperados}||{documentos recuperados}|{\displaystyle {\mbox{precisión}}={\frac {|\{{\mbox{documentos relevantes}}\}\cap \{{\mbox{documentos recuperados}}\}|}{|\{{\mbox{documentos recuperados}}\}|}}}

En la clasificación binaria , la precisión es análoga al valor predictivo positivo . La precisión tiene en cuenta todos los documentos recuperados. También se puede evaluar considerando solo los mejores resultados devueltos por el sistema usando Precision@k .

Cabe señalar que el significado y el uso de "precisión" en el campo de la recuperación de información difieren de la definición de exactitud y precisión en otras ramas de la ciencia y la estadística .

Recordar

La tasa de recuperación es la fracción de documentos relevantes para la consulta que se recuperan correctamente.

recordar=|{documentos pertinentes}{documentos recuperados}||{documentos pertinentes}|{\displaystyle {\mbox{recall}}={\frac {|\{{\mbox{documentos relevantes}}\}\cap \{{\mbox{documentos recuperados}}\}|}{|\{{\mbox{documentos relevantes}}\}|}}}

En la clasificación binaria, la exhaustividad se suele denominar sensibilidad . Por lo tanto, puede considerarse como la probabilidad de que la consulta recupere un documento relevante .

Es muy sencillo lograr una exhaustividad del 100% devolviendo todos los documentos en respuesta a cualquier consulta. Por lo tanto, la exhaustividad por sí sola no es suficiente, sino que también es necesario medir la cantidad de documentos irrelevantes, por ejemplo, calculando la precisión.

Polvillo radiactivo

La proporción de documentos no relevantes que se recuperan, respecto del total de documentos no relevantes disponibles:

polvillo radiactivo=|{documentos no relevantes}{documentos recuperados}||{documentos no relevantes}|{\displaystyle {\mbox{fall-out}}={\frac {|\{{\mbox{documentos no relevantes}}\}\cap \{{\mbox{documentos recuperados}}\}|}{|\{{\mbox{documentos no relevantes}}\}|}}}

En la clasificación binaria, la caída es lo opuesto a la especificidad y es igual a(1especificidad){\displaystyle (1-{\mbox{especificidad}})}. Puede considerarse como la probabilidad de que la consulta recupere un documento irrelevante .

Es trivial lograr un resultado del 0% devolviendo cero documentos en respuesta a cualquier consulta.

Puntuación F / Medida F

La media armónica ponderada de precisión y exhaustividad, la medida F tradicional o puntuación F equilibrada, es:

F=2pagrmidoisionortermidoall(pagrmidoisionorte+rmidoall){\displaystyle F={\frac {2\cdot \mathrm {precisión} \cdot \mathrm {recall} }{(\mathrm {precisión} +\mathrm {recall} )}}}

Esto también se conoce como elF1{\displaystyle F_{1}}medida, porque la exhaustividad y la precisión tienen el mismo peso.

La fórmula general para números reales no negativosβ{\displaystyle \beta }es:

Fβ=(1+β2)(pagrmidoisionortermidoall)(β2pagrmidoisionorte+rmidoall){\displaystyle F_{\beta }={\frac {(1+\beta ^{2})\cdot (\mathrm {precision} \cdot \mathrm {recall} )}{(\beta ^{2}\cdot \mathrm {precision} +\mathrm {recall} )}}\,}

Otras dos medidas F de uso común son laF2{\displaystyle F_{2}}medida, que pondera el recuerdo el doble que la precisión, y laF0,5{\displaystyle F_{0.5}}medida que otorga a la precisión el doble de peso que a la exhaustividad.

La medida F fue derivada por van Rijsbergen (1979) de modo queFβ{\displaystyle F_{\beta }}"mide la efectividad de la recuperación con respecto a un usuario que adjuntaβ{\displaystyle \beta }"Tanta importancia para recordar como para la precisión". Se basa en la medida de efectividad de van Rijsbergen.mi=11αPAG+1αR{\displaystyle E=1-{\frac {1}{{\frac {\alpha }{P}}+{\frac {1-\alpha }{R}}}}}Su relación es:

Fβ=1mi{\displaystyle F_{\beta }=1-E}dóndeα=11+β2{\displaystyle \alpha ={\frac {1}{1+\beta ^{2}}}}

Dado que la medida F combina información tanto de la precisión como de la exhaustividad, es una forma de representar el rendimiento general sin presentar dos números.

Precisión media

La precisión y la exhaustividad son métricas de valor único basadas en la lista completa de documentos devueltos por el sistema. Para sistemas que devuelven una secuencia clasificada de documentos, es deseable considerar también el orden en que se presentan los documentos devueltos. Al calcular la precisión y la exhaustividad en cada posición de la secuencia clasificada de documentos, se puede trazar una curva de precisión-exhaustividad, trazando la precisiónpag(r){\displaystyle p(r)}en función de la capacidad de recordarr{\displaystyle r}. La precisión promedio calcula el valor promedio depag(r){\displaystyle p(r)}durante el intervalo desder=0{\displaystyle r=0}ar=1{\displaystyle r=1}: [ 7 ]

PromedioP=01pag(r)dr{\displaystyle \operatorname {AveP} =\int _{0}^{1}p(r)dr}

Esa es el área bajo la curva de precisión-exhaustividad. En la práctica, esta integral se reemplaza por una suma finita sobre cada posición en la secuencia clasificada de documentos:

PromedioP=k=1nortePAG(k)Δr(k){\displaystyle \operatorname {AveP} =\sum _{k=1}^{n}P(k)\Delta r(k)}

dóndek{\displaystyle k}es el rango en la secuencia de documentos recuperados,norte{\displaystyle n}es el número de documentos recuperados,PAG(k){\displaystyle P(k)}es la precisión en el punto de cortek{\displaystyle k}en la lista, yΔr(k){\displaystyle \Delta r(k)}es el cambio en el recuerdo de los elementosk1{\displaystyle k-1}ak{\displaystyle k}. [ 7 ]

Esta suma finita es equivalente a:

PromedioP=k=1nortePAG(k)×rel(k)número total de documentos relevantes{\displaystyle \operatorname {AveP} ={\frac {\sum _{k=1}^{n}P(k)\times \operatorname {rel} (k)}{\mbox{total number of relevant documents}}}\!}

dónderel(k){\displaystyle \operatorname {rel} (k)}es una función indicadora que es igual a 1 si el elemento en el rangok{\displaystyle k}es un documento relevante, cero en caso contrario. [ 8 ] Tenga en cuenta que el promedio se calcula sobre los documentos relevantes en los k documentos recuperados principales y los documentos relevantes no recuperados obtienen una puntuación de precisión de cero.

Algunos autores optan por interpolar elpag(r){\displaystyle p(r)}función para reducir el impacto de las "oscilaciones" en la curva. [ 9 ] [ 10 ] Por ejemplo, el desafío PASCAL Visual Object Classes (un punto de referencia para la detección de objetos en visión artificial) hasta 2010 [ 11 ] calculaba la precisión promedio promediando la precisión sobre un conjunto de niveles de recuperación espaciados uniformemente {0, 0.1, 0.2, ... 1.0}: [ 9 ] [ 10 ]

PromedioP=111r{0,0.1,,1.0}paginterpretación(r){\displaystyle \operatorname {AveP} ={\frac {1}{11}}\sum _{r\in \{0,0.1,\ldots ,1.0\}}p_{\operatorname {interp} }(r)}

dóndepaginterpretación(r){\displaystyle p_{\operatorname {interp} }(r)}es una precisión interpolada que toma la precisión máxima sobre todos los valores de recuperación mayores quer{\displaystyle r}:

paginterpretación(r)=máximor~:r~rpag(r~){\displaystyle p_{\operatorname {interp} }(r)=\operatorname {max} _{{\tilde {r}}:{\tilde {r}}\geq r}p({\tilde {r}})}.

Una alternativa es derivar una analíticapag(r){\displaystyle p(r)}La función se obtiene asumiendo una distribución paramétrica particular para los valores de decisión subyacentes. Por ejemplo, una curva de precisión-exhaustividad binormal se puede obtener asumiendo que los valores de decisión en ambas clases siguen una distribución gaussiana. [ 12 ]

El valor mínimo de Promedio de Promedio (AveP) alcanzable para una tarea de clasificación determinada viene dado por:

1nortepagosk=1nortepagoskk+nortenortemigramo{\displaystyle {\frac {1}{n_{pos}}}\sum _{k=1}^{n_{pos}}{\frac {k}{k+n_{neg}}}}[ 13 ]

Precisión en k

Para la recuperación de información moderna (a escala web), la exhaustividad ya no es una métrica significativa, ya que muchas consultas tienen miles de documentos relevantes y pocos usuarios estarán interesados ​​en leerlos todos. La precisión en k documentos (P@k) sigue siendo una métrica útil (por ejemplo, P@10 o "Precisión en 10" corresponde al número de resultados relevantes entre los 10 primeros documentos recuperados), pero no tiene en cuenta las posiciones de los documentos relevantes entre los k primeros. [ 14 ] Otra deficiencia es que en una consulta con menos resultados relevantes que k, incluso un sistema perfecto tendrá una puntuación menor que 1. [ 15 ] Es más fácil puntuar manualmente ya que solo es necesario examinar los k primeros resultados para determinar si son relevantes o no.

Precisión R

La precisión R requiere conocer todos los documentos que son relevantes para una consulta. El número de documentos relevantes,R{\displaystyle R}, se utiliza como umbral para el cálculo, y esto varía de una consulta a otra. Por ejemplo, si hay 15 documentos relevantes para "rojo" en un corpus (R=15), la precisión R para "rojo" examina los 15 documentos principales devueltos, cuenta el número de los que son relevantes,r{\displaystyle r}y lo convierte en una fracción de relevancia:r/R=r/15{\displaystyle r/R=r/15}. [ 16 ]

Tenga en cuenta que la precisión R es equivalente a la precisión en elR{\displaystyle R}-ésima posición (P@R{\displaystyle R}) y la retirada en elR{\displaystyle R}-ésima posición. [ 15 ]

Empíricamente, esta medida suele estar altamente correlacionada con la precisión media promedio. [ 15 ]

Precisión media promedio

La precisión media promedio (MAP, por sus siglas en inglés) para un conjunto de consultas es la media de las puntuaciones de precisión promedio para cada consulta.

MAPA=q=1QAvmiPAG(q)Q{\displaystyle \operatorname {MAP} ={\frac {\sum _{q=1}^{Q}\operatorname {AveP(q)} }{Q}}\!}

donde Q es el número de consultas.

Ganancia acumulada descontada

DCG utiliza una escala de relevancia graduada de los documentos del conjunto de resultados para evaluar la utilidad, o ganancia, de un documento en función de su posición en la lista de resultados. La premisa de DCG es que los documentos altamente relevantes que aparecen más abajo en una lista de resultados de búsqueda deben ser penalizados, ya que el valor de relevancia graduada se reduce logarítmicamente de forma proporcional a la posición del resultado. [ 17 ]

El DCG se acumuló en una posición de rango particularpag{\displaystyle p}se define como:

DdoGRAMOpag=i=1pagrmiliregistro2(i+1).{\displaystyle \mathrm {DCG_{p}} =\sum _{i=1}^{p}{\frac {rel_{i}}{\log _{2}(i+1)}}.}

Dado que el conjunto de resultados puede variar en tamaño entre diferentes consultas o sistemas, para comparar el rendimiento la versión normalizada de DCG utiliza un DCG ideal. Para ello, ordena los documentos de una lista de resultados por relevancia, produciendo un DCG ideal en la posición p (IDdoGRAMOpag{\displaystyle IDCG_{p}}), que normaliza la puntuación:

norteDdoGRAMOpag=DdoGRAMOpagIDdoGRAMOpag.{\displaystyle \mathrm {nDCG_{p}} ={\frac {DCG_{p}}{IDCG{p}}}.}

Los valores nDCG para todas las consultas se pueden promediar para obtener una medida del rendimiento promedio de un algoritmo de clasificación. Tenga en cuenta que en un algoritmo de clasificación perfecto, elDdoGRAMOpag{\displaystyle DCG_{p}}será lo mismo que elIDdoGRAMOpag{\displaystyle IDCG_{p}}produciendo un nDCG de 1,0. Todos los cálculos de nDCG son entonces valores relativos en el intervalo de 0,0 a 1,0 y, por lo tanto, son comparables entre consultas cruzadas. [ 18 ]

Otras medidas

Visualización

Las visualizaciones del rendimiento de la recuperación de información incluyen:

Medidas de no relevancia

Consultas por tiempo

Medir la cantidad de consultas realizadas en el sistema de búsqueda por (mes/día/hora/minuto/segundo) permite monitorizar su utilización. Puede usarse para diagnósticos, para detectar picos inesperados en las consultas, o simplemente como referencia para comparar con otras métricas, como la latencia de las consultas. Por ejemplo, un pico en el tráfico de consultas puede explicar un pico en la latencia de las mismas.

Véase también

Referencias

  1. Carterette, Ben; Voorhees, Ellen M. (2011), "Overview of Information Retrieval Evaluation" , en Lupu, Mihai; Mayer, Katja; Tait, John; Trippe, Anthony J. (eds.), Current Challenges in Patent Information Retrieval , Berlín, Heidelberg: Springer, pp. 69–85 , doi : 10.1007/978-3-642-19231-9_3 , ISBN  978-3-642-19231-9, consultado el 9 de diciembre de 2022
  2. Clough, P.; Sanderson, M. (15 de junio de 2013). "Evaluación del rendimiento de los sistemas de recuperación de información mediante colecciones de prueba" . Information Research . Recuperado el 9 de diciembre de 2022 .
  3. Karlgren, Jussi (2019). "Adopción de puntos de referencia de evaluación sistemática en entornos operativos" (PDF) . Recuperación de información en un mundo cambiante . Recuperado el 27 de junio de 2022 .
  4. 1 2 Harman, Donna (2011). Evaluación de la recuperación de información . Conferencias de síntesis sobre conceptos, recuperación y servicios de información. Cham, Suiza: Springer. doi : 10.1007/978-3-031-02276-0 . ISBN 978-3-031-02276-0. S2CID 207318946 . 
  5. Sanderson, Mark (2010). "Evaluación de sistemas de recuperación de información basada en la recopilación de pruebas" . Foundations and Trends in Information Retrieval . 4 (4): 247– 375. doi : 10.1561/1500000009 . ISSN 1554-0669 . 
  6. Diccionario de la Asociación Americana de Marketing .Recuperado el 2 de noviembre de 2012. El Consejo de Normas de Responsabilidad de Marketing (MASB) respalda esta definición como parte de su proyecto continuo de Lenguaje Común en Marketing. Archivado el 5 de abril de 2019 en Wayback Machine .
  7. 1 2 Zhu, Mu (2004). "Recall, Precision and Average Precision" (PDF) . Archivado del original (PDF) el 4 de mayo de 2011.{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  8. Turpin, Andrew; Scholer, Falk (2006). "Rendimiento del usuario frente a medidas de precisión para tareas de búsqueda simples" . Actas de la 29.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información . Nueva York, NY: ACM. págs. 11-18 . CiteSeerX 10.1.1.533.4100 . doi : 10.1145/1148170.1148176 . ISBN   978-1-59593-369-0. S2CID 9810253 . 
  9. 1 2 Everingham, Mark; Van Gool, Luc; Williams, Christopher KI; Winn, John; Zisserman, Andrew (junio de 2010). "El desafío PASCAL Visual Object Classes (VOC)" (PDF) . International Journal of Computer Vision . 88 (2): 303–338 . doi : 10.1007/s11263-009-0275-4 . hdl : 20.500.11820/88a29de3-6220-442b-ab2d-284210cf72d6 . S2CID 4246903. Archivado del original (PDF) el 20 de noviembre de 2011. Recuperado el 29 de agosto de 2011 . 
  10. ^ Manning , Christopher D.; Raghavan, Prabhakar; Schütze, Hinrich (2008). Introducción a la recuperación de información . Prensa de la Universidad de Cambridge.
  11. "Kit de desarrollo del desafío PASCAL Visual Object Classes 2012 (VOC2012)" . host.robots.ox.ac.uk . Consultado el 23 de marzo de 2019 .
  12. KH Brodersen, CS Ong, KE Stephan, JM Buhmann (2010). La suposición binormal en las curvas de precisión-exhaustividad. Archivado el 8 de diciembre de 2012 en Wayback Machine . Actas de la 20.ª Conferencia Internacional sobre Reconocimiento de Patrones , 4263-4266.
  13. Boyd, K., Davis, J., Page, D., & Costa, VS (2012). Región inalcanzable en el espacio precisión-exhaustividad y su efecto en la evaluación empírica. Actas de la ... Conferencia Internacional sobre Aprendizaje Automático. Conferencia Internacional sobre Aprendizaje Automático, 2012, 349.
  14. Kalervo, Järvelin (2017). "Métodos de evaluación de IR para recuperar documentos altamente relevantes" (PDF) . ACM SIGIR Forum . 51, 2 : 243–250 .
  15. ^ Christopher D. Manning ; Prabhakar Raghavan y Hinrich Schütze (2009). «Capítulo 8: Evaluación en la recuperación de información» (PDF) . Consultado el 14 de junio de 2015 . Parte de la Introducción a la Recuperación de Información
  16. 1 2 3 4 5 "Medidas de evaluación comunes" (PDF) . Archivado del original (PDF) el 16 de septiembre de 2008.
  17. Järvelin, Kalervo; Kekäläinen, Jaana (2000). "Métodos de evaluación de IR para la recuperación de documentos de gran relevancia" . SIGIR . ACM: 41– 48. doi : 10.1145/345508.345545 . ISBN 978-1-58113-226-7.
  18. Järvelin, Kalervo; Kekäläinen, Jaana (2002). "Evaluación de técnicas de IR basada en ganancia acumulada" . Transacciones ACM sobre sistemas de información . 20 (4): 422– 446. doi : 10.1145/582415.582418 . ISSN 1046-8188 . 
  19. C. Lioma; JG Simonsen; B. Larsen (2017). "Medidas de evaluación de relevancia y credibilidad en listas clasificadas" (PDF) . Archivado del original (PDF) el 13 de marzo de 2018. Consultado el 12 de marzo de 2018 .Actas de la Conferencia Internacional ACM SIGIR sobre Teoría de la Recuperación de Información , 91-98.