La expansión de consultas ( QE ) es el proceso de reformular una consulta dada para mejorar el rendimiento de recuperación en operaciones de recuperación de información , particularmente en el contexto de la comprensión de consultas . [ 1 ] En el contexto de los motores de búsqueda , la expansión de consultas implica evaluar la entrada de un usuario (qué palabras se escribieron en el área de consulta de búsqueda y, a veces, otros tipos de datos ) y expandir la consulta de búsqueda para que coincida con documentos adicionales. La expansión de consultas incluye técnicas como:
- Encontrar sinónimos de palabras y buscar también los sinónimos.
- Encontrar palabras semánticamente relacionadas (por ejemplo , antónimos , merónimos , hipónimos , hiperónimos ).
- Encontrar todas las formas morfológicas de las palabras mediante la lematización de cada palabra en la consulta de búsqueda.
- Corregir errores ortográficos y buscar automáticamente la forma corregida o sugerirla en los resultados.
- Reponderar los términos en la consulta original
La expansión de consultas es una metodología estudiada en el campo de la informática , particularmente dentro del ámbito del procesamiento del lenguaje natural y la recuperación de información .
Compromisos entre precisión y exhaustividad
Los motores de búsqueda expanden las consultas para mejorar la calidad de los resultados. Se asume que los usuarios no siempre utilizan los términos más adecuados. En este caso, la opción "mejor" puede deberse a que la base de datos no contiene los términos introducidos.
Al reducir la raíz de un término introducido por el usuario, se encuentran más documentos coincidentes, ya que también se incluyen las formas alternativas de dicho término, lo que aumenta la exhaustividad total . Esto se logra a costa de reducir la precisión . Al ampliar una consulta de búsqueda para encontrar sinónimos de un término introducido por el usuario, la exhaustividad también aumenta a expensas de la precisión. Esto se debe a la naturaleza de la fórmula para calcular la precisión, ya que una mayor exhaustividad implica una disminución de la precisión, dado que los factores de exhaustividad forman parte del denominador. Además, una mayor exhaustividad puede afectar negativamente la experiencia del usuario, ya que la mayoría de los usuarios prefieren menos resultados, pero más relevantes, en lugar de un gran volumen de resultados vagamente relacionados.
El objetivo de la expansión de consultas en este sentido es aumentar la exhaustividad, lo que puede incrementar la precisión (en lugar de disminuirla, como se equipara matemáticamente), al incluir en el conjunto de resultados páginas más relevantes (de mayor calidad) o, al menos, igualmente relevantes. Se incluyen páginas que, de otro modo, no se incluirían en el conjunto de resultados, pero que podrían ser más relevantes para la consulta del usuario, y que, sin la expansión de consultas, no se incluirían, independientemente de su relevancia . Al mismo tiempo, muchos de los motores de búsqueda comerciales actuales utilizan la frecuencia de palabras ( tf-idf ) para ayudar en la clasificación. Al clasificar las ocurrencias tanto de las "palabras introducidas por el usuario" como de sus sinónimos y formas morfológicas alternativas, los documentos con mayor densidad (alta frecuencia y proximidad) tienden a ascender en los resultados de búsqueda, lo que conlleva una mayor calidad de los resultados de búsqueda cerca de la parte superior, a pesar de la mayor exhaustividad.
Métodos de expansión de consultas
Los métodos automáticos para la expansión de consultas fueron propuestos en 1960 por Maron y Kuhns. [ 2 ] Los métodos modernos de expansión de consultas implican análisis de colecciones de documentos (global o local) [ 3 ] o se basan en diccionarios u ontologías . [ 4 ] El análisis global de la colección de documentos se aplica para buscar relaciones entre términos. El análisis local se refiere a la retroalimentación de relevancia introducida por Rocchio. [ 5 ] Rocchio propuso juzgar manualmente algunos de los documentos recuperados y usar esta información de retroalimentación para expandir la consulta. Dado que recopilar el juicio de los usuarios puede ser difícil, solo los primeros documentos recuperados se consideran relevantes. Esto es lo que se llama retroalimentación de pseudorrelevancia (PRF). [ 6 ] La retroalimentación de pseudorrelevancia es eficiente en promedio, pero puede dañar los resultados para algunas consultas, [ 7 ] especialmente las difíciles, ya que los primeros documentos recuperados probablemente no sean relevantes. Los documentos pseudorrelevantes se utilizan para encontrar términos candidatos de expansión que coocurren con muchos términos de la consulta. [ 8 ] Esta idea se desarrolló aún más dentro del formalismo del modelo de lenguaje de relevancia en la relevancia posicional [ 9 ] y los modelos de relevancia de proximidad [ 10 ] que consideran la distancia a los términos de consulta en los documentos pseudo-relevantes. Otra dirección en la expansión de consultas es la representación de los términos de índice y consulta en un espacio vectorial que se puede utilizar para encontrar términos relacionados en el momento de la consulta, utilizando vectores semánticos o incrustaciones de palabras . [ 11 ] [ 12 ]
De manera más general, la expansión de consultas, junto con su contraparte, la expansión de documentos , se implementan hoy en día en forma de bases de datos vectoriales , utilizando diversos esquemas de codificación basados en aprendizaje profundo . [ 13 ]
Véase también
Bibliotecas de software
- QueryTermAnalyzer Archivado el 12/07/2013 en Wayback Machine , código abierto, C#. Analizador de términos de consulta y sinónimos basado en aprendizaje automático para la expansión de consultas.
- LucQE - código abierto, Java. Proporciona un marco junto con varias implementaciones que permiten realizar la expansión de consultas con el uso de Apache Lucene .
- Xapian es una biblioteca de búsqueda de código abierto que incluye soporte para la expansión de consultas.
- ReQue es de código abierto y está escrito en Python. Es un marco de software configurable y una colección de conjuntos de datos de referencia para entrenar y evaluar métodos de expansión de consultas supervisados. [ 14 ] [ 15 ]
Referencias
Citas
- ↑ Vectomova, Olga; Wang, Ying (2006). "Un estudio del efecto de la proximidad de los términos en la expansión de consultas". Journal of Information Science . 32 (4): 324– 333. CiteSeerX 10.1.1.552.5987 . doi : 10.1177/0165551506065787 . S2CID 7265523 .
- ↑ Maron, ME y Kuhns, JL 1960. Sobre relevancia, indexación probabilística y recuperación de información. Journal of the ACM 7, 3, 216–244.
- ↑ C. Carpineto y G. Romano. Un estudio sobre la expansión automática de consultas en la recuperación de información. ACM Computing Surveys, 44(1):1-50, enero de 2012.
- ↑ J. Bhogal, A. Macfarlane y P. Smith. Una revisión de la expansión de consultas basada en ontologías. Inf. Process. Manage., 43(4):866-886, julio de 2007.
- ↑ J. Rocchio. Retroalimentación de relevancia en la recuperación de información. En El sistema de recuperación SMART, págs. 313-323. 1971.
- ↑ C. Buckley. Expansión automática de consultas mediante SMART: TREC 3. En Actas de la tercera Conferencia de Recuperación de Texto (TREC-3). Publicación especial del NIST, págs. 69-80. Instituto Nacional de Estándares y Tecnología, 1995.
- ↑ G. Amati, C. Carpineto y G. Romano. Dificultad de la consulta, robustez y aplicación selectiva de la expansión de consultas. Avances en la recuperación de información, págs. 127-137, 2004.
- ↑ J. Xu y WB Croft. Expansión de consultas mediante análisis de documentos locales y globales. En Actas de la 19.ª conferencia internacional anual ACM SIGIR sobre investigación y desarrollo en recuperación de información, páginas 4-11. ACM, 1996.
- ↑ Y. Lv y C. Zhai. Modelo de relevancia posicional para retroalimentación de pseudorrelevancia. En Actas de la 33.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información, págs. 579-586. ACM, 2010.
- ↑ L. Ermakova, J. Mothe y E. Nikitina. 2016. Modelo de relevancia de proximidad para la expansión de consultas. En Actas del 31.er Simposio Anual de la ACM sobre Computación Aplicada (SAC '16). ACM, Nueva York, NY, EE. UU., 1054-1059. DOI: https://doi.org/10.1145/2851613.2851696
- ↑ Sahlgren, Magnus, Jussi Karlgren, Rickard Cöster y Timo Järvinen. 2003. «Expansión automática de consultas mediante indexación aleatoria». En Avances en la recuperación de información multilingüe: Tercer taller del Foro de evaluación multilingüe (CLEF). Springer.
- ↑ S. Kuzi, A. Shtok y O. Kurland. 2016. Expansión de consultas mediante incrustaciones de palabras. En Actas de la 25.ª Conferencia Internacional ACM sobre Gestión de la Información y el Conocimiento (CIKM '16). ACM, Nueva York, NY, EE. UU., 1929-1932. DOI: https://doi.org/10.1145/2983323.2983876
- ↑ Lin, Jimmy; Nogueira, Rodrigo; Yates, Andrew (2020-10-13). "Transformers preentrenados para la clasificación de texto: BERT y más allá". arXiv : 2010.06467 [ cs.IR ].
- ^ Mahtab Tamannaee, Hossein Fani, Fattane Zarrinkalam, Jamil Samouh, Samad Paydar, Ebrahim Bagheri: ReQue: un flujo de trabajo configurable y una colección de conjuntos de datos para el refinamiento de consultas. CIKM 2020: 3165-3172
- ↑ Hossein Fani, Mahtab Tamannaee, Fattane Zarrinkalam, Jamil Samouh, Samad Paydar, Ebrahim Bagheri; Un conjunto de herramientas extensible de métodos de refinamiento de consultas y generación de conjuntos de datos de referencia. En Avances en la recuperación de información: 43.ª Conferencia Europea sobre Investigación en Recuperación de Información (ECIR'21), 2021.
Fuentes
- D. Abberley, D. Kirby, S. Renals y T. Robinson, El sistema de recuperación de noticias de radiodifusión THISL. En Actas del Taller ESCA ETRW sobre Acceso a la Información en Audio Hablado (Cambridge), págs. 14-19, 1999. Sección sobre Expansión de Consultas : Resumen matemático conciso.
- R. Navigli, P. Velardi. Un análisis de estrategias de expansión de consultas basadas en ontologías Archivado el 26 de abril de 2012 en Wayback Machine . Actas del Taller sobre Extracción y Minería Adaptativa de Texto (ATEM 2003) , en la 14.ª Conferencia Europea sobre Aprendizaje Automático (ECML 2003) , Cavtat-Dubrovnik, Croacia, del 22 al 26 de septiembre de 2003, págs. 42-49 - Un análisis de métodos de expansión de consultas que se basan en WordNet como ontología de referencia.
- Y. Qiu y HP Frei. Expansión de consultas basada en conceptos . En Actas de SIGIR-93, 16.ª Conferencia Internacional ACM sobre Investigación y Desarrollo en Recuperación de Información , Pittsburgh, SIGIR Forum, ACM Press, junio de 1993. Documento académico sobre un método específico de expansión de consultas.
- Efthimis N. Efthimiadis. Expansión de consultas . En: Martha E. Williams (ed.), Annual Review of Information Systems and Technology (ARIST) , vol. 31, págs. 121-187, 1996 - Una introducción para lectores menos técnicos.
- Algoritmos de búsqueda