En la recuperación de información , el procesamiento de términos compuestos consiste en la comparación de resultados de búsqueda en función de dichos términos . Los términos compuestos se forman combinando dos o más términos simples; por ejemplo, "triple" es una palabra, pero "triple bypass cardíaco" es un término compuesto.
El procesamiento de términos compuestos es un nuevo enfoque para un problema antiguo: ¿cómo mejorar la relevancia de los resultados de búsqueda sin comprometer la facilidad de uso? Mediante esta técnica, una búsqueda sobre las tasas de supervivencia tras un triple bypass coronario en personas mayores encontrará documentos sobre este tema, incluso si la frase exacta no aparece en ninguno. Esto se puede lograr mediante una búsqueda conceptual , que a su vez utiliza el procesamiento de términos compuestos. Esta búsqueda extraerá automáticamente los conceptos clave (en este caso, "tasas de supervivencia", "triple bypass coronario" y "personas mayores") y los utilizará para seleccionar los documentos más relevantes.
Técnicas
En agosto de 2003, Concept Searching Limited introdujo la idea de utilizar el procesamiento estadístico de términos compuestos. [ 1 ]
CLAMOUR es un proyecto colaborativo europeo que busca encontrar una mejor manera de clasificar la información y las estadísticas industriales al recopilarlas y difundirlas. CLAMOUR parece utilizar un enfoque lingüístico, en lugar de uno basado en modelos estadísticos . [ 2 ]
Historia
Las técnicas para la ponderación probabilística de términos de una sola palabra se remontan al menos a 1976 en la publicación fundamental de Stephen E. Robertson y Karen Spärck Jones . [ 3 ] Robertson afirmó que la suposición de independencia de las palabras no está justificada y existe como una cuestión de conveniencia matemática. Su objeción a la independencia de términos no es una idea nueva, que se remonta al menos a 1964 cuando HH Williams afirmó que "[l]a suposición de independencia de las palabras en un documento se hace generalmente como una cuestión de conveniencia matemática". [ 4 ]
En 2004, Anna Lynn Patterson presentó patentes sobre "búsqueda basada en frases en un sistema de recuperación de información" [ 5 ] cuyos derechos Google adquirió posteriormente. [ 6 ]
Adaptabilidad
El procesamiento estadístico de términos compuestos es más adaptable que el proceso descrito por Patterson. Su proceso está orientado a la búsqueda en la World Wide Web, donde se puede utilizar un amplio conocimiento estadístico de las búsquedas comunes para identificar frases candidatas. El procesamiento estadístico de términos compuestos es más adecuado para aplicaciones de búsqueda empresarial , donde no se dispone de dicho conocimiento previo .
El procesamiento estadístico de términos compuestos también es más adaptable que el enfoque lingüístico adoptado por el proyecto CLAMOUR, que debe considerar las propiedades sintácticas de los términos (es decir, categoría gramatical, género, número, etc.) y sus combinaciones. CLAMOUR depende en gran medida del idioma, mientras que el enfoque estadístico es independiente del idioma.
Aplicaciones
El procesamiento de términos compuestos permite que las aplicaciones de recuperación de información, como los motores de búsqueda , realicen sus coincidencias basándose en conceptos de varias palabras, en lugar de en palabras individuales aisladas, que pueden resultar muy ambiguas.
Los primeros motores de búsqueda buscaban documentos que contuvieran las palabras introducidas por el usuario en el cuadro de búsqueda. Estos se conocen como motores de búsqueda por palabras clave . Los motores de búsqueda booleanos añaden un grado de sofisticación al permitir al usuario especificar requisitos adicionales. Por ejemplo, "Tiger NEAR Woods AND (golf OR golfing) NOT Volkswagen" utiliza los operadores "NEAR", "AND", "OR" y "NOT" para especificar que estas palabras deben cumplir ciertos requisitos. Una búsqueda de frase es más sencilla de usar, pero requiere que la frase exacta especificada aparezca en los resultados.
Véase también
Referencias
- ↑ "Pensamiento lateral en la recuperación de información" (PDF) . Gestión de la información y tecnología . 36 PARTE 4. Archivado del original (PDF) el 15-11-2017 . Recuperado el 20-06-2008 .La entrada del catálogo de British Library Direct se puede encontrar aquí:Archivado el 10 de febrero de 2012 en Wayback Machine.
- ↑Proyecto CLAMOUR de Estadísticas Nacionales
- ↑ Robertson, SE ; Spärck Jones, K. (1976). "Ponderación de relevancia de los términos de búsqueda". Journal of the American Society for Information Science . 27 (3): 129. doi : 10.1002/asi.4630270302 .
- ↑ WILLIAMS, JH (1965). "Resultados de la clasificación de documentos con múltiples funciones discriminantes" . Métodos de asociación estadística para la documentación mecanizada, Oficina Nacional de Normas . Washington: 217–224 . Archivado del original el 17 de julio de 2011. Recuperado el 21 de mayo de 2015 .
- ↑ EE. UU. 20060031195
- ^ Google adquiere las solicitudes de patente de Cuil
- Técnicas de recuperación de información