Articulo de referencia

Clasificación de consultas web

La clasificación/categorización de temas de consultas web es un problema de la ciencia de la información . La tarea consiste en asignar una consulta de búsqueda web a una o más ...

La clasificación/categorización de temas de consultas web es un problema de la ciencia de la información . La tarea consiste en asignar una consulta de búsqueda web a una o más categorías predefinidas , según sus temas. La importancia de la clasificación de consultas se ve reforzada por numerosos servicios de búsqueda web. Una aplicación directa es proporcionar mejores páginas de resultados de búsqueda a usuarios con intereses en diferentes categorías. Por ejemplo, los usuarios que realizan una consulta web como "manzana" podrían esperar ver páginas web relacionadas con la manzana, o bien preferir ver productos o noticias relacionados con la empresa de informática. Los servicios de publicidad en línea pueden basarse en los resultados de la clasificación de consultas para promocionar diferentes productos con mayor precisión. Las páginas de resultados de búsqueda se pueden agrupar según las categorías predichas por un algoritmo de clasificación de consultas. Sin embargo, el cálculo de la clasificación de consultas no es trivial. A diferencia de las tareas de clasificación de documentos , las consultas enviadas por los usuarios de búsqueda web suelen ser cortas y ambiguas; además, el significado de las consultas evoluciona con el tiempo. Por lo tanto, la clasificación de temas de consultas es mucho más difícil que las tareas tradicionales de clasificación de documentos.

Dificultades

La clasificación de temas de consultas web consiste en asignar automáticamente una consulta a algunas categorías predefinidas. A diferencia de las tareas tradicionales de clasificación de documentos, existen varias dificultades importantes que obstaculizan el progreso de la comprensión de las consultas web :

Derivar una representación de características apropiada para consultas web.

Muchas consultas son cortas y sus términos suelen ser confusos. Por ejemplo, en el conjunto de datos KDDCUP 2005, las consultas de 3 palabras son las más frecuentes (22%). Además, el 79% de las consultas constan de no más de 4 palabras. Una consulta de usuario suele tener múltiples significados. Por ejemplo, "manzana" podría referirse a un tipo de fruta o a una empresa de informática, mientras que "Java" podría significar un lenguaje de programación o una isla en Indonesia. En el conjunto de datos KDDCUP 2005, la mayoría de las consultas contienen más de un significado. Por lo tanto, no es apropiado utilizar únicamente las palabras clave de la consulta para configurar un modelo de espacio vectorial para la clasificación.

Los métodos basados ​​en el enriquecimiento de consultas [ 1 ] [ 2 ] comienzan enriqueciendo las consultas de los usuarios con una colección de documentos de texto a través de motores de búsqueda . Así, cada consulta se representa mediante un pseudodocumento que consta de fragmentos de las páginas de resultados mejor clasificadas recuperadas por el motor de búsqueda. Posteriormente, los documentos de texto se clasifican en las categorías objetivo utilizando clasificadores basados ​​en sinónimos o clasificadores estadísticos, como Naive Bayes (NB) y máquinas de vectores de soporte (SVM).

Adaptación a los cambios de las consultas y categorías a lo largo del tiempo.

El significado de las consultas también puede evolucionar con el tiempo. Por lo tanto, las antiguas consultas de entrenamiento etiquetadas pueden quedar obsoletas e inservibles pronto. Lograr que el clasificador se adapte con el tiempo se convierte en un gran desafío. Por ejemplo, la palabra " Barcelona " ahora se refiere al nuevo microprocesador de AMD, mientras que antes de 2007 se refería a una ciudad o un club de fútbol. La distribución de los significados de este término es, por lo tanto, una función del tiempo en la web.

El método basado en taxonomía intermedia [ 3 ] primero crea un clasificador puente sobre una taxonomía intermedia, como Open Directory Project (ODP), en modo fuera de línea. Este clasificador se utiliza luego en modo en línea para asignar las consultas de los usuarios a las categorías objetivo a través de la taxonomía intermedia. La ventaja de este enfoque es que el clasificador puente solo necesita entrenarse una vez y se adapta a cada nuevo conjunto de categorías objetivo y consultas entrantes.

Utilizar registros de consultas sin etiquetar para ayudar con la clasificación de consultas.

Dado que la clasificación manual de datos de entrenamiento para consultas resulta costosa, el uso de un extenso registro de consultas de motores de búsqueda web como fuente de datos sin etiquetar para facilitar la clasificación automática de consultas se ha convertido en un tema de gran interés. Estos registros documentan el comportamiento de los usuarios web al buscar información a través de un motor de búsqueda. Con el paso de los años, los registros de consultas se han convertido en un valioso recurso que contiene el conocimiento de los usuarios sobre la World Wide Web.

El método de agrupamiento de consultas [ 4 ] busca asociar consultas relacionadas mediante el agrupamiento de "datos de sesión", que contienen múltiples consultas e información de clics de una sola interacción del usuario. Este método considera términos de los documentos de resultados que un conjunto de consultas tiene en común. Se ha demostrado que el uso de palabras clave de consulta junto con los datos de sesión es el método más eficaz para realizar el agrupamiento de consultas.

El método basado en preferencias de selección [ 5 ] intenta aprovechar ciertas reglas de asociación entre los términos de la consulta para facilitar su clasificación. A partir de los datos de entrenamiento, utilizan diversos enfoques de clasificación, incluyendo la coincidencia exacta con datos etiquetados, la coincidencia de N-gramas con datos etiquetados y clasificadores basados ​​en la percepción. Hacen hincapié en un enfoque adaptado de la lingüística computacional denominado preferencias de selección. Si x e y forman un par (x; y) y y pertenece a la categoría c, entonces todos los demás pares (x; z) encabezados por x pertenecen a c. Utilizan datos de registro de consultas sin etiquetar para extraer estas reglas y validar la eficacia de sus enfoques en algunas consultas etiquetadas.

Aplicaciones

  • Los metabuscadores envían la consulta del usuario a varios motores de búsqueda y combinan los mejores resultados de cada uno en una lista general. El motor de búsqueda puede organizar la gran cantidad de páginas web en los resultados de búsqueda, según las posibles categorías de la consulta, para facilitar la navegación del usuario.
  • La búsqueda vertical , a diferencia de la búsqueda general, se centra en dominios específicos y satisface las necesidades de información particulares de nichos de mercado y profesiones concretas. Una vez que el motor de búsqueda predice la categoría de información que busca un usuario, puede seleccionar automáticamente un motor de búsqueda vertical determinado, sin que el usuario tenga que acceder a él explícitamente.
  • La publicidad en línea [ 6 ] [ 7 ] tiene como objetivo ofrecer anuncios interesantes a los usuarios de la web durante sus búsquedas. El motor de búsqueda puede proporcionar publicidad relevante a los usuarios según sus intereses, de modo que estos ahorren tiempo y esfuerzo en su investigación, mientras que los anunciantes reducen sus costes publicitarios.

Todos estos servicios se basan en la comprensión de las intenciones de búsqueda de los usuarios de la web a través de sus consultas web.

Véase también

Referencias

  1. ^ Shen et al. "Q2C@UST: Nuestra solución ganadora para la clasificación de consultas" . ACM SIGKDD Exploration, diciembre de 2005, volumen 7, número 2 .
  2. ^ Shen et al. "Enriquecimiento de consultas para la clasificación de consultas web" . ACM TOIS, vol. 24, n.° 3, julio de 2006 .
  3. ^ Shen et al. "Construyendo puentes para la clasificación de consultas web" . ACM SIGIR, 2006 .
  4. ^ Wen et al. "Agrupación de consultas mediante registros de usuarios" , ACM TOIS, Volumen 20, Número 1, enero de 2002 .
  5. ^ Beitzel et al. "Clasificación automática de consultas web utilizando registros de consultas sin etiquetar muy grandes" , ACM TOIS, Volumen 25, Número 2, abril de 2007 .
  6. ^ Minería de datos e inteligencia de audiencia para publicidad (ADKDD'07) , taller KDD 2007
  7. ^ Segmentación y posicionamiento para publicidad online (TROA'08) , taller WWW 2008

Lecturas adicionales

  • Shen. "Comprensión de consultas web basada en el aprendizaje" . Tesis doctoral , HKUST , junio de 2007.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Web_query_classification&oldid=1267164977 "