Articulo de referencia

Modelo de espacio vectorial generalizado

El modelo de espacio vectorial generalizado es una generalización del modelo de espacio vectorial utilizado en la recuperación de información . Wong et al. [1] presentaron un an...

El modelo de espacio vectorial generalizado es una generalización del modelo de espacio vectorial utilizado en la recuperación de información . Wong et al. [1] presentaron un análisis de los problemas que genera el supuesto de ortogonalidad por pares del modelo de espacio vectorial (VSM). A partir de aquí, extendieron el VSM al modelo de espacio vectorial generalizado (GVSM).

Definiciones

GVSM introduce correlaciones término a término, que desaprueban el supuesto de ortogonalidad por pares. Más específicamente, el factor consideró un nuevo espacio, donde cada vector de término t i se expresó como una combinación lineal de 2 n vectores m r donde r = 1...2 n .

Para un documento d k y una consulta q la función de similitud ahora se convierte en:

s i m ( d k , q ) = j = 1 n i = 1 n w i , k w j , q t i t j i = 1 n w i , k 2 i = 1 n w i , q 2 {\displaystyle sim(d_{k},q)={\frac {\sum _{j=1}^{n}\sum _{i=1}^{n}w_{i,k}*w_{j,q}*t_{i}\cdot t_{j}}{{\sqrt {\sum _{i=1}^{n}w_{i,k}^{2}}}*{\sqrt {\sum _{i=1}^{n}w_{i,q}^{2}}}}}}

donde t i y t j son ahora vectores de un espacio de 2 n dimensiones.

La correlación de términos se puede implementar de varias maneras. Por ejemplo, Wong et al. utiliza la matriz de frecuencia de ocurrencia de términos obtenida a partir de la indexación automática como entrada para su algoritmo. La ocurrencia de términos y el resultado es la correlación de términos entre cualquier par de términos del índice. t i t j {\displaystyle t_{i}\cdot t_{j}}

Información semántica sobre GVSM

Existen al menos dos direcciones básicas para incorporar la relación entre términos, además de la coincidencia exacta de palabras clave, en un modelo de recuperación:

  1. Calcular correlaciones semánticas entre términos
  2. Calcular estadísticas de coocurrencia de frecuencias a partir de grandes corpus

Recientemente Tsatsaronis [2] se centró en el primer enfoque.

Miden la relación semántica ( SR ) utilizando un tesauro ( O ) como WordNet . Considera la longitud de la ruta, capturada por la compacidad ( SCM ), y la profundidad de la ruta, capturada por la elaboración de la ruta semántica ( SPE ). Calculan el producto interno mediante: t i t j {\displaystyle t_{i}\cdot t_{j}}

t i t j = S R ( ( t i , t j ) , ( s i , s j ) , O ) {\displaystyle t_{i}\cdot t_{j}=SR((t_{i},t_{j}),(s_{i},s_{j}),O)}

donde s i y s j son sentidos de los términos t i y t j respectivamente, maximizando . S C M S P E {\displaystyle SCM\cdot SPE}

Además, basándose en el primer enfoque, Waitelonis et al. [3] han calculado la relación semántica a partir de recursos de Linked Open Data , como DBpedia y la taxonomía YAGO . De este modo, explotan las relaciones taxonómicas entre entidades semánticas en documentos y consultas después de la vinculación de entidades nombradas .

Referencias

  1. ^ Wong, SKM; Ziarko, Wojciech; Wong, Patrick CN (5 de junio de 1985), "Modelo de espacios vectoriales generalizados en la recuperación de información", Actas de la octava conferencia anual internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información - SIGIR '85 , SIGIR ACM , págs. 18-25, doi : 10.1145/253495.253506 , ISBN 0897911598
  2. ^ Tsatsaronis, George; Panagiotopoulou, Vicky (2009-04-02), Un modelo de espacio vectorial generalizado para la recuperación de texto basado en la relación semántica (PDF) , EACL ACM
  3. ^ Waitelonis, Jörg; Exeler, Claudia; Sack, Harald (11 de septiembre de 2015), Modelo de espacio vectorial generalizado habilitado con datos vinculados para mejorar la recuperación de documentos (PDF) , ISWC 2015, CEUR-WS 1581
Retrieved from "https://en.wikipedia.org/w/index.php?title=Generalized_vector_space_model&oldid=1136313991"