Articulo de referencia

Indexación aleatoria

La indexación aleatoria es un método de reducción de dimensionalidad y un marco computacional para la semántica distribucional , basado en la idea de que las implementaciones de...

La indexación aleatoria es un método de reducción de dimensionalidad y un marco computacional para la semántica distribucional , basado en la idea de que las implementaciones de modelos de espacio vectorial de muy alta dimensión son poco prácticas, que los modelos no necesitan aumentar su dimensionalidad cuando se encuentran nuevos elementos (por ejemplo, nueva terminología) y que un modelo de alta dimensión puede proyectarse en un espacio de menor dimensionalidad sin comprometer las métricas de distancia L2 si las dimensiones resultantes se eligen adecuadamente.

Este es el punto original del enfoque de proyección aleatoria para la reducción de dimensionalidad, formulado inicialmente como el lema de Johnson-Lindenstrauss , y el hash sensible a la localidad tiene algunos de los mismos puntos de partida. La indexación aleatoria, tal como se utiliza en la representación del lenguaje, tiene su origen en el trabajo de Pentti Kanerva [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] sobre memoria distribuida dispersa , y puede describirse como una formulación incremental de una proyección aleatoria. [ 6 ]

También se puede verificar que la indexación aleatoria es una técnica de proyección aleatoria para la construcción de espacios euclidianos, es decir, espacios vectoriales normados L2. [ 7 ] En los espacios euclidianos, las proyecciones aleatorias se explican mediante el lema de Johnson-Lindenstrauss. [ 8 ]

La técnica TopSig [ 9 ] extiende el modelo de indexación aleatoria para producir vectores de bits para la comparación con la función de similitud de distancia de Hamming . Se utiliza para mejorar el rendimiento de la recuperación de información y la agrupación de documentos . En una línea de investigación similar, se propone la indexación aleatoria de enteros de Manhattan (RMII) [ 10 ] para mejorar el rendimiento de los métodos que emplean la distancia de Manhattan entre unidades de texto. Muchos métodos de indexación aleatoria generan similitud principalmente a partir de la coocurrencia de elementos en un corpus. La indexación aleatoria reflexiva (RRI) [ 11 ] genera similitud a partir de la coocurrencia y de la ocurrencia compartida con otros elementos.

Referencias

  1. Kanerva, Pentti, Kristoferson, Jan y Holst, Anders (2000): Indexación aleatoria de muestras de texto para el análisis semántico latente , Actas de la 22.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas, pág. 1036. Mahwah, Nueva Jersey: Erlbaum, 2000.
  2. Sahlgren, Magnus (2005) Introducción a la indexación aleatoria , Actas del taller sobre métodos y aplicaciones de la indexación semántica en la 7.ª Conferencia Internacional sobre Terminología e Ingeniería del Conocimiento, TKE 2005, 16 de agosto, Copenhague, Dinamarca
  3. Sahlgren, Magnus, Holst, Anders y Pentti Kanerva (2008) Permutaciones como medio para codificar el orden en el espacio de palabras , En Actas de la 30.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas: 1300-1305.
  4. Kanerva, Pentti (2009) Hyperdimensional Computing: An Introduction to Computing in Distributed Representation with High-Dimensional Random Vectors , Cognitive Computation, Volumen 1, Número 2, pp. 139–159.
  5. Joshi, Aditya, Johan Halseth y Pentti Kanerva. " Reconocimiento de lenguaje mediante indexación aleatoria ". Preimpresión de arXiv arXiv:1412.7026 (2014).
  6. Recchia, Gabriel, et al. " Codificación de información secuencial en modelos de espacio vectorial de semántica: Comparación de la representación reducida holográfica y la permutación aleatoria ." (2010): 865-870.
  7. Qasemi Zadeh, Behrang y Handschuh, Siegrfied. (2014) Indexación aleatoria de Manhattan , en Actas del 25º Taller Internacional sobre Aplicaciones de Bases de Datos y Sistemas Expertos.
  8. Johnson, W. y Lindenstrauss, J. (1984) Extensiones de aplicaciones de Lipschitz en un espacio de Hilbert , en Matemáticas Contemporáneas. Sociedad Matemática Americana, vol. 26, pp. 189–206.
  9. Geva, S. y De Vries, CM (2011) TopSig: Firmas de documentos que preservan la topología , En Actas de la Conferencia sobre Gestión de Información y Conocimiento 2011, 24-28 de octubre de 2011, Glasgow, Escocia.
  10. Qasemi Zadeh, Behrang. y Handschuh, Siegfried. (2014) Indexación aleatoria de enteros de Manhattan: Construcción incremental de espacios vectoriales normados L1 , En Actas de la Conferencia de 2014 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP), páginas 1713–1723, 25–29 de octubre de 2014, Doha, Qatar.
  11. Cohen T., Schvaneveldt Roger y Widdows Dominic (2009) Indexación aleatoria reflectiva e inferencia indirecta: un método escalable para el descubrimiento de conexiones implícitas , Journal of Biomedical Informatics, 43(2):240-56.
  • Zadeh Behrang Qasemi, Handschuh Siegfried. (2015) Indexación aleatoria explicada con alta probabilidad , TSD.