Word2vec es una técnica de procesamiento del lenguaje natural para obtener representaciones vectoriales de palabras. Estos vectores capturan información sobre el significado de la palabra basándose en las palabras que la rodean. El algoritmo Word2vec estima estas representaciones modelando texto en un corpus extenso . Una vez entrenado, este modelo puede detectar sinónimos o sugerir palabras adicionales para una oración parcial. Word2vec fue desarrollado por Tomáš Mikolov , Kai Chen, Greg Corrado, Ilya Sutskever y Jeff Dean en Google, y publicado en 2013. [ 1 ] [ 2 ]
Word2vec representa una palabra como un vector de números de alta dimensión que captura las relaciones entre palabras. En particular, las palabras que aparecen en contextos similares se asignan a vectores cercanos, medidos mediante la similitud del coseno . Esto indica el nivel de similitud semántica entre las palabras; por ejemplo, los vectores de " walk" y "ran" están cerca, al igual que los de "but" y "however", y "Berlin" y "Germany".
Acercarse
Word2vec es un conjunto de modelos relacionados que se utilizan para generar incrustaciones de palabras . Estos modelos son redes neuronales simples de dos capas, entrenadas para reconstruir los contextos lingüísticos de las palabras. Word2vec toma como entrada un gran corpus de texto y genera una correspondencia entre el conjunto de palabras y un espacio vectorial , generalmente de varios cientos de dimensiones , donde a cada palabra única del corpus se le asigna un vector en dicho espacio.
Word2vec puede utilizar cualquiera de las dos arquitecturas de modelo para producir estas representaciones distribuidas de palabras: bolsa de palabras continua (CBOW) o skip-gram deslizante continuo. En ambas arquitecturas, word2vec considera tanto las palabras individuales como una ventana de contexto deslizante a medida que itera sobre el corpus.
El CBOW puede considerarse una tarea de "completar espacios en blanco", donde la representación vectorial de la palabra indica cómo influye en las probabilidades relativas de otras palabras en la ventana de contexto. Las palabras semánticamente similares deberían influir en estas probabilidades de forma similar, ya que se emplean en contextos parecidos. El orden de las palabras del contexto no influye en la predicción (suposición de bolsa de palabras).
En la arquitectura skip-gram continua, el modelo utiliza la palabra actual para predecir la ventana circundante de palabras de contexto. [ 1 ] [ 2 ] La arquitectura skip-gram da mayor peso a las palabras de contexto cercanas que a las más distantes. Según la nota de los autores, [ 3 ] CBOW es más rápido, mientras que skip-gram funciona mejor para palabras poco frecuentes.
Una vez entrenado el modelo, las incrustaciones de palabras aprendidas se posicionan en el espacio vectorial de manera que las palabras que comparten contextos comunes en el corpus —es decir, palabras que son semántica y sintácticamente similares— se ubican cerca unas de otras en el espacio. [ 1 ] Las palabras más disímiles se ubican más lejos unas de otras en el espacio. [ 1 ]
Detalles matemáticos
Esta sección se basa en exposiciones. [ 4 ] [ 5 ]
Un corpus es una secuencia de palabras. Tanto CBOW como skip-gram son métodos para aprender un vector por cada palabra que aparece en el corpus.
Dejar("vocabulario") sea el conjunto de todas las palabras que aparecen en el corpus.Nuestro objetivo es aprender un vectorpara cada palabra.
La idea de skip-gram es que el vector de una palabra debe ser similar al vector de cada uno de sus vecinos. La idea de CBOW es que la suma vectorial de los vecinos de una palabra debe ser similar al vector de la palabra misma.
Bolsa de palabras continua (CBOW)


La idea de CBOW es representar cada palabra con un vector, de manera que sea posible predecir una palabra utilizando la suma de los vectores de sus vecinos. Específicamente, para cada palabraEn el corpus, la codificación one-hot de la palabra se utiliza como entrada para la red neuronal. La salida de la red neuronal es una distribución de probabilidad sobre el diccionario, que representa una predicción de palabras individuales en el vecindario deEl objetivo del entrenamiento es maximizardóndees un conjunto de índices (distintos de cero) que representan las ubicaciones relativas de palabras cercanas consideradas enbarrio de.
Por ejemplo, si queremos que cada palabra del corpus sea predicha por todas las demás palabras en un pequeño intervalo de 4 palabras, el conjunto de índices relativos de palabras vecinas será:y el objetivo es maximizar.
En el modelo estándar de bolsa de palabras, el contexto de una palabra se representa mediante un recuento de palabras (también conocido como histograma de palabras ) de sus palabras vecinas. Por ejemplo, "sat" en "the cat sat on the mat" se representa como {"the": 2, "cat": 1, "on": 1}. Nótese que la última palabra, "mat", no se utiliza para representar "sat", porque está fuera del vecindario..
En el modelo continuo de bolsa de palabras, el histograma se multiplica por una matriz.para obtener una representación continua del contexto de la palabra. La matrizTambién se le llama diccionario . Sus columnas son los vectores de palabras. Tienecolumnas, dondees el tamaño del diccionario. Dejesea la longitud de cada vector de palabra. Tenemos.
Por ejemplo, multiplicando la palabra histograma {"the": 2, "cat": 1, "on": 1} con, obtenemos.
Luego, esto se multiplica por otra matriz.de formaCada fila es un vector de palabras.. Esto da como resultado un vector de longitud, una entrada por cada entrada del diccionario. Luego, aplique la función softmax para obtener una distribución de probabilidad sobre el diccionario.
Este sistema puede visualizarse como una red neuronal, similar en esencia a un autoencoder , de arquitectura lineal-lineal- softmax , como se muestra en el diagrama. El sistema se entrena mediante descenso de gradiente para minimizar la pérdida de entropía cruzada .
En su fórmula completa, la pérdida de entropía cruzada es:donde la suma externaes sobre las palabras en un corpus, la cantidades la suma de los vectores de los vecinos de una palabra, etc.
Una vez que dicho sistema está entrenado, tenemos dos matrices entrenadas.. Ya sean los vectores columna deo los vectores fila depuede servir como diccionario. Por ejemplo, la palabra "sat" puede representarse como la columna "sat"-ésima deo la fila "sat" deTambién es posible simplemente definir, en cuyo caso ya no habría opción.
Saltar-gram

La idea de skip-gram es representar cada palabra con un vector, de manera que sea posible predecir los vectores de sus vecinos utilizando el vector de una palabra.
La arquitectura sigue siendo lineal-lineal-softmax, la misma que CBOW, pero la entrada y la salida están intercambiadas. Específicamente, para cada palabraEn el corpus, la codificación one-hot de la palabra se utiliza como entrada para la red neuronal. La salida de la red neuronal es una distribución de probabilidad sobre el diccionario, que representa una predicción de palabras individuales en el vecindario deEl objetivo del entrenamiento es maximizar.
En su fórmula completa, la función de pérdida esAl igual que con CBOW, una vez que dicho sistema está entrenado, tenemos dos matrices entrenadas.. Ya sean los vectores columna deo los vectores fila depuede servir como diccionario. También es posible simplemente definir, en cuyo caso ya no habría opción.
En esencia, skip-gram y CBOW tienen exactamente la misma arquitectura. Solo se diferencian en la función objetivo durante el entrenamiento.
Historia
Durante la década de 1980, hubo algunos intentos iniciales de utilizar redes neuronales para representar palabras y conceptos como vectores. [ 6 ] [ 7 ] [ 8 ]
En 2010, Tomáš Mikolov (entonces en la Universidad Tecnológica de Brno ) con coautores aplicó una red neuronal recurrente simple con una sola capa oculta al modelado del lenguaje. [ 9 ]
Word2vec fue creado, patentado [ 10 ] y publicado en 2013 por un equipo de investigadores liderado por Mikolov en Google en dos artículos. [ 1 ] [ 2 ] El artículo original fue rechazado por los revisores de la conferencia ICLR 2013. También se necesitaron meses para que el código fuera aprobado como código abierto. [ 11 ] Otros investigadores ayudaron a analizar y explicar el algoritmo. [ 4 ]
Los vectores de incrustación creados con el algoritmo Word2vec tienen algunas ventajas en comparación con algoritmos anteriores [ 1 ], como los que utilizan n-gramas y análisis semántico latente . GloVe fue desarrollado por un equipo de Stanford específicamente como competidor, y el artículo original señaló múltiples mejoras de GloVe sobre word2vec. [ 12 ] Mikolov argumentó que la comparación era injusta, ya que GloVe se entrenó con más datos, y que el proyecto fastText demostró que word2vec es superior cuando se entrena con los mismos datos. [ 13 ] [ 11 ]
En 2022, el enfoque directo de Word2vec se describía como "obsoleto". Los modelos basados en Transformer , como ELMo y BERT , que añaden múltiples capas de atención de redes neuronales sobre un modelo de incrustación de palabras similar a Word2vec, se han llegado a considerar como el estado del arte en el procesamiento del lenguaje natural. [ 14 ]
Parametrización
Los resultados del entrenamiento de word2vec pueden ser sensibles a la parametrización . A continuación se presentan algunos parámetros importantes en el entrenamiento de word2vec.
Algoritmo de entrenamiento
Un modelo word2vec puede entrenarse con softmax jerárquico y/o muestreo negativo. Para aproximar la log-verosimilitud condicional que un modelo busca maximizar, el método softmax jerárquico utiliza un árbol de Huffman para reducir el cálculo. El método de muestreo negativo, por otro lado, aborda el problema de maximización minimizando la log-verosimilitud de las instancias negativas muestreadas. Según los autores, softmax jerárquico funciona mejor para palabras poco frecuentes, mientras que el muestreo negativo funciona mejor para palabras frecuentes y con vectores de baja dimensión. [ 3 ] A medida que aumentan las épocas de entrenamiento, softmax jerárquico deja de ser útil. [ 15 ]
Submuestreo
Las palabras de alta y baja frecuencia suelen proporcionar poca información. Las palabras con una frecuencia superior o inferior a un determinado umbral pueden ser submuestreadas o eliminadas para acelerar el entrenamiento. [ 16 ]
Dimensionalidad
La calidad de la incrustación de palabras aumenta con una mayor dimensionalidad. Pero después de cierto punto, la ganancia marginal disminuye. [ 1 ] Normalmente, la dimensionalidad de los vectores se establece entre 100 y 1000.
Ventana de contexto
El tamaño de la ventana de contexto determina cuántas palabras antes y después de una palabra dada se incluyen como palabras de contexto de dicha palabra. Según la nota de los autores, el valor recomendado es 10 para skip-gram y 5 para CBOW. [ 3 ]
Extensiones
Existen diversas extensiones para word2vec.
doc2vec
doc2vec genera representaciones distribuidas de fragmentos de texto de longitud variable , como oraciones, párrafos o documentos completos. [ 17 ] [ 18 ] doc2vec se ha implementado en las herramientas C , Python y Java / Scala (ver más abajo), y las versiones de Java y Python también admiten la inferencia de incrustaciones de documentos en documentos nuevos y no vistos.
doc2vec estima las representaciones distribuidas de documentos de forma muy similar a como word2vec estima las representaciones de palabras: doc2vec utiliza una de dos arquitecturas de modelo, ambas alegorías de las arquitecturas utilizadas en word2vec. La primera, Modelo de Memoria Distribuida de Vectores de Párrafo (PV-DM), es idéntica a CBOW, salvo que también proporciona un identificador de documento único como contexto adicional. La segunda arquitectura, Versión de Bolsa de Palabras Distribuida de Vector de Párrafo (PV-DBOW), es idéntica al modelo skip-gram, excepto que intenta predecir la ventana de palabras de contexto circundantes a partir del identificador de párrafo en lugar de la palabra actual. [ 17 ]
doc2vec también tiene la capacidad de capturar los "significados" semánticos de elementos adicionales de "contexto" alrededor de las palabras; puede estimar las incrustaciones semánticas para hablantes o atributos de hablantes, grupos y períodos de tiempo. Por ejemplo, doc2vec se ha utilizado para estimar las posiciones políticas de los partidos políticos en varios Congresos y Parlamentos de EE. UU. y Reino Unido, [ 19 ] respectivamente, y diversas instituciones gubernamentales. [ 20 ]
top2vec
Otra extensión de word2vec es top2vec, que aprovecha tanto las incrustaciones de documentos como las de palabras para estimar representaciones distribuidas de temas. [ 21 ] [ 22 ] top2vec toma las incrustaciones de documentos aprendidas de un modelo doc2vec y las reduce a una dimensión menor (normalmente usando UMAP ). El espacio de documentos se escanea luego usando HDBSCAN , [ 23 ] y se encuentran clústeres de documentos similares. A continuación, el centroide de los documentos identificados en un clúster se considera el vector de tema de ese clúster. Finalmente, top2vec busca en el espacio semántico incrustaciones de palabras ubicadas cerca del vector de tema para determinar el "significado" del tema. [ 21 ] La palabra con incrustaciones más similares al vector de tema podría asignarse como el título del tema, mientras que las incrustaciones de palabras lejanas pueden considerarse no relacionadas.
A diferencia de otros modelos de temas como LDA , top2vec proporciona métricas de "distancia" canónicas entre dos temas, o entre un tema y otras incrustaciones (palabra, documento, etc.). Junto con los resultados de HDBSCAN, los usuarios pueden generar jerarquías de temas, o grupos de temas y subtemas relacionados.
Además, un usuario puede utilizar los resultados de top2vec para inferir los temas de documentos fuera de la muestra. Tras inferir la representación vectorial de un nuevo documento, solo es necesario buscar en el espacio de temas el vector de tema más cercano.
Biovectores
Asgari y Mofrad propusieron una extensión de los vectores de palabras para n-gramas en secuencias biológicas (por ejemplo, ADN , ARN y proteínas ) para aplicaciones bioinformáticas . [ 24 ] Denominados biovectores ( BioVec ) para referirse a secuencias biológicas en general, con vectores de proteínas (ProtVec) para proteínas (secuencias de aminoácidos) y vectores de genes (GeneVec) para secuencias de genes, esta representación puede utilizarse ampliamente en aplicaciones de aprendizaje automático en proteómica y genómica. Los resultados sugieren que los BioVectors pueden caracterizar secuencias biológicas en términos de interpretaciones bioquímicas y biofísicas de los patrones subyacentes. [ 24 ] Una variante similar, dna2vec, ha demostrado que existe una correlación entre la puntuación de similitud de Needleman-Wunsch y la similitud del coseno de los vectores de palabras dna2vec. [ 25 ]
Radiología e incrustaciones de palabras inteligentes (IWE)
Banerjee et al. [ 26 ] propusieron una extensión de los vectores de palabras para crear una representación vectorial densa de informes radiológicos no estructurados. Uno de los mayores desafíos de Word2vec es cómo manejar palabras desconocidas o fuera del vocabulario (OOV) y palabras morfológicamente similares. Si el modelo Word2vec no ha encontrado una palabra en particular antes, se verá obligado a usar un vector aleatorio, que generalmente está lejos de su representación ideal. Esto puede ser un problema particularmente en dominios como la medicina, donde se pueden usar sinónimos y palabras relacionadas según el estilo preferido del radiólogo, y las palabras pueden haber sido usadas con poca frecuencia en un corpus grande.
IWE combina Word2vec con una técnica de mapeo de diccionario semántico para abordar los principales desafíos de la extracción de información de textos clínicos, que incluyen la ambigüedad del estilo narrativo del texto libre, las variaciones léxicas, el uso de frases agramaticales y telegráficas, el orden arbitrario de las palabras y la frecuente aparición de abreviaturas y acrónimos. Cabe destacar que el modelo IWE (entrenado con un conjunto de datos institucional) se tradujo con éxito a un conjunto de datos institucional diferente, lo que demuestra la buena generalización del enfoque entre instituciones.
Análisis
Las razones del éxito del aprendizaje de incrustaciones de palabras en el marco word2vec no se comprenden del todo. Goldberg y Levy señalan que la función objetivo de word2vec provoca que las palabras que aparecen en contextos similares tengan incrustaciones similares (medidas mediante la similitud del coseno ) y observan que esto concuerda con la hipótesis distribucional de JR Firth . Sin embargo, señalan que esta explicación es muy vaga y argumentan que sería preferible una explicación más formal. [ 4 ]
Levy et al. (2015) [ 27 ] muestran que gran parte del rendimiento superior de word2vec o incrustaciones similares en tareas posteriores no es resultado de los modelos en sí, sino de la elección de hiperparámetros específicos. Transferir estos hiperparámetros a enfoques más "tradicionales" produce rendimientos similares en tareas posteriores. Arora et al. (2016) [ 28 ] explican word2vec y algoritmos relacionados como inferencia para un modelo generativo simple para texto, que implica un proceso de generación de paseo aleatorio basado en un modelo de tema loglineal. Utilizan esto para explicar algunas propiedades de las incrustaciones de palabras, incluido su uso para resolver analogías.
Preservación de las relaciones semánticas y sintácticas

El enfoque de incrustación de palabras permite capturar diferentes grados de similitud entre palabras. Mikolov et al. (2013) [ 29 ] descubrieron que los patrones semánticos y sintácticos pueden reproducirse mediante aritmética vectorial. Patrones como "Hombre es a Mujer como Hermano es a Hermana" pueden generarse mediante operaciones algebraicas sobre las representaciones vectoriales de estas palabras, de modo que la representación vectorial de "Hermano" - "Hombre" + "Mujer" produce un resultado muy similar a la representación vectorial de "Hermana" en el modelo. Estas relaciones pueden generarse para una variedad de relaciones semánticas (como País-Capital) y sintácticas (por ejemplo, presente-pasado).
Esta faceta de word2vec se ha aprovechado en diversos contextos. Por ejemplo, word2vec se ha utilizado para mapear un espacio vectorial de palabras de un idioma a un espacio vectorial construido a partir de otro idioma. Las relaciones entre las palabras traducidas en ambos espacios pueden utilizarse para facilitar la traducción automática de nuevas palabras. [ 30 ]
Evaluación de la calidad de un modelo
Mikolov et al. (2013) [ 1 ] desarrollaron un enfoque para evaluar la calidad de un modelo word2vec que se basa en los patrones semánticos y sintácticos discutidos anteriormente. Desarrollaron un conjunto de 8.869 relaciones semánticas y 10.675 relaciones sintácticas que utilizan como referencia para probar la precisión de un modelo. Al evaluar la calidad de un modelo vectorial, un usuario puede basarse en esta prueba de precisión implementada en word2vec, [ 31 ] o desarrollar su propio conjunto de prueba que sea significativo para los corpus que componen el modelo. Este enfoque ofrece una prueba más exigente que simplemente argumentar que las palabras más similares a una palabra de prueba dada son intuitivamente plausibles. [ 1 ]
Parámetros y calidad del modelo
El uso de diferentes parámetros del modelo y diferentes tamaños de corpus puede afectar significativamente la calidad de un modelo word2vec. La precisión se puede mejorar de varias maneras, incluyendo la elección de la arquitectura del modelo (CBOW o Skip-Gram), el aumento del conjunto de datos de entrenamiento, el aumento del número de dimensiones del vector y el aumento del tamaño de la ventana de palabras consideradas por el algoritmo. Cada una de estas mejoras conlleva un aumento de la complejidad computacional y, por lo tanto, un mayor tiempo de generación del modelo. [ 1 ]
En modelos que utilizan grandes corpus y un elevado número de dimensiones, el modelo skip-gram ofrece la mayor precisión general y produce de forma consistente la mayor precisión en las relaciones semánticas, además de ofrecer la mayor precisión sintáctica en la mayoría de los casos. Sin embargo, el CBOW es menos costoso computacionalmente y produce resultados de precisión similares. [ 1 ]
En general, la precisión aumenta con la cantidad de palabras utilizadas y la cantidad de dimensiones. Mikolov et al. [ 1 ] informan que duplicar la cantidad de datos de entrenamiento resulta en un aumento de la complejidad computacional equivalente a duplicar la cantidad de dimensiones del vector.
Altszyler y coautores (2017) estudiaron el rendimiento de Word2vec en dos pruebas semánticas para diferentes tamaños de corpus. [ 32 ] Encontraron que Word2vec tiene una curva de aprendizaje pronunciada , superando a otra técnica de incrustación de palabras, el análisis semántico latente (LSA), cuando se entrena con un tamaño de corpus mediano a grande (más de 10 millones de palabras). Sin embargo, con un corpus de entrenamiento pequeño, LSA mostró un mejor rendimiento. Además, muestran que la mejor configuración de parámetros depende de la tarea y del corpus de entrenamiento. No obstante, para los modelos skip-gram entrenados en corpus de tamaño mediano, con 50 dimensiones, un tamaño de ventana de 15 y 10 muestras negativas parece ser una buena configuración de parámetros.
Véase también
Referencias
- 1 2 3 4 5 6 7 8 9 10 11 12 Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (16 de enero de 2013). "Estimación eficiente de representaciones de palabras en el espacio vectorial". arXiv : 1301.3781 [ cs.CL ].
- 1 2 3 Mikolov, Tomas; Sutskever, Ilya; Chen, Kai; Corrado, Greg S.; Dean, Jeff (2013). Representaciones distribuidas de palabras y frases y su composicionalidad . Advances in Neural Information Processing Systems . arXiv : 1310.4546 . Bibcode : 2013arXiv1310.4546M .
- 1 2 3 "Archivo de Google Code: almacenamiento a largo plazo para el alojamiento de proyectos de Google Code" . code.google.com . Consultado el 13 de junio de 2016 .
- 1 2 3 Goldberg, Yoav; Levy, Omer (2014). "word2vec explicado: derivación del método de incrustación de palabras de muestreo negativo de Mikolov et al." arXiv : 1402.3722 [ cs.CL ].
- ↑ Rong, Xin (5 de junio de 2016), Explicación del aprendizaje de parámetros de word2vec , arXiv : 1411.2738
- ↑ Hinton, Geoffrey E. "Aprendizaje de representaciones distribuidas de conceptos". Actas de la Reunión Anual de la Sociedad de Ciencias Cognitivas . Vol. 8. 1986.
- ↑ Rumelhart, David E.; McClelland, James L. (octubre de 1985). Sobre el aprendizaje de los tiempos pasados de los verbos en inglés (Informe).
- ↑ Elman, Jeffrey L. (1 de abril de 1990). "Encontrar estructura en el tiempo" . Cognitive Science . 14 (2): 179– 211. doi : 10.1016/0364-0213(90)90002-E . ISSN 0364-0213 .
- ↑ Mikolov, Tomáš; Karafiát, Martín; Burget, Lukáš; Černocký, Jan; Khudanpur, Sanjeev (26 de septiembre de 2010). "Modelo de lenguaje basado en redes neuronales recurrentes". Entre discursos 2010 . ISCA: ISCA. págs. 1045-1048 . doi : 10.21437/interspeech.2010-343 .
- ↑ US 9037464 , Mikolov, Tomas; Chen, Kai y Corrado, Gregory S. et al., "Cálculo de representaciones numéricas de palabras en un espacio de alta dimensión", publicado el 19 de mayo de 2015, asignado a Google Inc.
- 1 2 Mikolov, Tomáš (13 de diciembre de 2023). "Ayer recibimos un premio Test of Time en NeurIPS por el artículo word2vec de hace diez años" . Facebook .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ GloVe: Vectores globales para la representación de palabras (pdf) Archivado el 3 de septiembre de 2020 en Wayback Machine "Utilizamos nuestros conocimientos para construir un nuevo modelo de representación de palabras que llamamos GloVe, por Vectores Globales, porque las estadísticas del corpus global son capturadas directamente por el modelo."
- ↑ Joulin, Armand; Grave, Edouard; Bojanowski, Piotr; Mikolov, Tomas (9 de agosto de 2016). "Bolsa de trucos para una clasificación de texto eficiente". arXiv : 1607.01759 [ cs.CL ].
- ↑ Von der Mosel, Julian; Trautsch, Alexander; Herbold, Steffen (2022). "Sobre la validez de los transformadores preentrenados para el procesamiento del lenguaje natural en el dominio de la ingeniería de software". IEEE Transactions on Software Engineering . 49 (4): 1487– 1507. arXiv : 2109.04738 . doi : 10.1109/TSE.2022.3178469 . ISSN 1939-3520 . S2CID 237485425 .
- ↑ "Parámetro (hs y negativo)" . Grupos de Google . Consultado el 13 de junio de 2016 .
- ↑ "Visualización de datos mediante t-SNE" (PDF) . Journal of Machine Learning Research, 2008, vol. 9, p. 2595. Consultado el 18 de marzo de 2017 .
- 1 2 Le, Quoc; Mikolov, Tomas (mayo de 2014). "Representaciones distribuidas de oraciones y documentos". Actas de la 31.ª Conferencia Internacional sobre Aprendizaje Automático . arXiv : 1405.4053 .
- ↑ Rehurek, Radim. "Gensim" .
- ↑ Rheault, Ludovic; Cochrane, Christopher (3 de julio de 2019). "Incrustaciones de palabras para el análisis de la ubicación ideológica en corpus parlamentarios" . Análisis político . 28 (1).
- ↑ Nay, John (21 de diciembre de 2017). "Gov2Vec: Aprendizaje de representaciones distribuidas de instituciones y su texto legal" . SSRN . arXiv : 1609.06616 . SSRN 3087278 .
- 1 2 Angelov, Dimo (agosto de 2020). "Top2Vec: Representaciones distribuidas de temas". arXiv : 2008.09470 [ cs.CL ].
- ^ Angelov, Dimo (11 de noviembre de 2022). «Top2Vec» . GitHub .
- ↑ Campello, Ricardo; Moulavi, Davoud; Sander, Joerg (2013). "Agrupamiento basado en densidad mediante estimaciones jerárquicas de densidad" . Avances en el descubrimiento de conocimiento y la minería de datos . Notas de clase en informática. Vol. 7819. pp. 160–172 . doi : 10.1007/978-3-642-37456-2_14 . ISBN 978-3-642-37455-5.
- 1 2 Asgari, Ehsaneddin; Mofrad, Mohammad RK (2015). "Representación distribuida continua de secuencias biológicas para proteómica y genómica profunda" . PLOS ONE . 10 (11) e0141287. arXiv : 1503.05140 . Bibcode : 2015PLoSO..1041287A . doi : 10.1371/journal.pone.0141287 . PMC 4640716. PMID 26555596 .
- ↑ Ng, Patrick (2017). "dna2vec: Representaciones vectoriales consistentes de k-meros de longitud variable". arXiv : 1701.06279 [ q-bio.QM ].
- ↑ Banerjee, Imon; Chen, Matthew C.; Lungren, Matthew P.; Rubin, Daniel L. (2018). "Anotación de informes radiológicos mediante incrustaciones de palabras inteligentes: Aplicada a una cohorte multiinstitucional de tomografía computarizada de tórax" . Journal of Biomedical Informatics . 77 : 11–20 . doi : 10.1016/j.jbi.2017.11.012 . PMC 5771955. PMID 29175548 .
- ↑ Levy, Omer; Goldberg, Yoav; Dagan, Ido (2015). "Mejora de la similitud distribucional con lecciones aprendidas de incrustaciones de palabras" . Transactions of the Association for Computational Linguistics . 3. Transactions of the Association for Computational Linguistics: 211–225 . doi : 10.1162/tacl_a_00134 .
- ↑ Arora, S; et al. (Verano de 2016). "Un enfoque de modelo de variable latente para incrustaciones de palabras basadas en PMI" . Transactions of the Association for Computational Linguistics . 4 : 385–399 . arXiv : 1502.03520 . doi : 10.1162/tacl_a_00106 – vía ACLWEB.
- ↑ Mikolov, Tomás; Yih, Wen-tau; Zweig, Geoffrey (2013). "Regulades lingüísticas en representaciones de palabras en espacio continuo". HLT-Naacl : 746– 751.
- ↑ Jansen, Stefan (9 de mayo de 2017). "Traducción de palabras y frases con word2vec". arXiv : 1705.03127 [ cs.CL ].
- ↑ "Gensim - Aprendizaje profundo con word2vec" . Consultado el 10 de junio de 2016 .
- ↑ Altszyler, E.; Ribeiro, S.; Sigman, M.; Fernández Slezak, D. (2017). "La interpretación del significado de los sueños: resolución de la ambigüedad mediante el análisis semántico latente en un pequeño corpus de texto". Consciousness and Cognition . 56 : 178–187 . arXiv : 1610.01520 . doi : 10.1016/j.concog.2017.09.004 . PMID 28943127. S2CID 195347873 .
Enlaces externos
- Wikipedia2Vec( introducción )
Implementaciones
- do
- DO#
- Python (Spark)
- Python (TensorFlow)
- Python (Gensim)
- Java/Scala
- R
- Software científico gratuito
- Kits de herramientas para el procesamiento del lenguaje natural
- Redes neuronales artificiales
- Relaciones semánticas
- Software de 2013
- 2013 en inteligencia artificial