Articulo de referencia

Simulación genética

Gensim es una biblioteca de código abierto para modelado de temas no supervisado , indexación de documentos , recuperación por similitud y otras funcionalidades de procesamiento...

Gensim es una biblioteca de código abierto para modelado de temas no supervisado , indexación de documentos , recuperación por similitud y otras funcionalidades de procesamiento del lenguaje natural , utilizando aprendizaje automático estadístico moderno .

Gensim está implementado en Python y Cython para mejorar el rendimiento. Gensim está diseñado para manejar grandes colecciones de texto mediante el uso de transmisión de datos y algoritmos incrementales en línea, lo que lo diferencia de la mayoría de los demás paquetes de software de aprendizaje automático que se enfocan únicamente en el procesamiento en memoria.

Características principales

Gensim incluye implementaciones paralelizadas transmitidas de los algoritmos fastText , [2] word2vec y doc2vec, [3] así como análisis semántico latente (LSA, LSI, SVD), factorización matricial no negativa (NMF), asignación de Dirichlet latente (LDA), tf-idf y proyecciones aleatorias . [4]

Algunos de los nuevos algoritmos en línea de Gensim también se publicaron en la tesis doctoral de 2011 Escalabilidad del análisis semántico en el procesamiento del lenguaje natural de Radim Řehůřek, el creador de Gensim. [5]

Usos de Gensim

La biblioteca Gensim se ha utilizado y citado en más de 1400 aplicaciones comerciales y académicas hasta 2018, [6] en una amplia gama de disciplinas, desde medicina hasta análisis de reclamaciones de seguros y búsqueda de patentes. [7] El software ha sido abordado en varios artículos, podcasts y entrevistas nuevos. [8] [9] [10]

Soporte comercial y gratuito

El código fuente abierto se desarrolla y aloja en GitHub [11] y se mantiene un foro de soporte público en Google Groups [12] y Gitter . [13]

Gensim cuenta con el apoyo comercial de la empresa rare-technologies.com, que también ofrece tutorías para estudiantes y proyectos de tesis académicas para Gensim a través de su programa de incubación de estudiantes. [14]

Referencias

  1. ^ "Versión 4.3.2". 24 de agosto de 2023. Consultado el 18 de septiembre de 2023 .
  2. ^ Entrenamiento escalable *2vec
  3. ^ Aprendizaje profundo con word2vec y Gensim
  4. ^ Radim Řehůřek y Petr Sojka (2010). Marco de software para modelado de temas con grandes corpus. Proc. Taller LREC sobre nuevos desafíos para marcos de trabajo de NLP
  5. ^ Řehůřek, Radim (2011). "Escalabilidad del análisis semántico en el procesamiento del lenguaje natural" (PDF) . Consultado el 27 de enero de 2015. Mi paquete de software gensim de código abierto que acompaña a esta tesis
  6. ^ Citas académicas de Gensim
  7. ^ Adoptantes comerciales de Gensim
  8. ^ Podcast.__init__ episodio #71 en Gensim
  9. ^ Entrevista con Radim Řehůřek, creador de Gensim
  10. ^ "Entrevista de DecisionStats Radim Řehůřek Gensim #python". 8 de diciembre de 2015.
  11. ^ Código fuente de Gensim en Github
  12. ^ Lista de correo Gensim en Google Groups
  13. ^ Sala de chat de Gensim en Gitter
  14. ^ Incubadora de código abierto de Gensim
  • Sitio web oficial


Retrieved from "https://en.wikipedia.org/w/index.php?title=Gensim&oldid=1217334969"