La extracción de terminología (también conocida como extracción de términos , extracción de glosario , reconocimiento de términos o minería terminológica ) es una subtarea de la extracción de información . El objetivo de la extracción de terminología es extraer automáticamente los términos relevantes de un corpus dado . [ 1 ]
En la era de la web semántica , un número creciente de comunidades y empresas en red comenzaron a acceder e interoperar a través de internet . Modelar estas comunidades y sus necesidades de información es importante para varias aplicaciones web , como rastreadores web basados en temas , [ 2 ] servicios web , [ 3 ] sistemas de recomendación , [ 4 ] etc. El desarrollo de la extracción de terminología también es esencial para la industria del lenguaje .
Uno de los primeros pasos para modelar un dominio de conocimiento es recopilar un vocabulario de términos relevantes para el dominio, que constituye la manifestación lingüística superficial de los conceptos del dominio . En la literatura se han descrito varios métodos para extraer automáticamente términos técnicos de almacenes de documentos específicos del dominio. [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ]
Por lo general, los enfoques para la extracción automática de términos utilizan procesadores lingüísticos ( etiquetado de partes de la oración , segmentación de frases ) para extraer candidatos terminológicos, es decir, frases nominales terminológicas sintácticamente plausibles . Las frases nominales incluyen compuestos (p. ej., "tarjeta de crédito"), frases nominales adjetivas (p. ej., "oficina de información turística local") y frases nominales preposicionales (p. ej., "junta directiva"). En inglés, los dos primeros (compuestos y frases nominales adjetivas) son los más frecuentes. [ 18 ] Las entradas terminológicas se filtran de la lista de candidatos mediante métodos estadísticos y de aprendizaje automático . Una vez filtrados, debido a su baja ambigüedad y alta especificidad, estos términos son particularmente útiles para conceptualizar un dominio de conocimiento o para apoyar la creación de una ontología de dominio o una base terminológica. Además, la extracción de terminología es un punto de partida muy útil para la similitud semántica , la gestión del conocimiento , la traducción humana y la traducción automática , etc.
Extracción de terminología bilingüe
Los métodos de extracción de terminología pueden aplicarse a corpus paralelos . Combinados con, por ejemplo , estadísticas de coocurrencia , se pueden obtener candidatos para traducciones de términos. [ 19 ] La terminología bilingüe también puede extraerse de corpus comparables [ 20 ] (corpus que contienen textos del mismo tipo y dominio, pero no traducciones de documentos entre sí).
Véase también
Referencias
- ↑ Alrehamy, Hassan H; Walker, Coral (2018). "SemCluster: Extracción automática no supervisada de frases clave mediante propagación de afinidad". Advances in Computational Intelligence Systems . Advances in Intelligent Systems and Computing. Vol. 650. pp. 222–235 . doi : 10.1007/978-3-319-66939-7_19 . ISBN 978-3-319-66938-0.
- ↑ Menczer F., Pant G. y Srinivasan P. Rastreadores basados en temas: problemas de aprendizaje automático .
- ↑ Fan J. y Kambhampati S. Una instantánea de los servicios web públicos , en ACM SIGMOD Record archive Volumen 34, Número 1 (marzo de 2005).
- ↑ Yan Zheng Wei, Luc Moreau, Nicholas R. Jennings. Un enfoque basado en el mercado para los sistemas de recomendación , en ACM Transactions on Information Systems (TOIS), 23(3), 2005.
- ↑ Bourigault D. y Jacquemin C. Extracción de términos + Agrupación de términos: una plataforma integrada para terminología asistida por computadora Archivado el 19 de junio de 2006 en Wayback Machine , en Proc. de EACL, 1999.
- ↑ Collier, N.; Nobata, C.; Tsujii, J. (2002). "Adquisición y clasificación automática de terminología mediante un corpus etiquetado en el dominio de la biología molecular". Terminology . 7 (2): 239– 257. doi : 10.1075/term.7.2.07col .
- ↑ K. Frantzi, S. Ananiadou y H. Mima. (2000). Reconocimiento automático de términos multipalabra: el método del valor C/valor NC. En: C. Nikolau y C. Stephanidis (Eds.) International Journal on Digital Libraries, Vol. 3, No. 2, pp. 115-130.
- ↑ K. Frantzi, S. Ananiadou y J. Tsujii. (1998) El método del valor C/valor NC para el reconocimiento automático de términos multipalabra , En: ECDL '98 Actas de la Segunda Conferencia Europea sobre Investigación y Tecnología Avanzada para Bibliotecas Digitales, pp. 585-604. ISBN 3-540-65101-2
- ↑ L. Kozakov; Y. Park; T. Fin; Y. Drissi; Y. Doganata y T. Cofino. (2004). "Extracción y utilización de glosarios en el sistema de búsqueda y entrega de información para el soporte técnico de IBM" (PDF) . IBM Systems Journal . 43 (3): 546– 563. doi : 10.1147/sj.433.0546 .
- ↑ Navigli R. y Velardi, P. Aprendizaje de ontologías de dominio a partir de almacenes de documentos y sitios web dedicados . Lingüística Computacional. 30 (2), MIT Press, 2004, pp. 151-179
- ↑ Oliver, A. y Vázquez, M. TBXTools: Una herramienta gratuita, rápida y flexible para la extracción automática de terminología . Actas de Avances Recientes en Procesamiento del Lenguaje Natural (RANLP 2015), 2015, págs. 473–479
- ↑ Y. Park, RJ Byrd, B. Boguraev. "Extracción automática de glosarios: más allá de la identificación de terminología" , Conferencia Internacional sobre Lingüística Computacional, Actas de la 19.ª conferencia internacional sobre lingüística computacional - Taipéi, Taiwán, 2002.
- ↑ Sclano, F. y Velardi, P. Archivado el 4 de mayo de 2012 en Wayback Machine . TermExtractor : una aplicación web para aprender la terminología compartida de las comunidades web emergentes. Próxima publicación en las Actas de la 3.ª Conferencia Internacional sobre Interoperabilidad para Software y Aplicaciones Empresariales (I-ESA 2007). Funchal (Isla de Madeira), Portugal, del 28 al 30 de marzo de 2007.
- ↑ P. Velardi, R. Navigli, P. D'Amadio. Minería de la web para crear glosarios especializados , IEEE Intelligent Systems, 23(5), IEEE Press, 2008, pp. 18-25.
- ↑ Wermter J. y Hahn U. Finding New terminology in Very large Corpora , en Proc. of K-CAP'05, 2–5 de octubre de 2005, Banff, Alberta, Canadá
- ↑ Wong, W., Liu, W. y Bennamoun, M. (2007) Determinación de la terminología para el aprendizaje de ontologías de dominio utilizando la prevalencia y la tendencia del dominio . En: 6.ª Conferencia Australiana sobre Minería de Datos (AusDM); Gold Coast. ISBN 978-1-920682-51-4
- ↑ Wong, W., Liu, W. y Bennamoun, M. (2007) Determinación de la terminología para el aprendizaje de ontologías de dominio en un marco probabilístico . En: 6.ª Conferencia Australiana sobre Minería de Datos (AusDM); Gold Coast. ISBN 978-1-920682-51-4
- ↑ Alrehamy, Hassan H; Walker, Coral (2018). "SemCluster: Extracción automática no supervisada de frases clave mediante propagación de afinidad". Advances in Computational Intelligence Systems . Advances in Intelligent Systems and Computing. Vol. 650. pp. 222–235 . doi : 10.1007/978-3-319-66939-7_19 . ISBN 978-3-319-66938-0.
- ↑ Macken, Lieve; Lefever, Els; Hoste, Veronique (2013). "TExSIS: Extracción de terminología bilingüe de corpus paralelos mediante alineación basada en fragmentos" . Terminology . 19 (1): 1– 30. doi : 10.1075/term.19.1.01mac . hdl : 1854/LU-2128573 .
- ↑ Sharoff, Serge; Rapp, Reinhard; Zweigenbaum, Pierre; Fung, Pascale (2013), Building and Using Comparable Corpora (PDF) , Berlín: Springer-Verlag, archivado del original (PDF) el 11 de mayo de 2021 , consultado el 28 de enero de 2018 .
- Tareas del procesamiento del lenguaje natural
- Ciencias de la información
- Terminología informática