Articulo de referencia

Concordanciador

Un concordante es un programa informático que crea automáticamente una concordancia : un índice alfabético de todas las apariciones de una palabra o frase en un texto, mostrando...

Un concordante es un programa informático que crea automáticamente una concordancia : un índice alfabético de todas las apariciones de una palabra o frase en un texto, mostrando cada entrada con su contexto. Los concordantes son herramientas fundamentales en lingüística de corpus , lexicografía , traducción asistida por ordenador y enseñanza de idiomas. El formato de visualización más común es el de palabras clave en contexto (KWIC) , en el que cada coincidencia aparece centrada en una línea con un espacio fijo de palabras a su izquierda y derecha, lo que permite un análisis rápido de los patrones de uso en múltiples apariciones.

Historia

Concordancias precomputacionales

La compilación de concordancias es anterior a la invención de las computadoras por muchos siglos. Alrededor de 1230, el cardenal dominico francés Hugo de Saint-Cher dirigió a un equipo de frailes en la compilación de una concordancia de la Vulgata latina , generalmente considerada la primera concordancia sistemática de cualquier texto. [ 1 ] Para ayudar a los lectores a localizar pasajes, Hugo dividió cada capítulo bíblico en secciones identificadas con letras. Entre los hitos posteriores se incluyen una concordancia del Antiguo Testamento hebreo compilada por el rabino Mordecai Nathan (1448), la Concordancia completa de las Sagradas Escrituras de Alexander Cruden (1737) y el manuscrito Asaf ha-Mazkir , una concordancia inacabada del Talmud babilónico compilada por Moses Rigotz a principios del siglo XIX. [ 2 ]

Primera concordancia informática

La primera concordancia producida con ayuda informática fue el Index Thomisticus , un índice léxico exhaustivo de los escritos de Tomás de Aquino y su entorno , que suma aproximadamente 10,6 millones de palabras latinas. El sacerdote jesuita italiano Roberto Busa concibió el proyecto en 1946 y consiguió el patrocinio de IBM en 1949 tras una reunión con el presidente Thomas J. Watson . [ 3 ] Operadores de perforadoras de tarjetas en Gallarate, Italia, codificaron los textos en tarjetas perforadas a partir de 1950. El ejecutivo de IBM Paul Tasman desarrolló los métodos de procesamiento. La edición impresa completa de 56 volúmenes se terminó alrededor de 1980, seguida de una edición en CD-ROM en 1989 y una versión accesible en la web en 2005.

El formato KWIC

La visualización de palabras clave en contexto (KWIC) fue formalizada como una técnica computacional por Hans Peter Luhn , investigador de IBM, en un artículo de 1960 publicado en American Documentation . [ 4 ] En la salida KWIC, cada instancia del término de búsqueda (la palabra nodo ) se centra en una línea con una ventana fija de palabras a cada lado; al ordenar alfabéticamente las líneas resultantes por la palabra inmediatamente adyacente, se revelan patrones de colocación y fraseología de un vistazo. [ 5 ]

CACAO

Uno de los primeros programas dedicados a la concordancia fue COCOA (COunt and COncordance Generation on Atlas), creado en 1965 por DB Russell en el University College London y el Atlas Computer Laboratory en Harwell, Oxfordshire. [ 6 ] Escrito en aproximadamente 4000 tarjetas de FORTRAN , procesaba texto anotado con etiquetas de marcado planas y no jerárquicas y podía producir recuentos de palabras y concordancias en varios idiomas. En sus primeros seis meses, COCOA se había aplicado a textos en al menos seis idiomas. Una segunda versión diseñada para múltiples plataformas de mainframe se distribuyó a los centros de computación británicos a mediados de la década de 1970. La creciente insatisfacción con su interfaz y la eventual retirada del apoyo del Atlas Laboratory impulsaron a los organismos de financiación británicos a encargar un programa sucesor.

Programa de concordancia de Oxford

El Programa de Concordancia de Oxford (OCP) fue diseñado y escrito en FORTRAN por Susan Hockey e Ian Marriott en los Servicios Informáticos de la Universidad de Oxford (OUCS) entre 1979 y 1980 y se lanzó por primera vez en 1981. [ 7 ] Hockey y Marriott reconocieron que OCP debía mucho a COCOA y al sistema CLOC de la Universidad de Birmingham. OCP aceptaba el marcado en formato COCOA para codificar metadatos como autor, acto, escena y número de línea, y fue descrito por sus autores como "un programa de análisis de texto independiente de la máquina para producir listas de palabras, índices y concordancias en una variedad de idiomas y alfabetos". A mediados de la década de 1980, había sido licenciado a aproximadamente 240 instituciones en 23 países. [ 8 ] Una versión para computadora personal, Micro-OCP, fue desarrollada para la IBM PC y vendida por Oxford University Press desde finales de la década de 1980. La versión 2 fue reescrita en 1985-86 y documentada en el mismo artículo de 1987 por Hockey y su coautor John Martin. [ 7 ]

era de la computadora personal

La disponibilidad de ordenadores personales asequibles en las décadas de 1980 y 1990 permitió el desarrollo de aplicaciones de concordancia independientes que los analistas podían ejecutar localmente sin necesidad de instalaciones informáticas especializadas. MicroConcord , desarrollado por Mike Scott y Tim Johns y publicado por Oxford University Press en 1993 para MS-DOS, fue uno de los primeros concordantes diseñados específicamente para la enseñanza de idiomas en el aula. [ 9 ] WordSmith Tools , también desarrollado por Mike Scott, se lanzó por primera vez en 1996 y se convirtió en uno de los conjuntos de análisis de corpus más utilizados en la investigación lingüística académica. [ 10 ] Otras herramientas de esta época incluyen TACT (Universidad de Toronto, 1989), un conjunto de programas gratuitos para MS-DOS para el análisis de textos literarios, y MonoConc, un concordante para Windows creado por Michael Barlow.

Concordadores basados ​​en la web

Desde finales de la década de 1990 en adelante, los concordantes basados ​​en la web alojados en servidores remotos permitieron a los investigadores acceder a grandes corpus precargados a través del navegador sin necesidad de almacenamiento ni procesamiento local. Sketch Engine , desarrollado por Adam Kilgarriff y Pavel Rychlý (Universidad Masaryk), fue lanzado comercialmente en julio de 2003 por Lexical Computing Limited e introdujo los bocetos de palabras : perfiles de una página generados automáticamente sobre las relaciones gramaticales y colocaciones típicas de una palabra. [ 11 ] AntConc , creado por Laurence Anthony en la Universidad de Waseda, Tokio, se lanzó por primera vez en 2002 como software gratuito para Windows, macOS y Linux. [ 12 ]

Características

Los concordantes modernos suelen ofrecer una gama de funciones analíticas que van más allá de la visualización básica de KWIC. [ 5 ] [ 13 ] Estas comúnmente incluyen:

  • Visualización KWIC con la palabra del nodo centrada y las palabras de contexto en columnas alineadas, ordenables por la palabra una, dos o tres posiciones a la izquierda o derecha del nodo (L1–L3 y R1–R3).
  • Gráficos de concordancia , que visualizan la distribución de coincidencias como marcas a lo largo de una barra escalada que representa cada texto del corpus.
  • Frecuencia y listas de palabras , tanto alfabéticas como ordenadas por frecuencia.
  • Estadísticas de colocación , que identifican palabras que coocurren con el término de búsqueda con una frecuencia mayor que la esperada por azar, cuantificadas mediante medidas como la información mutua , la puntuación t o la verosimilitud logarítmica.
  • Análisis de palabras clave , que compara las frecuencias de las palabras entre un corpus de estudio y un corpus de referencia para identificar elementos estadísticamente distintivos.
  • Análisis de N-gramas , que consiste en encontrar secuencias de palabras que se repiten con frecuencia y que tienen una longitud específica.
  • Integración de etiquetado de partes de la oración , que permite realizar búsquedas filtradas por categorías gramaticales específicas.
  • Compatibilidad con Unicode para texto multilingüe

Además, los concordantes bilingües y paralelos muestran el texto alineado en dos o más idiomas uno al lado del otro, lo que permite comparar las equivalencias de traducción entre pares de idiomas.

Concordantes notables

Herramientas de WordSmith

Creado por Mike Scott y lanzado por primera vez en 1996, WordSmith Tools es un conjunto de herramientas de análisis de corpus para Windows que evolucionó a partir de MicroConcord. [ 10 ] [ 14 ] Sus tres módulos principales son Concord (concordancias KWIC), WordList (listas de palabras por frecuencia y alfabéticas) y Keywords (identificación estadística de palabras clave en relación con un corpus de referencia). Oxford University Press utilizó WordSmith Tools para la preparación de diccionarios. La versión 4.0 está disponible gratuitamente; las versiones posteriores son vendidas por Lexical Analysis Software Limited.

AntConc

AntConc es un conjunto de herramientas de concordancia multiplataforma y software libre creado por Laurence Anthony, profesor de Lingüística Aplicada en la Universidad de Waseda, Tokio. [ 15 ] Lanzado por primera vez en 2002 y descrito formalmente en un artículo académico de 2005, funciona en Windows, macOS y Linux. Sus herramientas incluyen un concordante KWIC, un gráfico de concordancia para visualizar la distribución en textos, una herramienta de colocaciones, una lista de palabras clave y un módulo de análisis de n-gramas. Debido a que es gratuito y solo requiere archivos de texto plano, AntConc se utiliza ampliamente en cursos de lingüística e investigación independiente en todo el mundo.

Motor de bocetos

Sketch Engine es un sistema de gestión y consulta de corpus creado conjuntamente por Adam Kilgarriff y Pavel Rychlý y lanzado en 2003 por Lexical Computing Limited. [ 11 ] [ 16 ] Proporciona acceso basado en navegador a más de 800 corpus en más de 100 idiomas. Además de la búsqueda de concordancias, ofrece bocetos de palabras, análisis de colocaciones, construcción de tesauros distribucionales, extracción de palabras clave y terminología, y análisis diacrónico. Es utilizado por importantes editoriales como Macmillan y Oxford University Press para la investigación lexicográfica. Una herramienta complementaria, SKELL (Sketch Engine for Language Learning), es de acceso gratuito para estudiantes individuales.

Matriz W

Wmatrix es un entorno de procesamiento de corpus basado en la web desarrollado por Paul Rayson en el Centro Universitario para la Investigación de Corpus Informáticos sobre el Lenguaje (UCREL), Universidad de Lancaster. [ 17 ] Junto con las concordancias y las listas de frecuencia, Wmatrix integra el etiquetado de partes del discurso CLAWS y el etiquetador semántico USAS, lo que permite el análisis de palabras clave simultáneamente a nivel de palabras individuales, categorías gramaticales y dominios semánticos, un enfoque que extiende los métodos estándar de palabras clave más allá de la simple comparación léxica.

ParaConc

ParaConc , desarrollado por Michael Barlow, es un concordante para Windows que permite trabajar con corpus paralelos (multilingües) y acepta hasta cuatro textos alineados en diferentes idiomas. [ 18 ] Diseñado para el análisis contrastivo, los estudios de traducción y la investigación sobre el aprendizaje de idiomas, incluye una función de "Palabras clave" que utiliza datos de frecuencia relativa para sugerir posibles equivalentes de traducción de una palabra de búsqueda.

Caja de Lancs

LancsBox es una herramienta gratuita y multiplataforma para el análisis de corpus, desarrollada en la Universidad de Lancaster bajo la dirección de Vaclav Brezina. [ 19 ] Lanzada en 2015, admite más de 15 idiomas e incluye un concordante KWIC, análisis de frecuencia y una herramienta GRAPH que representa las colocaciones como un diagrama de red interactivo. Integra TreeTagger para la anotación de partes de la oración y fue diseñada para facilitar el análisis de corpus en contextos de enseñanza e investigación.

Aplicaciones

Lingüística de corpus

Los concordantes son la principal herramienta analítica en la lingüística de corpus , ya que proporcionan acceso sistemático a patrones de uso en grandes muestras de texto auténtico. Entre sus usos más comunes en investigación se incluyen el estudio de colocaciones y fraseología, el análisis de la prosodia semántica , la comparación de variedades lingüísticas y el seguimiento de los cambios léxicos y gramaticales a lo largo del tiempo. Los grandes corpus de referencia, como el British National Corpus (aproximadamente 100 millones de palabras) y el Corpus of Contemporary American English (más de mil millones de palabras), se consultan habitualmente mediante concordantes web especializados.

Lexicografía

John Sinclair, de la Universidad de Birmingham, fue pionero en el uso sistemático de datos de concordancia en la elaboración de diccionarios a través del proyecto COBUILD , financiado por Collins desde principios de la década de 1980. El proyecto produjo el Diccionario de la Lengua Inglesa Collins COBUILD (1987), considerado generalmente el primer diccionario importante de inglés compilado completamente a partir de evidencia de corpus en lugar de ejemplos ilustrativos inventados. [ 20 ] Las líneas de concordancia permitieron a los lexicógrafos observar colocaciones auténticas, entornos sintácticos típicos y distinciones de registro que los métodos basados ​​en la introspección tendían a pasar por alto. Desde entonces, los métodos basados ​​en corpus se han convertido en práctica estándar en la lexicografía comercial.

Traducción asistida por ordenador

En el software de traducción asistida por ordenador (TAO), la búsqueda en concordancias permite a los traductores consultar una memoria de traducción para encontrar todas las instancias traducidas previamente de una palabra o frase en contexto, lo que garantiza la coherencia en todo un documento o proyecto. Las concordancias bilingües —que buscan simultáneamente en corpus paralelos alineados por oraciones en dos idiomas— también se utilizan para localizar equivalentes de traducción en textos ya traducidos. Las concordancias bilingües basadas en la web, como Linguee y Reverso Context, extienden esta capacidad a grandes corpus multilingües de acceso público.

enseñanza de idiomas

Tim Johns, de la Universidad de Birmingham, acuñó el término aprendizaje basado en datos (DDL, por sus siglas en inglés) alrededor de 1990 para describir un enfoque pedagógico en el que los estudiantes de idiomas utilizan concordantes para explorar evidencias de corpus y descubrir patrones gramaticales y léxicos de forma inductiva, actuando como "detectives del lenguaje" en lugar de receptores pasivos de reglas preestablecidas. Johns y Mike Scott desarrollaron MicroConcord (1993) específicamente para su uso en el aula. Desde entonces, el DDL se ha estudiado ampliamente en contextos de enseñanza de segundas lenguas y lenguas extranjeras, y se ha comprobado que fomenta la autonomía del estudiante y la comprensión de los patrones de colocación.

Véase también

Referencias

  1. "Concordancia de Hugh de St. Cher" . Christianity.com . Consultado el 1 de abril de 2025 .
  2. "Concordancia" . Enciclopedia Judía . 1906. Consultado el 4 de mayo de 2026 .
  3. "El padre Roberto Busa concibe el Índice Tomístico" . Historia de la Información . Consultado el 1 de abril de 2025 .
  4. Luhn, HP (1960). "Índice de palabras clave en contexto para literatura técnica (índice kwic)". American Documentation . 11 (4): 288– 295. doi : 10.1002/asi.5090110403 .
  5. 1 2 "Concordancia" . Lingüística de corpus: método, teoría y práctica . Universidad de Lancaster . Recuperado el 1 de abril de 2025 .
  6. "COCOA: Generación de conteo y concordancia en Atlas" . Chilton Computing . Consultado el 1 de abril de 2025 .
  7. 1 2 Hockey, Susan; Martin, John (1987). "The Oxford Concordance Program Version 2". Literary and Linguistic Computing . 2 (2): 125– 131. doi : 10.1093/llc/2.2.125 .
  8. "Programa de Concordancia de Oxford" . Centro CTI de Estudios Textuales, Universidad de Oxford . Consultado el 1 de abril de 2025 .
  9. "Tim Johns: la concordancia en el aula de idiomas" . lexically.net . Consultado el 1 de abril de 2025 .
  10. 1 2 "WordSmith Tools" . Software de análisis léxico . Consultado el 1 de abril de 2025 .
  11. ^ Kilgarriff , Adán; Rychlý, Pavel; Smrž, Pavel; Tugwell, David (2004). "El motor de bocetos" (PDF) . Actas del XI Congreso Internacional EURALEX . Lorient. págs. 105-116 . 
  12. Anthony, Laurence (2005). "AntConc: Diseño y desarrollo de un conjunto de herramientas de análisis de corpus de software libre para el aula de redacción técnica". Actas de la Conferencia Internacional de Comunicación Profesional del IEEE . págs. 729–737 . doi : 10.1109/IPCC.2005.1494244 . 
  13. Weisser, Martin. "Concordancers: An Overview" . Consultado el 1 de abril de 2025 .
  14. Scott, Mike. "Manual de WordSmith Tools Versión 4" (PDF) . Software de análisis léxico . Consultado el 1 de abril de 2025 .
  15. Anthony, Laurence. "AntConc" . Universidad de Waseda . Consultado el 1 de abril de 2025 .
  16. ^ Kilgarriff, Adán; Baisa, Vít; Busta, enero; Jakubíček, Miloš; Kovář, Vojtěch; Michelfeit, enero; Rychlý, Pavel; Suchomel, Vít (2014). "The Sketch Engine: diez años después". Lexicografía . 1 (1): 7– 36. doi : 10.1007/s40607-014-0009-9 .
  17. Rayson, Paul. "Wmatrix: Un entorno de procesamiento de corpus basado en la web" . UCREL, Universidad de Lancaster . Consultado el 1 de abril de 2025 .
  18. Barlow, Michael. "ParaConc" . Consultado el 1 de abril de 2025 .
  19. "LancsBox" . Universidad de Lancaster . Consultado el 1 de abril de 2025 .
  20. "La historia de COBUILD" . Diccionario Collins . Consultado el 1 de abril de 2025 .