Los corpus textuales (singular: corpus textual ) son conjuntos amplios y estructurados de textos que se han recopilado sistemáticamente. Los lingüistas de corpus y otras ramas de la lingüística utilizan los corpus textuales para realizar análisis estadísticos, comprobar hipótesis, encontrar patrones de uso del lenguaje, investigar los cambios y variaciones del lenguaje y enseñar a dominarlo. [1]
idioma en Inglés
- Corpus Nacional Americano
- Banco de ingles
- Corpus de libros
- Corpus Nacional Británico
- Corpus de Bergen sobre el lenguaje adolescente en Londres (COLT)
- Corpus Brown , que forma parte de la "familia Brown" de corpus, junto con LOB , Frown y F-LOB
- Corpus of Contemporary American English (COCA) 425 millones de palabras, 1990–2011. Búsqueda libre en línea
- Base de datos de recursos de corpus (CoRD), más de 80 corpus en idioma inglés. [2]
- Coruña Corpus, un corpus de escritos científicos en inglés moderno tardío que abarca el período 1700-1900, desarrollado por el grupo de investigación Muste de la Universidad de A Coruña
- Conjunto de datos de descubrimiento DBLP (D3), un corpus de publicaciones sobre ciencias de la computación con metadatos sensibles. [3]
- Corpus GUM, el corpus multicapa de código abierto de la Universidad de Georgetown, con muchas capas de anotación
- Corpus Ngram de Google Books [4] [5]
- Corpus Internacional de Inglés
- Corpus de inglés de Oxford
- RE3D (Conjunto de datos de evaluación de extracción de entidades y relaciones)
- Corpus de inglés americano hablado de Santa Bárbara
- Corpus escocés de textos y discursos
- Corpus Strathy de inglés canadiense
Lenguas europeas
- CETENFolha
- Vasco: [6]
- El corpus de textos electrónicos
- Corpus Inscriptionum Insularum Celticarum (CIIC), que cubre inscripciones irlandesas primitivas en Ogham
- Corpus Ngram de Google Books
- El corpus de la lengua georgiana
- Tesauro Linguae Graecae (griego antiguo)
- Corpus Nacional de Armenia Oriental (EANC) 110 millones de palabras. Búsqueda libre en línea.
- Corpus de textos en español de Molino de Ideas, que contiene 660 millones de palabras. [7]
- CorALit: el corpus de textos académicos en lengua lituana publicados entre 1999 y 2009 (aproximadamente 9 millones de palabras). Compilado en la Universidad de Vilnius, Lituania [8]
- Corpus de Referencia del Portugués Contemporáneo (CRPC)
- Corpus Nacional Turco [9]
- CoRoLa - El corpus de referencia de la lengua rumana contemporánea (Corpus reprezentativ al limbii române contemporane)
- TS Corpus: un amplio conjunto de corpus turcos. TS Corpus es un proyecto libre e independiente que tiene como objetivo crear corpus turcos, herramientas de procesamiento del lenguaje natural y conjuntos de datos lingüísticos...
- MacMorpho: un corpus anotado de textos en portugués brasileño
eslavo
Eslavo oriental
- N-korpus bielorruso
- Corpus nacional ruso
- Corpus general de Internet en ruso
- Corpus general anotado regionalmente del idioma ucraniano
- Corpus de la lengua ucraniana en el portal lingüístico Mova.info
- Corpus de la lengua ucraniana
- Araneo ruso
- Corpus ruso de textos biográficos [10]
- RuTweetCorp [11]
- RusAge: Corpus para la clasificación de textos según la edad
Eslavo del sur
- Corpus nacional búlgaro [12]
- Corpus electrónico macedonio [13]
- Corpus de la lengua croata
- Corpus nacional croata
- Corpus nacional esloveno
Eslavo occidental
Alemán
- Corpus de referencia alemán (DeReKo) Más de 4 mil millones de palabras de alemán escrito contemporáneo.
- Corpus gratuito de errores en alemán de personas con dislexia
Lenguas del Medio Oriente
- Corpus Inscriptionum Semiticarum
- Kanaanäische und Aramäische Inschriften
- Corpus Hamshahri ( persa )
- Persa en el corpus MULTEXT-EAST (persa) [15]
- Letras de Amarna (para acadio , egipcio, sumerogramas , etc.)
- TEP: Corpus paralelo inglés-persa de Teherán [16]
- TMC: Corpus monolingüe de Teherán , corpus estándar para el modelado del idioma persa [16]
- PTC: Persian Today Corpus: The Most Frequent Words of Today Persian, basado en un corpus de un millón de palabras (en persa: Vāže-hā-ye Porkārbord-e Fārsi-ye Emrūz ), Hamid Hassani , Teherán, Iran Language Institute (ILI), 2005, 322 pp. ISBN 964-8699-32-1
- Kurdish-corpus.uok.ac.ir (Corpus kurdo en dialecto sorani) Universidad del Kurdistán, Departamento de Lengua y Lingüística Inglesa
- Bijankhan Corpus Un corpus persa contemporáneo para investigaciones de PNL, Universidad de Teherán , 2012
- Proyecto de corpus de textos neoasirios
- Corpus árabe coránico (árabe clásico)
- Corpus de texto electrónico de la literatura sumeria
- Abrir el corpus cuneiforme ricamente anotado
- Corpus de texto de Asosoft [17] – Kurdo central (sorani)
- Thesaurus Linguae Aegyptiae (antiguo egipcio, afroasiático)
Lenguas turcas
- Corpus nacional uzbeko (20 millones de palabras)
Devanagari
- Corpus de texto en nepalí (más de 90 millones de palabras/más de 6,5 millones de oraciones)
Lenguas del este asiático
- Corpus de la lengua japonesa Kotonoha [18]
- Corpus sincrónico LIVAC (chino)
Lenguas del sur de Asia
Lenguas africanas
- Amárico : [21]
- Criollo (golfo de Guinea) : [22]
- Hausa : [23]
- Igbo : [24]
- Oromo : [25]
- Yoruba : [26]
- Zulú : [27]
Corpus paralelos de diversas lenguas
- El corpus de interpretación política chino/inglés (CEPIC) [28] [29] consta de transcripciones de discursos pronunciados por importantes figuras políticas de Hong Kong, Pekín, Washington DC y Londres, así como de sus textos traducidos/interpretados. Desarrollado por Jun Pan y la biblioteca de la HKBU.
- Corpus Europarl : actas del Parlamento Europeo de 1996 a 2012
- Corpus EUR-Lex: recopilación de todas las lenguas oficiales de la Unión Europea, creada a partir de la base de datos EUR-Lex [30]
- OPUS: Corpus paralelo de código abierto en muchos idiomas [31]
- Tatoeba Un corpus paralelo que contiene más de 8,9 millones de oraciones en varios idiomas; 107 idiomas tienen más de 1.000 oraciones cada uno; otros 81 idiomas tienen entre 100 y 1.000 oraciones cada uno. [32]
- NTU-Corpus multilingüe en 7 idiomas (ara, eng, ind, jpn, kor, mcn, vie) [33] (repositorio heredado)
- Corpus SeedLing: un corpus semilla para el Proyecto de Lenguaje Humano con más de 1000 idiomas de diversas fuentes. [34]
- Textos paralelos GRALIS para varias lenguas eslavas, compilados por el Instituto de Lenguas Eslavas de la Universidad de Graz (Branko Tošović et al.)
- El Corpus Paralelo ACTRES (P-ACTRES 2.0) es un corpus bidireccional inglés-español que consta de textos originales en un idioma y su traducción al otro. P-ACTRES 2.0 contiene más de 6 millones de palabras considerando ambas direcciones en conjunto. [35]
- El corpus paralelo multilingüe JRC-Acquis del conjunto del derecho de la Unión Europea (UE): Acquis Communautaire con 231 pares de lenguas. [36]
- Corpus paralelo de actas del Parlamento Europeo 1996-2011
- El proyecto Opus tiene como objetivo recopilar corpus paralelos disponibles de forma gratuita.
- Corpus bilingüe japonés-inglés de artículos de Kioto de Wikipedia Archivado el 22 de agosto de 2012 en Wayback Machine
- COMPARA – Corpus paralelos portugués/inglés
- BÚSQUEDA DE TÉRMINOS – Corpus paralelos inglés/ruso/francés (Principales tratados internacionales, convenciones, acuerdos, etc.)
- TradooIT – Inglés/Francés/Español – Herramientas gratuitas en línea
- Nunavut Hansard - corpus paralelo inglés/inuktitut
- ParaSol – Un corpus paralelo de lenguas eslavas y otras
- Glosbe: corpus paralelos multilingües Archivado el 27 de mayo de 2013 en Wayback Machine con interfaz de búsqueda en línea
- InterCorp: un corpus paralelo multilingüe en 40 idiomas alineados con el checo, interfaz de búsqueda en línea
- myCAT – Olanto, concordante (AGPL de código abierto) con búsqueda en línea en corpus JCR y UNO
- TAUS, con interfaz de búsqueda en línea.
- Corpora paralelos multilingües de linguatools, interfaz de búsqueda en línea.
- Corpus EUR-Lex: el corpus creado a partir de la base de datos EUR-Lex está compuesto por el derecho de la Unión Europea y otros documentos públicos de la Unión Europea.
- Language Grid: plataforma de servicios multilingües que incluye servicios de texto paralelo
Corpora comparables
- El Corpus of Political Speeches contiene cuatro colecciones de discursos políticos en inglés y chino: The Corpus of US Presidential Speeches (1789-2015), The Corpus of Policy Address by Hong Kong Governors (1984-1996) and Hong Kong Chief Executives (1997-2014), The Corpus of Speeches gave on New Year's days and Double Tenth days by Taiwan Presidents (1978-2014), y The Corpus of Report on the Work of the Government by Premiers of the People's Republic of China (1984-2013). Desarrollado por la biblioteca de la HKBU.
- WaCky - La iniciativa genial sobre la Web como corpus La Web como corpus (inglés, francés, alemán, italiano)
- Colección de corpus de idiomas similares para desambiguación (DSLCC) [37] (bosnio, croata, serbio, indonesio, malayo, checo, eslovaco, portugués brasileño, portugués europeo, español peninsular, español argentino)
- Corpora comparables de Wikipedia ( requiere registro ) cuando (41 millones de artículos de Wikipedia alineados para 253 pares de idiomas)
- La familia de corpus TenTen : corpus web comparables con un tamaño objetivo de 10 mil millones de palabras. Estos corpus están disponibles en el sistema de gestión de corpus Sketch Engine . Actualmente, existen corpus TenTen para más de 30 idiomas (como el corpus TenTen en inglés, [38] el corpus TenTen en árabe, [39] el corpus TenTen en español, [40] el corpus TenTen en ruso, [41] [42] ). La descripción general de los corpus TenTen existentes se puede encontrar en https://www.sketchengine.co.uk/documentation/tenten-corpora/
- Corpora web JSI con marca de tiempo: corpora web de artículos de noticias extraídos de una lista de canales RSS. Los corpora de canales de noticias se están preparando en el marco del proyecto implementado por el Instituto Jožef Stefan en el instituto de investigación científica esloveno. [43] y publicado en Sketch Engine. Hay más información sobre el proyecto en los sitios web del proyecto.
Corpora L2 (Inglés)
- Corpus de aprendizaje de Cambridge [44]
- Corpus of Academic Written and Spoken English (CAWSE), [45] una colección de muestras de inglés de estudiantes chinos en entornos académicos. Descargable gratuitamente en línea.
- Inglés como lengua franca en entornos académicos (ELFA), [46] un corpus ELF académico. [47] [48]
- Corpus Internacional de Inglés para Estudiantes (ICLE), [49] un corpus de inglés escrito para estudiantes.
- Base de datos internacional de interlenguaje inglés hablado de Lovaina (LINDSEI), [50] un corpus de inglés hablado por estudiantes.
- Corpus Trinity Lancaster, uno de los corpus más grandes de inglés hablado como segunda lengua. [51] [52]
- Corpus del Instituto de Lengua Inglesa de la Universidad de Pittsburgh (PELIC) [53]
- Corpus Internacional de Inglés de Viena-Oxford (VOICE), [54] un corpus ELF. [47]
Referencias
- ^ Leech, Geoffrey (2007). "Teaching and Language Corpora: a convergence" (Enseñanza y corpus lingüísticos: una convergencia). En Wichmann, A.; et al. (eds.). Teaching and Language Corpora (Enseñanza y corpus lingüísticos ). Londres: Longman. pág. 9.
- ^ "Base de datos de recursos de corpus (CoRD)". Departamento de Inglés, Universidad de Helsinki.
- ^ Wahle, Jan Philip; Ruas, Terry; Mohammad, Saif; Gipp, Bela (2022). "D3: Un conjunto masivo de metadatos académicos para analizar el estado de la investigación en ciencias de la computación". Actas de la decimotercera conferencia sobre recursos lingüísticos y evaluación . Marsella, Francia: Asociación Europea de Recursos Lingüísticos: 2642–2651. arXiv : 2204.13384 .
- ^ El profesor Mark Davies de BYU creó una herramienta en línea para buscar en el corpus de idioma inglés de Google, extraído de Google Books, en http://googlebooks.byu.edu/x.asp.
- ^ "Buscador de frases".Un motor de búsqueda para el Corpus Ngram de Google Books que admite consultas comodín y ofrece una API.
- ^ [1], Corpus vascos
- ^ (en español) "Molinolabs - corpus". molinolabs.com . Consultado el 12 de enero de 2014 .
- ^ "CorALit - CorALit - Lietuvių mokslo kalbos tekstynas". coralit.lt . Consultado el 12 de enero de 2014 .
- ^ "Corpus Nacional Turco - Türkçe Ulusal Derlemi - Página de inicio". tnc.org.tr. Consultado el 12 de enero de 2014 .
- ^ Glazkova, A (2020). "Clasificación temática de fragmentos de texto teniendo en cuenta su contexto más cercano". Automatización y control remoto . 81 (12): 2262–2276. doi :10.1134/S0005117920120097. S2CID 231929892.
- ^ Rubtsova, Yu (2015). "Construcción de un corpus para el entrenamiento de clasificación de sentimientos". Software & Systems . 1 : 72–78. doi :10.15827/0236-235X.109.072-078.
- ^ "Actualizado". search.dcl.bas.bg . Consultado el 12 de enero de 2014 .
- ^ "Електронски корупус на македонски книжевни текстови".
- ^ "Portál | Český národní korpus".
- ^ Zdravkova, Katrina; Tufiş, Dan; Simov, Kiril; Radziszewski, Adam; Qasemizadeh, Behrang; Sacerdote-Dorman, Greg; Petkevič, Vladimír; Oravecz, Csaba; Krstev, Cvetana; Kotsyba, Natalia; Kaalep, Heiki-Jaan; Ide, Nancy; Garabík, Radovan; Dimitrova, Ludmila; Derzhanski, Iván; Barbu, Ana-Maria; Erjavec, Tomaž (14 de mayo de 2010). "Disponible en CLARIN". http://nl.ijs.si/me/v4/ .
{{cite journal}}: Enlace externo en( ayuda )|journal= - ^ ab "University of Tehran NLP Lab". ece.ut.ac.ir. Archivado desde el original el 28 de enero de 2014. Consultado el 12 de enero de 2014 .
- ^ Hadi Veisi, Mohammad MohammadAmini, Hawre Hosseini; Hacia el procesamiento del idioma kurdo: experimentos en la recopilación y procesamiento del corpus de texto de AsoSoft, Digital Scholarship in the Humanities, fqy074, https://doi.org/10.1093/llc/fqy074
- ^ "KOTONOHA「現代日本語書き言葉均衡コーパス」少納言". kotonoha.gr.jp . Consultado el 12 de enero de 2014 .
- ^ "Descargar Corpora Hindi".
- ^ D. Upeksha, C. Wijayarathna, M. Siriwardena, L. Lasandun, C. Wimalasuriya, N. de Silva y G. Dias. 2015. Implementación de un corpus para el idioma cingalés. En Simposio sobre tecnología lingüística para el sur de Asia .
- ^ Glosa (uio.no)
- ^ "Los corpus criollos del Golfo de Guinea". Mayo de 2014. págs. 523–529.
- ^ https://arxiv.org/pdf/2102.06991.pdf, https://wortschatz.uni-leipzig.de/en/download/Hausa
- ^ "IgTenTen – Corpus igbo de la web | Sketch Engine". 20 de junio de 2022.
- ^ "Corpus de texto Oromo | Sketch Engine". 15 de enero de 2019.
- ^ https://www.researchgate.net/publication/336274457_Digital_Yoruba_Corpus, https://www.sketchengine.eu/corpora-and-languages/yoruba-text-corpora/
- ^ "Descargar Corpora Zulu".
- ^ Pan, Jun (2019). "El corpus de interpretación política chino/inglés (CEPIC). Biblioteca de la Universidad Bautista de Hong Kong" . Consultado el 3 de enero de 2022 .
- ^ Pan, Jun (30 de octubre de 2019). "El corpus de interpretación política chino/inglés (CEPIC): un nuevo recurso electrónico para traductores e intérpretes". Actas del segundo taller Tecnología de traducción e interpretación informada por humanos asociada con RANLP 2019. Incoma Ltd., Shoumen, Bulgaria: 82–88. doi : 10.26615/issn.2683-0078.2019_010 . S2CID 211257773.
- ^ "EUR-Lex Corpus". sketchengine.co.uk. 2 de junio de 2016. Consultado el 27 de octubre de 2016 .
- ^ "OPUS - un corpus paralelo de código abierto". opus.lingfil.uu.se . Consultado el 12 de enero de 2014 .
- ^ "Tatoeba - Número de oraciones por idioma". tatoeba.org . Consultado el 23 de noviembre de 2020 .
- ^ Liling Tan y Francis Bond (14 de mayo de 2012). "Building and Annotating the Linguistically Diverse NTU-MC (NTU — Multilingual Corpus)" (PDF) . Revista internacional de procesamiento del lenguaje asiático . 22 (4): 161–174. Archivado desde el original (PDF) el 16 de enero de 2014 . Consultado el 12 de enero de 2014 .
- ^ Guy Emerson, Liling Tan, Susanne Fertmann, Alexis Palmer y Michaela Regneri. 2014. SeedLing: construcción y uso de un corpus de semillas para el Proyecto de Lenguaje Humano. En Actas del taller sobre el uso de métodos computacionales en el estudio de lenguas en peligro de extinción (ComputEL). Baltimore, Estados Unidos.
- ^ H. Sanjurjo-González y M. Izquierdo. 2019. P-ACTRES 2.0: Un corpus paralelo para la investigación translingüística. En Corpus paralelos para estudios contrastivos y de traducción: nuevos recursos y aplicaciones (pp. 215-231). John Benjamins Publishing.
- ^ Ralf, Ralf Steinberger; Pouliquén, Bruno; Widiger, Anna; Ignat, Camelia; Erjavec, Tomaž; Tufiş, Dan; Varga, Daniel (2006). "El JRC-Acquis: un corpus paralelo alineado multilingüe con más de 20 idiomas" . Actas de la Quinta Conferencia Internacional sobre Evaluación y Recursos Lingüísticos (LREC'2006). Génova, Italia, 24 a 26 de mayo de 2006.
- ^ Liling Tan, Marcos Zampieri, Nikola Ljubešic y Jörg Tiedemann. Fusión de fuentes de datos comparables para la discriminación de idiomas similares: la colección de corpus DSL. En Actas del 7.º Taller sobre construcción y uso de corpus comparables (BUCC). 2014.
- ^ Kilgarriff, Adam (2012). "Conocer su corpus". Texto, discurso y diálogo . Apuntes de clase en informática. Vol. 7499. págs. 3–15. CiteSeerX 10.1.1.452.8074 . doi :10.1007/978-3-642-32790-2_1. ISBN . 978-3-642-32789-6.
- ^ Belinkov, Y., Habash, N., Kilgarriff, A., Ordan, N., Roth, R. y Suchomel, V. (2013). arTen-Ten: un corpus nuevo y vasto para el árabe. Actas de WACL .
- ^ Kilgarriff, A., & Renau, I. (2013). esTenTen, un vasto corpus web de español peninsular y americano. Procedia - Ciencias Sociales y del Comportamiento , 95, 12-19.
- ^ Хохлова, М. B. (2016). Обзор больших русскоязычных корпусов текстов. En Материалы научной конференции" Интернет и современное общество" (págs. 74-77).
- ^ Khokhlova, M. (2016). Comparación de sustantivos de alta frecuencia desde la perspectiva de grandes corpus. RASLAN 2016 Avances recientes en el procesamiento del lenguaje natural eslavo , 9.
- ^ Trampuš, M., y Novak, B. (octubre de 2012). Elementos internos de un servicio de noticias web agregado. En Actas de la Decimoquinta Conferencia Internacional sobre Ciencias de la Información IS SiKDD 2012 (pp. 431-434)
- ^ "Cambridge English Corpus", Wikipedia , 27 de septiembre de 2019 , consultado el 7 de enero de 2020
- ^ "CAWSE Corpus - Universidad de Nottingham Ningbo China - 宁波诺丁汉大学". nottingham.edu.cn . Consultado el 7 de enero de 2020 .
- ^ "El inglés como lengua franca en el ámbito académico". Universidad de Helsinki . 23 de marzo de 2018 . Consultado el 7 de enero de 2020 .
- ^ ab "El inglés como lengua franca", Wikipedia , 14 de diciembre de 2019 , consultado el 7 de enero de 2020
- ^ Mauranen, A (2010). "El inglés como lengua franca académica: el proyecto ELFA". Inglés para fines específicos . 29 (3): 183–190. doi :10.1016/j.esp.2009.10.001.
- ^ "ICLE". UCLouvain . Consultado el 7 de enero de 2020 .
- ^ "LINDSEI". UCLouvain (en francés) . Consultado el 7 de enero de 2020 .
- ^ "Trinity Lancaster Corpus | ESRC Centre for Corpus Approaches to Social Science (CASS)" (Corpus de Trinity Lancaster | Centro de enfoques de corpus para las ciencias sociales [CASS]) . Consultado el 7 de enero de 2020 .
- ^ Gablasova, D (2019). "El Corpus Trinity Lancaster: desarrollo, descripción y aplicación". Revista internacional de investigación de corpus de aprendizaje . 5 (2): 126–158. doi : 10.1075/ijlcr.19001.gab .
- ^ Juffs, A., Han, NR., y Naismith, B. (2020). El corpus de lengua inglesa de la Universidad de Pittsburgh (PELIC) [Conjunto de datos]. doi :10.5281/zenodo.3991977
- ^ "Proyecto". univie.ac.at . Consultado el 7 de enero de 2020 .