Articulo de referencia

Tatoeba

Tatoeba es una colección gratuita de oraciones de ejemplo con traducciones, pensada para estudiantes de idiomas extranjeros . Está disponible en más de 400 idiomas. Su nombre pr...

Tatoeba es una colección gratuita de oraciones de ejemplo con traducciones, pensada para estudiantes de idiomas extranjeros . Está disponible en más de 400 idiomas. Su nombre proviene de la expresión japonesa tatoeba (例えば) , que significa «por ejemplo». Es creada y mantenida por una comunidad de voluntarios mediante un modelo de colaboración abierta . Los colaboradores individuales se conocen como «Tatoebans». Está gestionada por la Asociación Tatoeba, una organización francesa sin ánimo de lucro financiada mediante donaciones.

Historia y desarrollo

En 2006, Trang Ho se sintió frustrada porque, a diferencia de algunos de sus homólogos japoneses, los diccionarios bilingües alemanes no incluían la búsqueda de texto completo de ejemplos de uso con traducciones. [ 1 ] Esto la llevó a imaginar su diccionario ideal [ 2 ] y a crear un prototipo alojado en SourceForge con el nombre de "multilangdict". [ 3 ] El enfoque principal ya era la colaboración colectiva para la creación de oraciones traducidas: "Algo parecido a Wikipedia, pero con la diferencia de que la gente añade oraciones, no artículos".

Paralelamente a sus estudios en la Universidad Tecnológica de Compiègne , Trang Ho mejoró gradualmente su sitio web con algunos compañeros. Reconstruyó el proyecto desde cero dos veces y lo renombró como Tatoeba. En septiembre de 2007, se importaron al Corpus Tatoeba aproximadamente 150 000 pares de oraciones inglés-japonés del Corpus Tanaka —una compilación de dominio público publicada en 2001 por el profesor de la Universidad de Hyogo, Yasuhito Tanaka, y mantenida por Jim Breen y Paul Blay—. [ 4 ] En diciembre de 2008, Trang Ho publicó la primera versión del código fuente actual, construido en torno a un modelo de datos más flexible . [ 5 ] Al mes siguiente, el sitio web se trasladó al dominio tatoeba.org. [ 6 ]

Durante el año académico 2009-2010, Allan Simon, entonces estudiante de SUPINFO , se convirtió en uno de los desarrolladores principales de Tatoeba. Junto con Trang Ho y otros jóvenes desarrolladores, hicieron de Tatoeba una plataforma más social: listas de oraciones, perfiles de usuario, mensajería privada y un muro inspirado en Facebook . También introdujeron funciones importantes como la vinculación de oraciones, el etiquetado y la búsqueda de "traducción de traducciones". En noviembre de 2010, Tatoeba superó la marca de las 600 000 oraciones. En un año, el número de oraciones añadidas diariamente se había multiplicado casi por 50. [ 7 ]

Entre 2014 y 2016, se formó un nuevo equipo de desarrolladores en torno a Trang Ho. [ 8 ]   Asesoraron a estudiantes en el Google Summer of Code 2014 [ 9 ] y agregaron características para mejorar la calidad del corpus.

Durante el período 2018-2020, el apoyo de la Fundación Mozilla como parte del proyecto Common Voice permitió a Tatoeba hacer que su plataforma fuera más abierta y fácil de usar. [ 10 ] [ 11 ]

Franqueza

Usar

Los usuarios pueden buscar palabras para recuperar oraciones que las utilicen. Los resultados se pueden filtrar por idioma, número de palabras, etiqueta y otros criterios. [ 12 ]

Cada oración se muestra junto a sus traducciones y a las "traducciones de las traducciones". Una sección de comentarios facilita la retroalimentación y las correcciones.

Los usuarios registrados pueden crear listas de oraciones descargables, que pueden ser privadas, públicas o colaborativas.

Contribución

Se anima a los tatoebans a contribuir en su idioma más fuerte. [ 13 ] Pueden añadir oraciones originales y traducir las existentes. Pueden revisar o comentar las oraciones de otros usuarios y «adoptar» oraciones sin autor. Los colaboradores avanzados también pueden etiquetar, enlazar y desenlazar oraciones.

Cuando el autor de una oración no responde a una solicitud de corrección, solo el responsable del corpus tiene la potestad de actualizar o eliminar la oración.

Gobernancia

Como fundadora de Tatoeba, Trang Ho ha sido durante mucho tiempo la principal impulsora del proyecto .

En 2011, creó una organización sin ánimo de lucro para supervisar el proyecto.

En 2022, decidió hacerse a un lado en favor de un pequeño grupo de Tatoebans experimentados. [ 14 ]

Idiomas

Diagrama simplificado de la estructura de datos subyacente de Tatoeba.

A abril de 2026, el Corpus Tatoeba cuenta con más de 13.400.000 oraciones en 429  idiomas. 69  de estos idiomas tienen 10.000  o más oraciones. Más de 1  millón de oraciones tienen grabaciones de audio. [ 15 ]

Las oraciones están interrelacionadas dentro de un grafo que tiene más de 25.900.000  enlaces. 276  pares de idiomas tienen más de 10.000  oraciones traducidas. [ 16 ]

Operación

Tatoeba recibió una subvención de Mozilla Drumbeat en diciembre de 2010. [ 18 ] [ 19 ]

Parte del trabajo en la infraestructura de Tatoeba fue patrocinado por Google Summer of Code , edición de 2014. [ 9 ]

Desde 2014, Tatoeba se ha mantenido gracias a donaciones. [ 20 ]

En mayo de 2018 recibieron una subvención de 25.000 dólares del programa de apoyo al código abierto de Mozilla (MOSS). [ 10 ]

En agosto de 2019 recibieron una subvención de 15.000 dólares del programa de apoyo al código abierto de Mozilla (MOSS). [ 11 ]

Acceso al contenido

Licencias

Por defecto, las oraciones del Corpus Tatoeba se publican bajo una licencia CC BY , [ 21 ] lo que permite su uso académico y otros fines. Los usuarios también pueden contribuir con oraciones bajo la licencia CC0 , aunque las traducciones de dichas oraciones actualmente no pueden compartir la misma licencia. [ 22 ]

Las grabaciones de audio de las oraciones utilizan la licencia elegida por el hablante, como CC BY, CC BY-SA, CC BY-NC o ninguna licencia pública. [ 23 ]

Uso sin conexión

Los visitantes pueden descargar pares de oraciones delimitadas por tabulaciones, listas para importar a Anki y software de repetición espaciada similar, en el sitio web de Tatoeba. [ 16 ]

Herramientas de desarrollo de software

Hay una API inestable disponible para los desarrolladores de software. [ 24 ]

Adquisición de una segunda lengua

Las oraciones de Tatoeba pueden usarse para construir referencias lexicográficas para estudiantes de idiomas. El diccionario japonés-inglés JMdict selecciona sus oraciones de ejemplo del Corpus Tatoeba. [ 25 ] OpenRussian es un diccionario ruso gratuito construido principalmente a partir del contenido de Wikcionario y Tatoeba. [ 26 ] GoodExample intenta extraer automáticamente un conjunto diverso de oraciones de ejemplo de alta calidad del Corpus Tatoeba en inglés. [ 27 ]

Los conjuntos de datos de Tatoeba pueden impulsar experiencias de aprendizaje incidental que combinan la adquisición de un idioma extranjero con las actividades cotidianas del usuario, como navegar por internet o leer libros. [ 28 ] [ 29 ] Un equipo del MIT Media Lab utilizó oraciones de ejemplo de Tatoeba en WordSense, una plataforma de realidad mixta que permite el "aprendizaje fortuito de idiomas en entornos reales". [ 30 ] Más recientemente, investigadores japoneses implementaron una función de búsqueda de Tatoeba en un entorno integrado de asistencia a la escritura. [ 31 ]

Aunque las oraciones del  corpus Tatoeba no son todas auténticas, a veces se utilizan para crear aplicaciones de aprendizaje basadas en datos . BES (Basic English Sentence) Search es una herramienta no comercial para encontrar oraciones en inglés de nivel principiante para su uso en materiales didácticos. [ 32 ] Contiene más de un millón de oraciones, la mayoría procedentes de Tatoeba. [ 33 ] Reverso utiliza corpus paralelos de Tatoeba en su concordante bilingüe comercial . [ 34 ]

También se utilizan oraciones de ejemplo como base para ejercicios. Charles Kelly y Paul Raine, ambos profesores de inglés como lengua extranjera en Japón, han desarrollado actividades de aprendizaje de idiomas basadas en oraciones seleccionadas del  Corpus Tatoeba. [ 35 ] [ 36 ] Clozemaster es un programa de autoaprendizaje de idiomas que genera pruebas de completar espacios en blanco gamificadas a partir de pares de oraciones de Tatoeba. [ 37 ] Algunos usuarios de Anki comparten tarjetas de memoria que fueron creadas usando Tatoeba. [ 38 ]

Lenguas regionales o minoritarias

Algunos activistas digitales lingüísticos contribuyen a proyectos colaborativos abiertos como Tatoeba, Wikipedia y Common Voice para promover su lengua minoritaria en espacios digitales. [ 39 ] Lenguas regionales como el cabilio , el catalán o el vasco pueden registrar más de cien miembros en Tatoeba. [ 40 ]

Lenguajes construidos

El contenido seleccionado de Tatoeba en esperanto está disponible en el DVD multilingüe Esperanto Elektronike publicado por E@I. [ 41 ] A noviembre de 2022, el esperanto es el quinto idioma pivote de Tatoeba , con más de 330 000 oraciones traducidas a al menos dos idiomas. [ 16 ] Otros idiomas construidos como Toki Pona , Interlingua , Klingon , Lojban e Ido también tienen una presencia significativa. [ 15 ]

Tecnología del lenguaje

Artículos de investigación sobre traducción automática que mencionan Tatoeba [ 42 ]

De 2008 a 2011, Francis Bond utilizó el Corpus Tatoeba para su investigación sobre la lengua japonesa. [ 43 ] [ 44 ]

Desde 2013, Jörg Tiedemann ha estado difundiendo los corpus paralelos de Tatoeba más ampliamente en la comunidad de traducción automática compartiéndolos en el repositorio OPUS y organizando el "Tatoeba  Translation  Challenge". [ 45 ] [ 46 ] Con el auge del aprendizaje profundo , los investigadores utilizan cada vez más los conjuntos de datos de Tatoeba para entrenar y evaluar sus modelos masivamente multilingües en tareas como la traducción automática , [ 47 ] la identificación de idiomas , [ 48 ] la búsqueda semántica , [ 49 ] y el reconocimiento de voz . [ 50 ]

Véase también

Referencias

  1. Trang. "La historia de Tatoeba" . Consultado el 8 de noviembre de 2022 .
  2. "Diccionario ideal de Trang.pdf" . Google Docs . Consultado el 8 de noviembre de 2022 .
  3. "Proyecto de diccionario de Trang" . sourceforge.net . 10 de abril de 2013.
  4. "Corpus Tanaka" . Wiki de EDRDG . Grupo de Investigación y Desarrollo de Diccionarios Electrónicos. 3 de febrero de 2011. Consultado el 20 de marzo de 2011 .
  5. Trang Ho (29 de noviembre de 2021). Tatoeba Stream #3 - Volviendo al pasado . Asociación Tatoeba . Recuperado el 8 de noviembre de 2022 vía YouTube .
  6. Trang. "Nueva dirección : tatoeba.org" . Consultado el 8 de noviembre de 2022 . 
  7. Trang. "Algunas estadísticas" . Consultado el 8 de noviembre de 2022 .
  8. AlanF. "Actualización sobre el desarrollo" . Consultado el 8 de noviembre de 2022 .
  9. 1 2 "Google Summer of Code 2014 Organization Association Tatoeba" . www.google-melange.com . Consultado el 26 de septiembre de 2022 .
  10. 1 2 "Premio MOSS para Tatoeba" . Consultado el 26 de septiembre de 2022 .
  11. 1 2 "Un segundo premio MOSS" . Consultado el 26 de septiembre de 2022 .
  12. "Búsqueda avanzada - Tatoeba" . tatoeba.org . Consultado el 21 de noviembre de 2023 .
  13. "Guía de inicio rápido" .
  14. "Hilo n.º 38883 - Tatoeba" . tatoeba.org . Consultado el 21 de noviembre de 2023 .
  15. 1 2 "Número de oraciones por idioma - Tatoeba" . tatoeba.org . Consultado el 22 de febrero de 2025 .
  16. 1 2 3 "Descargar oraciones - Tatoeba" . tatoeba.org . Consultado el 22 de febrero de 2025 .
  17. Exportaciones semanales de Tatoeba
  18. Ho, Trang (17 de enero de 2011). "Subvención de Mozilla Drumbeat" . Blog del proyecto Tatoeba . Consultado el 20 de marzo de 2011 .
  19. Moltke, Henrik (30 de diciembre de 2010). "Los mejores proyectos de Drumbeat: Tatoeba: una base de datos de oraciones libre y abierta" . Yoyodyne.cc . Archivado del original el 2 de enero de 2011. Recuperado el 20 de marzo de 2011. ... la Fundación Mozilla quiere alentar y ayudar al proyecto Tatoeba otorgándole una subvención Mozilla Drumbeat de 2500 USD.
  20. "Donaciones" . en.wiki.tatoeba.org .
  21. "Condiciones de uso" . Tatoeba.org . Consultado el 20 de marzo de 2011 .
  22. "Cómo contribuir bajo CC0" . en.wiki.tatoeba.org . Consultado el 25 de octubre de 2021 .
  23. "Todas las listas públicas que contienen "audio" (140) - Tatoeba" . tatoeba.org . Consultado el 25 de octubre de 2021 .
  24. «API de Tatoeba» . api.dev.tatoeba.org . Consultado el 21 de noviembre de 2023 .
  25. "WWWJDIC - INFORMACIÓN" . www.edrdg.org . Consultado el 13 de noviembre de 2022 .
  26. "Acerca de OpenRussian" . en.openrussian.org . Consultado el 16 de noviembre de 2022 .
  27. "Consideraciones legales - GoodExample" . www.goodexample.is . Consultado el 6 de diciembre de 2022 .
  28. Winiwarter, Werner (11 de diciembre de 2015). «JILL» . Actas de la 17.ª Conferencia Internacional sobre Integración de la Información y Aplicaciones y Servicios Web . iiWAS '15. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1-9 . doi : 10.1145/2837185.2837191 . ISBN  978-1-4503-3491-4. S2CID 2130581 . 
  29. "¡Lisons!" . fauu.github.io . Consultado el 2 de diciembre de 2022 .
  30. Vázquez, Christian David; Nyati, Afika Ayanda; Luh, Alejandro; Fu, Megan; Aikawa, Takako; Maes, Pattie (6 de mayo de 2017). "Aprendizaje fortuito de idiomas en realidad mixta" . Actas de la conferencia CHI de 2017 Resúmenes ampliados sobre factores humanos en sistemas informáticos . CHIEA '17. Nueva York, NY, EE.UU.: Asociación de Maquinaria de Computación. págs. 2172–2179 . doi : 10.1145/3027063.3053098 . ISBN  978-1-4503-4656-6. S2CID 1557887 . 
  31. Masato Hagiwara, Takumi Ito, Tatsuki Kuribayashi, Jun Suzuki y Kentaro Inui. 2019. TEASPN: Marco y protocolo para entornos integrados de asistencia a la escritura. En Actas de la Conferencia de 2019 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural y la 9.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (EMNLP-IJCNLP): Demostraciones de sistemas , páginas 229-234, Hong Kong, China. Asociación de Lingüística Computacional.
  32. "BES Search" . bessearch.ddl-study.org . Consultado el 14 de junio de 2023 .
  33. NISHIGAKI, C., & AKASEGAWA, S. Estudiantes de secundaria: ¿Qué podemos hacer para fomentar usuarios autónomos de corpus?
  34. "Reverso Context | Consideraciones legales sobre los corpus utilizados en el diccionario contextual" . context.reverso.net . Consultado el 2 de diciembre de 2022 .
  35. ^ Kelly, Charles (2012). "タトエバ・プロジェクト・コーパスを使った www. ManyThings. org の語学学習教材" (PDF),愛知工業大学研究報告 (47), 77-84.
  36. Raine, Paul (2018). "Construyendo oraciones con Web 2.0 y la base de datos Tatoeba" (PDF) . Accents Asia .
  37. "¿Qué es una prueba de completar espacios en blanco? Pruebas de eliminación de espacios en blanco y aprendizaje de idiomas" . Blog de Clozemaster . 17 de octubre de 2017.
  38. "Tatoeba - AnkiWeb" . ankiweb.net . Consultado el 2 de diciembre de 2022 .
  39. "Voces Emergentes - Conozca a Prasanta Hembram, un activista digital de la lengua santali de la India" . Voces Emergentes . 28 de junio de 2022. Consultado el 15 de noviembre de 2022 .
  40. "Idiomas de los miembros - Tatoeba" . tatoeba.org . Consultado el 15 de noviembre de 2022 .
  41. «Esperanto Elektronike | E@I» . 13 de octubre de 2017 . Consultado el 1 de noviembre de 2022 .
  42. "Google Académico" . scholar.google.com . Consultado el 13 de noviembre de 2022 .
  43. ^ Francis Bond, 栗林 孝行 [Takayuki Kuribayashi], 橋本 力 [Hashimoto Chikara] (2008) HPSGに基づくフリーな日本語ツリーバンクの構築 [Un Treebank japonés gratuito basado en HPSG]. En la 14ª Reunión Anual de la Asociación para el Procesamiento del Lenguaje Natural, Tokio.
  44. Eric Nichols, Francis Bond, Darren Scott Appling y Yuji Matsumoto (2010) Parafraseo de datos de entrenamiento para traducción automática estadística. Journal of Natural Language Processing, 17(3), páginas 101–122.
  45. "OPUS - un corpus paralelo de código abierto" . 30 de julio de 2013. Archivado del original el 30 de julio de 2013. Recuperado el 13 de noviembre de 2022 .
  46. Tiedemann, Jörg (13 de octubre de 2020). "El desafío de traducción de Tatoeba: conjuntos de datos realistas para la traducción automática multilingüe y con pocos recursos". arXiv : 2010.06354 [ cs.CL ].
  47. Equipo NLLB; Costa-jussà, Marta R.; Cross, James; Çelebi, Onur; Elbayad, Maha; Heafield, Kenneth; Heffernan, Kevin; Kalbassi, Elahe; Lam, Janice; Licht, Daniel; Maillard, Jean; Sun, Anna; Wang, Skyler; Wenzek, Guillaume; Youngblood, Al (25 de agosto de 2022). "Ningún idioma se queda atrás: escalando la traducción automática centrada en el ser humano". arXiv : 2207.04672 [ cs.CL ].
  48. "Identificación de idioma · fastText" . fasttext.cc . Consultado el 16 de noviembre de 2022 .
  49. Hu, Junjie; Ruder, Sebastian; Siddhant, Aditya; Neubig, Graham; Firat, Orhan; ​​Johnson, Melvin (4 de septiembre de 2020). "XTREME: Un banco de pruebas multitarea masivamente multilingüe para evaluar la generalización entre idiomas". arXiv : 2003.11080 [ cs.CL ].
  50. ^ Wang, Changhan; Pino, Juan; Wu, Ana; Gu, Jiatao (9 de junio de 2020). "CoVoST: un corpus multilingüe diverso de traducción de voz a texto". arXiv : 2002.01320 [ cs.CL ].
  • Sitio web oficial
  • Vídeo de Trang Ho presentando Tatoeba en MozFest 2019.
  • Estadísticas de Tatoeba
  • Desafío de traducción de Tatoeba