El Proyecto Moby es una colección de recursos léxicos de dominio público creados por Grady Ward . Los recursos estaban dedicados al dominio público y ahora están reflejados en el Proyecto Gutenberg . En 2007 [update], contenía la base de datos fonética gratuita más grande, con 177.267 palabras y pronunciaciones correspondientes. [1]
Separador de guiones
El Moby Hyphenator II contiene guiones de 187.175 palabras y frases (incluidas 9.752 entradas en las que no se dan guiones, como through y avoir ). La codificación de caracteres parece ser MacRoman y los guiones se indican con una viñeta ( ⟨•⟩ , valor de carácter 165 decimal o A5 hexadecimal). Sin embargo, algunas entradas tienen una combinación de guiones reales y carácter 165, como "bar•ber-sur•geon".
Hay poca o ninguna documentación de las opciones de separación de palabras realizadas; los siguientes ejemplos pueden dar una idea del estilo de separación de palabras utilizado: at•mos•phere; at•tend•ant; ca•pac•i•ty; un•col•or•a•ble.
Idiomas
Moby Language II contiene listas de palabras de cinco idiomas: francés , alemán , italiano , japonés y español . Sus estadísticas son:
Sin embargo, algunas de las listas están contaminadas: por ejemplo, la lista japonesa contiene palabras inglesas como abnormal y palabras no escritas como abcdefgh y m,./ . También hay peculiaridades inusuales en la clasificación de estas listas, ya que la lista francesa contiene una lista alfabética directa, mientras que la lista alemana contiene la lista alfabética de palabras tradicionalmente escritas con mayúscula y luego la lista alfabética de palabras tradicionalmente escritas con minúscula. La lista de palabras italianas, sin embargo, no contiene ninguna palabra escrita con mayúscula.
Las listas no utilizan caracteres acentuados, por lo que "e^tre" es la forma en que un usuario buscaría la palabra francesa être ("ser").
Parte del discurso
Moby Part-of-Speech contiene 233.356 palabras descritas completamente por partes del discurso , enumeradas en orden de prioridad. El formato del archivo es palabra\partes del discurso , y se identifican las siguientes partes del discurso:
Pronunciador
El Pronunciador II de Moby contiene 177.267 entradas con sus pronunciaciones correspondientes. La mayoría de las entradas describen una sola palabra, pero aproximadamente 79.000 [2] contienen frases con guiones o con varias palabras, nombres o lexemas . La distribución del Proyecto Gutenberg también contiene una copia del cmudict v0.3. El archivo contiene líneas con el formato pronunciación de palabra[/parte gramatical] . Cada línea termina con el carácter de retorno de carro ASCII (CR, '\r', 0x0D, 13 en decimal).
El campo de palabra puede incluir apóstrofos (por ejemplo, isn't ), guiones (por ejemplo, able-bodied ) y varias palabras separadas por guiones bajos (por ejemplo, monkey_wrench ). Las palabras que no están en inglés generalmente se representan, como se indica en la documentación, sin acentos ni otros signos diacríticos. Sin embargo, en 36 entradas (por ejemplo, São_Miguel ), quedan algunos caracteres acentuados que no son ASCII, representados mediante la codificación Roman de Mac OS .
El campo de categoría gramatical se utiliza para desambiguar 770 de las palabras que tienen diferentes pronunciaciones según su categoría gramatical. Por ejemplo, para las palabras escritas de forma cerrada, el verbo tiene la pronunciación / ˈk l oʊ z / , mientras que el adjetivo es / ˈk l oʊ s / . A las categorías gramaticales se les han asignado los siguientes códigos :
A continuación se muestra la pronunciación. Hay varios símbolos especiales:
El resto de los símbolos se utilizan para representar caracteres del AFI . Las pronunciaciones son generalmente consistentes con un dialecto general americano del inglés, que exhibe la fusión padre-aburrimiento , la fusión prisa-furry y la división lote-tela , pero no exhibe la fusión cuna-atrapado o la fusión vino-whine . Cada fonema está representado por una secuencia de uno o más caracteres. Algunas de las secuencias están delimitadas con un carácter de barra "/", como se muestra en la siguiente tabla, pero tenga en cuenta que la secuencia para / ɔɪ / está delimitada por dos caracteres de barra en cada extremo:
A esta colección se suman una serie de secuencias adicionales que representan fonemas que se encuentran en varios otros idiomas. Estas secuencias se utilizan para codificar las palabras, frases y nombres que no están en inglés y que se incluyen en la base de datos. La siguiente tabla contiene estos fonemas adicionales, pero tenga en cuenta que no está claro en qué medida algunos de ellos pueden existir debido a errores de codificación.
Shakespeare
Moby Shakespeare contiene las obras completas e íntegras de Shakespeare . Este recurso específico no está disponible en el Proyecto Gutenberg, pero sí en una versión de 1993 en la web. [3]
Tesauro
El Moby Thesaurus II contiene 30.260 raíces de palabras, con 2.520.264 sinónimos y términos relacionados, un promedio de 83,3 por raíz de palabra. Cada línea consta de una lista de valores separados por comas , donde el primer término es la raíz de la palabra y todas las palabras siguientes son términos relacionados.
Grady Ward colocó este tesauro en el dominio público en 1996. También está disponible como paquete Debian, aunque el paquete ha sido descontinuado a partir de Bullseye . [4]
Palabras
Moby Words II es la lista de palabras más grande del mundo. [1] [ cita(s) adicional(es) necesaria(s ) ] La distribución consta de los siguientes 16 archivos:
Referencias
- ^ ab "Enlaces de recursos de ACL SIGLEX". Grupo de interés especial sobre el léxico de la Asociación de Lingüística Computacional. 13 de agosto de 2004. Archivado desde el original el 15 de diciembre de 2018. Consultado el 9 de mayo de 2022. Moby Words: más de 610 000 palabras y frases .
La lista de palabras más grande del mundo
- ^ Se obtiene ejecutando el comando UNIX grep '.*[-_].* .*' mobypron.unc | wc -l después de convertir los finales de línea y corregir algunos errores de codificación.
- ^ mobyshak.txt versión 1993
- ^ Tosi, Sandro (13 de julio de 2020). "RM: dict-moby-thesaurus -- RoQA; inactivo en el upstream (más de 10 años); solo para python2; sin dependencias externas; capacidad de respuesta extremadamente baja". Registros de informes de errores de Debian . Consultado el 10 de mayo de 2022 .
Enlaces externos
- Página de inicio del Proyecto Moby, Universidad de Sheffield; copia realizada por Wayback Machine de la página tal como estaba el 30 de septiembre de 2017. ("Última modificación: 24 de octubre de 2000") sitio de descarga en funcionamiento.
- Descargas del Proyecto Gutenberg
- Buscando rimas con Perl ; código correspondiente
- Wikcionario:Apéndice:Tesauro de Moby II