Articulo de referencia

Colación

La cotejación consiste en organizar la información escrita en un orden estándar. Muchos sistemas de cotejación se basan en el orden numérico o alfabético , o en extensiones y co...

La cotejación consiste en organizar la información escrita en un orden estándar. Muchos sistemas de cotejación se basan en el orden numérico o alfabético , o en extensiones y combinaciones de ambos. La cotejación es un elemento fundamental de la mayoría de los sistemas de archivo de oficina , catálogos de bibliotecas y libros de referencia .

La cotejación se diferencia de la clasificación en que las clases en sí mismas no están necesariamente ordenadas. Sin embargo, incluso si el orden de las clases es irrelevante, los identificadores de las clases pueden pertenecer a un conjunto ordenado, lo que permite que un algoritmo de ordenación organice los elementos por clase.

Formalmente hablando, un método de cotejo normalmente define un orden total en un conjunto de identificadores posibles, llamados claves de ordenación, lo que produce, en consecuencia, un preorden total en el conjunto de elementos de información (los elementos con el mismo identificador no se colocan en ningún orden definido).

Un algoritmo de intercalación, como el algoritmo de intercalación Unicode, define un orden comparando dos cadenas de caracteres y decidiendo cuál debe ir antes que la otra. Una vez definido el orden, se puede utilizar un algoritmo de ordenación para colocar una lista de cualquier número de elementos en dicho orden.

La principal ventaja de la intercalación es que permite al usuario encontrar un elemento en la lista de forma rápida y sencilla, o confirmar su ausencia. En sistemas automáticos, esto se puede realizar mediante un algoritmo de búsqueda binaria o interpolación ; la búsqueda manual puede llevarse a cabo mediante un procedimiento similar, aunque a menudo se realiza de forma inconsciente. Otras ventajas son la facilidad para encontrar el primer o el último elemento de la lista (lo cual resulta especialmente útil con datos ordenados numéricamente) o elementos dentro de un rango determinado (útil también con datos numéricos y alfabéticos, cuando solo se conocen las primeras letras del elemento o elementos buscados).

Pedidos

Numérico y cronológico

Las cadenas de caracteres que representan números pueden ordenarse según los valores numéricos que representan. Por ejemplo: "−4", "2.5", "10", "89", "30,000". Sin embargo, la aplicación directa de este método solo proporciona un orden parcial, ya que diferentes cadenas pueden representar el mismo número (como "2" y "2.0" o, en notación científica , "2e3" y "2000").

Se puede adoptar un enfoque similar con cadenas de texto que representen fechas u otros elementos que puedan ordenarse cronológicamente o de alguna otra manera natural.

Alfabético

El orden alfabético es la base de muchos sistemas de clasificación donde la información se identifica mediante cadenas compuestas principalmente por letras de un alfabeto . El orden de estas cadenas depende de la existencia de un orden estándar para las letras del alfabeto en cuestión. (Este sistema no se limita a alfabetos en sentido estricto; lenguas que utilizan silabarios o abugidas , como el cherokee , pueden emplear el mismo principio de ordenación siempre que exista un orden establecido para los símbolos utilizados).

Para decidir cuál de dos cadenas va primero en orden alfabético, inicialmente se comparan sus primeras letras. La cadena cuya primera letra aparece antes en el alfabeto va primero. Si las primeras letras son iguales, se comparan las segundas letras, y así sucesivamente, hasta que se decide el orden. (Si una cadena se queda sin letras para comparar, se considera que va primero; por ejemplo, "cart" va antes que "carthorse"). El resultado de ordenar un conjunto de cadenas en orden alfabético es que las palabras con la misma primera letra se agrupan, y dentro de ese grupo se agrupan las palabras con las mismas dos primeras letras, y así sucesivamente.

Las letras mayúsculas se tratan generalmente como equivalentes a sus correspondientes letras minúsculas. (Para tratamientos alternativos en sistemas informatizados, véase Intercalación automatizada , más abajo).

Pueden aplicarse ciertas limitaciones, complicaciones y convenciones especiales cuando se utiliza el orden alfabético:

  • Cuando las cadenas de caracteres contienen espacios u otros separadores de palabras, se debe decidir si ignorar estos separadores o tratarlos como símbolos que preceden a todas las demás letras del alfabeto. Por ejemplo, si se opta por la primera opción, "aparcamiento" aparecerá después de "carbono" y "carpa" (como si se escribiera "aparcamiento"), mientras que en la segunda opción, "aparcamiento" aparecerá antes de esas dos palabras. La primera regla se utiliza en muchos (pero no en todos) los diccionarios , y la segunda en las guías telefónicas (de modo que Wilson, Jim K aparece con otras personas llamadas Wilson, Jim y no después de Wilson, Jimbo).
  • Las abreviaturas pueden tratarse como si estuvieran escritas completas. Por ejemplo, los nombres que contienen "St." (abreviatura de la palabra inglesa Saint ) a menudo se ordenan como si estuvieran escritos como "Saint". También existe una convención tradicional en inglés según la cual los apellidos que comienzan con Mc y M' se enumeran como si esos prefijos se escribieran como Mac .
  • Las cadenas de texto que representan nombres propios suelen aparecer ordenadas alfabéticamente por apellido, incluso si el nombre de pila va primero. Por ejemplo, Juan Hernández y Brian O'Leary deberían aparecer ordenados como "Hernandes, Juan" y "O'Leary, Brian", aunque no estén escritos de esta manera.
  • Las palabras iniciales muy comunes, como "The" en inglés, a menudo se ignoran para fines de clasificación. Por lo tanto, "The Shining " se clasificaría simplemente como "Shining" o "Shining, The".
  • Cuando algunas de las cadenas contienen números (u otros caracteres que no son letras), existen varios enfoques posibles. A veces, estos caracteres se tratan como si estuvieran antes o después de todas las letras del alfabeto. Otro método consiste en ordenar los números alfabéticamente como se escribirían: por ejemplo, 1776 se ordenaría como si se escribiera "diecisiete setenta y seis", y 24 heures du Mans como si se escribiera "veinticuatro". Cuando los números u otros símbolos se utilizan como formas gráficas especiales de letras, como en 1337 para leet o Se7en para el título de la película Seven , se pueden ordenar como si fueran esas letras.
  • Los idiomas tienen diferentes convenciones para tratar las letras modificadas y ciertas combinaciones de letras. Por ejemplo, en español la letra ñ se trata como una letra básica que sigue a la n , y los dígrafos ch y ll se trataban anteriormente (hasta 1994) como letras básicas que seguían a la c y la l , aunque ahora se ordenan alfabéticamente como combinaciones de dos letras. Puede encontrar una lista de dichas convenciones para varios idiomas en Orden alfabético §  Convenciones específicas de cada idioma .

En varios idiomas, las reglas han cambiado con el tiempo, por lo que los diccionarios antiguos pueden usar un orden diferente al de los modernos. Además, la intercalación puede depender del uso. Por ejemplo, los diccionarios alemanes y las guías telefónicas utilizan métodos distintos.

Ordenación de raíz

Algunos diccionarios árabes , como el bilingüe Diccionario de árabe escrito moderno de Hans Wehr , agrupan y clasifican palabras árabes por raíz semítica . [ 1 ] Por ejemplo, las palabras kitāba ( كتابة 'escritura'), kitāb ( كتاب 'libro'), kātib ( كاتب 'escritor'), maktaba ( مكتبة 'biblioteca'), maktab ( مكتب 'oficina'), maktūb ( مكتوب 'destino' o 'escrito'), se aglomeran bajo el raíz triliteral k - t - b ( ك ت ب ), que denota 'escritura'. [ 2 ]

Clasificación por radicales y trazos

Otra forma de cotejo es la clasificación por radicales y trazos , utilizada para sistemas de escritura no alfabéticos como los hanzi del chino y los kanji del japonés , cuyos miles de símbolos desafían la ordenación convencional. En este sistema, se identifican los componentes comunes de los caracteres; estos se denominan radicales en chino y en los sistemas logográficos derivados del chino. Los caracteres se agrupan según su radical principal y luego se ordenan según el número de trazos dentro de cada radical. Cuando no hay un radical obvio o hay más de uno, la convención determina cuál se utiliza para el cotejo. Por ejemplo, el carácter chino 妈 (que significa "madre") se clasifica como un carácter de seis trazos bajo el radical principal de tres trazos 女 (que significa "mujer").

El sistema de radicales y trazos es engorroso en comparación con un sistema alfabético en el que hay pocos caracteres, todos inequívocos. La elección de qué componentes de un logograma constituyen radicales separados y cuál radical es el principal no es clara. Como resultado, las lenguas logográficas a menudo complementan el orden de radicales y trazos con la clasificación alfabética de una conversión fonética de los logogramas. Por ejemplo, la palabra kanji Tōkyō (東京) se puede clasificar como si estuviera escrita en los caracteres japoneses del silabario hiragana como "to-u-ki- yo -u" (とうきょう), utilizando el orden de clasificación convencional para estos caracteres.

Además, los caracteres chinos también se pueden ordenar según su longitud de trazo . En la Gran China, el orden de los apellidos por longitud de trazo es una convención en algunos documentos oficiales donde los nombres de las personas se enumeran sin jerarquía.

Automatización

Cuando la información se almacena en sistemas digitales, la intercalación puede convertirse en un proceso automatizado. En ese caso, es necesario implementar un algoritmo de intercalación adecuado que permita ordenar la información de manera satisfactoria para la aplicación en cuestión. A menudo, el objetivo será lograr un ordenamiento alfabético o numérico que siga los criterios estándar descritos en las secciones anteriores. Sin embargo, no todos estos criterios son fáciles de automatizar. [ 3 ]

El tipo más simple de cotejo automatizado se basa en los códigos numéricos de los símbolos en un conjunto de caracteres , como la codificación ASCII (o cualquiera de sus superconjuntos como Unicode ), donde los símbolos se ordenan en orden numérico creciente de sus códigos, y este orden se extiende a las cadenas de acuerdo con los principios básicos del orden alfabético (matemáticamente hablando, orden lexicográfico ). Así, un programa de computadora podría tratar los caracteres a , b , C , d y $ como ordenados $ , C , a , b , d (los códigos ASCII correspondientes son $ = 36, a = 97, b = 98, C = 67 y d = 100). Por lo tanto, las cadenas que comienzan con C , M o Z se ordenarían antes que las cadenas con a , b , etc. en minúscula. Esto a veces se llama orden ASCIIbético . Esto se desvía del orden alfabético estándar, sobre todo por la colocación de las mayúsculas antes que las minúsculas (y posiblemente por el tratamiento de los espacios y otros caracteres que no son letras). Por lo tanto, suele aplicarse con ciertas modificaciones, la más evidente de las cuales es la conversión a mayúsculas (a menudo a mayúsculas, por razones históricas [ nota 1 ] ) antes de comparar los valores ASCII.

En muchos algoritmos de intercalación, la comparación no se basa en los códigos numéricos de los caracteres, sino en la secuencia de intercalación —una secuencia en la que se supone que aparecen los caracteres para la intercalación—, así como en otras reglas de ordenación apropiadas para la aplicación en cuestión. Esto permite aplicar las convenciones correctas de ordenación alfabética del idioma, manejando adecuadamente las mayúsculas y minúsculas, las letras modificadas , los dígrafos , las abreviaturas específicas, etc., como se mencionó anteriormente en el apartado de Orden alfabético y se detalla en el artículo correspondiente . Estos algoritmos pueden ser bastante complejos y posiblemente requieran varias pasadas por el texto. [ 3 ]

Sin embargo, siguen siendo frecuentes los problemas cuando el algoritmo tiene que abarcar más de un idioma. Por ejemplo, en los diccionarios alemanes la palabra ökonomisch aparece entre offenbar y olfaktorisch , mientras que los diccionarios turcos tratan la o y la ö como letras diferentes, colocando oyun antes de öbür .

El algoritmo estándar para intercalar cualquier conjunto de cadenas compuestas por símbolos Unicode estándar es el Algoritmo de Intercalación Unicode . Este algoritmo se puede adaptar para utilizar la secuencia de intercalación adecuada para un idioma determinado, modificando su tabla de intercalación predeterminada. Varias de estas adaptaciones se encuentran recopiladas en el Repositorio de Datos de Localización Común .

Claves de ordenación

En algunas aplicaciones, las cadenas de caracteres con las que se ordenan los elementos pueden diferir de los identificadores que se muestran. Por ejemplo, El Resplandor podría ordenarse como Resplandor, El (véase Orden alfabético más arriba), pero aun así se desearía mostrarlo como El Resplandor . En este caso, se pueden almacenar dos conjuntos de cadenas: uno para la visualización y otro para el ordenamiento. Las cadenas utilizadas para el ordenamiento de esta manera se denominan claves de ordenamiento .

Problemas con los números

En ocasiones, se desea ordenar texto con números incrustados según el orden numérico correcto. Por ejemplo, "Figura 7b" precede a "Figura 11a", aunque en Unicode el '7' viene después del '1' . Esto se puede extender a los números romanos . Este comportamiento no es particularmente difícil de lograr siempre que solo se ordenen números enteros, aunque puede ralentizar significativamente el proceso de ordenación. Por ejemplo, Microsoft Windows lo hace al ordenar nombres de archivos . El orden de ordenación subyacente se denomina orden de ordenación natural .

Ordenar correctamente los decimales es algo más complicado, ya que en diferentes idiomas se utilizan distintos símbolos para el separador decimal , y a veces el mismo carácter que se usa como separador decimal también se usa como separador, por ejemplo, "Sección 3.2.5". No existe una solución universal para ordenar este tipo de cadenas; las reglas dependen de la aplicación.

Etiquetado de los artículos pedidos

En algunos contextos, los números y las letras se utilizan no tanto como base para establecer un orden, sino como medio para etiquetar elementos que ya están ordenados. Por ejemplo, las páginas, secciones, capítulos y similares, así como los elementos de las listas, se numeran frecuentemente de esta manera. Las series de etiquetas que se pueden utilizar incluyen números arábigos (1, 2, 3, ...), números romanos (I, II, III, ... o i, ii, iii, ...) o letras (A, B, C, ... o a, b, c, ...). (Un método alternativo para indicar los elementos de una lista, sin numerarlos, es utilizar una lista con viñetas ).

Cuando se utilizan letras de un alfabeto para la enumeración , existen ciertas convenciones lingüísticas sobre qué letras se emplean. Por ejemplo, se omiten las letras rusas Ъ y Ь (que en la escritura solo se usan para modificar la consonante precedente ), y generalmente también Ы , Й y Ё. Asimismo, en muchos idiomas que utilizan el alfabeto latino extendido , las letras modificadas a menudo no se emplean en la enumeración.

Véase también

Notas

  1. Históricamente, las computadoras solo manejaban texto en mayúsculas (esto se remonta a las convenciones del telégrafo ).

Referencias

  1. Abu-Haidar, JA (1983). "Reseña de A Dictionary of Modern Written Arabic (Arabic-English)". Bulletin of the School of Oriental and African Studies, University of London . 46 (2): 351– 353. doi : 10.1017/S0041977X00079040 . ISSN 0041-977X . JSTOR 615409 .  
  2. "Diccionario árabe-inglés de Hans Wehr" . ejtaal.net . Consultado el 4 de junio de 2023 .
  3. 1 2 M Programación: Una guía completa , Richard F. Walters, Digital Press, 1997
  • Algoritmo de intercalación Unicode : Norma técnica Unicode n.º 10
  • Colación en español. Archivado el 13 de agosto de 2006 en Wayback Machine.
  • Recopilación de los nombres de los Estados miembros de las Naciones Unidas. Archivado el 30 de agosto de 2005 en la Wayback Machine.
  • Cotejo tipográfico para muchos idiomas , tal como se propone en el módulo Lista de Hojas de Estilo en Cascada .
  • Diagramas de intercalación : Diagramas que muestran los órdenes de clasificación específicos de cada idioma en diversos sistemas operativos y sistemas de gestión de bases de datos (DBMS).
  • ICU Locale Explorer : una demostración en línea de ordenación en diferentes idiomas que utiliza el algoritmo de intercalación Unicode con componentes internacionales para Unicode . Archivado el 11 de mayo de 2008 en Wayback Machine .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Collation&oldid=1342352196#Automation "