El método de calificación de coincidencia (MRA, por sus siglas en inglés) es un algoritmo fonético para la indexación de palabras según su pronunciación, desarrollado por Western Airlines en 1977 para la indexación y comparación de nombres homófonos . [ 1 ]
El algoritmo en sí tiene un conjunto simple de reglas de codificación, pero un conjunto más extenso de reglas de comparación. El mecanismo principal es la comparación de similitud, que calcula el número de caracteres no coincidentes comparando las cadenas de izquierda a derecha y luego de derecha a izquierda, y eliminando los caracteres idénticos. Este valor se resta de 6 y luego se compara con un umbral mínimo. El umbral mínimo se define en la tabla A y depende de la longitud de las cadenas.
El nombre codificado se conoce (quizás erróneamente) como identificador numérico personal (PNI). El nombre codificado nunca puede contener más de 6 caracteres alfabéticos.
El método de calificación de coincidencia funciona bien con nombres que contienen la letra "y", a diferencia de la versión original del algoritmo NYSIIS ; por ejemplo, los apellidos "Smith" y "Smyth" coinciden correctamente. Sin embargo, MRA no funciona bien con nombres codificados cuya longitud difiere en más de dos caracteres.
Reglas de codificación
- Elimine todas las vocales a menos que la vocal comience la palabra.
- Elimine la segunda consonante de cualquier consonante doble presente.
- Reduzca el códice a 6 letras uniendo solo las tres primeras y las tres últimas.
Reglas de comparación
En esta sección, las palabras "cadena(s)" y "nombre(s)" significan "cadena(s) codificada(s)" y "nombre(s) codificado(s)".
- Si la diferencia de longitud entre las cadenas codificadas es de 3 o más, no se realiza ninguna comparación de similitud.
- Obtenga el valor de calificación mínimo calculando la suma de la longitud de las cadenas codificadas y utilizando la tabla A.
- Procese las cadenas codificadas de izquierda a derecha y elimine los caracteres idénticos que encuentre en ambas cadenas respectivamente.
- Procese los caracteres que no coincidan de derecha a izquierda y elimine los caracteres idénticos que se encuentren en ambos nombres respectivamente.
- Resta el número de caracteres no coincidentes de 6 en la cadena más larga. Este es el índice de similitud.
- Si el índice de similitud es igual o superior al índice mínimo, entonces la coincidencia se considera buena.
Umbral mínimo
La siguiente tabla muestra la correspondencia entre la calificación mínima y la longitud de las cadenas.
Ejemplos de enfoques de calificación de coincidencia
La tabla que aparece a continuación muestra el resultado del algoritmo de clasificación de coincidencias para algunos nombres homófonos comunes.
Véase también
Referencias
- ↑ Moore, G B.; Kuhns, J L.; Treffzs, J L.; Montgomery, C A. (1 de febrero de 1977). Acceso a registros individuales desde archivos de datos personales mediante identificadores no únicos . Instituto Nacional de Estándares y Tecnología de EE. UU. pág. 17. NIST SP - 500-2.
Enlaces externos
- Panorama general de los problemas relacionados con el uso de identificadores personales, HSMD, Statistics Canada
- Implementación en C#: http://sounditout.codeplex.com/ Archivado el 16/12/2010 en Wayback Machine
- Algoritmos fonéticos