En el procesamiento del lenguaje natural, una w -shingling es un conjunto de tejas únicas (por lo tanto, n-gramas ), cada una de las cuales está compuesta por subsecuencias contiguas de tokens dentro de un documento , que luego se pueden usar para determinar la similitud entre documentos . El símbolo w denota la cantidad de tokens en cada teja seleccionada o resuelta.
El documento "una rosa es una rosa es una rosa" puede por tanto ser tokenizado al máximo de la siguiente manera:
- (una,rosa,es,una,rosa,es,una,rosa)
El conjunto de todas las secuencias contiguas de 4 fichas (por lo tanto, 4 = n , por lo tanto, 4- gramos ) es
- { (a,rosa,es,a), (rosa,es,a,rosa), (es,a,rosa,es), (a,rosa,es,a), (rosa,es,a,rosa) } Que luego se puede reducir, o comprimir al máximo en este caso particular a { (a,rosa,es,a), (rosa,es,a,rosa), (es,a,rosa,es) }.
Semejanza
Para un tamaño de teja determinado, el grado en que dos documentos A y B se parecen entre sí se puede expresar como la relación de las magnitudes de la intersección y la unión de sus tejas , o
donde |A| es el tamaño del conjunto A. La semejanza es un número en el rango [0,1], donde 1 indica que dos documentos son idénticos. Esta definición es idéntica al coeficiente de Jaccard que describe la similitud y diversidad de los conjuntos de muestras.
Véase también
- Modelo de bolsa de palabras
- Índice de Jaccard
- Minería de conceptos
- k -mer
- MinHash
- N-grama
- Huella dactilar de Rabin
- Hachís rodante
- Modelo de espacio vectorial
Referencias
- Broder; Glassman; Manasse; Zweig (1997). "Agrupamiento sintáctico de la Web". Nota técnica del SRC n.° 1997-015 .
- Manber (1993). "Cómo encontrar archivos similares en un sistema de archivos grande" (PDF) .Aún no se utiliza el término "shingling".
- Manning, Christopher D.; Raghavan, Prabhakar; Schütze, Hinrich (7 de julio de 2008). "w-shingling". Introducción a la recuperación de información. Cambridge University Press. ISBN 978-1-139-47210-4.