El aprendizaje por similitud es un área del aprendizaje automático supervisado en inteligencia artificial . Está estrechamente relacionado con la regresión y la clasificación , pero su objetivo es aprender una función de similitud que mida el grado de semejanza o relación entre dos objetos. Tiene aplicaciones en sistemas de clasificación , sistemas de recomendación , seguimiento de identidad visual, verificación facial y verificación de locutores.
Configuración de aprendizaje
Existen cuatro configuraciones comunes para el aprendizaje por similitud y distancia métrica.
- Aprendizaje de similitud de regresión
- En esta configuración, se dan pares de objetos.junto con una medida de su similitudEl objetivo es aprender una función que se aproxime apor cada nuevo ejemplo de triplete etiquetadoEsto se suele lograr minimizando una función de pérdida regularizada..
- Aprendizaje de similitud de clasificación
- Se proporcionan pares de objetos similaresy objetos no similares. Una formulación equivalente es que cada parse proporciona junto con una etiqueta binariaque determina si los dos objetos son similares o no. El objetivo es, de nuevo, aprender un clasificador que pueda decidir si un nuevo par de objetos es similar o no.
- Aprendizaje de similitud de clasificación
- Se proporcionan tríos de objetoscuya similitud relativa obedece a un orden predefinido:se sabe que es más similar aque aEl objetivo es aprender una función.de tal manera que para cualquier nueva terna de objetos, obedece( aprendizaje contrastivo ). Esta configuración presupone una forma de supervisión más débil que en la regresión, ya que en lugar de proporcionar una medida exacta de similitud , solo se requiere el orden relativo de similitud. Por esta razón, el aprendizaje de similitud basado en rangos es más fácil de aplicar en aplicaciones reales a gran escala. [ 1 ]
- Hashing sensible a la localidad (LSH) [ 2 ]
- Aplica funciones hash a los elementos de entrada para que los elementos similares se asignen a los mismos "cubos" en la memoria con alta probabilidad (el número de cubos es mucho menor que el universo de posibles elementos de entrada). Se aplica frecuentemente en la búsqueda del vecino más cercano en grandes conjuntos de datos de alta dimensión, por ejemplo, bases de datos de imágenes, colecciones de documentos, bases de datos de series temporales y bases de datos genómicas. [ 3 ]
Un enfoque común para aprender similitud es modelar la función de similitud como una forma bilineal . Por ejemplo, en el caso del aprendizaje de similitud de clasificación, se busca aprender una matriz W que parametriza la función de similitud.Cuando los datos son abundantes, un enfoque común es aprender una red siamesa , un modelo de red profunda con parámetros compartidos.
Aprendizaje métrico
El aprendizaje de similitud está estrechamente relacionado con el aprendizaje de métricas de distancia . El aprendizaje de métricas consiste en aprender una función de distancia sobre objetos. Una métrica o función de distancia debe cumplir cuatro axiomas: no negatividad , identidad de indiscernibles , simetría y subaditividad (o la desigualdad triangular). En la práctica, los algoritmos de aprendizaje de métricas ignoran la condición de identidad de indiscernibles y aprenden una pseudométrica.
Cuando los objetosson vectores en, entonces cualquier matrizen el cono semidefinido positivo simétricodefine una pseudométrica de distancia del espacio de x a través de la forma. Cuandoes una matriz simétrica definida positiva,es una métrica. Además, como cualquier matriz simétrica semidefinida positivapuede descomponerse comodóndey, la función de distanciapuede reescribirse de forma equivalenteLa distanciacorresponde a la distancia euclidiana entre los vectores de características transformadosy.
Se han propuesto muchas formulaciones para el aprendizaje métrico. [ 4 ] [ 5 ] Algunos enfoques bien conocidos para el aprendizaje métrico incluyen el aprendizaje a partir de comparaciones relativas, [ 6 ] que se basa en la pérdida de tripletas , el vecino más cercano de margen grande , [ 7 ] y el aprendizaje métrico basado en la teoría de la información (ITML). [ 8 ]
En estadística , la matriz de covarianza de los datos se utiliza a veces para definir una métrica de distancia llamada distancia de Mahalanobis .
Aplicaciones
El aprendizaje de similitud se utiliza en la recuperación de información para aprender a clasificar , en la verificación o identificación facial, [ 9 ] [ 10 ] y en sistemas de recomendación . Además, muchos enfoques de aprendizaje automático se basan en alguna métrica. Esto incluye el aprendizaje no supervisado , como el clustering , que agrupa objetos cercanos o similares. También incluye enfoques supervisados, como el algoritmo de k vecinos más cercanos , que se basa en las etiquetas de objetos cercanos para decidir la etiqueta de un nuevo objeto. El aprendizaje métrico se ha propuesto como un paso de preprocesamiento para muchos de estos enfoques. [ 11 ]
Escalabilidad
El aprendizaje de métricas y similitud escala cuadráticamente con la dimensión del espacio de entrada, como se puede ver fácilmente cuando la métrica aprendida tiene una forma bilineal.La escalabilidad a dimensiones superiores se puede lograr imponiendo una estructura de dispersión sobre el modelo matricial, como se hace con HDSL, [ 12 ] y con COMET. [ 13 ]
Software
- metric-learn [ 14 ] es una biblioteca de software libre para Python que ofrece implementaciones eficientes de varios algoritmos de aprendizaje de métricas y similitud supervisados y débilmente supervisados. La API de metric-learn es compatible con scikit-learn . [ 15 ]
- OpenMetricLearning [ 16 ] es un marco de trabajo de Python para entrenar y validar modelos que producen incrustaciones de alta calidad.
Más información
Para obtener más información sobre este tema, consulte los estudios sobre aprendizaje métrico y de similitud de Bellet et al. [ 4 ] y Kulis. [ 5 ]
Véase también
Referencias
- ↑ Chechik, G.; Sharma, V.; Shalit, U.; Bengio, S. (2010). "Aprendizaje en línea a gran escala de similitud de imágenes mediante clasificación" (PDF) . Journal of Machine Learning Research . 11 : 1109–1135 .
- ^ Gionis, Arístides, Piotr Indyk y Rajeev Motwani. "Búsqueda de similitudes en grandes dimensiones mediante hash". VLDB. vol. 99. N° 6. 1999.
- ↑ Rajaraman, A.; Ullman, J. (2010). "Minería de conjuntos de datos masivos, Cap. 3" .
- 1 2 Bellet, A.; Habrard, A.; Sebban, M. (2013). "Una revisión sobre el aprendizaje métrico para vectores de características y datos estructurados". arXiv : 1306.6709 [ cs.LG ].
- 1 2 Kulis, B. (2012). "Aprendizaje métrico: una revisión" . Fundamentos y tendencias en aprendizaje automático . 5 (4): 287– 364. doi : 10.1561/2200000019 .
- ↑ Schultz, M.; Joachims, T. (2004). "Aprendizaje de una métrica de distancia a partir de comparaciones relativas" (PDF) . Advances in Neural Information Processing Systems . 16 : 41–48 .
- ↑ Weinberger, KQ; Blitzer, JC; Saul, LK (2006). "Aprendizaje de métricas de distancia para la clasificación del vecino más cercano con margen amplio" (PDF) . Advances in Neural Information Processing Systems . 18 : 1473–1480 .
- ↑ Davis, JV; Kulis, B.; Jain, P.; Sra, S.; Dhillon, IS (2007). "Aprendizaje métrico basado en la teoría de la información" . Conferencia Internacional sobre Aprendizaje Automático : 209–216 .
- ↑ Guillaumin, M.; Verbeek, J.; Schmid, C. (2009). "¿Eres tú? Enfoques de aprendizaje métrico para la identificación facial" (PDF) . 2009 IEEE 12.ª Conferencia Internacional sobre Visión por Computadora . pp. 498–505 . doi : 10.1109/ICCV.2009.5459197 . ISBN 978-1-4244-4420-5.
- ↑ Mignon, A.; Jurie, F. (2012). "PCCA: Un nuevo enfoque para el aprendizaje a distancia a partir de restricciones dispersas por pares" (PDF) . Conferencia IEEE de 2012 sobre Visión por Computadora y Reconocimiento de Patrones . págs. 2666–2672 . doi : 10.1109/CVPR.2012.6247987 . ISBN 978-1-4673-1228-8.
- ↑ Xing, EP; Ng, AY; Jordan, MI; Russell, S. (2002). "Aprendizaje de métricas de distancia, con aplicación a la agrupación con información lateral" (PDF) . Advances in Neural Information Processing Systems . 15 : 505–512 .
- ↑ Liu; Bellet; Sha (2015). "Aprendizaje de similitud para datos dispersos de alta dimensión" (PDF) . Conferencia internacional sobre inteligencia artificial y estadística (AISTATS) . arXiv : 1411.2374 . Bibcode : 2014arXiv1411.2374L .
- ↑ Atzmon; Shalit; Chechik (2015). "Aprendizaje de métricas dispersas, una característica a la vez" (PDF) . J. Mach. Learn. Research .
- ↑ "Scikit-learn-contrib/Metric-learn" . GitHub .
- ↑ Vazelhes; Carey; Tang; Vauquier; Bellet (2020). "metric-learn: Algoritmos de aprendizaje métrico en Python" (PDF) . J. Mach. Learn. Research . arXiv : 1908.04710 .
- ↑ "OML-Team/Open-metric-learning" . GitHub .
- Aprendizaje automático
- Relaciones semánticas