Articulo de referencia

Aprendizaje por similitud

El aprendizaje por similitud es un área del aprendizaje automático supervisado en inteligencia artificial . Está estrechamente relacionado con la regresión y la clasificación , ...

El aprendizaje por similitud es un área del aprendizaje automático supervisado en inteligencia artificial . Está estrechamente relacionado con la regresión y la clasificación , pero su objetivo es aprender una función de similitud que mida el grado de semejanza o relación entre dos objetos. Tiene aplicaciones en sistemas de clasificación , sistemas de recomendación , seguimiento de identidad visual, verificación facial y verificación de locutores.

Configuración de aprendizaje

Existen cuatro configuraciones comunes para el aprendizaje por similitud y distancia métrica.

Aprendizaje de similitud de regresión
En esta configuración, se dan pares de objetos.(incógnitai1,incógnitai2){\displaystyle (x_{i}^{1},x_{i}^{2})}junto con una medida de su similitudyiR{\displaystyle y_{i}\in R}El objetivo es aprender una función que se aproxime aF(incógnitai1,incógnitai2)yi{\displaystyle f(x_{i}^{1},x_{i}^{2})\sim y_{i}}por cada nuevo ejemplo de triplete etiquetado(incógnitai1,incógnitai2,yi){\displaystyle (x_{i}^{1},x_{i}^{2},y_{i})}Esto se suele lograr minimizando una función de pérdida regularizada.minWiloss(w;incógnitai1,incógnitai2,yi)+rmigramo(w){\displaystyle \min _{W}\sum _{i}loss(w;x_{i}^{1},x_{i}^{2},y_{i})+reg(w)}.
Aprendizaje de similitud de clasificación
Se proporcionan pares de objetos similares(incógnitai,incógnitai+){\displaystyle (x_{i},x_{i}^{+})}y objetos no similares(incógnitai,incógnitai){\displaystyle (x_{i},x_{i}^{-})}. Una formulación equivalente es que cada par(incógnitai1,incógnitai2){\displaystyle (x_{i}^{1},x_{i}^{2})}se proporciona junto con una etiqueta binariayi{0,1}{\displaystyle y_{i}\in \{0,1\}}que determina si los dos objetos son similares o no. El objetivo es, de nuevo, aprender un clasificador que pueda decidir si un nuevo par de objetos es similar o no.
Aprendizaje de similitud de clasificación
Se proporcionan tríos de objetos(incógnitai,incógnitai+,incógnitai){\displaystyle (x_{i},x_{i}^{+},x_{i}^{-})}cuya similitud relativa obedece a un orden predefinido:incógnitai{\displaystyle x_{i}}se sabe que es más similar aincógnitai+{\displaystyle x_{i}^{+}}que aincógnitai{\displaystyle x_{i}^{-}}El objetivo es aprender una función.F{\displaystyle f}de tal manera que para cualquier nueva terna de objetos(incógnita,incógnita+,incógnita){\displaystyle (x,x^{+},x^{-})}, obedeceF(incógnita,incógnita+)>F(incógnita,incógnita){\displaystyle f(x,x^{+})>f(x,x^{-})}( aprendizaje contrastivo ). Esta configuración presupone una forma de supervisión más débil que en la regresión, ya que en lugar de proporcionar una medida exacta de similitud , solo se requiere el orden relativo de similitud. Por esta razón, el aprendizaje de similitud basado en rangos es más fácil de aplicar en aplicaciones reales a gran escala. [ 1 ]
Hashing sensible a la localidad (LSH) [ 2 ]
Aplica funciones hash a los elementos de entrada para que los elementos similares se asignen a los mismos "cubos" en la memoria con alta probabilidad (el número de cubos es mucho menor que el universo de posibles elementos de entrada). Se aplica frecuentemente en la búsqueda del vecino más cercano en grandes conjuntos de datos de alta dimensión, por ejemplo, bases de datos de imágenes, colecciones de documentos, bases de datos de series temporales y bases de datos genómicas. [ 3 ]

Un enfoque común para aprender similitud es modelar la función de similitud como una forma bilineal . Por ejemplo, en el caso del aprendizaje de similitud de clasificación, se busca aprender una matriz W que parametriza la función de similitud.FW(incógnita,z)=incógnitaTWz{\displaystyle f_{W}(x,z)=x^{T}Wz}Cuando los datos son abundantes, un enfoque común es aprender una red siamesa , un modelo de red profunda con parámetros compartidos.

Aprendizaje métrico

El aprendizaje de similitud está estrechamente relacionado con el aprendizaje de métricas de distancia . El aprendizaje de métricas consiste en aprender una función de distancia sobre objetos. Una métrica o función de distancia debe cumplir cuatro axiomas: no negatividad , identidad de indiscernibles , simetría y subaditividad (o la desigualdad triangular). En la práctica, los algoritmos de aprendizaje de métricas ignoran la condición de identidad de indiscernibles y aprenden una pseudométrica.

Cuando los objetosincógnitai{\displaystyle x_{i}}son vectores enRd{\displaystyle R^{d}}, entonces cualquier matrizW{\displaystyle W}en el cono semidefinido positivo simétricoS+d{\displaystyle S_{+}^{d}}define una pseudométrica de distancia del espacio de x a través de la formaDW(incógnita1,incógnita2)2=(incógnita1incógnita2)W(incógnita1incógnita2){\displaystyle D_{W}(x_{1},x_{2})^{2}=(x_{1}-x_{2})^{\top }W(x_{1}-x_{2})}. CuandoW{\displaystyle W}es una matriz simétrica definida positiva,DW{\displaystyle D_{W}}es una métrica. Además, como cualquier matriz simétrica semidefinida positivaWS+d{\displaystyle W\in S_{+}^{d}}puede descomponerse comoW=LL{\displaystyle W=L^{\top }L}dóndeLRmi×d{\displaystyle L\in R^{e\times d}}ymiranortek(W){\displaystyle e\geq rango(W)}, la función de distanciaDW{\displaystyle D_{W}}puede reescribirse de forma equivalenteDW(incógnita1,incógnita2)2=(incógnita1incógnita2)LL(incógnita1incógnita2)=L(incógnita1incógnita2)22{\displaystyle D_{W}(x_{1},x_{2})^{2}=(x_{1}-x_{2})^{\top }L^{\top }L(x_{1}-x_{2})=\|L(x_{1}-x_{2})\|_{2}^{2}}La distanciaDW(incógnita1,incógnita2)2=incógnita1incógnita222{\displaystyle D_{W}(x_{1},x_{2})^{2}=\|x_{1}'-x_{2}'\|_{2}^{2}}corresponde a la distancia euclidiana entre los vectores de características transformadosincógnita1=Lincógnita1{\displaystyle x_{1}'=Lx_{1}}yincógnita2=Lincógnita2{\displaystyle x_{2}'=Lx_{2}}.

Se han propuesto muchas formulaciones para el aprendizaje métrico. [ 4 ] [ 5 ] Algunos enfoques bien conocidos para el aprendizaje métrico incluyen el aprendizaje a partir de comparaciones relativas, [ 6 ] que se basa en la pérdida de tripletas , el vecino más cercano de margen grande , [ 7 ] y el aprendizaje métrico basado en la teoría de la información (ITML). [ 8 ]

En estadística , la matriz de covarianza de los datos se utiliza a veces para definir una métrica de distancia llamada distancia de Mahalanobis .

Aplicaciones

El aprendizaje de similitud se utiliza en la recuperación de información para aprender a clasificar , en la verificación o identificación facial, [ 9 ] [ 10 ] y en sistemas de recomendación . Además, muchos enfoques de aprendizaje automático se basan en alguna métrica. Esto incluye el aprendizaje no supervisado , como el clustering , que agrupa objetos cercanos o similares. También incluye enfoques supervisados, como el algoritmo de k vecinos más cercanos , que se basa en las etiquetas de objetos cercanos para decidir la etiqueta de un nuevo objeto. El aprendizaje métrico se ha propuesto como un paso de preprocesamiento para muchos de estos enfoques. [ 11 ]

Escalabilidad

El aprendizaje de métricas y similitud escala cuadráticamente con la dimensión del espacio de entrada, como se puede ver fácilmente cuando la métrica aprendida tiene una forma bilineal.FW(incógnita,z)=incógnitaTWz{\displaystyle f_{W}(x,z)=x^{T}Wz}La escalabilidad a dimensiones superiores se puede lograr imponiendo una estructura de dispersión sobre el modelo matricial, como se hace con HDSL, [ 12 ] y con COMET. [ 13 ]

Software

  • metric-learn [ 14 ] es una biblioteca de software libre para Python que ofrece implementaciones eficientes de varios algoritmos de aprendizaje de métricas y similitud supervisados ​​y débilmente supervisados. La API de metric-learn es compatible con scikit-learn . [ 15 ]
  • OpenMetricLearning [ 16 ] es un marco de trabajo de Python para entrenar y validar modelos que producen incrustaciones de alta calidad.

Más información

Para obtener más información sobre este tema, consulte los estudios sobre aprendizaje métrico y de similitud de Bellet et al. [ 4 ] y Kulis. [ 5 ]

Véase también

Referencias

  1. Chechik, G.; Sharma, V.; Shalit, U.; Bengio, S. (2010). "Aprendizaje en línea a gran escala de similitud de imágenes mediante clasificación" (PDF) . Journal of Machine Learning Research . 11 : 1109–1135 .
  2. ^ Gionis, Arístides, Piotr Indyk y Rajeev Motwani. "Búsqueda de similitudes en grandes dimensiones mediante hash". VLDB. vol. 99. N° 6. 1999.
  3. Rajaraman, A.; Ullman, J. (2010). "Minería de conjuntos de datos masivos, Cap. 3" .
  4. 1 2 Bellet, A.; Habrard, A.; Sebban, M. (2013). "Una revisión sobre el aprendizaje métrico para vectores de características y datos estructurados". arXiv : 1306.6709 [ cs.LG ].
  5. 1 2 Kulis, B. (2012). "Aprendizaje métrico: una revisión" . Fundamentos y tendencias en aprendizaje automático . 5 (4): 287– 364. doi : 10.1561/2200000019 .
  6. Schultz, M.; Joachims, T. (2004). "Aprendizaje de una métrica de distancia a partir de comparaciones relativas" (PDF) . Advances in Neural Information Processing Systems . 16 : 41–48 .
  7. Weinberger, KQ; Blitzer, JC; Saul, LK (2006). "Aprendizaje de métricas de distancia para la clasificación del vecino más cercano con margen amplio" (PDF) . Advances in Neural Information Processing Systems . 18 : 1473–1480 .
  8. Davis, JV; Kulis, B.; Jain, P.; Sra, S.; Dhillon, IS (2007). "Aprendizaje métrico basado en la teoría de la información" . Conferencia Internacional sobre Aprendizaje Automático : 209–216 .
  9. Guillaumin, M.; Verbeek, J.; Schmid, C. (2009). "¿Eres tú? Enfoques de aprendizaje métrico para la identificación facial" (PDF) . 2009 IEEE 12.ª Conferencia Internacional sobre Visión por Computadora . pp. 498–505 . doi : 10.1109/ICCV.2009.5459197 . ISBN  978-1-4244-4420-5.
  10. Mignon, A.; Jurie, F. (2012). "PCCA: Un nuevo enfoque para el aprendizaje a distancia a partir de restricciones dispersas por pares" (PDF) . Conferencia IEEE de 2012 sobre Visión por Computadora y Reconocimiento de Patrones . págs. 2666–2672 . doi : 10.1109/CVPR.2012.6247987 . ISBN  978-1-4673-1228-8.
  11. Xing, EP; Ng, AY; Jordan, MI; Russell, S. (2002). "Aprendizaje de métricas de distancia, con aplicación a la agrupación con información lateral" (PDF) . Advances in Neural Information Processing Systems . 15 : 505–512 .
  12. Liu; Bellet; Sha (2015). "Aprendizaje de similitud para datos dispersos de alta dimensión" (PDF) . Conferencia internacional sobre inteligencia artificial y estadística (AISTATS) . arXiv : 1411.2374 . Bibcode : 2014arXiv1411.2374L .
  13. Atzmon; Shalit; Chechik (2015). "Aprendizaje de métricas dispersas, una característica a la vez" (PDF) . J. Mach. Learn. Research .
  14. "Scikit-learn-contrib/Metric-learn" . GitHub .
  15. Vazelhes; Carey; Tang; Vauquier; Bellet (2020). "metric-learn: Algoritmos de aprendizaje métrico en Python" (PDF) . J. Mach. Learn. Research . arXiv : 1908.04710 .
  16. "OML-Team/Open-metric-learning" . GitHub .