
En el aprendizaje automático , la regularización de variedades es una técnica para usar la forma de un conjunto de datos para restringir las funciones que se deben aprender en ese conjunto de datos. En muchos problemas de aprendizaje automático, los datos que se deben aprender no cubren todo el espacio de entrada. Por ejemplo, un sistema de reconocimiento facial puede no necesitar clasificar ninguna imagen posible, sino solo el subconjunto de imágenes que contienen caras. La técnica de aprendizaje de variedades supone que el subconjunto relevante de datos proviene de una variedad , una estructura matemática con propiedades útiles. La técnica también supone que la función que se debe aprender es suave : no es probable que los datos con diferentes etiquetas estén juntos, por lo que la función de etiquetado no debería cambiar rápidamente en áreas donde es probable que haya muchos puntos de datos. Debido a esta suposición, un algoritmo de regularización de variedades puede usar datos sin etiquetar para informar dónde se permite que la función aprendida cambie rápidamente y dónde no, utilizando una extensión de la técnica de regularización de Tikhonov . Los algoritmos de regularización de variedades pueden extender los algoritmos de aprendizaje supervisado en entornos de aprendizaje semisupervisado y aprendizaje transductivo , donde hay datos no etiquetados disponibles. La técnica se ha utilizado para aplicaciones que incluyen imágenes médicas, imágenes geográficas y reconocimiento de objetos.
Regularizador de colectores
Motivación
La regularización de variedades es un tipo de regularización , una familia de técnicas que reduce el sobreajuste y garantiza que un problema esté bien planteado al penalizar las soluciones complejas. En particular, la regularización de variedades extiende la técnica de regularización de Tikhonov aplicada a los espacios de Hilbert de núcleo reproductor (RKHS). Bajo la regularización de Tikhonov estándar en RKHS, un algoritmo de aprendizaje intenta aprender una función de entre un espacio de hipótesis de funciones . El espacio de hipótesis es un RKHS, lo que significa que está asociado con un núcleo , y por lo tanto cada función candidata tiene una norma , que representa la complejidad de la función candidata en el espacio de hipótesis. Cuando el algoritmo considera una función candidata, tiene en cuenta su norma para penalizar las funciones complejas.
Formalmente, dado un conjunto de datos de entrenamiento etiquetados con y una función de pérdida , un algoritmo de aprendizaje que utilice la regularización de Tikhonov intentará resolver la expresión
donde es un hiperparámetro que controla en qué medida el algoritmo preferirá funciones más simples sobre funciones que se ajusten mejor a los datos.

La regularización de variedades agrega un segundo término de regularización, el regularizador intrínseco , al regularizador ambiental utilizado en la regularización estándar de Tikhonov. Bajo el supuesto de variedad en el aprendizaje automático, los datos en cuestión no provienen de todo el espacio de entrada , sino de una variedad no lineal . La geometría de esta variedad, el espacio intrínseco, se utiliza para determinar la norma de regularización. [1]
Norma laplaciana
Hay muchas opciones posibles para el regularizador intrínseco . Muchas opciones naturales involucran el gradiente en la variedad , que puede proporcionar una medida de cuán suave es una función objetivo. Una función suave debería cambiar lentamente donde los datos de entrada son densos; es decir, el gradiente debería ser pequeño donde la densidad de probabilidad marginal , la densidad de probabilidad de un punto de datos extraído aleatoriamente que aparece en , es grande. Esto da una opción apropiada para el regularizador intrínseco:
En la práctica, esta norma no se puede calcular directamente porque se desconoce la distribución marginal, pero se puede estimar a partir de los datos proporcionados.
Enfoque basado en gráficos de la norma laplaciana
Cuando las distancias entre los puntos de entrada se interpretan como un gráfico, entonces la matriz laplaciana del gráfico puede ayudar a estimar la distribución marginal. Suponga que los datos de entrada incluyen ejemplos etiquetados (pares de una entrada y una etiqueta ) y ejemplos no etiquetados (entradas sin etiquetas asociadas). Defina como una matriz de pesos de aristas para un gráfico, donde es una medida de distancia entre los puntos de datos y . Defina como una matriz diagonal con y como la matriz laplaciana . Luego, a medida que aumenta el número de puntos de datos , converge al operador de Laplace-Beltrami , que es la divergencia del gradiente . [2] [3] Luego, si es un vector de los valores de en los datos, , se puede estimar la norma intrínseca:
A medida que aumenta el número de puntos de datos , esta definición empírica de converge a la definición cuando se conoce. [1]
Solución del problema de regularización con un enfoque basado en gráficos
Utilizando los pesos y para los regularizadores ambientales e intrínsecos, la expresión final a resolver queda:
Al igual que con otros métodos de kernel , puede ser un espacio de dimensión infinita, por lo que si la expresión de regularización no se puede resolver explícitamente, es imposible buscar una solución en todo el espacio. En cambio, un teorema de representación muestra que bajo ciertas condiciones en la elección de la norma , la solución óptima debe ser una combinación lineal del kernel centrado en cada uno de los puntos de entrada: para algunos pesos ,
Utilizando este resultado, es posible buscar la solución óptima buscando en el espacio de dimensión finita definido por las posibles opciones de . [1]
Enfoque funcional de la norma laplaciana
La idea más allá del laplaciano gráfico es usar vecinos para estimar el laplaciano. Este método es similar a los métodos de promedio local , que se sabe que escalan mal en problemas de alta dimensión. De hecho, se sabe que el laplaciano gráfico sufre la maldición de la dimensionalidad . [2] Afortunadamente, es posible aprovechar la suavidad esperada de la función para estimar gracias a un análisis funcional más avanzado. Este método consiste en estimar el operador laplaciano gracias a las derivadas del kernel leyendo donde denota las derivadas parciales de acuerdo con la coordenada j -ésima de la primera variable. [4] Este segundo enfoque de la norma laplaciana se pone en relación con los métodos sin malla , que contrastan con el método de diferencias finitas en PDE.
Aplicaciones
La regularización de variedades puede extender una variedad de algoritmos que pueden expresarse utilizando la regularización de Tikhonov, eligiendo una función de pérdida y un espacio de hipótesis adecuados . Dos ejemplos comúnmente utilizados son las familias de máquinas de vectores de soporte y algoritmos de mínimos cuadrados regularizados . (Los mínimos cuadrados regularizados incluyen el algoritmo de regresión de cresta; los algoritmos relacionados de LASSO y la regularización de red elástica pueden expresarse como máquinas de vectores de soporte. [5] [6] ) Las versiones extendidas de estos algoritmos se denominan Mínimos Cuadrados Regularizados Laplacianos (abreviados LapRLS) y Máquinas de Vectores de Soporte Laplacianos (LapSVM), respectivamente. [1]
Mínimos cuadrados regularizados laplacianos (LapRLS)
Los mínimos cuadrados regularizados (RLS) son una familia de algoritmos de regresión : algoritmos que predicen un valor para sus entradas , con el objetivo de que los valores predichos sean cercanos a las etiquetas verdaderas de los datos. En particular, RLS está diseñado para minimizar el error cuadrático medio entre los valores predichos y las etiquetas verdaderas, sujeto a regularización. La regresión de cresta es una forma de RLS; en general, RLS es lo mismo que la regresión de cresta combinada con el método kernel . [ cita requerida ] El enunciado del problema para RLS resulta de elegir la función de pérdida en la regularización de Tikhonov como el error cuadrático medio:
Gracias al teorema del representador , la solución se puede escribir como una suma ponderada del kernel evaluado en los puntos de datos:
y resolviendo obtenemos:
donde se define como la matriz del núcleo, con , y es el vector de etiquetas de datos.
Al agregar un término laplaciano para la regularización de variedades se obtiene la declaración RLS laplaciana:
El teorema del representante para la regularización de variedades da nuevamente
y esto produce una expresión para el vector . Sea la matriz del núcleo como se indica arriba, el vector de etiquetas de datos y la matriz de bloques :
con una solución de
- [1]
LapRLS se ha aplicado a problemas que incluyen redes de sensores, [7] imágenes médicas , [8] [9] detección de objetos, [10] espectroscopia , [11] clasificación de documentos , [12] interacciones fármaco-proteína, [13] y compresión de imágenes y videos. [14]
Máquinas de vectores de soporte laplacianos (LapSVM)
Las máquinas de vectores de soporte (SVM) son una familia de algoritmos que se utilizan a menudo para clasificar datos en dos o más grupos o clases . Intuitivamente, una SVM traza un límite entre clases de modo que los ejemplos etiquetados más cercanos al límite estén lo más alejados posible. Esto se puede expresar directamente como un programa lineal , pero también es equivalente a la regularización de Tikhonov con la función de pérdida de bisagra :
- [15] [16]
Al agregar el término de regularización intrínseca a esta expresión se obtiene el enunciado del problema LapSVM:
Nuevamente, el teorema del representador permite expresar la solución en términos del núcleo evaluado en los puntos de datos:
se puede encontrar escribiendo el problema como un programa lineal y resolviendo el problema dual . Nuevamente, siendo la matriz del núcleo y la matriz de bloques , se puede demostrar que la solución es
¿Dónde está la solución al problema dual?
y se define por
- [1]
LapSVM se ha aplicado a problemas que incluyen imágenes geográficas, [17] [18] [19] imágenes médicas, [20] [21] [22] reconocimiento facial, [23] mantenimiento de máquinas, [24] e interfaces cerebro-computadora . [25]
Limitaciones
- La regularización de variedades supone que no es probable que los datos con etiquetas diferentes estén muy juntos. Esta suposición es lo que permite que la técnica extraiga información de datos no etiquetados, pero solo se aplica a algunos dominios problemáticos. Dependiendo de la estructura de los datos, puede ser necesario utilizar un algoritmo de aprendizaje transductivo o semisupervisado diferente. [26]
- En algunos conjuntos de datos, la norma intrínseca de una función puede ser muy cercana a la norma ambiental : por ejemplo, si los datos consisten en dos clases que se encuentran en líneas perpendiculares, la norma intrínseca será igual a la norma ambiental. En este caso, los datos no etiquetados no tienen efecto en la solución aprendida por la regularización de variedades, incluso si los datos se ajustan al supuesto del algoritmo de que el separador debe ser suave. Se han propuesto enfoques relacionados con el co-entrenamiento para abordar esta limitación. [27]
- Si hay una gran cantidad de ejemplos sin etiquetar, la matriz del núcleo se vuelve muy grande y un algoritmo de regularización de variedades puede volverse prohibitivamente lento de calcular. Los algoritmos en línea y las aproximaciones dispersas de la variedad pueden ayudar en este caso. [28]
Véase también
- Aprendizaje múltiple
- Hipótesis de colectores
- Aprendizaje semisupervisado
- Transducción (aprendizaje automático)
- Teoría de grafos espectrales
- Reproducción del espacio de Hilbert del núcleo
- Regularización de Tikhonov
- Geometría diferencial
Referencias
- ^ abcdef Belkin, Mikhail; Niyogi, Partha; Sindhwani, Vikas (2006). "Regularización de variedades: un marco geométrico para el aprendizaje a partir de ejemplos etiquetados y no etiquetados". The Journal of Machine Learning Research . 7 : 2399– 2434 . Consultado el 2 de diciembre de 2015 .
- ^ ab Hein, Matthias; Audibert, Jean-Yves; Von Luxburg, Ulrike (2005). "De grafos a variedades: consistencia puntual débil y fuerte de laplacianos de grafos". Teoría del aprendizaje . Apuntes de clase en informática. Vol. 3559. Springer. pp. 470– 485. CiteSeerX 10.1.1.103.82 . doi :10.1007/11503415_32. ISBN . 978-3-540-26556-6.
- ^ Belkin, Mikhail; Niyogi, Partha (2005). "Hacia una base teórica para los métodos de variedades basados en el Laplaciano". Teoría del aprendizaje . Notas de clase en informática. Vol. 3559. Springer. pp. 486– 500. CiteSeerX 10.1.1.127.795 . doi :10.1007/11503415_33. ISBN . 978-3-540-26556-6.
- ^ Cabannes, Vivien; Pillaud-Vivien, Loucas; Bach, Francis; Rudi, Alessandro (2021). "Superando la maldición de la dimensionalidad con la regularización laplaciana en el aprendizaje semisupervisado". arXiv : 2009.04324 [stat.ML].
- ^ Jaggi, Martin (2014). Suykens, Johan; Signoretto, Marco; Argyriou, Andreas (eds.). Una equivalencia entre las máquinas Lasso y las máquinas de vectores de soporte . Chapman y Hall/CRC.
- ^ Zhou, Quan; Chen, Wenlin; Song, Shiji; Gardner, Jacob; Weinberger, Kilian; Chen, Yixin. Una reducción de la red elástica para máquinas de vectores de soporte con una aplicación a la computación GPU. Asociación para el Avance de la Inteligencia Artificial .
- ^ Pan, Jeffrey Junfeng; Yang, Qiang; Chang, Hong; Yeung, Dit-Yan (2006). "Un enfoque de regularización múltiple para la reducción de la calibración para el seguimiento basado en redes de sensores" (PDF) . Actas de la conferencia nacional sobre inteligencia artificial . Vol. 21. Menlo Park, CA; Cambridge, MA; Londres; AAAI Press; MIT Press; 1999. p. 988 . Consultado el 2 de diciembre de 2015 .
- ^ Zhang, Daoqiang; Shen, Dinggang (2011). "Clasificación multimodal semisupervisada de la enfermedad de Alzheimer". Imágenes biomédicas: de nano a macro, Simposio internacional IEEE 2011 sobre . IEEE. págs. 1628– 1631. doi :10.1109/ISBI.2011.5872715.
- ^ Park, Sang Hyun; Gao, Yaozong; Shi, Yinghuan; Shen, Dinggang (2014). "Segmentación interactiva de próstata basada en selección de características adaptativas y regularización de colectores". Aprendizaje automático en imágenes médicas . Apuntes de clase en informática. Vol. 8679. Springer. págs. 264– 271. doi :10.1007/978-3-319-10581-9_33. ISBN . 978-3-319-10580-2.
- ^ Pillai, Sudeep. "Aprendizaje de detectores de objetos semisupervisados a partir de etiquetas mínimas" (PDF) . Consultado el 15 de diciembre de 2015 .
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Wan, Songjing; Wu, Di; Liu, Kangsheng (2012). "Algoritmo de aprendizaje automático semisupervisado en calibración espectral de infrarrojo cercano: un estudio de caso sobre combustibles diésel". Advanced Science Letters . 11 (1): 416– 419. doi :10.1166/asl.2012.3044.
- ^ Wang, Ziqiang; Sun, Xia; Zhang, Lijie; Qian, Xu (2013). "Clasificación de documentos basada en Laprls óptimos". Journal of Software . 8 (4): 1011– 1018. doi :10.4304/jsw.8.4.1011-1018.
- ^ Xia, Zheng; Wu, Ling-Yun; Zhou, Xiaobo; Wong, Stephen TC (2010). "Predicción semisupervisada de la interacción fármaco-proteína a partir de espacios biológicos heterogéneos". BMC Systems Biology . 4 (Suppl 2): –6. CiteSeerX 10.1.1.349.7173 . doi : 10.1186/1752-0509-4-S2-S6 . PMC 2982693 . PMID 20840733.
- ^ Cheng, Li; Vishwanathan, SVN (2007). "Aprendiendo a comprimir imágenes y vídeos". Actas de la 24.ª conferencia internacional sobre aprendizaje automático . ACM. págs. 161– 168. Consultado el 16 de diciembre de 2015 .
- ^ Lin, Yi; Wahba, Grace; Zhang, Hao; Lee, Yoonkyung (2002). "Propiedades estadísticas y ajuste adaptativo de máquinas de vectores de soporte". Aprendizaje automático . 48 ( 1– 3): 115– 136. doi : 10.1023/A:1013951620650 .
- ^ Wahba, Grace; otros (1999). "Máquinas de vectores de soporte, que reproducen espacios de Hilbert del núcleo y el GACV aleatorio". Avances en métodos de núcleo: aprendizaje de vectores de soporte . 6 : 69–87 . CiteSeerX 10.1.1.53.2114 .
- ^ Kim, Wonkook; Crawford, Melba M. (2010). "Clasificación adaptativa para datos de imágenes hiperespectrales utilizando máquinas de núcleo de regularización de variedades". IEEE Transactions on Geoscience and Remote Sensing . 48 (11): 4110– 4121. doi :10.1109/TGRS.2010.2076287. S2CID 29580629.
- ^ Camps-Valls, Gustavo; Tuia, Devis; Bruzzone, Lorenzo; Atli Benediktsson, Jon (2014). "Avances en la clasificación de imágenes hiperespectrales: monitoreo de la Tierra con métodos de aprendizaje estadístico". Revista IEEE Signal Processing . 31 (1): 45– 54. arXiv : 1310.5107 . Bibcode :2014ISPM...31...45C. doi :10.1109/msp.2013.2279179. S2CID 11945705.
- ^ Gómez-Chova, Luis; Camps-Valls, Gustavo; Muñoz-Marí, Jordi; Calpe, Javier (2007). "Detección de nubes semisupervisada con Laplacian SVM". Simposio de geociencia y teledetección, 2007. IGARSS 2007. IEEE International . IEEE. págs. 1521-1524 . doi :10.1109/IGARSS.2007.4423098.
- ^ Cheng, Bo; Zhang, Daoqiang; Shen, Dinggang (2012). "Aprendizaje por transferencia de dominio para predicción de conversión de deterioro cognitivo leve". Computación de imágenes médicas e intervención asistida por computadora – MICCAI 2012. Apuntes de clase en informática. Vol. 7510. Springer. págs. 82– 90. doi :10.1007/978-3-642-33415-3_11. ISBN . 978-3-642-33414-6. PMC 3761352 . PMID 23285538.
- ^ Jamieson, Andrew R.; Giger, Maryellen L.; Drukker, Karen; Pesce, Lorenzo L. (2010). "Mejora de la CADx de mama con datos no etiquetadosa)". Física Médica . 37 (8): 4155– 4172. Bibcode :2010MedPh..37.4155J. doi :10.1118/1.3455704. PMC 2921421 . PMID 20879576.
- ^ Wu, Jiang; Diao, Yuan-Bo; Li, Meng-Long; Fang, Ya-Ping; Ma, Dai-Chuan (2009). "Un método basado en aprendizaje semisupervisado: máquina de vectores de soporte laplaciano utilizada en el diagnóstico de la enfermedad de la diabetes". Ciencias interdisciplinarias: Ciencias de la vida computacionales . 1 (2): 151– 155. doi :10.1007/s12539-009-0016-2. PMID 20640829. S2CID 21860700.
- ^ Wang, Ziqiang; Zhou, Zhiqiang; Sun, Xia; Qian, Xu; Sun, Lijun (2012). "Algoritmo LapSVM mejorado para reconocimiento facial". Revista internacional de avances en tecnología informática . 4 (17) . Consultado el 16 de diciembre de 2015 .
- ^ Zhao, Xiukuan; Li, Min; Xu, Jinwu; Song, Gangbing (2011). "Un procedimiento eficaz que explota datos no etiquetados para construir un sistema de monitoreo". Sistemas expertos con aplicaciones . 38 (8): 10199– 10204. doi :10.1016/j.eswa.2011.02.078.
- ^ Zhong, Ji-Ying; Lei, Xu; Yao, D. (2009). "Aprendizaje semisupervisado basado en colectores en BCI" (PDF) . Revista de Ciencia y Tecnología Electrónica de China . 7 (1): 22– 26 . Consultado el 16 de diciembre de 2015 .
- ^ Zhu, Xiaojin (2005). "Estudio de la literatura sobre aprendizaje semisupervisado". CiteSeerX 10.1.1.99.9681 .
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Sindhwani, Vikas; Rosenberg, David S. (2008). "Un RKHS para aprendizaje multivista y co-regularización de variedades". Actas de la 25.ª conferencia internacional sobre aprendizaje automático . ACM. págs. 976– 983. Consultado el 2 de diciembre de 2015 .
- ^ Goldberg, Andrew; Li, Ming; Zhu, Xiaojin (2008). "Regularización de variedades en línea: un nuevo entorno de aprendizaje y estudio empírico". Aprendizaje automático y descubrimiento de conocimiento en bases de datos . Apuntes de clase en informática. Vol. 5211. págs. 393– 407. doi :10.1007/978-3-540-87479-9_44. ISBN 978-3-540-87478-2.