Los métodos de kernel son una herramienta consolidada para analizar la relación entre los datos de entrada y la salida correspondiente de una función. Los kernels encapsulan las propiedades de las funciones de forma computacionalmente eficiente y permiten que los algoritmos intercambien fácilmente funciones de complejidad variable.
En los algoritmos típicos de aprendizaje automático , estas funciones producen una salida escalar. El reciente desarrollo de métodos kernel para funciones con salida vectorial se debe, al menos en parte, al interés por resolver simultáneamente problemas relacionados. Los kernels que capturan la relación entre los problemas les permiten aprovechar la información de cada uno. Los algoritmos de este tipo incluyen el aprendizaje multitarea (también llamado aprendizaje de salida múltiple o aprendizaje vectorial), el aprendizaje por transferencia y el co- kriging . La clasificación multietiqueta puede interpretarse como la asignación de entradas a vectores de codificación (binarios) con una longitud igual al número de clases.
En los procesos gaussianos , los núcleos se denominan funciones de covarianza . Las funciones de salida múltiple corresponden a la consideración de múltiples procesos. Consulte la interpretación bayesiana de la regularización para conocer la relación entre ambas perspectivas.
Historia
La historia del aprendizaje de funciones vectoriales está estrechamente ligada al aprendizaje por transferencia : almacenar el conocimiento adquirido al resolver un problema y aplicarlo a un problema diferente pero relacionado. La motivación fundamental para el aprendizaje por transferencia en el campo del aprendizaje automático se discutió en un taller de NIPS-95 sobre "Aprender a aprender", que se centró en la necesidad de métodos de aprendizaje automático a lo largo de la vida que retengan y reutilicen el conocimiento aprendido previamente. La investigación sobre el aprendizaje por transferencia ha atraído mucha atención desde 1995 con diferentes nombres: aprender a aprender, aprendizaje a lo largo de la vida, transferencia de conocimiento, transferencia inductiva, aprendizaje multitarea, consolidación del conocimiento, aprendizaje sensible al contexto, sesgo inductivo basado en el conocimiento , metaaprendizaje y aprendizaje incremental/acumulativo . [ 1 ] El interés en aprender funciones vectoriales fue impulsado particularmente por el aprendizaje multitarea, un marco que intenta aprender múltiples tareas, posiblemente diferentes, simultáneamente.
Gran parte de la investigación inicial en aprendizaje multitarea en la comunidad de aprendizaje automático fue de naturaleza algorítmica y se aplicó a métodos como redes neuronales, árboles de decisión y k -vecinos más cercanos en la década de 1990. [ 2 ] El uso de modelos probabilísticos y procesos gaussianos fue pionero y desarrollado en gran medida en el contexto de la geoestadística, donde la predicción sobre datos de salida con valores vectoriales se conoce como cokriging. [ 3 ] [ 4 ] [ 5 ] Los enfoques geoestadísticos para el modelado multivariado se formulan principalmente en torno al modelo lineal de corregionalización (LMC), un enfoque generativo para desarrollar funciones de covarianza válidas que se ha utilizado para la regresión multivariada y en estadística para la emulación computacional de costosos códigos informáticos multivariados. La literatura sobre regularización y teoría del núcleo para funciones con valores vectoriales surgió en la década de 2000. [ 6 ] [ 7 ] Si bien las perspectivas bayesiana y de regularización se desarrollaron de forma independiente, de hecho están estrechamente relacionadas. [ 8 ]
Notación
En este contexto, el problema del aprendizaje supervisado consiste en aprender la función¿Cuál predice mejor las salidas con valores vectoriales?Entradas dadas (datos).
- para
- , un espacio de entrada (por ejemplo)
En general, cada componente de (), podrían tener diferentes datos de entrada () con diferente cardinalidad () e incluso diferentes espacios de entrada (). [ 8 ] La literatura geoestadística denomina a este caso heterotópico y utiliza isotópico para indicar que cada componente del vector de salida tiene el mismo conjunto de entradas. [ 9 ]
Aquí, para simplificar la notación, asumimos que el número y el espacio muestral de los datos para cada salida son los mismos.
Perspectiva de regularización
Desde la perspectiva de la regularización, el problema es aprenderperteneciente a un espacio de Hilbert de núcleo reproductor de funciones con valores vectoriales (). Esto es similar al caso escalar de la regularización de Tikhonov , con un cuidado adicional en la notación.
Es posible, aunque no trivial, demostrar que un teorema de representación también se cumple para la regularización de Tikhonov en el contexto vectorial. [ 8 ]
Nótese que el núcleo con valores matricialesTambién puede definirse mediante un núcleo escalar.en el espacioExiste una isometría entre los espacios de Hilbert asociados a estos dos núcleos:
Perspectiva del proceso gaussiano
El estimador del marco de regularización con valores vectoriales también puede derivarse desde un punto de vista bayesiano utilizando métodos de procesos gaussianos en el caso de un espacio de Hilbert con núcleo reproductor de dimensión finita. La derivación es similar a la interpretación bayesiana de la regularización en el caso de valores escalares . La función con valores vectoriales, que consta deresultadosSe supone que sigue un proceso gaussiano:
dóndeahora es un vector de las funciones mediaspara las salidas yes una función matricial definida positiva con entradacorrespondiente a la covarianza entre las salidasy.
Para un conjunto de entradas, la distribución previa sobre el vectores dado por, dóndees un vector que concatena los vectores medios asociados a las salidas yes una matriz particionada en bloques. Se supone que la distribución de las salidas es gaussiana:
dóndees una matriz diagonal con elementosespecificando el ruido para cada salida. Usando esta forma para la verosimilitud, la distribución predictiva para un nuevo vectores:
dóndeson los datos de entrenamiento yes un conjunto de hiperparámetros paray.
Ecuaciones parayentonces se puede obtener:
dóndetiene entradasparay. Tenga en cuenta que el predictores idéntico al predictor derivado en el marco de regularización. Para funciones de verosimilitud no gaussianas, se necesitan diferentes métodos, como la aproximación de Laplace y los métodos variacionales, para aproximar los estimadores.
Ejemplos de núcleos
Separable
Una clase simple, pero ampliamente aplicable, de núcleos de múltiples salidas se puede separar en el producto de un núcleo en el espacio de entrada y un núcleo que representa las correlaciones entre las salidas: [ 8 ]
- : núcleo escalar en
- : núcleo escalar en
En forma matricial: dóndees unMatriz simétrica y semidefinida positiva. Nota: configuraciónLa matriz identidad trata las salidas como no relacionadas y es equivalente a resolver los problemas de salida escalar por separado.
Para una forma un poco más general, la suma de varios de estos núcleos produce una suma de núcleos separables (núcleos SoS).
De la literatura sobre regularización
Fuentes: [ 8 ] [ 10 ] [ 12 ] [ 13 ] [ 14 ]
Derivado del regularizador
Una forma de obteneres especificar un regularizador que limite la complejidad dede forma deseable, y luego derivar el núcleo correspondiente. Para ciertos regularizadores, este núcleo resultará ser separable.
Regularizador de efectos mixtos
dónde:
dóndematriz con todas las entradas iguales a 1.
Este regularizador es una combinación de limitar la complejidad de cada componente del estimador () y forzando a que cada componente del estimador esté cerca de la media de todos los componentes. Estableciendotrata todos los componentes como independientes y es lo mismo que resolver los problemas escalares por separado. Configuraciónpresupone que todos los componentes se explican mediante la misma función.
Regularizador basado en clústeres
dónde:
- es el conjunto de índices de componentes que pertenecen al clúster
- es la cardinalidad del clúster
- siyambos pertenecen al grupo (de lo contrario
dónde
Este regularizador divide los componentes enagrupa y obliga a que los componentes de cada grupo sean similares.
Regularizador de gráficos
dóndematriz de pesos que codifica las similitudes entre los componentes
dónde,
Nota,es el laplaciano del grafo . Véase también: núcleo del grafo .
Aprendido a partir de los datos
Diversos enfoques para el aprendizajeSe han propuesto métodos a partir de datos. [ 8 ] Estos incluyen: realizar un paso de inferencia preliminar para estimara partir de los datos de entrenamiento, [ 9 ] una propuesta para aprenderyjuntos basados en el regularizador de clúster, [ 15 ] y enfoques basados en la escasez que suponen que solo se necesitan unas pocas de las características. [ 16 ] [ 17 ]
De la literatura bayesiana
Modelo lineal de corregionalización (LMC)
En LMC, las salidas se expresan como combinaciones lineales de funciones aleatorias independientes, de modo que la función de covarianza resultante (sobre todas las entradas y salidas) es una función semidefinida positiva válida. Suponiendoresultadoscon, cadase expresa como:
dóndeson coeficientes escalares y las funciones independientestienen media cero y covarianza covsiy 0 en caso contrario. La covarianza cruzada entre dos funciones cualesquierayentonces se puede escribir como:
donde las funciones, conytienen media cero y covarianza covsiy. Peroes dado por. Por lo tanto, el núcleoahora se puede expresar como
donde cadase conoce como matriz de corregionalización. Por lo tanto, el núcleo derivado de LMC es una suma de los productos de dos funciones de covarianza, una que modela la dependencia entre las salidas, independientemente del vector de entrada.(la matriz de corregionalización), y uno que modela la dependencia de entrada, independientemente de(la función de covarianza).
Modelo de corregionalización intrínseca (MCI)
El ICM es una versión simplificada del LMC, con. ICM supone que los elementosde la matriz de corregionalizaciónse puede escribir como, para algunos coeficientes adecuados. Con este formulario para:
dónde
En este caso, los coeficientes
y la matriz del núcleo para múltiples salidas se convierte en. ICM es mucho más restrictivo que LMC ya que asume que cada covarianza básicaContribuye por igual a la construcción de las autocovarianzas y covarianzas cruzadas para las salidas. Sin embargo, los cálculos necesarios para la inferencia se simplifican enormemente.
modelo de factores latentes semiparamétrico (SLFM)
Otra versión simplificada del LMC es el modelo de factor latente semiparamétrico (SLFM), que corresponde a establecer(en lugar decomo en ICM). Por lo tanto, cada función latentetiene su propia covarianza.
No separable
Si bien es sencilla, la estructura de los núcleos separables puede resultar demasiado limitante para algunos problemas.
Algunos ejemplos notables de núcleos no separables en la literatura sobre regularización incluyen:
- Núcleos cuadráticos exponenciados (EQ) con valores matriciales diseñados para estimar campos vectoriales libres de divergencia o libres de rotacional (o una combinación convexa de ambos) [ 8 ] [ 18 ]
- Núcleos definidos por transformaciones [ 8 ] [ 19 ]
Desde la perspectiva bayesiana , LMC produce un núcleo separable porque las funciones de salida se evalúan en un puntosolo dependen de los valores de las funciones latentes enUna forma no trivial de mezclar las funciones latentes es mediante la convolución de un proceso base con un núcleo de suavizado. Si el proceso base es un proceso gaussiano, el proceso convolucionado también lo es. Por lo tanto, podemos aprovechar las convoluciones para construir funciones de covarianza. [ 20 ] Este método de producir núcleos no separables se conoce como convolución de procesos. Las convoluciones de procesos se introdujeron para múltiples salidas en la comunidad de aprendizaje automático como "procesos gaussianos dependientes". [ 21 ]
Implementación
Al implementar un algoritmo utilizando cualquiera de los núcleos mencionados anteriormente, deben tenerse en cuenta consideraciones prácticas como el ajuste de los parámetros y la garantía de un tiempo de cálculo razonable.
Perspectiva de regularización
Desde la perspectiva de la regularización, el ajuste de parámetros es similar al caso de valores escalares y generalmente se puede lograr con validación cruzada . Resolver el sistema lineal requerido suele ser costoso en memoria y tiempo. Si el núcleo es separable, una transformación de coordenadas puede convertira una matriz diagonal por bloques , reduciendo enormemente la carga computacional al resolver D subproblemas independientes (más la descomposición en valores propios de). En particular, para una función de pérdida de mínimos cuadrados (regularización de Tikhonov), existe una solución de forma cerrada para: [ 8 ] [ 14 ]
Perspectiva bayesiana
Existen numerosos trabajos relacionados con la estimación de parámetros para procesos gaussianos. Algunos métodos, como la maximización de la verosimilitud marginal (también conocida como aproximación de la evidencia, máxima verosimilitud de tipo II o Bayes empírico) y los mínimos cuadrados, proporcionan estimaciones puntuales del vector de parámetros.También existen trabajos que emplean una inferencia bayesiana completa asignando distribuciones a priori ay calculando la distribución posterior mediante un procedimiento de muestreo. Para funciones de verosimilitud no gaussianas, no existe una solución analítica para la distribución posterior ni para la verosimilitud marginal. Sin embargo, la verosimilitud marginal puede aproximarse mediante los métodos de aproximación de Laplace, Bayes variacional o propagación de expectativas (EP) para la clasificación de múltiples salidas, y utilizarse para obtener estimaciones de los hiperparámetros.
El principal problema computacional desde el punto de vista bayesiano es el mismo que aparece en la teoría de regularización de la inversión de la matriz.
Este paso es necesario para calcular la verosimilitud marginal y la distribución predictiva. Para la mayoría de los métodos de aproximación propuestos para reducir el cálculo, la eficiencia computacional obtenida es independiente del método particular empleado (por ejemplo, LMC, convolución de procesos) utilizado para calcular la matriz de covarianza de múltiples salidas. En [ 8 ] se presenta un resumen de diferentes métodos para reducir la complejidad computacional en procesos gaussianos de múltiples salidas.
Referencias
- ↑ SJ Pan y Q. Yang, "Una revisión sobre el aprendizaje por transferencia", IEEE Transactions on Knowledge and Data Engineering, 22, 2010
- ↑ Rich Caruana, "Aprendizaje multitarea", Aprendizaje automático, 41–76, 1997
- ↑ J. Ver Hoef y R. Barry, " Construcción y ajuste de modelos para cokriging y predicción espacial multivariable "," Journal of Statistical Planning and Inference, 69:275–294, 1998
- ↑ P. Goovaerts, "Geoestadística para la evaluación de recursos naturales", Oxford University Press, EE. UU., 1997
- ↑ N. Cressie, "Estadística para datos espaciales", John Wiley & Sons Inc. (Edición revisada), EE. UU., 1993
- ↑ CA Micchelli y M. Pontil, " Sobre el aprendizaje de funciones con valores vectoriales ", Neural Computation, 17:177–204, 2005
- ↑ C. Carmeli et al., " Espacios de Hilbert con núcleo reproductor de valores vectoriales de funciones integrables y teorema de Mercer ", Anal. Appl. (Singap.), 4
- 1 2 3 4 5 6 7 8 9 10 11 Mauricio A. Álvarez, Lorenzo Rosasco y Neil D. Lawrence, «Núcleos para funciones vectoriales: una revisión», Foundations and Trends in Machine Learning 4, n.º 3 (2012): 195–266. doi: 10.1561/2200000036 arXiv:1106.6251
- ^ Hans Wackernagel. Geoestadística multivariada. Springer-Verlag Heidelberg Nueva York, 2003.
- 1 2 C.A. Micchelli y M. Pontil. Sobre el aprendizaje de funciones con valores vectoriales. Neural Computation, 17:177–204, 2005.
- ↑ C. Carmeli, E. DeVito y A. Toigo. Espacios de Hilbert con núcleo reproductor de valores vectoriales de funciones integrables y teorema de Mercer. Anal. Appl. (Singapur), 4(4):377–408, 2006.
- ↑ CA Micchelli y M. Pontil. Núcleos para el aprendizaje multitarea. En Avances en sistemas de procesamiento de información neuronal (NIPS). MIT Press, 2004.
- ↑ T. Evgeniou, C.A. Micchelli y M. Pontil. Aprendizaje de múltiples tareas con métodos de kernel . Journal of Machine Learning Research, 6:615–637, 2005.
- 1 2 L. Baldassarre, L. Rosasco, A. Barla y A. Verri. Aprendizaje de salida múltiple mediante filtrado espectral . Informe técnico, Instituto Tecnológico de Massachusetts, 2011. MIT-CSAIL-TR-2011-004, CBCL-296.
- ↑ Laurent Jacob, Francis Bach y Jean-Philippe Vert. Aprendizaje multitarea agrupado: una formulación convexa . En NIPS 21, páginas 745–752, 2008.
- ↑ Andreas Argyriou, Theodoros Evgeniou y Massimiliano Pontil. Aprendizaje de características multitarea convexas. Machine Learning, 73(3):243–272, 2008.
- ↑ Andreas Argyriou, Andreas Maurer y Massimiliano Pontil. Un algoritmo para el aprendizaje por transferencia en un entorno heterogéneo. En ECML/PKDD (1), páginas 71–85, 2008.
- ↑ I. Macedo y R. Castro. Aprendizaje de campos vectoriales sin divergencia y sin curvatura con núcleos con valores matriciales. Informe técnico, Instituto Nacional de Matemática Pura e Aplicada, 2008.
- ↑ A. Caponnetto, CA Micchelli, M. Pontil y Y. Ying. Núcleos universales para el aprendizaje multitarea. Journal of Machine Learning Research, 9:1615–1646, 2008.
- ↑ D. Higdon, "Modelado del espacio y del espacio-tiempo mediante convoluciones de procesos", Métodos cuantitativos para problemas ambientales actuales, 37–56, 2002
- ↑ P. Boyle y M. Frean, " Procesos gaussianos dependientes ", Advances in Neural Information Processing Systems, 17:217–224, MIT Press, 2005
- algoritmos de aprendizaje automático
- Métodos de kernel para el aprendizaje automático