Las máquinas de vectores de soporte de mínimos cuadrados (LS-SVM) para estadística y en modelado estadístico son versiones de mínimos cuadrados de las máquinas de vectores de soporte (SVM), que son un conjunto de métodos de aprendizaje supervisado relacionados que analizan datos y reconocen patrones, y que se utilizan para análisis de clasificación y regresión . En esta versión se encuentra la solución resolviendo un conjunto de ecuaciones lineales en lugar de un problema de programación cuadrática convexa (QP) para las SVM clásicas. Los clasificadores SVM de mínimos cuadrados fueron propuestos por Johan Suykens y Joos Vandewalle. [ 1 ] Las LS-SVM son una clase de métodos de aprendizaje basados en kernels .
De la máquina de vectores de soporte a la máquina de vectores de soporte de mínimos cuadrados
Dado un conjunto de entrenamientocon datos de entraday etiquetas de clase binarias correspondientes, el clasificador SVM [ 2 ] , según la formulación original de Vapnik , satisface las siguientes condiciones:

lo cual es equivalente a
dóndees la aplicación no lineal del espacio original al espacio de alta dimensión o de dimensión infinita.
Datos inseparables
En caso de que no exista dicho hiperplano separador, introducimos las llamadas variables de holgura.de tal manera que

Según el principio de minimización del riesgo estructural , el límite de riesgo se minimiza mediante el siguiente problema de minimización:
Para resolver este problema, podríamos construir la función lagrangiana :
dóndeson los multiplicadores de Lagrange . El punto óptimo estará en el punto de silla de la función de Lagrange, y entonces obtenemos
Al sustituirAl expresarlo en el lagrangiano formado a partir del objetivo y las restricciones apropiadas, obtendremos el siguiente problema de programación cuadrática:
dóndese denomina función kernel . Resolviendo este problema QP sujeto a las restricciones en ( 1 ), obtendremos el hiperplano en el espacio de alta dimensión y, por lo tanto, el clasificador en el espacio original.
Formulación de SVM por mínimos cuadrados
La versión de mínimos cuadrados del clasificador SVM se obtiene reformulando el problema de minimización como
sujeto a las restricciones de igualdad
La formulación del clasificador SVM de mínimos cuadrados (LS-SVM) anterior corresponde implícitamente a una interpretación de regresión con objetivos binarios..
Usando, tenemos
conNótese que este error también tendría sentido para el ajuste de datos por mínimos cuadrados, de modo que el mismo resultado final se mantiene para el caso de regresión.
Por lo tanto, la formulación del clasificador LS-SVM es equivalente a
cony

AmbosyDeben considerarse como hiperparámetros para ajustar la cantidad de regularización en función de la suma de los errores cuadráticos. La solución solo depende de la relación., por lo tanto, la formulación original utiliza solocomo parámetro de ajuste. Usamos ambosycomo parámetros para proporcionar una interpretación bayesiana a LS-SVM.
La solución del regresor LS-SVM se obtendrá después de construir la función lagrangiana :
dóndeson los multiplicadores de Lagrange. Las condiciones de optimalidad son
Eliminación deydará como resultado un sistema lineal en lugar de un problema de programación cuadrática :
con,y. Aquí,es unmatriz identidad yes la matriz del núcleo definida por.
Función núcleo K
Para la función núcleo K (•, •) normalmente se tienen las siguientes opciones:
- Núcleo lineal :
- Núcleo polinómico de grado:
- Núcleo de función de base radial (RBF) :
- núcleo MLP :
dónde,,,yson constantes. Nótese que la condición de Mercer se cumple para todosyvalores en el caso polinómico y RBF, pero no para todas las posibles elecciones deyen el caso de MLP. Los parámetros de escala,yDeterminar el escalado de las entradas en la función kernel polinómica, RBF y MLP . Este escalado está relacionado con el ancho de banda del kernel en estadística , donde se demuestra que el ancho de banda es un parámetro importante del comportamiento de generalización de un método kernel.
Interpretación bayesiana para LS-SVM
Smola et al. propusieron una interpretación bayesiana de la SVM. Demostraron que el uso de diferentes núcleos en la SVM puede considerarse como la definición de diferentes distribuciones de probabilidad a priori en el espacio funcional, como. Aquíes una constante yes el operador de regularización correspondiente al núcleo seleccionado.
MacKay desarrolló un marco general de evidencia bayesiana, [ 3 ] [ 4 ] [ 5 ] y lo ha utilizado para el problema de la regresión, las redes neuronales directas y las redes de clasificación. Conjunto de datos proporcionado, un modelocon vector de parámetrosy un denominado hiperparámetro o parámetro de regularización.La inferencia bayesiana se construye con 3 niveles de inferencia:
- En el nivel 1, para un valor dado de, el primer nivel de inferencia infiere la distribución posterior depor regla bayesiana
- El segundo nivel de inferencia determina el valor de, maximizando
- El tercer nivel de inferencia en el marco de evidencia clasifica diferentes modelos examinando sus probabilidades posteriores.
Podemos observar que el marco de evidencia bayesiana constituye una teoría unificada para el aprendizaje y la selección de modelos. Kwok utilizó este marco para interpretar la formulación de las máquinas de vectores de soporte (SVM) y la selección de modelos. Asimismo, lo aplicó a la regresión de vectores de soporte.
Ahora, dados los puntos de datosy los hiperparámetrosydel modelo, los parámetros del modeloyse estiman maximizando la posteriorAplicando la regla de Bayes, obtenemos
dóndees una constante de normalización tal que la integral sobre todos los posiblesyes igual a 1. Suponemos queyson independientes del hiperparámetroy son condicionalmente independientes, es decir, asumimos
Cuando, la distribución dese aproximará a una distribución uniforme. Además, asumimosyson distribución gaussiana, por lo que obtenemos la distribución a priori deyconser
Aquíes la dimensionalidad del espacio de características, igual que la dimensionalidad de.
La probabilidad dese supone que depende únicamente deySuponemos que los puntos de datos están distribuidos de forma independiente e idéntica (i.i.d.), de modo que:
Para obtener la función de coste de mínimos cuadrados, se supone que la probabilidad de un punto de datos es proporcional a:
Se toma una distribución gaussiana para los errores.como:
Se supone que elyse determinan de tal manera que los centros de claseyse mapean sobre el objetivo -1 y +1, respectivamente. Las proyeccionesde los elementos de la clasesiguen una distribución gaussiana multivariada, que tiene varianza.
Combinando las expresiones anteriores y despreciando todas las constantes, la regla de Bayes se convierte en:
Las estimaciones de densidad posterior máximayse obtienen luego minimizando el logaritmo negativo de (26), por lo que llegamos a (10).
Referencias
- ↑ Suykens, J. A. K.; Vandewalle, J. (1999) "Clasificadores de máquinas de vectores de soporte de mínimos cuadrados", Neural Processing Letters , 9 (3), 293–300.
- ↑ Vapnik, V. La naturaleza de la teoría del aprendizaje estadístico. Springer-Verlag, Nueva York, 1995.
- ↑ MacKay, D. J. C. Interpolación bayesiana. Neural Computation, 4(3): 415–447, mayo de 1992.
- ↑ MacKay, D. J. C. Un marco bayesiano práctico para redes de retropropagación. Neural Computation, 4(3): 448–472, mayo de 1992.
- ↑ MacKay, D. J. C. El marco de evidencia aplicado a las redes de clasificación. Neural Computation, 4(5): 720–736, septiembre de 1992.
Bibliografía
- JAK Suykens, T. Van Gestel, J. De Brabanter, B. De Moor, J. Vandewalle, Máquinas de vectores de soporte de mínimos cuadrados, World Scientific Pub. Co., Singapur, 2002. ISBN 981-238-151-1
- Suykens J. A. K., Vandewalle J., Clasificadores de máquinas de vectores de soporte de mínimos cuadrados, Neural Processing Letters , vol. 9, n.º 3, junio de 1999, págs. 293-300.
- Vladimir Vapnik. La naturaleza de la teoría del aprendizaje estadístico . Springer-Verlag, 1995. ISBN 0-387-98780-0
- MacKay, DJC, Redes probables y predicciones plausibles: una revisión de métodos bayesianos prácticos para redes neuronales supervisadas. Network: Computation in Neural Systems , vol. 6, 1995, pp. 469–505.
Enlaces externos
- www.esat.kuleuven.be/sista/lssvmlab/ "La caja de herramientas Least squares support vector machine Lab (LS-SVMlab) contiene implementaciones en Matlab/C para varios algoritmos LS-SVM".
- www.kernel-machines.org "Máquinas de vectores de soporte y métodos basados en kernels (Smola y Schölkopf)".
- www.gaussianprocess.org "Procesos gaussianos: modelado de datos utilizando priors de procesos gaussianos sobre funciones para regresión y clasificación (MacKay, Williams)".
- www.support-vector.net "Máquinas de vectores de soporte y métodos basados en kernel (Cristianini)".
- dlib : Contiene una implementación de SVM de mínimos cuadrados para conjuntos de datos a gran escala.
- Máquinas de vectores de soporte
- Algoritmos de clasificación
- Clasificación estadística
- Mínimos cuadrados
- 1999 en inteligencia artificial
- Análisis de regresión
- Métodos de kernel para el aprendizaje automático