Articulo de referencia

Máquina de vectores de soporte de mínimos cuadrados

Las máquinas de vectores de soporte de mínimos cuadrados (LS-SVM) para estadística y en modelado estadístico son versiones de mínimos cuadrados de las máquinas de vectores de so...

Las máquinas de vectores de soporte de mínimos cuadrados (LS-SVM) para estadística y en modelado estadístico son versiones de mínimos cuadrados de las máquinas de vectores de soporte (SVM), que son un conjunto de métodos de aprendizaje supervisado relacionados que analizan datos y reconocen patrones, y que se utilizan para análisis de clasificación y regresión . En esta versión se encuentra la solución resolviendo un conjunto de ecuaciones lineales en lugar de un problema de programación cuadrática convexa (QP) para las SVM clásicas. Los clasificadores SVM de mínimos cuadrados fueron propuestos por Johan Suykens y Joos Vandewalle. [ 1 ] Las LS-SVM son una clase de métodos de aprendizaje basados ​​en kernels .

De la máquina de vectores de soporte a la máquina de vectores de soporte de mínimos cuadrados

Dado un conjunto de entrenamiento{incógnitai,yi}i=1norte{\displaystyle \{x_{i},y_{i}\}_{i=1}^{N}}con datos de entradaincógnitaiRnorte{\displaystyle x_{i}\in \mathbb {R} ^{n}}y etiquetas de clase binarias correspondientesyi{1,+1}{\displaystyle y_{i}\in \{-1,+1\}}, el clasificador SVM [ 2 ] , según la formulación original de Vapnik , satisface las siguientes condiciones:

Los datos en espiral:yi=1{\displaystyle y_{i}=1}para el punto de datos azul,yi=1{\displaystyle y_{i}=-1}para el punto de datos rojo
{wTϕ(incógnitai)+b1,si yi=+1,wTϕ(incógnitai)+b1,si yi=1,{\displaystyle {\begin{cases}w^{T}\phi (x_{i})+b\geq 1,&{\text{si }}\quad y_{i}=+1,\\w^{T}\phi (x_{i})+b\leq -1,&{\text{si }}\quad y_{i}=-1,\end{cases}}}

lo cual es equivalente a

yi[wTϕ(incógnitai)+b]1,i=1,,norte,{\displaystyle y_{i}\left[{w^{T}\phi (x_{i})+b}\right]\geq 1,\quad i=1,\ldots ,N,}

dóndeϕ(incógnita){\displaystyle \phi (x)}es la aplicación no lineal del espacio original al espacio de alta dimensión o de dimensión infinita.

Datos inseparables

En caso de que no exista dicho hiperplano separador, introducimos las llamadas variables de holgura.ξi{\displaystyle \xi _{i}}de tal manera que

{yi[wTϕ(incógnitai)+b]1ξi,i=1,,norte,ξi0,i=1,,norte.{\displaystyle {\begin{cases}y_{i}\left[{w^{T}\phi (x_{i})+b}\right]\geq 1-\xi _{i},&i=1,\ldots ,N,\\\xi _{i}\geq 0,&i=1,\ldots ,N.\end{cases}}}
El resultado del clasificador SVM

Según el principio de minimización del riesgo estructural , el límite de riesgo se minimiza mediante el siguiente problema de minimización:

minJ1(w,ξ)=12wTw+doi=1norteξi,{\displaystyle \min J_{1}(w,\xi )={\frac {1}{2}}w^{T}w+c\sum \limits _{i=1}^{N}\xi _{i},}
Sujeto a {yi[wTϕ(incógnitai)+b]1ξi,i=1,,norte,ξi0,i=1,,norte,{\displaystyle {\text{Sujeto a }}{\begin{cases}y_{i}\left[{w^{T}\phi (x_{i})+b}\right]\geq 1-\xi _{i},&i=1,\ldots ,N,\\\xi _{i}\geq 0,&i=1,\ldots ,N,\end{cases}}}

Para resolver este problema, podríamos construir la función lagrangiana :

L1(w,b,ξ,α,β)=12wTw+doi=1norteξii=1norteαi{yi[wTϕ(incógnitai)+b]1+ξi}i=1norteβiξi,{\displaystyle L_{1}(w,b,\xi ,\alpha ,\beta )={\frac {1}{2}}w^{T}w+c\sum \limits _{i=1}^{N}{\xi _{i}}-\sum \limits _{i=1}^{N}\alpha _{i}\left\{y_{i}\left[{w^{T}\phi (x_{i})+b}\right]-1+\xi _{i}\right\}-\sum \limits _{i=1}^{N}\beta _{i}\xi _{i},}

dóndeαi0, βi0 (i=1,,norte){\displaystyle \alpha _{i}\geq 0,\ \beta _{i}\geq 0\ (i=1,\ldots ,N)}son los multiplicadores de Lagrange . El punto óptimo estará en el punto de silla de la función de Lagrange, y entonces obtenemos

Al sustituirw{\displaystyle w}Al expresarlo en el lagrangiano formado a partir del objetivo y las restricciones apropiadas, obtendremos el siguiente problema de programación cuadrática:

máximoQ1(α)=12i,j=1norteαiαjyiyjK(incógnitai,incógnitaj)+i=1norteαi,{\displaystyle \max Q_{1}(\alpha )=-{\frac {1}{2}}\sum \limits _{i,j=1}^{N}{\alpha _{i}\alpha _{j}y_{i}y_{j}K(x_{i},x_{j})}+\sum \limits _{i=1}^{N}\alpha _{i},}

dóndeK(incógnitai,incógnitaj)=ϕ(incógnitai),ϕ(incógnitaj){\displaystyle K(x_{i},x_{j})=\left\langle \phi (x_{i}),\phi (x_{j})\right\rangle }se denomina función kernel . Resolviendo este problema QP sujeto a las restricciones en ( 1 ), obtendremos el hiperplano en el espacio de alta dimensión y, por lo tanto, el clasificador en el espacio original.

Formulación de SVM por mínimos cuadrados

La versión de mínimos cuadrados del clasificador SVM se obtiene reformulando el problema de minimización como

minJ2(w,b,mi)=μ2wTw+ζ2i=1nortemii2,{\displaystyle \min J_{2}(w,b,e)={\frac {\mu }{2}}w^{T}w+{\frac {\zeta }{2}}\sum \limits _{i=1}^{N}e_{i}^{2},}

sujeto a las restricciones de igualdad

yi[wTϕ(incógnitai)+b]=1mii,i=1,,norte.{\displaystyle y_{i}\left[{w^{T}\phi (x_{i})+b}\right]=1-e_{i},\quad i=1,\ldots ,N.}

La formulación del clasificador SVM de mínimos cuadrados (LS-SVM) anterior corresponde implícitamente a una interpretación de regresión con objetivos binarios.yi=±1{\displaystyle y_{i}=\pm 1}.

Usandoyi2=1{\displaystyle y_{i}^{2}=1}, tenemos

i=1nortemii2=i=1norte(yimii)2=i=1nortemii2=i=1norte(yi(wTϕ(incógnitai)+b))2,{\displaystyle \sum \limits _{i=1}^{N}e_{i}^{2}=\sum \limits _{i=1}^{N}(y_{i}e_{i})^{2}=\sum \limits _{i=1}^{N}e_{i}^{2}=\sum \limits _{i=1}^{N}\left(y_{i}-(w^{T}\phi (x_{i})+b)\right)^{2},}

conmii=yi(wTϕ(incógnitai)+b).{\displaystyle e_{i}=y_{i}-(w^{T}\phi (x_{i})+b).}Nótese que este error también tendría sentido para el ajuste de datos por mínimos cuadrados, de modo que el mismo resultado final se mantiene para el caso de regresión.

Por lo tanto, la formulación del clasificador LS-SVM es equivalente a

J2(w,b,mi)=μmiW+ζmiD{\displaystyle J_{2}(w,b,e)=\mu E_{W}+\zeta E_{D}}

conmiW=12wTw{\displaystyle E_{W}={\frac {1}{2}}w^{T}w}ymiD=12i=1nortemii2=12i=1norte(yi(wTϕ(incógnitai)+b))2.{\displaystyle E_{D}={\frac {1}{2}}\sum \limits _{i=1}^{N}e_{i}^{2}={\frac {1}{2}}\sum \limits _{i=1}^{N}\left(y_{i}-(w^{T}\phi (x_{i})+b)\right)^{2}.}

El resultado del clasificador LS-SVM

Ambosμ{\displaystyle \mu }yζ{\displaystyle \zeta }Deben considerarse como hiperparámetros para ajustar la cantidad de regularización en función de la suma de los errores cuadráticos. La solución solo depende de la relación.γ=ζ/μ{\displaystyle \gamma =\zeta /\mu }, por lo tanto, la formulación original utiliza soloγ{\displaystyle \gamma }como parámetro de ajuste. Usamos ambosμ{\displaystyle \mu }yζ{\displaystyle \zeta }como parámetros para proporcionar una interpretación bayesiana a LS-SVM.

La solución del regresor LS-SVM se obtendrá después de construir la función lagrangiana :

{L2(w,b,mi,α)=J2(w,mi)i=1norteαi{[wTϕ(incógnitai)+b]+miiyi},=12wTw+γ2i=1nortemii2i=1norteαi{[wTϕ(incógnitai)+b]+miiyi},{\displaystyle {\begin{cases}L_{2}(w,b,e,\alpha )\;=J_{2}(w,e)-\sum \limits _{i=1}^{N}\alpha _{i}\left\{{\left[{w^{T}\phi (x_{i})+b}\right]+e_{i}-y_{i}}\right\},\\\quad \quad \quad \quad \quad \;={\frac {1}{2}}w^{T}w+{\frac {\gamma }{2}}\sum \limits _{i=1}^{N}e_{i}^{2}-\sum \limits _{i=1}^{N}\alpha _{i}\left\{\left[w^{T}\phi (x_{i})+b\right]+e_{i}-y_{i}\right\},\end{cases}}}

dóndeαiR{\displaystyle \alpha _{i}\in \mathbb {R} }son los multiplicadores de Lagrange. Las condiciones de optimalidad son

{L2w=0w=i=1norteαiϕ(incógnitai),L2b=0i=1norteαi=0,L2mii=0αi=γmii,i=1,,norte,L2αi=0yi=wTϕ(incógnitai)+b+mii,i=1,,norte.{\displaystyle {\begin{cases}{\frac {\partial L_{2}}{\partial w}}=0\quad \to \quad w=\sum \limits _{i=1}^{N}\alpha _{i}\phi (x_{i}),\\{\frac {\partial L_{2}}{\partial b}}=0\quad \to \quad \sum \limits _{i=1}^{N}\alpha _{i}=0,\\{\frac {\partial L_{2}}{\partial e_{i}}}=0\quad \to \quad \alpha _{i}=\gamma e_{i},\;i=1,\ldots ,N,\\{\frac {\partial L_{2}}{\partial \alpha _{i}}}=0\quad \to \quad y_{i}=w^{T}\phi (x_{i})+b+e_{i},\,i=1,\ldots ,N.\end{cases}}}

Eliminación dew{\displaystyle w}ymi{\displaystyle e}dará como resultado un sistema lineal en lugar de un problema de programación cuadrática :

[01norteT1norteΩ+γ1Inorte][bα]=[0Y],{\displaystyle \left[{\begin{matrix}0&1_{N}^{T}\\1_{N}&\Omega +\gamma ^{-1}I_{N}\end{matrix}}\right]\left[{\begin{matrix}b\\\alpha \end{matrix}}\right]=\left[{\begin{matrix}0\\Y\end{matrix}}\right],}

conY=[y1,,ynorte]T{\displaystyle Y=[y_{1},\ldots ,y_{N}]^{T}},1norte=[1,,1]T{\displaystyle 1_{N}=[1,\ldots ,1]^{T}}yα=[α1,,αnorte]T{\displaystyle \alpha =[\alpha _{1},\ldots ,\alpha _{N}]^{T}}. Aquí,Inorte{\displaystyle I_{N}}es unnorte×norte{\displaystyle N\times N}matriz identidad yΩRnorte×norte{\displaystyle \Omega \in \mathbb {R} ^{N\times N}}es la matriz del núcleo definida porΩij=ϕ(incógnitai)Tϕ(incógnitaj)=K(incógnitai,incógnitaj){\displaystyle \Omega _{ij}=\phi (x_{i})^{T}\phi (x_{j})=K(x_{i},x_{j})}.

Función núcleo K

Para la función núcleo K (•, •) normalmente se tienen las siguientes opciones:

  • Núcleo lineal  :K(incógnita,incógnitai)=incógnitaiTincógnita,{\displaystyle K(x,x_{i})=x_{i}^{T}x,}
  • Núcleo polinómico de gradod{\displaystyle d}:K(incógnita,incógnitai)=(1+incógnitaiTincógnita/do)d,{\displaystyle K(x,x_{i})=\left({1+x_{i}^{T}x/c}\right)^{d},}
  • Núcleo de función de base radial  (RBF) :K(incógnita,incógnitai)=exp(incógnitaincógnitai2/σ2),{\displaystyle K(x,x_{i})=\exp \left({-\left\|{x-x_{i}}\right\|^{2}/\sigma ^{2}}\right),}
  • núcleo MLP  :K(incógnita,incógnitai)=tanh(kincógnitaiTincógnita+θ),{\displaystyle K(x,x_{i})=\tanh \left({k\,x_{i}^{T}x+\theta }\right),}

dónded{\displaystyle d},do{\displaystyle c},σ{\displaystyle \sigma },k{\displaystyle k}yθ{\displaystyle \theta }son constantes. Nótese que la condición de Mercer se cumple para todosdo,σR+{\displaystyle c,\sigma \in \mathbb {R} ^{+}}ydnorte{\displaystyle d\in N}valores en el caso polinómico y RBF, pero no para todas las posibles elecciones dek{\displaystyle k}yθ{\displaystyle \theta }en el caso de MLP. Los parámetros de escalado{\displaystyle c},σ{\displaystyle \sigma }yk{\displaystyle k}Determinar el escalado de las entradas en la función kernel polinómica, RBF y MLP . Este escalado está relacionado con el ancho de banda del kernel en estadística , donde se demuestra que el ancho de banda es un parámetro importante del comportamiento de generalización de un método kernel.

Interpretación bayesiana para LS-SVM

Smola et al. propusieron una interpretación bayesiana de la SVM. Demostraron que el uso de diferentes núcleos en la SVM puede considerarse como la definición de diferentes distribuciones de probabilidad a priori en el espacio funcional, comoPAG[F]exp(βPAG^F2){\displaystyle P[f]\propto \exp \left({-\beta \left\|{{\hat {P}}f}\right\|^{2}}\right)}. Aquíβ>0{\displaystyle \beta >0}es una constante yPAG^{\displaystyle {\hat {P}}}es el operador de regularización correspondiente al núcleo seleccionado.

MacKay desarrolló un marco general de evidencia bayesiana, [ 3 ] [ 4 ] [ 5 ] y lo ha utilizado para el problema de la regresión, las redes neuronales directas y las redes de clasificación. Conjunto de datos proporcionadoD{\displaystyle D}, un modeloMETRO{\displaystyle \mathbb {M} }con vector de parámetrosw{\displaystyle w}y un denominado hiperparámetro o parámetro de regularización.λ{\displaystyle \lambda }La inferencia bayesiana se construye con 3 niveles de inferencia:

  • En el nivel 1, para un valor dado deλ{\displaystyle \lambda }, el primer nivel de inferencia infiere la distribución posterior dew{\displaystyle w}por regla bayesiana
pag(w|D,λ,METRO)pag(D|w,METRO)pag(w|λ,METRO).{\displaystyle p(w|D,\lambda ,\mathbb {M} )\propto p(D|w,\mathbb {M} )p(w|\lambda ,\mathbb {M} ).}
  • El segundo nivel de inferencia determina el valor deλ{\displaystyle \lambda }, maximizando
pag(λ|D,METRO)pag(D|λ,METRO)pag(λ|METRO).{\displaystyle p(\lambda |D,\mathbb {M} )\propto p(D|\lambda ,\mathbb {M} )p(\lambda |\mathbb {M} ).}
  • El tercer nivel de inferencia en el marco de evidencia clasifica diferentes modelos examinando sus probabilidades posteriores.
pag(METRO|D)pag(D|METRO)pag(METRO).{\displaystyle p(\mathbb {M} |D)\propto p(D|\mathbb {M} )p(\mathbb {M} ).}

Podemos observar que el marco de evidencia bayesiana constituye una teoría unificada para el aprendizaje y la selección de modelos. Kwok utilizó este marco para interpretar la formulación de las máquinas de vectores de soporte (SVM) y la selección de modelos. Asimismo, lo aplicó a la regresión de vectores de soporte.

Ahora, dados los puntos de datos{incógnitai,yi}i=1norte{\displaystyle \{x_{i},y_{i}\}_{i=1}^{N}}y los hiperparámetrosμ{\displaystyle \mu }yζ{\displaystyle \zeta }del modeloMETRO{\displaystyle \mathbb {M} }, los parámetros del modelow{\displaystyle w}yb{\displaystyle b}se estiman maximizando la posteriorpag(w,b|D,registroμ,registroζ,METRO){\displaystyle p(w,b|D,\log \mu ,\log \zeta ,\mathbb {M} )}Aplicando la regla de Bayes, obtenemos

pag(w,b|D,registroμ,registroζ,METRO)=pag(D|w,b,registroμ,registroζ,METRO)pag(w,b|registroμ,registroζ,METRO)pag(D|registroμ,registroζ,METRO),{\displaystyle p(w,b|D,\log \mu ,\log \zeta ,\mathbb {M} )={\frac {p(D|w,b,\log \mu ,\log \zeta ,\mathbb {M} )p(w,b|\log \mu ,\log \zeta ,\mathbb {M} )}{p(D|\log \mu ,\log \zeta ,\mathbb {M} )}},}

dóndepag(D|registroμ,registroζ,METRO){\displaystyle p(D|\log \mu ,\log \zeta ,\mathbb {M} )}es una constante de normalización tal que la integral sobre todos los posiblesw{\displaystyle w}yb{\displaystyle b}es igual a 1. Suponemos quew{\displaystyle w}yb{\displaystyle b}son independientes del hiperparámetroζ{\displaystyle \zeta }y son condicionalmente independientes, es decir, asumimos

pag(w,b|registroμ,registroζ,METRO)=pag(w|registroμ,METRO)pag(b|registroσb,METRO).{\displaystyle p(w,b|\log \mu ,\log \zeta ,\mathbb {M} )=p(w|\log \mu ,\mathbb {M} )p(b|\log \sigma _{b},\mathbb {M} ).}

Cuandoσb{\displaystyle \sigma _{b}\to \infty }, la distribución deb{\displaystyle b}se aproximará a una distribución uniforme. Además, asumimosw{\displaystyle w}yb{\displaystyle b}son distribución gaussiana, por lo que obtenemos la distribución a priori dew{\displaystyle w}yb{\displaystyle b}conσb{\displaystyle \sigma _{b}\to \infty }ser

pag(w,b|registroμ,)=(μ2π)norteF2exp(μ2wTw)12πσbexp(b22σb)(μ2π)norteF2exp(μ2wTw).{\displaystyle {\begin{array}{l}p(w,b|\log \mu ,)=\left({\frac {\mu }{2\pi }}\right)^{\frac {n_{f}}{2}}\exp \left({-{\frac {\mu }{2}}w^{T}w}\right){\frac {1}{\sqrt {2\pi \sigma _{b}}}}\exp \left({-{\frac {b^{2}}{2\sigma _{b}}}}\right)\\\quad \quad \quad \quad \quad \quad \quad \propto \left({\frac {\mu }{2\pi }}\right)^{\frac {n_{f}}{2}}\exp \left({-{\frac {\mu }{2}}w^{T}w}\right)\end{array}}.}

AquínorteF{\displaystyle n_{f}}es la dimensionalidad del espacio de características, igual que la dimensionalidad dew{\displaystyle w}.

La probabilidad depag(D|w,b,registroμ,registroζ,METRO){\displaystyle p(D|w,b,\log \mu ,\log \zeta ,\mathbb {M} )}se supone que depende únicamente dew,b,ζ{\displaystyle w,b,\zeta }yMETRO{\displaystyle \mathbb {M} }Suponemos que los puntos de datos están distribuidos de forma independiente e idéntica (i.i.d.), de modo que:

pag(D|w,b,registroζ,METRO)=i=1nortepag(incógnitai,yi|w,b,registroζ,METRO).{\displaystyle p(D|w,b,\log \zeta ,\mathbb {M} )=\prod \limits _{i=1}^{N}{p(x_{i},y_{i}|w,b,\log \zeta ,\mathbb {M} )}.}

Para obtener la función de coste de mínimos cuadrados, se supone que la probabilidad de un punto de datos es proporcional a:

pag(incógnitai,yi|w,b,registroζ,METRO)pag(mii|w,b,registroζ,METRO).{\displaystyle p(x_{i},y_{i}|w,b,\log \zeta ,\mathbb {M} )\propto p(e_{i}|w,b,\log \zeta ,\mathbb {M} ).}

Se toma una distribución gaussiana para los errores.mii=yi(wTϕ(incógnitai)+b){\displaystyle e_{i}=y_{i}-(w^{T}\phi (x_{i})+b)}como:

pag(mii|w,b,registroζ,METRO)=ζ2πexp(ζmii22).{\displaystyle p(e_{i}|w,b,\log \zeta ,\mathbb {M} )={\sqrt {\frac {\zeta }{2\pi }}}\exp \left({-{\frac {\zeta e_{i}^{2}}{2}}}\right).}

Se supone que elw{\displaystyle w}yb{\displaystyle b}se determinan de tal manera que los centros de clasemetro^{\displaystyle {\hat {m}}_{-}}ymetro^+{\displaystyle {\hat {m}}_{+}}se mapean sobre el objetivo -1 y +1, respectivamente. Las proyeccioneswTϕ(incógnita)+b{\displaystyle w^{T}\phi (x)+b}de los elementos de la claseϕ(incógnita){\displaystyle \phi (x)}siguen una distribución gaussiana multivariada, que tiene varianza1/ζ{\displaystyle 1/\zeta }.

Combinando las expresiones anteriores y despreciando todas las constantes, la regla de Bayes se convierte en:

pag(w,b|D,registroμ,registroζ,METRO)exp(μ2wTwζ2i=1nortemii2)=exp(J2(w,b)).{\displaystyle p(w,b|D,\log \mu ,\log \zeta ,\mathbb {M} )\propto \exp(-{\frac {\mu }{2}}w^{T}w-{\frac {\zeta }{2}}\sum \limits _{i=1}^{N}{e_{i}^{2}})=\exp(-J_{2}(w,b)).}

Las estimaciones de densidad posterior máximawMETROPAG{\displaystyle w_{MP}}ybMETROPAG{\displaystyle b_{MP}}se obtienen luego minimizando el logaritmo negativo de (26), por lo que llegamos a (10).

Referencias

  1. Suykens, J. A. K.; Vandewalle, J. (1999) "Clasificadores de máquinas de vectores de soporte de mínimos cuadrados", Neural Processing Letters , 9 (3), 293–300.
  2. Vapnik, V. La naturaleza de la teoría del aprendizaje estadístico. Springer-Verlag, Nueva York, 1995.
  3. MacKay, D. J. C. Interpolación bayesiana. Neural Computation, 4(3): 415–447, mayo de 1992.
  4. MacKay, D. J. C. Un marco bayesiano práctico para redes de retropropagación. Neural Computation, 4(3): 448–472, mayo de 1992.
  5. MacKay, D. J. C. El marco de evidencia aplicado a las redes de clasificación. Neural Computation, 4(5): 720–736, septiembre de 1992.

Bibliografía

  • JAK Suykens, T. Van Gestel, J. De Brabanter, B. De Moor, J. Vandewalle, Máquinas de vectores de soporte de mínimos cuadrados, World Scientific Pub. Co., Singapur, 2002. ISBN 981-238-151-1
  • Suykens J. A. K., Vandewalle J., Clasificadores de máquinas de vectores de soporte de mínimos cuadrados, Neural Processing Letters , vol. 9, n.º 3, junio de 1999, págs.  293-300.
  • Vladimir Vapnik. La naturaleza de la teoría del aprendizaje estadístico . Springer-Verlag, 1995. ISBN 0-387-98780-0
  • MacKay, DJC, Redes probables y predicciones plausibles: una revisión de métodos bayesianos prácticos para redes neuronales supervisadas. Network: Computation in Neural Systems , vol. 6, 1995, pp.  469–505.
  • www.esat.kuleuven.be/sista/lssvmlab/ "La caja de herramientas Least squares support vector machine Lab (LS-SVMlab) contiene implementaciones en Matlab/C para varios algoritmos LS-SVM".
  • www.kernel-machines.org "Máquinas de vectores de soporte y métodos basados ​​en kernels (Smola y Schölkopf)".
  • www.gaussianprocess.org "Procesos gaussianos: modelado de datos utilizando priors de procesos gaussianos sobre funciones para regresión y clasificación (MacKay, Williams)".
  • www.support-vector.net "Máquinas de vectores de soporte y métodos basados ​​en kernel (Cristianini)".
  • dlib : Contiene una implementación de SVM de mínimos cuadrados para conjuntos de datos a gran escala.