Articulo de referencia

Red de funciones de base hiperbólica

En el aprendizaje automático , una red de función de base hiperbásica , o red HyperBF , es una generalización del concepto de redes de función de base radial (RBF) , donde se ut...

En el aprendizaje automático , una red de función de base hiperbásica , o red HyperBF , es una generalización del concepto de redes de función de base radial (RBF) , donde se utiliza la distancia similar a Mahalanobis en lugar de la medida de distancia euclidiana. Las redes de función de base hiperbásica fueron introducidas por primera vez por Poggio y Girosi en el artículo de 1990 “Redes para aproximación y aprendizaje”. [1] [2]

Arquitectura de red

La estructura típica de la red HyperBF consta de un vector de entrada real , una capa oculta de funciones de activación y una capa de salida lineal. La salida de la red es una función escalar del vector de entrada, , que se expresa mediante incógnita R norte {\displaystyle x\in \mathbb {R} ^{n}} ϕ : R norte R {\displaystyle \phi :\mathbb {R} ^{n}\to \mathbb {R} }

ϕ ( incógnita ) = yo = 1 norte a yo ρ yo ( | | incógnita micras yo | | ) {\displaystyle \phi (x)=\sum _{j=1}^{N}a_{j}\rho _{j}(||x-\mu _{j}||)}

donde es un número de neuronas en la capa oculta, y son el centro y el peso de la neurona . La función de activación en la red HyperBF toma la siguiente forma norte {\estilo de visualización N} micras yo {\displaystyle \mu_{j}} a yo Estilo de visualización a_ {j}} yo {\estilo de visualización j} ρ yo ( | | incógnita micras yo | | ) {\displaystyle \rho_{j}(||x-\mu_{j}||)}

ρ yo ( | | incógnita micras yo | | ) = mi ( incógnita micras yo ) yo R yo ( incógnita micras yo ) {\displaystyle \rho_{j}(||x-\mu_{j}||)=e^{(x-\mu_{j})^{T}R_{j}(x-\mu_{j})}}

donde es una matriz definida positiva . Dependiendo de la aplicación, se suelen considerar los siguientes tipos de matrices [3] R yo Estilo de visualización R_{j}} d × d {\displaystyle d\times d} R yo Estilo de visualización R_{j}}

  • R yo = 1 2 σ 2 I d × d {\displaystyle R_{j}={\frac {1}{2\sigma ^{2}}}\mathbb {I} _{d\times d}} , donde . Este caso corresponde a la red RBF regular. σ > 0 {\displaystyle \sigma >0}
  • R yo = 1 2 σ yo 2 I d × d {\displaystyle R_{j}={\frac {1}{2\sigma _{j}^{2}}}\mathbb {I} _{d\times d}} , donde . En este caso, las funciones base son radialmente simétricas, pero están escaladas con diferente ancho. σ yo > 0 {\displaystyle \sigma _{j}>0}
  • R yo = d i a gramo ( 1 2 σ yo 1 2 , . . . , 1 2 σ yo el 2 ) I d × d {\displaystyle R_{j}=diag({\frac {1}{2\sigma _{j1}^{2}}},...,{\frac {1}{2\sigma _{jz}^{2}}}\right)\mathbb {I} _{d\times d}} , donde . Cada neurona tiene una forma elíptica con un tamaño variable. σ yo i > 0 {\displaystyle \sigma _ {ji}>0}
  • Matriz definida positiva, pero no diagonal.

Capacitación

El entrenamiento de redes HyperBF implica la estimación de pesos , formas y centros de neuronas y . Poggio y Girosi (1990) describen el método de entrenamiento con centros móviles y formas de neuronas adaptables. A continuación se ofrece un esquema del método. a yo Estilo de visualización a_ {j}} R yo Estilo de visualización R_{j}} micras yo {\displaystyle \mu_{j}}

Considere la pérdida cuadrática de la red . Las siguientes condiciones deben cumplirse en el estado óptimo: yo [ ϕ ] = i = 1 norte ( y i ϕ ( incógnita i ) ) 2 {\displaystyle H[\phi ^{*}]=\sum _{i=1}^{N}(y_{i}-\phi ^{*}(x_{i}))^{2}}

yo ( ϕ ) a yo = 0 {\displaystyle {\frac {\parcial H(\phi ^{*})}{\parcial a_{j}}}=0} , , yo ( ϕ ) micras yo = 0 {\displaystyle {\frac {\parcial H(\phi ^{*})}{\parcial \mu _{j}}}=0} yo ( ϕ ) Yo = 0 {\displaystyle {\frac {\partial H(\phi ^{*})}{\partial W}}=0}

donde . Entonces, en el método de descenso de gradiente, los valores de que se minimizan se pueden encontrar como un punto fijo estable del siguiente sistema dinámico: R yo = Yo yo Yo {\displaystyle R_{j}=W^{T}W} a yo , micras yo , Yo {\displaystyle a_{j},\mu _{j},W} yo [ ϕ ] {\displaystyle H[\phi ^{*}]}

a yo ˙ = ω yo ( ϕ ) a yo {\displaystyle {\dot {a_{j}}}=-\omega {\frac {\partial H(\phi ^{*})}{\partial a_{j}}}} , , micras yo ˙ = ω yo ( ϕ ) micras yo {\displaystyle {\dot {\mu _{j}}}=-\omega {\frac {\partial H(\phi ^{*})}{\partial \mu _{j}}}} Yo ˙ = ω yo ( ϕ ) Yo {\displaystyle {\dot {W}}=-\omega {\frac {\partial H(\phi ^{*})}{\partial W}}}

donde determina la tasa de convergencia. ω {\estilo de visualización \omega}

En general, el entrenamiento de redes HyperBF puede ser un desafío computacional. Además, el alto grado de libertad de HyperBF conduce a un sobreajuste y una generalización deficiente. Sin embargo, las redes HyperBF tienen una ventaja importante: una pequeña cantidad de neuronas es suficiente para aprender funciones complejas. [2]

Referencias

  1. ^ T. Poggio y F. Girosi (1990). "Redes para aproximación y aprendizaje". Proc. IEEE Vol. 78, N.º 9 :1481-1497.
  2. ^ ab RN Mahdi, EC Rouchka (2011). "Redes HyperBF reducidas: regularización mediante reducción de complejidad explícita y entrenamiento basado en Rprop escalado". IEEE Transactions of Neural Networks 2 :673–686.
  3. ^ F. Schwenker, HA Kestler y G. Palm (2001). "Tres fases de aprendizaje para redes de función de base radial" Neural Netw. 14 :439-458.
Obtenido de "https://es.wikipedia.org/w/index.php?title=Red_de_funciones_de_hiperbase&oldid=1237710667"