Articulo de referencia

Regla delta

En aprendizaje automático , la regla delta es una regla de aprendizaje de descenso de gradiente para actualizar los pesos de las entradas a las neuronas artificiales en una red ...

En aprendizaje automático , la regla delta es una regla de aprendizaje de descenso de gradiente para actualizar los pesos de las entradas a las neuronas artificiales en una red neuronal de una sola capa . [ 1 ] Se puede derivar como el algoritmo de retropropagación para una red neuronal de una sola capa con función de pérdida de error cuadrático medio .

Para una neuronaj{\displaystyle j}con función de activacióngramo(incógnita){\displaystyle g(x)}, la regla delta para la neuronaj{\displaystyle j}'si{\displaystyle i}-ésimo pesowji{\displaystyle w_{ji}}es dado por

Δwji=α(tjyj)gramo(hj)incógnitai,{\displaystyle \Delta w_{ji}=\alpha (t_{j}-y_{j})g'(h_{j})x_{i},}

dónde

  • α{\displaystyle \alpha }es una pequeña constante llamada tasa de aprendizaje
  • gramo(incógnita){\displaystyle g(x)}es la función de activación de la neurona
  • gramo{\displaystyle g'}es el derivado degramo{\displaystyle g}
  • tj{\displaystyle t_{j}}es el resultado objetivo
  • hj{\displaystyle h_{j}}es la suma ponderada de las entradas de la neurona
  • yj{\displaystyle y_{j}}es la salida real
  • incógnitai{\displaystyle x_{i}}es eli{\displaystyle i}-entrada.

Sostiene quehj=iincógnitaiwji{\textstyle h_{j}=\sum _{i}x_{i}w_{ji}}yyj=gramo(hj){\displaystyle y_{j}=g(h_{j})}.

La regla delta se suele enunciar de forma simplificada para una neurona con una función de activación lineal como Δwji=α(tjyj)incógnitai{\displaystyle \Delta w_{ji}=\alpha \left(t_{j}-y_{j}\right)x_{i}}

Si bien la regla delta es similar a la regla de actualización del perceptrón , la derivación es diferente. El perceptrón utiliza la función escalón de Heaviside como función de activación.gramo(h){\displaystyle g(h)}y eso significa quegramo(h){\displaystyle g'(h)}no existe en cero, y es igual a cero en cualquier otro lugar, lo que hace imposible la aplicación directa de la regla delta.

Derivación de la regla delta

La regla delta se deriva intentando minimizar el error en la salida de la red neuronal mediante descenso de gradiente . El error para una red neuronal conj{\displaystyle j}Los resultados se pueden medir como mi=j12(tjyj)2.{\displaystyle E=\sum _{j}{\tfrac {1}{2}}\left(t_{j}-y_{j}\right)^{2}.}

En este caso, deseamos movernos a través del "espacio de pesos" de la neurona (el espacio de todos los valores posibles de todos los pesos de la neurona) en proporción al gradiente de la función de error con respecto a cada peso. Para ello, calculamos la derivada parcial del error con respecto a cada peso. Para eli{\displaystyle i}el peso, esta derivada se puede escribir como miwji.{\displaystyle {\frac {\partial E}{\partial w_{ji}}}.}

Porque solo nos estamos preocupando por elj{\displaystyle j}-ésima neurona, podemos sustituir la fórmula de error anterior omitiendo la sumatoria: miwji=wji[12(tjyj)2]{\displaystyle {\frac {\partial E}{\partial w_{ji}}}={\frac {\partial }{\partial w_{ji}}}\left[{\frac {1}{2}}\left(t_{j}-y_{j}\right)^{2}\right]}

A continuación, utilizamos la regla de la cadena para dividir esto en dos derivadas: miwji=(12(tjyj)2)yjyjwji{\displaystyle {\frac {\partial E}{\partial w_{ji}}}={\frac {\partial \left({\frac {1}{2}}\left(t_{j}-y_{j}\right)^{2}\right)}{\partial y_{j}}}{\frac {\partial y_{j}}{\partial w_{ji}}}}

Para hallar la derivada izquierda, simplemente aplicamos la regla de la potencia y la regla de la cadena: miwji=(tjyj)yjwji{\displaystyle {\frac {\partial E}{\partial w_{ji}}}=-\left(t_{j}-y_{j}\right){\frac {\partial y_{j}}{\partial w_{ji}}}}

Para hallar la derivada correcta, volvemos a aplicar la regla de la cadena, esta vez diferenciando con respecto a la entrada total.j{\displaystyle j},hj{\displaystyle h_{j}}: miwji=(tjyj)yjhjhjwji{\displaystyle {\frac {\partial E}{\partial w_{ji}}}=-\left(t_{j}-y_{j}\right){\frac {\partial y_{j}}{\partial h_{j}}}{\frac {\partial h_{j}}{\partial w_{ji}}}}

Tenga en cuenta que la salida delj{\displaystyle j}la neurona,yj{\displaystyle y_{j}}es simplemente la función de activación de la neuronagramo{\displaystyle g}aplicado a la entrada de la neuronahj{\displaystyle h_{j}}Por lo tanto, podemos escribir la derivada deyj{\displaystyle y_{j}}con respecto ahj{\displaystyle h_{j}}simplemente comogramo{\displaystyle g}primera derivada: miwji=(tjyj)gramo(hj)hjwji{\displaystyle {\frac {\partial E}{\partial w_{ji}}}=-\left(t_{j}-y_{j}\right)g'(h_{j}){\frac {\partial h_{j}}{\partial w_{ji}}}}

A continuación, reescribimos.hj{\displaystyle h_{j}}en el último término como la suma sobre todosk{\displaystyle k}pesos de cada pesowjk{\displaystyle w_{jk}}veces su entrada correspondienteincógnitak{\displaystyle x_{k}}: miwji=(tjyj)gramo(hj)wji[iincógnitaiwji]{\displaystyle {\frac {\partial E}{\partial w_{ji}}}=-\left(t_{j}-y_{j}\right)g'(h_{j})\;{\frac {\partial }{\partial w_{ji}}}\!\!\left[\sum _{i}x_{i}w_{ji}\right]}

Porque solo nos preocupa eli{\displaystyle i}peso th, el único término de la suma que es relevante esincógnitaiwji{\displaystyle x_{i}w_{ji}}. Claramente, (incógnitaiwji)wji=incógnitai.{\displaystyle {\frac {\partial (x_{i}w_{ji})}{\partial w_{ji}}}=x_{i}.} lo que nos da nuestra ecuación final para el gradiente: miwji=(tjyj)gramo(hj)incógnitai{\displaystyle {\frac {\partial E}{\partial w_{ji}}}=-\left(t_{j}-y_{j}\right)g'(h_{j})x_{i}}

Como se mencionó anteriormente, el descenso de gradiente nos indica que el cambio para cada peso debe ser proporcional al gradiente. Elegir una constante de proporcionalidadα{\displaystyle \alpha }y eliminando el signo menos para poder mover el peso en la dirección negativa del gradiente para minimizar el error, llegamos a nuestra ecuación objetivo: Δwji=α(tjyj)gramo(hj)incógnitai.{\displaystyle \Delta w_{ji}=\alpha (t_{j}-y_{j})g'(h_{j})x_{i}.}

Véase también

Referencias

  1. Russell, Ingrid. "La regla delta" . Universidad de Hartford. Archivado del original el 4 de marzo de 2016. Recuperado el 5 de noviembre de 2012 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Delta_rule&oldid=1323218811 "