En aprendizaje automático , la regla delta es una regla de aprendizaje de descenso de gradiente para actualizar los pesos de las entradas a las neuronas artificiales en una red neuronal de una sola capa . [ 1 ] Se puede derivar como el algoritmo de retropropagación para una red neuronal de una sola capa con función de pérdida de error cuadrático medio .
Para una neuronacon función de activación, la regla delta para la neurona's-ésimo pesoes dado por
dónde
- es una pequeña constante llamada tasa de aprendizaje
- es la función de activación de la neurona
- es el derivado de
- es el resultado objetivo
- es la suma ponderada de las entradas de la neurona
- es la salida real
- es el-entrada.
Sostiene quey.
La regla delta se suele enunciar de forma simplificada para una neurona con una función de activación lineal como
Si bien la regla delta es similar a la regla de actualización del perceptrón , la derivación es diferente. El perceptrón utiliza la función escalón de Heaviside como función de activación.y eso significa queno existe en cero, y es igual a cero en cualquier otro lugar, lo que hace imposible la aplicación directa de la regla delta.
Derivación de la regla delta
La regla delta se deriva intentando minimizar el error en la salida de la red neuronal mediante descenso de gradiente . El error para una red neuronal conLos resultados se pueden medir como
En este caso, deseamos movernos a través del "espacio de pesos" de la neurona (el espacio de todos los valores posibles de todos los pesos de la neurona) en proporción al gradiente de la función de error con respecto a cada peso. Para ello, calculamos la derivada parcial del error con respecto a cada peso. Para elel peso, esta derivada se puede escribir como
Porque solo nos estamos preocupando por el-ésima neurona, podemos sustituir la fórmula de error anterior omitiendo la sumatoria:
A continuación, utilizamos la regla de la cadena para dividir esto en dos derivadas:
Para hallar la derivada izquierda, simplemente aplicamos la regla de la potencia y la regla de la cadena:
Para hallar la derivada correcta, volvemos a aplicar la regla de la cadena, esta vez diferenciando con respecto a la entrada total.,:
Tenga en cuenta que la salida della neurona,es simplemente la función de activación de la neuronaaplicado a la entrada de la neuronaPor lo tanto, podemos escribir la derivada decon respecto asimplemente comoprimera derivada:
A continuación, reescribimos.en el último término como la suma sobre todospesos de cada pesoveces su entrada correspondiente:
Porque solo nos preocupa elpeso th, el único término de la suma que es relevante es. Claramente, lo que nos da nuestra ecuación final para el gradiente:
Como se mencionó anteriormente, el descenso de gradiente nos indica que el cambio para cada peso debe ser proporcional al gradiente. Elegir una constante de proporcionalidady eliminando el signo menos para poder mover el peso en la dirección negativa del gradiente para minimizar el error, llegamos a nuestra ecuación objetivo:
Véase también
- Descenso de gradiente estocástico
- Retropropagación
- Modelo de Rescorla-Wagner : el origen de la regla delta.
Referencias
- ↑ Russell, Ingrid. "La regla delta" . Universidad de Hartford. Archivado del original el 4 de marzo de 2016. Recuperado el 5 de noviembre de 2012 .
- Redes neuronales artificiales