Articulo de referencia

Regla de la cadena

En cálculo , la regla de la cadena es una fórmula que expresa la derivada de la composición de dos funciones diferenciables z e y en términos de las derivadas de z e y . Más pre...

En cálculo , la regla de la cadena es una fórmula que expresa la derivada de la composición de dos funciones diferenciables z e y en términos de las derivadas de z e y . Más precisamente, sih=zy{\displaystyle h=z\circ y}es la composición tal queh(incógnita)=z(y(incógnita)){\displaystyle h(x)=z(y(x))}para cada x , entonces la regla de la cadena es, en la notación de Lagrange , h(incógnita)=z(y(incógnita))y(incógnita).{\displaystyle h'(x)=z'(y(x))y'(x).} o, equivalentemente, h=(zy)=(zy)y.{\displaystyle h'=(z\circ y)'=(z'\circ y)\cdot y'.}

La regla de la cadena también puede expresarse en la notación de Leibniz . Si una variable z depende de la variable y , que a su vez depende de la variable x (es decir, y y z son variables dependientes ), entonces z también depende de x , a través de la variable intermedia y . En este caso, la regla de la cadena se expresa como dzdincógnita=dzdydydincógnita,{\displaystyle {\frac {dz}{dx}}={\frac {dz}{dy}}\cdot {\frac {dy}{dx}},} y dzdincógnita|incógnita=dzdy|y(incógnita)dydincógnita|incógnita,{\displaystyle \left.{\frac {dz}{dx}}\right|_{x}=\left.{\frac {dz}{dy}}\right|_{y(x)}\cdot \left.{\frac {dy}{dx}}\right|_{x},} para indicar en qué puntos deben evaluarse las derivadas.

En integración , la contraparte de la regla de la cadena es la regla de sustitución .

Explicación intuitiva

Intuitivamente, la regla de la cadena establece que conociendo la tasa de cambio instantánea de z con respecto a y y la de y con respecto a x, se puede calcular la tasa de cambio instantánea de z con respecto a x como el producto de las dos tasas de cambio.

Como lo expresó George F. Simmons : "Si un automóvil viaja el doble de rápido que una bicicleta y la bicicleta es cuatro veces más rápida que un hombre caminando, entonces el automóvil viaja 2 × 4 = 8 veces más rápido que el hombre". [ 1 ] [ 2 ]

La relación entre este ejemplo y la regla de la cadena es la siguiente. Sean z , y y x las posiciones (variables) del automóvil, la bicicleta y el hombre que camina, respectivamente. La tasa de cambio de las posiciones relativas del automóvil y la bicicleta esdzdy=2.{\textstyle {\frac {dz}{dy}}=2.}Similarmente,dydincógnita=4.{\textstyle {\frac {dy}{dx}}=4.}Entonces, la tasa de cambio de las posiciones relativas del automóvil y el hombre que camina es dzdincógnita=dzdydydincógnita=24=8.{\displaystyle {\frac {dz}{dx}}={\frac {dz}{dy}}\cdot {\frac {dy}{dx}}=2\cdot 4=8.}

La tasa de cambio de posiciones es la razón de las velocidades, y la velocidad es la derivada de la posición con respecto al tiempo; es decir, dzdincógnita=dzdtdincógnitadt,{\displaystyle {\frac {dz}{dx}}={\frac {\dfrac {dz}{dt}}{\dfrac {dx}{dt}}},} o, equivalentemente, dzdt=dzdincógnitadincógnitadt,{\displaystyle {\frac {dz}{dt}}={\frac {dz}{dx}}\cdot {\frac {dx}{dt}},} lo cual también es una aplicación de la regla de la cadena.

Historia

La regla de la cadena parece haber sido utilizada por primera vez por Gottfried Wilhelm Leibniz . La utilizó para calcular la derivada dea+bz+doz2{\displaystyle {\sqrt {a+bz+cz^{2}}}}como la composición de la función raíz cuadrada y la funcióna+bz+doz2{\displaystyle a+bz+cz^{2}\!}Lo mencionó por primera vez en unas memorias de 1676 (con un error de signo en el cálculo). [ 3 ] La notación común de la regla de la cadena se debe a Leibniz. [ 4 ] Guillaume de l'Hôpital utilizó la regla de la cadena implícitamente en su Analyse des infiniment petits . La regla de la cadena no aparece en ninguno de los libros de análisis de Leonhard Euler , a pesar de que fueron escritos más de cien años después del descubrimiento de Leibniz. [ 4 ] Se cree que la primera versión "moderna" de la regla de la cadena aparece en la Théorie des fonctions analytiques de Lagrange de 1797 ; también aparece en el Résumé des Leçons données a L'École Royale Polytechnique sur Le Calcul Infinitesimal de Cauchy de 1823. [ 4 ]

Declaración

La forma más simple de la regla de la cadena es para funciones de valor real de una variable real . Establece que si g es una función que es diferenciable en un punto c (es decir,  la derivada g ′( c ) existe) y f es una función que es diferenciable en g ( c ) , entonces la función compuestaFgramo{\displaystyle f\circ g}es diferenciable en c , y la derivada es [ 5 ](Fgramo)(do)=F(gramo(do))gramo(do).{\displaystyle (f\circ g)'(c)=f'(g(c))\cdot g'(c).} La regla a veces se abrevia como (Fgramo)=(Fgramo)gramo.{\displaystyle (f\circ g)'=(f'\circ g)\cdot g'.}

Si y = f ( u ) y u = g ( x ) , entonces esta forma abreviada se escribe en notación de Leibniz como: dydincógnita=dydddincógnita.{\displaystyle {\frac {dy}{dx}}={\frac {dy}{du}}\cdot {\frac {du}{dx}}.}

También se pueden indicar explícitamente los puntos donde se evalúan las derivadas: dydincógnita|incógnita=do=dyd|=gramo(do)ddincógnita|incógnita=do.{\displaystyle \left.{\frac {dy}{dx}}\right|_{x=c}=\left.{\frac {dy}{du}}\right|_{u=g(c)}\cdot \left.{\frac {du}{dx}}\right|_{x=c}.}

Siguiendo con el mismo razonamiento, dadas n funcionesF1,,Fnorte{\displaystyle f_{1},\ldots ,f_{n}\!}con la función compuestaF1(F2(Fnorte1Fnorte)){\displaystyle f_{1}\circ (f_{2}\circ \cdots (f_{n-1}\circ f_{n}))\!}, si cada funciónFi{\displaystyle f_{i}\!}Si es diferenciable en su entrada inmediata, entonces la función compuesta también es diferenciable mediante la aplicación repetida de la regla de la cadena, donde la derivada es (en la notación de Leibniz): dF1dincógnita=dF1dF2dF2dF3dFnortedincógnita.{\displaystyle {\frac {df_{1}}{dx}}={\frac {df_{1}}{df_{2}}}{\frac {df_{2}}{df_{3}}}\cdots {\frac {df_{n}}{dx}}.}

Aplicaciones

La regla de la cadena en el caso de compuestos de más de dos funciones.

Compuestos de más de dos funciones

La regla de la cadena se puede aplicar a composiciones de más de dos funciones. Para calcular la derivada de una composición de más de dos funciones, observe que la composición de f , g y h (en ese orden) es la composición de f con gh . La regla de la cadena establece que para calcular la derivada de fgh , basta con calcular la derivada de f y la derivada de gh . La derivada de f se puede calcular directamente, y la derivada de gh se puede calcular aplicando nuevamente la regla de la cadena. [ 6 ]

Para mayor concreción, consideremos la función y=mipecado(incógnita2).{\displaystyle y=e^{\sin(x^{2})}.} Esto puede descomponerse como la composición de tres funciones: y=F()=mi,=gramo(v)=pecadov,v=h(incógnita)=incógnita2.{\displaystyle {\begin{aligned}y&=f(u)=e^{u},\\u&=g(v)=\sin v,\\v&=h(x)=x^{2}.\end{aligned}}} De modo quey=F(gramo(h(incógnita))){\displaystyle y=f(g(h(x)))}.

Sus derivados son: dyd=F()=mi,ddv=gramo(v)=porquev,dvdincógnita=h(incógnita)=2incógnita.{\displaystyle {\begin{aligned}{\frac {dy}{du}}&=f'(u)=e^{u},\\{\frac {du}{dv}}&=g'(v)=\cos v,\\{\frac {dv}{dx}}&=h'(x)=2x.\end{aligned}}}

La regla de la cadena establece que la derivada de su compuesto en el punto x = a es: (Fgramoh)(a)=F((gramoh)(a))(gramoh)(a)=F((gramoh)(a))gramo(h(a))h(a)=(Fgramoh)(a)(gramoh)(a)h(a).{\displaystyle {\begin{aligned}(f\circ g\circ h)'(a)&=f'((g\circ h)(a))\cdot (g\circ h)'(a)\\&=f'((g\circ h)(a))\cdot g'(h(a))\cdot h'(a)\\&=(f'\circ g\circ h)(a)\cdot (g'\circ h)(a)\cdot h'(a).\end{aligned}}}

En la notación de Leibniz , esto es: dydincógnita=dyd|=gramo(h(a))ddv|v=h(a)dvdincógnita|incógnita=a,{\displaystyle {\frac {dy}{dx}}=\left.{\frac {dy}{du}}\right|_{u=g(h(a))}\cdot \left.{\frac {du}{dv}}\right|_{v=h(a)}\cdot \left.{\frac {dv}{dx}}\right|_{x=a},} o, en resumen, dydincógnita=dydddvdvdincógnita.{\displaystyle {\frac {dy}{dx}}={\frac {dy}{du}}\cdot {\frac {du}{dv}}\cdot {\frac {dv}{dx}}.} Por lo tanto, la función derivada es: dydincógnita=mipecado(incógnita2)porque(incógnita2)2incógnita.{\displaystyle {\frac {dy}{dx}}=e^{\sin(x^{2})}\cdot \cos(x^{2})\cdot 2x.}

Otra forma de calcular esta derivada es considerar la función compuesta fgh como la composición de fg y h . Aplicando la regla de la cadena de esta manera se obtendría: (Fgramoh)(a)=(Fgramo)(h(a))h(a)=F(gramo(h(a)))gramo(h(a))h(a).{\displaystyle {\begin{aligned}(f\circ g\circ h)'(a)&=(f\circ g)'(h(a))\cdot h'(a)\\&=f'(g(h(a)))\cdot g'(h(a))\cdot h'(a).\end{aligned}}}

Esto es lo mismo que se calculó anteriormente. Esto es de esperar porque ( fg ) ∘ h = f ∘ ( gh ) .

A veces, es necesario diferenciar una composición arbitrariamente larga de la formaF1F2Fnorte1Fnorte{\displaystyle f_{1}\circ f_{2}\circ \cdots \circ f_{n-1}\circ f_{n}\!}. En este caso, defina Fa..b=FaFa+1Fb1Fb{\displaystyle f_{a\,.\,.\,b}=f_{a}\circ f_{a+1}\circ \cdots \circ f_{b-1}\circ f_{b}} dóndeFa..a=Fa{\displaystyle f_{a\,.\,.\,a}=f_{a}}yFa..b(incógnita)=incógnita{\displaystyle f_{a\,.\,.\,b}(x)=x}cuandob<a{\displaystyle b<a}Entonces la regla de la cadena toma la forma DF1..norte=(DF1F2..norte)(DF2F3..norte)(DFnorte1Fnorte..norte)DFnorte=k=1norte[DFkF(k+1)..norte]{\displaystyle {\begin{aligned}Df_{1\,.\,.\,n}&=(Df_{1}\circ f_{2\,.\,.\,n})(Df_{2}\circ f_{3\,.\,.\,n})\cdots (Df_{n-1}\circ f_{n\,.\,.\,n})Df_{n}\\&=\prod _{k=1}^{n}\left[Df_{k}\circ f_{(k+1)\,.\,.\,n}\right]\end{aligned}}} o, en la notación de Lagrange, F1..norte(incógnita)=F1(F2..norte(incógnita))F2(F3..norte(incógnita))Fnorte1(Fnorte..norte(incógnita))Fnorte(incógnita)=k=1norteFk(F(k+1..norte)(incógnita)){\displaystyle {\begin{aligned}f_{1\,.\,.\,n}'(x)&=f_{1}'\left(f_{2\,.\,.\,n}(x)\right)\;f_{2}'\left(f_{3\,.\,.\,n}(x)\right)\cdots f_{n-1}'\left(f_{n\,.\,.\,n}(x)\right)\;f_{n}'(x)\\[1ex]&=\prod _{k=1}^{n}f_{k}'\left(f_{(k+1\,.\,.\,n)}(x)\right)\end{aligned}}}

Regla del cociente

La regla de la cadena se puede utilizar para derivar algunas reglas de diferenciación bien conocidas. Por ejemplo, la regla del cociente es una consecuencia de la regla de la cadena y la regla del producto . Para ver esto, escriba la función f ( x )/ g ( x ) como el producto f ( x ) · 1/ g ( x ) . Primero aplique la regla del producto: ddincógnita(F(incógnita)gramo(incógnita))=ddincógnita(F(incógnita)1gramo(incógnita))=F(incógnita)1gramo(incógnita)+F(incógnita)ddincógnita(1gramo(incógnita)).{\displaystyle {\begin{aligned}{\frac {d}{dx}}\left({\frac {f(x)}{g(x)}}\right)&={\frac {d}{dx}}\left(f(x)\cdot {\frac {1}{g(x)}}\right)\\&=f'(x)\cdot {\frac {1}{g(x)}}+f(x)\cdot {\frac {d}{dx}}\left({\frac {1}{g(x)}}\right).\end{aligned}}}

Para calcular la derivada de 1/ g ( x ) , observe que es la composición de g con la función recíproca, es decir, la función que transforma x en 1/ x . La derivada de la función recíproca es1/incógnita2{\displaystyle -1/x^{2}\!}Aplicando la regla de la cadena, la última expresión se convierte en: F(incógnita)1gramo(incógnita)+F(incógnita)(1gramo(incógnita)2gramo(incógnita))=F(incógnita)gramo(incógnita)F(incógnita)gramo(incógnita)gramo(incógnita)2,{\displaystyle f'(x)\cdot {\frac {1}{g(x)}}+f(x)\cdot \left(-{\frac {1}{g(x)^{2}}}\cdot g'(x)\right)={\frac {f'(x)g(x)-f(x)g'(x)}{g(x)^{2}}},} que es la fórmula habitual para la regla del cociente.

Derivadas de funciones inversas

Supongamos que y = g ( x ) tiene una función inversa . Llamemos a su función inversa f, de modo que tengamos x = f ( y ) . Existe una fórmula para la derivada de f en términos de la derivada de g . Para ver esto, observemos que f y g satisfacen la fórmula. F(gramo(incógnita))=incógnita.{\displaystyle f(g(x))=x.}

Y debido a las funcionesF(gramo(incógnita)){\displaystyle f(g(x))}y x son iguales, sus derivadas deben ser iguales. La derivada de x es la función constante con valor 1, y la derivada deF(gramo(incógnita)){\displaystyle f(g(x))}se determina mediante la regla de la cadena. Por lo tanto, tenemos que: F(gramo(incógnita))gramo(incógnita)=1.{\displaystyle f'(g(x))g'(x)=1.}

Para expresar f' como una función de una variable independiente y , sustituimosF(y){\displaystyle f(y)}para x dondequiera que aparezca. Entonces podemos resolver para f' . F(gramo(F(y)))gramo(F(y))=1F(y)gramo(F(y))=1F(y)=1gramo(F(y)).{\displaystyle {\begin{aligned}f'(g(f(y)))g'(f(y))&=1\\f'(y)g'(f(y))&=1\\f'(y)={\frac {1}{g'(f(y))}}.\end{aligned}}}

Por ejemplo, consideremos la función g ( x ) = e x . Tiene una inversa f ( y ) = ln y . Debido a que g ′( x ) = e x , la fórmula anterior dice que ddylny=1milny=1y.{\displaystyle {\frac {d}{dy}}\ln y={\frac {1}{e^{\ln y}}}={\frac {1}{y}}.}

Esta fórmula es válida siempre que g sea diferenciable y su inversa f también lo sea. Sin embargo, puede fallar cuando alguna de estas condiciones no se cumple. Por ejemplo, consideremos g ( x ) = . Su inversa es f ( y ) = , que no es diferenciable en cero. Si intentamos usar la fórmula anterior para calcular la derivada de f en cero, debemos calcular 1/ g '( f (0)) . Dado que f (0) = 0 y g '(0) = 0 , debemos calcular 1/0, que no está definido. Por lo tanto, la fórmula falla en este caso. Esto no es sorprendente, ya que f no es diferenciable en cero.

Retropropagación

La regla de la cadena constituye la base del algoritmo de retropropagación , que se utiliza en el descenso de gradiente de redes neuronales en el aprendizaje profundo ( inteligencia artificial ). [ 7 ]

Derivadas superiores

La fórmula de Faà di Bruno generaliza la regla de la cadena a derivadas de orden superior. Suponiendo que y = f ( u ) y u = g ( x ) , entonces las primeras derivadas son: dydincógnita=dydddincógnitad2ydincógnita2=d2yd2(ddincógnita)2+dydd2dincógnita2d3ydincógnita3=d3yd3(ddincógnita)3+3d2yd2ddincógnitad2dincógnita2+dydd3dincógnita3d4ydincógnita4=d4yd4(ddincógnita)4+6d3yd3(ddincógnita)2d2dincógnita2+d2yd2(4ddincógnitad3dincógnita3+3(d2dincógnita2)2)+dydd4dincógnita4.{\displaystyle {\begin{aligned}{\frac {dy}{dx}}&={\frac {dy}{du}}{\frac {du}{dx}}\\{\frac {d^{2}y}{dx^{2}}}&={\frac {d^{2}y}{du^{2}}}\left({\frac {du}{dx}}\right)^{2}+{\frac {dy}{du}}{\frac {d^{2}u}{dx^{2}}}\\{\frac {d^{3}y}{dx^{3}}}&={\frac {d^{3}y}{du^{3}}}\left({\frac {du}{dx}}\right)^{3}+3\,{\frac {d^{2}y}{du^{2}}}{\frac {du}{dx}}{\frac {d^{2}u}{dx^{2}}}+{\frac {dy}{du}}{\frac {d^{3}u}{dx^{3}}}\\{\frac {d^{4}y}{dx^{4}}}&={\frac {d^{4}y}{du^{4}}}\left({\frac {du}{dx}}\right)^{4}+6\,{\frac {d^{3}y}{du^{3}}}\left({\frac {du}{dx}}\right)^{2}{\frac {d^{2}u}{dx^{2}}}+{\frac {d^{2}y}{du^{2}}}\left(4\,{\frac {du}{dx}}{\frac {d^{3}u}{dx^{3}}}+3\,\left({\frac {d^{2}u}{dx^{2}}}\right)^{2}\right)+{\frac {dy}{du}}{\frac {d^{4}u}{dx^{4}}}.\end{aligned}}}

Pruebas

Primera prueba

Una demostración de la regla de la cadena comienza definiendo la derivada de la función compuesta fg , donde tomamos el límite del cociente de diferencias para fg cuando x se aproxima a a : (Fgramo)(a)=límiteincógnitaaF(gramo(incógnita))F(gramo(a))incógnitaa.{\displaystyle (f\circ g)'(a)=\lim _{x\to a}{\frac {f(g(x))-f(g(a))}{x-a}}.}

Supongamos por el momento quegramo(incógnita){\displaystyle g(x)\!}no es igualgramo(a){\displaystyle g(a)}para cualquierincógnita{\displaystyle x}cercaa{\displaystyle a}Entonces, la expresión anterior es igual al producto de dos factores: límiteincógnitaaF(gramo(incógnita))F(gramo(a))gramo(incógnita)gramo(a)gramo(incógnita)gramo(a)incógnitaa.{\displaystyle \lim _{x\to a}{\frac {f(g(x))-f(g(a))}{g(x)-g(a)}}\cdot {\frac {g(x)-g(a)}{x-a}}.}

Sigramo{\displaystyle g}Si oscila cerca de a , entonces puede suceder que, sin importar cuán cerca se esté de a , siempre hay un x aún más cercano tal que g ( x ) = g ( a ) . Por ejemplo, esto sucede cerca de a = 0 para la función continua g definida por g ( x ) = 0 para x = 0 y g ( x ) = x²sin (1/ x ) en caso contrario. Siempre que esto sucede, la expresión anterior no está definida porque implica una división por cero . Para solucionar esto, introduzca una funciónQ{\displaystyle Q}como sigue: Q(y)={F(y)F(gramo(a))ygramo(a),ygramo(a),F(gramo(a)),y=gramo(a).{\displaystyle Q(y)={\begin{cases}\displaystyle {\frac {f(y)-f(g(a))}{y-g(a)}},&y\neq g(a),\\f'(g(a)),&y=g(a).\end{cases}}} Demostraremos que el cociente de diferencias para fg siempre es igual a: Q(gramo(incógnita))gramo(incógnita)gramo(a)incógnitaa.{\displaystyle Q(g(x))\cdot {\frac {g(x)-g(a)}{x-a}}.}

Siempre que g ( x ) no sea igual a g ( a ) , esto es evidente porque los factores de g ( x ) − g ( a ) se cancelan. Cuando g ( x ) es igual a g ( a ) , entonces el cociente de diferencias para fg es cero porque f ( g ( x )) es igual a f ( g ( a )) , y el producto anterior es cero porque es igual a f '( g ( a )) multiplicado por cero. Por lo tanto, el producto anterior siempre es igual al cociente de diferencias, y para demostrar que la derivada de fg en a existe y determinar su valor, solo necesitamos demostrar que el límite cuando x tiende a a del producto anterior existe y determinar su valor.

Para ello, recordemos que el límite de un producto existe si existen los límites de sus factores. Cuando esto ocurre, el límite del producto de estos dos factores será igual al producto de los límites de los factores. Los dos factores son Q ( g ( x )) y ( g ( x ) − g ( a )) / ( xa ) . Este último es el cociente de diferencias para g en a , y como g es diferenciable en a por hipótesis, su límite cuando x tiende a a existe y es igual a g ′( a ) .

En cuanto a Q ( g ( x )) , observe que Q está definida dondequiera que esté f . Además, f es diferenciable en g ( a ) por hipótesis, por lo que Q es continua en g ( a ) , por definición de la derivada. La función g es continua en a porque es diferenciable en a , y por lo tanto Qg es continua en a . Así que su límite cuando x tiende a a existe y es igual a Q ( g ( a )) , que es f ′( g ( a )) .

Esto demuestra que los límites de ambos factores existen y que son iguales a f ′( g ( a )) y g ′( a ) , respectivamente. Por lo tanto, la derivada de fg en a existe y es igual a f ′( g ( a )) g ′( a ) .

Segunda prueba

Otra forma de demostrar la regla de la cadena es medir el error en la aproximación lineal determinada por la derivada. Esta demostración tiene la ventaja de que se generaliza a varias variables. Se basa en la siguiente definición equivalente de diferenciabilidad en un punto: Una función g es diferenciable en a si existe un número real g ′( a ) y una función ε ( h ) que tiende a cero cuando h tiende a cero, y además gramo(a+h)gramo(a)=gramo(a)h+ε(h)h.{\displaystyle g(a+h)-g(a)=g'(a)h+\varepsilon (h)h.} Aquí, el lado izquierdo representa la diferencia real entre el valor de g en a y en a + h , mientras que el lado derecho representa la aproximación determinada por la derivada más un término de error.

En el caso de la regla de la cadena, existe una función ε porque se supone que g es diferenciable en a . Nuevamente por suposición, también existe una función similar para f en g ( a ). Llamando a esta función η , tenemos F(gramo(a)+k)F(gramo(a))=F(gramo(a))k+η(k)k.{\displaystyle f(g(a)+k)-f(g(a))=f'(g(a))k+\eta (k)k.} La definición anterior no impone restricciones a η (0), aunque se supone que η ( k ) tiende a cero cuando k tiende a cero. Si establecemos η (0) = 0 , entonces η es continua en 0.

Para demostrar el teorema es necesario estudiar la diferencia f ( g ( a + h )) − f ( g ( a )) cuando h tiende a cero. El primer paso es sustituir g ( a + h ) usando la definición de diferenciabilidad de g en a : F(gramo(a+h))F(gramo(a))=F(gramo(a)+gramo(a)h+ε(h)h)F(gramo(a)).{\displaystyle f(g(a+h))-f(g(a))=f(g(a)+g'(a)h+\varepsilon (h)h)-f(g(a)).} El siguiente paso es utilizar la definición de diferenciabilidad de f en g ( a ). Esto requiere un término de la forma f ( g ( a ) + k ) para algún k . En la ecuación anterior, el k correcto varía con h . Si definimos k h = g '( a ) h + ε ( h ) h , el lado derecho se convierte en f ( g ( a ) + k h ) − f ( g ( a )) . Aplicando la definición de la derivada se obtiene: F(gramo(a)+kh)F(gramo(a))=F(gramo(a))kh+η(kh)kh.{\displaystyle f(g(a)+k_{h})-f(g(a))=f'(g(a))k_{h}+\eta (k_{h})k_{h}.} Para estudiar el comportamiento de esta expresión cuando h tiende a cero, desarrollamos k h . Después de reagrupar los términos, el lado derecho se convierte en: F(gramo(a))gramo(a)h+[F(gramo(a))ε(h)+η(kh)gramo(a)+η(kh)ε(h)]h.{\displaystyle f'(g(a))g'(a)h+[f'(g(a))\varepsilon (h)+\eta (k_{h})g'(a)+\eta (k_{h})\varepsilon (h)]h.} Debido a que ε ( h ) y η ( k h ) tienden a cero cuando h tiende a cero, los dos primeros términos entre corchetes tienden a cero cuando h tiende a cero. Aplicando el mismo teorema sobre productos de límites que en la primera demostración, el tercer término entre corchetes también tiende a cero. Debido a que la expresión anterior es igual a la diferencia f ( g ( a + h )) − f ( g ( a )) , por definición de la derivada fg es diferenciable en a y su derivada es f ′( g ( a )) g ′( a ).

El papel de Q en la primera demostración lo desempeña η en esta demostración. Están relacionados por la ecuación: Q(y)=F(gramo(a))+η(ygramo(a)).{\displaystyle Q(y)=f'(g(a))+\eta (y-g(a)).} La necesidad de definir Q en g ( a ) es análoga a la necesidad de definir η en cero.

Tercera prueba

La definición alternativa de diferenciabilidad de una función propuesta por Constantin Carathéodory puede utilizarse para dar una demostración elegante de la regla de la cadena. [ 8 ]

Según esta definición, una función f es diferenciable en un punto a si y solo si existe una función q , continua en a y tal que f ( x ) − f ( a ) = q ( x )( xa ) . Existe como máximo una función de este tipo, y si f es diferenciable en a, entonces f ′( a ) = q ( a ) .

Dadas las suposiciones de la regla de la cadena y el hecho de que las funciones diferenciables y las composiciones de funciones continuas son continuas, tenemos que existen funciones q , continua en g ( a ) , y r , continua en a , y tales que, F(gramo(incógnita))F(gramo(a))=q(gramo(incógnita))(gramo(incógnita)gramo(a)){\displaystyle f(g(x))-f(g(a))=q(g(x))(g(x)-g(a))} y gramo(incógnita)gramo(a)=r(incógnita)(incógnitaa).{\displaystyle g(x)-g(a)=r(x)(x-a).} Por lo tanto, F(gramo(incógnita))F(gramo(a))=q(gramo(incógnita))r(incógnita)(incógnitaa),{\displaystyle f(g(x))-f(g(a))=q(g(x))r(x)(x-a),} pero la función dada por h ( x ) = q ( g ( x )) r ( x ) es continua en a , y obtenemos, para este a(F(gramo(a)))=q(gramo(a))r(a)=F(gramo(a))gramo(a).{\displaystyle (f(g(a)))'=q(g(a))r(a)=f'(g(a))g'(a).} Un enfoque similar funciona para funciones (vectoriales) de varias variables que son continuamente diferenciables. Este método de factorización también permite un enfoque unificado para formas más fuertes de diferenciabilidad, cuando se requiere que la derivada sea continua de Lipschitz , continua de Hölder , etc. La diferenciación en sí misma puede considerarse como el teorema del resto de un polinomio (el pequeño teorema de Bézout o teorema del factor), generalizado a una clase apropiada de funciones.

caso multivariable

La generalización completa de la regla de la cadena a funciones multivariables (comoF:RmetroRnorte{\displaystyle f\colon \mathbb {R} ^{m}\to \mathbb {R} ^{n}}) es bastante técnico. Sin embargo, es más sencillo escribirlo en el caso de funciones de la forma F(gramo1(incógnita),,gramok(incógnita)),{\displaystyle f(g_{1}(x),\dots ,g_{k}(x)),} dóndeF:RkR{\displaystyle f\colon \mathbb {R} ^{k}\to \mathbb {R} }, ygramoi:RR{\displaystyle g_{i}\colon \mathbb {R} \to \mathbb {R} }para cadai=1,2,,k.{\displaystyle i=1,2,\dots ,k.}

Como este caso se presenta con frecuencia en el estudio de funciones de una sola variable, vale la pena describirlo por separado.

Caso de funciones multivariadas con valores escalares

DejarF:RkR{\displaystyle f\colon \mathbb {R} ^{k}\to \mathbb {R} }, ygramoi:RR{\displaystyle g_{i}\colon \mathbb {R} \to \mathbb {R} }para cadai=1,2,,k.{\displaystyle i=1,2,\dots ,k.} Para escribir la regla de la cadena para la composición de funciones incógnitaF(gramo1(incógnita),,gramok(incógnita)),{\displaystyle x\mapsto f(g_{1}(x),\dots ,g_{k}(x)),} Se necesitan las derivadas parciales de f con respecto a sus k argumentos. Las notaciones habituales para derivadas parciales implican nombres para los argumentos de la función. Como estos argumentos no se nombran en la fórmula anterior, es más sencillo y claro usar la notación D y denotar por DiF{\displaystyle D_{i}f} la derivada parcial de f con respecto a su i- ésimo argumento, y por DiF(z){\displaystyle D_{i}f(z)} el valor de esta derivada en z .

Con esta notación, la regla de la cadena es ddincógnitaF(gramo1(incógnita),,gramok(incógnita))=i=1k(ddincógnitagramoi(incógnita))DiF(gramo1(incógnita),,gramok(incógnita)).{\displaystyle {\frac {d}{dx}}f(g_{1}(x),\dots ,g_{k}(x))=\sum _{i=1}^{k}\left({\frac {d}{dx}}{g_{i}}(x)\right)D_{i}f(g_{1}(x),\dots ,g_{k}(x)).}

Ejemplo: operaciones aritméticas

Si la función f es suma, es decir, si F(,v)=+v,{\displaystyle f(u,v)=u+v,} entoncesD1F=F=1{\textstyle D_{1}f={\frac {\partial f}{\partial u}}=1}yD2F=Fv=1{\textstyle D_{2}f={\frac {\partial f}{\partial v}}=1}Por lo tanto, la regla de la cadena da ddincógnita(gramo(incógnita)+h(incógnita))=(ddincógnitagramo(incógnita))D1F+(ddincógnitah(incógnita))D2F=ddincógnitagramo(incógnita)+ddincógnitah(incógnita).{\displaystyle {\frac {d}{dx}}(g(x)+h(x))=\left({\frac {d}{dx}}g(x)\right)D_{1}f+\left({\frac {d}{dx}}h(x)\right)D_{2}f={\frac {d}{dx}}g(x)+{\frac {d}{dx}}h(x).}

Para la multiplicación F(,v)=v,{\displaystyle f(u,v)=uv,} los parciales sonD1F=v{\displaystyle D_{1}f=v}yD2F={\displaystyle D_{2}f=u}. De este modo, ddincógnita(gramo(incógnita)h(incógnita))=h(incógnita)ddincógnitagramo(incógnita)+gramo(incógnita)ddincógnitah(incógnita).{\displaystyle {\frac {d}{dx}}(g(x)h(x))=h(x){\frac {d}{dx}}g(x)+g(x){\frac {d}{dx}}h(x).}

El caso de la exponenciación F(,v)=v{\displaystyle f(u,v)=u^{v}} es un poco más complicado, ya que D1F=vv1,{\displaystyle D_{1}f=vu^{v-1},} y, comov=mivln,{\displaystyle u^{v}=e^{v\ln u},}D2F=vln.{\displaystyle D_{2}f=u^{v}\ln u.} Resulta que ddincógnita(gramo(incógnita)h(incógnita))=h(incógnita)gramo(incógnita)h(incógnita)1ddincógnitagramo(incógnita)+gramo(incógnita)h(incógnita)lngramo(incógnita)ddincógnitah(incógnita).{\displaystyle {\frac {d}{dx}}\left(g(x)^{h(x)}\right)=h(x)g(x)^{h(x)-1}{\frac {d}{dx}}g(x)+g(x)^{h(x)}\ln g(x)\,{\frac {d}{dx}}h(x).}

Regla general: Funciones multivariadas con valores vectoriales

La forma más sencilla de escribir la regla de la cadena en el caso general es usar la derivada total , que es una transformación lineal que captura todas las derivadas direccionales en una sola fórmula. Consideremos funciones diferenciables f  : R mR k y g  : R nR m , y un punto a en R n . Sea D a g la derivada total de g en a y D g ( a ) f la derivada total de f en g ( a ) . Estas dos derivadas son transformaciones lineales R nR m y R mR k , respectivamente, por lo que se pueden componer. La regla de la cadena para derivadas totales es que su composición es la derivada total de fg en a : Da(Fgramo)=Dgramo(a)FDagramo,{\displaystyle D_{\mathbf {a} }(f\circ g)=D_{g(\mathbf {a} )}f\circ D_{\mathbf {a} }g,} o, en resumen, D(Fgramo)=DFDgramo.{\displaystyle D(f\circ g)=Df\circ Dg.} La regla de la cadena de dimensiones superiores se puede demostrar utilizando una técnica similar a la segunda demostración dada anteriormente. [ 9 ]

Dado que la derivada total es una transformación lineal, las funciones que aparecen en la fórmula pueden reescribirse como matrices. La matriz correspondiente a una derivada total se denomina matriz jacobiana , y la composición de dos derivadas corresponde al producto de sus matrices jacobianas. Desde esta perspectiva, la regla de la cadena establece, por lo tanto: JFgramo(a)=JF(gramo(a))Jgramo(a),{\displaystyle J_{f\circ g}(\mathbf {a} )=J_{f}(g(\mathbf {a} ))J_{g}(\mathbf {a} ),} o, en resumen, JFgramo=(JFgramo)Jgramo.{\displaystyle J_{f\circ g}=(J_{f}\circ g)J_{g}.}

Es decir, el jacobiano de una función compuesta es el producto de los jacobianos de las funciones que la componen (evaluados en los puntos apropiados).

La regla de la cadena de dimensiones superiores es una generalización de la regla de la cadena de dimensiones superiores. Si k , m y n son 1, de modo que f  : RR y g  : RR , entonces las matrices jacobianas de f y g son de 1 × 1. Específicamente, son: Jgramo(a)=(gramo(a)),JF(gramo(a))=(F(gramo(a))).{\displaystyle {\begin{aligned}J_{g}(a)&={\begin{pmatrix}g'(a)\end{pmatrix}},\\J_{f}(g(a))&={\begin{pmatrix}f'(g(a))\end{pmatrix}}.\end{aligned}}} El jacobiano de fg es el producto de estas matrices de 1 × 1 , por lo que es f ′( g ( a ))⋅ g ′( a ) , como se espera de la regla de la cadena unidimensional. En el lenguaje de las transformaciones lineales, D a ( g ) es la función que escala un vector por un factor de g ′( a ) y D g ( a ) ( f ) es la función que escala un vector por un factor de f ′( g ( a )) . La regla de la cadena dice que la composición de estas dos transformaciones lineales es la transformación lineal D a ( fg ) , y por lo tanto es la función que escala un vector por f ′( g ( a ))⋅ g ′( a ) .

Otra forma de escribir la regla de la cadena se utiliza cuando f y g se expresan en términos de sus componentes como y = f ( u ) = ( f 1 ( u ), …, f k ( u )) y u = g ( x ) = ( g 1 ( x ), …, g m ( x )) . En este caso, la regla anterior para matrices jacobianas se suele escribir como: (y1,,yk)(incógnita1,,incógnitanorte)=(y1,,yk)(1,,metro)(1,,metro)(incógnita1,,incógnitanorte).{\displaystyle {\frac {\partial (y_{1},\ldots ,y_{k})}{\partial (x_{1},\ldots ,x_{n})}}={\frac {\partial (y_{1},\ldots ,y_{k})}{\partial (u_{1},\ldots ,u_{m})}}{\frac {\partial (u_{1},\ldots ,u_{m})}{\partial (x_{1},\ldots ,x_{n})}}.}

La regla de la cadena para derivadas totales implica una regla de la cadena para derivadas parciales. Recordemos que cuando existe la derivada total, la derivada parcial en la dirección de la i -ésima coordenada se obtiene multiplicando la matriz jacobiana por el i -ésimo vector base. Al aplicar este procedimiento a la fórmula anterior, obtenemos: (y1,,yk)incógnitai=(y1,,yk)(1,,metro)(1,,metro)incógnitai.{\displaystyle {\frac {\partial (y_{1},\ldots ,y_{k})}{\partial x_{i}}}={\frac {\partial (y_{1},\ldots ,y_{k})}{\partial (u_{1},\ldots ,u_{m})}}{\frac {\partial (u_{1},\ldots ,u_{m})}{\partial x_{i}}}.} Dado que las entradas de la matriz jacobiana son derivadas parciales, podemos simplificar la fórmula anterior para obtener: (y1,,yk)incógnitai==1metro(y1,,yk)incógnitai.{\displaystyle {\frac {\partial (y_{1},\ldots ,y_{k})}{\partial x_{i}}}=\sum _{\ell =1}^{m}{\frac {\partial (y_{1},\ldots ,y_{k})}{\partial u_{\ell }}}{\frac {\partial u_{\ell }}{\partial x_{i}}}.} De forma más conceptual, esta regla expresa el hecho de que un cambio en la dirección x i puede cambiar todo g 1 a g m , y cualquiera de estos cambios puede afectar a f .

En el caso especial en que k = 1 , de modo que f es una función de valor real, entonces esta fórmula se simplifica aún más: yincógnitai==1metroyincógnitai.{\displaystyle {\frac {\partial y}{\partial x_{i}}}=\sum _{\ell =1}^{m}{\frac {\partial y}{\partial u_{\ell }}}{\frac {\partial u_{\ell }}{\partial x_{i}}}.} Esto se puede reescribir como un producto escalar . Recordando que u = ( g 1 , …, g m ) , la derivada parcial u / ∂ x i también es un vector, y la regla de la cadena dice que: yincógnitai=yincógnitai.{\displaystyle {\frac {\partial y}{\partial x_{i}}}=\nabla y\cdot {\frac {\partial \mathbf {u} }{\partial x_{i}}}.}

Ejemplo

Dado u ( x , y ) = x 2 + 2 y donde x ( r , t ) = r sin( t ) e y ( r , t ) = sin 2 ( t ) , determine el valor de u / ∂ r y u / ∂ t usando la regla de la cadena.r=incógnitaincógnitar+yyr=(2incógnita)(pecado(t))+(2)(0)=2rpecado2(t),{\displaystyle {\frac {\partial u}{\partial r}}={\frac {\partial u}{\partial x}}{\frac {\partial x}{\partial r}}+{\frac {\partial u}{\partial y}}{\frac {\partial y}{\partial r}}=(2x)(\sin(t))+(2)(0)=2r\sin ^{2}(t),} y t=incógnitaincógnitat+yyt=(2incógnita)(rporque(t))+(2)(2pecado(t)porque(t))=(2rpecado(t))(rporque(t))+4pecado(t)porque(t)=2(r2+2)pecado(t)porque(t)=(r2+2)pecado(2t).{\displaystyle {\begin{aligned}{\frac {\partial u}{\partial t}}&={\frac {\partial u}{\partial x}}{\frac {\partial x}{\partial t}}+{\frac {\partial u}{\partial y}}{\frac {\partial y}{\partial t}}\\&=(2x)(r\cos(t))+(2)(2\sin(t)\cos(t))\\&=(2r\sin(t))(r\cos(t))+4\sin(t)\cos(t)\\&=2(r^{2}+2)\sin(t)\cos(t)\\&=(r^{2}+2)\sin(2t).\end{aligned}}}

Derivadas de orden superior de funciones multivariables

La fórmula de Faà di Bruno para derivadas de orden superior de funciones de una sola variable se generaliza al caso multivariable. Si y = f ( u ) es una función de u = g ( x ) como se indicó anteriormente, entonces la segunda derivada de fg es: 2yincógnitaiincógnitaj=k(yk2kincógnitaiincógnitaj)+k,(2ykkincógnitaiincógnitaj).{\displaystyle {\frac {\partial ^{2}y}{\partial x_{i}\partial x_{j}}}=\sum _{k}\left({\frac {\partial y}{\partial u_{k}}}{\frac {\partial ^{2}u_{k}}{\partial x_{i}\partial x_{j}}}\right)+\sum _{k,\ell }\left({\frac {\partial ^{2}y}{\partial u_{k}\partial u_{\ell }}}{\frac {\partial u_{k}}{\partial x_{i}}}{\frac {\partial u_{\ell }}{\partial x_{j}}}\right).}

Generalizaciones adicionales

Todas las extensiones del cálculo tienen una regla de la cadena. En la mayoría de ellas, la fórmula permanece invariable, aunque su significado puede ser muy diferente.

Una generalización se aplica a las variedades . En este caso, la regla de la cadena representa el hecho de que la derivada de fg es la composición de la derivada de f y la derivada de g . Este teorema es una consecuencia inmediata de la regla de la cadena de dimensiones superiores mencionada anteriormente, y tiene exactamente la misma fórmula.

La regla de la cadena también es válida para derivadas de Fréchet en espacios de Banach . La misma fórmula se mantiene como antes. [ 10 ] Este caso y el anterior admiten una generalización simultánea a variedades de Banach .

En álgebra diferencial , la derivada se interpreta como un morfismo de módulos de diferenciales de Kähler . Un homomorfismo de anillos conmutativos f  : RS determina un morfismo de diferenciales de Kähler Df  : Ω R → Ω S que envía un elemento dr a d ( f ( r )) , el diferencial exterior de f ( r ) . La fórmula D ( fg ) = DfDg también se cumple en este contexto.

La característica común de estos ejemplos es que son expresiones de la idea de que la derivada es parte de un functor . Un functor es una operación sobre espacios y funciones entre ellos. Asocia a cada espacio un nuevo espacio y a cada función entre dos espacios una nueva función entre los nuevos espacios correspondientes. En cada uno de los casos anteriores, el functor envía cada espacio a su fibrado tangente y envía cada función a su derivada. Por ejemplo, en el caso de la variedad, la derivada envía una variedad C r a una variedad C r −1 (su fibrado tangente) y una función C r a su derivada total. Hay un requisito para que esto sea un functor, a saber, que la derivada de una composición debe ser la composición de las derivadas. Esta es exactamente la fórmula D ( fg ) = DfDg .

En el cálculo estocástico también existen reglas de cadena . Una de ellas, el lema de Itō , expresa la composición de un proceso de Itō (o, más generalmente, una semimartingala ) dX t con una función f dos veces diferenciable . En el lema de Itō, la derivada de la función compuesta depende no solo de dX t y de la derivada de f , sino también de la segunda derivada de f . Esta dependencia de la segunda derivada es consecuencia de la variación cuadrática no nula del proceso estocástico, lo que, en términos generales, significa que el proceso puede variar de forma muy irregular. Esta variante de la regla de cadena no es un ejemplo de functor, ya que las dos funciones que se componen son de tipos diferentes.

Véase también

Referencias

  1. George F. Simmons , Cálculo con geometría analítica (1985), pág. 93.
  2. Simmons, George F. (1996). Cálculo con geometría analítica . McGraw-Hill. pág. 115. ISBN 9780070575295. Archivo de Internet
  3. Child, JM (1917). "LOS MANUSCRITOS DE LEIBNIZ SOBRE SU DESCUBRIMIENTO DEL CÁLCULO DIFERENCIAL. PARTE II (Continuación)" . The Monist . 27 (3): 411– 454. doi : 10.5840/monist191727324 . ISSN 0026-9662 . JSTOR 27900650 .  
  4. 1 2 3 Rodríguez, Omar Hernández; López Fernández, Jorge M. (2010). «Una reflexión semiótica sobre la didáctica de la regla de la cadena» . El entusiasta de las matemáticas . 7 (2): 321– 332. doi : 10.54870/1551-3440.1191 .
  5. Apostol, Tom (1974). Análisis matemático (2.ª ed.). Addison Wesley. Teorema 5.5. 
  6. Landau, LD y EM Lifshitz. Mecánica . Curso de Física Teórica, Vol. 1. Pergamon Press, 1960, §12.
  7. Goodfellow, Ian ; Bengio, Yoshua ; Courville, Aaron (2016), Aprendizaje profundo , MIT, págs.=197–217.
  8. Kuhn, Stephen (1991). "The Derivative á la Carathéodory". The American Mathematical Monthly . 98 (1): 40– 44. doi : 10.2307/2324035 . JSTOR 2324035 . 
  9. Spivak, Michael (1965). Cálculo en variedades . Boston: Addison-Wesley. págs. 19–20 . ISBN  0-8053-9021-9.
  10. Cheney, Ward (2001). «La regla de la cadena y los teoremas del valor medio». Análisis para matemáticas aplicadas . Nueva York: Springer. págs. 121–125 . ISBN  0-387-95279-9.

Lecturas adicionales

  • Abou-Hayt, Imad; Dahl, Bettina (2025-03-29). "Uso de un contexto realista para motivar y enseñar a estudiantes de ingeniería la regla de la cadena" . Ciencias de la Educación . 15 (4): 433. doi : 10.3390/educsci15040433 . ISSN 2227-7102 .