Articulo de referencia

Función de valor

La función de valor de un problema de optimización proporciona el valor alcanzado por la función objetivo en una solución, dependiendo únicamente de los parámetros del problema....

La función de valor de un problema de optimización proporciona el valor alcanzado por la función objetivo en una solución, dependiendo únicamente de los parámetros del problema. [ 1 ] [ 2 ] En un sistema dinámico controlado , la función de valor representa la recompensa óptima del sistema en el intervalo[t,t1]{\displaystyle [t,t_{1}]}cuando comenzó en ese momento-t{\displaystyle t}variable de estadoincógnita(t)=incógnita{\displaystyle x(t)=x}[ 3 ] Si la función objetivo representa algún costo que debe minimizarse, la función de valor puede interpretarse como el costo para finalizar el programa óptimo, y por lo tanto se la denomina "función de costo restante". [ 4 ] [ 5 ] En un contexto económico, donde la función objetivo generalmente representa la utilidad , la función de valor es conceptualmente equivalente a la función de utilidad indirecta . [ 6 ] [ 7 ]

En un problema de control óptimo , la función de valor se define como el supremo de la función objetivo tomado sobre el conjunto de controles admisibles. Dado(t0,incógnita0)[0,t1]×Rd{\displaystyle (t_{0},x_{0})\in [0,t_{1}]\times \mathbb {R} ^{d}}, un problema típico de control óptimo es

maximizarJ(t0,incógnita0;)=t0t1I(t,incógnita(t),(t))dt+ϕ(incógnita(t1)){\displaystyle {\text{maximizar}}\quad J(t_{0},x_{0};u)=\int _{t_{0}}^{t_{1}}I(t,x(t),u(t))\,\mathrm {d} t+\phi (x(t_{1}))}

sujeto a

dincógnita(t)dt=F(t,incógnita(t),(t)){\displaystyle {\frac {\mathrm {d} x(t)}{\mathrm {d} t}}=f(t,x(t),u(t))}

con variable de estado inicialincógnita(t0)=incógnita0{\displaystyle x(t_{0})=x_{0}}. [ 8 ] La función objetivoJ(t0,incógnita0;){\displaystyle J(t_{0},x_{0};u)}debe maximizarse sobre todos los controles admisiblesU[t0,t1]{\displaystyle u\in U[t_{0},t_{1}]}, dónde{\displaystyle u}es una función medible de Lebesgue de[t0,t1]{\displaystyle [t_{0},t_{1}]}a algún conjunto arbitrario prescrito enRmetro{\displaystyle \mathbb {R} ^{m}}La función de valor se define entonces como

V(t,incógnita(t))=máximoUtt1I(τ,incógnita(τ),(τ))dτ+ϕ(incógnita(t1)){\displaystyle V(t,x(t))=\max _{u\in U}\int _{t}^{t_{1}}I(\tau ,x(\tau ),u(\tau ))\,\mathrm {d} \tau +\phi (x(t_{1}))}

conV(t1,incógnita(t1))=ϕ(incógnita(t1)){\displaystyle V(t_{1},x(t_{1}))=\phi (x(t_{1}))}, dóndeϕ(incógnita(t1)){\displaystyle \phi (x(t_{1}))}es el "valor de desecho". Si el par óptimo de trayectorias de control y estado es(incógnita,){\displaystyle (x^{\ast },u^{\ast })}, entoncesV(t0,incógnita0)=J(t0,incógnita0;){\displaystyle V(t_{0},x_{0})=J(t_{0},x_{0};u^{\ast })}. La funciónh{\displaystyle h}que proporciona el control óptimo{\displaystyle u^{\ast }}basado en el estado actualincógnita{\displaystyle x}se denomina política de control de retroalimentación, [ 4 ] o simplemente función de política. [ 9 ]

El principio de optimalidad de Bellman establece aproximadamente que cualquier política óptima en el momentot{\displaystyle t},t0tt1{\displaystyle t_{0}\leq t\leq t_{1}}tomando el estado actualincógnita(t){\displaystyle x(t)}como "nueva" condición inicial debe ser óptima para el problema restante. Si la función de valor resulta ser continuamente diferenciable , [ 10 ] esto da lugar a una importante ecuación diferencial parcial conocida como ecuación de Hamilton-Jacobi-Bellman ,

V(t,incógnita)t=máximo{I(t,incógnita,)+V(t,incógnita)incógnitaF(t,incógnita,)}{\displaystyle -{\frac {\partial V(t,x)}{\partial t}}=\max _{u}\left\{I(t,x,u)+{\frac {\partial V(t,x)}{\partial x}}f(t,x,u)\right\}}

donde el maximando del lado derecho también puede reescribirse como el hamiltoniano ,H(t,incógnita,,λ)=I(t,incógnita,)+λ(t)F(t,incógnita,){\displaystyle H\left(t,x,u,\lambda \right)=I(t,x,u)+\lambda (t)f(t,x,u)}, como

V(t,incógnita)t=máximoH(t,incógnita,,λ){\displaystyle -{\frac {\partial V(t,x)}{\partial t}}=\max _{u}H(t,x,u,\lambda )}

conV(t,incógnita)/incógnita=λ(t){\displaystyle \partial V(t,x)/\partial x=\lambda (t)}desempeñando el papel de las variables coestado . [ 11 ] Dada esta definición, además tenemosdλ(t)/dt=2V(t,incógnita)/incógnitat+2V(t,incógnita)/incógnita2F(incógnita){\displaystyle \mathrm {d} \lambda (t)/\mathrm {d} t=\partial ^{2}V(t,x)/\partial x\partial t+\partial ^{2}V(t,x)/\partial x^{2}\cdot f(x)}y después de diferenciar ambos lados de la ecuación HJB con respecto aincógnita{\displaystyle x},

2V(t,incógnita)tincógnita=Iincógnita+2V(t,incógnita)incógnita2F(incógnita)+V(t,incógnita)incógnitaF(incógnita)incógnita{\displaystyle -{\frac {\partial ^{2}V(t,x)}{\partial t\partial x}}={\frac {\partial I}{\partial x}}+{\frac {\partial ^{2}V(t,x)}{\partial x^{2}}}f(x)+{\frac {\partial V(t,x)}{\partial x}}{\frac {\partial f(x)}{\partial x}}}

que, tras sustituir los términos apropiados, recupera la ecuación coestado.

λ˙(t)=Iincógnita+λ(t)F(incógnita)incógnita=Hincógnita{\displaystyle -{\dot {\lambda }}(t)=\underbrace {{\frac {\partial I}{\partial x}}+\lambda (t){\frac {\partial f(x)}{\partial x}}} _{={\frac {\partial H}{\partial x}}}}

dóndeλ˙(t){\displaystyle {\dot {\lambda }}(t)}es la notación de Newton para la derivada con respecto al tiempo. [ 12 ]

La función de valor es la solución de viscosidad única de la ecuación de Hamilton-Jacobi-Bellman. [ 13 ] En un control óptimo aproximado en lazo cerrado en línea , la función de valor también es una función de Lyapunov que establece la estabilidad asintótica global del sistema en lazo cerrado. [ 14 ]

Referencias

  1. Fleming, Wendell H.; Rishel, Raymond W. (1975). Control óptimo determinista y estocástico . Nueva York: Springer. págs. 81–83 . ISBN  0-387-90155-8.
  2. Caputo, Michael R. (2005). Fundamentos del análisis económico dinámico : teoría y aplicaciones del control óptimo . Nueva York: Cambridge University Press. pág. 185. ISBN   0-521-60368-4.
  3. Weber, Thomas A. (2011). Teoría del control óptimo : con aplicaciones en economía . Cambridge: The MIT Press. pág. 82. ISBN   978-0-262-01573-8.
  4. 1 2 Bertsekas, Dimitri P.; Tsitsiklis, John N. (1996). Programación neurodinámica . Belmont: Athena Scientific. pág. 2. ISBN  1-886529-10-8.
  5. "EE365: Programación dinámica" (PDF) .
  6. Mas-Colell, Andreu ; Whinston, Michael D .; Green, Jerry R. (1995). Teoría microeconómica . Nueva York: Oxford University Press. pág. 964. ISBN  0-19-507340-1.
  7. Corbae, Dean; Stinchcombe, Maxwell B.; Zeman, Juraj (2009). Introducción al análisis matemático para la teoría económica y la econometría . Princeton University Press. pág. 145. ISBN  978-0-691-11867-3.
  8. Kamien, Morton I. ; Schwartz, Nancy L. (1991). Optimización dinámica : El cálculo de variaciones y el control óptimo en economía y gestión (2.ª ed.). Ámsterdam: North-Holland. p. 259. ISBN    0-444-01609-0.
  9. Ljungqvist, Lars ; Sargent, Thomas J. (2018). Teoría macroeconómica recursiva (Cuarta ed.). Cambridge: MIT Press. p. 106. ISBN   978-0-262-03866-9.
  10. Benveniste y Scheinkman establecieron condiciones suficientes para la diferenciabilidad de la función de valor, lo que a su vez permite una aplicación del teorema de la envolvente , véase Benveniste, LM; Scheinkman, JA (1979). "On the Differentiability of the Value Function in Dynamic Models of Economics". Econometrica . 47 (3): 727– 732. doi : 10.2307/1910417 . JSTOR 1910417 . Véase también Seierstad, Atle (1982). "Propiedades de diferenciabilidad de la función de valor óptimo en la teoría de control". Journal of Economic Dynamics and Control . 4 : 303–310 . doi : 10.1016/0165-1889(82)90019-7 .
  11. Kirk, Donald E. (1970). Teoría del control óptimo . Englewood Cliffs, NJ: Prentice-Hall. pág. 88. ISBN  0-13-638098-0.
  12. Zhou, XY (1990). "Principio del máximo, programación dinámica y su conexión en el control determinista". Journal of Optimization Theory and Applications . 65 (2): 363– 373. doi : 10.1007/BF01102352 . S2CID 122333807 . 
  13. Teorema 10.1 en Bressan, Alberto (2019). "Soluciones de viscosidad de ecuaciones de Hamilton-Jacobi y problemas de control óptimo" (PDF) . Apuntes de clase .
  14. Kamalapurkar, Rushikesh; Walters, Patrick; Rosenfeld, Joel; Dixon, Warren (2018). "Control óptimo y estabilidad de Lyapunov" . Aprendizaje por refuerzo para el control óptimo de retroalimentación: un enfoque basado en Lyapunov . Berlín: Springer. págs. 26–27 . ISBN  978-3-319-78383-3.

Lecturas adicionales

  • Caputo, Michael R. (2005). «Condiciones necesarias y suficientes para problemas isoperimétricos» . Fundamentos del análisis económico dinámico  : teoría y aplicaciones del control óptimo . Nueva York: Cambridge University Press. pp. 174–210 . ISBN  0-521-60368-4.
  • Clarke, Frank H.; Loewen, Philip D. (1986). "La función de valor en el control óptimo: sensibilidad, controlabilidad y optimalidad temporal". SIAM Journal on Control and Optimization . 24 (2): 243– 263. doi : 10.1137/0324014 .
  • LaFrance, Jeffrey T.; Barney, L. Dwayne (1991). "El teorema de la envolvente en la optimización dinámica" (PDF) . Journal of Economic Dynamics and Control . 15 (2): 355– 385. doi : 10.1016/0165-1889(91)90018-V .
  • Stengel, Robert F. (1994). «Condiciones para la optimalidad» . Control óptimo y estimación . Nueva York: Dover. págs. 201–222 . ISBN  0-486-68200-5.