Articulo de referencia

método de ecuaciones diferenciales estocásticas regresivas profundas

La arquitectura de red neuronal del método de ecuaciones diferenciales profundas hacia atrás El método de ecuaciones diferenciales estocásticas regresivas profundas es un método...

La arquitectura de red neuronal del método de ecuaciones diferenciales profundas hacia atrás

El método de ecuaciones diferenciales estocásticas regresivas profundas es un método numérico que combina el aprendizaje profundo con ecuaciones diferenciales estocásticas regresivas (BSDE). Este método es particularmente útil para resolver problemas de alta dimensionalidad en la valoración de derivados financieros y la gestión de riesgos . Al aprovechar las potentes capacidades de aproximación de funciones de las redes neuronales profundas , el método BSDE profundo aborda los desafíos computacionales que enfrentan los métodos numéricos tradicionales en entornos de alta dimensionalidad. [ 1 ]

Historia

Ecuaciones diferenciales estocásticas hacia atrás

Las BSDE fueron introducidas por primera vez por Pardoux y Peng en 1990 y desde entonces se han convertido en herramientas esenciales en el control estocástico y las matemáticas financieras . En la década de 1990, Étienne Pardoux y Shige Peng establecieron la teoría de existencia y unicidad para las soluciones de BSDE, aplicándolas a las matemáticas financieras y la teoría de control. Por ejemplo, las BSDE se han utilizado ampliamente en la valoración de opciones, la medición de riesgos y la cobertura dinámica. [ 2 ]

Aprendizaje profundo

Introducción al aprendizaje profundo

El aprendizaje profundo es un método de aprendizaje automático basado en redes neuronales multicapa . Su concepto central se remonta a los modelos de computación neuronal de la década de 1940. En la década de 1980, la propuesta del algoritmo de retropropagación hizo posible el entrenamiento de redes neuronales multicapa. En 2006, las Redes de Creencia Profunda propuestas por Geoffrey Hinton y otros reavivaron el interés en el aprendizaje profundo. Desde entonces, el aprendizaje profundo ha logrado avances revolucionarios en el procesamiento de imágenes , el reconocimiento de voz , el procesamiento del lenguaje natural y otros campos. [ 3 ]

Limitaciones de los métodos numéricos tradicionales

Los métodos numéricos tradicionales para resolver ecuaciones diferenciales estocásticas [ 4 ] incluyen el método de Euler-Maruyama , el método de Milstein , el método de Runge-Kutta (EDE) y métodos basados ​​en diferentes representaciones de integrales estocásticas iteradas. [ 5 ] [ 6 ]

Pero a medida que los problemas financieros se vuelven más complejos, los métodos numéricos tradicionales para las BSDE (como el método de Monte Carlo , el método de diferencias finitas , etc.) han mostrado limitaciones tales como una alta complejidad computacional y la maldición de la dimensionalidad. [ 1 ]

  1. En escenarios de alta dimensionalidad, el método de Monte Carlo requiere numerosas rutas de simulación para garantizar la precisión, lo que resulta en tiempos de cálculo prolongados. En particular, para las BSDE no lineales, la tasa de convergencia es lenta, lo que dificulta el manejo de problemas complejos de valoración de derivados financieros. [ 7 ] [ 8 ]
    Método de Monte Carlo aplicado para aproximar el valor de π
  2. Por otro lado, el método de diferencias finitas experimenta un crecimiento exponencial en el número de mallas de cálculo con el aumento de las dimensiones, lo que conlleva importantes exigencias computacionales y de almacenamiento. Este método suele ser adecuado para condiciones de contorno simples y ecuaciones diferenciales estocásticas regresivas de baja dimensión, pero es menos eficaz en situaciones complejas. [ 9 ]

Método BSDE profundo

La combinación de aprendizaje profundo con BSDE, conocida como BSDE profunda, fue propuesta por Han, Jentzen y E en 2018 como una solución a los desafíos de alta dimensionalidad que enfrentan los métodos numéricos tradicionales. El enfoque de BSDE profunda aprovecha las potentes capacidades de ajuste no lineal del aprendizaje profundo, aproximando la solución de las BSDE mediante la construcción de redes neuronales. La idea específica es representar la solución de una BSDE como la salida de una red neuronal y entrenar la red para aproximar la solución. [ 1 ]

Modelo

Método matemático

Las ecuaciones diferenciales estocásticas regresivas (EDER) representan una poderosa herramienta matemática ampliamente aplicada en campos como el control estocástico , las matemáticas financieras y otros. A diferencia de las ecuaciones diferenciales estocásticas (EDE) tradicionales, que se resuelven hacia adelante en el tiempo, las EDER se resuelven hacia atrás, comenzando desde un momento futuro y retrocediendo hasta el presente. Esta característica única hace que las EDER sean particularmente adecuadas para problemas que involucran condiciones terminales e incertidumbres. [ 2 ]

Una ecuación diferencial estocástica hacia atrás (BSDE) se puede formular como: [ 10 ]

Yt=ξ+tTF(s,Ys,Zs)dstTZsdWs,t[0,T]{\displaystyle Y_{t}=\xi +\int _{t}^{T}f(s,Y_{s},Z_{s})\,ds-\int _{t}^{T}Z_{s}\,dW_{s},\quad t\in [0,T]}

En esta ecuación:

  • ξ{\displaystyle \xi }es la condición terminal especificada en el tiempoT{\displaystyle T}.
  • F:[0,T]×R×RR{\displaystyle f:[0,T]\times \mathbb {R} \times \mathbb {R} \to \mathbb {R} }se denomina generador de la BSDE
  • (Yt,Zt)t[0,T]{\displaystyle (Y_{t},Z_{t})_{t\in [0,T]}}La solución consiste en procesos estocásticos(Yt)t[0,T]{\displaystyle (Y_{t})_{t\in [0,T]}}y(Zt)t[0,T]{\displaystyle (Z_{t})_{t\in [0,T]}}que están adaptados a la filtración(Ft)t[0,T]{\displaystyle ({\mathcal {F}}_{t})_{t\in [0,T]}}
  • Ws{\displaystyle W_{s}}es un movimiento browniano estándar .

El objetivo es encontrar procesos adaptados.Yt{\displaystyle Y_{t}}yZt{\displaystyle Z_{t}}que satisfacen esta ecuación. Los métodos numéricos tradicionales tienen dificultades con las BSDE debido a la maldición de la dimensionalidad, lo que hace que los cálculos en espacios de alta dimensión sean extremadamente difíciles. [ 1 ]

Descripción general de la metodología

Fuente: [ 1 ]

1. Ecuaciones diferenciales parciales parabólicas semilineales

Consideramos una clase general de EDP representada por t(t,incógnita)+12Tran(σσT(t,incógnita)(Hessincógnita(t,incógnita)))+(t,incógnita)μ(t,incógnita)+F(t,incógnita,(t,incógnita),σT(t,incógnita)(t,incógnita))=0{\displaystyle {\frac {\partial u}{\partial t}}(t,x)+{\frac {1}{2}}{\text{Tr}}\left(\sigma \sigma ^{T}(t,x)\left({\text{Hess}}_{x}u(t,x)\right)\right)+\nabla u(t,x)\cdot \mu (t,x)+f\left(t,x,u(t,x),\sigma ^{T}(t,x)\nabla u(t,x)\right)=0}

En esta ecuación:

  • (T,incógnita)=gramo(incógnita){\displaystyle u(T,x)=g(x)}es la condición terminal especificada en el tiempoT{\displaystyle T}.
  • t{\displaystyle t}yincógnita{\displaystyle x}representar el tiempo yd{\displaystyle d}variable espacial de -dimensiones, respectivamente.
  • σ{\displaystyle \sigma }es una función vectorial conocida,σT{\displaystyle \sigma ^{T}}denota la transpuesta asociada aσ{\displaystyle \sigma }, yHessincógnita{\displaystyle {\text{Hess}}_{x}u}denota el hessiano de la función{\displaystyle u}con respecto aincógnita{\displaystyle x}.
  • μ{\displaystyle \mu }es una función vectorial conocida, yF{\displaystyle f}es una función no lineal conocida.

2. Representación de procesos estocásticos

Dejar{Wt}t0{\displaystyle \{W_{t}\}_{t\geq 0}}ser und{\displaystyle d}Movimiento browniano dimensional y{incógnitat}t0{\displaystyle \{X_{t}\}_{t\geq 0}}ser und{\displaystyle d}Proceso estocástico de dimensión que satisface

incógnitat=ξ+0tμ(s,incógnitas)ds+0tσ(s,incógnitas)dWs{\displaystyle X_{t}=\xi +\int _{0}^{t}\mu (s,X_{s})\,ds+\int _{0}^{t}\sigma (s,X_{s})\,dW_{s}}

3. Ecuación diferencial estocástica hacia atrás (BSDE)

Entonces, la solución de la EDP satisface la siguiente BSDE:

(t,incógnitat)(0,incógnita0){\displaystyle u(t,X_{t})-u(0,X_{0})}

=0tF(s,incógnitas,(s,incógnitas),σT(s,incógnitas)(s,incógnitas))ds+0t(s,incógnitas)σ(s,incógnitas)dWs{\displaystyle =-\int _{0}^{t}f\left(s,X_{s},u(s,X_{s}),\sigma ^{T}(s,X_{s})\nabla u(s,X_{s})\right)\,ds+\int _{0}^{t}\nabla u(s,X_{s})\cdot \sigma (s,X_{s})\,dW_{s}}

4. Discretización temporal

Discretizar el intervalo de tiempo[0,T]{\displaystyle [0,T]}en pasos0=t0<t1<<tnorte=T{\displaystyle 0=t_{0}<t_{1}<\cdots <t_{N}=T}:

incógnitatnorte+1incógnitatnorteμ(tnorte,incógnitatnorte)Δtnorte+σ(tnorte,incógnitatnorte)ΔWnorte{\displaystyle X_{t_{n+1}}-X_{t_{n}}\approx \mu (t_{n},X_{t_{n}})\Delta t_{n}+\sigma (t_{n},X_{t_{n}})\Delta W_{n}}

(tnorte,incógnitatnorte+1)(tnorte,incógnitatnorte){\displaystyle u(t_{n},X_{t_{n+1}})-u(t_{n},X_{t_{n}})}

F(tnorte,incógnitatnorte,(tnorte,incógnitatnorte),σT(tnorte,incógnitatnorte)(tnorte,incógnitatnorte))Δtnorte+[(tnorte,incógnitatnorte)σ(tnorte,incógnitatnorte)]ΔWnorte{\displaystyle \approx -f\left(t_{n},X_{t_{n}},u(t_{n},X_{t_{n}}),\sigma ^{T}(t_{n},X_{t_{n}})\nabla u(t_{n},X_{t_{n}})\right)\Delta t_{n}+\left[\nabla u(t_{n},X_{t_{n}})\sigma (t_{n},X_{t_{n}})\right]\Delta W_{n}}

dóndeΔtnorte=tnorte+1tnorte{\displaystyle \Delta t_{n}=t_{n+1}-t_{n}}yΔWnorte=Wtnorte+1Wnorte{\displaystyle \Delta W_{n}=W_{t_{n+1}}-W_{n}}.

5. Aproximación mediante redes neuronales

Utilice una red neuronal multicapa de alimentación directa para aproximar:

σT(tnorte,incógnitanorte)(tnorte,incógnitanorte)(σT)(tnorte,incógnitanorte;θnorte){\displaystyle \sigma ^{T}(t_{n},X_{n})\nabla u(t_{n},X_{n})\approx (\sigma ^{T}\nabla u)(t_{n},X_{n};\theta _{n})}

paranorte=1,,norte{\displaystyle n=1,\ldots ,N}, dóndeθnorte{\displaystyle \theta _{n}}son parámetros de la red neuronal que aproximanincógnitaσT(t,incógnita)(t,incógnita){\displaystyle x\mapsto \sigma ^{T}(t,x)\nabla u(t,x)}ent=tnorte{\displaystyle t=t_{n}}.

6. Entrenamiento de la red neuronal

Apila todas las subredes en el paso de aproximación para formar una red neuronal profunda. Entrena la red usando rutas.{incógnitatnorte}0nortenorte{\displaystyle \{X_{t_{n}}\}_{0\leq n\leq N}}y{Wtnorte}0nortenorte{\displaystyle \{W_{t_{n}}\}_{0\leq n\leq N}}como datos de entrada, minimizando la función de pérdida:

l(θ)=mi|gramo(incógnitatnorte)^({incógnitatnorte}0nortenorte,{Wtnorte}0nortenorte;θ)|2{\displaystyle l(\theta )=\mathbb {E} \left|g(X_{t_{N}})-{\hat {u}}\left(\{X_{t_{n}}\}_{0\leq n\leq N},\{W_{t_{n}}\}_{0\leq n\leq N};\theta \right)\right|^{2}}

dónde^{\displaystyle {\hat {u}}}es la aproximación de(t,incógnitat){\displaystyle u(t,X_{t})}.

Arquitectura de redes neuronales

Fuente: [ 1 ]

El aprendizaje profundo abarca una clase de técnicas de aprendizaje automático que han transformado numerosos campos al permitir el modelado e interpretación de estructuras de datos complejas. Estos métodos, a menudo denominados aprendizaje profundo , se distinguen por su arquitectura jerárquica compuesta por múltiples capas de nodos o neuronas interconectadas. Esta arquitectura permite que las redes neuronales profundas aprendan de forma autónoma representaciones abstractas de los datos, lo que las hace particularmente efectivas en tareas como el reconocimiento de imágenes , el procesamiento del lenguaje natural y el modelado financiero . El núcleo de este método reside en el diseño de una estructura de red neuronal apropiada (como redes totalmente conectadas o redes neuronales recurrentes ) y la selección de algoritmos de optimización eficaces. [ 3 ]

La elección de la arquitectura de red BSDE profunda, el número de capas y el número de neuronas por capa son hiperparámetros cruciales que impactan significativamente el rendimiento del método BSDE profundo. El método BSDE profundo construye redes neuronales para aproximar las soluciones paraY{\displaystyle Y}yZ{\displaystyle Z}y utiliza el descenso de gradiente estocástico y otros algoritmos de optimización para el entrenamiento. [ 1 ]

La figura ilustra la arquitectura de red para el método BSDE profundo. Tenga en cuenta que(tnorte,incógnitatnorte){\displaystyle \nabla u(t_{n},X_{t_{n}})}denota la variable aproximada directamente por subredes, y(tnorte,incógnitatnorte){\displaystyle u(t_{n},X_{t_{n}})}denota la variable calculada iterativamente en la red. Hay tres tipos de conexiones en esta red: [ 1 ]

i)incógnitatnorteh1norteh2nortehHnorte(tnorte,incógnitatnorte){\displaystyle X_{t_{n}}\rightarrow h_{1}^{n}\rightarrow h_{2}^{n}\rightarrow \ldots \rightarrow h_{H}^{n}\rightarrow \nabla u(t_{n},X_{t_{n}})}es la red neuronal multicapa de alimentación directa que aproxima los gradientes espaciales en el tiempot=tnorte{\displaystyle t=t_{n}}Los pesosθnorte{\displaystyle \theta _{n}}Los parámetros de esta subred están optimizados.

ii)((tnorte,incógnitatnorte),(tnorte,incógnitatnorte),Wtnorte+1Wtnorte)(tnorte+1,incógnitatnorte+1){\displaystyle (u(t_{n},X_{t_{n}}),\nabla u(t_{n},X_{t_{n}}),W_{t_{n}+1}-W_{t_{n}})\rightarrow u(t_{n+1},X_{t_{n+1}})}es la iteración hacia adelante que proporciona la salida final de la red como una aproximación de(tnorte,incógnitatnorte){\displaystyle u(t_{N},X_{t_{N}})}, caracterizada por las ecuaciones 5 y 6. No hay parámetros optimizados en este tipo de conexión.

iii)(incógnitatnorte,Wtnorte+1Wtnorte)incógnitatnorte+1{\displaystyle (X_{t_{n}},W_{t_{n}+1}-W_{t_{n}})\rightarrow X_{t_{n+1}}}es el atajo que conecta bloques en diferentes momentos, caracterizado por las ecuaciones 4 y 6. Tampoco hay parámetros optimizados en este tipo de conexión.

Algoritmos

Descenso de gradiente frente a Monte Carlo

Optimizador Adam

Esta función implementa el algoritmo Adam [ 11 ] para minimizar la función objetivo.GRAMO(θ){\displaystyle {\mathcal {G}}(\theta )}.

Función: ADAM(α{\displaystyle \alpha },β1{\displaystyle \beta _{1}},β2{\displaystyle \beta _{2}},ϵ{\displaystyle \epsilon },GRAMO(θ){\displaystyle {\mathcal {G}}(\theta )},θ0{\displaystyle \theta _{0}}) esmetro0:=0{\displaystyle m_{0}:=0}// Inicializar el primer vector de momentosv0:=0{\displaystyle v_{0}:=0}// Inicializar el vector de segundo momentot:=0{\displaystyle t:=0}// Inicializar paso de tiempo// Paso 1: Inicializar parámetrosθt:=θ0{\displaystyle \theta _{t}:=\theta _{0}}// Paso 2: Bucle de optimización whileθt{\displaystyle \theta _{t}}no ha convergidot:=t+1{\displaystyle t:=t+1}gramot:=θGRAMOt(θt1){\displaystyle g_{t}:=\nabla _{\theta }{\mathcal {G}}_{t}(\theta _{t-1})}// Calcular el gradiente deGRAMO{\displaystyle {\mathcal {G}}}en el paso de tiempot{\displaystyle t}metrot:=β1metrot1+(1β1)gramot{\displaystyle m_{t}:=\beta _{1}\cdot m_{t-1}+(1-\beta _{1})\cdot g_{t}}// Actualizar la estimación sesgada del primer momentovt:=β2vt1+(1β2)gramot2{\displaystyle v_{t}:=\beta _{2}\cdot v_{t-1}+(1-\beta _{2})\cdot g_{t}^{2}}// Actualizar la estimación del segundo momento bruto sesgadometro^t:=metrot(1β1t){\displaystyle {\widehat {m}}_{t}:={\frac {m_{t}}{(1-\beta _{1}^{t})}}}// Calcular la estimación del primer momento corregida por sesgov^t:=vt(1β2t){\displaystyle {\widehat {v}}_{t}:={\frac {v_{t}}{(1-\beta _{2}^{t})}}}// Calcular la estimación del segundo momento corregida por sesgoθt:=θt1αmetro^t(v^t+ϵ){\displaystyle \theta _{t}:=\theta _{t-1}-{\frac {\alpha \cdot {\widehat {m}}_{t}}{({\sqrt {{\widehat {v}}_{t}}}+\epsilon )}}}// Actualizar parámetrosdevolverθt{\displaystyle \theta _{t}}
  • Con el algoritmo ADAM descrito anteriormente, presentamos ahora el pseudocódigo correspondiente a una red neuronal multicapa de alimentación directa:

Algoritmo de retropropagación

Esta función implementa el algoritmo de retropropagación para entrenar una red neuronal multicapa de propagación directa.

Función: Retropropagación( establecerD={(incógnitak,yk)}k=1metro{\displaystyle D=\left\{(\mathbf {x} _{k},\mathbf {y} _{k})\right\}_{k=1}^{m}}) es // Paso 1: Inicialización aleatoria // Paso 2: Bucle de optimización que se repite hasta que se cumple la condición de terminación: para cada(incógnitak,yk)D{\displaystyle (\mathbf {x} _{k},\mathbf {y} _{k})\in D}: y^k:=F(βjθj){\displaystyle {\hat {\mathbf {y} }}_{k}:=f(\beta _{j}-\theta _{j})}// Calcular la salida // Calcular los gradientes para cada neurona de salidaj{\displaystyle j}: gramoj:=y^jk(1y^jk)(y^jkyjk){\displaystyle g_{j}:={\hat {y}}_{j}^{k}(1-{\hat {y}}_{j}^{k})({\hat {y}}_{j}^{k}-y_{j}^{k})}// Gradiente de la neurona de salida para cada neurona ocultah{\displaystyle h}: mih:=bh(1bh)j=1whjgramoj{\displaystyle e_{h}:=b_{h}(1-b_{h})\sum _{j=1}^{\ell }w_{hj}g_{j}}// Gradiente de la neurona oculta // Actualizar los pesos para cada pesowhj{\displaystyle w_{hj}}: Δwhj:=ηgramojbh{\displaystyle \Delta w_{hj}:=\eta g_{j}b_{h}}// Actualizar la regla de peso para cada pesovih{\displaystyle v_{ih}}: Δvih:=ηmihincógnitai{\displaystyle \Delta v_{ih}:=\eta e_{h}x_{i}}// Actualizar regla para peso // Actualizar parámetros para cada parámetroθj{\displaystyle \theta _{j}}: Δθj:=ηgramoj{\displaystyle \Delta \theta _{j}:=-\eta g_{j}}// Regla de actualización para el parámetro para cada parámetroγh{\displaystyle \gamma _{h}}: Δγh:=ηmih{\displaystyle \Delta \gamma _{h}:=-\eta e_{h}}// Regla de actualización para el parámetro// Paso 3: Construir la red neuronal multicapa de alimentación directa entrenadared neuronal entrenada de retorno
  • Combinando el algoritmo ADAM y una red neuronal multicapa de alimentación directa, proporcionamos el siguiente pseudocódigo para resolver la cartera de inversión óptima:

Solución numérica para una cartera de inversión óptima

Fuente: [ 1 ]

Esta función calcula la cartera de inversión óptima utilizando los parámetros y procesos estocásticos especificados.

función Inversión Óptima(Wti+1Wti{\displaystyle W_{t_{i+1}}-W_{t_{i}}},incógnita{\displaystyle x},θ=(incógnita0,H0,θ1,θ2,,θnorte1){\displaystyle \theta =(X_{0},H_{0},\theta _{1},\theta _{2},\dots ,\theta _{N-1})}) es // Paso 1: Inicialización parak:=0{\displaystyle k:=0}para maxstep hacerMETRO0k,metro:=0{\displaystyle M_{0}^{k,m}:=0},incógnita0k,metro:=incógnita0k{\displaystyle X_{0}^{k,m}:=X_{0}^{k}}// Inicialización de parámetros parai:=0{\displaystyle i:=0}anorte1{\displaystyle N-1}hacerHtik,metro:=nortenorte(METROtik,metro;θik){\displaystyle H_{t_{i}}^{k,m}:={\mathcal {NN}}(M_{t_{i}}^{k,m};\theta _{i}^{k})}// Actualizar la unidad de red neuronal de alimentación directaMETROti+1k,metro:=METROtik,metro+((1ϕ)(μtiMETROtik,metro))(ti+1ti)+σti(Wti+1Wti){\displaystyle M_{t_{i+1}}^{k,m}:=M_{t_{i}}^{k,m}+{\big (}(1-\phi )(\mu _{t_{i}}-M_{t_{i}}^{k,m}){\big )}(t_{i+1}-t_{i})+\sigma _{t_{i}}(W_{t_{i+1}}-W_{t_{i}})}incógnitati+1k,metro:=incógnitatik,metro+[Htik,metro(ϕ(METROtik,metroμti)+μti)](ti+1ti)+Htik,metro(Wti+1Wti){\displaystyle X_{t_{i+1}}^{k,m}:=X_{t_{i}}^{k,m}+{\big [}H_{t_{i}}^{k,m}(\phi (M_{t_{i}}^{k,m}-\mu _{t_{i}})+\mu _{t_{i}}){\big ]}(t_{i+1}-t_{i})+H_{t_{i}}^{k,m}(W_{t_{i+1}}-W_{t_{i}})}// Paso 2: Calcular la función de pérdidaL(t):=1METROmetro=1METRO|incógnitatnortek,metrogramo(METROtnortek,metro)|2{\displaystyle {\mathcal {L}}(t):={\frac {1}{M}}\sum _{m=1}^{M}\left|X_{t_{N}}^{k,m}-g(M_{t_{N}}^{k,m})\right|^{2}}// Paso 3: Actualizar parámetros mediante la optimización de ADAMθk+1:=ADÁN(θk,L(t)){\displaystyle \theta ^{k+1}:=\operatorname {ADAM} (\theta ^{k},\nabla {\mathcal {L}}(t))}incógnita0k+1:=ADÁN(incógnita0k,L(t)){\displaystyle X_{0}^{k+1}:=\operatorname {ADAM} (X_{0}^{k},\nabla {\mathcal {L}}(t))}// Paso 4: Devolver el estado del terminal(METROtnorte,incógnitatnorte){\displaystyle (M_{t_{N}},X_{t_{N}})}

Solicitud

La función de pérdida que cambia dinámicamente

El método Deep BSDE se utiliza ampliamente en los campos de valoración de derivados financieros, gestión de riesgos y asignación de activos. Es particularmente adecuado para:

  • Valoración de opciones de alta dimensión: Valoración de derivados complejos como opciones de cesta y opciones asiáticas , que involucran múltiples activos subyacentes. [ 1 ] Los métodos tradicionales, como los métodos de diferencias finitas y las simulaciones de Monte Carlo, tienen dificultades con estos problemas de alta dimensión debido a la maldición de la dimensionalidad, donde el costo computacional aumenta exponencialmente con el número de dimensiones. Los métodos BSDE profundos utilizan las capacidades de aproximación de funciones de las redes neuronales profundas para gestionar esta complejidad y proporcionar soluciones de valoración precisas. El enfoque BSDE profundo es particularmente beneficioso en escenarios donde los métodos numéricos tradicionales se quedan cortos. Por ejemplo, en la valoración de opciones de alta dimensión, métodos como las diferencias finitas o las simulaciones de Monte Carlo enfrentan desafíos significativos debido al aumento exponencial en los requisitos computacionales con el número de dimensiones. Los métodos BSDE profundos superan esto al aprovechar el aprendizaje profundo para aproximar soluciones a EDP de alta dimensión de manera eficiente. [ 1 ]
  • Medición del riesgo: Cálculo de medidas de riesgo como el Valor en Riesgo Condicional (CVaR) y el Déficit Esperado (ES). [ 12 ] Estas medidas de riesgo son cruciales para que las instituciones financieras evalúen las pérdidas potenciales en sus carteras. Los métodos BSDE profundos permiten el cálculo eficiente de estas métricas de riesgo incluso en entornos de alta dimensionalidad, mejorando así la precisión y la robustez de las evaluaciones de riesgo. En la gestión de riesgos, los métodos BSDE profundos mejoran el cálculo de medidas de riesgo avanzadas como CVaR y ES, que son esenciales para capturar el riesgo de cola en las carteras. Estas medidas proporcionan una comprensión más completa de las pérdidas potenciales en comparación con métricas más simples como el Valor en Riesgo (VaR). El uso de redes neuronales profundas permite que estos cálculos sean factibles incluso en contextos de alta dimensionalidad, asegurando evaluaciones de riesgo precisas y confiables. [ 12 ]
  • Asignación dinámica de activos: Determinación de estrategias óptimas para la asignación de activos a lo largo del tiempo en un entorno estocástico. [ 12 ] Esto implica la creación de estrategias de inversión que se adaptan a las condiciones cambiantes del mercado y a la dinámica de los precios de los activos. Al modelar el comportamiento estocástico de los rendimientos de los activos e incorporarlo a las decisiones de asignación, los métodos BSDE profundos permiten a los inversores ajustar dinámicamente sus carteras, maximizando los rendimientos esperados y gestionando el riesgo de forma eficaz. Para la asignación dinámica de activos, los métodos BSDE profundos ofrecen ventajas significativas al optimizar las estrategias de inversión en respuesta a los cambios del mercado. Este enfoque dinámico es fundamental para la gestión de carteras en un entorno financiero estocástico, donde los precios de los activos están sujetos a fluctuaciones aleatorias. Los métodos BSDE profundos proporcionan un marco para desarrollar y ejecutar estrategias que se adaptan a estas fluctuaciones, lo que conduce a una gestión de activos más resiliente y eficaz. [ 12 ]

Ventajas y desventajas

Ventajas

Fuentes: [ 1 ] [ 12 ]

  1. Capacidad para alta dimensionalidad: En comparación con los métodos numéricos tradicionales, el método BSDE profundo ofrece un rendimiento excepcionalmente bueno en problemas de alta dimensionalidad.
  2. Flexibilidad: La incorporación de redes neuronales profundas permite que este método se adapte a diversos tipos de BSDE y modelos financieros.
  3. Computación paralela: Los marcos de aprendizaje profundo admiten la aceleración por GPU, lo que mejora significativamente la eficiencia computacional.

Desventajas

Fuentes: [ 1 ] [ 12 ]

  1. Tiempo de entrenamiento: El entrenamiento de redes neuronales profundas generalmente requiere una cantidad sustancial de datos y recursos computacionales.
  2. Sensibilidad de los parámetros: La elección de la arquitectura de la red neuronal y de los hiperparámetros influye enormemente en los resultados, y a menudo requiere experiencia y un método de ensayo y error.

Véase también

Referencias

  1. 1 2 3 4 5 6 7 8 9 10 11 12 13 Han, J.; Jentzen, A.; E, W. (2018). "Resolución de ecuaciones diferenciales parciales de alta dimensión mediante aprendizaje profundo" . Actas de la Academia Nacional de Ciencias . 115 (34): 8505– 8510. arXiv : 1707.02568 . Bibcode : 2018PNAS..115.8505H . doi : 10.1073 / pnas.1718942115 . PMC 6112690. PMID 30082389 .  
  2. 1 2 Pardoux, E.; Peng, S. (1990). "Solución adaptada de una ecuación diferencial estocástica hacia atrás". Systems & Control Letters . 14 (1): 55– 61. doi : 10.1016/0167-6911(90)90082-6 .
  3. 1 2 LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015). " Aprendizaje profundo" (PDF) . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . PMID 26017442. S2CID 3074096 .  
  4. Kloeden, PE , Platen E. (1992). Solución numérica de ecuaciones diferenciales estocásticas. Springer, Berlín, Heidelberg. DOI: https://doi.org/10.1007/978-3-662-12616-5
  5. Kuznetsov, DF (2023). Aproximación fuerte de integrales estocásticas iteradas de Itô y Stratonovich: Método de series de Fourier múltiples generalizadas. Aplicación a la integración numérica de EDE de Itô y EDE semilineales. Differ. Uravn. Protsesy Upr., n.º 1. DOI: https://doi.org/10.21638/11701/spbu35.2023.110
  6. Rybakov, KA (2023). Representaciones espectrales de integrales estocásticas iteradas y su aplicación para el modelado de dinámicas estocásticas no lineales. Mathematics, vol. 11, 4047. DOI: https://doi.org/10.3390/math11194047
  7. "Opciones reales con simulación de Monte Carlo" . Archivado del original el 18 de marzo de 2010. Consultado el 24 de septiembre de 2010 .
  8. "Simulación de Monte Carlo" . Palisade Corporation. 2010. Consultado el 24 de septiembre de 2010 .
  9. Christian Grossmann; Hans-G. Roos; Martin Stynes ​​(2007). Tratamiento numérico de ecuaciones diferenciales parciales . Springer Science & Business Media. pág . 23. ISBN  978-3-540-71584-9.
  10. Ma, Jin; Yong, Jiongmin (2007). Ecuaciones diferenciales estocásticas hacia adelante y hacia atrás y sus aplicaciones . Lecture Notes in Mathematics. Vol. 1702. Springer Berlin, Heidelberg. doi : 10.1007/978-3-540-48831-6 . ISBN  978-3-540-65960-0.
  11. Kingma, Diederik; Ba, Jimmy (2014). "Adam: Un método para la optimización estocástica". arXiv : 1412.6980 [ cs.LG ].
  12. 1 2 3 4 5 6 Beck, C.; E, W.; Jentzen, A. (2019). "Algoritmos de aproximación de aprendizaje automático para ecuaciones diferenciales parciales totalmente no lineales de alta dimensión y ecuaciones diferenciales estocásticas regresivas de segundo orden". Journal of Nonlinear Science . 29 (4): 1563– 1619. arXiv : 1709.05963 . Bibcode : 2019JNS....29.1563B . doi : 10.1007/s00332-018-9525-3 .

Lecturas adicionales

  • Bishop, Christopher M.; Bishop, Hugh (2024). Aprendizaje profundo: fundamentos y conceptos . Springer. ISBN 978-3-031-45467-7.
  • Goodfellow, Ian ; Bengio, Yoshua ; Courville, Aaron (2016). Aprendizaje profundo . MIT Press. ISBN 978-0-26203561-3. Archivado del original el 16-04-2016 . Recuperado el 09-05-2021 , libro de texto introductorio.{{cite book}}: CS1 mantenimiento: postscript ( enlace )
  • Evans, Lawrence C. (2013). Una introducción a las ecuaciones diferenciales estocásticas. Sociedad Matemática Americana.
  • Higham, Desmond J. (enero de 2001). "Una introducción algorítmica a la simulación numérica de ecuaciones diferenciales estocásticas". SIAM Review . 43 (3): 525– 546. Bibcode : 2001SIAMR..43..525H . CiteSeerX 10.1.1.137.6375 . doi : 10.1137/S0036144500378302 . 
  • Desmond Higham y Peter Kloeden: "Introducción a la simulación numérica de ecuaciones diferenciales estocásticas", SIAM, ISBN 978-1-611976-42-7(2021).