Articulo de referencia

Función de pérdida

En la optimización matemática y la teoría de la decisión , una función de pérdida o función de costo (a veces también llamada función de error) [ 1 ] es una función que asigna u...

En la optimización matemática y la teoría de la decisión , una función de pérdida o función de costo (a veces también llamada función de error) [ 1 ] es una función que asigna un evento o valores de una o más variables a un número real que representa intuitivamente algún "costo" asociado con el evento. Un problema de optimización busca minimizar una función de pérdida. Una función objetivo es una función de pérdida o su opuesto (en dominios específicos, llamada de diversas maneras función de recompensa , función de beneficio , función de utilidad , función de aptitud , etc.), en cuyo caso debe maximizarse. La función de pérdida puede incluir términos de varios niveles de la jerarquía .

En estadística, normalmente se utiliza una función de pérdida para la estimación de parámetros , y el evento en cuestión es alguna función de la diferencia entre los valores estimados y verdaderos para una instancia de datos. El concepto, tan antiguo como Laplace , fue reintroducido en estadística por Abraham Wald a mediados del siglo XX. [ 2 ] En el contexto de la economía , por ejemplo, esto suele ser el costo económico o el arrepentimiento . En clasificación , es la penalización por una clasificación incorrecta de un ejemplo. En ciencia actuarial , se utiliza en un contexto de seguros para modelar los beneficios pagados sobre las primas, particularmente desde los trabajos de Harald Cramér en la década de 1920. [ 3 ] En control óptimo , la pérdida es la penalización por no alcanzar un valor deseado. En gestión de riesgos financieros , la función se asigna a una pérdida monetaria.

Comparación de funciones de pérdida comunes ( MAE , SMAE, pérdida de Huber y pérdida log-cosh) utilizadas para la regresión.

Ejemplos

Arrepentirse

Leonard J. Savage argumentó que, al utilizar métodos no bayesianos como el minimax , la función de pérdida debería basarse en la idea del arrepentimiento , es decir, la pérdida asociada a una decisión debería ser la diferencia entre las consecuencias de la mejor decisión que se podría haber tomado en circunstancias conocidas y la decisión que se tomó de hecho antes de que se conocieran.

Función de pérdida cuadrática

El uso de una función de pérdida cuadrática es común, por ejemplo, al utilizar técnicas de mínimos cuadrados . A menudo es más manejable matemáticamente que otras funciones de pérdida debido a las propiedades de las varianzas , además de ser simétrica: un error por encima del objetivo causa la misma pérdida que un error de la misma magnitud por debajo del objetivo. Si el objetivo est{\displaystyle t}, entonces una función de pérdida cuadrática es

λ(incógnita)=do(tincógnita)2{\displaystyle \lambda (x)=C(tx)^{2}\;}

por alguna constantedo{\displaystyle C}El valor de la constante no influye en la decisión y puede ignorarse estableciéndola igual a 1. Esto también se conoce como pérdida de error cuadrático ( SEL ). [ 1 ]

Muchas estadísticas comunes , incluidas las pruebas t , los modelos de regresión , el diseño de experimentos y muchas otras, utilizan métodos de mínimos cuadrados aplicados mediante la teoría de la regresión lineal , que se basa en la función de pérdida cuadrática.

La función de pérdida cuadrática también se utiliza en problemas de control óptimo lineal-cuadrático . En estos problemas, incluso en ausencia de incertidumbre, puede que no sea posible alcanzar los valores deseados de todas las variables objetivo. A menudo, la pérdida se expresa como una forma cuadrática en términos de las desviaciones de las variables de interés respecto a sus valores deseados; este enfoque es manejable porque resulta en condiciones lineales de primer orden . En el contexto del control estocástico , se utiliza el valor esperado de la forma cuadrática. La pérdida cuadrática otorga mayor importancia a los valores atípicos que a los datos reales debido a su naturaleza cuadrada, por lo que se utilizan alternativas como las pérdidas de Huber , log-cosh y SMAE cuando los datos presentan muchos valores atípicos grandes.

Efecto del uso de diferentes funciones de pérdida cuando los datos contienen valores atípicos.

función de pérdida 0-1

En estadística y teoría de la decisión , una función de pérdida de uso frecuente es la función de pérdida 0-1.

L(y^,y)={0si y=y^1si yy^{\displaystyle L({\hat {y}},y)={\begin{cases}0&{\text{si }}y={\hat {y}}\\1&{\text{si }}y\neq {\hat {y}}\end{cases}}}

En teoría de la información , esta función de pérdida se conoce como distorsión de Hamming .

Construcción de funciones de pérdida y objetivo.

En muchas aplicaciones, las funciones objetivo, incluidas las funciones de pérdida como caso particular, están determinadas por la formulación del problema. En otras situaciones, la preferencia del responsable de la toma de decisiones debe ser obtenida y representada por una función escalar (también llamada función de utilidad ) en una forma adecuada para la optimización, el problema que Ragnar Frisch destacó en su discurso de aceptación del Premio Nobel . [ 4 ] Los métodos existentes para construir funciones objetivo se recogen en las actas de dos conferencias especializadas. [ 5 ] [ 6 ] En particular, Andranik Tangian demostró que las funciones objetivo más útiles —cuadráticas y aditivas— están determinadas por unos pocos puntos de indiferencia . Utilizó esta propiedad en los modelos para construir estas funciones objetivo a partir de datos ordinales o cardinales obtenidos mediante entrevistas asistidas por ordenador con responsables de la toma de decisiones. [ 7 ] [ 8 ] Entre otras cosas, construyó funciones objetivo para distribuir de forma óptima los presupuestos de 16 universidades de Westfalia [ 9 ] y las subvenciones europeas para igualar las tasas de desempleo entre 271 regiones alemanas. [ 10 ]

Pérdida esperada

En algunos contextos, el valor de la función de pérdida en sí misma es una cantidad aleatoria porque depende del resultado de una variable aleatoria.incógnita{\displaystyle X}.

Estadística

Tanto la teoría estadística frecuentista como la bayesiana implican tomar una decisión basada en el valor esperado de la función de pérdida; sin embargo, esta cantidad se define de manera diferente en ambos paradigmas.

pérdida esperada frecuentista

Primero definimos la pérdida esperada en el contexto frecuentista. Se obtiene tomando el valor esperado con respecto a la distribución de probabilidad ,PAGθ{\displaystyle P_{\theta }}, de los datos observados,incógnita{\displaystyle X}Esto también se conoce como la función de riesgo [ 11 ] [ 12 ] [ 13 ] [ 14 ] de la regla de decisión .δ{\displaystyle \delta }y el parámetroθ{\displaystyle \theta }Aquí la regla de decisión depende del resultado deincógnita{\displaystyle X}La función de riesgo viene dada por:

R(θ,δ)=miθL(θ,δ(incógnita))=incógnitaL(θ,δ(incógnita))dPAGθ(incógnita).{\displaystyle R(\theta ,\delta )=\operatorname {E} _{\theta }L{\big (}\theta ,\delta (X){\big )}=\int _{X}L{\big (}\theta ,\delta (x){\big )}\,\mathrm {d} P_{\theta }(x).}

Aquí,θ{\displaystyle \theta }es un estado de la naturaleza fijo pero posiblemente desconocido,incógnita{\displaystyle X}es un vector de observaciones extraídas estocásticamente de una población ,miθ{\displaystyle \operatorname {E} _{\theta }}es la esperanza sobre todos los valores de la población deincógnita{\displaystyle X},dPAGθ{\displaystyle \mathrm {d} P_{\theta }}es una medida de probabilidad sobre el espacio de eventos deincógnita{\displaystyle X}(parametrizado porθ{\displaystyle \theta }) y la integral se evalúa sobre todo el soporte deincógnita{\displaystyle X}.

Riesgo de Bayes

En un enfoque bayesiano, la esperanza se calcula utilizando la distribución previa.π{\displaystyle \pi ^{*}}del parámetroθ{\displaystyle \theta }:

ρ(π,a)=ΘincógnitaL(θ,a(incógnita))dPAG(incógnita|θ)dπ(θ)=incógnitaΘL(θ,a(incógnita))dπ(θ|incógnita)dMETRO(incógnita){\displaystyle \rho (\pi ^{*},a)=\int _{\Theta }\int _{\mathbf {X}}L(\theta ,a({\mathbf {x}}))\,\mathrm {d} P({\mathbf {x}}\vert \theta )\,\mathrm {d} \pi ^{*}(\theta )=\int _{\mathbf {X}}\int _{\Theta }L(\theta ,a({\mathbf {x}}))\,\mathrm {d} \pi ^{*}(\theta \vert {\mathbf {x}})\,\mathrm {d} M({\mathbf {x}})}

dóndeMETRO(incógnita){\displaystyle M(\mathbf {x} )}se conoce como probabilidad predictiva en la queθ{\displaystyle \theta }ha sido "integrado fuera",π(θ|incógnita){\displaystyle \pi ^{*}(\theta |\mathbf {x} )}es la distribución posterior, y el orden de integración ha cambiado. Entonces se debe elegir la accióna{\displaystyle a^{*}}que minimiza esta pérdida esperada, que se conoce como riesgo de Bayes . En la última ecuación, el integrando dentrodincógnita{\displaystyle \mathrm {d} x}se conoce como el riesgo posterior , y minimizarlo con respecto a la decisióna{\displaystyle a}también minimiza el riesgo bayesiano general. Esta decisión óptima,a{\displaystyle a^{*}}Se conoce como la regla de Bayes (de decisión) : minimiza la pérdida promedio sobre todos los posibles estados de la naturaleza.θ{\displaystyle \theta }, sobre todos los posibles resultados de datos (ponderados por probabilidad). Una ventaja del enfoque bayesiano es que solo se necesita elegir la acción óptima bajo los datos observados reales para obtener una acción uniformemente óptima, mientras que elegir la regla de decisión óptima frecuentista real como una función de todas las observaciones posibles es un problema mucho más difícil. Sin embargo, de igual importancia, la regla de Bayes refleja la consideración de los resultados de pérdida bajo diferentes estados de la naturaleza,θ{\displaystyle \theta }.

Ejemplos en estadística

Elección económica en condiciones de incertidumbre

En economía, la toma de decisiones en condiciones de incertidumbre se suele modelar mediante la función de utilidad de von Neumann-Morgenstern de la variable incierta de interés, como la riqueza al final del período. Dado que el valor de esta variable es incierto, también lo es el valor de la función de utilidad; lo que se maximiza es el valor esperado de la utilidad.

Reglas de decisión

Una regla de decisión toma una decisión utilizando un criterio de optimalidad. Algunos criterios comúnmente utilizados son:

  • Minimax : Elija la regla de decisión con la menor pérdida en el peor de los casos; es decir, minimice la pérdida en el peor de los casos (máxima posible):argramometroinorteδ máximoθΘ R(θ,δ).{\displaystyle {\underset {\delta }{\operatorname {arg\,min} }}\ \max _{\theta \in \Theta }\ R(\theta ,\delta ).}
  • Invariancia : Elija la regla de decisión que satisfaga un requisito de invariancia.
  • Elija la regla de decisión con la menor pérdida promedio (es decir, minimice el valor esperado de la función de pérdida):argramometroinorteδmiθΘ[R(θ,δ)]=argramometroinorteδ θΘR(θ,δ)pag(θ)dθ.{\displaystyle {\underset {\delta }{\operatorname {arg\,min} }}\operatorname {E} _{\theta \in \Theta }[R(\theta ,\delta )]={\underset {\delta }{\operatorname {arg\,min} }}\ \int _{\theta \in \Theta }R(\theta ,\delta )\,p(\theta )\,d\theta .}

Selección de una función de pérdida

Una buena práctica estadística exige seleccionar un estimador coherente con la variación aceptable real experimentada en el contexto de un problema aplicado particular. Por lo tanto, en el uso aplicado de funciones de pérdida, la selección del método estadístico a utilizar para modelar un problema aplicado depende de conocer las pérdidas que se experimentarán al equivocarse en las circunstancias particulares del problema. [ 15 ]

Un ejemplo común consiste en estimar la " ubicación ". Bajo supuestos estadísticos típicos, la media o promedio es el estadístico que minimiza la pérdida esperada según la función de pérdida de error cuadrático , mientras que la mediana es el estimador que minimiza la pérdida esperada según la función de pérdida de diferencia absoluta. Sin embargo, en otras circunstancias menos comunes, otros estimadores serían óptimos.

En economía, cuando un agente es neutral al riesgo , la función objetivo se expresa simplemente como el valor esperado de una cantidad monetaria, como la ganancia, el ingreso o la riqueza al final del período. Para los agentes aversos o propensos al riesgo , la pérdida se mide como el negativo de una función de utilidad , y la función objetivo a optimizar es el valor esperado de la utilidad.

Son posibles otras medidas de coste, por ejemplo la mortalidad o la morbilidad en el ámbito de la salud pública o la ingeniería de seguridad .

Para la mayoría de los algoritmos de optimización , es deseable tener una función de pérdida que sea globalmente continua y diferenciable .

Dos funciones de pérdida muy utilizadas son la pérdida al cuadrado ,L(a)=a2{\displaystyle L(a)=a^{2}}y la pérdida absoluta ,L(a)=|a|{\displaystyle L(a)=|a|}Sin embargo, la pérdida absoluta tiene la desventaja de que no es diferenciable ena=0{\displaystyle a=0}. La pérdida al cuadrado tiene la desventaja de que tiende a estar dominada por valores atípicos —cuando se suma sobre un conjunto dea{\displaystyle a}de (como eni=1norteL(ai){\textstyle \sum _{i=1}^{n}L(a_{i})}), la suma final tiende a ser el resultado de unos pocos particularmente grandesa{\displaystyle a}valores -, en lugar de una expresión del promedioa{\displaystyle a}-valor.

La elección de una función de pérdida no es arbitraria. Es muy restrictiva y, en ocasiones, la función de pérdida puede caracterizarse por sus propiedades deseables. [ 16 ] Entre los principios de elección se encuentran, por ejemplo, el requisito de completitud de la clase de estadísticas simétricas en el caso de observaciones i.i.d. , el principio de información completa y algunos otros.

W. Edwards Deming y Nassim Nicholas Taleb argumentan que la realidad empírica, y no las propiedades matemáticas agradables, debería ser la única base para seleccionar las funciones de pérdida, y que las pérdidas reales a menudo no son matemáticamente agradables ni diferenciables, continuas, simétricas, etc. Por ejemplo, una persona que llega antes del cierre de la puerta de embarque de un avión aún puede abordar, pero una persona que llega después no puede, una discontinuidad y asimetría que hace que llegar un poco tarde sea mucho más costoso que llegar un poco antes. En la dosificación de medicamentos, el costo de una dosis insuficiente puede ser la falta de eficacia, mientras que el costo de una dosis excesiva puede ser una toxicidad tolerable, otro ejemplo de asimetría. El tráfico, las tuberías, las vigas, los ecosistemas, los climas, etc., pueden tolerar un aumento de la carga o el estrés con pocos cambios perceptibles hasta cierto punto, para luego colapsar o romperse catastróficamente. Estas situaciones, argumentan Deming y Taleb, son comunes en problemas de la vida real, quizás más comunes que los casos clásicos de diferenciales suaves, continuas y simétricas. [ 17 ]

Véase también

Referencias

  1. 1 2 Hastie, Trevor; Tibshirani, Robert ; Friedman, Jerome H. (2001). Los elementos del aprendizaje estadístico . Springer. pág.  18. ISBN 0-387-95284-5.
  2. Wald, A. (1950). Funciones de decisión estadística . Wiley vía APA Psycnet.
  3. Cramér, H. (1930). Sobre la teoría matemática del riesgo . Centraltryckeriet.
  4. Frisch, Ragnar (1969). «De la teoría utópica a las aplicaciones prácticas: el caso de la econometría». Conferencia de entrega del Premio Nobel . Consultado el 15 de febrero de 2021 .
  5. Tangian, Andranik; Gruber, Josef (1997). Construcción de funciones objetivo escalares. Actas de la Tercera Conferencia Internacional sobre Modelos de Decisión Econométrica: Construcción de funciones objetivo escalares, Universidad de Hagen, celebrada en la Katholische Akademie Schwerte del 5 al 8 de septiembre de 1995. Lecture Notes in Economics and Mathematical Systems. Vol. 453. Berlín: Springer. doi : 10.1007/978-3-642-48773-6 . ISBN  978-3-540-63061-6.
  6. Tangian, Andranik; Gruber, Josef (2002). Construcción y aplicación de funciones objetivo. Actas de la Cuarta Conferencia Internacional sobre Modelos de Decisión Econométrica: Construcción y aplicación de funciones objetivo, Universidad de Hagen, celebrada en Haus Nordhelle, del 28 al 31 de agosto de 2000. Lecture Notes in Economics and Mathematical Systems. Vol. 510. Berlín: Springer. doi : 10.1007/978-3-642-56038-5 . ISBN  978-3-540-42669-1.
  7. Tangian, Andranik (2002). "Construcción de una función objetivo cuadrática cuasi-cóncava a partir de entrevistas a un responsable de la toma de decisiones". European Journal of Operational Research . 141 (3): 608– 640. doi : 10.1016/S0377-2217(01)00185-0 . S2CID 39623350 . 
  8. Tangian, Andranik (2004). "Un modelo para la construcción ordinal de funciones objetivo aditivas". European Journal of Operational Research . 159 (2): 476– 512. doi : 10.1016/S0377-2217(03)00413-2 . S2CID 31019036 . 
  9. Tangian, Andranik (2004). "Redistribución de los presupuestos universitarios con respecto al statu quo". European Journal of Operational Research . 157 (2): 409– 428. doi : 10.1016/S0377-2217(03)00271-6 .
  10. Tangian, Andranik (2008). "Optimización multicriterio de la política regional de empleo: un análisis de simulación para Alemania" . Revista de Desarrollo Urbano y Regional . 20 (2): 103– 122. doi : 10.1111/j.1467-940X.2008.00144.x .
  11. Nikulin, MS (2001) [1994], "Riesgo de un procedimiento estadístico" , Enciclopedia de Matemáticas , EMS Press
  12. Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª ed.). Nueva York: Springer-Verlag. Bibcode : 1985sdtb.book.....B . ISBN  978-0-387-96098-2MR 0804611 . 
  13. DeGroot, Morris (2004) [1970]. Decisiones estadísticas óptimas . Wiley Classics Library. ISBN 978-0-471-68029-1MR 2288194 .​ 
  14. Robert, Christian P. (2007). La elección bayesiana . Textos de Springer en estadística (2.ª ed.). Nueva York: Springer. doi : 10.1007/0-387-71599-1 . ISBN  978-0-387-95231-4. SR 1835885 . 
  15. ^ Pfanzagl, J. (1994). Teoría estadística paramétrica . Berlín: Walter de Gruyter. ISBN 978-3-11-013863-4.
  16. En el capítulo 2 del libro Klebanov, B.; Rachev, Svetlozat T.; Fabozzi, Frank J. (2009). Robust and Non-Robust Models in Statistics . Nueva York: Nova Scientific Publishers, Inc. se ofrece información detallada sobre los principios matemáticos de la elección de la función de pérdida.(y referencias allí).
  17. Deming, W. Edwards (2000). Fuera de la crisis . The MIT Press. ISBN 9780262541152.

Lecturas adicionales

  • Aretz, Kevin; Bartram, Söhnke M.; Pope, Peter F. (abril-junio de 2011). "Funciones de pérdida asimétricas y la racionalidad de los rendimientos esperados de las acciones" (PDF) . International Journal of Forecasting . 27 (2): 413– 437. doi : 10.1016/j.ijforecast.2009.10.008 . SSRN 889323 . 
  • Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª  ed.). Nueva York: Springer-Verlag. Bibcode : 1985sdtb.book.....B . ISBN 978-0-387-96098-2MR 0804611 . 
  • Cecchetti, S. (2000). "Elaboración de la política monetaria: objetivos y reglas" . Oxford Review of Economic Policy . 16 (4): 43– 59. doi : 10.1093/oxrep/16.4.43 .
  • Horowitz, Ann R. (1987). "Funciones de pérdida y política pública". Journal of Macroeconomics . 9 (4): 489– 504. doi : 10.1016/0164-0704(87)90016-4 .
  • Waud, Roger N. (1976). "Funciones de utilidad asimétricas para los responsables políticos y política óptima bajo incertidumbre". Econometrica . 44 (1): 53– 66. doi : 10.2307/1911380 . JSTOR 1911380 .