En la optimización matemática y la teoría de la decisión , una función de pérdida o función de costo (a veces también llamada función de error) [ 1 ] es una función que asigna un evento o valores de una o más variables a un número real que representa intuitivamente algún "costo" asociado con el evento. Un problema de optimización busca minimizar una función de pérdida. Una función objetivo es una función de pérdida o su opuesto (en dominios específicos, llamada de diversas maneras función de recompensa , función de beneficio , función de utilidad , función de aptitud , etc.), en cuyo caso debe maximizarse. La función de pérdida puede incluir términos de varios niveles de la jerarquía .
En estadística, normalmente se utiliza una función de pérdida para la estimación de parámetros , y el evento en cuestión es alguna función de la diferencia entre los valores estimados y verdaderos para una instancia de datos. El concepto, tan antiguo como Laplace , fue reintroducido en estadística por Abraham Wald a mediados del siglo XX. [ 2 ] En el contexto de la economía , por ejemplo, esto suele ser el costo económico o el arrepentimiento . En clasificación , es la penalización por una clasificación incorrecta de un ejemplo. En ciencia actuarial , se utiliza en un contexto de seguros para modelar los beneficios pagados sobre las primas, particularmente desde los trabajos de Harald Cramér en la década de 1920. [ 3 ] En control óptimo , la pérdida es la penalización por no alcanzar un valor deseado. En gestión de riesgos financieros , la función se asigna a una pérdida monetaria.

Ejemplos
Arrepentirse
Leonard J. Savage argumentó que, al utilizar métodos no bayesianos como el minimax , la función de pérdida debería basarse en la idea del arrepentimiento , es decir, la pérdida asociada a una decisión debería ser la diferencia entre las consecuencias de la mejor decisión que se podría haber tomado en circunstancias conocidas y la decisión que se tomó de hecho antes de que se conocieran.
Función de pérdida cuadrática
El uso de una función de pérdida cuadrática es común, por ejemplo, al utilizar técnicas de mínimos cuadrados . A menudo es más manejable matemáticamente que otras funciones de pérdida debido a las propiedades de las varianzas , además de ser simétrica: un error por encima del objetivo causa la misma pérdida que un error de la misma magnitud por debajo del objetivo. Si el objetivo es, entonces una función de pérdida cuadrática es
por alguna constanteEl valor de la constante no influye en la decisión y puede ignorarse estableciéndola igual a 1. Esto también se conoce como pérdida de error cuadrático ( SEL ). [ 1 ]
Muchas estadísticas comunes , incluidas las pruebas t , los modelos de regresión , el diseño de experimentos y muchas otras, utilizan métodos de mínimos cuadrados aplicados mediante la teoría de la regresión lineal , que se basa en la función de pérdida cuadrática.
La función de pérdida cuadrática también se utiliza en problemas de control óptimo lineal-cuadrático . En estos problemas, incluso en ausencia de incertidumbre, puede que no sea posible alcanzar los valores deseados de todas las variables objetivo. A menudo, la pérdida se expresa como una forma cuadrática en términos de las desviaciones de las variables de interés respecto a sus valores deseados; este enfoque es manejable porque resulta en condiciones lineales de primer orden . En el contexto del control estocástico , se utiliza el valor esperado de la forma cuadrática. La pérdida cuadrática otorga mayor importancia a los valores atípicos que a los datos reales debido a su naturaleza cuadrada, por lo que se utilizan alternativas como las pérdidas de Huber , log-cosh y SMAE cuando los datos presentan muchos valores atípicos grandes.

función de pérdida 0-1
En estadística y teoría de la decisión , una función de pérdida de uso frecuente es la función de pérdida 0-1.
En teoría de la información , esta función de pérdida se conoce como distorsión de Hamming .
Construcción de funciones de pérdida y objetivo.
En muchas aplicaciones, las funciones objetivo, incluidas las funciones de pérdida como caso particular, están determinadas por la formulación del problema. En otras situaciones, la preferencia del responsable de la toma de decisiones debe ser obtenida y representada por una función escalar (también llamada función de utilidad ) en una forma adecuada para la optimización, el problema que Ragnar Frisch destacó en su discurso de aceptación del Premio Nobel . [ 4 ] Los métodos existentes para construir funciones objetivo se recogen en las actas de dos conferencias especializadas. [ 5 ] [ 6 ] En particular, Andranik Tangian demostró que las funciones objetivo más útiles —cuadráticas y aditivas— están determinadas por unos pocos puntos de indiferencia . Utilizó esta propiedad en los modelos para construir estas funciones objetivo a partir de datos ordinales o cardinales obtenidos mediante entrevistas asistidas por ordenador con responsables de la toma de decisiones. [ 7 ] [ 8 ] Entre otras cosas, construyó funciones objetivo para distribuir de forma óptima los presupuestos de 16 universidades de Westfalia [ 9 ] y las subvenciones europeas para igualar las tasas de desempleo entre 271 regiones alemanas. [ 10 ]
Pérdida esperada
En algunos contextos, el valor de la función de pérdida en sí misma es una cantidad aleatoria porque depende del resultado de una variable aleatoria..
Estadística
Tanto la teoría estadística frecuentista como la bayesiana implican tomar una decisión basada en el valor esperado de la función de pérdida; sin embargo, esta cantidad se define de manera diferente en ambos paradigmas.
pérdida esperada frecuentista
Primero definimos la pérdida esperada en el contexto frecuentista. Se obtiene tomando el valor esperado con respecto a la distribución de probabilidad ,, de los datos observados,Esto también se conoce como la función de riesgo [ 11 ] [ 12 ] [ 13 ] [ 14 ] de la regla de decisión .y el parámetroAquí la regla de decisión depende del resultado deLa función de riesgo viene dada por:
Aquí,es un estado de la naturaleza fijo pero posiblemente desconocido,es un vector de observaciones extraídas estocásticamente de una población ,es la esperanza sobre todos los valores de la población de,es una medida de probabilidad sobre el espacio de eventos de(parametrizado por) y la integral se evalúa sobre todo el soporte de.
Riesgo de Bayes
En un enfoque bayesiano, la esperanza se calcula utilizando la distribución previa.del parámetro:
dóndese conoce como probabilidad predictiva en la queha sido "integrado fuera",es la distribución posterior, y el orden de integración ha cambiado. Entonces se debe elegir la acciónque minimiza esta pérdida esperada, que se conoce como riesgo de Bayes . En la última ecuación, el integrando dentrose conoce como el riesgo posterior , y minimizarlo con respecto a la decisióntambién minimiza el riesgo bayesiano general. Esta decisión óptima,Se conoce como la regla de Bayes (de decisión) : minimiza la pérdida promedio sobre todos los posibles estados de la naturaleza., sobre todos los posibles resultados de datos (ponderados por probabilidad). Una ventaja del enfoque bayesiano es que solo se necesita elegir la acción óptima bajo los datos observados reales para obtener una acción uniformemente óptima, mientras que elegir la regla de decisión óptima frecuentista real como una función de todas las observaciones posibles es un problema mucho más difícil. Sin embargo, de igual importancia, la regla de Bayes refleja la consideración de los resultados de pérdida bajo diferentes estados de la naturaleza,.
Ejemplos en estadística
- Para un parámetro escalar, una función de decisión cuya salidaes una estimación dey una función de pérdida cuadrática ( pérdida de error al cuadrado )la función de riesgo se convierte en el error cuadrático medio de la estimación,Un estimador que se encuentra al minimizar el error cuadrático medio estima la media de la distribución posterior .
- En la estimación de densidad , el parámetro desconocido es la propia densidad de probabilidad . La función de pérdida se elige típicamente como una norma en un espacio de funciones apropiado . Por ejemplo, paranorma ,La función de riesgo se convierte en el error cuadrático medio integrado.
Elección económica en condiciones de incertidumbre
En economía, la toma de decisiones en condiciones de incertidumbre se suele modelar mediante la función de utilidad de von Neumann-Morgenstern de la variable incierta de interés, como la riqueza al final del período. Dado que el valor de esta variable es incierto, también lo es el valor de la función de utilidad; lo que se maximiza es el valor esperado de la utilidad.
Reglas de decisión
Una regla de decisión toma una decisión utilizando un criterio de optimalidad. Algunos criterios comúnmente utilizados son:
- Minimax : Elija la regla de decisión con la menor pérdida en el peor de los casos; es decir, minimice la pérdida en el peor de los casos (máxima posible):
- Invariancia : Elija la regla de decisión que satisfaga un requisito de invariancia.
- Elija la regla de decisión con la menor pérdida promedio (es decir, minimice el valor esperado de la función de pérdida):
Selección de una función de pérdida
Una buena práctica estadística exige seleccionar un estimador coherente con la variación aceptable real experimentada en el contexto de un problema aplicado particular. Por lo tanto, en el uso aplicado de funciones de pérdida, la selección del método estadístico a utilizar para modelar un problema aplicado depende de conocer las pérdidas que se experimentarán al equivocarse en las circunstancias particulares del problema. [ 15 ]
Un ejemplo común consiste en estimar la " ubicación ". Bajo supuestos estadísticos típicos, la media o promedio es el estadístico que minimiza la pérdida esperada según la función de pérdida de error cuadrático , mientras que la mediana es el estimador que minimiza la pérdida esperada según la función de pérdida de diferencia absoluta. Sin embargo, en otras circunstancias menos comunes, otros estimadores serían óptimos.
En economía, cuando un agente es neutral al riesgo , la función objetivo se expresa simplemente como el valor esperado de una cantidad monetaria, como la ganancia, el ingreso o la riqueza al final del período. Para los agentes aversos o propensos al riesgo , la pérdida se mide como el negativo de una función de utilidad , y la función objetivo a optimizar es el valor esperado de la utilidad.
Son posibles otras medidas de coste, por ejemplo la mortalidad o la morbilidad en el ámbito de la salud pública o la ingeniería de seguridad .
Para la mayoría de los algoritmos de optimización , es deseable tener una función de pérdida que sea globalmente continua y diferenciable .
Dos funciones de pérdida muy utilizadas son la pérdida al cuadrado ,y la pérdida absoluta ,Sin embargo, la pérdida absoluta tiene la desventaja de que no es diferenciable en. La pérdida al cuadrado tiene la desventaja de que tiende a estar dominada por valores atípicos —cuando se suma sobre un conjunto dede (como en), la suma final tiende a ser el resultado de unos pocos particularmente grandesvalores -, en lugar de una expresión del promedio-valor.
La elección de una función de pérdida no es arbitraria. Es muy restrictiva y, en ocasiones, la función de pérdida puede caracterizarse por sus propiedades deseables. [ 16 ] Entre los principios de elección se encuentran, por ejemplo, el requisito de completitud de la clase de estadísticas simétricas en el caso de observaciones i.i.d. , el principio de información completa y algunos otros.
W. Edwards Deming y Nassim Nicholas Taleb argumentan que la realidad empírica, y no las propiedades matemáticas agradables, debería ser la única base para seleccionar las funciones de pérdida, y que las pérdidas reales a menudo no son matemáticamente agradables ni diferenciables, continuas, simétricas, etc. Por ejemplo, una persona que llega antes del cierre de la puerta de embarque de un avión aún puede abordar, pero una persona que llega después no puede, una discontinuidad y asimetría que hace que llegar un poco tarde sea mucho más costoso que llegar un poco antes. En la dosificación de medicamentos, el costo de una dosis insuficiente puede ser la falta de eficacia, mientras que el costo de una dosis excesiva puede ser una toxicidad tolerable, otro ejemplo de asimetría. El tráfico, las tuberías, las vigas, los ecosistemas, los climas, etc., pueden tolerar un aumento de la carga o el estrés con pocos cambios perceptibles hasta cierto punto, para luego colapsar o romperse catastróficamente. Estas situaciones, argumentan Deming y Taleb, son comunes en problemas de la vida real, quizás más comunes que los casos clásicos de diferenciales suaves, continuas y simétricas. [ 17 ]
Véase también
Referencias
- 1 2 Hastie, Trevor; Tibshirani, Robert ; Friedman, Jerome H. (2001). Los elementos del aprendizaje estadístico . Springer. pág. 18. ISBN 0-387-95284-5.
- ↑ Wald, A. (1950). Funciones de decisión estadística . Wiley – vía APA Psycnet.
- ↑ Cramér, H. (1930). Sobre la teoría matemática del riesgo . Centraltryckeriet.
- ↑ Frisch, Ragnar (1969). «De la teoría utópica a las aplicaciones prácticas: el caso de la econometría». Conferencia de entrega del Premio Nobel . Consultado el 15 de febrero de 2021 .
- ↑ Tangian, Andranik; Gruber, Josef (1997). Construcción de funciones objetivo escalares. Actas de la Tercera Conferencia Internacional sobre Modelos de Decisión Econométrica: Construcción de funciones objetivo escalares, Universidad de Hagen, celebrada en la Katholische Akademie Schwerte del 5 al 8 de septiembre de 1995. Lecture Notes in Economics and Mathematical Systems. Vol. 453. Berlín: Springer. doi : 10.1007/978-3-642-48773-6 . ISBN 978-3-540-63061-6.
- ↑ Tangian, Andranik; Gruber, Josef (2002). Construcción y aplicación de funciones objetivo. Actas de la Cuarta Conferencia Internacional sobre Modelos de Decisión Econométrica: Construcción y aplicación de funciones objetivo, Universidad de Hagen, celebrada en Haus Nordhelle, del 28 al 31 de agosto de 2000. Lecture Notes in Economics and Mathematical Systems. Vol. 510. Berlín: Springer. doi : 10.1007/978-3-642-56038-5 . ISBN 978-3-540-42669-1.
- ↑ Tangian, Andranik (2002). "Construcción de una función objetivo cuadrática cuasi-cóncava a partir de entrevistas a un responsable de la toma de decisiones". European Journal of Operational Research . 141 (3): 608– 640. doi : 10.1016/S0377-2217(01)00185-0 . S2CID 39623350 .
- ↑ Tangian, Andranik (2004). "Un modelo para la construcción ordinal de funciones objetivo aditivas". European Journal of Operational Research . 159 (2): 476– 512. doi : 10.1016/S0377-2217(03)00413-2 . S2CID 31019036 .
- ↑ Tangian, Andranik (2004). "Redistribución de los presupuestos universitarios con respecto al statu quo". European Journal of Operational Research . 157 (2): 409– 428. doi : 10.1016/S0377-2217(03)00271-6 .
- ↑ Tangian, Andranik (2008). "Optimización multicriterio de la política regional de empleo: un análisis de simulación para Alemania" . Revista de Desarrollo Urbano y Regional . 20 (2): 103– 122. doi : 10.1111/j.1467-940X.2008.00144.x .
- ↑ Nikulin, MS (2001) [1994], "Riesgo de un procedimiento estadístico" , Enciclopedia de Matemáticas , EMS Press
- ↑ Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª ed.). Nueva York: Springer-Verlag. Bibcode : 1985sdtb.book.....B . ISBN 978-0-387-96098-2MR 0804611 .
- ↑ DeGroot, Morris (2004) [1970]. Decisiones estadísticas óptimas . Wiley Classics Library. ISBN 978-0-471-68029-1MR 2288194 .
- ↑ Robert, Christian P. (2007). La elección bayesiana . Textos de Springer en estadística (2.ª ed.). Nueva York: Springer. doi : 10.1007/0-387-71599-1 . ISBN 978-0-387-95231-4. SR 1835885 .
- ^ Pfanzagl, J. (1994). Teoría estadística paramétrica . Berlín: Walter de Gruyter. ISBN 978-3-11-013863-4.
- ↑ En el capítulo 2 del libro Klebanov, B.; Rachev, Svetlozat T.; Fabozzi, Frank J. (2009). Robust and Non-Robust Models in Statistics . Nueva York: Nova Scientific Publishers, Inc. se ofrece información detallada sobre los principios matemáticos de la elección de la función de pérdida.(y referencias allí).
- ↑ Deming, W. Edwards (2000). Fuera de la crisis . The MIT Press. ISBN 9780262541152.
Lecturas adicionales
- Aretz, Kevin; Bartram, Söhnke M.; Pope, Peter F. (abril-junio de 2011). "Funciones de pérdida asimétricas y la racionalidad de los rendimientos esperados de las acciones" (PDF) . International Journal of Forecasting . 27 (2): 413– 437. doi : 10.1016/j.ijforecast.2009.10.008 . SSRN 889323 .
- Berger, James O. (1985). Teoría estadística de la decisión y análisis bayesiano (2.ª ed.). Nueva York: Springer-Verlag. Bibcode : 1985sdtb.book.....B . ISBN 978-0-387-96098-2MR 0804611 .
- Cecchetti, S. (2000). "Elaboración de la política monetaria: objetivos y reglas" . Oxford Review of Economic Policy . 16 (4): 43– 59. doi : 10.1093/oxrep/16.4.43 .
- Horowitz, Ann R. (1987). "Funciones de pérdida y política pública". Journal of Macroeconomics . 9 (4): 489– 504. doi : 10.1016/0164-0704(87)90016-4 .
- Decisiones óptimas
- Funciones de pérdida