Articulo de referencia

Desviaciones absolutas mínimas

Las desviaciones absolutas mínimas ( LAD ), también conocidas como errores absolutos mínimos ( LAE ), residuos absolutos mínimos ( LAR ) o valores absolutos mínimos ( LAV ), son...

Las desviaciones absolutas mínimas ( LAD ), también conocidas como errores absolutos mínimos ( LAE ), residuos absolutos mínimos ( LAR ) o valores absolutos mínimos ( LAV ), son un criterio de optimalidad estadística y una técnica de optimización estadística basada en minimizar la suma de las desviaciones absolutas (también suma de los residuos absolutos o suma de los errores absolutos ) o la norma L1 de dichos valores. Es análoga a la técnica de mínimos cuadrados , excepto que se basa en valores absolutos en lugar de valores al cuadrado . Intenta encontrar una función que se aproxime lo más posible a un conjunto de datos minimizando los residuos entre los puntos generados por la función y los puntos de datos correspondientes. La estimación LAD también surge como la estimación de máxima verosimilitud si los errores tienen una distribución de Laplace . Fue introducida en 1757 por Roger Joseph Boscovich . [ 1 ]

Formulación

Supongamos que el conjunto de datos consta de los puntos ( x i , y i ) con i = 1, 2, ..., n . Queremos encontrar una función f tal queF(incógnitai)yi.{\displaystyle f(x_{i})\approx y_{i}.}

Para alcanzar este objetivo, suponemos que la función f tiene una forma particular que contiene algunos parámetros que deben determinarse. Por ejemplo, la forma más simple sería lineal: f ( x ) = bx + c , donde b y c son parámetros cuyos valores se desconocen pero que deseamos estimar. De forma menos sencilla, supongamos que f ( x ) es cuadrática , es decir, f ( x ) = ax² + bx + c , donde a , b y c aún se desconocen. (En términos más generales, podría haber no solo un explicativo x , sino varios, todos ellos argumentos de la función f ).

Ahora buscamos valores estimados de los parámetros desconocidos que minimicen la suma de los valores absolutos de los residuos:

S=i=1norte|yiF(incógnitai)|.{\displaystyle S=\sum _{i=1}^{n}|y_{i}-f(x_{i})|.}

Solución

Si bien la regresión por mínimos desvíos absolutos es tan sencilla como la regresión por mínimos cuadrados, la recta de mínimos desvíos absolutos no es tan fácil de calcular de manera eficiente. A diferencia de la regresión por mínimos cuadrados, la regresión por mínimos desvíos absolutos no cuenta con un método de resolución analítico. Por lo tanto, se requiere un enfoque iterativo. A continuación, se enumeran algunos métodos de resolución de mínimos desvíos absolutos.

Los métodos basados ​​en el método Simplex son la forma "preferida" de resolver el problema de las mínimas desviaciones absolutas. [ 7 ] Un método Simplex es un método para resolver un problema en programación lineal. El algoritmo más popular es el algoritmo Simplex modificado de Barrodale-Roberts. Los algoritmos para IRLS, el método de Wesolowsky y el método de Li se pueden encontrar en el Apéndice A de [ 7 ] entre otros métodos. Verificar todas las combinaciones de líneas que atraviesan cualesquiera dos puntos de datos (x,y) es otro método para encontrar la línea de mínimas desviaciones absolutas. Dado que se sabe que al menos una línea de mínimas desviaciones absolutas atraviesa al menos dos puntos de datos, este método encontrará una línea comparando el SAE (Error Absoluto Mínimo sobre los puntos de datos) de cada línea y eligiendo la línea con el SAE más pequeño. Además, si varias líneas tienen el mismo SAE más pequeño, entonces las líneas delimitan la región de múltiples soluciones. Aunque simple, este último método es ineficiente para grandes conjuntos de datos.

Solución mediante programación lineal

El problema se puede resolver utilizando cualquier técnica de programación lineal en la siguiente especificación del problema. Deseamos

Minimizari=1norte|yia0a1incógnitai1a2incógnitai2akincógnitaik|{\displaystyle {\text{Minimizar}}\sum _{i=1}^{n}|y_{i}-a_{0}-a_{1}x_{i1}-a_{2}x_{i2}-\cdots -a_{k}x_{ik}|}

con respecto a la elección de los valores de los parámetrosa0,,ak{\displaystyle a_{0},\ldots ,a_{k}}donde y i es el valor de la i -ésima observación de la variable dependiente, y x ij es el valor de la i -ésima observación de la j -ésima variable independiente ( j = 1,..., k ). Reescribimos este problema en términos de variables artificiales u i como

Minimizari=1nortei{\displaystyle {\text{Minimizar}}\sum _{i=1}^{n}u_{i}}
con respecto aa0,,ak{\displaystyle a_{0},\ldots ,a_{k}}y1,,norte{\displaystyle u_{1},\ldots ,u_{n}}
sujeto a
iyia0a1incógnitai1a2incógnitai2akincógnitaik     para i=1,,norte{\displaystyle u_{i}\geq y_{i}-a_{0}-a_{1}x_{i1}-a_{2}x_{i2}-\cdots -a_{k}x_{ik}\,\ \,\ \,\ \,\ \,\ {\text{para }}i=1,\ldots ,n}
i[yia0a1incógnitai1a2incógnitai2akincógnitaik]   para i=1,,norte.{\displaystyle u_{i}\geq -[y_{i}-a_{0}-a_{1}x_{i1}-a_{2}x_{i2}-\cdots -a_{k}x_{ik}]\,\ \,\ {\text{ para }}i=1,\ldots ,n.}

Estas restricciones tienen el efecto de forzar cadai{\displaystyle u_{i}}igualar|yia0a1incógnitai1a2incógnitai2akincógnitaik|{\displaystyle |y_{i}-a_{0}-a_{1}x_{i1}-a_{2}x_{i2}-\cdots -a_{k}x_{ik}|}Al minimizarse, la función objetivo resulta equivalente a la función objetivo original. Dado que esta versión del enunciado del problema no contiene el operador de valor absoluto, su formato permite resolverlo con cualquier paquete de programación lineal.

Propiedades

Existen otras propiedades únicas de la línea de mínimas desviaciones absolutas. En el caso de un conjunto de datos ( x , y ), la línea de mínimas desviaciones absolutas siempre pasará por al menos dos de los puntos de datos, a menos que existan múltiples soluciones. Si existen múltiples soluciones, la región de soluciones válidas de mínimas desviaciones absolutas estará delimitada por al menos dos líneas, cada una de las cuales pasa por al menos dos puntos de datos. De forma más general, si hay k regresores (incluida la constante), al menos una superficie de regresión óptima pasará por k de los puntos de datos. [ 8 ] : pág. 936

Esta fijación de la línea a los puntos de datos puede ayudar a comprender la propiedad de "inestabilidad": si la línea siempre se fija a al menos dos puntos, entonces saltará entre diferentes conjuntos de puntos a medida que se modifiquen los datos. Esta fijación también ayuda a comprender la propiedad de "robustez": si existe un valor atípico y una línea de mínima desviación absoluta debe fijarse a dos puntos de datos, lo más probable es que el valor atípico no sea uno de esos dos puntos, ya que esto no minimizará la suma de las desviaciones absolutas en la mayoría de los casos.

Un caso conocido en el que existen múltiples soluciones es un conjunto de puntos simétricos respecto a una línea horizontal, como se muestra en la Figura A a continuación.

Figura A: Conjunto de puntos de datos con simetría de reflexión y múltiples soluciones de mínimos desvíos absolutos. El área de soluciones se muestra en verde. Las líneas verticales azules representan los errores absolutos desde la línea rosa hasta cada punto de datos. La línea rosa es una de las infinitas soluciones dentro del área verde.

Para comprender por qué existen múltiples soluciones en el caso mostrado en la Figura A, consideremos la línea rosa en la región verde. La suma de sus errores absolutos es un valor S. Si se inclinara ligeramente la línea hacia arriba, manteniéndola dentro de la región verde, la suma de errores seguiría siendo S. Esto no cambiaría porque la distancia de cada punto a la línea aumenta en un lado de la misma, mientras que la distancia a cada punto en el lado opuesto disminuye exactamente en la misma cantidad. Por lo tanto, la suma de los errores absolutos permanece constante. Además, dado que la línea puede inclinarse en incrementos infinitamente pequeños, esto también demuestra que si hay más de una solución, existen infinitas soluciones.

Ventajas y desventajas

A continuación se presenta una tabla que compara algunas propiedades del método de mínimas desviaciones absolutas con las del método de mínimos cuadrados (para problemas no singulares). [ 9 ] [ 10 ]

* Siempre que el número de puntos de datos sea mayor o igual que el número de características.

El método de desviaciones absolutas mínimas (LAD) encuentra aplicaciones en diversas áreas debido a su robustez en comparación con el método de mínimos cuadrados. Su robustez radica en su resistencia a los valores atípicos en los datos. El LAD otorga la misma importancia a todas las observaciones, a diferencia de los mínimos cuadrados ordinarios (MCO), que, al elevar al cuadrado los residuos, otorga mayor peso a los residuos grandes, es decir, a los valores atípicos cuyas predicciones difieren considerablemente de las observaciones reales. Esto puede resultar útil en estudios donde no es necesario dar mayor peso a los valores atípicos que a las demás observaciones. Si es importante otorgar mayor peso a los valores atípicos, el método de mínimos cuadrados es la mejor opción.

Variaciones, extensiones, especializaciones

Si en la suma de los valores absolutos de los residuos se generaliza la función de valor absoluto a una función de valor absoluto inclinada, que en la semirrecta izquierda tiene pendienteτ1{\displaystyle \tau -1}y en la semirrecta derecha tiene pendienteτ{\displaystyle \tau }, dónde0<τ<1{\displaystyle 0<\tau <1}, se obtiene regresión de cuantiles . El caso deτ=1/2{\displaystyle \tau =1/2}proporciona la regresión estándar por mínimos desvíos absolutos y también se conoce como regresión mediana .

El problema de la mínima desviación absoluta puede extenderse para incluir múltiples explicadores, restricciones y regularización , por ejemplo, un modelo lineal con restricciones lineales: [ 11 ]

minimizarS(β,b)=i|incógnitaiβ+byi|{\displaystyle S(\mathbf {\beta } ,b)=\sum _ {i}|\mathbf {x} '_{i}\mathbf {\beta } +b-y_{i}|}
sujeto a, por ejemplo,incógnita1β+by1k{\displaystyle \mathbf {x} '_{1}\mathbf {\beta } +b-y_{1}\leq k}

dóndeβ{\displaystyle \mathbf {\beta } }es un vector columna de coeficientes a estimar, b es una intersección a estimar, x i es un vector columna de las i -ésimas observaciones de los diversos explicadores, y i es la i -ésima observación de la variable dependiente y k es una constante conocida.

La regularización con LASSO (operador de selección y contracción de mínimos absolutos) también puede combinarse con LAD. [ 12 ]

Véase también

Referencias

  1. «Regresión de mínima desviación absoluta». Enciclopedia concisa de estadística . Springer. 2008. págs. 299-302 . doi : 10.1007/978-0-387-32833-1_225 . ISBN  9780387328331.
  2. Barrodale, I.; Roberts, FDK (1973). "Un algoritmo mejorado para la aproximación lineal discreta L 1 ". SIAM Journal on Numerical Analysis . 10 (5): 839– 848. Bibcode : 1973SJNA...10..839B . doi : 10.1137/0710069 . hdl : 1828/11491 . JSTOR 2156318 . 
  3. Schlossmacher, EJ (diciembre de 1973). "Una técnica iterativa para el ajuste de curvas de desviaciones absolutas". Journal of the American Statistical Association . 68 (344): 857– 859. doi : 10.2307/2284512 . JSTOR 2284512 . 
  4. Wesolowsky, GO (1981). "Un nuevo algoritmo de descenso para el problema de regresión de mínimos valores absolutos". Communications in Statistics – Simulation and Computation . B10 (5): 479– 491. doi : 10.1080/03610918108812224 .
  5. Li, Yinbo; Arce, Gonzalo R. (2004). "Un enfoque de máxima verosimilitud para la regresión de mínima desviación absoluta" . EURASIP Journal on Applied Signal Processing . 2004 (12): 1762– 1769. Bibcode : 2004EJASP2004...61L . doi : 10.1155/S1110865704401139 .
  6. Kržić, Ana Sovic; Seršić, Damir (2018). "Minimización de L1 mediante reducción recursiva de dimensionalidad". Procesamiento de señales . 151 : 119– 129. Código bibliográfico : 2018SigPr.151..119S . doi : 10.1016/j.sigpro.2018.05.002 .
  7. 1 2 William A. Pfeil, Materiales didácticos estadísticos , tesis de licenciatura en ciencias, Instituto Politécnico de Worcester , 2006
  8. Branham, RL, Jr., "Alternativas a los mínimos cuadrados", Astronomical Journal 87, junio de 1982, 928–937.en el Sistema de Datos Astrofísicos (ADS) de SAO/NASA
  9. Para ver un conjunto de applets que demuestran estas diferencias, consulte el siguiente sitio web: http://www.math.wpi.edu/Course_Materials/SAS/lablets/7.3/73_choices.html
  10. Para un análisis comparativo entre LAD y OLS, consulte estos artículos e informes académicos: http://www.econ.uiuc.edu/~roger/research/rq/QRJEP.pdf y https://www.leeds.ac.uk/educol/documents/00003759.htm
  11. Shi, Mingren; Mark A., Lukas (marzo de 2002). "Un algoritmo de estimación L 1 con degeneración y restricciones lineales" . Computational Statistics & Data Analysis . 39 (1): 35– 55. doi : 10.1016/S0167-9473(01)00049-4 .
  12. Wang, Li; Gordon, Michael D.; Zhu, Ji (diciembre de 2006). "Regresión de mínimas desviaciones absolutas regularizada y un algoritmo eficiente para el ajuste de parámetros". Actas de la Sexta Conferencia Internacional sobre Minería de Datos . págs. 690–700 . doi : 10.1109/ICDM.2006.134 . 

Lecturas adicionales

  • Peter Bloomfield ; William Steiger (1980). "Ajuste de curvas mediante desviaciones absolutas mínimas" . SIAM Journal on Scientific Computing . 1 (2): 290– 301. doi : 10.1137/0901019 .
  • Subhash C. Narula y John F. Wellington (1982). "La regresión de suma mínima de errores absolutos: una revisión del estado del arte". International Statistical Review . 50 (3): 317– 326. doi : 10.2307/1402501 . JSTOR 1402501 . 
  • Robert F. Phillips (julio de 2002). "Estimación de desviaciones absolutas mínimas mediante el algoritmo EM". Statistics and Computing . 12 (3): 281– 285. doi : 10.1023/A:1020759012226 .
  • Enno Siemsen y Kenneth A. Bollen (2007). "Estimación de la desviación absoluta mínima en el modelado de ecuaciones estructurales". Sociological Methods & Research . 36 (2): 227– 265. doi : 10.1177/0049124107301946 .