
En estadística , la regresión de ángulo mínimo (LARS) es un algoritmo para ajustar modelos de regresión lineal a datos de alta dimensión, desarrollado por Bradley Efron , Trevor Hastie , Iain Johnstone y Robert Tibshirani . [ 1 ]
Supongamos que esperamos que una variable de respuesta esté determinada por una combinación lineal de un subconjunto de posibles covariables. En ese caso, el algoritmo LARS proporciona un método para estimar qué variables incluir, así como sus coeficientes.
En lugar de proporcionar un vector como resultado, la solución LARS consiste en una curva que representa la solución para cada valor de la norma L1 del vector de parámetros. El algoritmo es similar a la regresión escalonada hacia adelante , pero en lugar de incluir variables en cada paso, los parámetros estimados se incrementan en una dirección equiangular a la correlación de cada uno con el residuo.
Ventajas y desventajas
Las ventajas del método LARS son:
- Su velocidad de cálculo es la misma que la de la selección hacia adelante.
- Produce una ruta de solución lineal por tramos completa, lo cual resulta útil en la validación cruzada o en intentos similares para ajustar el modelo.
- Si dos variables están correlacionadas casi por igual con la respuesta, entonces sus coeficientes deberían aumentar aproximadamente al mismo ritmo. Por lo tanto, el algoritmo se comporta como cabría esperar intuitivamente y, además, es más estable.
- Se puede modificar fácilmente para generar algoritmos eficientes para otros métodos que produzcan resultados similares, como el lasso y la regresión por etapas hacia adelante.
- Es eficaz en contextos donde p ≫ n (es decir, cuando el número de predictores p es significativamente mayor que el número de puntos n ) [ 2 ].
Las desventajas del método LARS incluyen:
- Con cualquier cantidad de ruido en la variable dependiente y con variables independientes multicolineales de alta dimensión , no hay razón para creer que las variables seleccionadas tendrán una alta probabilidad de ser las variables causales subyacentes reales. Este problema no es exclusivo de LARS, ya que es un problema general con los enfoques de selección de variables que buscan encontrar componentes deterministas subyacentes. Sin embargo, debido a que LARS se basa en un reajuste iterativo de los residuos, parece ser particularmente sensible a los efectos del ruido. Weisberg discute este problema en detalle en la sección de discusión del artículo de Efron et al. (2004) Annals of Statistics. [ 3 ] Weisberg proporciona un ejemplo empírico basado en el reanálisis de datos originalmente utilizados para validar LARS que muestra que la selección de variables parece tener problemas con variables altamente correlacionadas.
- Dado que casi todos los datos de alta dimensión del mundo real, por pura casualidad, exhibirán cierto grado de colinealidad entre al menos algunas variables, el problema que tiene LARS con las variables correlacionadas puede limitar su aplicación a datos de alta dimensión.
Algoritmo
Los pasos básicos del algoritmo de regresión de ángulo mínimo son:
- Comience con todos los coeficientesigual a cero.
- Encuentra el predictormás correlacionado con.
- Aumentar el coeficienteen la dirección del signo de su correlación con. Tomar residuosen el camino. Deténgase cuando algún otro predictortiene tanta correlación concomotiene.
- Aumentar (,) en su dirección conjunta de mínimos cuadrados, hasta que algún otro predictortiene tanta correlación con el residuo.
- Aumentar (,,) en su dirección conjunta de mínimos cuadrados, hasta que algún otro predictortiene tanta correlación con el residuo.
- Continuar hasta que: todos los predictores estén en el modelo. [ 4 ]
Implementación de software
La regresión de ángulo mínimo se implementa en R mediante el paquete lars , en Python con el paquete scikit-learn y en SAS mediante el procedimiento GLMSELECT .
Véase también
Referencias
- ↑ Efron, Bradley ; Hastie, Trevor; Johnstone, Iain; Tibshirani, Robert (2004). "Regresión de ángulo mínimo" ( PDF) . Annals of Statistics . 32 (2): pp. 407–499. arXiv : math/0406456 . doi : 10.1214/009053604000000067 . MR 2060166. S2CID 204004121 .
- ↑ Hastie, Trevor; Robert, Tibshirani; Jerome, Friedman (2009). The Elements of Statistical Learning Data Mining, Inference, and Prediction (2.ª ed. 2009.) (PDF) . Springer Series in Statistics. Springer New York. p. 76. doi : 10.1007/978-0-387-84858-7 . ISBN 978-0-387-84857-0. Archivado del original (PDF) el 28-09-2018 . Consultado el 08-06-2021 .
- ↑ Véase la discusión de Weisberg siguiendo a Efron, Bradley ; Hastie, Trevor; Johnstone, Iain; Tibshirani, Robert (2004). "Regresión de ángulo mínimo" ( PDF) . Annals of Statistics . 32 (2): pp. 407–499. arXiv : math/0406456 . doi : 10.1214/009053604000000067 . MR 2060166. S2CID 204004121 .
- ↑ "Una explicación sencilla del método Lasso y la regresión de ángulo mínimo" . Archivado del original el 21 de junio de 2015.
- Teoría de la estimación
- estadística paramétrica
- Selección de variables de regresión
- Métodos de ecuación única (econometría)