En estadística , y en particular en el análisis de regresión , el apalancamiento es una medida de cuán alejados están los valores de la variable independiente de una observación de los de las demás observaciones. Los puntos de alto apalancamiento , si los hay, son valores atípicos con respecto a las variables independientes . Es decir, los puntos de alto apalancamiento no tienen puntos vecinos enespacio, dondees el número de variables independientes en un modelo de regresión. Esto hace que el modelo ajustado sea propenso a pasar cerca de una observación de alto apalancamiento. [ 1 ] Por lo tanto, los puntos de alto apalancamiento tienen el potencial de causar grandes cambios en las estimaciones de los parámetros cuando se eliminan, es decir, de ser puntos influyentes . Aunque un punto influyente normalmente tendrá un alto apalancamiento, un punto de alto apalancamiento no es necesariamente un punto influyente. El apalancamiento se define típicamente como los elementos diagonales de la matriz de sombrero . [ 2 ]
Definición e interpretaciones
Consideremos el modelo de regresión lineal.,. Eso es,, dónde,es elmatriz de diseño cuyas filas corresponden a las observaciones y cuyas columnas corresponden a las variables independientes o explicativas. La puntuación de apalancamiento para laobservación independientese da como:
- , elelemento diagonal de la matriz de ortoproyección ( también conocida como matriz sombrero).
Por lo tanto, elLa puntuación de apalancamiento puede verse como la distancia 'ponderada' entre a la media de de (véase su relación con la distancia de Mahalanobis ). También puede interpretarse como el grado en que lavalor medido (dependiente) (es decir, ) influye en elvalor ajustado (predicho) (es decir,): matemáticamente,
- .
Por lo tanto, la puntuación de apalancamiento también se conoce como auto-sensibilidad de observación o auto-influencia. [ 3 ] Utilizando el hecho de que(es decir, la predicción)es la orto-proyección deen el espacio de rango de) en la expresión anterior, obtenemosTenga en cuenta que este apalancamiento depende de los valores de las variables explicativas.de todas las observaciones pero no en ninguno de los valores de las variables dependientes.
Propiedades
- El apalancamiento es un número entre 0 y 1,Prueba: Tenga en cuenta quees una matriz idempotente () y simétrico (). Por lo tanto, utilizando el hecho de que, tenemos. Puesto que sabemos que, tenemos.
- La suma de los apalancamientos es igual al número de parámetros.en(incluyendo la intersección). Prueba:,
dóndees el operador de traza .
Determinación de valores atípicos en X mediante el uso de palancas.
Gran apalancamientocorresponde a unEso es extremo. Una regla común es identificarcuyo valor de apalancamientoes más de 2 veces mayor que el apalancamiento medio(véase la propiedad 2 anterior). Es decir, si,se considerará un valor atípico. Algunos estadísticos prefieren el umbral de en lugar de.
Relación con la distancia de Mahalanobis
El apalancamiento está estrechamente relacionado con la distancia de Mahalanobis (prueba [ 4 ] ). Específicamente, para algunosmatriz, la distancia de Mahalanobis al cuadrado de(dóndees fila de ) del vector de mediade longitud, es, dóndees la matriz de covarianza estimada de Esto está relacionado con el apalancamiento.de la matriz de sombreros dedespués de agregarle un vector columna de 1. La relación entre ambos es:
Esta relación nos permite descomponer el apalancamiento en componentes significativos para que algunas fuentes de alto apalancamiento puedan investigarse analíticamente. [ 5 ]
Relación con las funciones de influencia
En un contexto de regresión, combinamos funciones de apalancamiento e influencia para calcular el grado en que los coeficientes estimados cambiarían si elimináramos un solo punto de datos. Denotando los residuos de la regresión como, se puede comparar el coeficiente estimadoal coeficiente estimado de exclusión de unoutilizando la fórmula [ 6 ] [ 7 ]
Young (2019) utiliza una versión de esta fórmula después de residualizar los controles. [ 8 ] Para comprender intuitivamente esta fórmula, tenga en cuenta quecaptura el potencial de que una observación afecte los parámetros de regresión y, por lo tanto,captura la influencia real de las desviaciones de esas observaciones con respecto a su valor ajustado en los parámetros de regresión. La fórmula luego divide porPara tener en cuenta que eliminamos la observación en lugar de ajustar su valor, lo que refleja que la eliminación altera más la distribución de las covariables cuando se aplica a observaciones con alto apalancamiento (es decir, con valores atípicos de las covariables). Fórmulas similares surgen al aplicar fórmulas generales para funciones de influencia estadística en el contexto de la regresión. [ 9 ] [ 10 ]
Efecto sobre la varianza residual
Si nos encontramos en un entorno de mínimos cuadrados ordinarios con fijoy errores de regresión homocedástica, entonces elresiduo de regresión ,tiene varianza
- .
En otras palabras, la puntuación de apalancamiento de una observación determina el grado de ruido en la predicción errónea del modelo de esa observación, y un mayor apalancamiento conlleva menos ruido. Esto se deriva del hecho de quees idempotente y simétrico y, por eso,.
El residuo estudentizado correspondiente —el residuo ajustado por su varianza residual estimada específica de la observación— es entonces
dóndees una estimación apropiada de.
Apalancamiento parcial
El apalancamiento parcial ( PL ) es una medida de la contribución de las variables independientes individuales al apalancamiento total de cada observación. Es decir, PL es una medida de cómocambia a medida que se agrega una variable al modelo de regresión. Se calcula de la siguiente manera:
dóndees el índice de la variable independiente,es el índice de observación yson los residuos de la regresiónfrente a las variables independientes restantes. Tenga en cuenta que el apalancamiento parcial es el apalancamiento de lapunto en el gráfico de regresión parcial para elvariable. Los puntos de datos con un gran apalancamiento parcial para una variable independiente pueden ejercer una influencia indebida en la selección de esa variable en los procedimientos de construcción de modelos de regresión automáticos.
Implementaciones de software
Muchos programas y paquetes estadísticos, como R , Python , etc., incluyen implementaciones de Leverage.
Véase también
- Matriz de proyección : cuyas entradas de la diagonal principal son los apalancamientos de las observaciones.
- Distancia de Mahalanobis : una medida ( escalada ) de apalancamiento de un dato
- Apalancamiento parcial
- Distancia de Cook : una medida de los cambios en los coeficientes de regresión cuando se elimina una observación.
- DFFITS
- Valores atípicos : observaciones con valores Y extremos.
- Grados de libertad (estadística) , la suma de las puntuaciones de apalancamiento
Referencias
- ↑ Everitt, BS (2002). Diccionario de estadística de Cambridge . Cambridge University Press. ISBN 0-521-81099-X.
- ↑ James, Gareth; Witten, Daniela; Hastie, Trevor; Tibshirani, Robert (2021). Introducción al aprendizaje estadístico: con aplicaciones en R (Segunda edición). Nueva York, NY: Springer. pág. 112. doi : 10.1007/978-1-0716-1418-1 . ISBN 978-1-0716-1418-1Consultado el 29 de octubre de 2024 .
- ↑ Cardinali, C. (junio de 2013). "Asimilación de datos: diagnóstico de la influencia de la observación en un sistema de asimilación de datos" (PDF) .
- ↑ ¿Demuestra la relación entre la distancia de Mahalanobis y el apalancamiento?
- ↑ Kim, MG (2004). "Fuentes de alto apalancamiento en el modelo de regresión lineal (Journal of Applied Mathematics and Computing, Vol 16, 509–513)". arXiv : 2006.04024 [ math.ST ].
- ↑ Miller, Rupert G. (septiembre de 1974). "Un jackknife desequilibrado" . Annals of Statistics . 2 (5): 880– 891. doi : 10.1214/aos/1176342811 . ISSN 0090-5364 .
- ↑ Hiyashi, Fumio (2000). Econometría . Princeton University Press. pág. 21.
- ↑ Young, Alwyn (2019). "Canalizando a Fisher: Pruebas de aleatorización y la insignificancia estadística de resultados experimentales aparentemente significativos" . The Quarterly Journal of Economics . 134 (2): 567. doi : 10.1093/qje/qjy029 .
- ↑ Chatterjee, Samprit; Hadi, Ali S. (agosto de 1986). "Observaciones influyentes, puntos de alto apalancamiento y valores atípicos en la regresión lineal" . Statistical Science . 1 (3): 379– 393. doi : 10.1214/ss/1177013622 . ISSN 0883-4237 .
- ↑ "regresión - Funciones de influencia y MCO" . Validado cruzadamente . Consultado el 6 de diciembre de 2020 .
- Diagnóstico de regresión