Articulo de referencia

Apalancamiento (estadística)

En estadística , y en particular en el análisis de regresión , el apalancamiento es una medida de cuán alejados están los valores de la variable independiente de una observación...

En estadística , y en particular en el análisis de regresión , el apalancamiento es una medida de cuán alejados están los valores de la variable independiente de una observación de los de las demás observaciones. Los puntos de alto apalancamiento , si los hay, son valores atípicos con respecto a las variables independientes . Es decir, los puntos de alto apalancamiento no tienen puntos vecinos enRpag{\displaystyle \mathbb {R} ^{p}}espacio, dondepag{\displaystyle {p}}es el número de variables independientes en un modelo de regresión. Esto hace que el modelo ajustado sea propenso a pasar cerca de una observación de alto apalancamiento. [ 1 ] Por lo tanto, los puntos de alto apalancamiento tienen el potencial de causar grandes cambios en las estimaciones de los parámetros cuando se eliminan, es decir, de ser puntos influyentes . Aunque un punto influyente normalmente tendrá un alto apalancamiento, un punto de alto apalancamiento no es necesariamente un punto influyente. El apalancamiento se define típicamente como los elementos diagonales de la matriz de sombrero . [ 2 ]

Definición e interpretaciones

Consideremos el modelo de regresión lineal.yi=incógnitaiβ+εi{\displaystyle {y}_{i}={\boldsymbol {x}}_{i}^{\top }{\boldsymbol {\beta }}+{\varepsilon }_{i}},i=1,2,,norte{\displaystyle i=1,\,2,\ldots ,\,n}. Eso es,y=incógnitaβ+ε{\displaystyle {\boldsymbol {y}}=\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }}}, dónde,incógnita{\displaystyle \mathbf {X} }es elnorte×pag{\displaystyle n\times p}matriz de diseño cuyas filas corresponden a las observaciones y cuyas columnas corresponden a las variables independientes o explicativas. La puntuación de apalancamiento para laith{\displaystyle {i}^{th}}observación independienteincógnitai{\displaystyle {\boldsymbol {x}}_{i}}se da como:

hii=[H]ii=incógnitai(incógnitaincógnita)1incógnitai{\displaystyle h_{ii}=\left[\mathbf {H} \right]_{ii}={\boldsymbol {x}}_{i}^{\top }\left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}{\boldsymbol {x}}_{i}}, elith{\displaystyle {i}^{th}}elemento diagonal de la matriz de ortoproyección ( también conocida como matriz sombrero)H=incógnita(incógnitaincógnita)1incógnita{\displaystyle \mathbf {H} =\mathbf {X} \left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }}.

Por lo tanto, elith{\displaystyle {i}^{th}}La puntuación de apalancamiento puede verse como la distancia 'ponderada' entre incógnitai{\displaystyle {\boldsymbol {x}}_{i}}a la media de incógnitai{\displaystyle {\boldsymbol {x}}_{i}}de (véase su relación con la distancia de Mahalanobis ). También puede interpretarse como el grado en que laith{\displaystyle {i}^{th}}valor medido (dependiente) (es decir, yi{\displaystyle y_{i}}) influye en elith{\displaystyle {i}^{th}}valor ajustado (predicho) (es decir,y^i{\displaystyle {\widehat {y\,}}_{i}}): matemáticamente,

hii=y^iyi{\displaystyle h_{ii}={\frac {\partial {\widehat {y\,}}_{i}}{\partial y_{i}}}}.

Por lo tanto, la puntuación de apalancamiento también se conoce como auto-sensibilidad de observación o auto-influencia. [ 3 ] Utilizando el hecho de quey^=Hy{\displaystyle {\boldsymbol {\widehat {y}}}={\mathbf {H} }{\boldsymbol {y}}}(es decir, la predicción)y^{\displaystyle {\boldsymbol {\widehat {y}}}}es la orto-proyección dey{\displaystyle {\boldsymbol {y}}}en el espacio de rango deincógnita{\displaystyle \mathbf {X} }) en la expresión anterior, obtenemoshii=[H]ii{\displaystyle h_{ii}=\left[\mathbf {H} \right]_{ii}}Tenga en cuenta que este apalancamiento depende de los valores de las variables explicativas.(incógnita){\displaystyle (\mathbf {X} )}de todas las observaciones pero no en ninguno de los valores de las variables dependientes(yi){\displaystyle (y_{i})}.

Propiedades

  1. El apalancamiento  hii{\displaystyle h_{ii}}es un número entre 0 y 1,0hii1.{\displaystyle 0\leq h_{ii}\leq 1.}Prueba: Tenga en cuenta queH{\displaystyle \mathbf {H} }es una matriz idempotente (H2=H{\displaystyle \mathbf {H} ^{2}=\mathbf {H} }) y simétrico (hij=hji{\displaystyle h_{ij}=h_{ji}}). Por lo tanto, utilizando el hecho de que[H2]ii=[H]ii{\displaystyle \left[\mathbf {H} ^{2}\right]_{ii}=\left[\mathbf {H} \right]_{ii}}, tenemoshii=hii2+jihij2{\displaystyle h_{ii}=h_{ii}^{2}+\sum _{j\neq i}h_{ij}^{2}}. Puesto que sabemos quejihij20{\displaystyle \sum _{j\neq i}h_{ij}^{2}\geq 0}, tenemoshiihii20hii1{\displaystyle h_{ii}\geq h_{ii}^{2}\implies 0\leq h_{ii}\leq 1}.
  2. La suma de los apalancamientos es igual al número de parámetros.(pag){\displaystyle (p)}enβ{\displaystyle {\boldsymbol {\beta }}}(incluyendo la intersección). Prueba:i=1nortehii=Tran(H)=Tran(incógnita(incógnitaincógnita)1incógnita)=Tran(incógnitaincógnita(incógnitaincógnita)1)=Tran(Ipag)=pag{\displaystyle \sum _{i=1}^{n}h_{ii}=\operatorname {Tr} (\mathbf {H} )=\operatorname {Tr} \left(\mathbf {X} \left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\mathbf {X} ^{\top }\right)=\operatorname {Tr} \left(\mathbf {X} ^{\top }\mathbf {X} \left(\mathbf {X} ^{\top }\mathbf {X} \right)^{-1}\right)=\operatorname {Tr} (\mathbf {I} _{p})=p},

dóndeTran{\displaystyle \operatorname {Tr} }es el operador de traza .

Determinación de valores atípicos en X mediante el uso de palancas.

Gran apalancamientohii{\displaystyle {h_{ii}}}corresponde a unincógnitai{\displaystyle {{\boldsymbol {x}}_{i}}}Eso es extremo. Una regla común es identificarincógnitai{\displaystyle {{\boldsymbol {x}}_{i}}}cuyo valor de apalancamientohii{\displaystyle {h}_{ii}}es más de 2 veces mayor que el apalancamiento medioh¯=1nortei=1nortehii=pagnorte{\displaystyle {\bar {h}}={\dfrac {1}{n}}\sum _{i=1}^{n}h_{ii}={\dfrac {p}{n}}}(véase la propiedad 2 anterior). Es decir, sihii>2pagnorte{\displaystyle h_{ii}>2{\dfrac {p}{n}}},incógnitai{\displaystyle {{\boldsymbol {x}}_{i}}}se considerará un valor atípico. Algunos estadísticos prefieren el umbral de 3pag/norte{\displaystyle 3p/{n}}en lugar de2pag/norte{\displaystyle 2p/{n}}.

Relación con la distancia de Mahalanobis

El apalancamiento está estrechamente relacionado con la distancia de Mahalanobis (prueba [ 4 ] ). Específicamente, para algunosnorte×pag{\displaystyle n\times p}matrizincógnita{\displaystyle \mathbf {X} }, la distancia de Mahalanobis al cuadrado deincógnitai{\displaystyle {{\boldsymbol {x}}_{i}}}(dóndeincógnitai{\displaystyle {\boldsymbol {x}}_{i}^{\top }}es ith{\displaystyle {i}^{th}}fila de incógnita{\displaystyle \mathbf {X} }) del vector de mediaμ^=i=1norteincógnitai{\displaystyle {\widehat {\boldsymbol {\mu }}}=\sum _{i=1}^{n}{\boldsymbol {x}}_{i}}de longitudpag{\displaystyle p}, esD2(incógnitai)=(incógnitaiμ^)S1(incógnitaiμ^){\displaystyle D^{2}({\boldsymbol {x}}_{i})=({\boldsymbol {x}}_{i}-{\widehat {\boldsymbol {\mu }}})^{\top }\mathbf {S} ^{-1}({\boldsymbol {x}}_{i}-{\widehat {\boldsymbol {\mu }}})}, dóndeS=incógnitaincógnita{\displaystyle \mathbf {S} =\mathbf {X} ^{\top }\mathbf {X} }es la matriz de covarianza estimada de incógnitai{\displaystyle {{\boldsymbol {x}}_{i}}}Esto está relacionado con el apalancamiento.hii{\displaystyle h_{ii}}de la matriz de sombreros deincógnita{\displaystyle \mathbf {X} }después de agregarle un vector columna de 1. La relación entre ambos es:

D2(incógnitai)=(norte1)(hii1norte){\displaystyle D^{2}({\boldsymbol {x}}_{i})=(n-1)(h_{ii}-{\tfrac {1}{n}})}

Esta relación nos permite descomponer el apalancamiento en componentes significativos para que algunas fuentes de alto apalancamiento puedan investigarse analíticamente. [ 5 ]

Relación con las funciones de influencia

En un contexto de regresión, combinamos funciones de apalancamiento e influencia para calcular el grado en que los coeficientes estimados cambiarían si elimináramos un solo punto de datos. Denotando los residuos de la regresión comomi^i=yiincógnitaiβ^{\displaystyle {\widehat {e}}_{i}=y_{i}-{\boldsymbol {x}}_{i}^{\top }{\widehat {\boldsymbol {\beta }}}}, se puede comparar el coeficiente estimadoβ^{\displaystyle {\widehat {\boldsymbol {\beta }}}}al coeficiente estimado de exclusión de unoβ^(i){\displaystyle {\widehat {\boldsymbol {\beta }}}^{(-i)}}utilizando la fórmula [ 6 ] [ 7 ]

β^β^(i)=(incógnitaincógnita)1incógnitaimi^i1hii{\displaystyle {\widehat {\boldsymbol {\beta }}}-{\widehat {\boldsymbol {\beta }}}^{(-i)}={\frac {(\mathbf {X} ^{\top }\mathbf {X} )^{-1}{\boldsymbol {x}}_{i}{\widehat {e}}_{i}}{1-h_{ii}}}}

Young (2019) utiliza una versión de esta fórmula después de residualizar los controles. [ 8 ] Para comprender intuitivamente esta fórmula, tenga en cuenta queβ^yi=(incógnitaincógnita)1incógnitai{\displaystyle {\frac {\partial {\hat {\beta }}}{\partial y_{i}}}=(\mathbf {X} ^{\top }\mathbf {X} )^{-1}{\boldsymbol {x}}_{i}}captura el potencial de que una observación afecte los parámetros de regresión y, por lo tanto,(incógnitaincógnita)1incógnitaimi^i{\displaystyle (\mathbf {X} ^{\top }\mathbf {X} )^{-1}{\boldsymbol {x}}_{i}{\widehat {e}}_{i}}captura la influencia real de las desviaciones de esas observaciones con respecto a su valor ajustado en los parámetros de regresión. La fórmula luego divide por(1hii){\displaystyle (1-h_{ii})}Para tener en cuenta que eliminamos la observación en lugar de ajustar su valor, lo que refleja que la eliminación altera más la distribución de las covariables cuando se aplica a observaciones con alto apalancamiento (es decir, con valores atípicos de las covariables). Fórmulas similares surgen al aplicar fórmulas generales para funciones de influencia estadística en el contexto de la regresión. [ 9 ] [ 10 ]

Efecto sobre la varianza residual

Si nos encontramos en un entorno de mínimos cuadrados ordinarios con fijoincógnita{\displaystyle \mathbf {X} }y errores de regresión homocedásticaεi,{\displaystyle \varepsilon _{i},}y=incógnitaβ+ε;  Var(ε)=σ2I{\displaystyle {\boldsymbol {y}}=\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }};\ \ \operatorname {Var} ({\boldsymbol {\varepsilon }})=\sigma ^{2}\mathbf {I} }, entonces elith{\displaystyle {i}^{th}}residuo de regresión ,mii=yiy^i{\displaystyle e_{i}=y_{i}-{\widehat {y}}_{i}}tiene varianza

Var(mii)=(1hii)σ2{\displaystyle \operatorname {Var} (e_{i})=(1-h_{ii})\sigma ^{2}}.

En otras palabras, la puntuación de apalancamiento de una observación determina el grado de ruido en la predicción errónea del modelo de esa observación, y un mayor apalancamiento conlleva menos ruido. Esto se deriva del hecho de queIH{\displaystyle \mathbf {I} -\mathbf {H} }es idempotente y simétrico yy^=Hy{\displaystyle {\widehat {\boldsymbol {y}}}=\mathbf {H} {\boldsymbol {y}}}, por eso,Var(mi)=Var((IH)y)=(IH)Var(y)(IH)=σ2(IH)2=σ2(IH){\displaystyle \operatorname {Var} ({\boldsymbol {e}})=\operatorname {Var} ((\mathbf {I} -\mathbf {H} ){\boldsymbol {y}})=(\mathbf {I} -\mathbf {H} )\operatorname {Var} ({\boldsymbol {y}})(\mathbf {I} -\mathbf {H} )^{\top }=\sigma ^{2}(\mathbf {I} -\mathbf {H} )^{2}=\sigma ^{2}(\mathbf {I} -\mathbf {H} )}.

El residuo estudentizado correspondiente —el residuo ajustado por su varianza residual estimada específica de la observación— es entonces

ti=miiσ^1hii {\displaystyle t_{i}={e_{i} \over {\widehat {\sigma }}{\sqrt {1-h_{ii}\ }}}}

dóndeσ^{\displaystyle {\widehat {\sigma }}}es una estimación apropiada deσ{\displaystyle \sigma }.

Apalancamiento parcial

El apalancamiento parcial ( PL ) es una medida de la contribución de las variables independientes individuales al apalancamiento total de cada observación. Es decir, PL es una medida de cómohii{\displaystyle h_{ii}}cambia a medida que se agrega una variable al modelo de regresión. Se calcula de la siguiente manera:

(PAGLj)i=(incógnitaj[j])i2k=1norte(incógnitaj[j])k2{\displaystyle \left(\mathrm {PL} _{j}\right)_{i}={\frac {\left(\mathbf {X} _{j\bullet [j]}\right)_{i}^{2}}{\sum _{k=1}^{n}\left(\mathbf {X} _{j\bullet [j]}\right)_{k}^{2}}}}

dóndej{\displaystyle j}es el índice de la variable independiente,i{\displaystyle i}es el índice de observación yincógnitaj[j]{\displaystyle \mathbf {X} _{j\bullet [j]}}son los residuos de la regresiónincógnitaj{\displaystyle \mathbf {X} _{j}}frente a las variables independientes restantes. Tenga en cuenta que el apalancamiento parcial es el apalancamiento de laith{\displaystyle {i}^{th}}punto en el gráfico de regresión parcial para eljth{\displaystyle {j}^{th}}variable. Los puntos de datos con un gran apalancamiento parcial para una variable independiente pueden ejercer una influencia indebida en la selección de esa variable en los procedimientos de construcción de modelos de regresión automáticos.

Implementaciones de software

Muchos programas y paquetes estadísticos, como R , Python , etc., incluyen implementaciones de Leverage.

Véase también

Referencias

  1. Everitt, BS (2002). Diccionario de estadística de Cambridge . Cambridge University Press. ISBN 0-521-81099-X.
  2. James, Gareth; Witten, Daniela; Hastie, Trevor; Tibshirani, Robert (2021). Introducción al aprendizaje estadístico: con aplicaciones en R (Segunda edición). Nueva York, NY: Springer. pág. 112. doi : 10.1007/978-1-0716-1418-1 . ISBN   978-1-0716-1418-1Consultado el 29 de octubre de 2024 .
  3. Cardinali, C. (junio de 2013). "Asimilación de datos: diagnóstico de la influencia de la observación en un sistema de asimilación de datos" (PDF) .
  4. ¿Demuestra la relación entre la distancia de Mahalanobis y el apalancamiento?
  5. Kim, MG (2004). "Fuentes de alto apalancamiento en el modelo de regresión lineal (Journal of Applied Mathematics and Computing, Vol 16, 509–513)". arXiv : 2006.04024 [ math.ST ].
  6. Miller, Rupert G. (septiembre de 1974). "Un jackknife desequilibrado" . Annals of Statistics . 2 (5): 880– 891. doi : 10.1214/aos/1176342811 . ISSN 0090-5364 . 
  7. Hiyashi, Fumio (2000). Econometría . Princeton University Press. pág. 21. 
  8. Young, Alwyn (2019). "Canalizando a Fisher: Pruebas de aleatorización y la insignificancia estadística de resultados experimentales aparentemente significativos" . The Quarterly Journal of Economics . 134 (2): 567. doi : 10.1093/qje/qjy029 .
  9. Chatterjee, Samprit; Hadi, Ali S. (agosto de 1986). "Observaciones influyentes, puntos de alto apalancamiento y valores atípicos en la regresión lineal" . Statistical Science . 1 (3): 379– 393. doi : 10.1214/ss/1177013622 . ISSN 0883-4237 . 
  10. "regresión - Funciones de influencia y MCO" . Validado cruzadamente . Consultado el 6 de diciembre de 2020 .