Articulo de referencia

Matriz de proyección

En estadística , la matriz de proyección ( PAG ) {\displaystyle (\mathbf {P} )} , [ 1 ] a veces también llamada matriz de influencia [ 2 ] o matriz de sombrero ( H ) {\displayst...

En estadística , la matriz de proyección(PAG){\displaystyle (\mathbf {P} )}, [ 1 ] a veces también llamada matriz de influencia [ 2 ] o matriz de sombrero(H){\displaystyle (\mathbf {H} )}, mapea el vector de valores de respuesta (valores de la variable dependiente) al vector de valores ajustados (o valores predichos). Describe la influencia que cada valor de respuesta tiene sobre cada valor ajustado. [ 3 ] [ 4 ] Los elementos diagonales de la matriz de proyección son los apalancamientos , que describen la influencia que cada valor de respuesta tiene sobre el valor ajustado para esa misma observación.

Definición

Si el vector de valores de respuesta se denota pory{\displaystyle \mathbf {y} }y el vector de valores ajustados pory^{\displaystyle \mathbf {\hat {y}} },

y^=PAGy.{\displaystyle \mathbf {\hat {y}} =\mathbf {P} \mathbf {y} .}

Comoy^{\displaystyle \mathbf {\hat {y}} }Se suele pronunciar "y-hat", la matriz de proyecciónPAG{\displaystyle \mathbf {P} }También se le llama matriz de sombrero porque "le pone un sombrero " .y{\displaystyle \mathbf {y} }".

Solicitud de derechos residuales

La fórmula para el vector de residuosr{\displaystyle \mathbf {r} }También se puede expresar de forma compacta utilizando la matriz de proyección:

r=yy^=yPAGy=(IPAG)y.{\displaystyle \mathbf {r} =\mathbf {y} -\mathbf {\hat {y}} =\mathbf {y} -\mathbf {P} \mathbf {y} =\left(\mathbf {I} -\mathbf {P} \right)\mathbf {y} .}

dóndeI{\displaystyle \mathbf {I} }es la matriz identidad . La matrizMETRO:=IPAG{\displaystyle \mathbf {M} :=\mathbf {I} -\mathbf {P} } a veces se denomina matriz de creación residual o matriz aniquiladora .

La matriz de covarianza de los residuosr{\displaystyle \mathbf {r} }, por propagación de errores , es igual a

Σr=(IPAG)TΣ(IPAG){\displaystyle \mathbf {\Sigma } _{\mathbf {r} }=\left(\mathbf {I} -\mathbf {P} \right)^{\textsf {T}}\mathbf {\Sigma } \left(\mathbf {I} -\mathbf {P} \right)},

dóndeΣ{\displaystyle \mathbf {\Sigma } }es la matriz de covarianza del vector de error (y por extensión, también del vector de respuesta). Para el caso de modelos lineales con errores independientes e idénticamente distribuidos en los queΣ=σ2I{\displaystyle \mathbf {\Sigma } =\sigma ^{2}\mathbf {I} }, esto se reduce a: [ 3 ]

Σr=(IPAG)σ2{\displaystyle \mathbf {\Sigma } _{\mathbf {r} }=\left(\mathbf {I} -\mathbf {P} \right)\sigma ^{2}}.

Intuición

Una matriz,A{\displaystyle \mathbf {A} }tiene su espacio columnar representado por la línea verde. La proyección de algún vectorb{\displaystyle \mathbf {b} }en el espacio de columna deA{\displaystyle \mathbf {A} }es el vectorincógnita{\displaystyle \mathbf {x} }

De la figura, queda claro que el punto más cercano al vectorb{\displaystyle \mathbf {b} }en el espacio de columna deA{\displaystyle \mathbf {A} }, esAincógnita{\displaystyle \mathbf {Ax} }y es uno donde podemos trazar una línea ortogonal al espacio columna deA{\displaystyle \mathbf {A} }Un vector que es ortogonal al espacio columna de una matriz está en el espacio nulo de la transpuesta de la matriz, por lo que

AT(bAincógnita)=0{\displaystyle \mathbf {A} ^{\textsf {T}}(\mathbf {b} -\mathbf {Ax} )=0}.

A partir de ahí, uno reorganiza, así que

ATbATAincógnita=0ATb=ATAincógnitaincógnita=(ATA)1ATb{\displaystyle {\begin{aligned}&&\mathbf {A} ^{\textsf {T}}\mathbf {b} &-\mathbf {A} ^{\textsf {T}}\mathbf {Ax} =0\\\Rightarrow &&\mathbf {A} ^{\textsf {T}}\mathbf {b} &=\mathbf {A} ^{\textsf {T}}\mathbf {Ax} \\\Rightarrow &&\mathbf {x} &=\left(\mathbf {A} ^{\textsf {T}}\mathbf {A} \right)^{-1}\mathbf {A} ^{\textsf {T}}\mathbf {b} \end{aligned}}}.

Por lo tanto, dado queAincógnita{\displaystyle \mathbf {Ax} }está en el espacio de columna deA{\displaystyle \mathbf {A} }, la matriz de proyección, que mapeab{\displaystyle \mathbf {b} }sobreAincógnita{\displaystyle \mathbf {A} \mathbf {x} }, esA(ATA)1AT{\displaystyle \mathbf {A} \left(\mathbf {A} ^{\textsf {T}}\mathbf {A} \right)^{-1}\mathbf {A} ^{\textsf {T}}}.

Modelo lineal

Supongamos que deseamos estimar un modelo lineal utilizando mínimos cuadrados lineales. El modelo se puede escribir como

y=incógnitaβ+ε,{\displaystyle \mathbf {y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }},}

dóndeincógnita{\displaystyle \mathbf {X} }es una matriz de variables explicativas (la matriz de diseño ), β es un vector de parámetros desconocidos que se deben estimar y ε es el vector de error.

Muchos tipos de modelos y técnicas están sujetos a esta formulación. Algunos ejemplos son los mínimos cuadrados lineales , las splines de suavizado , las splines de regresión , la regresión local , la regresión de núcleo y el filtrado lineal .

mínimos cuadrados ordinarios

Cuando los pesos para cada observación son idénticos y los errores no están correlacionados, los parámetros estimados son

β^=(incógnitaTincógnita)1incógnitaTy,{\displaystyle {\hat {\boldsymbol {\beta }}}=\left(\mathbf {X} ^{\textsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}\mathbf {y} ,}

por lo tanto los valores ajustados son

y^=incógnitaβ^=incógnita(incógnitaTincógnita)1incógnitaTy.{\displaystyle {\hat {\mathbf {y} }}=\mathbf {X} {\hat {\boldsymbol {\beta }}}=\mathbf {X} \left(\mathbf {X} ^{\textsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}\mathbf {y} .}

Por lo tanto, la matriz de proyección (y la matriz sombrero) viene dada por

PAG:=incógnita(incógnitaTincógnita)1incógnitaT.{\displaystyle \mathbf {P} :=\mathbf {X} \left(\mathbf {X} ^{\textsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}.}

Mínimos cuadrados ponderados y generalizados

Lo anterior puede generalizarse a los casos en que los pesos no son idénticos y/o los errores están correlacionados. Supongamos que la matriz de covarianza de los errores es Σ . Entonces, dado que

β^GLS=(incógnitaTΣ1incógnita)1incógnitaTΣ1y{\displaystyle {\hat {\mathbf {\beta } }}_{\text{GLS}}=\left(\mathbf {X} ^{\textsf {T}}\mathbf {\Sigma } ^{-1}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}\mathbf {\Sigma } ^{-1}\mathbf {y} }.

La matriz de sombreros es, por lo tanto,

H=incógnita(incógnitaTΣ1incógnita)1incógnitaTΣ1{\displaystyle \mathbf {H} =\mathbf {X} \left(\mathbf {X} ^{\textsf {T}}\mathbf {\Sigma } ^{-1}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}\mathbf {\Sigma } ^{-1}}

y nuevamente puede verse queH2=HH=H{\displaystyle H^{2}=H\cdot H=H}, aunque ahora ya no es simétrico.

Propiedades

La matriz de proyección tiene varias propiedades algebraicas útiles. [ 5 ] [ 6 ] En el lenguaje del álgebra lineal , la matriz de proyección es la proyección ortogonal sobre el espacio columna de la matriz de diseño.incógnita{\displaystyle \mathbf {X} }. [ 4 ] (Tenga en cuenta que(incógnitaTincógnita)1incógnitaT{\displaystyle \left(\mathbf {X} ^{\textsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}}es la pseudoinversa de X. ) Algunos hechos de la matriz de proyección en este contexto se resumen de la siguiente manera: [ 4 ]

  • =(IPAG)y,{\displaystyle \mathbf {u} =(\mathbf {I} -\mathbf {P} )\mathbf {y} ,}y=yPAGyincógnita.{\displaystyle \mathbf {u} =\mathbf {y} -\mathbf {P} \mathbf {y} \perp \mathbf {X} .}
  • PAG{\displaystyle \mathbf {P} }es simétrico, y también lo esMETRO:=IPAG{\displaystyle \mathbf {M} :=\mathbf {I} -\mathbf {P} } .
  • PAG{\displaystyle \mathbf {P} }es idempotente:PAG2=PAG{\displaystyle \mathbf {P} ^{2}=\mathbf {P} }y también lo esMETRO{\displaystyle \mathbf {M} }.
  • Siincógnita{\displaystyle \mathbf {X} }es una matriz n × r conrango(incógnita)=r{\displaystyle \operatorname {rank} (\mathbf {X} )=r}, entoncesrango(PAG)=r{\displaystyle \operatorname {rank} (\mathbf {P} )=r}
  • Los valores propios dePAG{\displaystyle \mathbf {P} }constan de r unos y nr ceros, mientras que los valores propios deMETRO{\displaystyle \mathbf {M} }consta de nr unos y r ceros. [ 7 ]
  • incógnita{\displaystyle \mathbf {X} }es invariante bajoPAG{\displaystyle \mathbf {P} } :PAGincógnita=incógnita,{\displaystyle \mathbf {PX} =\mathbf {X} ,}por eso(IPAG)incógnita=0{\displaystyle \left(\mathbf {I} -\mathbf {P} \right)\mathbf {X} =\mathbf {0} }.
  • (IPAG)PAG=PAG(IPAG)=0.{\displaystyle \left(\mathbf {I} -\mathbf {P} \right)\mathbf {P} =\mathbf {P} \left(\mathbf {I} -\mathbf {P} \right)=\mathbf {0} .}
  • PAG{\displaystyle \mathbf {P} }es único para ciertos subespacios.

La matriz de proyección correspondiente a un modelo lineal es simétrica e idempotente , es decir,PAG2=PAG{\displaystyle \mathbf {P} ^{2}=\mathbf {P} }Sin embargo, esto no siempre es así; en el suavizado de diagramas de dispersión ponderados localmente (LOESS) , por ejemplo, la matriz de proyección no es, en general, ni simétrica ni idempotente.

Para los modelos lineales , la traza de la matriz de proyección es igual al rango deincógnita{\displaystyle \mathbf {X} }, que es el número de parámetros independientes del modelo lineal. [ 8 ] Para otros modelos como LOESS que siguen siendo lineales en las observacionesy{\displaystyle \mathbf {y} }La matriz de proyección se puede utilizar para definir los grados de libertad efectivos del modelo.

Las aplicaciones prácticas de la matriz de proyección en el análisis de regresión incluyen el apalancamiento y la distancia de Cook , que se ocupan de identificar observaciones influyentes , es decir, observaciones que tienen un gran efecto en los resultados de una regresión.

Fórmula por bloques

Supongamos que la matriz de diseñoincógnita{\displaystyle \mathbf {X} }puede descomponerse por columnas comoincógnita=[AB]{\displaystyle \mathbf {X} ={\begin{bmatrix}\mathbf {A} &\mathbf {B} \end{bmatrix}}}. Defina el operador de proyección o de sombrero comoPAG[incógnita]:=incógnita(incógnitaTincógnita)1incógnitaT{\displaystyle \mathbf {P} [\mathbf {X} ]:=\mathbf {X} \left(\mathbf {X} ^{\textsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\textsf {T}}}. De manera similar, definimos el operador residual comoMETRO[incógnita]:=IPAG[incógnita]{\displaystyle \mathbf {M} [\mathbf {X} ]:=\mathbf {I} -\mathbf {P} [\mathbf {X} ]}. Entonces la matriz de proyección se puede descomponer de la siguiente manera: [ 9 ]

PAG[incógnita]=PAG[A]+PAG[METRO[A]B],{\displaystyle \mathbf {P} [\mathbf {X} ]=\mathbf {P} [\mathbf {A} ]+\mathbf {P} {\big [}\mathbf {M} [\mathbf {A} ]\mathbf {B} {\big ]},}

donde, por ejemplo,PAG[A]=A(ATA)1AT{\displaystyle \mathbf {P} [\mathbf {A} ]=\mathbf {A} \left(\mathbf {A} ^{\textsf {T}}\mathbf {A} \right)^{-1}\mathbf {A} ^{\textsf {T}}}yMETRO[A]=IPAG[A]{\displaystyle \mathbf {M} [\mathbf {A} ]=\mathbf {I} -\mathbf {P} [\mathbf {A} ]}Existen diversas aplicaciones de dicha descomposición. En la aplicación clásicaA{\displaystyle \mathbf {A} }es una columna de todos unos, lo que permite analizar los efectos de agregar un término de intersección a una regresión. Otro uso es en el modelo de efectos fijos , dondeA{\displaystyle \mathbf {A} }es una matriz dispersa grande de las variables ficticias para los términos de efectos fijos. Se puede usar esta partición para calcular la matriz de sombrero deincógnita{\displaystyle \mathbf {X} }sin formar explícitamente la matrizincógnita{\displaystyle \mathbf {X} }, que podría ser demasiado grande para caber en la memoria del ordenador.

Historia

La matriz sombrero fue introducida por John Wilder en 1972. Un artículo de Hoaglin, DC y Welsch, RE (1978) describe las propiedades de la matriz y también muchos ejemplos de su aplicación.

Véase también

Referencias

  1. Basilevsky, Alexander (2005). Álgebra matricial aplicada en las ciencias estadísticas . Dover. págs. 160–176 . ISBN  0-486-44538-0.
  2. "Asimilación de datos: Diagnóstico de la influencia de la observación en un sistema de asimilación de datos" (PDF) . Archivado del original (PDF) el 3 de septiembre de 2014.
  3. 1 2 Hoaglin, David C.; Welsch, Roy E. (febrero de 1978). "La matriz de sombrero en regresión y ANOVA" (PDF) . The American Statistician . 32 (1): 17– 22. doi : 10.2307/2683469 . hdl : 1721.1/1920 . JSTOR 2683469 . 
  4. 1 2 3 David A. Freedman (2009). Modelos estadísticos: teoría y práctica . Cambridge University Press .
  5. Gans, P. (1992). Ajuste de datos en las ciencias químicas . Wiley. ISBN 0-471-93412-7.
  6. Draper, NR; Smith, H. (1998). Análisis de regresión aplicada . Wiley. ISBN 0-471-17082-8.
  7. Amemiya, Takeshi (1985). Econometría avanzada . Cambridge: Harvard University Press. págs. 460-461 . ISBN  0-674-00560-0.
  8. "Prueba de que la traza de la matriz 'sombrero' en la regresión lineal es el rango de X" . Stack Exchange . 13 de abril de 2017.
  9. ^ Rao, C. Radhakrishna; Toutenburg, Helge; Shalabh; Heumann, cristiano (2008). Modelos lineales y generalizaciones (3ª ed.). Berlín: Springer. pag. 323 . ISBN   978-3-540-74226-5.