Articulo de referencia

Regresión de componentes principales

En estadística , la regresión de componentes principales ( PCR ) es una técnica de análisis de regresión que se basa en el análisis de componentes principales (PCA). La PCR es u...

En estadística , la regresión de componentes principales ( PCR ) es una técnica de análisis de regresión que se basa en el análisis de componentes principales (PCA). La PCR es una forma de regresión de rango reducido. [1] Más específicamente, la PCR se utiliza para estimar los coeficientes de regresión desconocidos en un modelo de regresión lineal estándar .

En la PCR, en lugar de hacer una regresión de la variable dependiente sobre las variables explicativas directamente, se utilizan los componentes principales de las variables explicativas como regresores . Normalmente, se utiliza solo un subconjunto de todos los componentes principales para la regresión, lo que convierte a la PCR en una especie de procedimiento regularizado y también en un tipo de estimador de contracción .

A menudo se seleccionan como regresores los componentes principales con mayores varianzas (aquellos basados ​​en vectores propios correspondientes a los mayores valores propios de la matriz de varianza-covarianza de la muestra de las variables explicativas). Sin embargo, para predecir el resultado, los componentes principales con varianzas bajas también pueden ser importantes, en algunos casos incluso más importantes. [2]

Un uso importante de la PCR consiste en superar el problema de multicolinealidad que surge cuando dos o más de las variables explicativas están cerca de ser colineales . [3] La PCR puede abordar adecuadamente estas situaciones al excluir algunos de los componentes principales de baja varianza en el paso de regresión. Además, al realizar una regresión generalmente solo sobre un subconjunto de todos los componentes principales, la PCR puede dar como resultado una reducción de la dimensión al reducir sustancialmente el número efectivo de parámetros que caracterizan el modelo subyacente. Esto puede ser particularmente útil en entornos con covariables de alta dimensión . Además, a través de la selección apropiada de los componentes principales que se utilizarán para la regresión, la PCR puede conducir a una predicción eficiente del resultado basado en el modelo supuesto.

El principio

El método PCR puede dividirse en tres pasos principales:

1. Realizar un PCA sobre la matriz de datos observados para las variables explicativas a fin de obtener los componentes principales y luego (generalmente) seleccionar un subconjunto, con base en algunos criterios apropiados, de los componentes principales así obtenidos para su uso posterior. {\estilo de visualización \;\;}
2. Ahora, haga una regresión del vector observado de resultados en los componentes principales seleccionados como covariables, utilizando la regresión de mínimos cuadrados ordinarios ( regresión lineal ) para obtener un vector de coeficientes de regresión estimados (con una dimensión igual al número de componentes principales seleccionados). {\estilo de visualización \;\;}
3. Ahora transforme este vector nuevamente a la escala de las covariables reales, utilizando las cargas de PCA seleccionadas (los vectores propios correspondientes a los componentes principales seleccionados) para obtener el estimador de PCR final (con dimensión igual al número total de covariables) para estimar los coeficientes de regresión que caracterizan el modelo original. {\estilo de visualización \;\;}

Detalles del método

Representación de datos: Sea el vector de resultados observados y la matriz de datos correspondiente de covariables observadas, donde y denotan el tamaño de la muestra observada y el número de covariables respectivamente, con . Cada una de las filas de denota un conjunto de observaciones para la covariable dimensional y la entrada respectiva de denota el resultado observado correspondiente. Y norte × 1 = ( y 1 , , y norte ) yo {\displaystyle \mathbf {Y} _{n\times 1}=\left(y_{1},\ldots ,y_{n}\right)^{T}} incógnita norte × pag = ( incógnita 1 , , incógnita norte ) yo {\displaystyle \mathbf {X} _{n\times p}=\left(\mathbf {x} _{1},\ldots ,\mathbf {x} _{n}\right)^{T}} norte {\estilo de visualización n} pag {\estilo de visualización p} norte pag {\displaystyle n\geq p} n {\displaystyle n} X {\displaystyle \mathbf {X} } p {\displaystyle p} Y {\displaystyle \mathbf {Y} }

Preprocesamiento de datos: Suponga que y cada una de las columnas de ya se han centrado de modo que todas ellas tienen medias empíricas cero . Este paso de centrado es crucial (al menos para las columnas de ) ya que la PCR implica el uso de PCA en y el PCA es sensible al centrado de los datos. Y {\displaystyle \mathbf {Y} } p {\displaystyle p} X {\displaystyle \mathbf {X} } X {\displaystyle \mathbf {X} } X {\displaystyle \mathbf {X} }

Modelo subyacente: después del centrado, el modelo de regresión lineal de Gauss-Markov estándar para on se puede representar como: donde denota el vector de parámetros desconocidos de los coeficientes de regresión y denota el vector de errores aleatorios con y para algún parámetro de varianza desconocido. Y {\displaystyle \mathbf {Y} } X {\displaystyle \mathbf {X} } Y = X β + ε , {\displaystyle \mathbf {Y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }},\;} β R p {\displaystyle {\boldsymbol {\beta }}\in \mathbb {R} ^{p}} ε {\displaystyle {\boldsymbol {\varepsilon }}} E ( ε ) = 0 {\displaystyle \operatorname {E} \left({\boldsymbol {\varepsilon }}\right)=\mathbf {0} \;} Var ( ε ) = σ 2 I n × n {\displaystyle \;\operatorname {Var} \left({\boldsymbol {\varepsilon }}\right)=\sigma ^{2}I_{n\times n}} σ 2 > 0 {\displaystyle \sigma ^{2}>0\;\;}

Objetivo: El objetivo principal es obtener un estimador eficiente para el parámetro , basado en los datos. Un enfoque que se utiliza con frecuencia para esto es la regresión de mínimos cuadrados ordinarios que, suponiendo que el rango de columna es completo , proporciona el estimador imparcial : de . La PCR es otra técnica que se puede utilizar para el mismo propósito de estimar . β ^ {\displaystyle {\widehat {\boldsymbol {\beta }}}} β {\displaystyle {\boldsymbol {\beta }}} X {\displaystyle \mathbf {X} } β ^ o l s = ( X T X ) 1 X T Y {\displaystyle {\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} }=(\mathbf {X} ^{T}\mathbf {X} )^{-1}\mathbf {X} ^{T}\mathbf {Y} } β {\displaystyle {\boldsymbol {\beta }}} β {\displaystyle {\boldsymbol {\beta }}}

Paso de PCA: PCR comienza realizando un PCA en la matriz de datos centrada . Para esto, denotemos la descomposición en valores singulares de donde, con denota los valores singulares no negativos de , mientras que las columnas de y son conjuntos ortonormales de vectores que denotan los vectores singulares izquierdo y derecho de respectivamente. X {\displaystyle \mathbf {X} } X = U Δ V T {\displaystyle \mathbf {X} =U\Delta V^{T}} X {\displaystyle \mathbf {X} } Δ p × p = diag [ δ 1 , , δ p ] {\displaystyle \Delta _{p\times p}=\operatorname {diag} \left[\delta _{1},\ldots ,\delta _{p}\right]} δ 1 δ p 0 {\displaystyle \delta _{1}\geq \cdots \geq \delta _{p}\geq 0} X {\displaystyle \mathbf {X} } U n × p = [ u 1 , , u p ] {\displaystyle U_{n\times p}=[\mathbf {u} _{1},\ldots ,\mathbf {u} _{p}]} V p × p = [ v 1 , , v p ] {\displaystyle V_{p\times p}=[\mathbf {v} _{1},\ldots ,\mathbf {v} _{p}]} X {\displaystyle \mathbf {X} }

Los componentes principales: dan una descomposición espectral de donde con denota los valores propios no negativos (también conocidos como valores principales ) de , mientras que las columnas de denotan el conjunto ortonormal correspondiente de vectores propios. Luego, y denotan respectivamente el componente principal y la dirección del componente principal (o carga PCA ) correspondiente al valor principal más grande para cada . V Λ V T {\displaystyle V\Lambda V^{T}} X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} } Λ p × p = diag [ λ 1 , , λ p ] = diag [ δ 1 2 , , δ p 2 ] = Δ 2 {\displaystyle \Lambda _{p\times p}=\operatorname {diag} \left[\lambda _{1},\ldots ,\lambda _{p}\right]=\operatorname {diag} \left[\delta _{1}^{2},\ldots ,\delta _{p}^{2}\right]=\Delta ^{2}} λ 1 λ p 0 {\displaystyle \lambda _{1}\geq \cdots \geq \lambda _{p}\geq 0} X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} } V {\displaystyle V} X v j {\displaystyle \mathbf {X} \mathbf {v} _{j}} v j {\displaystyle \mathbf {v} _{j}} j t h {\displaystyle j^{th}} j t h {\displaystyle j^{th}} j th {\displaystyle j^{\text{th}}} λ j {\displaystyle \lambda _{j}} j { 1 , , p } {\displaystyle j\in \{1,\ldots ,p\}}

Covariables derivadas: Para cualquier , denotemos la matriz con columnas ortonormales que consisten en las primeras columnas de . Denotemos la matriz que tiene los primeros componentes principales como sus columnas. puede verse como la matriz de datos obtenida al usar las covariables transformadas en lugar de usar las covariables originales . k { 1 , , p } {\displaystyle k\in \{1,\ldots ,p\}} V k {\displaystyle V_{k}} p × k {\displaystyle p\times k} k {\displaystyle k} V {\displaystyle V} W k = X V k {\displaystyle W_{k}=\mathbf {X} V_{k}} = [ X v 1 , , X v k ] {\displaystyle =[\mathbf {X} \mathbf {v} _{1},\ldots ,\mathbf {X} \mathbf {v} _{k}]} n × k {\displaystyle n\times k} k {\displaystyle k} W {\displaystyle W} x i k = V k T x i R k {\displaystyle \mathbf {x} _{i}^{k}=V_{k}^{T}\mathbf {x} _{i}\in \mathbb {R} ^{k}} x i R p 1 i n {\displaystyle \mathbf {x} _{i}\in \mathbb {R} ^{p}\;\;\forall \;\;1\leq i\leq n}

Estimador PCR: Sea el vector de coeficientes de regresión estimados obtenidos mediante regresión de mínimos cuadrados ordinarios del vector de respuesta en la matriz de datos . Entonces, para cualquier , el estimador PCR final de basado en el uso de los primeros componentes principales viene dado por: . γ ^ k = ( W k T W k ) 1 W k T Y R k {\displaystyle {\widehat {\gamma }}_{k}=(W_{k}^{T}W_{k})^{-1}W_{k}^{T}\mathbf {Y} \in \mathbb {R} ^{k}} Y {\displaystyle \mathbf {Y} } W k {\displaystyle W_{k}} k { 1 , , p } {\displaystyle k\in \{1,\ldots ,p\}} β {\displaystyle {\boldsymbol {\beta }}} k {\displaystyle k} β ^ k = V k γ ^ k R p {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}=V_{k}{\widehat {\gamma }}_{k}\in \mathbb {R} ^{p}}

Características fundamentales y aplicaciones del estimador PCR

Dos propiedades básicas

El proceso de ajuste para obtener el estimador PCR implica la regresión del vector de respuesta sobre la matriz de datos derivada que tiene columnas ortogonales para cualquier, ya que los componentes principales son mutuamente ortogonales entre sí. Por lo tanto, en el paso de regresión, realizar una regresión lineal múltiple de manera conjunta sobre los componentes principales seleccionados como covariables es equivalente a realizar regresiones lineales simples independientes (o regresiones univariadas) por separado sobre cada uno de los componentes principales seleccionados como covariable. W k {\displaystyle W_{k}} k { 1 , , p } {\displaystyle k\in \{1,\ldots ,p\}} k {\displaystyle k} k {\displaystyle k} k {\displaystyle k}

Cuando se seleccionan todos los componentes principales para la regresión de modo que , entonces el estimador PCR es equivalente al estimador de mínimos cuadrados ordinarios . Por lo tanto, . Esto se ve fácilmente a partir del hecho de que y también observando que es una matriz ortogonal . k = p {\displaystyle k=p} β ^ p = β ^ o l s {\displaystyle {\widehat {\boldsymbol {\beta }}}_{p}={\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} }} W p = X V p = X V {\displaystyle W_{p}=\mathbf {X} V_{p}=\mathbf {X} V} V {\displaystyle V}

Reducción de la varianza

Para cualquier , la varianza de está dada por k { 1 , , p } {\displaystyle k\in \{1,\ldots ,p\}} β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}}

Var ( β ^ k ) = σ 2 V k ( W k T W k ) 1 V k T = σ 2 V k diag ( λ 1 1 , , λ k 1 ) V k T = σ 2 j = 1 k v j v j T λ j . {\displaystyle \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{k})=\sigma ^{2}\;V_{k}(W_{k}^{T}W_{k})^{-1}V_{k}^{T}=\sigma ^{2}\;V_{k}\;\operatorname {diag} \left(\lambda _{1}^{-1},\ldots ,\lambda _{k}^{-1}\right)V_{k}^{T}=\sigma ^{2}\sideset {}{}\sum _{j=1}^{k}{\frac {\mathbf {v} _{j}\mathbf {v} _{j}^{T}}{\lambda _{j}}}.}

En particular:

Var ( β ^ p ) = Var ( β ^ o l s ) = σ 2 j = 1 p v j v j T λ j . {\displaystyle \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{p})=\operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })=\sigma ^{2}\sideset {}{}\sum _{j=1}^{p}{\frac {\mathbf {v} _{j}\mathbf {v} _{j}^{T}}{\lambda _{j}}}.}

Por lo tanto para todos tenemos: k { 1 , , p 1 } {\displaystyle k\in \{1,\ldots ,p-1\}}

Var ( β ^ o l s ) Var ( β ^ k ) = σ 2 j = k + 1 p v j v j T λ j . {\displaystyle \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })-\operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{k})=\sigma ^{2}\sideset {}{}\sum _{j=k+1}^{p}{\frac {\mathbf {v} _{j}\mathbf {v} _{j}^{T}}{\lambda _{j}}}.}

Así pues, para todo lo que tenemos es: k { 1 , , p } {\displaystyle k\in \{1,\ldots ,p\}}

Var ( β ^ o l s ) Var ( β ^ k ) 0 {\displaystyle \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })-\operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{k})\succeq 0}

donde indica que una matriz simétrica cuadrada es definida no negativa . En consecuencia, cualquier forma lineal dada del estimador PCR tiene una varianza menor en comparación con la de la misma forma lineal del estimador de mínimos cuadrados ordinarios. A 0 {\displaystyle A\succeq 0} A {\displaystyle A}

Abordar la multicolinealidad

En el marco de la multicolinealidad , dos o más de las covariables están altamente correlacionadas , de modo que una puede predecirse linealmente a partir de las otras con un grado de precisión no trivial. En consecuencia, las columnas de la matriz de datos que corresponden a las observaciones de estas covariables tienden a volverse linealmente dependientes y, por lo tanto, tienden a volverse deficientes en rango , perdiendo su estructura de rango de columna completa. Más cuantitativamente, uno o más de los valores propios más pequeños de se acercan mucho o se vuelven exactamente iguales a en tales situaciones. Las expresiones de varianza anteriores indican que estos pequeños valores propios tienen el efecto de inflación máximo en la varianza del estimador de mínimos cuadrados, desestabilizando así significativamente el estimador cuando están cerca de . Este problema se puede abordar de manera eficaz mediante el uso de un estimador de PCR obtenido excluyendo los componentes principales correspondientes a estos pequeños valores propios. X {\displaystyle \mathbf {X} } X {\displaystyle \mathbf {X} } X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} } 0 {\displaystyle 0} 0 {\displaystyle 0}

Reducción de dimensión

La PCR también se puede utilizar para realizar una reducción de dimensión . Para ver esto, denotemos cualquier matriz que tenga columnas ortonormales, para cualquier Supongamos ahora que queremos aproximar cada una de las observaciones de covariables a través de la transformación lineal de rangos para algún . L k {\displaystyle L_{k}} p × k {\displaystyle p\times k} k { 1 , , p } . {\displaystyle k\in \{1,\ldots ,p\}.} x i {\displaystyle \mathbf {x} _{i}} k {\displaystyle k} L k z i {\displaystyle L_{k}\mathbf {z} _{i}} z i R k ( 1 i n ) {\displaystyle \mathbf {z} _{i}\in \mathbb {R} ^{k}(1\leq i\leq n)}

Entonces, se puede demostrar que

i = 1 n x i L k z i 2 {\displaystyle \sum _{i=1}^{n}\left\|\mathbf {x} _{i}-L_{k}\mathbf {z} _{i}\right\|^{2}}

se minimiza en la matriz con las direcciones del primer componente principal como columnas y las covariables derivadas dimensionales correspondientes. Por lo tanto, los componentes principales dimensionales proporcionan la mejor aproximación lineal de rango a la matriz de datos observada . L k = V k , {\displaystyle L_{k}=V_{k},} k {\displaystyle k} z i = x i k = V k T x i , {\displaystyle \mathbf {z} _{i}=\mathbf {x} _{i}^{k}=V_{k}^{T}\mathbf {x} _{i},} k {\displaystyle k} k {\displaystyle k} k {\displaystyle k} X {\displaystyle \mathbf {X} }

El error de reconstrucción correspondiente viene dado por:

i = 1 n x i V k x i k 2 = { j = k + 1 n λ j 1 k < p 0 k = p {\displaystyle \sum _{i=1}^{n}\left\|\mathbf {x} _{i}-V_{k}\mathbf {x} _{i}^{k}\right\|^{2}={\begin{cases}\sum _{j=k+1}^{n}\lambda _{j}&1\leqslant k<p\\0&k=p\end{cases}}}

Por lo tanto, cualquier reducción de dimensión potencial puede lograrse eligiendo , el número de componentes principales que se utilizarán, mediante la umbralización apropiada en la suma acumulativa de los valores propios de . Dado que los valores propios más pequeños no contribuyen significativamente a la suma acumulativa, los componentes principales correspondientes pueden continuar omitiéndose siempre que no se exceda el límite de umbral deseado. Los mismos criterios también pueden usarse para abordar el problema de multicolinealidad mediante el cual los componentes principales correspondientes a los valores propios más pequeños pueden ignorarse siempre que se mantenga el límite de umbral. k {\displaystyle k} X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} }

Efecto de regularización

Dado que el estimador PCR normalmente utiliza solo un subconjunto de todos los componentes principales para la regresión, se lo puede considerar como una especie de procedimiento regularizado . Más específicamente, para cualquier , el estimador PCR denota la solución regularizada al siguiente problema de minimización restringida : 1 k < p {\displaystyle 1\leqslant k<p} β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}}

min β R p Y X β 2  subject to  β { v k + 1 , , v p } . {\displaystyle \min _{{\boldsymbol {\beta }}_{*}\in \mathbb {R} ^{p}}\left\|\mathbf {Y} -\mathbf {X} {\boldsymbol {\beta }}_{*}\right\|^{2}\quad {\text{ subject to }}\quad {\boldsymbol {\beta }}_{*}\perp \{\mathbf {v} _{k+1},\ldots ,\mathbf {v} _{p}\}.}

La restricción puede escribirse de forma equivalente como:

V ( p k ) T β = 0 , {\displaystyle V_{(p-k)}^{T}{\boldsymbol {\beta }}_{*}=\mathbf {0} ,}

dónde:

V ( p k ) = [ v k + 1 , , v p ] p × ( p k ) . {\displaystyle V_{(p-k)}=\left[\mathbf {v} _{k+1},\ldots ,\mathbf {v} _{p}\right]_{p\times (p-k)}.}

Por lo tanto, cuando solo se selecciona un subconjunto adecuado de todos los componentes principales para la regresión, el estimador de PCR así obtenido se basa en una forma estricta de regularización que restringe la solución resultante al espacio de columnas de las direcciones de los componentes principales seleccionados y, en consecuencia, la restringe para que sea ortogonal a las direcciones excluidas.

Optimalidad de la PCR entre una clase de estimadores regularizados

Dado el problema de minimización restringida tal como se definió anteriormente, considere la siguiente versión generalizada del mismo:

min β R p Y X β 2  subject to  L ( p k ) T β = 0 {\displaystyle \min _{{\boldsymbol {\beta }}_{*}\in \mathbb {R} ^{p}}\|\mathbf {Y} -\mathbf {X} {\boldsymbol {\beta }}_{*}\|^{2}\quad {\text{ subject to }}\quad L_{(p-k)}^{T}{\boldsymbol {\beta }}_{*}=\mathbf {0} }

donde, denota cualquier matriz de rango de columna completa de orden con . L ( p k ) {\displaystyle L_{(p-k)}} p × ( p k ) {\displaystyle p\times (p-k)} 1 k < p {\displaystyle 1\leqslant k<p}

Sea la solución correspondiente. Por lo tanto β ^ L {\displaystyle {\widehat {\boldsymbol {\beta }}}_{L}}

β ^ L = arg min β R p Y X β 2  subject to  L ( p k ) T β = 0 . {\displaystyle {\widehat {\boldsymbol {\beta }}}_{L}=\arg \min _{{\boldsymbol {\beta }}_{*}\in \mathbb {R} ^{p}}\|\mathbf {Y} -\mathbf {X} {\boldsymbol {\beta }}_{*}\|^{2}\quad {\text{ subject to }}\quad L_{(p-k)}^{T}{\boldsymbol {\beta }}_{*}=\mathbf {0} .}

Entonces, la elección óptima de la matriz de restricción para la cual el estimador correspondiente logra el error de predicción mínimo viene dada por: [4] L ( p k ) {\displaystyle L_{(p-k)}} β ^ L {\displaystyle {\widehat {\boldsymbol {\beta }}}_{L}}

L ( p k ) = V ( p k ) Λ ( p k ) 1 / 2 , {\displaystyle L_{(p-k)}^{*}=V_{(p-k)}\Lambda _{(p-k)}^{1/2},}

dónde

Λ ( p k ) 1 / 2 = diag ( λ k + 1 1 / 2 , , λ p 1 / 2 ) . {\displaystyle \Lambda _{(p-k)}^{1/2}=\operatorname {diag} \left(\lambda _{k+1}^{1/2},\ldots ,\lambda _{p}^{1/2}\right).}

Claramente, el estimador óptimo resultante viene dado simplemente por el estimador PCR basado en los primeros componentes principales. β ^ L {\displaystyle {\widehat {\boldsymbol {\beta }}}_{L^{*}}} β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}} k {\displaystyle k}

Eficiencia

Dado que el estimador de mínimos cuadrados ordinarios es imparcial para , tenemos β {\displaystyle {\boldsymbol {\beta }}}

Var ( β ^ o l s ) = MSE ( β ^ o l s ) , {\displaystyle \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })=\operatorname {MSE} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} }),}

donde, MSE denota el error cuadrático medio . Ahora, si para algún , además tenemos: , entonces el correspondiente también es imparcial para y por lo tanto k { 1 , , p } {\displaystyle k\in \{1,\ldots ,p\}} V ( p k ) T β = 0 {\displaystyle V_{(p-k)}^{T}{\boldsymbol {\beta }}=\mathbf {0} } β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}} β {\displaystyle {\boldsymbol {\beta }}}

Var ( β ^ k ) = MSE ( β ^ k ) . {\displaystyle \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{k})=\operatorname {MSE} ({\widehat {\boldsymbol {\beta }}}_{k}).}

Ya lo hemos visto

j { 1 , , p } : Var ( β ^ o l s ) Var ( β ^ j ) 0 , {\displaystyle \forall j\in \{1,\ldots ,p\}:\quad \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })-\operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{j})\succeq 0,}

Lo que entonces implica:

MSE ( β ^ o l s ) MSE ( β ^ k ) 0 {\displaystyle \operatorname {MSE} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })-\operatorname {MSE} ({\widehat {\boldsymbol {\beta }}}_{k})\succeq 0}

para ese . Por lo tanto, en ese caso, el correspondiente sería un estimador más eficiente de en comparación con , basándose en el uso del error cuadrático medio como criterio de rendimiento. Además, cualquier forma lineal dada del correspondiente también tendría un error cuadrático medio menor en comparación con el de la misma forma lineal de . k {\displaystyle k} β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}} β {\displaystyle {\boldsymbol {\beta }}} β ^ o l s {\displaystyle {\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} }} β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}} β ^ o l s {\displaystyle {\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} }}

Ahora supongamos que para un determinado . Entonces el correspondiente está sesgado para . Sin embargo, dado que k { 1 , , p } , V ( p k ) T β 0 {\displaystyle k\in \{1,\ldots ,p\},V_{(p-k)}^{T}{\boldsymbol {\beta }}\neq \mathbf {0} } β ^ k {\displaystyle {\widehat {\boldsymbol {\beta }}}_{k}} β {\displaystyle {\boldsymbol {\beta }}}

k { 1 , , p } : Var ( β ^ o l s ) Var ( β ^ k ) 0 , {\displaystyle \forall k\in \{1,\ldots ,p\}:\quad \operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })-\operatorname {Var} ({\widehat {\boldsymbol {\beta }}}_{k})\succeq 0,}

Todavía es posible que , especialmente si es tal que los componentes principales excluidos corresponden a los valores propios más pequeños, lo que resulta en un sesgo menor . MSE ( β ^ o l s ) MSE ( β ^ k ) 0 {\displaystyle \operatorname {MSE} ({\widehat {\boldsymbol {\beta }}}_{\mathrm {ols} })-\operatorname {MSE} ({\widehat {\boldsymbol {\beta }}}_{k})\succeq 0} k {\displaystyle k}

Para asegurar un desempeño eficiente de estimación y predicción de PCR como estimador de , Park (1981) [4] propone la siguiente guía para seleccionar los componentes principales que se utilizarán para la regresión: Eliminar el componente principal si y solo si La implementación práctica de esta guía, por supuesto, requiere estimaciones para los parámetros desconocidos del modelo y . En general, se pueden estimar utilizando las estimaciones de mínimos cuadrados sin restricciones obtenidas del modelo completo original. Sin embargo, Park (1981) proporciona un conjunto ligeramente modificado de estimaciones que pueden ser más adecuadas para este propósito. [4] β {\displaystyle {\boldsymbol {\beta }}} j t h {\displaystyle j^{th}} λ j < ( p σ 2 ) / β T β . {\displaystyle \lambda _{j}<(p\sigma ^{2})/{\boldsymbol {\beta }}^{T}{\boldsymbol {\beta }}.} σ 2 {\displaystyle \sigma ^{2}} β {\displaystyle {\boldsymbol {\beta }}}

A diferencia de los criterios basados ​​en la suma acumulada de los valores propios de , que probablemente sean más adecuados para abordar el problema de multicolinealidad y para realizar la reducción de dimensión, los criterios anteriores en realidad intentan mejorar la predicción y la eficiencia de la estimación del estimador PCR al involucrar tanto el resultado como las covariables en el proceso de selección de los componentes principales que se utilizarán en el paso de regresión. Los enfoques alternativos con objetivos similares incluyen la selección de los componentes principales basados ​​en la validación cruzada o los criterios C p de Mallow . A menudo, los componentes principales también se seleccionan en función de su grado de asociación con el resultado. X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} }

Efecto de contracción de la PCR

En general, PCR es esencialmente un estimador de contracción que usualmente retiene los componentes principales de alta varianza (correspondientes a los autovalores más altos de ) como covariables en el modelo y descarta los componentes de baja varianza restantes (correspondientes a los autovalores más bajos de ). Por lo tanto, ejerce un efecto de contracción discreto sobre los componentes de baja varianza anulando su contribución completamente en el modelo original. En contraste, el estimador de regresión de cresta ejerce un efecto de contracción suave a través del parámetro de regularización (o el parámetro de ajuste) inherentemente involucrado en su construcción. Si bien no descarta completamente ninguno de los componentes, ejerce un efecto de contracción sobre todos ellos de manera continua de modo que el grado de contracción es mayor para los componentes de baja varianza y menor para los componentes de alta varianza. Frank y Friedman (1993) [5] concluyen que para el propósito de la predicción en sí, el estimador de cresta, debido a su efecto de contracción suave, es quizás una mejor opción en comparación con el estimador PCR que tiene un efecto de contracción discreto. X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} } X T X {\displaystyle \mathbf {X} ^{T}\mathbf {X} }

Además, los componentes principales se obtienen a partir de la descomposición propia que involucra las observaciones de las variables explicativas únicamente. Por lo tanto, el estimador PCR resultante obtenido al utilizar estos componentes principales como covariables no necesariamente tiene que tener un desempeño predictivo satisfactorio para el resultado. Un estimador algo similar que intenta abordar esta cuestión a través de su propia construcción es el estimador de mínimos cuadrados parciales (PLS). De manera similar a la PCR, el PLS también utiliza covariables derivadas de dimensiones inferiores. Sin embargo, a diferencia de la PCR, las covariables derivadas para PLS se obtienen en función del uso tanto del resultado como de las covariables. Mientras que la PCR busca las direcciones de alta varianza en el espacio de las covariables, el PLS busca las direcciones en el espacio de covariables que son más útiles para la predicción del resultado. X {\displaystyle \mathbf {X} }

En 2006 se propuso una variante de la PCR clásica conocida como PCR supervisada . [6] En un espíritu similar al de PLS, intenta obtener covariables derivadas de dimensiones inferiores basándose en un criterio que involucra tanto el resultado como las covariables. El método comienza realizando un conjunto de regresiones lineales simples (o regresiones univariadas) en las que el vector de resultado se regresa por separado en cada una de las covariables tomadas una a la vez. Luego, para algunos , las primeras covariables que resultan ser las más correlacionadas con el resultado (según el grado de significancia de los coeficientes de regresión estimados correspondientes) se seleccionan para su uso posterior. Luego se realiza una PCR convencional, como se describió anteriormente, pero ahora se basa solo en la matriz de datos correspondiente a las observaciones para las covariables seleccionadas. El número de covariables utilizadas: y el número posterior de componentes principales utilizados: generalmente se seleccionan mediante validación cruzada . p {\displaystyle p} p {\displaystyle p} m { 1 , , p } {\displaystyle m\in \{1,\ldots ,p\}} m {\displaystyle m} n × m {\displaystyle n\times m} m { 1 , , p } {\displaystyle m\in \{1,\ldots ,p\}} k { 1 , , m } {\displaystyle k\in \{1,\ldots ,m\}}

Generalización a la configuración del kernel

El método PCR clásico descrito anteriormente se basa en el PCA clásico y considera un modelo de regresión lineal para predecir el resultado en función de las covariables. Sin embargo, se puede generalizar fácilmente a una configuración de máquina kernel en la que la función de regresión no necesariamente debe ser lineal en las covariables, sino que puede pertenecer al espacio de Hilbert del kernel reproductor asociado con cualquier kernel arbitrario (posiblemente no lineal ), simétrico y definido positivo . El modelo de regresión lineal resulta ser un caso especial de esta configuración cuando se elige que la función kernel sea el kernel lineal .

En general, en la configuración de la máquina kernel , el vector de covariables se mapea primero en un espacio de características de alta dimensión (potencialmente de dimensión infinita ) caracterizado por la función kernel elegida. El mapeo así obtenido se conoce como el mapa de características y cada una de sus coordenadas , también conocidas como los elementos de característica , corresponde a una característica (puede ser lineal o no lineal ) de las covariables. Luego se supone que la función de regresión es una combinación lineal de estos elementos de característica . Por lo tanto, el modelo de regresión subyacente en la configuración de la máquina kernel es esencialmente un modelo de regresión lineal con el entendimiento de que en lugar del conjunto original de covariables, los predictores ahora están dados por el vector (potencialmente de dimensión infinita ) de elementos de característica obtenidos al transformar las covariables reales utilizando el mapa de características .

Sin embargo, el truco del núcleo nos permite operar en el espacio de características sin calcular explícitamente el mapa de características . Resulta que solo es suficiente calcular los productos internos por pares entre los mapas de características para los vectores de covariables observados y estos productos internos simplemente se dan por los valores de la función del núcleo evaluada en los pares correspondientes de vectores de covariables. Por lo tanto, los productos internos por pares así obtenidos pueden representarse en forma de una matriz definida no negativa simétrica también conocida como matriz del núcleo . n × n {\displaystyle n\times n}

La PCR en la configuración de la máquina kernel ahora se puede implementar centrando primero de manera apropiada esta matriz kernel (K, por ejemplo) con respecto al espacio de características y luego realizando un PCA kernel en la matriz kernel centrada (K', por ejemplo) con lo que se obtiene una descomposición propia de K'. La PCR kernel luego procede seleccionando (generalmente) un subconjunto de todos los vectores propios así obtenidos y luego realizando una regresión lineal estándar del vector de resultado en estos vectores propios seleccionados . Los vectores propios que se usarán para la regresión generalmente se seleccionan utilizando validación cruzada . Los coeficientes de regresión estimados (que tienen la misma dimensión que el número de vectores propios seleccionados) junto con los vectores propios seleccionados correspondientes se usan luego para predecir el resultado de una observación futura. En aprendizaje automático , esta técnica también se conoce como regresión espectral .

Claramente, la PCR de kernel tiene un efecto de contracción discreto sobre los vectores propios de K', bastante similar al efecto de contracción discreto de la PCR clásica sobre los componentes principales, como se discutió anteriormente. Sin embargo, el mapa de características asociado con el kernel elegido podría ser potencialmente de dimensión infinita y, por lo tanto, los componentes principales correspondientes y las direcciones de los componentes principales también podrían ser de dimensión infinita. Por lo tanto, estas cantidades son a menudo prácticamente intratables bajo la configuración de la máquina kernel. La PCR de kernel esencialmente resuelve este problema considerando una formulación dual equivalente basada en el uso de la descomposición espectral de la matriz kernel asociada. Bajo el modelo de regresión lineal (que corresponde a la elección de la función kernel como kernel lineal), esto equivale a considerar una descomposición espectral de la matriz kernel correspondiente y luego hacer una regresión del vector de resultado en un subconjunto seleccionado de los vectores propios así obtenidos. Se puede demostrar fácilmente que esto es lo mismo que hacer una regresión del vector de resultado en los componentes principales correspondientes (que son de dimensión finita en este caso), como se define en el contexto de la PCR clásica. Por lo tanto, para el núcleo lineal, la PCR de núcleo basada en una formulación dual es exactamente equivalente a la PCR clásica basada en una formulación primaria. Sin embargo, para núcleos arbitrarios (y posiblemente no lineales), esta formulación primaria puede volverse intratable debido a la dimensionalidad infinita del mapa de características asociado. Por lo tanto, la PCR clásica se vuelve prácticamente inviable en ese caso, pero la PCR de núcleo basada en la formulación dual sigue siendo válida y computacionalmente escalable. n × n {\displaystyle n\times n} X X T {\displaystyle \mathbf {X} \mathbf {X} ^{T}} X X T {\displaystyle \mathbf {X} \mathbf {X} ^{T}}

Véase también

Referencias

  1. ^ Schmidli, Heinz (13 de marzo de 2013). Regresión de rango reducido: con aplicaciones a las relaciones cuantitativas entre estructura y actividad. Springer. ISBN 978-3-642-50015-2.
  2. ^ Jolliffe, Ian T. (1982). "Una nota sobre el uso de componentes principales en regresión". Journal of the Royal Statistical Society, Serie C . 31 (3): 300–303. doi :10.2307/2348005. JSTOR  2348005.
  3. ^ Dodge, Y. (2003) Diccionario Oxford de términos estadísticos , OUP. ISBN 0-19-920613-9 
  4. ^ abc Sung H. Park (1981). "Colinealidad y restricciones óptimas en los parámetros de regresión para estimar respuestas". Technometrics . 23 (3): 289–295. doi :10.2307/1267793. JSTOR  1267793.
  5. ^ Lldiko E. Frank y Jerome H. Friedman (1993). "Una visión estadística de algunas herramientas de regresión quimiométrica". Technometrics . 35 (2): 109–135. doi :10.1080/00401706.1993.10485033.
  6. ^ Eric Bair; Trevor Hastie; Debashis Paul; Robert Tibshirani (2006). "Predicción mediante componentes principales supervisados". Revista de la Asociación Estadounidense de Estadística . 101 (473): 119–137. CiteSeerX 10.1.1.516.2313 . doi :10.1198/016214505000000628. 

Lectura adicional

  • Amemiya, Takeshi (1985). Econometría avanzada. Harvard University Press. Págs. 57-60. ISBN. 978-0-674-00560-0.
  • Theil, Henri (1971). Principios de econometría. Wiley. Págs. 46-55. ISBN. 978-0-471-85845-4.
Retrieved from "https://en.wikipedia.org/w/index.php?title=Principal_component_regression&oldid=1256288436"