Articulo de referencia

estadística de alta dimensión

En teoría estadística , el campo de la estadística de alta dimensión estudia datos cuya dimensión es mayor (en relación con el número de puntos de datos) que la que se suele con...

En teoría estadística , el campo de la estadística de alta dimensión estudia datos cuya dimensión es mayor (en relación con el número de puntos de datos) que la que se suele considerar en el análisis multivariante clásico . Esta área surgió debido a la aparición de muchos conjuntos de datos modernos en los que la dimensión de los vectores de datos puede ser comparable o incluso mayor que el tamaño de la muestra , por lo que faltaba justificación para el uso de técnicas tradicionales, a menudo basadas en argumentos asintóticos con la dimensión fija a medida que aumentaba el tamaño de la muestra. [ 1 ] [ 2 ]

Existen varias nociones de análisis de alta dimensión de métodos estadísticos, entre las que se incluyen:

  • Resultados no asintóticos que se aplican para valores finitosnorte,pag{\displaystyle n,p}(número de puntos de datos y tamaño de la dimensión, respectivamente).
  • Asintótica de Kolmogorov que estudia el comportamiento asintótico donde la razónnorte/pag{\displaystyle n/p}converge a un valor finito específico. [ 3 ]

Ejemplos

Estimación de parámetros en modelos lineales

Ilustración del modelo lineal en altas dimensiones: un conjunto de datos consta de un vector de respuesta.YRnorte{\displaystyle Y\in \mathbb {R} ^{n}}y una matriz de diseñoincógnitaRnorte×pag{\displaystyle X\in \mathbb {R} ^{n\times p}}conpagnorte{\displaystyle p\gg n}Nuestro objetivo es estimar el vector desconocido.β=(β1,,βpag)Rpag{\displaystyle \beta =(\beta _{1},\dots ,\beta _{p})\in \mathbb {R} ^{p}}de coeficientes de regresión dondeβ{\displaystyle \beta }A menudo se supone que es escaso , en el sentido de que la cardinalidad del conjuntoS:={j:βj0}{\displaystyle S:=\{j:\beta _ {j}\neq 0\}}es pequeño en comparación conpag{\displaystyle p}.

El modelo estadístico más básico para la relación entre un vector de covariablesincógnitaRpag{\displaystyle x\in \mathbb {R} ^{p}}y una variable de respuestayR{\displaystyle y\in \mathbb {R} }es el modelo lineal

y=incógnitaβ+ϵ,{\displaystyle y=x^{\top }\beta +\epsilon ,}

dóndeβRpag{\displaystyle \beta \in \mathbb {R} ^{p}}es un vector de parámetros desconocido, yϵ{\displaystyle \epsilon }es ruido aleatorio con media cero y varianzaσ2{\displaystyle \sigma ^{2}}. Dadas las respuestas independientesY1,,Ynorte{\displaystyle Y_{1},\ldots ,Y_{n}}, con las covariables correspondientesincógnita1,,incógnitanorte{\displaystyle x_{1},\ldots ,x_{n}}A partir de este modelo, podemos formar el vector de respuesta.Y=(Y1,,Ynorte){\displaystyle Y=(Y_{1},\ldots,Y_{n})^{\top }}y matriz de diseñoincógnita=(incógnita1,,incógnitanorte)Rnorte×pag{\displaystyle X=(x_{1},\ldots ,x_{n})^{\top }\in \mathbb {R} ^{n\times p}}. Cuandonortepag{\displaystyle n\geq p}y la matriz de diseño tiene rango de columna completo (es decir, sus columnas son linealmente independientes ), el estimador de mínimos cuadrados ordinarios deβ{\displaystyle \beta }es

β^:=(incógnitaincógnita)1incógnitaY.{\displaystyle {\hat {\beta }}:=(X^{\top }X)^{-1}X^{\top }Y.}

Cuandoϵnorte(0,σ2){\displaystyle \epsilon \sim N(0,\sigma ^{2})}, se sabe queβ^nortepag(β,σ2(incógnitaincógnita)1){\displaystyle {\hat {\beta }}\sim N_{p}{\bigl (}\beta ,\sigma ^{2}(X^{\top }X)^{-1}{\bigr )}}. De este modo,β^{\displaystyle {\sombrero {\beta }}}es un estimador insesgado deβ{\displaystyle \beta }y el teorema de Gauss-Markov nos dice que es el mejor estimador lineal insesgado .

Sin embargo, el sobreajuste es una preocupación cuandopag{\displaystyle p}es de magnitud comparable anorte{\displaystyle n}: la matrizincógnitaincógnita{\displaystyle X^{\top }X}en la definición deβ^{\displaystyle {\sombrero {\beta }}}puede volverse mal condicionado , con un pequeño valor propio mínimo . En tales circunstanciasmi(β^β2)=σ2tr((incógnitaincógnita)1){\displaystyle \mathbb {E} (\|{\hat {\beta }}-\beta \|^{2})=\sigma ^{2}\mathrm {tr} {\bigl (}(X^{\top }X)^{-1}{\bigr )}}será grande (ya que la traza de una matriz es la suma de sus valores propios). Peor aún, cuandopag>norte{\displaystyle p>n}, la matrizincógnitaincógnita{\displaystyle X^{\top }X}es singular . (Véase la Sección 1.2 y el Ejercicio 1.2 en [ 1 ] .)

Es importante señalar que el deterioro en el rendimiento de la estimación en dimensiones altas observado en el párrafo anterior no se limita al estimador de mínimos cuadrados ordinarios. De hecho, la inferencia estadística en dimensiones altas es intrínsecamente difícil, un fenómeno conocido como la maldición de la dimensionalidad , y se puede demostrar que ningún estimador puede hacerlo mejor en el peor de los casos sin información adicional (véase el Ejemplo 15.10 [ 2 ] ). Sin embargo, la situación en la estadística de alta dimensión puede no ser desesperada cuando los datos poseen alguna estructura de baja dimensión. Una suposición común para la regresión lineal de alta dimensión es que el vector de coeficientes de regresión es disperso , en el sentido de que la mayoría de las coordenadas deβ{\displaystyle \beta }son cero. Se han propuesto muchos procedimientos estadísticos, incluido el Lasso , para ajustar modelos lineales de alta dimensión bajo tales supuestos de escasez.

Estimación de la matriz de covarianza

Otro ejemplo de un fenómeno estadístico de alta dimensión se puede encontrar en el problema de la estimación de la matriz de covarianza . Supongamos que observamosincógnita1,,incógnitanorteRpag{\displaystyle X_{1},\ldots ,X_{n}\in \mathbb {R} ^{p}}, que son extracciones i.i.d. de alguna distribución de media cero con una matriz de covarianza desconocidaΣRpag×pag{\displaystyle \Sigma \in \mathbb {R} ^{p\times p}}. Un estimador natural insesgado deΣ{\displaystyle \Sigma }es la matriz de covarianza de la muestra

Σ^:=1nortei=1norteincógnitaiincógnitai.{\displaystyle {\widehat {\Sigma }}:={\frac {1}{n}}\sum _{i=1}^{n}X_{i}X_{i}^{\top }.}

En el entorno de baja dimensión dondenorte{\displaystyle n}aumenta ypag{\displaystyle p}se mantiene fijo,Σ^{\displaystyle {\widehat {\Sigma }}}es un estimador consistente deΣ{\displaystyle \Sigma }en cualquier norma matricial . Cuandopag{\displaystyle p}crece connorte{\displaystyle n}Por otro lado, este resultado de consistencia puede no cumplirse. Como ejemplo, supongamos que cadaincógnitainortepag(0,I){\displaystyle X_{i}\sim N_{p}(0,I)}ypag/norteα(0,1){\displaystyle p/n\rightarrow \alpha \in (0,1)}. SiΣ^{\displaystyle {\widehat {\Sigma }}}debían estimar de forma consistenteΣ=I{\displaystyle \Sigma =I}, entonces los valores propios deΣ^{\displaystyle {\widehat {\Sigma }}}debería acercarse a uno comonorte{\displaystyle n}aumenta. Resulta que este no es el caso en este entorno de alta dimensión. De hecho, los autovalores más grandes y más pequeños deΣ^{\displaystyle {\widehat {\Sigma }}}concentrarse en(1+α)2{\displaystyle (1+{\sqrt {\alpha }})^{2}}y(1α)2{\displaystyle (1-{\sqrt {\alpha }})^{2}}, respectivamente, según la distribución límite derivada por Tracy y Widom , y estos se desvían claramente de los valores propios unitarios deΣ{\displaystyle \Sigma }. Información adicional sobre el comportamiento asintótico de los valores propios deΣ^{\displaystyle {\widehat {\Sigma }}}se puede obtener a partir de la ley de Marchenko-Pastur . Desde un punto de vista no asintótico, el valor propio máximoλmetroaincógnita(Σ^){\displaystyle \lambda _ {\mathrm {max} }({\widehat {\Sigma }})}deΣ^{\displaystyle {\widehat {\Sigma }}}Satisface

PAG(λmetroaincógnita(Σ^)(1+pag/norte+δ)2)minorteδ2/2,{\displaystyle \mathbb {P} \left(\lambda _{\mathrm {max} }({\widehat {\Sigma }})\geq (1+{\sqrt {p/n}}+\delta )^{2}\right)\leq e^{-n\delta ^{2}/2},}

para cualquierδ0{\displaystyle \delta \geq 0}y todas las opciones de pares denorte,pag{\displaystyle n,p}. [ 2 ]

Nuevamente, se requiere una estructura adicional de baja dimensión para una estimación exitosa de la matriz de covarianza en dimensiones altas. Ejemplos de dichas estructuras incluyen la escasez , el bajo rango y la agrupación en bandas . Consideraciones similares se aplican al estimar una matriz de covarianza inversa (matriz de precisión) .

Historia

Desde una perspectiva aplicada, la investigación en estadística de alta dimensión se motivó por la constatación de que los avances en la tecnología informática habían aumentado drásticamente la capacidad de recopilar y almacenar datos , y que las técnicas estadísticas tradicionales, como las descritas en los ejemplos anteriores, a menudo no estaban bien equipadas para manejar los desafíos resultantes. Los avances teóricos en el área se remontan al notable resultado de Charles Stein en 1956, [ 4 ] donde demostró que el estimador usual de una media normal multivariada era inadmisible con respecto a la pérdida de error cuadrático en tres o más dimensiones. De hecho, el estimador de James-Stein [ 5 ] proporcionó la idea de que en entornos de alta dimensión, se puede obtener un mejor rendimiento de estimación a través de la contracción, que reduce la varianza a costa de introducir una pequeña cantidad de sesgo. Esta compensación entre sesgo y varianza fue explotada más en el contexto de modelos lineales de alta dimensión por Hoerl y Kennard en 1970 con la introducción de la regresión de cresta . [ 6 ] Otro impulso importante para el campo fue proporcionado por el trabajo de Robert Tibshirani sobre el Lasso en 1996, que utilizó1{\displaystyle \ell _{1}}regularización para lograr la selección simultánea de modelos y la estimación de parámetros en regresión lineal dispersa de alta dimensión. [ 7 ] Desde entonces, se han propuesto muchos otros estimadores de contracción para explotar diferentes estructuras de baja dimensión en una amplia gama de problemas estadísticos de alta dimensión.

Temas de estadística de alta dimensión

Los siguientes son ejemplos de temas que han recibido considerable atención en la literatura sobre estadística de alta dimensión en los últimos años:

  • Modelos lineales en altas dimensiones. Los modelos lineales son una de las herramientas más utilizadas en estadística y sus aplicaciones. Por ello, la regresión lineal dispersa es uno de los temas más estudiados en la investigación estadística de alta dimensión. Partiendo de trabajos anteriores sobre regresión de cresta y el método Lasso , se han propuesto y estudiado varios otros estimadores de contracción en este y otros problemas relacionados. Estos incluyen:
    • El selector de Dantzig, que minimiza la correlación máxima covariable-residuo, en lugar de la suma de cuadrados residuales como en Lasso, sujeto a una1{\displaystyle \ell _{1}}restricción sobre los coeficientes. [ 8 ]
    • Red elástica , que combina1{\displaystyle \ell _{1}}regularización del Lasso con2{\displaystyle \ell _{2}}Regularización de la regresión de cresta para permitir que covariables altamente correlacionadas se seleccionen simultáneamente con coeficientes de regresión similares. [ 9 ]
    • El método Group Lasso permite seleccionar conjuntamente grupos predefinidos de covariables. [ 10 ]
    • El lasso fusionado , que regulariza la diferencia entre coeficientes cercanos cuando los coeficientes de regresión reflejan relaciones espaciales o temporales, para imponer una estructura constante por partes. [ 11 ]
  • Selección de variables de alta dimensión . Además de estimar el parámetro subyacente en los modelos de regresión, otro tema importante es identificar los coeficientes distintos de cero, ya que estos corresponden a variables necesarias en el modelo final. Cada una de las técnicas enumeradas en el apartado anterior puede utilizarse para este fin, y a veces se combinan con ideas como el submuestreo mediante la selección de estabilidad. [ 12 ] [ 13 ]
  • Estimación de matrices de covarianza y precisión de alta dimensión. Estos problemas se introdujeron anteriormente; véase también estimación de contracción . Los métodos incluyen estimadores de atenuación [ 14 ] y el restringido.1{\displaystyle \ell _{1}}estimador de minimización. [ 15 ]
  • Análisis de componentes principales dispersos . El análisis de componentes principales es otra técnica que falla en dimensiones altas; más precisamente, bajo condiciones apropiadas, el vector propio principal de la matriz de covarianza muestral es un estimador inconsistente de su contraparte poblacional cuando la razón del número de variablespag{\displaystyle p}al número de observacionesnorte{\displaystyle n}está acotado lejos de cero. [ 16 ] Bajo el supuesto de que este vector propio principal es disperso (lo que puede ayudar a la interpretabilidad), se puede restablecer la consistencia. [ 17 ]
  • Completar matrices . Este tema, que trata sobre la tarea de completar las entradas que faltan en una matriz observada parcialmente, se popularizó en gran parte gracias al premio de Netflix por predecir las calificaciones de los usuarios para las películas.
  • Clasificación de alta dimensión. El análisis discriminante lineal no se puede utilizar cuandopag>norte{\displaystyle p>n}, porque la matriz de covarianza de la muestra es singular . Se han propuesto enfoques alternativos basados ​​en Naive Bayes , [ 18 ] selección de características [ 19 ] y proyecciones aleatorias . [ 20 ]
  • Modelos gráficos para datos de alta dimensión . Los modelos gráficos se utilizan para codificar la estructura de dependencia condicional entre diferentes variables. Bajo el supuesto de gaussianidad, el problema se reduce a estimar una matriz de precisión dispersa, como se mencionó anteriormente.

Notas

  1. 1 2 Lederer, Johannes (2022). Fundamentos de estadística de alta dimensión: con ejercicios y laboratorios de R. Libros de texto de estadística de Springer. doi : 10.1017/9781108627771 . ISBN 9781108498029. S2CID 128095693 . 
  2. 1 2 3 Wainwright, Martin J. (2019). High-Dimensional Statistics: A Non-Asymptotic Viewpoint . Cambridge University Press. doi : 10.1017/9781108627771 . ISBN 9781108498029. S2CID 128095693 . 
  3. Wainwright MJ. Estadística de alta dimensión: una perspectiva no asintótica. Cambridge: Cambridge University Press; 2019. doi:10.1017/9781108627771
  4. Stein, C. (1956), "Inadmisibilidad del estimador usual para la media de una distribución multivariada", Proc. Third Berkeley Symp. Math. Statist. Prob. , vol. 1, pp. 197– 206, MR 0084922 , Zbl 0073.35602    
  5. James, W.; Stein, C. (1961), "Estimación con pérdida cuadrática", Actas del Cuarto Simposio de Berkeley sobre Estadística Matemática y Probabilidad , vol. 1, págs. 361–379 , MR 0133191   
  6. Hoerl, Arthur E., y Robert W. Kennard. «Regresión de cresta: estimación sesgada para problemas no ortogonales». Technometrics , vol. 12, n.º 1, 1970, págs. 55-67. [www.jstor.org/stable/1267351 JSTOR]. Consultado el 13 de marzo de 2021.
  7. Tibshirani, Robert (1996). "Regresión, contracción y selección mediante el método lasso". Journal of the Royal Statistical Society . Serie B (metodológica). 58 (1). Wiley: 267–88 . JSTOR 2346178 . 
  8. Candes, Emmanuel ; Tao, Terence (2007). "El selector de Dantzig: estimación estadística cuando p es mucho mayor que n " . Annals of Statistics . 35 (6): 2313–2351 . arXiv : math/0506081 . doi : 10.1214/009053606000001523 . MR 2382644. S2CID 88524200 .  
  9. Zou, Hui; Hastie, Trevor (2005). "Regularización y selección de variables mediante la red elástica" . Journal of the Royal Statistical Society . Serie B (metodología estadística). 67 (2). Wiley: 301–20 . doi : 10.1111/j.1467-9868.2005.00503.x . JSTOR 3647580 . 
  10. Yuan, Ming; Lin, Yi (2006). "Selección y estimación de modelos en regresión con variables agrupadas" . Journal of the Royal Statistical Society . Serie B (metodología estadística). 68 (1). Wiley: 49– 67. doi : 10.1111 / j.1467-9868.2005.00532.x . JSTOR 3647556. S2CID 6162124 .  
  11. ^ Tibshirani, Robert, Michael Saunders, Saharon Rosset, Ji Zhu y Keith Knight. 2005. “Escasez y suavidad a través del lazo fusionado”. Revista de la Real Sociedad de Estadística. Serie B (Metodología estadística) 67 (1). Wiley: 91-108. https://www.jstor.org/stable/3647602 .
  12. Meinshausen, Nicolai; Bühlmann, Peter (2010). "Selección de estabilidad" . Journal of the Royal Statistical Society, Serie B (Metodología estadística) . 72 (4): 417– 473. doi : 10.1111/j.1467-9868.2010.00740.x . ISSN 1467-9868 . S2CID 1231300 .  
  13. Shah, Rajen D.; Samworth, Richard J. (2013). "Selección de variables con control de errores: otra mirada a la selección de estabilidad" . Journal of the Royal Statistical Society. Serie B (Metodología estadística) . 75 (1): 55–80 . arXiv : 1105.5578 . doi : 10.1111/j.1467-9868.2011.01034.x . ISSN 1369-7412 . JSTOR 23361014. S2CID 18211609 .   
  14. Cai, T. Tony; Zhang, Cun-Hui; Zhou, Harrison H. (agosto de 2010). "Tasas óptimas de convergencia para la estimación de la matriz de covarianza" . The Annals of Statistics . 38 (4): 2118– 2144. arXiv : 1010.3866 . doi : 10.1214/09-AOS752 . ISSN 0090-5364 . S2CID 14038500. Recuperado el 6 de abril de 2021 .  
  15. ^ Cai, Tony; Liu, Weidong; Luo, Xi (1 de junio de 2011). "Un restringido1{\displaystyle \ell _{1}}Enfoque de minimización para la estimación de matrices de precisión dispersas" . Journal of the American Statistical Association . 106 (494): 594– 607. arXiv : 1102.2233 . doi : 10.1198/jasa.2011.tm10155 . ISSN 0162-1459 . S2CID 15900101. Recuperado el 6 de abril de 2021 .  
  16. Johnstone, Iain M.; Lu, Arthur Yu (2009-06-01). "Sobre la consistencia y la escasez para el análisis de componentes principales en altas dimensiones" . Journal of the American Statistical Association . 104 (486): 682– 693. doi : 10.1198/jasa.2009.0121 . ISSN 0162-1459 . PMC 2898454. PMID 20617121 .   
  17. Vu, Vincent Q.; Lei, Jing (diciembre de 2013). "Estimación del subespacio principal disperso minimax en altas dimensiones" . The Annals of Statistics . 41 (6): 2905– 2947. arXiv : 1211.0373 . doi : 10.1214/13-AOS1151 . ISSN 0090-5364 . S2CID 562591 .  
  18. Bickel, Peter J. ; Levina, Elizaveta (2004). "Alguna teoría para la función discriminante lineal de Fisher, el bayesiano ingenuo y algunas alternativas cuando hay muchas más variables que observaciones" . Bernoulli . 10 (6): 989– 1010. doi : 10.3150/bj/1106314847 .
  19. Fan, Jianqing; Fan, Yingying (diciembre de 2008). "Clasificación de alta dimensión utilizando reglas de independencia recocidas de características" . The Annals of Statistics . 36 (6): 2605– 2637. arXiv : math/0701108 . doi : 10.1214 / 07-AOS504 . PMC 2630123. PMID 19169416. S2CID 2982392 .   
  20. Cannings, Timothy I.; Samworth, Richard J. (2017). "Clasificación de conjuntos de proyección aleatoria" . Journal of the Royal Statistical Society, Serie B (Metodología estadística) . 79 (4): 959– 1035. arXiv : 1504.04595 . doi : 10.1111/rssb.12228 . S2CID 88520328 . 

Referencias

  • Lederer, Johannes (2022). Fundamentos de estadística de alta dimensión . Cham: Springer.
  • Giraud, Christophe (2015). Introducción a la estadística de alta dimensión . Filadelfia: Chapman and Hall/CRC.
  • Cai, T. Tony; Shen, Xiaotong, eds. (2011). Análisis de datos de alta dimensión . Fronteras de la estadística. Singapur: World Scientific.
  • Bühlmann, Peter ; van de Geer, Sara (2011). Estadística para datos de alta dimensión: métodos, teoría y aplicaciones . Heidelberg; Nueva York: Springer.
  • Wainwright, Martin J. (2019). Estadística de alta dimensión: una perspectiva no asintótica . Cambridge, Reino Unido: Cambridge University Press.