El análisis de componentes principales funcionales ( FPCA ) es un método estadístico para investigar los modos dominantes de variación de datos funcionales . Utilizando este método, una función aleatoria se representa en la base propia, que es una base ortonormal del espacio de Hilbert L 2 que consiste en las funciones propias del operador de autocovarianza . FPCA representa datos funcionales de la manera más parsimoniosa, en el sentido de que cuando se utiliza un número fijo de funciones base , la base de la función propia explica más variación que cualquier otra expansión de base. FPCA se puede aplicar para representar funciones aleatorias, [1] o en regresión funcional [2] y clasificación.
Formulación
Para un proceso estocástico integrable al cuadrado X ( t ), t ∈ 𝒯, sea
y
donde son los valores propios y , , ... son las funciones propias ortonormales del operador lineal de Hilbert-Schmidt
Por el teorema de Karhunen-Loève , se puede expresar el proceso centrado en la base propia,
dónde
es el componente principal asociado con la función propia k - ésima , con las propiedades
El proceso centrado es entonces equivalente a ξ 1 , ξ 2 , .... Una suposición común es que X puede representarse solo por las primeras funciones propias (después de restar la función media), es decir
dónde
Interpretación de funciones propias
La primera función propia representa el modo dominante de variación de X.
dónde
La función propia k -ésima es el modo dominante de variación ortogonal a , , ... , ,
dónde
Estimación
Sea Y ij = X i ( t ij ) + ε ij las observaciones realizadas en las ubicaciones (normalmente puntos temporales) t ij , donde X i es la i -ésima realización del proceso estocástico suave que genera los datos, y ε ij son variables aleatorias normales distribuidas de forma idéntica e independiente con media 0 y varianza σ 2 , j = 1, 2, ..., m i . Para obtener una estimación de la función media μ ( t ij ), si se dispone de una muestra densa en una cuadrícula regular, se puede tomar el promedio en cada ubicación t ij :
Si las observaciones son escasas, es necesario suavizar los datos agrupados de todas las observaciones para obtener la estimación media, [3] utilizando métodos de suavizado como el suavizado lineal local o el suavizado de spline .
Luego, la estimación de la función de covarianza se obtiene promediando (en el caso denso) o suavizando (en el caso disperso) las covarianzas brutas.
Téngase en cuenta que los elementos diagonales de G i deben eliminarse porque contienen errores de medición. [4]
En la práctica, se discretiza en una cuadrícula densa de espaciado uniforme, y la estimación de los valores propios λ k y los vectores propios v k se lleva a cabo mediante álgebra lineal numérica. [5] Las estimaciones de las funciones propias se pueden obtener interpolando los vectores propios.
La covarianza ajustada debe ser definida positiva y simétrica y luego se obtiene como
Sea una versión suavizada de los elementos diagonales G i ( t ij , t ij ) de las matrices de covarianza en bruto. Entonces es una estimación de ( G ( t , t ) + σ 2 ). Una estimación de σ 2 se obtiene mediante
- En caso contrario
Si las observaciones X ij , j =1, 2, ..., m i son densas en 𝒯, entonces el k -ésimo FPC ξ k se puede estimar mediante integración numérica , implementando
Sin embargo, si las observaciones son escasas, este método no funcionará. En su lugar, se pueden utilizar los mejores predictores lineales imparciales , [3] obteniendo
dónde
- ,
y se evalúa en los puntos de la cuadrícula generados por t ij , j = 1, 2, ..., m i . El algoritmo, PACE, tiene un paquete Matlab disponible [6] y un paquete R [7]
Se han investigado las propiedades de convergencia asintótica de estas estimaciones. [3] [8] [9]
Aplicaciones
El FPCA se puede aplicar para mostrar los modos de variación funcional , [1] [10] en diagramas de dispersión de FPC entre sí o de respuestas contra FPC, para modelar datos longitudinales dispersos , [3] o para regresión y clasificación funcional (por ejemplo, regresión lineal funcional). [2] Se pueden utilizar diagramas de sedimentación y otros métodos para determinar el número de componentes incluidos. El análisis de componentes principales funcional tiene diversas aplicaciones en el análisis de series temporales. En la actualidad, este método se está adaptando a partir de técnicas multivariadas tradicionales para analizar conjuntos de datos financieros como índices bursátiles y generar gráficos de volatilidad implícita. [11] Un buen ejemplo de las ventajas del enfoque funcional es el FPCA suavizado (SPCA), desarrollado por Silverman [1996] y estudiado por Pezzulli y Silverman [1993], que permite la combinación directa de FPCA junto con un enfoque de suavizado general que hace posible el uso de la información almacenada en algunos operadores diferenciales lineales. Una aplicación importante del FPCA ya conocido a partir del PCA multivariante está motivada por la descomposición de Karhunen-Loève de una función aleatoria al conjunto de parámetros funcionales – funciones factoriales y cargas factoriales correspondientes (variables aleatorias escalares). Esta aplicación es mucho más importante que en el PCA multivariante estándar ya que la distribución de la función aleatoria es en general demasiado compleja para ser analizada directamente y la descomposición de Karhunen-Loève reduce el análisis a la interpretación de las funciones factoriales y la distribución de variables aleatorias escalares. Debido a la reducción de la dimensionalidad así como a su precisión para representar datos, existe un amplio margen para futuros desarrollos de técnicas de componentes principales funcionales en el campo financiero.
Aplicaciones del PCA en la ingeniería automotriz. [12] [13] [14] [15]
Conexión con el análisis de componentes principales
La siguiente tabla muestra una comparación de varios elementos del análisis de componentes principales (PCA) y FPCA. Ambos métodos se utilizan para la reducción de dimensionalidad . En las implementaciones, FPCA utiliza un paso de PCA.
Sin embargo, el PCA y el FPCA difieren en algunos aspectos críticos. En primer lugar, el orden de los datos multivariados en el PCA se puede permutar , lo que no tiene ningún efecto en el análisis, pero el orden de los datos funcionales lleva información de tiempo o espacio y no se puede reordenar. En segundo lugar, el espaciado de las observaciones en el FPCA importa, mientras que no hay ningún problema de espaciado en el PCA. En tercer lugar, el PCA regular no funciona para datos de alta dimensión sin regularización , mientras que el FPCA tiene una regularización incorporada debido a la suavidad de los datos funcionales y el truncamiento a un número finito de componentes incluidos.
Véase también
Notas
- ^ ab Jones, MC; Rice, JA (1992). "Visualización de las características importantes de grandes colecciones de curvas similares". The American Statistician . 46 (2): 140. doi :10.1080/00031305.1992.10475870.
- ^ ab Yao, F.; Müller, HG; Wang, JL (2005). "Análisis de regresión lineal funcional para datos longitudinales". Anales de Estadística . 33 (6): 2873. arXiv : math/0603132 . doi :10.1214/009053605000000660.
- ^ abcd Yao, F.; Müller, HG; Wang, JL (2005). "Análisis de datos funcionales para datos longitudinales dispersos". Revista de la Asociación Estadounidense de Estadística . 100 (470): 577. doi :10.1198/016214504000001745.
- ^ Staniswalis, JG ; Lee, JJ (1998). "Análisis de regresión no paramétrica de datos longitudinales". Revista de la Asociación Estadounidense de Estadística . 93 (444): 1403. doi :10.1080/01621459.1998.10473801.
- ^ Rice, John; Silverman, B. (1991). "Estimación de la estructura de media y covarianza de forma no paramétrica cuando los datos son curvas". Revista de la Royal Statistical Society. Serie B (Metodológica) . 53 (1): 233–243. doi :10.1111/j.2517-6161.1991.tb01821.x.
- ^ "PACE: Análisis principal por expectativa condicional".
- ^ "fdapace: Análisis de datos funcionales y dinámica empírica". 25 de febrero de 2018.
- ^ Hall, P.; Müller, HG; Wang, JL (2006). "Propiedades de los métodos de componentes principales para el análisis de datos funcionales y longitudinales". Anales de Estadística . 34 (3): 1493. arXiv : math/0608022 . doi :10.1214/009053606000000272.
- ^ Li, Y.; Hsing, T. (2010). "Tasas de convergencia uniformes para regresión no paramétrica y análisis de componentes principales en datos funcionales/longitudinales". Anales de Estadística . 38 (6): 3321. arXiv : 1211.2137 . doi :10.1214/10-AOS813.
- ^ Madrigal, Pedro; Krajewski, Paweł (2015). "Descubrimiento de variabilidad correlacionada en conjuntos de datos epigenómicos utilizando la transformada Karhunen-Loeve". BioData Mining . 8 : 20. doi : 10.1186/s13040-015-0051-7 . PMC 4488123 . PMID 26140054.
- ^ Análisis de datos funcionales con aplicaciones en finanzas por Michal Benko
- ^ Lee, Sangdon (2012). "Modos de variación de la aceleración del vehículo y desarrollo de la aceleración ideal del vehículo". Actas de la Institución de Ingenieros Mecánicos, Parte D: Revista de Ingeniería Automotriz . 226 (9): 1185–1201. doi :10.1177/0954407012442775.
- ^ Lee, Sangdon (2010). "Caracterización y desarrollo de la fuerza ideal del pedal, el recorrido del pedal y el tiempo de respuesta en el sistema de frenos para la traducción de la voz del cliente a especificaciones de ingeniería". Actas de la Institución de Ingenieros Mecánicos, Parte D: Revista de Ingeniería Automotriz . 224 (11): 1433–1450. doi :10.1243/09544070JAUTO1585.
- ^ Lee, Sangdon (2008). "Análisis de componentes principales de la ganancia de aceleración del vehículo y traducción de la voz del cliente". Actas de la Institución de Ingenieros Mecánicos, Parte D: Revista de Ingeniería Automotriz . 222 (2): 191–203. doi :10.1243/09544070JAUTO351.
- ^ Lee, Sangdon (2006). "Análisis estadísticos multivariados del ruido en ralentí y el posicionamiento del vehículo". Revista internacional de ruido y vibración de vehículos . 2 (2): 156–175. doi :10.1504/IJVNV.2006.011052.
Referencias
- James O. Ramsay; BW Silverman (8 de junio de 2005). Análisis de datos funcionales. Springer. ISBN 978-0-387-40080-8.