El modelo lineal funcional generalizado ( GFLM ) es una extensión del modelo lineal generalizado (GLM) que permite realizar una regresión de respuestas univariadas de diversos tipos (continuas o discretas) sobre predictores funcionales, que son principalmente trayectorias aleatorias generadas por procesos estocásticos de cuadrado integrable . De forma similar al GLM, una función de enlace relaciona el valor esperado de la variable de respuesta con un predictor lineal, que en el caso del GFLM se obtiene formando el producto escalar de la función predictora aleatoria.con una función de parámetros suaveLa regresión lineal funcional, la regresión de Poisson funcional y la regresión binomial funcional , incluyendo la importante regresión logística funcional , son casos especiales de GFLM. Las aplicaciones de GFLM incluyen la clasificación y discriminación de procesos estocásticos y datos funcionales . [ 1 ]
Descripción general
Un aspecto clave de GFLM es la estimación e inferencia de la función de parámetros suavizados.que se suele obtener mediante la reducción de dimensionalidad del predictor funcional de dimensión infinita. Un método común es expandir la función predictora.en una base ortonormal del espacio L2 , el espacio de Hilbert de funciones de cuadrado integrable con la expansión simultánea de la función de parámetro en la misma base. Esta representación se combina luego con un paso de truncamiento para reducir la contribución de la función de parámetro.en el predictor lineal a un número finito de coeficientes de regresión. El análisis de componentes principales funcionales (FPCA), que emplea la expansión de Karhunen-Loève, es un enfoque común y parsimonioso para lograr esto. Otras expansiones ortogonales, como las expansiones de Fourier y las expansiones de B-spline, también pueden emplearse para el paso de reducción de dimensión. El criterio de información de Akaike (AIC) puede utilizarse para seleccionar el número de componentes incluidos. La minimización de los errores de predicción de validación cruzada es otro criterio que se utiliza a menudo en aplicaciones de clasificación. Una vez que se ha reducido la dimensión del proceso predictor, el predictor lineal simplificado permite utilizar técnicas de estimación de GLM y cuasi-verosimilitud para obtener estimaciones de los coeficientes de regresión de dimensión finita, que a su vez proporcionan una estimación de la función de parámetros.en el GFLM.
Componentes del modelo
Predictor lineal
Las funciones predictoras, típicamente son procesos estocásticos integrables al cuadrado en un intervalo realy la función de parámetros suaves desconocida, se supone que es de cuadrado integrable enDado un valor realen, el predictor lineal viene dado pordóndees el proceso predictor centrado yes un escalar que sirve como término independiente.
Variable de respuesta y función de varianza
El resultadoes típicamente una variable aleatoria de valor real que puede ser continua o discreta. A menudo, la distribución condicional dedado que el proceso predictor se especifica dentro de la familia exponencial . Sin embargo, también es suficiente considerar la configuración de cuasi-verosimilitud funcional, donde en lugar de la distribución de la respuesta se especifica la función de varianza condicional ., como función de la media condicional,.
Función de enlace
La función de enlacees una función suave e invertible que relaciona la media condicional de la respuestacon el predictor linealLa relación viene dada por.
Formulación
Para implementar la reducción de dimensionalidad necesaria, se utiliza el proceso predictor centrado. y la función de parámetrosse expanden como,
dóndees una base ortonormal del espacio de funcionesde tal manera quedóndesiyde lo contrario.
Las variables aleatoriasson dados pory los coeficientescomopara.
yy denotando, entonces.
A partir de la ortonormalidad de las funciones baseDe ello se deduce inmediatamente que.
El paso clave es entonces aproximarporpara un punto de truncamiento elegido adecuadamente.
FPCA proporciona la aproximación más parsimoniosa del predictor lineal para un número dado de funciones base, ya que la base de autofunciones explica más variación que cualquier otro conjunto de funciones base.
Para una función de enlace diferenciable con primera derivada acotada, el error de aproximación de la-modelo truncado, es decir, el predictor lineal truncado a la suma de los primeroscomponentes, es un múltiplo constante de.
Una motivación heurística para la estrategia de truncamiento se deriva del hecho de quelo cual es consecuencia de la desigualdad de Cauchy-Schwarz y al observar que el lado derecho de la última desigualdad converge a 0 cuandoya que ambosyson finitos.
Para el caso especial de la base de autofunciones, la secuenciacorresponde a la secuencia de los valores propios del núcleo de covarianza.
Para datos conobservaciones iid , configuración,y, los predictores lineales aproximados pueden representarse comoque están relacionados con los medios a través de.
Estimación
El objetivo principal es estimar la función de parámetros..
Una vezUna vez solucionado, se pueden utilizar los métodos GLM estándar y de cuasi-verosimilitud para el-modelo truncado para estimarresolviendo la ecuación de estimación o la ecuación de puntuación.
La función de puntuación vectorial resulta serque depende dea través dey.
Al igual que en GLM, la ecuaciónse resuelve utilizando métodos iterativos como Newton-Raphson (NR) o puntuación de Fisher (FS) o mínimos cuadrados reponderados iterativamente (IWLS) para obtener la estimación de los coeficientes de regresión, lo que lleva a la estimación de la función de parámetros.. Al utilizar la función de enlace canónico , estos métodos son equivalentes.
Los resultados están disponibles en la literatura de-modelos truncados comoque proporcionan inferencia asintótica para la desviación de la función paramétrica estimada de la función paramétrica verdadera y también pruebas asintóticas para efectos de regresión y regiones de confianza asintóticas .
Respuesta familiar exponencial
Si la variable de respuesta, dadosigue la familia exponencial de un parámetro, entonces su función de densidad de probabilidad o función de masa de probabilidad (según sea el caso) es
para algunas funcionesy, dóndees el parámetro canónico, yes un parámetro de dispersión que normalmente se supone positivo.
En la configuración canónica,y a partir de las propiedades de la familia exponencial,
Por esoSirve como función de enlace y se denomina función de enlace canónica.
es la función de varianza correspondiente yel parámetro de dispersión.
Casos especiales
Regresión lineal funcional (RLF)
La regresión lineal funcional, una de las herramientas más útiles del análisis de datos funcionales, es un ejemplo de GFLM donde la variable de respuesta es continua y a menudo se supone que tiene una distribución normal . La función de varianza es una función constante y la función de enlace es la identidad. Bajo estos supuestos, la GFLM se reduce a la FLR,
Sin el supuesto de normalidad, la función de varianza constante justifica el uso de técnicas cuasinormales.
Regresión binaria funcional
Cuando la variable de respuesta tiene resultados binarios, es decir, 0 o 1, la distribución generalmente se elige como Bernoulli y luegoLas funciones de enlace más populares son la función expit, que es la inversa de la función logit (regresión logística funcional) y la función probit (regresión probit funcional). Cualquier función de distribución acumulativa F tiene un rango [0,1] que es el rango de la media binomial y, por lo tanto, puede elegirse como función de enlace. Otra función de enlace en este contexto es la función log-log complementaria , que es un enlace asimétrico. La función de varianza para datos binarios viene dada pordonde el parámetro de dispersiónse toma como 1 o, alternativamente, se utiliza el enfoque de cuasi-verosimilitud.
Regresión de Poisson funcional
Otro caso especial de GFLM ocurre cuando los resultados son recuentos, por lo que se supone que la distribución de las respuestas es de Poisson . La mediaestá típicamente vinculado al predictor lineala través de un enlace logarítmico, que también es el enlace canónico. La función de varianza esdonde el parámetro de dispersiónes 1, excepto cuando los datos pueden estar sobredispersos, que es cuando se utiliza el enfoque cuasi-Poisson.
Extensiones
Se han propuesto extensiones de GFLM para casos con múltiples funciones predictoras. [ 2 ] Otra generalización se denomina Regresión de Cuasi-verosimilitud Semiparamétrica (SPQR) [ 1 ] , que considera la situación en la que las funciones de enlace y varianza son desconocidas y se estiman de forma no paramétrica a partir de los datos. Esta situación también puede abordarse mediante modelos de índice único o múltiple, utilizando, por ejemplo, la Regresión Inversa Segmentada (SIR).
Otra extensión en este dominio es el Modelo Aditivo Generalizado Funcional (FGAM) [ 3 ] que es una generalización del modelo aditivo generalizado (GAM) donde
dóndeson los coeficientes de expansión de la función predictora aleatoriay cada unoes una función suave desconocida que debe estimarse y donde.
En general, la estimación en FGAM requiere combinar IWLS con backfitting . Sin embargo, si los coeficientes de expansión se obtienen como componentes principales funcionales, entonces en algunos casos (por ejemplo, función predictora gaussiana)), serán independientes, en cuyo caso no se necesita el backfit, y se pueden utilizar métodos de suavizado populares para estimar las funciones de parámetros desconocidos..
Solicitud

Un conjunto de datos popular que se ha utilizado para varios análisis en el ámbito del análisis de datos funcionales consiste en el número de huevos puestos diariamente hasta la muerte de 1000 moscas de la fruta mediterráneas (o moscas medmosas, para abreviar).El gráfico muestra las trayectorias de puesta de huevos durante los primeros 25 días de vida de aproximadamente 600 moscas mediterráneas hembras (aquellas que tienen al menos 20 huevos restantes a lo largo de su vida). Las curvas rojas corresponden a las moscas que pondrán menos huevos que la mediana, mientras que las curvas azules corresponden a las moscas que pondrán más huevos que la mediana después de los 25 años. Un problema relacionado, como la clasificación de las moscas mediterráneas como longevas o de corta vida, basándose en las trayectorias iniciales de puesta de huevos como predictores y la longevidad posterior de las moscas como respuesta, se ha estudiado con el GFLM [ 1 ].
Véase también
Referencias
- 1 2 3 Muller y Stadtmuller (2005). "Modelos lineales funcionales generalizados". The Annals of Statistics . 33 (2): 774– 805. arXiv : math/0505638 . doi : 10.1214/009053604000001156 .
- ↑ James (2002). "Modelos lineales generalizados con predictores funcionales". Journal of the Royal Statistical Society, Serie B. 64 ( 3): 411– 432. CiteSeerX 10.1.1.165.1333 . doi : 10.1111/1467-9868.00342 .
- ↑ Muller y Yao (2008). "Modelos aditivos funcionales". Journal of the American Statistical Association . 103 (484): 1534– 1544. doi : 10.1198/016214508000000751 .
- Modelos lineales generalizados