Articulo de referencia

Modelo lineal funcional generalizado

El modelo lineal funcional generalizado ( GFLM ) es una extensión del modelo lineal generalizado (GLM) que permite realizar una regresión de respuestas univariadas de diversos t...

El modelo lineal funcional generalizado ( GFLM ) es una extensión del modelo lineal generalizado (GLM) que permite realizar una regresión de respuestas univariadas de diversos tipos (continuas o discretas) sobre predictores funcionales, que son principalmente trayectorias aleatorias generadas por procesos estocásticos de cuadrado integrable . De forma similar al GLM, una función de enlace relaciona el valor esperado de la variable de respuesta con un predictor lineal, que en el caso del GFLM se obtiene formando el producto escalar de la función predictora aleatoria.incógnita{\displaystyle X}con una función de parámetros suaveβ{\displaystyle \beta }La regresión lineal funcional, la regresión de Poisson funcional y la regresión binomial funcional , incluyendo la importante regresión logística funcional , son casos especiales de GFLM. Las aplicaciones de GFLM incluyen la clasificación y discriminación de procesos estocásticos y datos funcionales . [ 1 ]

Descripción general

Un aspecto clave de GFLM es la estimación e inferencia de la función de parámetros suavizados.β{\displaystyle \beta }que se suele obtener mediante la reducción de dimensionalidad del predictor funcional de dimensión infinita. Un método común es expandir la función predictora.incógnita{\displaystyle X}en una base ortonormal del espacio L2 , el espacio de Hilbert de funciones de cuadrado integrable con la expansión simultánea de la función de parámetro en la misma base. Esta representación se combina luego con un paso de truncamiento para reducir la contribución de la función de parámetro.β{\displaystyle \beta }en el predictor lineal a un número finito de coeficientes de regresión. El análisis de componentes principales funcionales (FPCA), que emplea la expansión de Karhunen-Loève, es un enfoque común y parsimonioso para lograr esto. Otras expansiones ortogonales, como las expansiones de Fourier y las expansiones de B-spline, también pueden emplearse para el paso de reducción de dimensión. El criterio de información de Akaike (AIC) puede utilizarse para seleccionar el número de componentes incluidos. La minimización de los errores de predicción de validación cruzada es otro criterio que se utiliza a menudo en aplicaciones de clasificación. Una vez que se ha reducido la dimensión del proceso predictor, el predictor lineal simplificado permite utilizar técnicas de estimación de GLM y cuasi-verosimilitud para obtener estimaciones de los coeficientes de regresión de dimensión finita, que a su vez proporcionan una estimación de la función de parámetros.β{\displaystyle \beta }en el GFLM.

Componentes del modelo

Predictor lineal

Las funciones predictorasincógnita(t),tT{\displaystyle \textstyle X(t),t\in T}, típicamente son procesos estocásticos integrables al cuadrado en un intervalo realT{\displaystyle T}y la función de parámetros suaves desconocidaβ(t),tT{\displaystyle \beta (t),t\in T}, se supone que es de cuadrado integrable enT{\displaystyle T}Dado un valor realdw{\displaystyle dw}enT{\displaystyle T}, el predictor lineal viene dado porη=α+incógnitado(t)β(t)dw(t){\displaystyle \eta =\alpha +\int X^{c}(t)\beta (t)\,dw(t)}dóndeincógnitado(t)=incógnita(t)mi(incógnita(t)){\displaystyle X^{c}(t)=X(t)-{\text{E}}(X(t))}es el proceso predictor centrado yα{\displaystyle \alpha }es un escalar que sirve como término independiente.

Variable de respuesta y función de varianza

El resultadoY{\displaystyle Y}es típicamente una variable aleatoria de valor real que puede ser continua o discreta. A menudo, la distribución condicional deY{\displaystyle Y}dado que el proceso predictor se especifica dentro de la familia exponencial . Sin embargo, también es suficiente considerar la configuración de cuasi-verosimilitud funcional, donde en lugar de la distribución de la respuesta se especifica la función de varianza condicional .Var(Yincógnita)=σ2(μ){\displaystyle {\rm {{Var}(Y\mid X)=\sigma ^{2}(\mu )}}}, como función de la media condicional,mi(Yincógnita)=μ{\displaystyle {\rm {{E}(Y\mid X)=\mu }}}.

La función de enlacegramo{\displaystyle g}es una función suave e invertible que relaciona la media condicional de la respuestami(Yincógnita)=μ{\displaystyle {\rm {{E}(Y\mid X)=\mu }}}con el predictor linealη=α+incógnitado(t)β(t)dw(t){\displaystyle \eta =\alpha +\int X^{c}(t)\beta (t)\,dw(t)}La relación viene dada porμ=gramo(η){\displaystyle \mu =g(\eta )}.

Formulación

Para implementar la reducción de dimensionalidad necesaria, se utiliza el proceso predictor centrado.incógnitado(t){\displaystyle X^{c}(t)} y la función de parámetrosβ(t){\displaystyle \beta (t)}se expanden como,

incógnitado(t)=j=1ξjρj(t) y β(t)=j=1βjρj(t),{\displaystyle X^{c}(t)=\sum _{j=1}^{\infty }\xi _{j}\rho _{j}(t){\text{ y }}\beta (t)=\sum _{j=1}^{\infty }\beta _{j}\rho _{j}(t),}

dóndeρj,j=1,2,{\displaystyle \rho _{j},j=1,2,\ldots }es una base ortonormal del espacio de funcionesL2(dw),{\displaystyle L^{2}(dw),}de tal manera queTρj(t)ρk(t)dw(t)=δjk{\displaystyle \int _{T}\rho _{j}(t)\rho _{k}(t)\,dw(t)=\delta _{jk}}dóndeδjk=1{\displaystyle \delta _{jk}=1}sij=k{\displaystyle j=k}y0{\displaystyle 0}de lo contrario.

Las variables aleatoriasξj{\displaystyle \xi _{j}}son dados porξj=incógnitado(t)ρj(t)dw(t){\displaystyle \xi _{j}=\int X^{c}(t)\rho _{j}(t)\,dw(t)}y los coeficientesβj{\displaystyle \beta _{j}}comoβj=β(t)ρj(t)dw(t){\displaystyle \beta _{j}=\int \beta (t)\rho _{j}(t)\,dw(t)}paraj=1,2,{\displaystyle j=1,2,\ldots }.

mi(ξj)=0{\displaystyle {\text{E}}(\xi _{j})=0}yj=1βj2<{\displaystyle \sum _{j=1}^{\infty }\beta _{j}^{2}<\infty }y denotandoσj2=Var(ξj)=mi(ξj2){\displaystyle \sigma _{j}^{2}={\text{Var}}(\xi _{j})={\text{E}}(\xi _{j}^{2})}, entoncesj=1σj2=mi(incógnitado(t))2dw(t)<{\displaystyle \sum _{j=1}^{\infty }\sigma _{j}^{2}=\int {\text{E}}(X^{c}(t))^{2}\,dw(t)<\infty }.

A partir de la ortonormalidad de las funciones baseρj{\displaystyle \rho _{j}}De ello se deduce inmediatamente queincógnitado(t)β(t)dw(t)=j=1βjξj{\displaystyle \int X^{c}(t)\beta (t)\,dw(t)=\sum _{j=1}^{\infty }\beta _{j}\xi _{j}}.

El paso clave es entonces aproximarη=α+incógnitado(t)β(t)dw(t)=α+j=1βjξj{\displaystyle \eta =\alpha +\int X^{c}(t)\beta (t)\,dw(t)=\alpha +\sum _{j=1}^{\infty }\beta _{j}\xi _{j}}porηα+j=1pagβjξj{\displaystyle \eta \approx \alpha +\sum _{j=1}^{p}\beta _{j}\xi _{j}}para un punto de truncamiento elegido adecuadamentepag{\displaystyle p}.

FPCA proporciona la aproximación más parsimoniosa del predictor lineal para un número dado de funciones base, ya que la base de autofunciones explica más variación que cualquier otro conjunto de funciones base.

Para una función de enlace diferenciable con primera derivada acotada, el error de aproximación de lapag{\displaystyle p}-modelo truncado, es decir, el predictor lineal truncado a la suma de los primerospag{\displaystyle p}componentes, es un múltiplo constante deVar(j=pag+1βjξj)=mi((j=pag+1βjξj)2)=j=pag+1βjσj2{\displaystyle {\text{Var}}(\sum _{j=p+1}^{\infty }\beta _{j}\xi _{j})={\text{E}}\left(\left(\sum _{j=p+1}^{\infty }\beta _{j}\xi _{j}\right)^{2}\right)=\sum _{j=p+1}^{\infty }\beta _{j}\sigma _{j}^{2}}.

Una motivación heurística para la estrategia de truncamiento se deriva del hecho de quemi((j=pag+1βjξj)2)=j=pag+1βjσj2j=pag+1βj2 j=pag+1σj2{\displaystyle {\text{E}}\left(\left(\sum _{j=p+1}^{\infty }\beta _{j}\xi _{j}\right)^{2}\right)=\sum _{j=p+1}^{\infty }\beta _{j}\sigma _{j}^{2}\leq \sum _{j=p+1}^{\infty }\beta _{j}^{2}\ \sum _{j=p+1}^{\infty }\sigma _{j}^{2}}lo cual es consecuencia de la desigualdad de Cauchy-Schwarz y al observar que el lado derecho de la última desigualdad converge a 0 cuandopag{\displaystyle p\rightarrow \infty }ya que ambosj=1βj2{\displaystyle \sum _{j=1}^{\infty }\beta _{j}^{2}}yj=1σj2{\displaystyle \sum _{j=1}^{\infty }\sigma _{j}^{2}}son finitos.

Para el caso especial de la base de autofunciones, la secuenciaσj2,j=1,2,{\displaystyle \sigma _{j}^{2},j=1,2,\ldots }corresponde a la secuencia de los valores propios del núcleo de covarianzaGRAMO(s,t)=Cov(incógnita(s),incógnita(t)), s,tT{\displaystyle G(s,t)={\text{Cov}}(X(s),X(t)),\ s,t\in T}.

Para datos connorte{\displaystyle n}observaciones iid , configuraciónξj0=1{\displaystyle \xi _{j}^{0}=1},β0=α{\displaystyle \beta _{0}=\alpha }yξji=incógnitai(t)ρj(t)dw(t){\displaystyle \xi _{j}^{i}=\int X_{i}(t)\rho _{j}(t)\,dw(t)}, los predictores lineales aproximados pueden representarse comoηi=j=0pagβjξji,i=1,2,,norte{\displaystyle \eta _{i}=\sum _{j=0}^{p}\beta _{j}\xi _{j}^{i},i=1,2,\ldots ,n}que están relacionados con los medios a través deμi=gramo(ηi){\displaystyle \mu _{i}=g(\eta _{i})}.

Estimación

El objetivo principal es estimar la función de parámetros.β{\displaystyle \beta }.

Una vezpag{\displaystyle p}Una vez solucionado, se pueden utilizar los métodos GLM estándar y de cuasi-verosimilitud para elpag{\displaystyle p}-modelo truncado para estimarβT=(β0,β1,,βpag){\displaystyle {\boldsymbol {\beta }}^{T}=(\beta _{0},\beta _{1},\ldots ,\beta _{p})}resolviendo la ecuación de estimación o la ecuación de puntuación.U(β)=0.{\displaystyle U(\beta )=0.}

La función de puntuación vectorial resulta serU(β)=i=1norte(Yiμi)gramo(ηi)ξi/σ2(μi){\displaystyle U(\beta )=\sum _{i=1}^{n}(Y_{i}-\mu _{i})g'(\eta _{i})\xi _{i}/\sigma ^{2}(\mu _{i})}que depende deβ{\displaystyle {\boldsymbol {\beta }}}a través deμ{\displaystyle \mu }yη{\displaystyle \eta }.

Al igual que en GLM, la ecuaciónU(β)=0{\displaystyle U(\beta )=0}se resuelve utilizando métodos iterativos como Newton-Raphson (NR) o puntuación de Fisher (FS) o mínimos cuadrados reponderados iterativamente (IWLS) para obtener la estimación de los coeficientes de regresiónβ^{\displaystyle {\boldsymbol {\hat {\beta }}}}, lo que lleva a la estimación de la función de parámetros.β^(t)=β^o+j=1pagβ^jρj(t){\displaystyle {\hat {\beta }}(t)={\hat {\beta }}_{o}+\sum _{j=1}^{p}{\hat {\beta }}_{j}\rho _{j}(t)}. Al utilizar la función de enlace canónico , estos métodos son equivalentes.

Los resultados están disponibles en la literatura depag{\displaystyle p}-modelos truncados comopag{\displaystyle p\rightarrow \infty }que proporcionan inferencia asintótica para la desviación de la función paramétrica estimada de la función paramétrica verdadera y también pruebas asintóticas para efectos de regresión y regiones de confianza asintóticas .

Respuesta familiar exponencial

Si la variable de respuestaYi{\displaystyle Y_{i}}, dadoincógnitaiL2(T){\displaystyle X_{i}\in L^{2}(T)}sigue la familia exponencial de un parámetro, entonces su función de densidad de probabilidad o función de masa de probabilidad (según sea el caso) es

F(yiincógnitai)=exp(yiθib(θi)ϕ+do(yi,ϕ)){\displaystyle f(y_{i}\mid X_{i})=\exp \left({\frac {y_{i}\theta _{i}-b(\theta _{i})}{\phi }}+c(y_{i},\phi )\right)}

para algunas funcionesb{\displaystyle b}ydo{\displaystyle c}, dóndeθi{\displaystyle \theta _{i}}es el parámetro canónico, yϕ{\displaystyle \phi }es un parámetro de dispersión que normalmente se supone positivo.

En la configuración canónica,ηi=α+incógnitaido(t)β(t)dw(t)=θi{\displaystyle \eta _{i}=\alpha +\int X_{i}^{c}(t)\beta (t)\,dw(t)=\theta _{i}}y a partir de las propiedades de la familia exponencial,

μi=b(θi), y entonces μi=b(ηi).{\displaystyle \mu _{i}=b'(\theta _{i}),{\text{ and so }}\mu _{i}=b'(\eta _{i}).}

Por esob{\displaystyle b'}Sirve como función de enlace y se denomina función de enlace canónica.

Var(yi)=ϕb(θi)=ϕb(ηi)=ϕgramo(ηi)=ϕgramo(gramo1(μi))){\displaystyle {\text{Var}}(y_{i})=\phi b''(\theta _{i})=\phi b''(\eta _{i})=\phi g'(\eta _{i})=\phi g'(g^{-1}(\mu _{i})))}es la función de varianza correspondiente yϕ{\displaystyle \phi }el parámetro de dispersión.

Casos especiales

Regresión lineal funcional (RLF)

La regresión lineal funcional, una de las herramientas más útiles del análisis de datos funcionales, es un ejemplo de GFLM donde la variable de respuesta es continua y a menudo se supone que tiene una distribución normal . La función de varianza es una función constante y la función de enlace es la identidad. Bajo estos supuestos, la GFLM se reduce a la FLR,

μ=mi(Yincógnita)=η=α+incógnitado(t)β(t)dw(t){\displaystyle \mu =\operatorname {E} (Y\mid X)=\eta =\alpha +\int X^{c}(t)\beta (t)\,dw(t)}

Sin el supuesto de normalidad, la función de varianza constante justifica el uso de técnicas cuasinormales.

Regresión binaria funcional

Cuando la variable de respuesta tiene resultados binarios, es decir, 0 o 1, la distribución generalmente se elige como Bernoulli y luegoμi=PAG(Yi=1incógnitai){\displaystyle \mu _{i}=P(Y_{i}=1\mid X_{i})}Las funciones de enlace más populares son la función expit, que es la inversa de la función logit (regresión logística funcional) y la función probit (regresión probit funcional). Cualquier función de distribución acumulativa F tiene un rango [0,1] que es el rango de la media binomial y, por lo tanto, puede elegirse como función de enlace. Otra función de enlace en este contexto es la función log-log complementaria , que es un enlace asimétrico. La función de varianza para datos binarios viene dada porVar(Yi)=ϕμi(1μi){\displaystyle \operatorname {Var} (Y_{i})=\phi \mu _{i}(1-\mu _{i})}donde el parámetro de dispersiónϕ{\displaystyle \phi }se toma como 1 o, alternativamente, se utiliza el enfoque de cuasi-verosimilitud.

Regresión de Poisson funcional

Otro caso especial de GFLM ocurre cuando los resultados son recuentos, por lo que se supone que la distribución de las respuestas es de Poisson . La mediaμi{\displaystyle \mu _{i}}está típicamente vinculado al predictor linealηi{\displaystyle \eta _{i}}a través de un enlace logarítmico, que también es el enlace canónico. La función de varianza esVar(Yi)=ϕμi{\displaystyle \operatorname {Var} (Y_{i})=\phi \mu _{i}}donde el parámetro de dispersiónϕ{\displaystyle \phi }es 1, excepto cuando los datos pueden estar sobredispersos, que es cuando se utiliza el enfoque cuasi-Poisson.

Extensiones

Se han propuesto extensiones de GFLM para casos con múltiples funciones predictoras. [ 2 ] Otra generalización se denomina Regresión de Cuasi-verosimilitud Semiparamétrica (SPQR) [ 1 ] , que considera la situación en la que las funciones de enlace y varianza son desconocidas y se estiman de forma no paramétrica a partir de los datos. Esta situación también puede abordarse mediante modelos de índice único o múltiple, utilizando, por ejemplo, la Regresión Inversa Segmentada (SIR).

Otra extensión en este dominio es el Modelo Aditivo Generalizado Funcional (FGAM) [ 3 ] que es una generalización del modelo aditivo generalizado (GAM) donde

gramo1(mi(Yincógnita))=α+j=1pagFj(ξj),{\displaystyle g^{-1}(\operatorname {E} (Y\mid X))=\alpha +\sum _{j=1}^{p}f_{j}(\xi _{j}),}

dóndeξj{\displaystyle \xi _{j}}son los coeficientes de expansión de la función predictora aleatoriaincógnita{\displaystyle X}y cada unoFj{\displaystyle f_{j}}es una función suave desconocida que debe estimarse y dondemi(Fj(ξj))=0.{\displaystyle {\text{E}}(f_{j}(\xi _{j}))=0.}.

En general, la estimación en FGAM requiere combinar IWLS con backfitting . Sin embargo, si los coeficientes de expansión se obtienen como componentes principales funcionales, entonces en algunos casos (por ejemplo, función predictora gaussiana)incógnita{\displaystyle X}), serán independientes, en cuyo caso no se necesita el backfit, y se pueden utilizar métodos de suavizado populares para estimar las funciones de parámetros desconocidos.Fj{\displaystyle f_{j}}.

Solicitud

Trayectorias de puesta de huevos de la mosca mediterránea de la fruta durante los primeros 25 días

Un conjunto de datos popular que se ha utilizado para varios análisis en el ámbito del análisis de datos funcionales consiste en el número de huevos puestos diariamente hasta la muerte de 1000 moscas de la fruta mediterráneas (o moscas medmosas, para abreviar).El gráfico muestra las trayectorias de puesta de huevos durante los primeros 25 días de vida de aproximadamente 600 moscas mediterráneas hembras (aquellas que tienen al menos 20 huevos restantes a lo largo de su vida). Las curvas rojas corresponden a las moscas que pondrán menos huevos que la mediana, mientras que las curvas azules corresponden a las moscas que pondrán más huevos que la mediana después de los 25 años. Un problema relacionado, como la clasificación de las moscas mediterráneas como longevas o de corta vida, basándose en las trayectorias iniciales de puesta de huevos como predictores y la longevidad posterior de las moscas como respuesta, se ha estudiado con el GFLM [ 1 ].

Véase también

Referencias

  1. 1 2 3 Muller y Stadtmuller (2005). "Modelos lineales funcionales generalizados". The Annals of Statistics . 33 (2): 774– 805. arXiv : math/0505638 . doi : 10.1214/009053604000001156 .
  2. James (2002). "Modelos lineales generalizados con predictores funcionales". Journal of the Royal Statistical Society, Serie B. 64 ( 3): 411– 432. CiteSeerX 10.1.1.165.1333 . doi : 10.1111/1467-9868.00342 . 
  3. Muller y Yao (2008). "Modelos aditivos funcionales". Journal of the American Statistical Association . 103 (484): 1534– 1544. doi : 10.1198/016214508000000751 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Generalized_functional_linear_model&oldid=1313653522 "