Articulo de referencia

Modelo lineal generalizado vectorial

En estadística , se propuso la clase de modelos lineales generalizados vectoriales ( VGLM ) para ampliar el alcance de los modelos contemplados por los modelos lineales generali...

En estadística , se propuso la clase de modelos lineales generalizados vectoriales ( VGLM ) para ampliar el alcance de los modelos contemplados por los modelos lineales generalizados ( GLM ). En particular, los VGLM permiten variables de respuesta fuera de la familia exponencial clásica y para más de un parámetro. Cada parámetro (no necesariamente una media) puede transformarse mediante una función de enlace . El marco VGLM también es lo suficientemente grande como para acomodar de forma natural múltiples respuestas; se trata de varias respuestas independientes, cada una de las cuales proviene de una distribución estadística particular con valores de parámetros posiblemente diferentes.

Los modelos lineales generalizados vectoriales se describen en detalle en Yee (2015). [1] El algoritmo central adoptado es el método de mínimos cuadrados reponderados iterativamente , para la estimación de máxima verosimilitud de, por lo general, todos los parámetros del modelo. En particular, se implementa la puntuación de Fisher, que, para la mayoría de los modelos, utiliza la primera y la segunda derivada esperada de la función de log-verosimilitud.

Motivación

Los GLM cubren esencialmente modelos de un parámetro de la familia exponencial clásica e incluyen 3 de los modelos de regresión estadística más importantes: el modelo lineal, la regresión de Poisson para recuentos y la regresión logística para respuestas binarias. Sin embargo, la familia exponencial es demasiado limitante para el análisis de datos regular. Por ejemplo, para los recuentos, se encuentran regularmente inflación cero, truncamiento cero y sobredispersión, y las adaptaciones improvisadas realizadas a los modelos binomial y de Poisson en forma de cuasibinomial y cuasi-Poisson pueden argumentarse como ad hoc e insatisfactorias. Pero el marco VGLM maneja fácilmente modelos como la regresión de Poisson inflada a cero , la regresión de Poisson (obstáculo) alterada a cero, la regresión de Poisson positiva y la regresión binomial negativa . Como otro ejemplo, en el caso del modelo lineal, la varianza de una distribución normal se relega a un parámetro de escala y, a menudo, se la trata como un parámetro molesto (si es que se la considera como tal). Pero el marco VGLM permite modelar la varianza utilizando covariables.

En general, se puede pensar libremente en los VGLM como GLM que manejan muchos modelos fuera de la familia exponencial clásica y no están restringidos a la estimación de una media única. Durante la estimación, en lugar de utilizar mínimos cuadrados ponderados durante IRLS, se utilizan mínimos cuadrados generalizados para manejar la correlación entre los M predictores lineales.

Datos y notación

Suponemos que la respuesta o el resultado o la (s) variable (s) dependiente (s), , se generan a partir de una distribución particular . La mayoría de las distribuciones son univariadas, de modo que , y un ejemplo de es la distribución normal bivariada. y = ( y 1 , , y Q 1 ) T {\displaystyle {\boldsymbol {y}}=(y_{1},\ldots ,y_{Q_{1}})^{T}} Q 1 = 1 {\displaystyle Q_{1}=1} Q 1 = 2 {\displaystyle Q_{1}=2}

A veces escribimos nuestros datos como para . Cada una de las n observaciones se considera independiente. Entonces . Se conocen ponderaciones previas positivas y, a menudo , . ( x i , w i , y i ) {\displaystyle ({\boldsymbol {x}}_{i},w_{i},{\boldsymbol {y}}_{i})} i = 1 , , n {\displaystyle i=1,\ldots ,n} y i = ( y i 1 , , y i Q 1 ) T {\displaystyle {\boldsymbol {y}}_{i}=(y_{i1},\ldots ,y_{iQ_{1}})^{T}} w i {\displaystyle w_{i}} w i = 1 {\displaystyle w_{i}=1}

Las variables explicativas o independientes se escriben como , o cuando se necesita i , como . Generalmente hay una intersección con , en cuyo caso o . x = ( x 1 , , x p ) T {\displaystyle {\boldsymbol {x}}=(x_{1},\ldots ,x_{p})^{T}} x i = ( x i 1 , , x i p ) T {\displaystyle {\boldsymbol {x}}_{i}=(x_{i1},\ldots ,x_{ip})^{T}} x 1 = 1 {\displaystyle x_{1}=1} x i 1 = 1 {\displaystyle x_{i1}=1}

En realidad, el marco VGLM permite respuestas S , cada una de dimensión . En el ejemplo anterior, S  = 1. Por lo tanto, la dimensión de es más generalmente . Las respuestas S se manejan mediante código, como para S  = 3. Para simplificar las cosas, la mayor parte de este artículo tiene S  = 1. Q 1 {\displaystyle Q_{1}} y i {\displaystyle {\boldsymbol {y}}_{i}} Q = S × Q 1 {\displaystyle Q=S\times Q_{1}} vglm(cbind(y1, y2, y3) ~ x2 + x3, ..., data = mydata)

Componentes del modelo

El VGLM generalmente consta de cuatro elementos:

1. Una función de densidad de probabilidad o una función de masa de probabilidad de alguna distribución estadística que tenga una probabilidad logarítmica , derivadas primeras y una matriz de información esperada que se pueda calcular. El modelo debe satisfacer las condiciones de regularidad habituales de MLE . {\displaystyle \ell } / θ j {\displaystyle \partial \ell /\partial \theta _{j}}
2. Predictores lineales descritos a continuación para modelar cada parámetro , η j {\displaystyle \eta _{j}} θ j {\displaystyle \theta _{j}} j = 1 , , M . {\displaystyle j=1,\ldots ,M.}
3. Vincular funciones de manera que g j {\displaystyle g_{j}} θ j = g j 1 ( η j ) . {\displaystyle \theta _{j}=g_{j}^{-1}(\eta _{j}).}
4. Matrices de restricción para cada una de las columnas de rango completo y conocidas. H k {\displaystyle {\boldsymbol {H}}_{k}} k = 1 , , p , {\displaystyle k=1,\ldots ,p,}

Predictores lineales

Cada predictor lineal es una cantidad que incorpora información sobre las variables independientes en el modelo. El símbolo ( griego " eta ") denota un predictor lineal y se utiliza un subíndice j para denotar el j -ésimo. Relaciona el j -ésimo parámetro con las variables explicativas y se expresa como combinaciones lineales (por lo tanto, "lineales") de parámetros desconocidos , es decir, de coeficientes de regresión . η j {\displaystyle \eta _{j}} η j {\displaystyle \eta _{j}} β j , {\displaystyle {\boldsymbol {\beta }}_{j},} β ( j ) k {\displaystyle \beta _{(j)k}}

El j -ésimo parámetro, , de la distribución depende de las variables independientes, a través de θ j {\displaystyle \theta _{j}} x , {\displaystyle {\boldsymbol {x}},}

g j ( θ j ) = η j = β j T x . {\displaystyle g_{j}(\theta _{j})=\eta _{j}={\boldsymbol {\beta }}_{j}^{T}{\boldsymbol {x}}.}

Sea el vector de todos los predictores lineales. (Por conveniencia, siempre se deja que sea de dimensión M ). Por lo tanto, todas las covariables que comprenden afectan potencialmente a todos los parámetros a través de los predictores lineales . Más adelante, permitiremos que los predictores lineales se generalicen a predictores aditivos, que es la suma de funciones suaves de cada uno y cada función se estima a partir de los datos. η = ( η 1 , , η M ) T {\displaystyle {\boldsymbol {\eta }}=(\eta _{1},\ldots ,\eta _{M})^{T}} η {\displaystyle {\boldsymbol {\eta }}} x {\displaystyle {\boldsymbol {x}}} η j {\displaystyle \eta _{j}} x k {\displaystyle x_{k}}

Cada función de enlace proporciona la relación entre un predictor lineal y un parámetro de la distribución. Hay muchas funciones de enlace de uso común y su elección puede ser algo arbitraria. Tiene sentido intentar hacer coincidir el dominio de la función de enlace con el rango del valor del parámetro de la distribución. Observe arriba que la permite una función de enlace diferente para cada parámetro. Tienen propiedades similares a las de los modelos lineales generalizados , por ejemplo, las funciones de enlace comunes incluyen el enlace logit para los parámetros en y el enlace logarítmico para los parámetros positivos. El paquete tiene una función para parámetros que pueden asumir valores tanto positivos como negativos. g j {\displaystyle g_{j}} ( 0 , 1 ) {\displaystyle (0,1)} VGAMidentitylink()

Matrices de restricción

En términos más generales, el marco VGLM permite cualquier restricción lineal entre los coeficientes de regresión de cada predictor lineal. Por ejemplo, podemos querer establecer algunos para que sean iguales a 0, o restringir algunos de ellos para que sean iguales. Tenemos β ( j ) k {\displaystyle \beta _{(j)k}}

η = k = 1 p β ( k ) x k = k = 1 p H k β ( k ) x k {\displaystyle {\boldsymbol {\eta }}=\sum _{k=1}^{p}\,{\boldsymbol {\beta }}_{(k)}^{}\,x_{k}=\sum _{k=1}^{p}\,{\boldsymbol {H}}_{k}\;{\boldsymbol {\beta }}_{(k)}^{*}\,x_{k}}

donde son las matrices de restricción . Cada matriz de restricción es conocida y preespecificada, y tiene M filas, y entre 1 y M columnas. Los elementos de las matrices de restricción tienen valores finitos, y a menudo son solo 0 o 1. Por ejemplo, el valor 0 omite efectivamente ese elemento mientras que un 1 lo incluye. Es común que algunos modelos tengan un supuesto de paralelismo , lo que significa que para , y para algunos modelos, para también. El caso especial cuando para todos se conoce como restricciones triviales ; todos los coeficientes de regresión se estiman y no están relacionados. Y se conoce como un parámetro de solo intersección si la j ésima fila de todos los son iguales a para , es decir, es igual a solo una intersección. Los parámetros de solo intersección se modelan de la manera más simple posible, como un escalar. H k {\displaystyle {\boldsymbol {H}}_{k}} H k = 1 M {\displaystyle {\boldsymbol {H}}_{k}={\boldsymbol {1}}_{M}} k = 2 , , p {\displaystyle k=2,\ldots ,p} k = 1 {\displaystyle k=1} H k = I M {\displaystyle {\boldsymbol {H}}_{k}={\boldsymbol {I}}_{M}} k = 1 , , p {\displaystyle k=1,\ldots ,p} θ j {\displaystyle \theta _{j}} H k = {\displaystyle {\boldsymbol {H}}_{k}=} 0 T {\displaystyle {\boldsymbol {0}}^{T}} k = 2 , , p {\displaystyle k=2,\ldots ,p} η j = β ( j ) 1 {\displaystyle \eta _{j}=\beta _{(j)1}^{*}}

Los parámetros desconocidos, , se estiman normalmente mediante el método de máxima verosimilitud . Todos los coeficientes de regresión se pueden introducir en una matriz de la siguiente manera: β = ( β ( 1 ) T , , β ( p ) T ) T {\displaystyle {\boldsymbol {\beta }}^{*}=({\boldsymbol {\beta }}_{(1)}^{*T},\ldots ,{\boldsymbol {\beta }}_{(p)}^{*T})^{T}}

η i = B T x i = ( β 1 T x i β M T x i ) = ( β ( 1 ) , , β ( p ) ) x i . {\displaystyle {\boldsymbol {\eta }}_{i}={\boldsymbol {B}}^{T}{\boldsymbol {x}}_{i}={\begin{pmatrix}{\boldsymbol {\beta }}_{1}^{T}\,{\boldsymbol {x}}_{i}\\\vdots \\{\boldsymbol {\beta }}_{M}^{T}\,{\boldsymbol {x}}_{i}\\\end{pmatrix}}=\left({\boldsymbol {\beta }}_{(1)}^{},\ldots ,{\boldsymbol {\beta }}_{(p)}^{}\right)\;{\boldsymbol {x}}_{i}.}

La instalación xij

De manera aún más general, se puede permitir que el valor de una variable tenga un valor diferente para cada . Por ejemplo, si cada predictor lineal es para un punto de tiempo diferente, entonces se podría tener una covariable que varíe en el tiempo. Por ejemplo, en los modelos de elección discreta , se tienen modelos logit condicionales , modelos logit anidados , modelos logit generalizados y similares, para distinguir entre ciertas variantes y ajustar un modelo logit multinomial a, por ejemplo, las opciones de transporte. Una variable como el costo difiere dependiendo de la elección, por ejemplo, el taxi es más caro que el autobús, que es más caro que caminar. La facilidad de permite generalizar a . x k {\displaystyle x_{k}} η j {\displaystyle \eta _{j}} xijVGAM η j ( x i ) {\displaystyle \eta _{j}({\boldsymbol {x}}_{i})} η j ( x i j ) {\displaystyle \eta _{j}({\boldsymbol {x}}_{ij})}

La fórmula más general es

η i = o i + k = 1 p d i a g ( x i k 1 , , x i k M ) H k β ( k ) . {\displaystyle {\boldsymbol {\eta }}_{i}={\boldsymbol {o}}_{i}+\sum _{k=1}^{p}\,diag(x_{ik1},\ldots ,x_{ikM})\,\mathbf {H} _{k}\,{\boldsymbol {\beta }}_{(k)}^{*}.}

Aquí hay un desplazamiento opcional , que en la práctica se traduce como una matriz. El paquete tiene un argumento que permite introducir los elementos sucesivos de la matriz diagonal. o i {\displaystyle {\boldsymbol {o}}_{i}} n × M {\displaystyle n\times M} VGAMxij

Software

Yee (2015) [1] describe una implementación del paquete R en el llamado VGAM. [2] Actualmente, este software se adapta a aproximadamente 150 modelos/distribuciones. Las funciones de modelado centrales son vglm()y vgam(). Al familyargumento se le asigna una función de la familia VGAM , por ejemplo, family = negbinomialpara la regresión binomial negativa , family = poissonffpara la regresión de Poisson , family = propoddspara el modelo impar proporcional o el modelo logit acumulativo para la regresión categórica ordinal.

Adecuado

Máxima verosimilitud

Estamos maximizando una probabilidad logarítmica

= i = 1 n w i i , {\displaystyle \ell =\sum _{i=1}^{n}\,w_{i}\,\ell _{i},}

donde son ponderaciones previas positivas y conocidas . Las estimaciones de máxima verosimilitud se pueden encontrar utilizando un algoritmo de mínimos cuadrados reponderado iterativamente utilizando el método de puntuación de Fisher , con actualizaciones de la forma: w i {\displaystyle w_{i}}

β ( a + 1 ) = β ( a ) + I 1 ( β ( a ) ) u ( β ( a ) ) , {\displaystyle {\boldsymbol {\beta }}^{(a+1)}={\boldsymbol {\beta }}^{(a)}+{\boldsymbol {\mathcal {I}}}^{-1}({\boldsymbol {\beta }}^{(a)})\,\,\mathbf {u} ({\boldsymbol {\beta }}^{(a)}),}

donde es la matriz de información de Fisher en la iteración a . También se denomina matriz de información esperada o EIM . I ( β ( a ) ) {\displaystyle {\boldsymbol {\mathcal {I}}}({\boldsymbol {\beta }}^{(a)})}

VLM

Para el cálculo, la matriz modelo (pequeña) construida a partir del lado derecho de la fórmula en vglm() y las matrices de restricción se combinan para formar una matriz modelo grande . El IRLS se aplica a esta gran X. Esta matriz se conoce como la matriz VLM, ya que el modelo lineal vectorial es el problema de mínimos cuadrados subyacente que se está resolviendo. Una VLM es una regresión multivariante ponderada donde la matriz de varianza-covarianza para cada fila de la matriz de respuesta no es necesariamente la misma y se conoce. (En la regresión multivariante clásica, todos los errores tienen la misma matriz de varianza-covarianza y se desconoce). En particular, la VLM minimiza la suma ponderada de cuadrados.

R e s S S = i = 1 n w i { z i ( a 1 ) η i ( a 1 ) } T W i ( a 1 ) { z i ( a 1 ) η i ( a 1 ) } {\displaystyle \mathrm {ResSS} =\sum _{i=1}^{n}\;w_{i}\left\{\mathbf {z} _{i}^{(a-1)}-{\boldsymbol {\eta }}_{i}^{(a-1)}\right\}^{T}\mathbf {W} _{i}^{(a-1)}\left\{\mathbf {z} _{i}^{(a-1)}-{\boldsymbol {\eta }}_{i}^{(a-1)}\right\}}

Esta cantidad se minimiza en cada iteración de IRLS. Las respuestas de trabajo (también conocidas como pseudorrespuesta y vectores dependientes ajustados ) son

z i = η i + W i 1 u i , {\displaystyle \mathbf {z} _{i}={\boldsymbol {\eta }}_{i}+\mathbf {W} _{i}^{-1}\mathbf {u} _{i},}

donde se conocen como pesos de trabajo o matrices de pesos de trabajo . Son simétricas y definidas positivas. El uso de la EIM ayuda a garantizar que todas sean definidas positivas (y no solo la suma de ellas) en gran parte del espacio de parámetros. Por el contrario, el uso de Newton-Raphson significaría que se utilizarían las matrices de información observada, y estas tienden a ser definidas positivas en un subconjunto más pequeño del espacio de parámetros. W i {\displaystyle \mathbf {W} _{i}}

Computacionalmente, se utiliza la descomposición de Cholesky para invertir las matrices de peso de trabajo y convertir el problema de mínimos cuadrados generalizados en un problema de mínimos cuadrados ordinario .

Ejemplos

Modelos lineales generalizados

Por supuesto, todos los modelos lineales generalizados son casos especiales de modelos lineales generales, pero a menudo estimamos todos los parámetros mediante una estimación de máxima verosimilitud en lugar de utilizar el método de momentos para el parámetro de escala.

Respuesta categórica ordenada

Si la variable de respuesta es una medida ordinal con niveles M  + 1 , entonces se puede ajustar una función modelo de la forma:

g ( θ j ) = η j {\displaystyle g(\theta _{j})=\eta _{j}}   dónde θ j = P r ( Y j ) , {\displaystyle \theta _{j}=\mathrm {Pr} (Y\leq j),}

Para diferentes enlaces g se obtienen modelos de probabilidades proporcionales o modelos probit ordenados , por ejemplo, la función de familia asigna un enlace probit a las probabilidades acumuladas, por lo que este modelo también se denomina modelo probit acumulativo . En general se denominan modelos de enlace acumulativo . j = 1 , , M . {\displaystyle j=1,\ldots ,M.} VGAMcumulative(link = probit)

Para distribuciones categóricas y multinomiales, los valores ajustados son un vector ( M  + 1) de probabilidades, con la propiedad de que todas las probabilidades suman 1. Cada probabilidad indica la probabilidad de ocurrencia de uno de los M  + 1 valores posibles.

Respuesta categórica desordenada

Si la variable de respuesta es una medida nominal , o los datos no satisfacen los supuestos de un modelo ordenado, entonces se puede ajustar un modelo de la siguiente forma:

log [ P r ( Y = j ) P r ( Y = M + 1 ) ] = η j , {\displaystyle \log \left[{\frac {Pr(Y=j)}{\mathrm {Pr} (Y=M+1)}}\right]=\eta _{j},}

El vínculo anterior a veces se denomina vínculo multilogit y el modelo se denomina modelo logit multinomial . Es común elegir el primer o el último nivel de la respuesta como grupo de referencia o línea base ; el anterior utiliza el último nivel. La función de familia se ajusta al modelo anterior y tiene un argumento llamado al que se puede asignar el nivel utilizado como grupo de referencia. j = 1 , , M . {\displaystyle j=1,\ldots ,M.} VGAMmultinomial()refLevel

Contar datos

La teoría GLM clásica realiza una regresión de Poisson para los datos de recuento . El vínculo suele ser el logaritmo, que se conoce como vínculo canónico . La función de varianza es proporcional a la media:

Var ( Y i ) = τ μ i , {\displaystyle \operatorname {Var} (Y_{i})=\tau \mu _{i},\,}

donde el parámetro de dispersión se fija típicamente en exactamente uno. Cuando no lo es, el modelo de cuasi-verosimilitud resultante se describe a menudo como Poisson con sobredispersión o cuasi-Poisson ; entonces se estima comúnmente mediante el método de momentos y, como tal, los intervalos de confianza para son difíciles de obtener. τ {\displaystyle \tau } τ {\displaystyle \tau } τ {\displaystyle \tau }

Por el contrario, los VGLM ofrecen un conjunto mucho más rico de modelos para manejar la sobredispersión con respecto a la distribución de Poisson, por ejemplo, la distribución binomial negativa y varias variantes de la misma. Otro modelo de regresión de conteo es la distribución de Poisson generalizada . Otros modelos posibles son la distribución zeta y la distribución Zipf .

Extensiones

Modelos lineales generalizados de vectores de rango reducido

Los RR-VGLM son VGLM donde un subconjunto de la matriz B es de un rango inferior . Sin pérdida de generalidad, supongamos que es una partición del vector de covariables. Entonces la parte de la matriz B correspondiente a tiene la forma donde y son matrices delgadas (es decir, con R columnas), p. ej., vectores si el rango R  = 1. Los RR-VGLM ofrecen potencialmente varias ventajas cuando se aplican a ciertos modelos y conjuntos de datos. En primer lugar, si M y p son grandes, entonces el número de coeficientes de regresión que se estiman mediante VGLM es grande ( ). Entonces los RR-VGLM pueden reducir enormemente el número de coeficientes de regresión estimados si R es bajo, p. ej., R  = 1 o R  = 2. Un ejemplo de un modelo donde esto es particularmente útil es el modelo logit multinomial RR , también conocido como modelo de estereotipo . En segundo lugar, es un R -vector de variables latentes y, a menudo, estas se pueden interpretar de manera útil. Si R  = 1, entonces podemos escribir de modo que la variable latente comprenda cargas sobre las variables explicativas. Se puede observar que los RR-VGLM toman combinaciones lineales óptimas de y luego se ajusta un VGLM a las variables explicativas . En tercer lugar, se puede producir un biplot si R  = 2, y esto permite visualizar el modelo. x = ( x 1 T , x 2 T ) T {\displaystyle {\boldsymbol {x}}=({\boldsymbol {x}}_{1}^{T},{\boldsymbol {x}}_{2}^{T})^{T}} x 2 {\displaystyle {\boldsymbol {x}}_{2}} A C T {\displaystyle {\boldsymbol {A}}{\boldsymbol {C}}^{T}} A {\displaystyle {\boldsymbol {A}}} C {\displaystyle {\boldsymbol {C}}} M × p {\displaystyle M\times p} ν = C T x 2 = ( ν 1 , , ν R ) T {\displaystyle {\boldsymbol {\nu }}={\boldsymbol {C}}^{T}{\boldsymbol {x}}_{2}=(\nu _{1},\ldots ,\nu _{R})^{T}} ν = c T x 2 {\displaystyle \nu ={\boldsymbol {c}}^{T}{\boldsymbol {x}}_{2}} x 2 {\displaystyle {\boldsymbol {x}}_{2}} ( x 1 , ν ) {\displaystyle ({\boldsymbol {x}}_{1},{\boldsymbol {\nu }})}

Se puede demostrar que los RR-VGLM son simplemente VGLM donde las matrices de restricción para las variables en son desconocidas y deben estimarse. Luego resulta que para tales variables. Los RR-VGLM pueden estimarse mediante un algoritmo alterno que fija y estima y luego fija y estima , etc. x 2 {\displaystyle {\boldsymbol {x}}_{2}} H k = A {\displaystyle {\boldsymbol {H}}_{k}={\boldsymbol {A}}} A {\displaystyle {\boldsymbol {A}}} C , {\displaystyle {\boldsymbol {C}},} C {\displaystyle {\boldsymbol {C}}} A {\displaystyle {\boldsymbol {A}}}

En la práctica, se necesitan algunas restricciones de unicidad para y/o . En , la función usa restricciones de esquina de manera predeterminada, lo que significa que las filas R superiores de se establecen en . Los RR-VGLM se propusieron en 2003. [3] A {\displaystyle {\boldsymbol {A}}} C {\displaystyle {\boldsymbol {C}}} VGAMrrvglm() A {\displaystyle {\boldsymbol {A}}} I R {\displaystyle {\boldsymbol {I}}_{R}}

Dos a uno

Un caso especial de RR-VGLM es cuando R  = 1 y M  = 2. Esto es una reducción de dimensión de 2 parámetros a 1 parámetro. Entonces se puede demostrar que

θ 2 = g 2 1 ( t 1 + a 21 g 1 ( θ 1 ) ) , {\displaystyle \theta _{2}=g_{2}^{-1}\left(t_{1}+a_{21}\cdot g_{1}(\theta _{1})\right),}

donde se estiman los elementos y . De manera equivalente, t 1 {\displaystyle t_{1}} a 21 {\displaystyle a_{21}}

η 2 = t 1 + a 21 η 1 . {\displaystyle \eta _{2}=t_{1}+a_{21}\cdot \eta _{1}.}

Esta fórmula proporciona un acoplamiento de y . Induce una relación entre dos parámetros de un modelo que puede ser útil, por ejemplo, para modelar una relación media-varianza. A veces hay alguna opción de funciones de enlace, por lo tanto, ofrece un poco de flexibilidad al acoplar los dos parámetros, por ejemplo, un enlace logit, probit, cauchit o cloglog para parámetros en el intervalo unitario. La fórmula anterior es particularmente útil para la distribución binomial negativa , de modo que la RR-NB tiene función de varianza η 1 {\displaystyle \eta _{1}} η 2 {\displaystyle \eta _{2}}

Var ( Y x ) = μ ( x ) + δ 1 μ ( x ) δ 2 . {\displaystyle \operatorname {Var} (Y\mid {\boldsymbol {x}})=\mu ({\boldsymbol {x}})+\delta _{1}\,\mu ({\boldsymbol {x}})^{\delta _{2}}.}

Algunos autores la han denominado variante NB-P . Se estiman y también es posible obtener intervalos de confianza aproximados para ellos. δ 1 {\displaystyle \delta _{1}} δ 2 {\displaystyle \delta _{2}}

Por cierto, también se pueden ajustar otras variantes útiles de NB, con la ayuda de la selección de la combinación correcta de matrices de restricción. Por ejemplo, NB  − 1, NB  − 2 ( negbinomial()predeterminado), NB  −  H ; consulte Yee (2014) [4] y la Tabla 11.3 de Yee (2015). [1]

RCIM

También se ha propuesto la subclase de modelos de interacción fila-columna (RCIM); estos son un tipo especial de RR-VGLM. Los RCIM se aplican solo a una respuesta de matriz Y y no hay variables explicativas explícitas . En cambio, las variables indicadoras para cada fila y columna se establecen explícitamente, y se permite una interacción de orden- R de la forma . Los casos especiales de este tipo de modelo incluyen el modelo de asociación RC de Goodman y la metodología de cuasi-varianzas tal como se implementa en el paquete R. x {\displaystyle {\boldsymbol {x}}} A C T {\displaystyle {\boldsymbol {A}}{\boldsymbol {C}}^{T}} qvcalc

Los RCIM se pueden definir como un RR-VGLM aplicado a Y con

g 1 ( θ 1 ) η 1 i j = β 0 + α i + γ j + r = 1 R c i r a j r . {\displaystyle g_{1}(\theta _{1})\equiv \eta _{1ij}=\beta _{0}+\alpha _{i}+\gamma _{j}+\sum _{r=1}^{R}c_{ir}\,a_{jr}.}

Para el modelo de asociación RC de Goodman, tenemos que si R  = 0 entonces es una regresión de Poisson ajustada a una matriz de conteos con efectos de fila y efectos de columna; esto tiene una idea similar a un modelo ANOVA de dos vías sin interacción. η 1 i j = log μ i j , {\displaystyle \eta _{1ij}=\log \mu _{ij},}

Otro ejemplo de un RCIM es si es el enlace de identidad y el parámetro es la mediana y el modelo corresponde a una distribución de Laplace asimétrica; entonces un RCIM sin interacción es similar a una técnica llamada pulido de mediana . g 1 {\displaystyle g_{1}}

En VGAM, las funciones rcim()y grc()se ajustan a los modelos anteriores. Además, Yee y Hadi (2014) [5] muestran que los RCIM se pueden utilizar para ajustar modelos de ordenación cuadrática sin restricciones a datos de especies; este es un ejemplo de análisis de gradiente indirecto en ordenación (un tema de ecología estadística).

Modelos aditivos generalizados vectoriales

Los modelos aditivos generalizados vectoriales (VGAM) son una extensión importante de los VGLM en los que el predictor lineal no está restringido a ser lineal en las covariables, sino que es la suma de funciones de suavizado aplicadas a : η j {\displaystyle \eta _{j}} x k {\displaystyle x_{k}} x k {\displaystyle x_{k}}

η ( x ) = H 1 β ( 1 ) + H 2 f ( 2 ) ( x 2 ) + H 3 f ( 3 ) ( x 3 ) + {\displaystyle {\boldsymbol {\eta }}({\boldsymbol {x}})={\boldsymbol {H}}_{1}\,{\boldsymbol {\beta }}_{(1)}^{*}+{\boldsymbol {H}}_{2}\,{\boldsymbol {f}}_{(2)}^{*}(x_{2})+{\boldsymbol {H}}_{3}\,{\boldsymbol {f}}_{(3)}^{*}(x_{3})+\cdots \,\!}

donde Estos son M predictores aditivos . Cada función suavizada se estima a partir de los datos. Por lo tanto, los VGLM están impulsados ​​por modelos mientras que los VGAM están impulsados ​​por datos . Actualmente, solo se implementan splines de suavizado en el paquete. Para M  > 1, en realidad son splines vectoriales , que estiman las funciones componentes en simultáneamente. Por supuesto, se podrían usar splines de regresión con VGLM. La motivación detrás de los VGAM es similar a la de Hastie y Tibshirani (1990) [6] y Wood (2017). [7] Los VGAM se propusieron en 1996. [8] f ( k ) ( x k ) = ( f ( 1 ) k ( x k ) , f ( 2 ) k ( x k ) , ) T . {\displaystyle {\boldsymbol {f}}_{(k)}^{*}(x_{k})=(f_{(1)k}^{*}(x_{k}),f_{(2)k}^{*}(x_{k}),\ldots )^{T}.} f ( j ) k {\displaystyle f_{(j)k}^{*}} VGAM f ( j ) k ( x k ) {\displaystyle f_{(j)k}^{*}(x_{k})}

Actualmente, se está trabajando para estimar VGAM utilizando P-splines de Eilers y Marx (1996). [9] Esto permite varias ventajas sobre el uso de splines de suavizado y retroajuste vectorial , como la capacidad de realizar una selección automática de parámetros de suavizado más fácilmente.

Modelos lineales generalizados de vector de rango reducido cuadrático

Estos agregan una variable cuadrática en la variable latente a la clase RR-VGLM. El resultado es una curva en forma de campana que se puede ajustar a cada respuesta, como una función de la variable latente. Para R  = 2, se tienen superficies en forma de campana como una función de las 2 variables latentes, algo similar a una distribución normal bivariada . Se pueden encontrar aplicaciones particulares de los QRR-VGLM en ecología , en un campo del análisis multivariado llamado ordenación .

Como ejemplo específico de rango 1 de un QRR-VGLM, considere los datos de Poisson con S especies. El modelo para las especies s es la regresión de Poisson.

log μ s ( ν ) = η s ( ν ) = β ( s ) 1 + β ( s ) 2 ν + β ( s ) 3 ν 2 = α s 1 2 ( ν u s t s ) 2 , {\displaystyle \log \,\mu _{s}(\nu )=\eta _{s}(\nu )=\beta _{(s)1}+\beta _{(s)2}\,\nu +\beta _{(s)3}\,\nu ^{2}=\alpha _{s}-{\frac {1}{2}}\left({\frac {\nu -u_{s}}{t_{s}}}\right)^{2},}

para . La parametrización más a la derecha que utiliza los símbolos tiene un significado ecológico particular, porque se relacionan con la abundancia de especies , el óptimo y la tolerancia respectivamente. Por ejemplo, la tolerancia es una medida del ancho del nicho, y un valor grande significa que esa especie puede vivir en una amplia gama de entornos. En la ecuación anterior, se necesitaría para obtener una curva en forma de campana. s = 1 , , S {\displaystyle s=1,\ldots ,S} α s , {\displaystyle \alpha _{s},} u s , {\displaystyle u_{s},} t s , {\displaystyle t_{s},} β ( s ) 3 < 0 {\displaystyle \beta _{(s)3}<0}

Los QRR-VGLM se ajustan a los modelos de ordenación gaussiana mediante estimación de máxima verosimilitud y son un ejemplo de análisis de gradiente directo . La cqo()función del VGAMpaquete actualmente llama optim()a buscar el óptimo y, dado eso, es fácil calcular las puntuaciones del sitio y ajustar un modelo lineal generalizado adecuado a eso. La función recibe su nombre del acrónimo CQO, que significa ordenación cuadrática restringida : la restringida es para el análisis de gradiente directo (hay variables ambientales y una combinación lineal de estas se toma como variable latente) y la cuadrática es para la forma cuadrática en las variables latentes en la escala. Desafortunadamente, los QRR-VGLM son sensibles a los valores atípicos tanto en las variables de respuesta como en las explicativas, además de ser computacionalmente costosos y pueden dar una solución local en lugar de una solución global. Los QRR-VGLM se propusieron en 2004. [10] C {\displaystyle {\boldsymbol {C}}} ν {\displaystyle {\boldsymbol {\nu }}} η {\displaystyle {\boldsymbol {\eta }}}

Véase también

Referencias

  1. ^ abc Yee, TW (2015). Modelos lineales y aditivos generalizados vectoriales: con una implementación en R. Nueva York, EE. UU.: Springer. ISBN  978-1-4939-2817-0.
  2. ^ "Modelos lineales generalizados vectoriales". 18 de enero de 2016.
  3. ^ Yee, TW; Hastie, TJ (2003). "Modelos lineales generalizados de vector de rango reducido". Modelado estadístico . 3 (1): 15– 41. CiteSeerX 10.1.1.36.3700 . doi :10.1191/1471082x03st045oa. S2CID  122810408. 
  4. ^ Yee, TW (1996). "Modelos lineales generalizados de vector de rango reducido con dos predictores lineales". Computational Statistics & Data Analysis . 71 : 889– 902. doi :10.1016/j.csda.2013.01.012.
  5. ^ Yee, TW; Hadi, AF (2014). "Modelos de interacción fila-columna, con una implementación R". Computational Statistics . 29 (6): 1427– 1445. doi :10.1007/s00180-014-0499-9. S2CID  253724333.
  6. ^ Hastie, TJ; Tibshirani, RJ (1990). Modelos aditivos generalizados . Londres: Chapman y Hall.
  7. ^ Wood, SN (2017). Modelos aditivos generalizados: una introducción con R (segunda edición). Londres: Chapman and Hall. ISBN  9781498728331.
  8. ^ Yee, TW; Wild, CJ (1996). "Modelos aditivos generalizados vectoriales". Revista de la Royal Statistical Society, Serie B. 58 ( 3): 481– 493. doi :10.1111/j.2517-6161.1996.tb02095.x.
  9. ^ Eilers, PHC; Marx, BD (1996). "Suavizado flexible con B-splines y penalizaciones". Ciencia estadística . 11 (2): 89– 121. CiteSeerX 10.1.1.47.4521 . doi :10.1214/ss/1038425655.  
  10. ^ Yee, TW (2004). "Una nueva técnica para la ordenación gaussiana canónica de máxima verosimilitud". Monografías ecológicas . 74 (4): 685– 701. doi :10.1890/03-0078.

Lectura adicional

  • Hilbe, Joseph (2011). Regresión binomial negativa (2.ª ed.). Cambridge: Cambridge University Press. ISBN 978-0-521-19815-8.
Retrieved from "https://en.wikipedia.org/w/index.php?title=Vector_generalized_linear_model&oldid=1266872000"