En estadística , se propuso la clase de modelos lineales generalizados vectoriales ( VGLM ) para ampliar el alcance de los modelos contemplados por los modelos lineales generalizados ( GLM ). En particular, los VGLM permiten variables de respuesta fuera de la familia exponencial clásica y para más de un parámetro. Cada parámetro (no necesariamente una media) puede transformarse mediante una función de enlace . El marco VGLM también es lo suficientemente grande como para acomodar de forma natural múltiples respuestas; se trata de varias respuestas independientes, cada una de las cuales proviene de una distribución estadística particular con valores de parámetros posiblemente diferentes.
Los modelos lineales generalizados vectoriales se describen en detalle en Yee (2015). [1] El algoritmo central adoptado es el método de mínimos cuadrados reponderados iterativamente , para la estimación de máxima verosimilitud de, por lo general, todos los parámetros del modelo. En particular, se implementa la puntuación de Fisher, que, para la mayoría de los modelos, utiliza la primera y la segunda derivada esperada de la función de log-verosimilitud.
Motivación
Los GLM cubren esencialmente modelos de un parámetro de la familia exponencial clásica e incluyen 3 de los modelos de regresión estadística más importantes: el modelo lineal, la regresión de Poisson para recuentos y la regresión logística para respuestas binarias. Sin embargo, la familia exponencial es demasiado limitante para el análisis de datos regular. Por ejemplo, para los recuentos, se encuentran regularmente inflación cero, truncamiento cero y sobredispersión, y las adaptaciones improvisadas realizadas a los modelos binomial y de Poisson en forma de cuasibinomial y cuasi-Poisson pueden argumentarse como ad hoc e insatisfactorias. Pero el marco VGLM maneja fácilmente modelos como la regresión de Poisson inflada a cero , la regresión de Poisson (obstáculo) alterada a cero, la regresión de Poisson positiva y la regresión binomial negativa . Como otro ejemplo, en el caso del modelo lineal, la varianza de una distribución normal se relega a un parámetro de escala y, a menudo, se la trata como un parámetro molesto (si es que se la considera como tal). Pero el marco VGLM permite modelar la varianza utilizando covariables.
En general, se puede pensar libremente en los VGLM como GLM que manejan muchos modelos fuera de la familia exponencial clásica y no están restringidos a la estimación de una media única. Durante la estimación, en lugar de utilizar mínimos cuadrados ponderados durante IRLS, se utilizan mínimos cuadrados generalizados para manejar la correlación entre los M predictores lineales.
Datos y notación
Suponemos que la respuesta o el resultado o la (s) variable (s) dependiente (s), , se generan a partir de una distribución particular . La mayoría de las distribuciones son univariadas, de modo que , y un ejemplo de es la distribución normal bivariada.
A veces escribimos nuestros datos como para . Cada una de las n observaciones se considera independiente. Entonces . Se conocen ponderaciones previas positivas y, a menudo , .
Las variables explicativas o independientes se escriben como , o cuando se necesita i , como . Generalmente hay una intersección con , en cuyo caso o .
En realidad, el marco VGLM permite respuestas S , cada una de dimensión . En el ejemplo anterior, S = 1. Por lo tanto, la dimensión de es más generalmente . Las respuestas S se manejan mediante código, como para S = 3. Para simplificar las cosas, la mayor parte de este artículo tiene S = 1.
vglm(cbind(y1, y2, y3) ~ x2 + x3, ..., data = mydata)
Componentes del modelo
El VGLM generalmente consta de cuatro elementos:
- 1. Una función de densidad de probabilidad o una función de masa de probabilidad de alguna distribución estadística que tenga una probabilidad logarítmica , derivadas primeras y una matriz de información esperada que se pueda calcular. El modelo debe satisfacer las condiciones de regularidad habituales de MLE .
- 2. Predictores lineales descritos a continuación para modelar cada parámetro ,
- 3. Vincular funciones de manera que
- 4. Matrices de restricción para cada una de las columnas de rango completo y conocidas.
Predictores lineales
Cada predictor lineal es una cantidad que incorpora información sobre las variables independientes en el modelo. El símbolo ( griego " eta ") denota un predictor lineal y se utiliza un subíndice j para denotar el j -ésimo. Relaciona el j -ésimo parámetro con las variables explicativas y se expresa como combinaciones lineales (por lo tanto, "lineales") de parámetros desconocidos , es decir, de coeficientes de regresión .
El j -ésimo parámetro, , de la distribución depende de las variables independientes, a través de
Sea el vector de todos los predictores lineales. (Por conveniencia, siempre se deja que sea de dimensión M ). Por lo tanto, todas las covariables que comprenden afectan potencialmente a todos los parámetros a través de los predictores lineales . Más adelante, permitiremos que los predictores lineales se generalicen a predictores aditivos, que es la suma de funciones suaves de cada uno y cada función se estima a partir de los datos.
Funciones de enlace
Cada función de enlace proporciona la relación entre un predictor lineal y un parámetro de la distribución. Hay muchas funciones de enlace de uso común y su elección puede ser algo arbitraria. Tiene sentido intentar hacer coincidir el dominio de la función de enlace con el rango del valor del parámetro de la distribución. Observe arriba que la permite una función de enlace diferente para cada parámetro. Tienen propiedades similares a las de los modelos lineales generalizados , por ejemplo, las funciones de enlace comunes incluyen el enlace logit para los parámetros en y el enlace logarítmico para los parámetros positivos. El paquete tiene una función para parámetros que pueden asumir valores tanto positivos como negativos.
VGAMidentitylink()
Matrices de restricción
En términos más generales, el marco VGLM permite cualquier restricción lineal entre los coeficientes de regresión de cada predictor lineal. Por ejemplo, podemos querer establecer algunos para que sean iguales a 0, o restringir algunos de ellos para que sean iguales. Tenemos
donde son las matrices de restricción . Cada matriz de restricción es conocida y preespecificada, y tiene M filas, y entre 1 y M columnas. Los elementos de las matrices de restricción tienen valores finitos, y a menudo son solo 0 o 1. Por ejemplo, el valor 0 omite efectivamente ese elemento mientras que un 1 lo incluye. Es común que algunos modelos tengan un supuesto de paralelismo , lo que significa que para , y para algunos modelos, para también. El caso especial cuando para todos se conoce como restricciones triviales ; todos los coeficientes de regresión se estiman y no están relacionados. Y se conoce como un parámetro de solo intersección si la j ésima fila de todos los son iguales a para , es decir, es igual a solo una intersección. Los parámetros de solo intersección se modelan de la manera más simple posible, como un escalar.
Los parámetros desconocidos, , se estiman normalmente mediante el método de máxima verosimilitud . Todos los coeficientes de regresión se pueden introducir en una matriz de la siguiente manera:
La instalación xij
De manera aún más general, se puede permitir que el valor de una variable
tenga un valor diferente para cada . Por ejemplo, si cada predictor lineal es para un punto de tiempo diferente, entonces se podría tener una covariable que varíe en el tiempo. Por ejemplo, en los modelos de elección discreta , se tienen
modelos logit
condicionales , modelos logit
anidados , modelos logit generalizados y similares, para distinguir entre ciertas variantes y ajustar un modelo logit multinomial a, por ejemplo, las opciones de transporte. Una variable como el costo difiere dependiendo de la elección, por ejemplo, el taxi es más caro que el autobús, que es más caro que caminar. La facilidad de permite generalizar
a .
xijVGAM
La fórmula más general es
Aquí hay un desplazamiento opcional , que en la práctica se traduce como una matriz. El paquete tiene un argumento que permite introducir los elementos sucesivos de la matriz diagonal.
VGAMxij
Software
Yee (2015) [1] describe una implementación del paquete R en el llamado VGAM. [2]
Actualmente, este software se adapta a aproximadamente 150 modelos/distribuciones. Las funciones de modelado centrales son vglm()y vgam(). Al familyargumento se le asigna una función de la familia VGAM , por ejemplo, family = negbinomialpara la regresión binomial negativa ,
family = poissonffpara la regresión de Poisson ,
family = propoddspara el modelo impar proporcional o
el modelo logit acumulativo para la regresión categórica ordinal.
Adecuado
Máxima verosimilitud
Estamos maximizando una probabilidad logarítmica
donde son ponderaciones previas positivas y conocidas . Las estimaciones de máxima verosimilitud se pueden encontrar utilizando un algoritmo de mínimos cuadrados reponderado iterativamente utilizando el método de puntuación de Fisher , con actualizaciones de la forma:
donde es la matriz de información de Fisher en la iteración a . También se denomina matriz de información esperada o EIM .
VLM
Para el cálculo, la matriz modelo (pequeña) construida a partir del lado derecho de la fórmula en vglm()
y las matrices de restricción se combinan para formar una matriz modelo grande . El IRLS se aplica a esta gran X. Esta matriz se conoce como la matriz VLM, ya que el modelo lineal vectorial es el problema de mínimos cuadrados subyacente que se está resolviendo. Una VLM es una regresión multivariante ponderada donde la matriz de varianza-covarianza para cada fila de la matriz de respuesta no es necesariamente la misma y se conoce. (En la regresión multivariante clásica, todos los errores tienen la misma matriz de varianza-covarianza y se desconoce). En particular, la VLM minimiza la suma ponderada de cuadrados.
Esta cantidad se minimiza en cada iteración de IRLS. Las respuestas de trabajo (también conocidas como pseudorrespuesta y vectores dependientes ajustados ) son
donde se conocen como pesos de trabajo o matrices de pesos de trabajo . Son simétricas y definidas positivas. El uso de la EIM ayuda a garantizar que todas sean definidas positivas (y no solo la suma de ellas) en gran parte del espacio de parámetros. Por el contrario, el uso de Newton-Raphson significaría que se utilizarían las matrices de información observada, y estas tienden a ser definidas positivas en un subconjunto más pequeño del espacio de parámetros.
Computacionalmente, se utiliza la descomposición de Cholesky para invertir las matrices de peso de trabajo y convertir el problema de mínimos cuadrados generalizados en un problema de mínimos cuadrados ordinario .
Ejemplos
Modelos lineales generalizados
Por supuesto, todos los modelos lineales generalizados son casos especiales de modelos lineales generales, pero a menudo estimamos todos los parámetros mediante una estimación de máxima verosimilitud en lugar de utilizar el método de momentos para el parámetro de escala.
Respuesta categórica ordenada
Si la variable de respuesta es una medida ordinal con niveles M + 1 , entonces se puede ajustar una función modelo de la forma:
- dónde
Para
diferentes enlaces g se obtienen modelos de probabilidades proporcionales o modelos probit ordenados , por ejemplo, la función de familia asigna un enlace probit a las probabilidades acumuladas, por lo que este modelo también se denomina modelo probit acumulativo . En general se denominan modelos de enlace acumulativo .
VGAMcumulative(link = probit)
Para distribuciones categóricas y multinomiales, los valores ajustados son un vector ( M + 1) de probabilidades, con la propiedad de que todas las probabilidades suman 1. Cada probabilidad indica la probabilidad de ocurrencia de uno de los M + 1 valores posibles.
Respuesta categórica desordenada
Si la variable de respuesta es una medida nominal , o los datos no satisfacen los supuestos de un modelo ordenado, entonces se puede ajustar un modelo de la siguiente forma:
El vínculo anterior a veces se denomina vínculo multilogit y el modelo se denomina modelo logit multinomial . Es común elegir el primer o el último nivel de la respuesta como
grupo de referencia o línea base ; el anterior utiliza el último nivel. La función de familia se ajusta al modelo anterior y tiene un argumento llamado al que se puede asignar el nivel utilizado como grupo de referencia.
VGAMmultinomial()refLevel
Contar datos
La teoría GLM clásica realiza una regresión de Poisson para los datos de recuento . El vínculo suele ser el logaritmo, que se conoce como vínculo canónico . La función de varianza es proporcional a la media:
donde el parámetro de dispersión se fija típicamente en exactamente uno. Cuando no lo es, el modelo de cuasi-verosimilitud resultante se describe a menudo como Poisson con sobredispersión o cuasi-Poisson ; entonces se estima comúnmente mediante el método de momentos y, como tal, los intervalos de confianza para son difíciles de obtener.
Por el contrario, los VGLM ofrecen un conjunto mucho más rico de modelos para manejar la sobredispersión con respecto a la distribución de Poisson, por ejemplo, la distribución binomial negativa y varias variantes de la misma. Otro modelo de regresión de conteo es la distribución de Poisson generalizada . Otros modelos posibles son la distribución zeta y la distribución Zipf .
Extensiones
Modelos lineales generalizados de vectores de rango reducido
Los RR-VGLM son VGLM donde un subconjunto de la matriz B es de un rango inferior . Sin pérdida de generalidad, supongamos que es una partición del vector de covariables. Entonces la parte de la matriz B correspondiente a tiene la forma donde y son matrices delgadas (es decir, con R columnas), p. ej., vectores si el rango R = 1. Los RR-VGLM ofrecen potencialmente varias ventajas cuando se aplican a ciertos modelos y conjuntos de datos. En primer lugar, si M y p son grandes, entonces el número de coeficientes de regresión que se estiman mediante VGLM es grande ( ). Entonces los RR-VGLM pueden reducir enormemente el número de coeficientes de regresión estimados si R es bajo, p. ej., R = 1 o R = 2. Un ejemplo de un modelo donde esto es particularmente útil es el modelo logit multinomial RR , también conocido como modelo de estereotipo . En segundo lugar, es un R -vector de variables latentes y, a menudo, estas se pueden interpretar de manera útil. Si R = 1, entonces podemos escribir de modo que la variable latente comprenda cargas sobre las variables explicativas. Se puede observar que los RR-VGLM toman combinaciones lineales óptimas de y luego se ajusta un VGLM a las variables explicativas . En tercer lugar, se puede producir un biplot si R = 2, y esto permite visualizar el modelo.
Se puede demostrar que los RR-VGLM son simplemente VGLM donde las matrices de restricción para las variables en son desconocidas y deben estimarse. Luego resulta que para tales variables. Los RR-VGLM pueden estimarse mediante un algoritmo alterno que fija y estima y luego fija y estima , etc.
En la práctica, se necesitan algunas restricciones de unicidad para
y/o . En , la función usa restricciones de esquina de manera predeterminada, lo que significa que las filas R superiores de se establecen en . Los RR-VGLM se propusieron en 2003. [3]VGAMrrvglm()
Dos a uno
Un caso especial de RR-VGLM es cuando R = 1 y M = 2. Esto es una reducción de dimensión de 2 parámetros a 1 parámetro. Entonces se puede demostrar que
donde se estiman los elementos y . De manera equivalente,
Esta fórmula proporciona un acoplamiento de y . Induce una relación entre dos parámetros de un modelo que puede ser útil, por ejemplo, para modelar una relación media-varianza. A veces hay alguna opción de funciones de enlace, por lo tanto, ofrece un poco de flexibilidad al acoplar los dos parámetros, por ejemplo, un enlace logit, probit, cauchit o cloglog para parámetros en el intervalo unitario. La fórmula anterior es particularmente útil para la distribución binomial negativa , de modo que la RR-NB tiene función de varianza
Algunos autores la han denominado variante NB-P . Se estiman y también es posible obtener intervalos de confianza aproximados para ellos.
Por cierto, también se pueden ajustar otras variantes útiles de NB, con la ayuda de la selección de la combinación correcta de matrices de restricción. Por ejemplo, NB − 1, NB − 2 ( negbinomial()predeterminado), NB − H ; consulte Yee (2014) [4] y la Tabla 11.3 de Yee (2015). [1]
RCIM
También se ha propuesto la subclase de modelos de interacción fila-columna (RCIM); estos son un tipo especial de RR-VGLM. Los RCIM se aplican solo a una respuesta de matriz Y y no hay variables explicativas explícitas . En cambio, las variables indicadoras para cada fila y columna se establecen explícitamente, y se permite una interacción de orden- R
de la forma . Los casos especiales de este tipo de modelo incluyen el modelo de asociación RC de Goodman
y la metodología de cuasi-varianzas tal como se implementa en el paquete R.
qvcalc
Los RCIM se pueden definir como un RR-VGLM aplicado a Y con
Para el modelo de asociación RC de Goodman, tenemos que si R = 0 entonces es una regresión de Poisson ajustada a una matriz de conteos con efectos de fila y efectos de columna; esto tiene una idea similar a un modelo ANOVA de dos vías sin interacción.
Otro ejemplo de un RCIM es si es el enlace de identidad y el parámetro es la mediana y el modelo corresponde a una distribución de Laplace asimétrica; entonces un RCIM sin interacción es similar a una técnica llamada pulido de mediana .
En VGAM, las funciones rcim()y grc()se ajustan a los modelos anteriores. Además, Yee y Hadi (2014) [5] muestran que los RCIM se pueden utilizar para ajustar modelos de ordenación cuadrática sin restricciones a datos de especies; este es un ejemplo de análisis de gradiente
indirecto en ordenación (un tema de ecología estadística).
Modelos aditivos generalizados vectoriales
Los modelos aditivos generalizados vectoriales (VGAM) son una extensión importante de los VGLM en los que el predictor lineal no está restringido a ser lineal en las covariables, sino que es la suma de funciones de suavizado aplicadas a :
donde
Estos son M predictores aditivos . Cada función suavizada se estima a partir de los datos. Por lo tanto, los VGLM están impulsados por modelos mientras que los VGAM están impulsados por datos . Actualmente, solo se implementan splines de suavizado en el paquete. Para M > 1, en realidad son splines vectoriales , que estiman las funciones componentes en simultáneamente. Por supuesto, se podrían usar splines de regresión con VGLM. La motivación detrás de los VGAM es similar a la de Hastie y Tibshirani (1990) [6]
y Wood (2017). [7]
Los VGAM se propusieron en 1996. [8] VGAM
Actualmente, se está trabajando para estimar VGAM utilizando P-splines de Eilers y Marx (1996). [9] Esto permite varias ventajas sobre el uso de splines de suavizado y retroajuste vectorial , como la capacidad de realizar una selección automática de parámetros de suavizado más fácilmente.
Modelos lineales generalizados de vector de rango reducido cuadrático
Estos agregan una variable cuadrática en la variable latente a la clase RR-VGLM. El resultado es una curva en forma de campana que se puede ajustar a cada respuesta, como una función de la variable latente. Para R = 2, se tienen superficies en forma de campana como una función de las 2 variables latentes, algo similar a una distribución normal bivariada . Se pueden encontrar aplicaciones particulares de los QRR-VGLM en ecología , en un campo del análisis multivariado llamado ordenación .
Como ejemplo específico de rango 1 de un QRR-VGLM, considere los datos de Poisson con S especies. El modelo para las especies s es la regresión de Poisson.
para . La parametrización más a la derecha que utiliza los símbolos tiene un significado ecológico particular, porque se relacionan con la abundancia de especies , el óptimo y la tolerancia respectivamente. Por ejemplo, la tolerancia es una medida del ancho del nicho, y un valor grande significa que esa especie puede vivir en una amplia gama de entornos. En la ecuación anterior, se necesitaría para obtener una curva en forma de campana.
Los QRR-VGLM se ajustan a los modelos de ordenación gaussiana mediante estimación de máxima verosimilitud y son un ejemplo de análisis de gradiente directo . La cqo()función del VGAMpaquete actualmente llama optim()a buscar el óptimo
y, dado eso, es fácil calcular las puntuaciones del sitio y ajustar un modelo lineal generalizado adecuado a eso. La función recibe su nombre del acrónimo CQO, que significa
ordenación cuadrática restringida : la restringida es para el análisis de gradiente directo (hay variables ambientales y una combinación lineal de estas se toma como variable latente) y la cuadrática es para la forma cuadrática en las variables latentes
en la escala. Desafortunadamente, los QRR-VGLM son sensibles a los valores atípicos tanto en las variables de respuesta como en las explicativas, además de ser computacionalmente costosos y pueden dar una solución local en lugar de una solución global. Los QRR-VGLM se propusieron en 2004. [10]
Véase también
- modelos lineales generalizados
- R (software)
- Análisis de regresión
- Modelo estadístico
- Familia exponencial natural
Referencias
- ^ abc Yee, TW (2015). Modelos lineales y aditivos generalizados vectoriales: con una implementación en R. Nueva York, EE. UU.: Springer. ISBN 978-1-4939-2817-0.
- ^ "Modelos lineales generalizados vectoriales". 18 de enero de 2016.
- ^ Yee, TW; Hastie, TJ (2003). "Modelos lineales generalizados de vector de rango reducido". Modelado estadístico . 3 (1): 15– 41. CiteSeerX 10.1.1.36.3700 . doi :10.1191/1471082x03st045oa. S2CID 122810408.
- ^ Yee, TW (1996). "Modelos lineales generalizados de vector de rango reducido con dos predictores lineales". Computational Statistics & Data Analysis . 71 : 889– 902. doi :10.1016/j.csda.2013.01.012.
- ^ Yee, TW; Hadi, AF (2014). "Modelos de interacción fila-columna, con una implementación R". Computational Statistics . 29 (6): 1427– 1445. doi :10.1007/s00180-014-0499-9. S2CID 253724333.
- ^ Hastie, TJ; Tibshirani, RJ (1990). Modelos aditivos generalizados . Londres: Chapman y Hall.
- ^ Wood, SN (2017). Modelos aditivos generalizados: una introducción con R (segunda edición). Londres: Chapman and Hall. ISBN 9781498728331.
- ^ Yee, TW; Wild, CJ (1996). "Modelos aditivos generalizados vectoriales". Revista de la Royal Statistical Society, Serie B. 58 ( 3): 481– 493. doi :10.1111/j.2517-6161.1996.tb02095.x.
- ^ Eilers, PHC; Marx, BD (1996). "Suavizado flexible con B-splines y penalizaciones". Ciencia estadística . 11 (2): 89– 121. CiteSeerX 10.1.1.47.4521 . doi :10.1214/ss/1038425655.
- ^ Yee, TW (2004). "Una nueva técnica para la ordenación gaussiana canónica de máxima verosimilitud". Monografías ecológicas . 74 (4): 685– 701. doi :10.1890/03-0078.
Lectura adicional
- Hilbe, Joseph (2011). Regresión binomial negativa (2.ª ed.). Cambridge: Cambridge University Press. ISBN 978-0-521-19815-8.