Articulo de referencia

regresión de Poisson

En estadística , la regresión de Poisson es una forma generalizada de análisis de regresión lineal que se utiliza para modelar datos de conteo y tablas de contingencia . [ 1 ] L...

En estadística , la regresión de Poisson es una forma generalizada de análisis de regresión lineal que se utiliza para modelar datos de conteo y tablas de contingencia . [ 1 ] La regresión de Poisson supone que la variable de respuesta Y tiene una distribución de Poisson y que el logaritmo de su valor esperado puede modelarse mediante una combinación lineal de parámetros desconocidos . Un modelo de regresión de Poisson a veces se conoce como modelo log-lineal , especialmente cuando se utiliza para modelar tablas de contingencia.

La regresión binomial negativa es una generalización popular de la regresión de Poisson porque flexibiliza el supuesto altamente restrictivo de que la varianza es igual a la media, propio del modelo de Poisson. El modelo tradicional de regresión binomial negativa se basa en la distribución de mezcla Poisson-gamma. Este modelo es popular porque representa la heterogeneidad de Poisson con una distribución gamma.

Los modelos de regresión de Poisson son modelos lineales generalizados con el logaritmo como función de enlace (canónica) y la función de distribución de Poisson como distribución de probabilidad supuesta de la respuesta.

Modelos de regresión

SiincógnitaRnorte{\displaystyle \mathbf {x} \in \mathbb {R} ^{n}}es un vector de variables independientes , entonces el modelo toma la forma

registro(mi(Yincógnita))=α+βincógnita,{\displaystyle \log(\operatorname {E} (Y\mid \mathbf {x} ))=\alpha +\mathbf {\beta } '\mathbf {x} ,}

dóndeαR{\displaystyle \alpha \in \mathbb {R} }yβRnorte{\displaystyle \mathbf {\beta } \in \mathbb {R} ^{n}}. A veces esto se escribe de forma más compacta como

registro(mi(Yincógnita))=θincógnita,{\displaystyle \log(\operatorname {E} (Y\mid \mathbf {x} ))={\boldsymbol {\theta }}'\mathbf {x} ,\,}

dóndeincógnita{\displaystyle \mathbf {x} }Ahora es un vector de ( n  + 1) dimensiones que consta de n variables independientes concatenadas al número uno. θ{\displaystyle \theta }es simplementeβ{\displaystyle \beta }concatenado aα{\displaystyle \alpha }.

Por lo tanto, cuando se le da un modelo de regresión de Poissonθ{\displaystyle \theta }y un vector de entradaincógnita{\displaystyle \mathbf {x} }, la media prevista de la distribución de Poisson asociada viene dada por

mi(Yincógnita)=miθincógnita.{\displaystyle \operatorname {E} (Y\mid \mathbf {x} )=e^{{\boldsymbol {\theta }}'\mathbf {x} }.\,}

SiYi{\displaystyle Y_{i}}son observaciones independientes con valores correspondientesincógnitai{\displaystyle \mathbf {x} _ {i}}de las variables predictoras, entoncesθ{\displaystyle \theta }Se puede estimar mediante máxima verosimilitud . Las estimaciones de máxima verosimilitud carecen de una expresión analítica y deben obtenerse mediante métodos numéricos. La superficie de probabilidad para la regresión de Poisson de máxima verosimilitud siempre es cóncava, lo que hace que el método de Newton-Raphson u otros métodos basados ​​en gradientes sean técnicas de estimación apropiadas.

Interpretación de los coeficientes

Supongamos que tenemos un modelo con un único predictor, es decir,norte=1{\displaystyle n=1}:

registro(mi(Yincógnita))=α+βincógnita{\displaystyle \log(\operatorname {E} (Y\mid \mathbf {x} ))=\alpha +\beta x}

Supongamos que calculamos los valores predichos en el punto(Y2,incógnita2){\displaystyle (Y_{2},x_{2})}y(Y1,incógnita1){\displaystyle (Y_{1},x_{1})}:

registro(mi(Y2incógnita2))=α+βincógnita2{\displaystyle \log(\operatorname {E} (Y_{2}\mid x_{2}))=\alpha +\beta x_{2}}
registro(mi(Y1incógnita1))=α+βincógnita1{\displaystyle \log(\operatorname {E} (Y_{1}\mid x_{1}))=\alpha +\beta x_{1}}

Restando el primero del segundo:

registro(mi(Y2incógnita2))registro(mi(Y1incógnita1))=β(incógnita2incógnita1){\displaystyle \log(\operatorname {E} (Y_{2}\mid x_{2}))-\log(\operatorname {E} (Y_{1}\mid x_{1}))=\beta (x_{2}-x_{1})}

Supongamos ahora queincógnita2=incógnita1+1{\displaystyle x_{2}=x_{1}+1}Obtenemos:

registro(mi(Y2incógnita2))registro(mi(Y1incógnita1))=β{\displaystyle \log(\operatorname {E} (Y_{2}\mid x_{2}))-\log(\operatorname {E} (Y_{1}\mid x_{1}))=\beta }

Por lo tanto, el coeficiente del modelo debe interpretarse como el aumento en el logaritmo del recuento de la variable de resultado cuando la variable independiente aumenta en 1.

Aplicando las reglas de los logaritmos:

registro(mi(Y2incógnita2)mi(Y1incógnita1))=β{\displaystyle \log \left({\dfrac {\operatorname {E} (Y_{2}\mid x_{2})}{\operatorname {E} (Y_{1}\mid x_{1})}}\right)=\beta }
mi(Y2incógnita2)mi(Y1incógnita1)=miβ{\displaystyle {\dfrac {\operatorname {E} (Y_{2}\mid x_{2})}{\operatorname {E} (Y_{1}\mid x_{1})}}=e^{\beta }}
mi(Y2incógnita2)=miβmi(Y1incógnita1){\displaystyle \operatorname {E} (Y_{2}\mid x_{2})=e^{\beta }\operatorname {E} (Y_{1}\mid x_{1})}

Es decir, cuando la variable independiente aumenta en 1, la variable de resultado se multiplica por el coeficiente elevado a la potencia.

El coeficiente exponenciado también se denomina razón de incidencia .

Efecto parcial promedio

A menudo, el objeto de interés es el efecto parcial promedio o el efecto marginal promedio.mi(Y|incógnita)incógnita{\displaystyle {\frac {\partial E(Y|x)}{\partial x}}}, lo cual se interpreta como el cambio en el resultadoY{\displaystyle Y}para un cambio de una unidad en la variable independienteincógnita{\displaystyle x}. El efecto parcial promedio en el modelo de Poisson para una variable continuaincógnita{\displaystyle x}se puede demostrar que es: [ 2 ]

mi(Y|incógnita)incógnita=exp(θincógnita)β{\displaystyle {\frac {\partial E(Y|x)}{\partial x}}=\exp(\theta '\mathbb {x} )\beta }

Esto se puede estimar utilizando las estimaciones de los coeficientes del modelo de Poisson.θ^=(α^,β^){\displaystyle {\hat {\theta }}=({\hat {\alpha }},{\hat {\beta }})}con los valores observados deincógnita{\displaystyle \mathbb {x} }.

Estimación de parámetros basada en la máxima verosimilitud

Dado un conjunto de parámetros θ y un vector de entrada x , la media de la distribución de Poisson predicha , como se indicó anteriormente, viene dada por

λ:=mi(Yincógnita)=miθincógnita,{\displaystyle \lambda :=\operatorname {E} (Y\mid x)=e^{\theta 'x},\,}

y así, la función de masa de probabilidad de la distribución de Poisson viene dada por

pag(yincógnita;θ)=λyy¡miλ=miyθincógnitamimiθincógnitay¡{\displaystyle p(y\mid x;\theta )={\frac {\lambda ^{y}}{y!}}e^{-\lambda }={\frac {e^{y\theta 'x}e^{-e^{\theta 'x}}}{y!}}}

Ahora supongamos que se nos da un conjunto de datos que consta de m vectores.incógnitaiRnorte+1,i=1,,metro{\displaystyle x_{i}\in \mathbb {R} ^{n+1},\,i=1,\ldots ,m}, junto con un conjunto de valores my1,,ymetronorte{\displaystyle y_{1},\ldots ,y_{m}\in \mathbb {N} }Entonces, para un conjunto dado de parámetros θ , la probabilidad de obtener este conjunto particular de datos viene dada por

pag(y1,,ymetroincógnita1,,incógnitametro;θ)=i=1metromiyiθincógnitaimimiθincógnitaiyi¡.{\displaystyle p(y_{1},\ldots ,y_{m}\mid x_{1},\ldots ,x_{m};\theta )=\prod _{i=1}^{m}{\frac {e^{y_{i}\theta 'x_{i}}e^{-e^{\theta 'x_{i}}}}{y_{i}!}}.}

Mediante el método de máxima verosimilitud , deseamos encontrar el conjunto de parámetros θ que haga que esta probabilidad sea lo más grande posible. Para ello, primero se reescribe la ecuación como una función de verosimilitud en términos de θ :

L(θincógnita,Y)=i=1metromiyiθincógnitaimimiθincógnitaiyi¡.{\displaystyle L(\theta \mid X,Y)=\prod _{i=1}^{m}{\frac {e^{y_{i}\theta 'x_{i}}e^{-e^{\theta 'x_{i}}}}{y_{i}!}}.}

Nótese que la expresión del lado derecho no ha cambiado realmente. Una fórmula de esta forma suele ser difícil de manejar; en su lugar, se utiliza la log-verosimilitud :

(θincógnita,Y)=registroL(θincógnita,Y)=i=1metro(yiθincógnitaimiθincógnitairegistro(yi¡)).{\displaystyle \ell (\theta \mid X,Y)=\log L(\theta \mid X,Y)=\sum _{i=1}^{m}\left(y_{i}\theta 'x_{i}-e^{\theta 'x_{i}}-\log(y_{i}!)\right).}

Nótese que los parámetros θ solo aparecen en los dos primeros términos de cada término de la suma. Por lo tanto, dado que solo nos interesa encontrar el mejor valor para θ, podemos omitir y i ! y simplemente escribir

(θincógnita,Y)=i=1metro(yiθincógnitaimiθincógnitai).{\displaystyle \ell (\theta \mid X,Y)=\sum _{i=1}^{m}\left(y_{i}\theta 'x_{i}-e^{\theta 'x_{i}}\right).}

Para encontrar un máximo, necesitamos resolver una ecuación.(θincógnita,Y)θ=0{\displaystyle {\frac {\partial \ell (\theta \mid X,Y)}{\partial \theta }}=0}que no tiene solución de forma cerrada. Sin embargo, la log-verosimilitud negativa,(θincógnita,Y){\displaystyle -\ell (\theta \mid X,Y)}, es una función convexa, por lo que se pueden aplicar técnicas estándar de optimización convexa, como el descenso de gradiente, para encontrar el valor óptimo de θ .

Regresión de Poisson en la práctica

La regresión de Poisson puede ser apropiada cuando la variable dependiente es un recuento, por ejemplo, de eventos como la llegada de una llamada telefónica a un centro de llamadas. [ 3 ] Los eventos deben ser independientes en el sentido de que la llegada de una llamada no hará que otra sea más o menos probable, pero se entiende que la probabilidad por unidad de tiempo de los eventos está relacionada con covariables como la hora del día.

"Exposición" y compensación

La regresión de Poisson también puede ser apropiada para datos de tasa, donde la tasa es un recuento de eventos dividido por alguna medida de la exposición de esa unidad (una unidad de observación particular). [ 4 ] Por ejemplo, los biólogos pueden contar el número de especies de árboles en un bosque: los eventos serían observaciones de árboles, la exposición sería el área unitaria y la tasa sería el número de especies por área unitaria. Los demógrafos pueden modelar las tasas de mortalidad en áreas geográficas como el recuento de muertes dividido por persona-años. De manera más general, las tasas de eventos se pueden calcular como eventos por unidad de tiempo, lo que permite que la ventana de observación varíe para cada unidad. En estos ejemplos, la exposición es respectivamente el área unitaria, persona-años y tiempo unitario. En la regresión de Poisson esto se maneja como un desplazamiento . Si la tasa es recuento/exposición, multiplicar ambos lados de la ecuación por la exposición la mueve al lado derecho de la ecuación. Cuando ambos lados de la ecuación se logaritman, el modelo final contiene log(exposición) como un término que se agrega a los coeficientes de regresión. Esta variable logarítmica, log(exposición), se denomina variable de desplazamiento y entra en el lado derecho de la ecuación con una estimación de parámetro (para log(exposición)) restringida a 1.

registro(mi(Yincógnita))=θincógnita{\displaystyle \log(\operatorname {E} (Y\mid x))=\theta 'x}

lo cual implica

registro(mi(Yincógnita)exposición)=registro(mi(Yincógnita))registro(exposición)=θincógnita{\displaystyle \log \left({\frac {\operatorname {E} (Y\mid x)}{\text{exposure}}}\right)=\log(\operatorname {E} (Y\mid x))-\log({\text{exposure}})=\theta 'x}
registro(mi(Yincógnita))=θincógnita+registro(exposición){\displaystyle \log \left(\operatorname {E} (Y\mid x)\right)=\theta 'x+\log({\text{exposure}})}

El desplazamiento en el caso de un GLM en R se puede lograr utilizando la offset()función:

glm ( y ~ offset ( log ( exposición )) + x , familia = poisson ( enlace = log ) )

Sobredispersión e inflación cero

Una característica de la distribución de Poisson es que su media es igual a su varianza. En ciertas circunstancias, se observa que la varianza es mayor que la media; esto se conoce como sobredispersión e indica que el modelo no es apropiado. Una causa común es la omisión de variables explicativas relevantes u observaciones dependientes. En algunos casos, el problema de la sobredispersión puede resolverse utilizando la estimación de cuasi-verosimilitud o una distribución binomial negativa . [ 5 ] [ 6 ]

Ver Hoef y Boveng describieron la diferencia entre cuasi-Poisson (también llamada sobredispersión con cuasi-verosimilitud) y binomial negativa (equivalente a gamma-Poisson) de la siguiente manera: Si E ( Y ) = μ , el modelo cuasi-Poisson asume var( Y ) = θμ mientras que gamma-Poisson asume var( Y ) = μ (1  + κμ ), donde θ es el parámetro de sobredispersión cuasi-Poisson y κ es el parámetro de forma de la distribución binomial negativa . Para ambos modelos, los parámetros se estiman utilizando mínimos cuadrados reponderados iterativamente . Para cuasi-Poisson, los pesos son μ / θ . Para binomial negativa, los pesos son μ /(1 + κμ ). Con μ grande y variación extra-Poisson sustancial, los pesos binomiales negativos se limitan a 1/ κ . Ver Hoef y Boveng analizaron un ejemplo en el que seleccionaron entre los dos graficando los residuos cuadráticos medios frente a la media. [ 7 ]    

Otro problema común de la regresión de Poisson es el exceso de ceros: si intervienen dos procesos, uno que determina si hay cero eventos o algún evento, y otro de Poisson que determina cuántos eventos hay, habrá más ceros de los que predeciría una regresión de Poisson. Un ejemplo sería la distribución de cigarrillos fumados en una hora por los miembros de un grupo donde algunos individuos no fuman.

En estos casos, otros modelos lineales generalizados, como el modelo binomial negativo o el modelo con exceso de ceros, podrían funcionar mejor.

Por el contrario, la subdispersión puede plantear un problema para la estimación de parámetros. [ 8 ]

Uso en análisis de supervivencia

La regresión de Poisson crea modelos de riesgos proporcionales, una clase de análisis de supervivencia : consulte los modelos de riesgos proporcionales para obtener descripciones de los modelos de Cox.

Extensiones

Regresión de Poisson regularizada

Al estimar los parámetros para la regresión de Poisson, normalmente se intenta encontrar valores para θ que maximicen la probabilidad de una expresión de la forma

i=1metroregistro(pag(yi;miθincógnitai)),{\displaystyle \sum _{i=1}^{m}\log(p(y_{i};e^{\theta 'x_{i}})),}

donde m es el número de ejemplos en el conjunto de datos, ypag(yi;miθincógnitai){\displaystyle p(y_{i};e^{\theta 'x_{i}})}es la función de masa de probabilidad de la distribución de Poisson con la media establecida enmiθincógnitai{\displaystyle e^{\theta 'x_{i}}}. Se puede agregar regularización a este problema de optimización maximizando en su lugar [ 9 ]

i=1metroregistro(pag(yi;miθincógnitai))λθ22,{\displaystyle \sum _{i=1}^{m}\log(p(y_{i};e^{\theta 'x_{i}}))-\lambda \left\|\theta \right\|_{2}^{2},}

para alguna constante positivaλ{\displaystyle \lambda }Esta técnica, similar a la regresión de cresta , puede reducir el sobreajuste .

Véase también

Referencias

  1. Nelder, JA (1974). "Modelos log-lineales para tablas de contingencia: una generalización de los mínimos cuadrados clásicos" . Journal of the Royal Statistical Society, Serie C (Estadística Aplicada) . 23 (3): págs. 323–329. doi : 10.2307/2347125 . JSTOR 2347125 . 
  2. Wooldridge, Jeffrey (2010). Análisis econométrico de datos de sección transversal y de panel (2.ª ed.). Cambridge, Massachusetts: The MIT Press. p. 726.  
  3. Greene, William H. (2003). Análisis econométrico (Quinta ed.). Prentice-Hall. págs. 740–752 . ISBN   978-0130661890.
  4. Frome, Edward L. (1983). "Análisis de tasas mediante modelos de regresión de Poisson" . Biometrics . 39 (3): pp. 665–674. doi : 10.2307/2531094 . JSTOR 2531094 . 
  5. Paternoster R, Brame R (1997). "¿Múltiples rutas hacia la delincuencia? Una prueba de las teorías generales y del desarrollo del crimen". Criminología . 35 : 49–84 . doi : 10.1111/j.1745-9125.1997.tb00870.x . eISSN 1745-9125 . ISSN 0011-1384 .  
  6. Berk R, MacDonald J (2008). "Sobredispersión y regresión de Poisson". Journal of Quantitative Criminology . 24 (3): 269– 284. doi : 10.1007/s10940-008-9048-4 . S2CID 121273486 . 
  7. Ver Hoef, JAY M.; Boveng, Peter L. (2007-01-01). "Regresión cuasi-Poisson vs. binomial negativa: ¿Cómo deberíamos modelar datos de conteo sobredispersos?" . Ecology . 88 (11): 2766– 2772. Bibcode : 2007Ecol...88.2766V . doi : 10.1890/07-0043.1 . PMID 18051645 . Recuperado el 2016-09-01 . 
  8. Schwarzenegger, Rafael; Quigley, John; Walls, Lesley (23 de noviembre de 2021). "¿Vale la pena el esfuerzo de obtener dependencia? Un estudio para el modelo de probabilidad Poisson-Gamma multivariante" . Actas de la Institución de Ingenieros Mecánicos, Parte O: Revista de Riesgo y Fiabilidad . 237 (5): 5. doi : 10.1177/1748006X211059417 .
  9. Perperoglou, Aris (2011-09-08). "Ajuste de datos de supervivencia con regresión de Poisson penalizada". Métodos estadísticos y aplicaciones . 20 (4). Springer Nature: 451– 462. doi : 10.1007/s10260-011-0172-1 . ISSN 1618-2510 . S2CID 10883925 .  

Lecturas adicionales

  • Cameron, AC; Trivedi, PK (1998). Análisis de regresión de datos de conteo . Cambridge University Press. ISBN 978-0-521-63201-0.
  • Christensen, Ronald (1997). Modelos log-lineales y regresión logística . Textos de Springer en Estadística (Segunda  edición). Nueva York: Springer-Verlag. ISBN 978-0-387-98247-2. SR 1633357 . 
  • Gouriéroux, Christian (2000). «La econometría de las variables positivas discretas: el modelo de Poisson» . Econometría de las variables dependientes cualitativas . Nueva York: Cambridge University Press. pp. 270–283 . ISBN  978-0-521-58985-7.
  • Greene, William H. (2008). «Modelos para el recuento y la duración de eventos». Análisis econométrico (8.ª  ed.). Upper Saddle River: Prentice Hall. pp. 906-944 . ISBN  978-0-13-600383-0.
  • Hilbe, JM (2007). Regresión binomial negativa . Cambridge University Press. ISBN 978-0-521-85772-7.
  • Jones, Andrew M.; et  al. (2013). «Modelos para datos de recuento». Economía de la salud aplicada . Londres: Routledge. pp. 295–341 . ISBN  978-0-415-67682-3.
  • Myers, Raymond H.; et  al. (2010). «Modelos de regresión logística y de Poisson». Modelos lineales generalizados con aplicaciones en ingeniería y ciencias (Segunda  edición). Nueva Jersey: Wiley. págs. 176–183 . ISBN  978-0-470-45463-3.