Articulo de referencia

criterio de información de desviación

El criterio de información de desviación ( DIC ) es una generalización jerárquica del criterio de información de Akaike (AIC). Resulta particularmente útil en problemas de selec...

El criterio de información de desviación ( DIC ) es una generalización jerárquica del criterio de información de Akaike (AIC). Resulta particularmente útil en problemas de selección de modelos bayesianos , donde las distribuciones posteriores de los modelos se han obtenido mediante simulación de Monte Carlo de cadena de Markov (MCMC). El DIC es una aproximación asintótica a medida que aumenta el tamaño de la muestra, al igual que el AIC. Solo es válido cuando la distribución posterior es aproximadamente normal multivariada .

Definición

Defina la desviación comoD(θ)=2registro(pag(y|θ))+do{\displaystyle D(\theta )=-2\log(p(y|\theta ))+C\,}, dóndey{\displaystyle y}son los datos,θ{\displaystyle \theta }son los parámetros desconocidos del modelo ypag(y|θ){\displaystyle p(y|\theta )}es la función de verosimilitud .do{\displaystyle C}es una constante que se cancela en todos los cálculos que comparan diferentes modelos y que, por lo tanto, no es necesario conocer.

Existen dos cálculos de uso común para el número efectivo de parámetros del modelo. El primero, como se describe en Spiegelhalter et al. (2002 , p. 587) , es pagD=D(θ)¯D(θ¯){\displaystyle p_{D}={\overline {D(\theta )}}-D({\bar {\theta }})}, dóndeθ¯{\displaystyle {\bar {\theta }}}es la expectativa deθ{\displaystyle \theta }. El segundo, como se describe en Gelman et al. (2004 , p. 182) , es pagD=pagV=12var(D(θ))¯{\displaystyle p_{D}=p_{V}={\frac {1}{2}}{\overline {\operatorname {var} \left(D(\theta )\right)}}}Cuanto mayor sea el número efectivo de parámetros, más fácil será para el modelo ajustarse a los datos, por lo que la desviación deberá ser penalizada.

El criterio de información de desviación se calcula como

DIdo=pagD+D(θ)¯,{\displaystyle \mathrm {DIC} =p_{D}+{\overline {D(\theta )}},}

o equivalentemente como

DIdo=D(θ¯)+2pagD.{\displaystyle \mathrm {DIC} =D({\bar {\theta }})+2p_{D}.}

A partir de esta última forma, la conexión con AIC resulta más evidente.

Motivación

La idea es que se deben preferir los modelos con DIC más pequeño a los modelos con DIC más grande. Los modelos son penalizados tanto por el valor deD¯{\displaystyle {\bar {D}}}, lo que favorece un buen ajuste, pero también (de forma similar al AIC) por el número efectivo de parámetros.pagD{\displaystyle p_{D}}. DesdeD¯{\displaystyle {\bar {D}}}disminuirá a medida que aumente el número de parámetros en un modelo, elpagD{\displaystyle p_{D}}Este término compensa este efecto favoreciendo los modelos con un menor número de parámetros.

Una ventaja del DIC sobre otros criterios en el caso de la selección de modelos bayesianos es que el DIC se calcula fácilmente a partir de las muestras generadas por una simulación de Monte Carlo de cadena de Markov. El AIC requiere calcular la verosimilitud en su máximo sobreθ{\displaystyle \theta }, que no está fácilmente disponible a partir de la simulación MCMC. Pero para calcular DIC, simplemente calculeD¯{\displaystyle {\bar {D}}}como el promedio deD(θ){\displaystyle D(\theta )}sobre las muestras deθ{\displaystyle \theta }, yD(θ¯){\displaystyle D({\bar {\theta }})}como el valor deD{\displaystyle D}evaluado en el promedio de las muestras deθ{\displaystyle \theta }Entonces, el DIC se deriva directamente de estas aproximaciones. Claeskens y Hjort (2008, Cap. 3.5) muestran que el DIC es equivalente para muestras grandes a la versión robusta del AIC basada en modelos naturales.

Supuestos

En la derivación del DIC, se asume que la familia paramétrica de distribuciones de probabilidad especificada que genera observaciones futuras abarca el modelo verdadero. Esta suposición no siempre se cumple, y es conveniente considerar procedimientos de evaluación del modelo en ese caso.

Además, los datos observados se utilizan tanto para construir la distribución posterior como para evaluar los modelos estimados. Por lo tanto, el DIC tiende a seleccionar modelos sobreajustados .

Extensiones

Ando (2007) sugirió una solución a los problemas anteriores con la propuesta del criterio de información predictiva bayesiano (BPIC). Ando (2010, cap. 8) presentó un análisis de varios criterios de selección de modelos bayesianos. Para evitar los problemas de sobreajuste del DIC, Ando (2011) desarrolló criterios de selección de modelos bayesianos desde una perspectiva predictiva. El criterio se calcula como:

Ido=D¯+2pagD=2miθ[registro(pag(y|θ))]+2pagD.{\displaystyle {\mathit {IC}}={\bar {D}}+2p_{D}=-2\mathbf {E} ^{\theta }[\log(p(y|\theta ))]+2p_{D}.}

El primer término mide qué tan bien se ajusta el modelo a los datos, mientras que el segundo penaliza la complejidad del modelo. Cabe destacar que la p en esta expresión representa la distribución predictiva, no la verosimilitud mencionada anteriormente.

Otras aplicaciones

El DIC se utilizó en varias bibliotecas de S-Plus (y posteriormente de R ) para ajustar modelos basados ​​en verosimilitud en la década de 1990 (con precedentes sobre los métodos bayesianos, en la medida en que se superponen); generalmente se presenta como una generalización del AIC. El DIC fue definido por Hastie y Tibshirani (1990, pág. 160, ecuación 6.32) [ 1 ] para los suavizadores ponderados utilizados en los Modelos Aditivos Generalizados, y los cálculos de desviación y grados de libertad efectivos necesarios se incorporaron a la biblioteca GAM (Hastie, 1991). [ 2 ]

El método aic en S-Plus y R se atribuye (inicialmente) a Pinheiro y Bates, desarrollado en conjunto con el software nlme, [ 3 ] y posteriormente adaptado a otras bibliotecas (algunas son simplemente AIC; otras requieren aproximaciones al estilo DIC).

En el contexto de la verosimilitud local , Loader (1999, pág. 69, def. 4.4) define un criterio de información de desviación [ 4 ] con una derivación basada en validación cruzada de dejar uno fuera con jackknife, con cálculos de grados de libertad efectivos explícitamente en términos de derivadas de verosimilitud. Esto conlleva algunas pequeñas diferencias técnicas en comparación con el enfoque de Hastie y Tibshirani.

Irizarry (2001) [ 5 ] también presenta un desarrollo extenso de criterios de información para la verosimilitud local. A diferencia de las técnicas globales en las fuentes anteriores, los criterios desarrollados por Irizarry se aplican al estimar en un solo punto del espacio de predictores, por lo que son aplicables a los suavizadores adaptativos locales considerados por otros autores.

Véase también

Referencias

  1. Trevor Hastie ; Robert Tibshirani (1990). Modelos aditivos generalizados . Monografías sobre estadística y probabilidad aplicada. Chapman & Hall . ISBN 0-412-34390-8. LCCN 91109621 . SEÑOR 1082147 . OCLC 41137485 . OL 4147339W . Zbl 0747.62061 . Wikidata Q132471455 .      
  2. Trevor Hastie (1991). Modelos aditivos generalizados . págs. 249–307 . doi : 10.1201/9780203738535-7 . ISBN  978-0-534-16765-3. Wikidata Q134623036 . {{cite book}}: |journal=ignorado ( ayuda )
  3. José C. Pinheiro; Douglas M Bates (5 de mayo de 2000). Modelos de efectos mixtos en S y S-PLUS . Estadística y computación. Springer Nueva York. doi : 10.1007/B98882 . ISBN 978-0-387-98957-0. LCCN 99053566 . OCLC 42690165 . Zbl 0953.62065 . Wikidata Q58040120 .    
  4. Catherine Loader (1999). Regresión local y verosimilitud . Estadística y computación. Springer Nature . doi : 10.1007/B98858 . ISBN 978-0-387-98775-0. LCCN 99014732 . SEÑOR 1704236 . OL 14851039W . Zbl 0929.62046 . Wikidata Q59410587 .     
  5. Rafael Irizarry (2001). "Criterios de información y probabilidad posterior para la selección de modelos en la estimación de verosimilitud local". Journal of the American Statistical Association . 96 (453): 303– 315. doi : 10.1198/016214501750332875 . ISSN 0162-1459 . JSTOR 2670368. Zbl 1015.62016 . Wikidata Q135676816 .    
  • McElreath, Richard (29 de enero de 2015). "Repensamiento estadístico, Lección 8 (sobre DIC y otros criterios de información)" . Archivado del original el 21 de diciembre de 2021 a través de YouTube .