Articulo de referencia

Criterio de información bayesiano

En estadística , el criterio de información bayesiano ( BIC ) o criterio de información de Schwarz (también conocido como SIC , SBC o SBIC ) es un criterio para la selección de ...

En estadística , el criterio de información bayesiano ( BIC ) o criterio de información de Schwarz (también conocido como SIC , SBC o SBIC ) es un criterio para la selección de modelos entre un conjunto finito de modelos; generalmente se prefieren los modelos con un BIC más bajo. Se basa, en parte, en la función de verosimilitud y está estrechamente relacionado con el criterio de información de Akaike (AIC).

Al ajustar modelos, es posible aumentar la máxima verosimilitud añadiendo parámetros, pero esto puede provocar sobreajuste . Tanto el BIC como el AIC intentan resolver este problema introduciendo un término de penalización para el número de parámetros del modelo; este término es mayor en el BIC que en el AIC para tamaños de muestra superiores a 7. [ 1 ]

El BIC fue desarrollado por Gideon E. Schwarz y publicado en un artículo de 1978, [ 2 ] como una aproximación de muestra grande al factor de Bayes .

Definición

El BIC se define formalmente como [ 3 ] [ a ]

BIdo=kln(norte)2ln(L^). {\displaystyle \mathrm {BIC} =k\ln(n)-2\ln({\widehat {L}}).\ }

dónde

  • L^{\displaystyle {\hat {L}}}= el valor maximizado de la función de verosimilitud del modeloMETRO{\displaystyle M}, es decirL^=pag(incógnitaθ^,METRO){\displaystyle {\hat {L}}=p(x\mid {\widehat {\theta }},M)}, dónde{θ^}{\displaystyle \{{\widehat {\theta }}\}}son los valores de los parámetros que maximizan la función de verosimilitud yincógnita{\displaystyle x}son los datos observados;
  • norte{\displaystyle n}= el número de puntos de datos enincógnita{\displaystyle x}, el número de observaciones , o equivalentemente, el tamaño de la muestra;
  • k{\displaystyle k}= el número de parámetros estimados por el modelo. Por ejemplo, en la regresión lineal múltiple , los parámetros estimados son el intercepto, elq{\displaystyle q}parámetros de pendiente y la varianza constante de los errores; por lo tanto,k=q+2{\displaystyle k=q+2}.

Derivación

El BIC se puede derivar integrando los parámetros del modelo utilizando el método de Laplace , comenzando con la siguiente evidencia del modelo : [ 5 ] [ 6 ] : 217

pag(incógnitaMETRO)=pag(incógnitaθ,METRO)π(θMETRO)dθ{\displaystyle p(x\mid M)=\int p(x\mid \theta ,M)\pi (\theta \mid M)\,d\theta }

dóndeπ(θMETRO){\displaystyle \pi (\theta \mid M)}es el prior paraθ{\displaystyle \theta }bajo modeloMETRO{\displaystyle M}.

La verosimilitud logarítmica,ln(pag(incógnitaθ,METRO)){\displaystyle \ln(p(x\mid \theta ,M))}, luego se expande a una serie de Taylor de segundo orden sobre el MLE ,θ^{\displaystyle {\widehat {\theta }}}, suponiendo que es dos veces diferenciable de la siguiente manera:

ln(pag(incógnitaθ,METRO))=ln(L^)norte2(θθ^)TI(θ^)(θθ^)+R(incógnita,θ),{\displaystyle \ln(p(x\mid \theta ,M))=\ln({\widehat {L}})-{\frac {n}{2}}(\theta -{\widehat {\theta }})^{\operatorname {T} }{\mathcal {I}}({\widehat {\theta }})(\theta -{\widehat {\theta }})+R(x,\theta ),}

dóndeI(θ){\displaystyle {\mathcal {I}}(\theta)}es la información observada promedio por observación , yR(incógnita,θ){\displaystyle R(x,\theta )}denota el término residual. En la medida en queR(incógnita,θ){\displaystyle R(x,\theta )}es insignificante yπ(θMETRO){\displaystyle \pi (\theta \mid M)}es relativamente lineal cercaθ^{\displaystyle {\widehat {\theta }}}, podemos integrarloθ{\displaystyle \theta }para obtener lo siguiente:

pag(incógnitaMETRO)L^(2πnorte)k2|I(θ^)|12π(θ^){\displaystyle p(x\mid M)\approx {\hat {L}}{\left({\frac {2\pi }{n}}\right)}^{\frac {k}{2}}|{\mathcal {I}}({\widehat {\theta }})|^{-{\frac {1}{2}}}\pi ({\widehat {\theta }})}

Comonorte{\displaystyle n}aumentos, podemos ignorar|I(θ^)|{\displaystyle |{\mathcal {I}}({\widehat {\theta }})|}yπ(θ^){\displaystyle \pi ({\widehat {\theta }})}tal como sonO(1){\displaystyle O(1)}. De este modo,

pag(incógnitaMETRO)=exp(lnL^k2ln(norte)+O(1))=exp(BIdo2+O(1)),{\displaystyle p(x\mid M)=\exp \left(\ln {\widehat {L}}-{\frac {k}{2}}\ln(n)+O(1)\right)=\exp \left(-{\frac {\mathrm {BIC} }{2}}+O(1)\right),}

donde BIC se define como se indicó anteriormente, yL^{\displaystyle {\widehat {L}}}o bien (a) es el modo posterior bayesiano o bien (b) utiliza el MLE y la distribución a prioriπ(θMETRO){\displaystyle \pi (\theta \mid M)}tiene una pendiente distinta de cero en el MLE. Entonces, la posterior

pag(METROincógnita)pag(incógnitaMETRO)pag(METRO)exp(BIdo2)pag(METRO){\displaystyle p(M\mid x)\propto p(x\mid M)p(M)\approx \exp \left(-{\frac {\mathrm {BIC} }{2}}\right)p(M)}

Los argumentos anteriores son heurísticos, pero pueden hacerse matemáticamente rigurosos bajo los supuestos técnicos de continuidad de Lipschitz y convexidad fuerte , como sigue.

Lema. (Lema 2.82 [ 7 ] ) Definirnorte(θ)=ln(pag(incógnitaθ,METRO)π(θMETRO))/norte{\displaystyle \ell _{n}(\theta )=-\ln(p(x\mid \theta ,M)\pi (\theta \mid M))/n}. Si la secuencia de gradientes{norte(θ)}{\displaystyle \{\nabla \ell _{n}(\theta )\}}es Lipschitz continua, uniformemente ennorte{\displaystyle n}y cadanorte(θ){\displaystyle \ell _{n}(\theta )}es fuertemente convexa con un parámetro comúnmetro>0{\displaystyle m>0}(independiente denorte{\displaystyle n}), entonces comonorte{\displaystyle n\rightarrow \infty }: lnpag(incógnitaMETRO)=ln(pag(incógnitaθ¯norte,METRO)π(θ¯norteMETRO))k2ln(norte)+O(1),{\displaystyle \ln p(x\mid M)=\ln(p(x\mid {\bar {\theta }}_{n},M)\pi ({\bar {\theta }}_{n}\mid M))-{\frac {k}{2}}\ln(n)+O(1),} dóndeθ¯norte=argminθnorte(θ){\displaystyle {\bar {\theta }}_{n}=\arg \min _{\theta }\ell _{n}(\theta )}es la estimación de máxima posteriori (MAP) deθ{\displaystyle \theta }.

Tenga en cuenta que siempre es posible seleccionar una densidad previa.π(θMETRO){\displaystyle \pi (\theta \mid M)}de tal manera que cadanorte(θ){\displaystyle \ell _{n}(\theta )}es fuertemente convexa (con el mismo parámetrometro{\displaystyle m}). Dicha distribución a priori garantiza que la estimación MAPθ¯norte{\displaystyle {\bar {\theta }}_{n}}existe, incluso en casos donde la estimación MLEθ^{\displaystyle {\hat {\theta }}}en sí mismo no existe.

Usar

Al elegir entre varios modelos, generalmente se prefieren aquellos con valores BIC más bajos. El BIC es una función creciente de la varianza del error.σmi2{\displaystyle \sigma _{e}^{2}}y una función creciente de k . Es decir, la variación no explicada en la variable dependiente y el número de variables explicativas aumentan el valor del BIC. Sin embargo, un BIC menor no indica necesariamente que un modelo sea mejor que otro. Dado que implica aproximaciones, el BIC es simplemente una heurística. En particular, las diferencias en el BIC nunca deben tratarse como factores de Bayes transformados.

Es importante tener en cuenta que el BIC solo se puede usar para comparar modelos estimados cuando los valores numéricos de la variable dependiente [ b ] son ​​idénticos para todos los modelos que se comparan. Los modelos que se comparan no tienen por qué estar anidados , a diferencia de cuando se comparan modelos usando una prueba F o una prueba de razón de verosimilitud .

Para comparar dos modelos diferentes, simplemente calcule el BIC para cada modelo y compárelos según la tabla que aparece a continuación:

Limitaciones

El BIC sufre de dos limitaciones principales: [ 8 ]

  1. La aproximación anterior solo es válida para el tamaño de la muestra.norte{\displaystyle n}mucho mayor que el númerok{\displaystyle k}de parámetros en el modelo.
  2. El BIC no puede manejar colecciones complejas de modelos como en el problema de selección de variables (o selección de características ) en alta dimensión. [ 8 ]

caso especial gaussiano

Bajo el supuesto de que los errores o perturbaciones del modelo son independientes e idénticamente distribuidos según una distribución normal y la condición de contorno de que la derivada de la verosimilitud logarítmica con respecto a la varianza verdadera es cero, esto se convierte en ( salvo una constante aditiva , que depende solo de n y no del modelo): [ 9 ]

BIdo=norteln(σmi2^)+kln(norte) {\displaystyle \mathrm {BIC} =n\ln({\widehat {\sigma _{e}^{2}}})+k\ln(n)\ }

dóndeσmi2^{\displaystyle {\widehat {\sigma _{e}^{2}}}}es la varianza del error. La varianza del error en este caso se define como

σmi2^=1nortei=1norte(incógnitaiincógnita^i)2.{\displaystyle {\widehat {\sigma _{e}^{2}}}={\frac {1}{n}}\sum _{i=1}^{n}(x_{i}-{\widehat {x}}_{i})^{2}.}

lo cual es un estimador sesgado de la varianza verdadera .

En términos de la suma residual de cuadrados (RSS), el BIC es

BIdo=norteln(RSS/norte)+kln(norte) {\displaystyle \mathrm {BIC} =n\ln({\text{RSS}}/n)+k\ln(n)\ }

Al probar múltiples modelos lineales frente a un modelo saturado, el BIC se puede reescribir en términos de la desviación.χ2{\displaystyle \chi ^{2}}como: [ 10 ]

BIdo=χ2+kln(norte){\displaystyle \mathrm {BIC} =\chi ^{2}+k\ln(n)}

dóndek{\displaystyle k}es el número de parámetros del modelo en la prueba.

Véase también

Notas

  1. El AIC, AICc y BIC definidos por Claeskens y Hjort [ 4 ] son ​​los negativos de los definidos en este artículo y en la mayoría de las demás referencias estándar.
  2. Una variable dependiente también se denomina variable de respuesta o variable de resultado . Véase Análisis de regresión .

Referencias

  1. Véase el artículo de revisión: Stoica, P.; Selen, Y. (2004), "Selección del orden del modelo: una revisión de las reglas del criterio de información", IEEE Signal Processing Magazine (julio): 36–47 , doi : 10.1109/MSP.2004.1311138 , S2CID 17338979 .
  2. Schwarz, Gideon E. (1978), "Estimating the dimension of a model", Annals of Statistics , 6 (2): 461– 464, doi : 10.1214/aos/1176344136 , MR 0468014 .
  3. Ingenio, Ernst; Edwin van den Heuvel; Jan-Willem Romeyn (2012). "«Todos los modelos están equivocados...»: una introducción a la incertidumbre del modelo (PDF) . Statistica Neerlandica . 66 (3): 217– 236. doi : 10.1111/j.1467-9574.2012.00530.x . S2CID 7793470. Archivado del original (PDF) el 26 de julio de 2020. Consultado el 11 de diciembre de 2019 . 
  4. Claeskens, G. ; Hjort, NL (2008), Selección de modelos y promediado de modelos , Cambridge University Press
  5. Raftery, AE (1995). "Selección de modelos bayesianos en la investigación social". Sociological Methodology . 25 : 111–196 . doi : 10.2307/271063 . JSTOR 271063 . 
  6. ^ Konishi, Sadanori; Kitagawa, Genshiro (2008). Criterios de información y modelización estadística . Saltador. ISBN 978-0-387-71886-6.
  7. Botev, Zdravko I.; Kroese, Dirk P.; Taimre, Thomas (2025). Ciencia de datos y aprendizaje automático: métodos matemáticos y estadísticos (2.ª ed.). Boca Raton ; Londres: CRC Press. pp. 56–57 . ISBN    978-1-032-48868-4.
  8. 1 2 Giraud, C. (2015). Introducción a la estadística de alta dimensión . Chapman & Hall/CRC. ISBN 9781482237948.
  9. Priestley, MB (1981). Análisis espectral y series temporales . Academic Press . ISBN 978-0-12-564922-3.(pág. 375).
  10. Kass, Robert E.; Raftery, Adrian E. (1995), "Factores de Bayes", Journal of the American Statistical Association , 90 (430): 773– 795, doi : 10.2307/2291091 , ISSN 0162-1459 , JSTOR 2291091  .

Lecturas adicionales

  • Modelado autorregresivo de vectores dispersos