En estadística , el criterio de información bayesiano ( BIC ) o criterio de información de Schwarz (también conocido como SIC , SBC o SBIC ) es un criterio para la selección de modelos entre un conjunto finito de modelos; generalmente se prefieren los modelos con un BIC más bajo. Se basa, en parte, en la función de verosimilitud y está estrechamente relacionado con el criterio de información de Akaike (AIC).
Al ajustar modelos, es posible aumentar la máxima verosimilitud añadiendo parámetros, pero esto puede provocar sobreajuste . Tanto el BIC como el AIC intentan resolver este problema introduciendo un término de penalización para el número de parámetros del modelo; este término es mayor en el BIC que en el AIC para tamaños de muestra superiores a 7. [ 1 ]
El BIC fue desarrollado por Gideon E. Schwarz y publicado en un artículo de 1978, [ 2 ] como una aproximación de muestra grande al factor de Bayes .
Definición
El BIC se define formalmente como [ 3 ] [ a ]
dónde
- = el valor maximizado de la función de verosimilitud del modelo, es decir, dóndeson los valores de los parámetros que maximizan la función de verosimilitud yson los datos observados;
- = el número de puntos de datos en, el número de observaciones , o equivalentemente, el tamaño de la muestra;
- = el número de parámetros estimados por el modelo. Por ejemplo, en la regresión lineal múltiple , los parámetros estimados son el intercepto, elparámetros de pendiente y la varianza constante de los errores; por lo tanto,.
Derivación
El BIC se puede derivar integrando los parámetros del modelo utilizando el método de Laplace , comenzando con la siguiente evidencia del modelo : [ 5 ] [ 6 ] : 217
dóndees el prior parabajo modelo.
La verosimilitud logarítmica,, luego se expande a una serie de Taylor de segundo orden sobre el MLE ,, suponiendo que es dos veces diferenciable de la siguiente manera:
dóndees la información observada promedio por observación , ydenota el término residual. En la medida en quees insignificante yes relativamente lineal cerca, podemos integrarlopara obtener lo siguiente:
Comoaumentos, podemos ignorarytal como son. De este modo,
donde BIC se define como se indicó anteriormente, yo bien (a) es el modo posterior bayesiano o bien (b) utiliza el MLE y la distribución a prioritiene una pendiente distinta de cero en el MLE. Entonces, la posterior
Los argumentos anteriores son heurísticos, pero pueden hacerse matemáticamente rigurosos bajo los supuestos técnicos de continuidad de Lipschitz y convexidad fuerte , como sigue.
Lema. (Lema 2.82 [ 7 ] ) Definir. Si la secuencia de gradienteses Lipschitz continua, uniformemente eny cadaes fuertemente convexa con un parámetro común(independiente de), entonces como: dóndees la estimación de máxima posteriori (MAP) de.
Tenga en cuenta que siempre es posible seleccionar una densidad previa.de tal manera que cadaes fuertemente convexa (con el mismo parámetro). Dicha distribución a priori garantiza que la estimación MAPexiste, incluso en casos donde la estimación MLEen sí mismo no existe.
Usar
Al elegir entre varios modelos, generalmente se prefieren aquellos con valores BIC más bajos. El BIC es una función creciente de la varianza del error.y una función creciente de k . Es decir, la variación no explicada en la variable dependiente y el número de variables explicativas aumentan el valor del BIC. Sin embargo, un BIC menor no indica necesariamente que un modelo sea mejor que otro. Dado que implica aproximaciones, el BIC es simplemente una heurística. En particular, las diferencias en el BIC nunca deben tratarse como factores de Bayes transformados.
Es importante tener en cuenta que el BIC solo se puede usar para comparar modelos estimados cuando los valores numéricos de la variable dependiente [ b ] son idénticos para todos los modelos que se comparan. Los modelos que se comparan no tienen por qué estar anidados , a diferencia de cuando se comparan modelos usando una prueba F o una prueba de razón de verosimilitud .
Para comparar dos modelos diferentes, simplemente calcule el BIC para cada modelo y compárelos según la tabla que aparece a continuación:
Limitaciones
El BIC sufre de dos limitaciones principales: [ 8 ]
- La aproximación anterior solo es válida para el tamaño de la muestra.mucho mayor que el númerode parámetros en el modelo.
- El BIC no puede manejar colecciones complejas de modelos como en el problema de selección de variables (o selección de características ) en alta dimensión. [ 8 ]
caso especial gaussiano
Bajo el supuesto de que los errores o perturbaciones del modelo son independientes e idénticamente distribuidos según una distribución normal y la condición de contorno de que la derivada de la verosimilitud logarítmica con respecto a la varianza verdadera es cero, esto se convierte en ( salvo una constante aditiva , que depende solo de n y no del modelo): [ 9 ]
dóndees la varianza del error. La varianza del error en este caso se define como
lo cual es un estimador sesgado de la varianza verdadera .
En términos de la suma residual de cuadrados (RSS), el BIC es
Al probar múltiples modelos lineales frente a un modelo saturado, el BIC se puede reescribir en términos de la desviación.como: [ 10 ]
dóndees el número de parámetros del modelo en la prueba.
Véase también
Notas
- ↑ El AIC, AICc y BIC definidos por Claeskens y Hjort [ 4 ] son los negativos de los definidos en este artículo y en la mayoría de las demás referencias estándar.
- ↑ Una variable dependiente también se denomina variable de respuesta o variable de resultado . Véase Análisis de regresión .
Referencias
- ↑ Véase el artículo de revisión: Stoica, P.; Selen, Y. (2004), "Selección del orden del modelo: una revisión de las reglas del criterio de información", IEEE Signal Processing Magazine (julio): 36–47 , doi : 10.1109/MSP.2004.1311138 , S2CID 17338979 .
- ↑ Schwarz, Gideon E. (1978), "Estimating the dimension of a model", Annals of Statistics , 6 (2): 461– 464, doi : 10.1214/aos/1176344136 , MR 0468014 .
- ↑ Ingenio, Ernst; Edwin van den Heuvel; Jan-Willem Romeyn (2012). "«Todos los modelos están equivocados...»: una introducción a la incertidumbre del modelo (PDF) . Statistica Neerlandica . 66 (3): 217– 236. doi : 10.1111/j.1467-9574.2012.00530.x . S2CID 7793470. Archivado del original (PDF) el 26 de julio de 2020. Consultado el 11 de diciembre de 2019 .
- ↑ Claeskens, G. ; Hjort, NL (2008), Selección de modelos y promediado de modelos , Cambridge University Press
- ↑ Raftery, AE (1995). "Selección de modelos bayesianos en la investigación social". Sociological Methodology . 25 : 111–196 . doi : 10.2307/271063 . JSTOR 271063 .
- ^ Konishi, Sadanori; Kitagawa, Genshiro (2008). Criterios de información y modelización estadística . Saltador. ISBN 978-0-387-71886-6.
- ↑ Botev, Zdravko I.; Kroese, Dirk P.; Taimre, Thomas (2025). Ciencia de datos y aprendizaje automático: métodos matemáticos y estadísticos (2.ª ed.). Boca Raton ; Londres: CRC Press. pp. 56–57 . ISBN 978-1-032-48868-4.
- 1 2 Giraud, C. (2015). Introducción a la estadística de alta dimensión . Chapman & Hall/CRC. ISBN 9781482237948.
- ↑ Priestley, MB (1981). Análisis espectral y series temporales . Academic Press . ISBN 978-0-12-564922-3.(pág. 375).
- ↑ Kass, Robert E.; Raftery, Adrian E. (1995), "Factores de Bayes", Journal of the American Statistical Association , 90 (430): 773– 795, doi : 10.2307/2291091 , ISSN 0162-1459 , JSTOR 2291091 .
Lecturas adicionales
- Bhat, HS; Kumar, N (2010). "Sobre la derivación del criterio de información bayesiano" (PDF) . Archivado del original (PDF) el 28 de marzo de 2012.
- Findley, DF (1991). "Contraejemplos a la parsimonia y el BIC". Anales del Instituto de Matemáticas Estadísticas . 43 (3): 505– 514. doi : 10.1007/BF00053369 . S2CID 58910242 .
- Kass, RE; Wasserman, L. (1995). "Una prueba bayesiana de referencia para hipótesis anidadas y su relación con el criterio de Schwarz". Journal of the American Statistical Association . 90 (431): 928– 934. doi : 10.2307/2291327 . JSTOR 2291327 .
- Liddle, AR (2007). "Criterios de información para la selección de modelos astrofísicos" . Monthly Notices of the Royal Astronomical Society . 377 (1): L74– L78. arXiv : astro-ph/0701113 . Bibcode : 2007MNRAS.377L..74L . doi : 10.1111/j.1745-3933.2007.00306.x . S2CID 2884450 .
- McQuarrie, ADR; Tsai, C.-L. (1998). Selección de modelos de regresión y series temporales . World Scientific .
Enlaces externos
- Modelado autorregresivo de vectores dispersos
- Selección de modelos
- Inferencia bayesiana
- Selección de variables de regresión