La selección de modelos es la tarea de elegir un modelo entre varios candidatos basándose en criterios de rendimiento para seleccionar el mejor. [ 1 ] En el contexto del aprendizaje automático y, más generalmente, del análisis estadístico , esto puede ser la selección de un modelo estadístico de un conjunto de modelos candidatos, dados los datos. En los casos más simples, se considera un conjunto de datos preexistente. Sin embargo, la tarea también puede implicar el diseño de experimentos de manera que los datos recopilados sean adecuados para el problema de la selección de modelos. Dados los modelos candidatos con un poder predictivo o explicativo similar, el modelo más simple es probablemente la mejor opción ( la navaja de Occam ).
Konishi y Kitagawa (2008 , p. 75) afirman: «La mayoría de los problemas en inferencia estadística pueden considerarse problemas relacionados con el modelado estadístico». En este sentido, Cox (2006 , p. 197) ha dicho: «La forma en que se realiza la traducción del problema de campo al modelo estadístico suele ser la parte más crítica de un análisis».
La selección de modelos también puede referirse al problema de seleccionar unos pocos modelos representativos de un gran conjunto de modelos computacionales con el propósito de tomar decisiones u optimizar bajo incertidumbre. [ 2 ]
En el aprendizaje automático , los enfoques algorítmicos para la selección de modelos incluyen la selección de características , la optimización de hiperparámetros y la teoría del aprendizaje estadístico .
Introducción

En su forma más básica, la selección de modelos es una de las tareas fundamentales de la investigación científica . Determinar el principio que explica una serie de observaciones suele estar directamente vinculado a un modelo matemático que predice dichas observaciones. Por ejemplo, cuando Galileo realizó sus experimentos con el plano inclinado , demostró que el movimiento de las bolas se ajustaba a la parábola predicha por su modelo .
Ante la innumerable cantidad de mecanismos y procesos posibles que podrían haber generado los datos, ¿cómo empezar a elegir el mejor modelo? El enfoque matemático comúnmente empleado consiste en seleccionar entre un conjunto de modelos candidatos; este conjunto debe ser elegido por el investigador. A menudo se utilizan modelos sencillos, como los polinomios , al menos inicialmente . Burnham y Anderson (2002) enfatizan a lo largo de su libro la importancia de elegir modelos basados en principios científicos sólidos, como la comprensión de los procesos o mecanismos fenomenológicos (por ejemplo, reacciones químicas) que subyacen a los datos.
Una vez elegido el conjunto de modelos candidatos, el análisis estadístico nos permite seleccionar el mejor. El significado de " mejor" es controvertido. Una buena técnica de selección de modelos equilibrará la bondad de ajuste con la simplicidad. Los modelos más complejos podrán adaptar mejor su forma a los datos (por ejemplo, un polinomio de quinto orden puede ajustarse con precisión a seis puntos), pero los parámetros adicionales podrían no ser útiles. (Quizás esos seis puntos estén simplemente distribuidos aleatoriamente alrededor de una línea recta). La bondad de ajuste se determina generalmente mediante un enfoque de razón de verosimilitud , o una aproximación del mismo, que conduce a una prueba de chi-cuadrado . La complejidad se mide generalmente contando el número de parámetros del modelo.
Las técnicas de selección de modelos pueden considerarse estimadores de alguna magnitud física, como la probabilidad de que el modelo genere los datos dados. El sesgo y la varianza son medidas importantes de la calidad de este estimador; la eficiencia también se suele tener en cuenta.
Un ejemplo estándar de selección de modelos es el ajuste de curvas , donde, dado un conjunto de puntos y otros conocimientos previos (por ejemplo, que los puntos son el resultado de muestras i.i.d. ), debemos seleccionar una curva que describa la función que generó los puntos.
Dos direcciones de selección de modelos
La inferencia y el aprendizaje a partir de datos tienen dos objetivos principales. Uno es el descubrimiento científico, también llamado inferencia estadística, que implica comprender el mecanismo subyacente de generación de datos e interpretar su naturaleza. El otro objetivo es predecir observaciones futuras o desconocidas, lo que se conoce como predicción estadística. En este segundo objetivo, el científico de datos no se preocupa necesariamente por una descripción probabilística precisa de los datos. Por supuesto, también puede interesarle ambos enfoques.
En consonancia con los dos objetivos distintos, la selección de modelos también puede tener dos vertientes: selección de modelos para inferencia y selección de modelos para predicción. [ 3 ] La primera vertiente consiste en identificar el mejor modelo para los datos, que preferiblemente proporcione una caracterización fiable de las fuentes de incertidumbre para la interpretación científica. Para este fin, es de suma importancia que el modelo seleccionado no sea demasiado sensible al tamaño de la muestra. Por consiguiente, una noción apropiada para evaluar la selección de modelos es la consistencia de la selección, lo que significa que el candidato más robusto será seleccionado de forma consistente cuando haya suficientes muestras de datos.
La segunda opción consiste en elegir un modelo como herramienta para ofrecer un excelente rendimiento predictivo. Sin embargo, en este caso, el modelo seleccionado podría ser simplemente el ganador afortunado entre unos pocos competidores cercanos, aunque su rendimiento predictivo siga siendo el mejor posible. Si es así, la selección del modelo es adecuada para el segundo objetivo (la predicción), pero su uso para obtener información e interpretación puede resultar muy poco fiable y engañoso. [ 3 ] Además, para modelos muy complejos seleccionados de esta manera, incluso las predicciones pueden ser irrazonables para datos que difieren solo ligeramente de aquellos en los que se basó la selección. [ 4 ]
Métodos para ayudar a elegir el conjunto de modelos candidatos
Criterios
A continuación se presenta una lista de criterios para la selección de modelos. Los criterios de información más utilizados son (i) el criterio de información de Akaike y (ii) el factor de Bayes y/o el criterio de información bayesiano (que en cierta medida se aproxima al factor de Bayes); consulte Stoica y Selen (2004) para obtener una revisión.
- Criterio de información de Akaike (AIC), una medida de la bondad de ajuste de un modelo estadístico estimado.
- factor de Bayes
- El criterio de información bayesiano (BIC), también conocido como criterio de información de Schwarz, es un criterio estadístico para la selección de modelos.
- Criterio puente (BC), un criterio estadístico que puede lograr un mejor rendimiento que AIC y BIC a pesar de la idoneidad de la especificación del modelo. [ 5 ]
- Validación cruzada
- Criterio de información de desviación (DIC), otro criterio de selección de modelos orientado al enfoque bayesiano.
- Tasa de falsos descubrimientos
- El criterio de información focalizada (FIC, por sus siglas en inglés) es un criterio de selección que clasifica los modelos estadísticos según su efectividad para un parámetro de enfoque determinado.
- Criterio de información de Hannan-Quinn , una alternativa a los criterios de Akaike y bayesiano.
- El criterio de información de Kashyap (KIC) es una alternativa potente al AIC y al BIC, porque el KIC utiliza la matriz de información de Fisher.
- Prueba de razón de verosimilitud
- C p de Mallows
- Longitud mínima de la descripción
- Longitud mínima del mensaje (MML)
- Estadística PRESS , también conocida como criterio PRESS
- Criterio de información cuasi (QIC), para la selección de modelos donde la log-verosimilitud se reemplaza por la cuasi log-verosimilitud (por ejemplo, ecuaciones de estimación generalizadas ).
- Minimización del riesgo estructural
- regresión por pasos
- Criterio de información de Watanabe-Akaike (WAIC), también llamado criterio de información de amplia aplicación
- El criterio de información bayesiano extendido (EBIC) es una extensión del criterio de información bayesiano ordinario (BIC) para modelos con espacios de parámetros amplios.
- El Criterio de Información de Fisher Extendido (EFIC) es un criterio de selección de modelos para modelos de regresión lineal.
- El Criterio Mínimo Restringido (CMC) es un método frecuentista para la selección de modelos de regresión basado en las siguientes observaciones geométricas. En el espacio vectorial de parámetros del modelo completo, cada vector representa un modelo. Existe una bola centrada en el verdadero vector de parámetros del modelo completo en la que el verdadero modelo es el modelo más pequeño (ennorma). A medida que el tamaño de la muestra tiende a infinito, el estimador de máxima verosimilitud (MLE) para el vector de parámetros verdadero converge y, por lo tanto, acerca la región de confianza de la razón de verosimilitud decreciente al vector de parámetros verdadero. La región de confianza estará dentro de la bola con una probabilidad que tiende a uno. El CMC selecciona el modelo más pequeño en esta región. Cuando la región contiene el vector de parámetros verdadero, la selección del CMC es el modelo verdadero. Por lo tanto, la probabilidad de que la selección del CMC sea el modelo verdadero es mayor o igual que el nivel de confianza. [ 6 ]
Entre estos criterios, la validación cruzada suele ser la más precisa, y la más costosa desde el punto de vista computacional, para los problemas de aprendizaje supervisado.
Burnham y Anderson (2002 , §6.3) afirman lo siguiente:
Existe una variedad de métodos de selección de modelos. Sin embargo, desde el punto de vista del rendimiento estadístico de un método y el contexto previsto de su uso, solo hay dos clases distintas de métodos: Estos han sido etiquetados como eficientes y consistentes . (...) Bajo el paradigma frecuentista para la selección de modelos, generalmente hay tres enfoques principales: (I) optimización de algunos criterios de selección, (II) pruebas de hipótesis y (III) métodos ad hoc.
Véase también
- Todos los modelos son erróneos.
- Análisis de hipótesis contrapuestas
- Aprendizaje automático automatizado (AutoML)
- El dilema del sesgo y la varianza
- Selección de características
- La paradoja de Freedman
- Búsqueda en cuadrícula
- Análisis de identificabilidad
- Análisis log-lineal
- Identificación de modelos
- La navaja de Occam
- Diseño óptimo
- Problema de identificación de parámetros
- Modelado científico
- Validación del modelo estadístico
- La paradoja de Stein
Notas
- ↑ Hastie, Tibshirani, Friedman (2009). Los elementos del aprendizaje estadístico . Springer. pág. 195.
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Shirangi, Mehrdad G.; Durlofsky, Louis J. (2016). "Un método general para seleccionar modelos representativos para la toma de decisiones y la optimización bajo incertidumbre". Computers & Geosciences . 96 : 109–123 . Bibcode : 2016CG.....96..109S . doi : 10.1016/j.cageo.2016.08.002 .
- 1 2 Ding, Jie; Tarokh, Vahid; Yang, Yuhong (2018). "Técnicas de selección de modelos: una visión general" . IEEE Signal Processing Magazine . 35 (6): 16– 34. arXiv : 1810.09583 . Bibcode : 2018ISPM...35f..16D . doi : 10.1109/MSP.2018.2867638 . ISSN 1053-5888 . S2CID 53035396 .
- ↑ Su, J.; Vargas, DV; Sakurai, K. (2019). "Ataque de un píxel para engañar a las redes neuronales profundas". IEEE Transactions on Evolutionary Computation . 23 (5): 828– 841. arXiv : 1710.08864 . Bibcode : 2019ITEC...23..828S . doi : 10.1109/TEVC.2019.2890858 . S2CID 2698863 .
- ↑ Ding, J.; Tarokh, V.; Yang, Y. (junio de 2018). "Uniendo AIC y BIC: un nuevo criterio para la autorregresión". IEEE Transactions on Information Theory . 64 (6): 4024– 4043. arXiv : 1508.02473 . Bibcode : 2018ITIT...64.4024D . doi : 10.1109/TIT.2017.2717599 . ISSN 1557-9654 . S2CID 5189440 .
- ↑ Tsao, Min (2023). "Selección de modelos de regresión mediante razón de verosimilitud logarítmica y criterio mínimo restringido". Revista Canadiense de Estadística . 52 : 195–211 . arXiv : 2107.08529 . doi : 10.1002/cjs.11756 . S2CID 236087375 .
Referencias
- Aho, K.; Derryberry, D.; Peterson, T. (2014), "Selección de modelos para ecólogos: las visiones del mundo de AIC y BIC", Ecology , 95 (3): 631– 636, Bibcode : 2014Ecol...95..631A , doi : 10.1890/13-1452.1 , PMID 24804445
- Akaike, H. (1994), "Implicaciones del punto de vista informacional en el desarrollo de la ciencia estadística", en Bozdogan, H. (ed.), Actas de la Primera Conferencia EE. UU./Japón sobre las Fronteras del Modelado Estadístico: Un Enfoque Informacional—Volumen 3 , Kluwer Academic Publishers , pp. 27–38 .
- Anderson, DR (2008), Inferencia basada en modelos en las ciencias de la vida , Springer, ISBN 9780387740751
- Ando, T. (2010), Selección de modelos bayesianos y modelado estadístico , CRC Press , ISBN 9781439836156
- Breiman, L. (2001), "Modelado estadístico: las dos culturas", Statistical Science , 16 : 199–231 , doi : 10.1214/ss/1009213726
- Burnham, KP; Anderson, DR (2002), Selección de modelos e inferencia multimodelos: un enfoque práctico basado en la teoría de la información (2.ª ed.), Springer-Verlag, ISBN 0-387-95364-7[Este artículo tiene más de 38.000 citas en Google Académico ]
- Chamberlin, TC (1890), "El método de las hipótesis de trabajo múltiples", Science , 15 (366): 92–6 , Bibcode : 1890Sci....15R..92. , doi : 10.1126/science.ns-15.366.92 , PMID 17782687 (reimpreso en 1965, Science 148: 754–759)doi : 10.1126/science.148.3671.754 )
- Claeskens, G. (2016), "Elección de modelos estadísticos" (PDF) , Annual Review of Statistics and Its Application , 3 (1): 233– 256, Bibcode : 2016AnRSA...3..233C , doi : 10.1146/annurev-statistics-041715-033413
- Claeskens, G.; Hjort, NL (2008), Selección de modelos y promediado de modelos , Cambridge University Press, ISBN 9781139471800
- Cox, DR (2006), Principios de inferencia estadística , Cambridge University Press
- Ding, J.; Tarokh, V.; Yang, Y. (2018), "Técnicas de selección de modelos: una visión general", IEEE Signal Processing Magazine , 35 (6): 16– 34, arXiv : 1810.09583 , Bibcode : 2018ISPM...35f..16D , doi : 10.1109/MSP.2018.2867638 , S2CID 53035396
- Kashyap, RL (1982), "Elección óptima de las partes AR y MA en modelos autorregresivos de media móvil", IEEE Transactions on Pattern Analysis and Machine Intelligence , PAMI-4 (2), IEEE: 99–104 , doi : 10.1109/TPAMI.1982.4767213 , PMID 21869012 , S2CID 18484243
- Konishi, S.; Kitagawa, G. (2008), Information Criteria and Statistical Modeling , Springer, Bibcode : 2007icsm.book.....K , ISBN 9780387718866
- Lahiri, P. (2001), Selección de modelos , Instituto de Estadística Matemática
- Leeb, H.; Pötscher, BM (2009), "Selección de modelos", en Anderson, TG (ed.), Handbook of Financial Time Series , Springer, pp. 889–925 , doi : 10.1007/978-3-540-71297-8_39 , ISBN 978-3-540-71296-1
- Lukacs, PM; Thompson, WL; Kendall, WL; Gould, WR; Doherty, PF Jr.; Burnham, KP; Anderson, DR (2007), "Preocupaciones sobre un llamado al pluralismo de la teoría de la información y la comprobación de hipótesis", Journal of Applied Ecology , 44 (2): 456– 460, Bibcode : 2007JApEc..44..456L , doi : 10.1111/j.1365-2664.2006.01267.x , S2CID 83816981
- McQuarrie, Allan DR; Tsai, Chih-Ling (1998), Selección de modelos de regresión y series temporales , Singapur: World Scientific, ISBN 981-02-3242-X
- Massart, P. (2007), Desigualdades de concentración y selección de modelos , Springer
- Massart, P. (2014), "Un paseo no asintótico en probabilidad y estadística" , en Lin, Xihong (ed.), Pasado, presente y futuro de la ciencia estadística , Chapman & Hall , pp. 309–321 , ISBN 9781482204988
- Navarro, DJ (2019), "Entre el diablo y el mar profundo: tensiones entre el juicio científico y la selección de modelos estadísticos", Computational Brain & Behavior , 2 : 28–34 , doi : 10.1007/s42113-018-0019-z , hdl : 1959.4/unsworks_64247
- Resende, Paulo Angelo Alves; Dorea, Chang Chung Yu (2016), "Identificación de modelos mediante el criterio de determinación eficiente", Journal of Multivariate Analysis , 150 : 229–244 , arXiv : 1409.7441 , doi : 10.1016/j.jmva.2016.06.002 , S2CID 5469654
- Shmueli, G. (2010), "¿Explicar o predecir?" , Statistical Science , 25 (3): 289–310 , arXiv : 1101.0891 , doi : 10.1214/10-STS330 , MR 2791669 , S2CID 15900983
- Stoica, P.; Selen, Y. (2004), "Selección del orden del modelo: una revisión de las reglas del criterio de información" (PDF) , IEEE Signal Processing Magazine , 21 (4): 36– 47, Bibcode : 2004ISPM...21...36S , doi : 10.1109/MSP.2004.1311138 , S2CID 17338979
- ingenio, E.; van den Heuvel, E.; Romeijn, J.-W. (2012), "«Todos los modelos son erróneos...»: una introducción a la incertidumbre de los modelos (PDF) , Statistica Neerlandica , 66 (3): 217–236 , doi : 10.1111/j.1467-9574.2012.00530.x , S2CID 7793470
- Wit, E.; McCullagh, P. (2001), Viana, MAG; Richards, D. St. P. (eds.), "La extensibilidad de los modelos estadísticos", Métodos algebraicos en estadística y probabilidad , págs. 327–340
- Wójtowicz, Anna; Bigaj, Tomasz (2016), «Justificación, confirmación y el problema de las hipótesis mutuamente excluyentes», en Kuźniar, Adrian; Odrowąż-Sypniewska, Joanna (eds.), Descubriendo hechos y valores , Brill Publishers , pp. 122–143 , doi : 10.1163/9789004312654_009 , ISBN 9789004312654
- Owrang, Arash; Jansson, Magnus (2018), "Un criterio de selección de modelos para regresión lineal de alta dimensión" , IEEE Transactions on Signal Processing , 66 (13): 3436–3446 , Bibcode : 2018ITSP...66.3436O , doi : 10.1109/TSP.2018.2821628 , ISSN 1941-0476 , S2CID 46931136
- B. Gohain, Prakash; Jansson, Magnus (2022), "Criterio de información bayesiano consistente e invariante a escala para la selección de orden en modelos de regresión lineal", Signal Processing , 196 108499, Bibcode : 2022SigPr.19608499G , doi : 10.1016/j.sigpro.2022.108499 , ISSN 0165-1684 , S2CID 246759677
- Selección de modelos
- Selección de variables de regresión
- Métodos matemáticos y cuantitativos (economía)
- Ciencias de la administración