En estadística , la validación de modelos consiste en evaluar si un modelo estadístico elegido es apropiado o no. A menudo, en la inferencia estadística, las inferencias de modelos que parecen ajustarse a los datos pueden ser casualidades, lo que lleva a los investigadores a malinterpretar la relevancia real de su modelo. Para evitar esto, se utiliza la validación de modelos para comprobar si un modelo estadístico se mantiene válido ante variaciones en los datos. La validación de modelos también se conoce como crítica o evaluación de modelos.
Este tema no debe confundirse con la tarea estrechamente relacionada de selección de modelos , que consiste en discriminar entre múltiples modelos candidatos: la validación de modelos no se refiere tanto al diseño conceptual de los modelos, sino que solo comprueba la coherencia entre un modelo elegido y sus resultados declarados.
Existen muchas maneras de validar un modelo. Los gráficos de residuos muestran la diferencia entre los datos reales y las predicciones del modelo: las correlaciones en los gráficos de residuos pueden indicar un fallo en el modelo. La validación cruzada es un método de validación de modelos que ajusta iterativamente el modelo, omitiendo cada vez solo una pequeña muestra y comparando si las muestras omitidas son predichas por el modelo: existen muchos tipos de validación cruzada . La simulación predictiva se utiliza para comparar datos simulados con datos reales. La validación externa implica ajustar el modelo a nuevos datos. El criterio de información de Akaike estima la calidad de un modelo.
Descripción general
La validación de modelos se presenta de diversas formas, y el método específico que utiliza un investigador suele estar condicionado por el diseño de su investigación . Es importante destacar que no existe un método único para validar un modelo. Por ejemplo, si un investigador trabaja con un conjunto de datos muy limitado, pero sobre el cual tiene fuertes supuestos previos, podría considerar validar el ajuste de su modelo mediante un marco bayesiano y probándolo con diversas distribuciones previas. Sin embargo, si un investigador dispone de muchos datos y está probando múltiples modelos anidados, estas condiciones podrían propiciar la validación cruzada y, posiblemente, una prueba de exclusión de un elemento. Estos son dos ejemplos abstractos, y cualquier validación de modelo real deberá considerar muchas más complejidades de las descritas aquí, pero estos ejemplos ilustran que los métodos de validación de modelos siempre serán circunstanciales.
En general, los modelos pueden validarse utilizando datos existentes o con datos nuevos, y ambos métodos se analizan con más detalle en las siguientes subsecciones, donde también se incluye una advertencia.
Validación con datos existentes
La validación basada en datos existentes implica analizar la bondad de ajuste del modelo o si los residuos parecen ser aleatorios (es decir, diagnóstico de residuos ). Este método consiste en analizar la proximidad del modelo a los datos y tratar de comprender qué tan bien predice el modelo sus propios datos. Un ejemplo de este método se muestra en la Figura 1, que presenta una función polinómica ajustada a algunos datos. Observamos que la función polinómica no se ajusta bien a los datos, que parecen lineales, lo que podría invalidar este modelo polinómico.
Generalmente, los modelos estadísticos basados en datos existentes se validan mediante un conjunto de validación, también conocido como conjunto de prueba. Este conjunto de validación es un conjunto de datos que el usuario excluye al ajustar un modelo estadístico. Una vez ajustado el modelo, el conjunto de validación se utiliza como medida del error del modelo. Si el modelo se ajusta bien a los datos iniciales, pero presenta un error considerable en el conjunto de validación, esto indica sobreajuste .

Validación con nuevos datos
Si se dispone de nuevos datos, un modelo existente puede validarse comprobando si el modelo anterior predice los nuevos datos. Si el modelo anterior no predice los nuevos datos, es posible que el modelo no sea válido para los objetivos del investigador.
Teniendo esto en cuenta, un enfoque moderno para validar una red neuronal consiste en probar su rendimiento con datos de dominio cambiado. Esto permite determinar si el modelo aprendió características invariantes al dominio. [ 1 ]
Una nota de precaución
Un modelo solo puede validarse en relación con un área de aplicación específica. [ 2 ] [ 3 ] Un modelo válido para una aplicación podría no serlo para otras. Por ejemplo, considérese la curva de la Figura 1: si la aplicación solo utilizara entradas del intervalo [0, 2], dicha curva podría considerarse un modelo aceptable.
Métodos para validar
Al realizar una validación, existen tres causas notables de posibles dificultades, según la Enciclopedia de Ciencias Estadísticas . [ 4 ] Estas tres causas son: falta de datos; falta de control de las variables de entrada; incertidumbre sobre las distribuciones de probabilidad y correlaciones subyacentes. Los métodos habituales para abordar las dificultades en la validación incluyen: verificar los supuestos realizados al construir el modelo; examinar los datos disponibles y los resultados del modelo; y aplicar el juicio de expertos. [ 2 ] Cabe señalar que el juicio de expertos generalmente requiere experiencia en el área de aplicación. [ 2 ]
En ocasiones, el juicio de expertos puede utilizarse para evaluar la validez de una predicción sin necesidad de obtener datos reales: por ejemplo, para la curva de la Figura 1, un experto podría determinar que una extrapolación sustancial sería inválida. Además, el juicio de expertos puede emplearse en pruebas de tipo Turing , donde se presentan a los expertos tanto datos reales como resultados de modelos relacionados y se les pide que distingan entre ambos. [ 5 ]
Para ciertas clases de modelos estadísticos, existen métodos especializados para su validación. Por ejemplo, si el modelo estadístico se obtuvo mediante regresión , existen análisis especializados para la validación de modelos de regresión, los cuales suelen emplearse.
Diagnóstico residual
El diagnóstico de residuos comprende el análisis de los residuos para determinar si estos parecen ser efectivamente aleatorios. Dicho análisis generalmente requiere estimaciones de las distribuciones de probabilidad de los residuos. Estas estimaciones a menudo se pueden obtener ejecutando repetidamente el modelo, es decir, mediante simulaciones estocásticas repetidas (empleando un generador de números pseudoaleatorios para las variables aleatorias del modelo).
Si el modelo estadístico se obtuvo mediante una regresión, entonces existen diagnósticos de residuos de regresión que pueden utilizarse; dichos diagnósticos han sido ampliamente estudiados.
Validación cruzada
La validación cruzada es un método de muestreo que consiste en excluir parte de los datos del proceso de ajuste y comprobar si esos datos excluidos se encuentran cerca o lejos de las predicciones del modelo. En la práctica, esto significa que las técnicas de validación cruzada ajustan el modelo muchas veces con una porción de los datos y comparan cada ajuste con la porción no utilizada. Si los modelos rara vez describen los datos con los que no fueron entrenados, es probable que el modelo sea incorrecto.
Un avance reciente en estadística médica es el uso de una métrica de validación cruzada en metaanálisis . Esta constituye la base del estadístico de validación, Vn, que se utiliza para comprobar la validez estadística de las estimaciones resumidas del metaanálisis. [ 6 ] También se ha utilizado de forma más convencional en metaanálisis para estimar el probable error de predicción de los resultados del metaanálisis. [ 7 ]
Véase también
- Todos los modelos son erróneos : aforismo en estadística.
- Validación cruzada (estadística) – Técnica de validación de modelos estadísticos
- Análisis de identificabilidad : métodos en estadística matemática
- Validez interna : Grado en que una prueba respalda una afirmación sobre causa y efecto.
- Identificación de modelos : propiedad estadística que un modelo debe satisfacer para permitir una inferencia precisa. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Sobreajuste : un fallo en el modelado matemático.
- Perplejidad : concepto en la teoría de la información.
- Modelo predictivo : forma de modelado que utiliza estadísticas para predecir resultados. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Análisis de sensibilidad : estudio de la incertidumbre en el resultado de un modelo o sistema matemático.
- Relación espuria : correlación aparente, pero falsa, entre variables causalmente independientes.
- Validez de la conclusión estadística
- Selección de modelos estadísticos : tarea de seleccionar un modelo estadístico de un conjunto de modelos candidatos. Páginas que muestran descripciones breves de los destinos de redireccionamiento.
- Especificación del modelo estadístico : parte del proceso de construcción de un modelo estadístico.
- Validez (estadística) : Grado en que una medición se corresponde con la realidad.
Referencias
- ↑ Feng, Cheng; Zhong, Chaoliang; Wang, Jie; Zhang, Ying; Sun, Jun; Yokota, Yasuto (julio de 2022). «Aprendizaje de representaciones invariantes de dominio no olvidadas para la adaptación de dominio no supervisada en línea». Actas de la Trigésimo Primera Conferencia Internacional Conjunta sobre Inteligencia Artificial . California: International Joint Conferences on Artificial Intelligence Organization. págs. 2958–2965 . doi : 10.24963/ijcai.2022/410 . ISBN 978-1-956792-00-3.
- 1 2 3 Consejo Nacional de Investigación (2012), «Capítulo 5: Validación y predicción de modelos» , Evaluación de la fiabilidad de modelos complejos: Fundamentos matemáticos y estadísticos de la verificación, validación y cuantificación de la incertidumbre , Washington, DC: National Academies Press , págs. 52–85 , doi : 10.17226/13395 , ISBN 978-0-309-25634-6
{{citation}}: CS1 maint: nombres múltiples: lista de autores ( enlace ) . - ↑ Batzel, JJ; Bachar, M.; Karemaker, JM; Kappel, F. (2013), "Capítulo 1: Combinando el conocimiento matemático y fisiológico", en Batzel, JJ; Bachar, M.; Kappel, F. (eds.), Modelado matemático y validación en fisiología , Springer , pp. 3–19 , doi : 10.1007/978-3-642-32882-4_1 .
- ↑ Deaton, ML (2006), "Modelos de simulación, validación de", en Kotz, S. ; et al. (eds.), Enciclopedia de Ciencias Estadísticas , Wiley .
- ↑ Mayer, DG; Butler, DG (1993), "Validación estadística", Ecological Modelling , 68 ( 1–2 ): 21–32 , doi : 10.1016/0304-3800(93)90105-2.
- ↑ Willis, Brian H.; Riley, Richard D. (20 de septiembre de 2017). "Medición de la validez estadística de los resultados de metaanálisis y metarregresión resumidos para su uso en la práctica clínica" . Statistics in Medicine . 36 (21): 3283– 3301. doi : 10.1002/sim.7372 . PMC 5575530. PMID 28620945 .
- ↑ Riley, Richard D.; Ahmed, Ikhlaaq; Debray, Thomas PA; Willis, Brian H.; Noordzij, J. Pieter; Higgins, Julian PT; Deeks, Jonathan J. (15 de junio de 2015). "Resumen y validación de los resultados de precisión de las pruebas en múltiples estudios para su uso en la práctica clínica" . Statistics in Medicine . 34 (13): 2081– 2103. doi : 10.1002/sim.6471 . PMC 4973708. PMID 25800943 .
Lecturas adicionales
- Barlas, Y. (1996), "Aspectos formales de la validez y validación de modelos en dinámica de sistemas", System Dynamics Review , 12 (3): 183– 210, doi : 10.1002/(SICI)1099-1727(199623)12:3 < 183::AID-SDR103 > 3.0.CO ; 2-4
- Good, PI ; Hardin, JW ( 2012), "Capítulo 15: Validación", Errores comunes en estadística (Cuarta edición), John Wiley & Sons , págs. 277–285
- Huber, PJ (2002), "Capítulo 3: Modelos aproximados", en Huber-Carol, C.; Balakrishnan, N.; Nikulin, MS; Mesbah, M. (eds.), Pruebas de bondad de ajuste y validez del modelo , Springer , pp . 25–41
Enlaces externos
- ¿Cómo puedo saber si un modelo se ajusta a mis datos? — Manual de métodos estadísticos ( NIST )
- Hicks, Dan (14 de julio de 2017). "¿Cuáles son las técnicas básicas de validación de modelos estadísticos?" . Stack Exchange .
- Modelos estadísticos
- Validez (estadística)