


En el modelado matemático , el sobreajuste es la producción de un análisis que se corresponde demasiado de cerca o exactamente con un conjunto particular de datos y, por lo tanto, puede no ajustarse a datos adicionales ni predecir observaciones futuras de manera confiable. [ 1 ] Un modelo sobreajustado es un modelo matemático que contiene más parámetros de los que pueden justificarse con los datos. [ 2 ] En el caso especial de un modelo que consiste en una función polinómica, estos parámetros representan el grado de un polinomio . La esencia del sobreajuste es extraer inconscientemente parte de la variación residual (es decir, ruido ) como si esa variación representara la estructura subyacente del modelo. [ 3 ] : 45
El subajuste se produce cuando un modelo matemático no puede capturar adecuadamente la estructura subyacente de los datos. Un modelo subajustado es aquel al que le faltan algunos parámetros o términos que aparecerían en un modelo correctamente especificado. [ 2 ] El subajuste se produciría, por ejemplo, al ajustar un modelo lineal a datos no lineales. Dicho modelo tenderá a tener un rendimiento predictivo deficiente.
Existe la posibilidad de sobreajuste cuando el criterio utilizado para seleccionar el modelo no coincide con el criterio utilizado para evaluar su idoneidad. Por ejemplo, un modelo podría seleccionarse maximizando su rendimiento en un conjunto de datos de entrenamiento , pero su idoneidad podría determinarse por su capacidad para funcionar bien con datos no vistos. El sobreajuste se produce cuando un modelo comienza a "memorizar" los datos de entrenamiento en lugar de "aprender" a generalizar a partir de una tendencia.
Como ejemplo extremo, si el número de parámetros es igual o mayor que el número de observaciones, un modelo puede predecir perfectamente los datos de entrenamiento simplemente memorizándolos por completo. (Para una ilustración, véase la Figura 2). Un modelo de este tipo suele fallar estrepitosamente al realizar predicciones.
El sobreajuste está relacionado tanto con la complejidad del modelo elegido como con su grado de optimización durante el entrenamiento. Una clase de función demasiado grande, en un sentido adecuado, en relación con el tamaño del conjunto de datos, es probable que se produzca sobreajuste. [ 4 ] Incluso cuando el modelo ajustado no tiene un número excesivo de parámetros, es de esperar que la relación ajustada parezca tener un rendimiento inferior en un nuevo conjunto de datos que en el conjunto de datos utilizado para el ajuste (un fenómeno a veces conocido como contracción ). [ 2 ] En particular, el valor del coeficiente de determinación se contraerá en relación con los datos originales.
Para reducir la probabilidad o la magnitud del sobreajuste, existen diversas técnicas (por ejemplo, comparación de modelos , validación cruzada , regularización , parada temprana , poda , priors bayesianos o abandono ). Algunas técnicas se basan en (1) penalizar explícitamente los modelos excesivamente complejos o (2) evaluar la capacidad de generalización del modelo analizando su rendimiento en un conjunto de datos no utilizados para el entrenamiento, que se supone que se aproxima a los datos típicos no vistos que encontrará el modelo.
Inferencia estadística
En estadística, se extrae una inferencia de un modelo estadístico , seleccionado mediante algún procedimiento. Burnham y Anderson, en su texto sobre selección de modelos, ampliamente citado, argumentan que para evitar el sobreajuste, se debe seguir el « Principio de Parsimonia ». [ 3 ] Los autores también afirman lo siguiente: [ 3 ] : 32-33
Los modelos sobreajustados... suelen carecer de sesgo en los estimadores de parámetros, pero presentan varianzas de muestreo estimadas (y reales) innecesariamente grandes (la precisión de los estimadores es baja en comparación con la que se podría haber logrado con un modelo más parsimonioso). Se tienden a identificar efectos de tratamiento falsos y se incluyen variables falsas en los modelos sobreajustados. ... Se obtiene un modelo de mejor aproximación equilibrando adecuadamente los errores de subajuste y sobreajuste.
El sobreajuste es más probable que sea una preocupación seria cuando hay poca teoría disponible para guiar el análisis, en parte porque entonces suele haber una gran cantidad de modelos para elegir. El libro Model Selection and Model Averaging (2008) lo expresa de esta manera. [ 5 ]
Con un conjunto de datos, puedes ajustar miles de modelos con solo pulsar un botón, pero ¿cómo elegir el mejor? Con tantos modelos candidatos, el sobreajuste es un peligro real. ¿Acaso el mono que escribió Hamlet es realmente un buen escritor?
Regresión
En el análisis de regresión , el sobreajuste ocurre con frecuencia. [ 6 ] Como ejemplo extremo, si hay p variables en una regresión lineal con p puntos de datos, la línea ajustada puede pasar exactamente por cada punto. [ 7 ] Para la regresión logística o los modelos de riesgos proporcionales de Cox , hay una variedad de reglas empíricas (por ejemplo, 5–9, [ 8 ] 10 [ 9 ] y 10–15 [ 10 ] — la pauta de 10 observaciones por variable independiente se conoce como la " regla de uno en diez "). En el proceso de selección del modelo de regresión, el error cuadrático medio de la función de regresión aleatoria se puede dividir en ruido aleatorio, sesgo de aproximación y varianza en la estimación de la función de regresión. El compromiso sesgo-varianza se usa a menudo para superar los modelos sobreajustados.
Con un amplio conjunto de variables explicativas que en realidad no guardan relación con la variable dependiente que se pretende predecir, algunas variables se considerarán erróneamente significativas desde el punto de vista estadístico , y el investigador podría, por lo tanto, mantenerlas en el modelo, sobreajustándolo. Esto se conoce como la paradoja de Freedman .
Aprendizaje automático

Por lo general, un algoritmo de aprendizaje se entrena utilizando un conjunto de "datos de entrenamiento": situaciones ejemplares para las que se conoce el resultado deseado. El objetivo es que el algoritmo también tenga un buen desempeño al predecir el resultado cuando se le proporcionan "datos de validación" que no se encontraron durante su entrenamiento.
El sobreajuste es el uso de modelos o procedimientos que violan la navaja de Occam , por ejemplo, al incluir más parámetros ajustables de los que son óptimos, o al usar un enfoque más complicado de lo que es óptimo. Como ejemplo donde hay demasiados parámetros ajustables, consideremos un conjunto de datos donde los datos de entrenamiento para y pueden predecirse adecuadamente mediante una función lineal de dos variables independientes. Dicha función requiere solo tres parámetros (la intersección y dos pendientes). Reemplazar esta función simple con una nueva función cuadrática más compleja, o con una nueva función lineal más compleja con más de dos variables independientes, conlleva un riesgo: la navaja de Occam implica que cualquier función compleja dada es a priori menos probable que cualquier función simple dada. Si se selecciona la nueva función más compleja en lugar de la función simple, y si no hubo una ganancia suficientemente grande en el ajuste de los datos de entrenamiento para compensar el aumento de complejidad, entonces la nueva función compleja "sobreajusta" los datos y es probable que la función compleja sobreajustada tenga un rendimiento peor que la función más simple en los datos de validación fuera del conjunto de datos de entrenamiento, incluso si la función compleja tuvo un rendimiento igual o incluso mejor en el conjunto de datos de entrenamiento. [ 11 ]
Al comparar diferentes tipos de modelos, la complejidad no puede medirse únicamente contando cuántos parámetros tiene cada modelo; también debe considerarse la expresividad de cada parámetro. Por ejemplo, no es trivial comparar directamente la complejidad de una red neuronal (que puede rastrear relaciones curvilíneas) con m parámetros con la de un modelo de regresión con n parámetros. [ 11 ]
El sobreajuste es especialmente probable en casos donde el aprendizaje se ha prolongado demasiado o donde los ejemplos de entrenamiento son escasos, lo que provoca que el modelo se ajuste a características aleatorias muy específicas de los datos de entrenamiento que no tienen relación causal con la función objetivo . En este proceso de sobreajuste, el rendimiento con los ejemplos de entrenamiento sigue aumentando, mientras que el rendimiento con datos no vistos empeora.
Como ejemplo sencillo, consideremos una base de datos de compras minoristas que incluye el artículo comprado, el comprador y la fecha y hora de la compra. Es fácil construir un modelo que se ajuste perfectamente al conjunto de entrenamiento utilizando la fecha y hora de compra para predecir los demás atributos, pero este modelo no se generalizará en absoluto a nuevos datos, ya que esos momentos pasados nunca volverán a ocurrir.
En general, se dice que un algoritmo de aprendizaje se sobreajusta en comparación con uno más simple si es más preciso al ajustarse a datos conocidos (retrospectiva) pero menos preciso al predecir datos nuevos (prospectiva). El sobreajuste se puede comprender intuitivamente a partir del hecho de que la información de toda la experiencia pasada se puede dividir en dos grupos: información relevante para el futuro e información irrelevante ("ruido"). En igualdad de condiciones, cuanto más difícil sea predecir un criterio (es decir, cuanto mayor sea su incertidumbre), más ruido habrá en la información pasada que deberá ignorarse. El problema radica en determinar qué parte ignorar. Un algoritmo de aprendizaje que puede reducir el riesgo de ajustar ruido se denomina " robusto ".
Consecuencias
Anne Graham Lotz.La consecuencia más obvia del sobreajuste es un rendimiento deficiente en el conjunto de datos de validación. Otras consecuencias negativas incluyen:
- Es probable que una función sobreajustada solicite más información sobre cada elemento del conjunto de datos de validación que la función óptima; recopilar estos datos adicionales innecesarios puede ser costoso o propenso a errores, especialmente si cada dato individual debe recopilarse mediante observación humana e ingreso manual de datos. [ 11 ]
- Es probable que una función más compleja y sobreajustada sea menos portable que una simple. En un extremo, una regresión lineal de una variable es tan portable que, si fuera necesario, incluso podría realizarse manualmente. En el otro extremo se encuentran los modelos que solo pueden reproducirse duplicando exactamente toda la configuración del modelador original, lo que dificulta su reutilización o reproducción científica. [ 11 ]
- Es posible reconstruir detalles de instancias de entrenamiento individuales a partir del conjunto de entrenamiento de un modelo de aprendizaje automático sobreajustado. Esto puede ser indeseable si, por ejemplo, los datos de entrenamiento incluyen información personal identificable sensible (PII). Este fenómeno también presenta problemas en el ámbito de la inteligencia artificial y los derechos de autor , ya que los desarrolladores de algunos modelos generativos de aprendizaje profundo, como Stable Diffusion y GitHub Copilot, han sido demandados por infracción de derechos de autor debido a que se ha descubierto que estos modelos son capaces de reproducir ciertos elementos protegidos por derechos de autor a partir de sus datos de entrenamiento. [ 12 ] [ 13 ]
Recurso
La función óptima generalmente requiere verificación en conjuntos de datos más grandes o completamente nuevos. Sin embargo, existen métodos como el árbol de expansión mínima o la correlación de tiempo de vida que aplican la dependencia entre los coeficientes de correlación y las series temporales (ancho de ventana). Cuando el ancho de ventana es suficientemente grande, los coeficientes de correlación son estables y ya no dependen del tamaño de la ventana. Por lo tanto, se puede crear una matriz de correlación calculando un coeficiente de correlación entre las variables investigadas. Esta matriz se puede representar topológicamente como una red compleja donde se visualizan las influencias directas e indirectas entre las variables.
La regularización por abandono (eliminación aleatoria de datos del conjunto de entrenamiento) también puede mejorar la robustez y, por lo tanto, reducir el sobreajuste al eliminar probabilísticamente las entradas a una capa. La poda es otra técnica que mitiga el sobreajuste y mejora la generalización al identificar una estructura de red neuronal óptima y dispersa [ 14 ] , al tiempo que reduce el costo computacional tanto del entrenamiento como de la inferencia.
Ajuste insuficiente


El subajuste es lo opuesto al sobreajuste, lo que significa que el modelo estadístico o el algoritmo de aprendizaje automático es demasiado simple para capturar con precisión los patrones en los datos. Un signo de subajuste es que se detecta un sesgo alto y una varianza baja en el modelo o algoritmo actual utilizado (lo opuesto al sobreajuste: sesgo bajo y varianza alta ). Esto se puede obtener a partir del compromiso sesgo-varianza , que es el método para analizar un modelo o algoritmo en busca de errores de sesgo, errores de varianza y errores irreducibles. Con un sesgo alto y una varianza baja, el resultado del modelo es que representará de forma inexacta los puntos de datos y, por lo tanto, no podrá predecir con suficiente precisión los resultados de datos futuros (véase Error de generalización ). Como se muestra en la Figura 5, la línea recta no pudo representar todos los puntos de datos dados debido a que la línea no se asemeja a la curvatura de los puntos. Cabría esperar una línea con forma de parábola, como se muestra en las figuras 6 y 1. Si se utilizara la figura 5 para el análisis, se obtendrían resultados predictivos erróneos, contrarios a los que se obtendrían al analizar la figura 6.
Burnham y Anderson afirman lo siguiente. [ 3 ] : 32
Un modelo subajustado ignoraría alguna estructura importante y replicable (es decir, conceptualmente replicable en la mayoría de las demás muestras) en los datos y, por lo tanto, no lograría identificar efectos que sí estaban respaldados por los datos. En este caso, el sesgo en los estimadores de parámetros suele ser considerable y la varianza muestral se subestima, factores que resultan en una cobertura deficiente del intervalo de confianza. Los modelos subajustados tienden a pasar por alto efectos importantes del tratamiento en entornos experimentales.
Solución al problema del ajuste insuficiente
Existen múltiples maneras de abordar el problema del ajuste insuficiente:
- Incrementar la complejidad del modelo: Si el modelo es demasiado simple, puede ser necesario aumentar su complejidad añadiendo más características, incrementando el número de parámetros o utilizando un modelo más flexible. Sin embargo, esto debe hacerse con cuidado para evitar el sobreajuste. [ 15 ]
- Utilice un algoritmo diferente: Si el algoritmo actual no logra capturar los patrones en los datos, puede ser necesario probar uno diferente. Por ejemplo, una red neuronal puede ser más eficaz que un modelo de regresión lineal para algunos tipos de datos. [ 15 ]
- Aumentar la cantidad de datos de entrenamiento: Si el modelo no se ajusta correctamente debido a la falta de datos, aumentar la cantidad de datos de entrenamiento puede ser útil. Esto permitirá que el modelo capture mejor los patrones subyacentes en los datos. [ 15 ]
- Regularización: La regularización es una técnica que se utiliza para prevenir el sobreajuste añadiendo un término de penalización a la función de pérdida que desalienta los valores de parámetros grandes. También puede utilizarse para prevenir el subajuste controlando la complejidad del modelo. [ 16 ]
- Métodos de conjunto : Los métodos de conjunto combinan varios modelos para generar una predicción más precisa. Esto puede ayudar a reducir el subajuste al permitir que varios modelos trabajen juntos para capturar los patrones subyacentes en los datos.
- Ingeniería de características : La ingeniería de características implica crear nuevas características del modelo a partir de las existentes que puedan ser más relevantes para el problema en cuestión. Esto puede ayudar a mejorar la precisión del modelo y prevenir el subajuste. [ 15 ]
sobreajuste benigno
El sobreajuste benigno describe el fenómeno de un modelo estadístico que parece generalizarse bien a datos no vistos, incluso cuando se ha ajustado perfectamente a datos de entrenamiento ruidosos (es decir, obtiene una precisión predictiva perfecta en el conjunto de entrenamiento). Este fenómeno es de particular interés en las redes neuronales profundas , pero se estudia desde una perspectiva teórica en el contexto de modelos mucho más simples, como la regresión lineal . En particular, se ha demostrado que la sobreparametrización es esencial para el sobreajuste benigno en este contexto. En otras palabras, el número de direcciones en el espacio de parámetros que no son importantes para la predicción debe superar significativamente el tamaño de la muestra. [ 17 ]
Véase también
- Compromiso entre sesgo y varianza
- Ajuste de curvas
- dragado de datos
- Doble descenso
- Selección de características
- Ingeniería de características
- La paradoja de Freedman
- Error de generalización
- Bondad de ajuste
- Comprender (aprendizaje automático)
- Tiempo de vida de la correlación
- Selección de modelos
- Grados de libertad del investigador
- La navaja de Occam
- Modelo primario
- Dimensión de Vapnik-Chervonenkis : una mayor dimensión de VC implica un mayor riesgo de sobreajuste.
Notas
- ↑ Definición de " sobreajuste " en OxfordDictionaries.com : esta definición es específica para estadística.
- 1 2 3 Everitt BS, Skrondal A. (2010), Cambridge Dictionary of Statistics , Cambridge University Press .
- 1 2 3 4 Burnham, KP; Anderson, DR (2002), Selección de modelos e inferencia multimodelos (2.ª ed.), Springer-Verlag.
- ↑ Bottou, Léon; Bousquet, Olivier (30 de septiembre de 2011), "Las ventajas y desventajas del aprendizaje a gran escala" , Optimización para el aprendizaje automático , The MIT Press, págs. 351–368 , doi : 10.7551/mitpress/8996.003.0015 , ISBN 978-0-262-29877-3, consultado el 8 de diciembre de 2023
- ↑ Claeskens, G. ; Hjort, NL (2008), Selección de modelos y promediado de modelos , Cambridge University Press.
- ↑ Harrell, FE Jr. (2001), Estrategias de modelado de regresión , Springer.
- ↑ Martha K. Smith (13 de junio de 2014). "Sobreajuste" . Universidad de Texas en Austin . Recuperado el 31 de julio de 2016 .
- ↑ Vittinghoff, E.; McCulloch, CE (2007). "Relajando la regla de diez eventos por variable en la regresión logística y de Cox". American Journal of Epidemiology . 165 (6): 710– 718. doi : 10.1093/aje/kwk052 . PMID 17182981 .
- ↑ Draper, Norman R.; Smith, Harry (1998). Análisis de regresión aplicada (3.ª ed.). Wiley . ISBN 978-0471170822.
- ↑ Jim Frost (3 de septiembre de 2015). "El peligro del sobreajuste de los modelos de regresión" . Consultado el 31 de julio de 2016 .
- 1 2 3 4 Hawkins, Douglas M (2004). "El problema del sobreajuste". Journal of Chemical Information and Modeling . 44 (1): 1– 12. doi : 10.1021/ci0342472 . PMID 14741005 . S2CID 12440383 .
- 1 2 Lee, Timothy B. (3 de abril de 2023). "Las demandas por derechos de autor de Stable Diffusion podrían ser un terremoto legal para la IA" . Ars Technica .
- ↑ Vincent, James (8 de noviembre de 2022). "La demanda que podría reescribir las reglas de los derechos de autor de la IA" . The Verge . Consultado el 7 de diciembre de 2022 .
- ↑ LeCun, Yann; Denker, John; Solla, Sara (1989). "Daño cerebral óptimo" . Avances en sistemas de procesamiento de información neuronal . 2. Morgan-Kaufmann.
- 1 2 3 4 "ML | Subajuste y sobreajuste" . GeeksforGeeks . 23-11-2017 . Recuperado el 27-02-2023 .
- ↑ Nusrat, Ismoilov; Jang, Sung-Bong (noviembre de 2018). "Una comparación de técnicas de regularización en redes neuronales profundas" . Symmetry . 10 (11): 648. Bibcode : 2018Symm...10..648N . doi : 10.3390/sym10110648 . ISSN 2073-8994 .
- ↑ Bartlett, PL, Long, PM, Lugosi, G., & Tsigler, A. (2019). Sobreajuste benigno en regresión lineal. Actas de la Academia Nacional de Ciencias, 117, 30063 - 30070.
Referencias
- Leinweber, DJ (2007). "Trucos estúpidos de minería de datos". The Journal of Investing . 16 : 15–22 . doi : 10.3905/joi.2007.681820 . S2CID 108627390 .
- Tetko, IV; Livingstone, DJ; Luik, AI (1995). "Estudios de redes neuronales. 1. Comparación de sobreajuste y sobreentrenamiento" (PDF) . Journal of Chemical Information and Modeling . 35 (5): 826– 833. doi : 10.1021/ci00027a006 .
Lecturas adicionales
- Christian, Brian ; Griffiths, Tom (abril de 2017), «Capítulo 7: Sobreajuste», Algoritmos para la vida: La informática aplicada a las decisiones humanas , William Collins , págs. 149-168 , ISBN 978-0-00-754799-9
Enlaces externos
- El problema del sobreajuste de datos – Universidad de Stony Brook
- ¿Qué es exactamente el "sobreajuste"? – Blog de Andrew Gelman
- CSE546: Compromiso entre sesgo y varianza en la regresión lineal – Universidad de Washington
- ¿Qué es el subajuste ? – IBM
- Ajuste de curvas
- Matemáticas aplicadas
- Modelado matemático
- Inferencia estadística
- Aprendizaje automático