
El doble descenso en estadística y aprendizaje automático es el fenómeno por el cual la tasa de error de un modelo en el conjunto de prueba inicialmente disminuye con el número de parámetros, luego alcanza un máximo y luego vuelve a disminuir. [ 2 ] Este fenómeno se ha considerado sorprendente, ya que contradice las suposiciones sobre el sobreajuste en el aprendizaje automático clásico. [ 3 ]
El aumento suele producirse cerca del umbral de interpolación, donde el número de parámetros es igual al número de puntos de datos de entrenamiento (el modelo es lo suficientemente grande como para ajustarse a los datos de entrenamiento). O, más precisamente, es el número máximo de muestras en las que el modelo/procedimiento de entrenamiento alcanza, en promedio, un error de entrenamiento de aproximadamente 0. [ 4 ]
Historia
Las primeras observaciones de lo que más tarde se denominaría doble descenso en modelos específicos datan de 1989. [ 5 ] [ 6 ]
El término "doble descenso" fue acuñado por Belkin et al. [ 7 ] en 2019, [ 3 ] cuando el fenómeno ganó popularidad como un concepto más amplio exhibido por muchos modelos. [ 8 ] [ 9 ] Este último desarrollo fue impulsado por una contradicción percibida entre la sabiduría convencional de que demasiados parámetros en el modelo resultan en un error de sobreajuste significativo (una extrapolación de la compensación sesgo-varianza ), [ 10 ] y las observaciones empíricas en la década de 2010 de que algunas técnicas modernas de aprendizaje automático tienden a funcionar mejor con modelos más grandes. [ 7 ] [ 11 ]
Modelos teóricos
El doble descenso ocurre en la regresión lineal con covariables gaussianas isotrópicas y ruido gaussiano isotrópico. [ 12 ]
Se ha analizado un modelo de doble descenso en el límite termodinámico utilizando el truco de réplica , y el resultado se ha confirmado numéricamente. [ 13 ]
Varios trabajos [ 14 ] [ 15 ] han sugerido que el doble descenso puede explicarse utilizando el concepto de dimensión efectiva : si bien una red puede tener un gran número de parámetros, en la práctica solo un subconjunto de esos parámetros son relevantes para el rendimiento de generalización, medido por la curvatura hessiana local . Esta explicación se formaliza a través de límites de generalización basados en compresión PAC -Bayes, [ 16 ] que muestran que se espera que los modelos menos complejos generalicen mejor bajo una distribución a priori de Solomonoff .
Véase también
Referencias
- ↑ Rocks, Jason W. (2022). "Memorizar sin sobreajuste: sesgo, varianza e interpolación en modelos sobreparametrizados" . Physical Review Research . 4 (1) 013201. arXiv : 2010.13933 . Bibcode : 2022PhRvR...4a3201R . doi : 10.1103 /PhysRevResearch.4.013201 . PMC 9879296. PMID 36713351 .
- ↑ "Deep Double Descent" . OpenAI . 5 de diciembre de 2019. Consultado el 12 de agosto de 2022 .
- 1 2 Schaeffer, Rylan; Khona, Mikail; Robertson, Zachary; Boopathy, Akhilan; Pistunova, Kateryna; Rocks, Jason W.; Fiete, Ila Rani; Koyejo, Oluwasanmi (2023-03-24). "Double Descent Demystified: Identifying, Interpreting & Ablating the Sources of a Deep Learning Puzzle". arXiv : 2303.14151v1 [ cs.LG ].
- ↑ Nakkiran, Preetum; Kaplun, Gal; Bansal, Yamini; Yang, Tristan; Barak, Boaz; Sutskever, Ilya (2019-12-04). "Doble descenso profundo: donde los modelos más grandes y más datos perjudican". arXiv : 1912.02292 [ cs.LG ].
- ↑ Vallet, F.; Cailton, J.-G.; Refregier, Ph (junio de 1989). "Extensión lineal y no lineal de la solución pseudoinversa para el aprendizaje de funciones booleanas" . Europhysics Letters . 9 (4): 315. Bibcode : 1989EL......9..315V . doi : 10.1209/0295-5075/9/4/003 . ISSN 0295-5075 .
- ↑ Loog, Marco; Viering, Tom; Mey, Alexander; Krijthe, Jesse H.; Tax, David MJ (2020-05-19). " Una breve prehistoria del doble descenso" . Actas de la Academia Nacional de Ciencias . 117 (20): 10625– 10626. arXiv : 2004.04328 . Bibcode : 2020PNAS..11710625L . doi : 10.1073/pnas.2001875117 . ISSN 0027-8424 . PMC 7245109. PMID 32371495 .
- 1 2 Belkin, Mikhail; Hsu, Daniel; Ma, Siyuan; Mandal, Soumik (2019-08-06). "Conciliando la práctica moderna del aprendizaje automático y la compensación entre sesgo y varianza" . Actas de la Academia Nacional de Ciencias . 116 (32): 15849– 15854. arXiv : 1812.11118 . doi : 10.1073/pnas.1903070116 . ISSN 0027-8424 . PMC 6689936. PMID 31341078 .
- ↑ Spigler, Stefano; Geiger, Mario; d'Ascoli, Stéphane; Sagun, Levent; Biroli, Giulio; Wyart, Matthieu (2019-11-22). "Una transición de atasco de subparametrización a sobreparametrización afecta el paisaje de pérdidas y la generalización". Journal of Physics A: Mathematical and Theoretical . 52 (47): 474001. arXiv : 1810.09665 . doi : 10.1088/1751-8121/ab4c8b . ISSN 1751-8113 .
- ↑ Viering, Tom; Loog, Marco (2023-06-01). "La forma de las curvas de aprendizaje: una revisión". IEEE Transactions on Pattern Analysis and Machine Intelligence . 45 (6): 7799– 7819. arXiv : 2103.10948 . Bibcode : 2023ITPAM..45.7799V . doi : 10.1109/TPAMI.2022.3220744 . ISSN 0162-8828 . PMID 36350870 .
- ↑ Geman, Stuart ; Bienenstock, Élie; Doursat, René (1992). "Redes neuronales y el dilema sesgo/varianza" (PDF) . Neural Computation . 4 : 1–58 . doi : 10.1162/neco.1992.4.1.1 . S2CID 14215320 .
- ↑ Preetum Nakkiran; Gal Kaplun; Yamini Bansal; Tristan Yang; Boaz Barak; Ilya Sutskever (29 de diciembre de 2021). "Doble descenso profundo: donde los modelos más grandes y más datos perjudican". Journal of Statistical Mechanics: Theory and Experiment . 2021 (12). IOP Publishing Ltd y SISSA Medialab srl: 124003. arXiv : 1912.02292 . Bibcode : 2021JSMTE2021l4003N . doi : 10.1088/1742-5468/ac3a74 . S2CID 207808916 .
- ↑ Nakkiran, Preetum (2019-12-16). "Más datos pueden perjudicar la regresión lineal: doble descenso por muestra". arXiv : 1912.07242v1 [ stat.ML ].
- ↑ Advani, Madhu S.; Saxe, Andrew M.; Sompolinsky, Haim (2020-12-01). "Dinámica de alta dimensión del error de generalización en redes neuronales" . Redes neuronales . 132 : 428–446 . doi : 10.1016/j.neunet.2020.08.022 . ISSN 0893-6080 . PMC 7685244. PMID 33022471 .
- ↑ Maddox, Wesley J.; Benton, Gregory W.; Wilson, Andrew Gordon (2020). "Repensando el conteo de parámetros en modelos profundos: dimensionalidad efectiva revisitada". arXiv : 2003.02139 [ cs.LG ].
- ↑ Wilson, Andrew Gordon (2025). "El aprendizaje profundo no es tan misterioso ni diferente". arXiv : 2503.02113 [ cs.LG ].
- ↑ Lotfi, Sanae; Finzi, Marc; Kapoor, Sanyam; Potapczynski, Andres; Goldblum, Micah; Wilson, Andrew G. (2022). Límites de compresión PAC-Bayes tan ajustados que pueden explicar la generalización (PDF) . Advances in Neural Information Processing Systems. Vol. 35. pp. 31459–31473 .
Lecturas adicionales
- Mikhail Belkin; Daniel Hsu; Ji Xu (2020). "Dos modelos de doble descenso para características débiles" . SIAM Journal on Mathematics of Data Science . 2 (4): 1167– 1180. arXiv : 1903.07571 . doi : 10.1137/20M1336072 .
- Mount, John (3 de abril de 2024). "La anomalía del aprendizaje automático m = n" .
- Preetum Nakkiran; Gal Kaplun; Yamini Bansal; Tristan Yang; Boaz Barak; Ilya Sutskever (29 de diciembre de 2021). "Doble descenso profundo: donde los modelos más grandes y más datos perjudican". Journal of Statistical Mechanics: Theory and Experiment . 2021 (12). IOP Publishing Ltd y SISSA Medialab srl: 124003. arXiv : 1912.02292 . Bibcode : 2021JSMTE2021l4003N . doi : 10.1088/1742-5468/ac3a74 . S2CID 207808916 .
- Song Mei; Andrea Montanari (abril de 2022). "El error de generalización de la regresión de características aleatorias: asintótica precisa y la curva de doble descenso". Communications on Pure and Applied Mathematics . 75 (4): 667– 766. arXiv : 1908.05355 . doi : 10.1002/cpa.22008 . S2CID 199668852 .
- Xiangyu Chang; Yingcong Li; Samet Oymak; Christos Thrampoulidis (2021). "Beneficios demostrables de la sobreparametrización en la compresión de modelos: del doble descenso a la poda de redes neuronales". Actas de la Conferencia AAAI sobre Inteligencia Artificial . 35 (8). arXiv : 2012.08749 .
- Manuchehr Aminian: "Caracterizaciones de la doble descendencia", SIAM News, vol. 58, n.º 10 (dic. de 2025).
Enlaces externos
- Brent Werness; Jared Wilber. "Doble descenso: Parte 1: Una introducción visual" .
- Brent Werness; Jared Wilber. "Doble descenso: Parte 2: Una explicación matemática" .
- Comprender el "Doble Descenso Profundo" en evhub.
- Selección de modelos
- Aprendizaje automático
- Clasificación estadística
- Esbozos estadísticos