Articulo de referencia

Búsqueda de arquitectura neuronal

La búsqueda de arquitectura neuronal ( NAS ) [ 1 ] [ 2 ] es una técnica para automatizar el diseño de redes neuronales artificiales (ANN), un modelo ampliamente utilizado en el ...

La búsqueda de arquitectura neuronal ( NAS ) [ 1 ] [ 2 ] es una técnica para automatizar el diseño de redes neuronales artificiales (ANN), un modelo ampliamente utilizado en el campo del aprendizaje automático . NAS se ha utilizado para diseñar redes que están a la par o superan a las arquitecturas diseñadas manualmente. [ 3 ] [ 4 ] Los métodos para NAS se pueden categorizar según el espacio de búsqueda, la estrategia de búsqueda y la estrategia de estimación del rendimiento utilizada: [ 1 ]

  • El espacio de búsqueda define el tipo o tipos de redes neuronales artificiales que se pueden diseñar y optimizar.
  • La estrategia de búsqueda define el enfoque utilizado para explorar el espacio de búsqueda.
  • La estrategia de estimación del rendimiento evalúa el desempeño de una posible red neuronal artificial a partir de su diseño (sin construirla ni entrenarla).

NAS está estrechamente relacionado con la optimización de hiperparámetros [ 5 ] y el metaaprendizaje [ 6 ] y es un subcampo del aprendizaje automático automatizado (AutoML). [ 7 ]

Aprendizaje por refuerzo

El aprendizaje por refuerzo (RL) puede sustentar una estrategia de búsqueda NAS. Barret Zoph y Quoc Viet Le [ 3 ] aplicaron NAS con RL al conjunto de datos CIFAR-10 y lograron una arquitectura de red que rivaliza con la mejor arquitectura diseñada manualmente en cuanto a precisión, con una tasa de error de 3,65, un 0,09 por ciento mejor y 1,05 veces más rápida que un modelo similar diseñado manualmente. En el conjunto de datos Penn Treebank , ese modelo compuso una celda recurrente que supera a LSTM , alcanzando una perplejidad en el conjunto de prueba de 62,4, o 3,6 perplejidades mejor que el sistema líder anterior. En la tarea de modelado de lenguaje de caracteres PTB, logró bits por carácter de 1,214. [ 3 ]

Aprender una arquitectura de modelo directamente en un conjunto de datos grande puede ser un proceso largo. NASNet [ 4 ] [ 8 ] abordó este problema transfiriendo un bloque de construcción diseñado para un conjunto de datos pequeño a un conjunto de datos más grande. El diseño se restringió al uso de dos tipos de celdas convolucionales para devolver mapas de características que cumplen dos funciones principales al convolucionar un mapa de características de entrada: celdas normales que devuelven mapas de la misma extensión (altura y anchura) y celdas de reducción en las que la altura y la anchura del mapa de características devuelto se reducen a la mitad. Para la celda de reducción, la operación inicial aplicada a las entradas de la celda utiliza un paso de dos (para reducir la altura y la anchura). [ 4 ] El aspecto aprendido del diseño incluyó elementos como qué capa(s) inferior(es) tomó cada capa superior como entrada, las transformaciones aplicadas en esa capa y para fusionar múltiples salidas en cada capa. En el ejemplo estudiado, la mejor capa convolucional (o "celda") se diseñó para el conjunto de datos CIFAR-10 y luego se aplicó al conjunto de datos ImageNet apilando copias de esta celda, cada una con sus propios parámetros. El enfoque arrojó una precisión del 82,7 % top-1 y del 96,2 % top-5. Esto superó a las mejores arquitecturas inventadas por humanos con un costo de 9 mil millones menos de FLOPS , una reducción del 28 %. El sistema continuó superando a la alternativa diseñada manualmente en diferentes niveles de computación. Las características de imagen aprendidas de la clasificación de imágenes se pueden transferir a otros problemas de visión por computadora. Por ejemplo, para la detección de objetos, las celdas aprendidas integradas con el marco Faster-RCNN mejoraron el rendimiento en un 4,0 % en el conjunto de datos COCO . [ 4 ]

En el denominado ENAS (Eficiente Neural Architecture Search), un controlador descubre arquitecturas aprendiendo a buscar un subgrafo óptimo dentro de un grafo grande. El controlador se entrena con gradiente de política para seleccionar un subgrafo que maximice la recompensa esperada del conjunto de validación. El modelo correspondiente al subgrafo se entrena para minimizar una pérdida de entropía cruzada canónica . Varios modelos secundarios comparten parámetros, ENAS requiere menos horas de GPU que otros enfoques y 1000 veces menos que NAS "estándar". En CIFAR-10, el diseño ENAS logró un error de prueba del 2,89 %, comparable a NASNet. En Penn Treebank, el diseño ENAS alcanzó una perplejidad de prueba de 55,8. [ 9 ]

Evolución

Un enfoque alternativo para NAS se basa en algoritmos evolutivos , que han sido empleados por varios grupos. [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ] [ 16 ] Un algoritmo evolutivo para la búsqueda de arquitectura neuronal generalmente realiza el siguiente procedimiento. [ 17 ] Primero se inicializa un conjunto que consiste en diferentes arquitecturas candidatas junto con sus puntuaciones de validación (aptitud). En cada paso, las arquitecturas en el conjunto de candidatas se mutan (por ejemplo: convolución 3x3 en lugar de una convolución 5x5). Luego, las nuevas arquitecturas se entrenan desde cero durante algunas épocas y se obtienen sus puntuaciones de validación. Esto es seguido por reemplazar las arquitecturas con las puntuaciones más bajas en el conjunto de candidatas con las mejores y más nuevas arquitecturas. Este procedimiento se repite varias veces y así el conjunto de candidatas se refina con el tiempo. Las mutaciones en el contexto de la evolución de las ANN son operaciones como agregar o eliminar una capa, que incluyen cambiar el tipo de una capa (por ejemplo, de convolución a pooling), cambiar los hiperparámetros de una capa o cambiar los hiperparámetros de entrenamiento. En CIFAR-10 e ImageNet , la evolución y el RL tuvieron un rendimiento comparable, mientras que ambos superaron ligeramente a la búsqueda aleatoria . [ 13 ] [ 12 ]

Optimización bayesiana

La optimización bayesiana (BO), que ha demostrado ser un método eficiente para la optimización de hiperparámetros, también puede aplicarse a NAS. En este contexto, la función objetivo asigna una arquitectura a su error de validación tras ser entrenada durante varias épocas. En cada iteración, BO utiliza un modelo sustituto para modelar esta función objetivo basándose en las arquitecturas obtenidas previamente y sus errores de validación. A continuación, se elige la siguiente arquitectura a evaluar maximizando una función de adquisición, como la mejora esperada, que proporciona un equilibrio entre exploración y explotación. La maximización de la función de adquisición y la evaluación de la función objetivo suelen ser computacionalmente costosas para NAS, lo que dificulta la aplicación de BO en este contexto. Recientemente, BANANAS [ 18 ] ha logrado resultados prometedores en este sentido mediante la introducción de una instancia de alto rendimiento de BO acoplada a un predictor neuronal.

Subir colinas

Otro grupo utilizó un procedimiento de ascenso de colina que aplica morfismos de red, seguido de breves ejecuciones de optimización de recocido coseno. El enfoque arrojó resultados competitivos, requiriendo recursos del mismo orden de magnitud que el entrenamiento de una sola red. Por ejemplo, en CIFAR-10, el método diseñó y entrenó una red con una tasa de error inferior al 5 % en 12 horas en una sola GPU. [ 19 ]

Si bien la mayoría de los enfoques se centran exclusivamente en encontrar la arquitectura con el máximo rendimiento predictivo, para la mayoría de las aplicaciones prácticas son relevantes otros objetivos, como el consumo de memoria, el tamaño del modelo o el tiempo de inferencia (es decir, el tiempo necesario para obtener una predicción). Por ello, los investigadores crearon una búsqueda multiobjetivo . [ 16 ] [ 20 ]

LEMONADE [ 16 ] es un algoritmo evolutivo que adoptó el lamarckismo para optimizar eficientemente múltiples objetivos. En cada generación, se generan redes hijas para mejorar la frontera de Pareto con respecto a la población actual de redes neuronales artificiales.

Neural Architect [ 20 ] se presenta como un NAS multiobjetivo basado en RL con conciencia de recursos, que incluye incrustación de red y predicción de rendimiento. La incrustación de red codifica una red existente en un vector de incrustación entrenable. A partir de la incrustación, una red controladora genera transformaciones de la red objetivo. Una función de recompensa multiobjetivo considera la precisión de la red, los recursos computacionales y el tiempo de entrenamiento. La recompensa se predice mediante múltiples redes de simulación de rendimiento que se preentrenan o coentrenan con la red controladora. La red controladora se entrena mediante gradiente de política. Tras una modificación, la red candidata resultante se evalúa mediante una red de precisión y una red de tiempo de entrenamiento. Los resultados se combinan mediante un motor de recompensa que devuelve su salida a la red controladora.

Modelos de una sola toma

Los sistemas NAS basados ​​en RL o evolución requieren miles de días de GPU para búsqueda/entrenamiento para lograr resultados de visión artificial de vanguardia, como se describe en los artículos de NASNet, mNASNet y MobileNetV3. [ 4 ] [ 21 ] [ 22 ]

Para reducir el costo computacional, muchos métodos NAS recientes se basan en la idea de compartir pesos. [ 23 ] [ 24 ] En este enfoque, se define una única superred sobreparametrizada (también conocida como modelo de una sola pasada). Una superred es un grafo acíclico dirigido (DAG) muy grande cuyos subgrafos son diferentes redes neuronales candidatas. Así, en una superred, los pesos se comparten entre un gran número de subarquitecturas diferentes que tienen aristas en común, cada una de las cuales se considera una ruta dentro de la superred. La idea esencial es entrenar una superred que abarque muchas opciones para el diseño final en lugar de generar y entrenar miles de redes de forma independiente. Además de los parámetros aprendidos, se aprende un conjunto de parámetros de arquitectura para representar la preferencia por un módulo sobre otro. Estos métodos reducen los recursos computacionales necesarios a solo unos pocos días de GPU.

Trabajos más recientes combinan este paradigma de compartición de pesos con una relajación continua del espacio de búsqueda, [ 25 ] [ 26 ] [ 27 ] [ 28 ] lo que permite el uso de métodos de optimización basados ​​en gradientes. Estos enfoques se conocen generalmente como NAS diferenciables y han demostrado ser muy eficientes en la exploración del espacio de búsqueda de arquitecturas neuronales. Uno de los algoritmos más populares entre los métodos basados ​​en gradientes para NAS es DARTS. [ 27 ] Sin embargo, DARTS enfrenta problemas como el colapso del rendimiento debido a una inevitable agregación de conexiones de salto y una generalización deficiente que fueron abordados por muchos algoritmos posteriores. [ 29 ] [ 30 ] [ 31 ] Métodos como [ 30 ] [ 31 ] tienen como objetivo robustecer DARTS y suavizar el paisaje de precisión de validación mediante la introducción de una regularización basada en la norma hessiana y suavizado aleatorio/ataque adversario , respectivamente. La causa de la degradación del rendimiento se analiza posteriormente desde el aspecto de la selección de la arquitectura . [ 33 ]

Se ha demostrado que la búsqueda de redes neuronales diferenciables (NAS) produce resultados competitivos utilizando una fracción del tiempo de búsqueda requerido por los métodos de búsqueda basados ​​en aprendizaje por refuerzo (RL). Por ejemplo, FBNet (abreviatura de Facebook Berkeley Network) demostró que la búsqueda basada en superredes produce redes que superan la curva de compromiso velocidad-precisión de mNASNet y MobileNetV2 en el conjunto de datos de clasificación de imágenes ImageNet. FBNet logra esto utilizando más de 400 veces menos tiempo de búsqueda que el utilizado para mNASNet. [ 34 ] [ 35 ] [ 36 ] Además, SqueezeNAS demostró que la búsqueda de redes neuronales basada en superredes produce redes neuronales que superan la curva de compromiso velocidad-precisión de MobileNetV3 en el conjunto de datos de segmentación semántica Cityscapes, y SqueezeNAS utiliza más de 100 veces menos tiempo de búsqueda que el utilizado en la búsqueda basada en RL de los autores de MobileNetV3. [ 37 ] [ 38 ]

Puntos de referencia para la búsqueda de arquitectura neuronal

La búsqueda de arquitecturas neuronales suele requerir grandes recursos computacionales debido a sus costosas fases de entrenamiento y evaluación. Esto, a su vez, genera una gran huella de carbono asociada a la evaluación de estos métodos. Para superar esta limitación, se han introducido los benchmarks NAS [ 39 ] [ 40 ] [ 41 ] [ 42 ] , que permiten consultar o predecir el rendimiento final de las arquitecturas neuronales en segundos. Un benchmark NAS se define como un conjunto de datos con una división fija entre entrenamiento y prueba, un espacio de búsqueda y una canalización de entrenamiento fija (hiperparámetros). Existen principalmente dos tipos de benchmarks NAS: un benchmark NAS sustituto y un benchmark NAS tabular. Un benchmark sustituto utiliza un modelo sustituto (por ejemplo, una red neuronal) para predecir el rendimiento de una arquitectura a partir del espacio de búsqueda. Por otro lado, un benchmark tabular consulta el rendimiento real de una arquitectura entrenada hasta la convergencia. Ambos benchmarks son consultables y pueden utilizarse para simular eficientemente muchos algoritmos NAS utilizando únicamente una CPU para consultar el benchmark en lugar de entrenar una arquitectura desde cero.

Véase también

Lecturas adicionales

Artículos de encuesta.

  • Wistuba, Martín; Rawat, Ambrish; Pedapati, Tejaswini (4 de mayo de 2019). "Una encuesta sobre búsqueda de arquitectura neuronal". arXiv : 1905.01392 [ cs.LG ].
  • Elsken, Thomas; Metzen, Jan Hendrik; Hutter, Frank (8 de agosto de 2019). "Búsqueda de arquitectura neuronal: una revisión" . Journal of Machine Learning Research . 20 (55): 1– 21. arXiv : 1808.05377 .
  • Liu, Yuqiao; Sun, Yanan; Xue, Bing; Zhang, Mengjie; Yen, Gary G; Tan, Kay Chen (2021). "Una revisión sobre la búsqueda de arquitectura neuronal evolutiva". IEEE Transactions on Neural Networks and Learning Systems . 34 (2): 1– 21. arXiv : 2008.10937 . doi : 10.1109/TNNLS.2021.3100554 . PMID 34357870. S2CID 221293236 .  
  • White, Colin; Safari, Mahmoud; Sukthanker, Rhea; Ru, Binxin; Elsken, Thomas; Zela, Arber; Dey, Debadeepta; Hutter, Frank (2023-01-25). "Búsqueda de arquitectura neuronal: perspectivas a partir de 1000 artículos". arXiv : 2301.08727 [ cs.LG ].

Referencias

  1. 1 2 Elsken, Thomas; Metzen, Jan Hendrik; Hutter, Frank (8 de agosto de 2019). "Búsqueda de arquitectura neuronal: una revisión" . Journal of Machine Learning Research . 20 (55): 1– 21. arXiv : 1808.05377 .
  2. ^ Wistuba, Martín; Rawat, Ambrish; Pedapati, Tejaswini (4 de mayo de 2019). "Una encuesta sobre búsqueda de arquitectura neuronal". arXiv : 1905.01392 [ cs.LG ].
  3. 1 2 3 Zoph, Barret; Le, Quoc V. (2016-11-04). "Búsqueda de arquitectura neuronal con aprendizaje por refuerzo". arXiv : 1611.01578 [ cs.LG ].
  4. 1 2 3 4 5 Zoph, Barret; Vasudevan, Vijay; Shlens, Jonathon; Le, Quoc V. (2017-07-21). "Learning Transferable Architectures for Scalable Image Recognition". arXiv : 1707.07012 [ cs.CV ].
  5. Matthias Feurer y Frank Hutter. Optimización de hiperparámetros . En: AutoML: Métodos, sistemas, desafíos , páginas 3–38.
  6. Vanschoren, Joaquín (2019). «Meta-aprendizaje» . Aprendizaje automático automatizado . Serie Springer sobre desafíos en el aprendizaje automático. pp. 35–61 . doi : 10.1007/978-3-030-05318-5_2 . ISBN  978-3-030-05317-8. S2CID 239362577 . 
  7. Salehin, Imrus; Islam, Md. Shamiul; Saha, Pritom; Noman, SM; Tuni, Azra; Hasan, Md. Mehedi; Baten, Md. Abu (2024-01-01). "AutoML: Una revisión sistemática sobre el aprendizaje automático automatizado con búsqueda de arquitectura neuronal" . Journal of Information and Intelligence . 2 (1): 52– 81. doi : 10.1016/j.jiixd.2023.10.002 . ISSN 2949-7159 . 
  8. Zoph, Barret; Vasudevan, Vijay; Shlens, Jonathon; Le, Quoc V. (2 de noviembre de 2017). "AutoML para la clasificación de imágenes a gran escala y la detección de objetos" . Blog de investigación . Recuperado el 20 de febrero de 2018 .
  9. Pham, Hieu; Guan, Melody Y.; Zoph, Barret; Le, Quoc V.; Dean, Jeff (2018-02-09). "Búsqueda eficiente de arquitectura neuronal mediante el intercambio de parámetros". arXiv : 1802.03268 [ cs.LG ].
  10. Real, Esteban; Moore, Jerez; Selle, Andrés; Saxena, Saurabh; Suematsu, Yutaka León; Bronceado, Jie; Le, Quoc; Kurakin, Alex (3 de marzo de 2017). "Evolución a gran escala de los clasificadores de imágenes". arXiv : 1703.01041 [ cs.NE ].
  11. Suganuma, Masanori; Shirakawa, Shinichi; Nagao, Tomoharu (2017-04-03). "Un enfoque de programación genética para el diseño de arquitecturas de redes neuronales convolucionales". arXiv : 1704.00764v2 [ cs.NE ].
  12. 1 2 Liu, Hanxiao; Simonyan, Karen; Vinyals, Oriol; Fernando, Chrisantha; Kavukcuoglu, Koray (2017-11-01). "Representaciones jerárquicas para una búsqueda eficiente de arquitectura". arXiv : 1711.00436v2 [ cs.LG ].
  13. 1 2 Real, Esteban; Aggarwal, Alok; Huang, Yanping; Le, Quoc V. (2018-02-05). "Regularized Evolution for Image Classifier Architecture Search". arXiv : 1802.01548 [ cs.NE ].
  14. Mükkulainen, Risto; Liang, Jason; Meyerson, Elliot; Rawal, Aditya; Fink, Dan; Francon, Olivier; Raju, Bala; Shahrzad, Hormoz; Navruzyan, Arshak; Duffy, Nigel; Hodjat, Babak (4 de marzo de 2017). "Evolución de las redes neuronales profundas". arXiv : 1703.00548 [ cs.NE ].
  15. Xie, Lingxi; Yuille, Alan (2017). "Genetic CNN". 2017 IEEE International Conference on Computer Vision (ICCV) . pp. 1388–1397 . arXiv : 1703.01513 . doi : 10.1109/ICCV.2017.154 . ISBN  978-1-5386-1032-9. S2CID 206770867 . 
  16. 1 2 3 Elsken, Thomas; Metzen, Jan Hendrik; Hutter, Frank (2018-04-24). "Búsqueda eficiente de arquitectura neuronal multiobjetivo mediante evolución lamarckiana". arXiv : 1804.09081 [ stat.ML ].
  17. Liu, Yuqiao; Sun, Yanan; Xue, Bing; Zhang, Mengjie; Yen, Gary G; Tan, Kay Chen (2021). "Una revisión sobre la búsqueda de arquitectura neuronal evolutiva". IEEE Transactions on Neural Networks and Learning Systems . 34 (2): 1– 21. arXiv : 2008.10937 . doi : 10.1109/TNNLS.2021.3100554 . PMID 34357870. S2CID 221293236 .  
  18. White, Colin; Neiswanger, Willie; Savani, Yash (2020-11-02). "BANANAS: Optimización bayesiana con arquitecturas neuronales para la búsqueda de arquitecturas neuronales". arXiv : 1910.11858 [ cs.LG ].
  19. Thomas, Elsken; Jan Hendrik, Metzen; Frank, Hutter (2017-11-13). "Simple And Efficient Architecture Search for Convolutional Neural Networks". arXiv : 1711.04528 [ stat.ML ].
  20. 1 2 Zhou, Yanqi; Diamos, Gregory. "Neural Architect: A Multi-objective Neural Architecture Search with Performance Prediction" (PDF) . Baidu. Archivado del original (PDF) el 27 de septiembre de 2019. Recuperado el 27 de septiembre de 2019 .
  21. Tan, Mingxing; Chen, Bo; Pang, Ruoming; Vasudevan, Vijay; Sandler, Mark; Howard, Andrew; Le, Quoc V. (2018). "MnasNet: Búsqueda de arquitectura neuronal con conciencia de plataforma para dispositivos móviles". arXiv : 1807.11626 [ cs.CV ].
  22. ^ Howard, Andrés; Sandler, Marcos; Chu, Gracia; Chen, Liang-Chieh; Chen, Bo; Bronceado, Mingxing; Wang, Weijun; Zhu, Yukun; Pang, Ruoming; Vasudevan, Vijay; Le, Quoc V.; Adán, Hartwig (6 de mayo de 2019). "Buscando MobileNetV3". arXiv : 1905.02244 [ cs.CV ].
  23. Pham, Hieu; Guan, Melody Y.; Zoph, Barret; Le, Quoc V.; Dean, Jeff (2018). "Búsqueda eficiente de arquitectura neuronal mediante el intercambio de parámetros". arXiv : 1802.03268 [ cs.LG ].
  24. Li, Liam; Talwalkar, Ameet (2019). "Búsqueda aleatoria y reproducibilidad para la búsqueda de arquitectura neuronal". arXiv : 1902.07638 [ cs.LG ].
  25. Cai, Han; Zhu, Ligeng; Han, Song (2018). "ProxylessNAS: Búsqueda directa de arquitectura neuronal en la tarea y el hardware objetivo". arXiv : 1812.00332 [ cs.LG ].
  26. Dong, Xuanyi; Yang, Yi (2019). "Búsqueda de una arquitectura neuronal robusta en cuatro horas de GPU". arXiv : 1910.04465 [ cs.CV ].
  27. 1 2 Liu, Hanxiao; Simonyan, Karen; Yang, Yiming (2018). "DARTS: Búsqueda de arquitectura diferenciable". arXiv : 1806.09055 [ cs.LG ].
  28. Xie, Sirui; Zheng, Hehui; Liu, Chunxiao; Lin, Liang (2018). "SNAS: búsqueda de arquitectura neuronal estocástica". arXiv : 1812.09926 [ cs.LG ].
  29. ^ Chu, Xiangxiang; Zhou, Tianbao; Zhang, Bo; Li, Jixiang (2019). "DARTS justos: eliminación de ventajas injustas en la búsqueda de arquitectura diferenciable". arXiv : 1911.12126 [ cs.LG ].
  30. 1 2 Zela, Arber; Elsken, Thomas; Saikia, Tonmoy; Marrakchi, Yassine; Brox, Thomas; Hutter, Frank (2019). "Understanding and Robustifying Differentiable Architecture Search". arXiv : 1909.09656 [ cs.LG ].
  31. 1 2 Chen, Xiangning; Hsieh, Cho-Jui (2020). "Estabilización de la búsqueda de arquitectura diferenciable mediante regularización basada en perturbaciones". arXiv : 2002.05283 [ cs.LG ].
  32. Xu, Yuhui; Xie, Ling Xi; Zhang, Xiaopeng; Chen, Xin; Qi, Guo-Jun; Tian, ​​Qi; Xiong, Hongkai (2019). "PC-DARTS: Conexiones de canales parciales para búsqueda de arquitectura con uso eficiente de la memoria". arXiv : 1907.05737 [ cs.CV ].
  33. ^ Wang, Ruochen; Cheng, Minhao; Chen, Xiangning; Tang, Xiaocheng; Hsieh, Cho-Jui (2021). "Repensar la selección de arquitectura en NAS diferenciables". arXiv : 2108.04392 [ cs.LG ].
  34. ^ Wu, Bichén; Dai, Xiaoliang; Zhang, Peizhao; Wang, Yanghan; Sol, Fei; Wu, Yiming; Tian, ​​Yuandong; Vajda, Peter; Jia, Yangqing; Keutzer, Kurt (24 de mayo de 2019). "FBNet: diseño ConvNet eficiente con reconocimiento de hardware mediante búsqueda de arquitectura neuronal diferenciable". arXiv : 1812.03443 [ cs.CV ].
  35. Sandler, Mark; Howard, Andrew; Zhu, Menglong; Zhmoginov, Andrey; Chen, Liang-Chieh (2018). "MobileNetV2: residuos invertidos y cuellos de botella lineales". arXiv : 1801.04381 ​​[ cs.CV ].
  36. Keutzer, Kurt (22 de mayo de 2019). "Codiseño de DNN y aceleradores de NN" (PDF) . IEEE . Consultado el 26 de septiembre de 2019 .
  37. Shaw, Albert; Hunter, Daniel; Iandola, Forrest; Sidhu, Sammy (2019). "SqueezeNAS: Búsqueda rápida de arquitectura neuronal para una segmentación semántica más rápida". arXiv : 1908.01748 [ cs.CV ].
  38. Yoshida, Junko (25 de agosto de 2019). "¿Tiene tu chip de IA su propia DNN?" . EE Times . Recuperado el 26 de septiembre de 2019 .
  39. Ying, Chris; Klein, Aaron; Real, Esteban; Christiansen, Eric; Murphy, Kevin; Hutter, Frank (2019). "NAS-Bench-101: Hacia una búsqueda reproducible de arquitectura neuronal". arXiv : 1902.09635 [ cs.LG ].
  40. Zela, Arber; Siems, Julien; Hutter, Frank (2020). "NAS-Bench-1Shot1: Evaluación comparativa y análisis de la búsqueda de arquitectura neuronal de una sola muestra". arXiv : 2001.10422 [ cs.LG ].
  41. Dong, Xuanyi; Yang, Yi (2020). "NAS-Bench-201: Ampliando el alcance de la búsqueda reproducible de arquitectura neuronal". arXiv : 2001.00326 [ cs.CV ].
  42. Zela, Arber; Siems, Julien; Zimmer, Lucas; Lukasik, Jovita; Keuper, Margret; Hutter, Frank (2020). "Surrogate NAS Benchmarks: Going Beyond the Limited Search Spaces of Tabular NAS Benchmarks". arXiv : 2008.09777 [ cs.LG ].
Obtenido de " https://en.wikipedia.org/w/index.php?title=Neural_architecture_search&oldid=1352658376#Reinforcement_learning "