Articulo de referencia

Promediado de conjuntos (aprendizaje automático)

En el aprendizaje automático , el promedio de conjuntos consiste en crear múltiples modelos (normalmente redes neuronales artificiales ) y combinarlos para obtener el resultado ...

En el aprendizaje automático , el promedio de conjuntos consiste en crear múltiples modelos (normalmente redes neuronales artificiales ) y combinarlos para obtener el resultado deseado, en lugar de crear un único modelo. Los conjuntos de modelos suelen superar a los modelos individuales, ya que los distintos errores de los componentes del conjunto se compensan entre sí.

Descripción general

El promedio de conjuntos es uno de los tipos más simples de máquinas de comité . Junto con el boosting , es uno de los dos tipos principales de máquinas de comité estáticas. [ 1 ] A diferencia del diseño estándar de redes neuronales, en el que se generan muchas redes pero solo se conserva una, el promedio de conjuntos conserva las redes menos satisfactorias, pero con menor peso asignado a sus salidas. [ 2 ] La teoría del promedio de conjuntos se basa en dos propiedades de las redes neuronales artificiales: [ 3 ]

  1. En cualquier red, el sesgo puede reducirse a costa de un aumento de la varianza.
  2. En un grupo de redes, la varianza se puede reducir sin que ello afecte al sesgo.

Esto se conoce como la compensación entre sesgo y varianza . El promedio de conjuntos crea un grupo de redes, cada una con bajo sesgo y alta varianza, y las combina para formar una nueva red que, en teoría, debería presentar bajo sesgo y baja varianza. Por lo tanto, esto puede considerarse una solución a la compensación entre sesgo y varianza. [ 4 ] La idea de combinar expertos se remonta a Pierre-Simon Laplace . [ 5 ]

Método

La teoría mencionada anteriormente ofrece una estrategia obvia: crear un conjunto de expertos con bajo sesgo y alta varianza, y promediarlos. En general, esto significa crear un conjunto de expertos con parámetros variables; frecuentemente, estos son los pesos sinápticos iniciales de una red neuronal, aunque también se pueden variar otros factores (como la tasa de aprendizaje, el momento, etc.). Algunos autores desaconsejan la variación de la disminución de peso y la detención temprana . [ 3 ] Por lo tanto, los pasos son:

  1. Generar N expertos, cada uno con sus propios parámetros iniciales (estos valores generalmente se obtienen mediante muestreo aleatorio de una distribución).
  2. Capacita a cada experto por separado.
  3. Combina las opiniones de los expertos y calcula el promedio de sus valores.

Alternativamente, el conocimiento del dominio puede utilizarse para generar varias clases de expertos. Se entrena a un experto de cada clase y luego se combinan.

Una versión más compleja del promedio de conjunto considera el resultado final no como un simple promedio de todos los expertos, sino como una suma ponderada. Si cada experto esyi{\displaystyle y_{i}}, entonces el resultado generaly~{\displaystyle {\tilde {y}}}se puede definir como:

y~(incógnita;α)=j=1pagαjyj(incógnita){\displaystyle {\tilde {y}}(\mathbf {x} ;\mathbf {\alpha } )=\sum _{j=1}^{p}\alpha _{j}y_{j}(\mathbf {x} )}

dóndeα{\displaystyle \mathbf {\alpha } }es un conjunto de pesos. El problema de optimización de encontrar alfa se resuelve fácilmente mediante redes neuronales; por lo tanto, se puede entrenar una "metarred" donde cada "neurona" es, de hecho, una red neuronal completa, y los pesos sinápticos de la red final son el peso aplicado a cada experto. Esto se conoce como una combinación lineal de expertos . [ 2 ]

Se puede observar que la mayoría de las formas de redes neuronales son algún subconjunto de una combinación lineal: la red neuronal estándar (donde solo se utiliza un experto) es simplemente una combinación lineal con todosαj=0{\displaystyle \alpha _{j}=0}y unoαk=1{\displaystyle \alpha _{k}=1}. Un promedio bruto es donde todosαj{\displaystyle \alpha _{j}}son iguales a algún valor constante, a saber, uno dividido entre el número total de expertos. [ 2 ]

Un método de promedio de conjuntos más reciente es el aprendizaje de correlación negativa, [ 6 ] propuesto por Y. Liu y X. Yao. Este método se ha utilizado ampliamente en computación evolutiva .

Beneficios

  • El comité resultante es casi siempre menos complejo que una sola red que lograría el mismo nivel de rendimiento [ 7 ].
  • El comité resultante puede entrenarse más fácilmente con conjuntos de datos más pequeños [ 1 ].
  • El comité resultante a menudo tiene un rendimiento mejorado en comparación con cualquier modelo individual [ 2 ].
  • El riesgo de sobreajuste disminuye, ya que hay menos parámetros (por ejemplo, pesos de la red neuronal) que deben configurarse. [ 1 ]

Véase también

Referencias

  1. 1 2 3 Haykin, Simon. Redes neuronales: una base integral. 2.ª ed. Upper Saddle River, NJ: Prentice Hall, 1999.
  2. 1 2 3 4 Hashem, S. "Combinaciones lineales óptimas de redes neuronales." Redes neuronales 10, n.º 4 (1997): 599 614.
  3. 1 2 Naftaly, U., N. Intrator y D. Horn. "Promediación óptima de conjuntos de redes neuronales". Network: Computation in Neural Systems 8, n.º 3 (1997): 283 296.
  4. Geman, S., E. Bienenstock y R. Doursat. "Redes neuronales y el dilema sesgo/varianza". Neural computation 4, n.º 1 (1992): 1 58.
  5. Clemen, RT "Combinación de pronósticos: una revisión y bibliografía anotada." International Journal of Forecasting 5, no. 4 (1989): 559 583.
  6. Y. Liu y X. Yao, Aprendizaje de conjuntos mediante redes neuronales de correlación negativa, Volumen 12, Número 10, diciembre de 1999, págs. 1399-1404. doi : 10.1016/S0893-6080(99)00073-8
  7. Pearlmutter, BA y R. Rosenfeld. «Complejidad y generalización de Chaitin - Kolmogorov en redes neuronales». En Actas de la conferencia de 1990 sobre avances en sistemas de procesamiento de información neuronal, 3, 931. Morgan Kaufmann Publishers Inc., 1990.

Lecturas adicionales

  • Perrone, MP (1993), Mejora de la estimación de regresión: métodos de promediado para la reducción de la varianza con extensiones a la optimización general de medidas convexas.
  • Wolpert, DH (1992), "Generalización apilada", Redes neuronales , 5 (2): 241– 259, CiteSeerX 10.1.1.133.8090 , doi : 10.1016/S0893-6080(05)80023-1 
  • Hashem, S. (1997), "Combinaciones lineales óptimas de redes neuronales", Neural Networks , 10 (4): 599– 614, doi : 10.1016/S0893-6080(96)00098-6 , PMID 12662858 
  • Hashem, S. y B. Schmeiser ( 1993), "Aproximación de una función y sus derivadas mediante combinaciones lineales óptimas de MSE de redes neuronales de alimentación directa entrenadas", Actas de la Conferencia Conjunta sobre Redes Neuronales , 87 : 617–620