Articulo de referencia

Aprendizaje de la cuantización vectorial

En informática , la cuantización vectorial de aprendizaje ( LVQ ) es un algoritmo de clasificación supervisada basado en prototipos . LVQ es la contraparte supervisada de los si...

En informática , la cuantización vectorial de aprendizaje ( LVQ ) es un algoritmo de clasificación supervisada basado en prototipos . LVQ es la contraparte supervisada de los sistemas de cuantización vectorial . LVQ puede entenderse como un caso especial de una red neuronal artificial ; más precisamente, aplica un enfoque de aprendizaje hebbiano de tipo "el ganador se lo lleva todo" . Es un precursor de los mapas autoorganizados (SOM) y está relacionado con el gas neuronal y el algoritmo de k vecinos más cercanos (k-NN). LVQ fue inventado por Teuvo Kohonen . [ 1 ]

Definición

Un sistema LVQ está representado por prototipos.W=(w(i),...,w(norte)){\displaystyle W=(w(i),...,w(n))}que se definen en el espacio de características de los datos observados. En los algoritmos de entrenamiento de selección del ganador, se determina, para cada punto de datos, el prototipo más cercano a la entrada según una medida de distancia dada. La posición de este prototipo ganador se ajusta: se acerca si clasifica correctamente el punto de datos o se aleja si lo clasifica incorrectamente.

Una ventaja de LVQ es que crea prototipos fáciles de interpretar para expertos en el dominio de aplicación correspondiente. [ 2 ] Los sistemas LVQ se pueden aplicar a problemas de clasificación multiclase de forma natural.

Un aspecto clave en LVQ es la elección de una medida de distancia o similitud apropiada para el entrenamiento y la clasificación. Recientemente, se han desarrollado técnicas que adaptan una medida de distancia parametrizada durante el entrenamiento del sistema; véase, por ejemplo, (Schneider, Biehl y Hammer, 2009) [ 3 ] y las referencias allí citadas.

LVQ puede ser una valiosa herramienta para clasificar documentos de texto.

Algoritmo

Los algoritmos se presentan como en [ 4 ] .

Configuración:

  • Sea que los datos se denoten porincógnitaiRD{\displaystyle x_{i}\in \mathbb {R} ^{D}}y sus etiquetas correspondientes poryi{1,2,,do}{\displaystyle y_{i}\in \{1,2,\dots ,C\}}.
  • El conjunto de datos completo es{(incógnitai,yi)}i=1norte{\displaystyle \{(x_{i},y_{i})\}_{i=1}^{N}}.
  • El conjunto de vectores de código eswjRD{\displaystyle w_{j}\in \mathbb {R} ^{D}}.
  • La tasa de aprendizaje en el paso de iteraciónt{\displaystyle t}se denota porαt{\displaystyle \alpha _{t}}.
  • Los hiperparámetrosw{\displaystyle w}yϵ{\displaystyle \epsilon }son utilizados por LVQ2 y LVQ3. El artículo original sugiereϵ[0.1,0,5]{\displaystyle \epsilon \en [0.1,0.5]}yw[0,2,0,3]{\displaystyle w\en [0.2,0.3]}.

LVQ1

Inicialice varios vectores de código por etiqueta. Repita hasta que se alcancen los criterios de convergencia.

  1. Muestra de un datoincógnitai{\displaystyle x_{i}}y averiguar el vector de códigowj{\displaystyle w_{j}}, de tal manera queincógnitai{\displaystyle x_{i}}cae dentro de la celda de Voronoi dewj{\displaystyle w_{j}}.
  2. Si su etiquetayi{\displaystyle y_{i}}es lo mismo que el dewj{\displaystyle w_{j}}, entonceswjwj+αt(incógnitaiwj){\displaystyle w_{j}\leftarrow w_{j}+\alpha _{t}(x_{i}-w_{j})}, de lo contrario,wjwjαt(incógnitaiwj){\displaystyle w_{j}\leftarrow w_{j}-\alpha _{t}(x_{i}-w_{j})}.

LVQ2

LVQ2 es igual que LVQ3, pero sin esta frase: "Siwj{\displaystyle w_{j}}ywk{\displaystyle w_{k}}yincógnitai{\displaystyle x_{i}}tienen la misma clase, entonceswjwjαt(incógnitaiwj){\displaystyle w_{j}\leftarrow w_{j}-\alpha _{t}(x_{i}-w_{j})}ywkwk+αt(incógnitaiwk){\displaystyle w_{k}\leftarrow w_{k}+\alpha _{t}(x_{i}-w_{k})}.". Siwj{\displaystyle w_{j}}ywk{\displaystyle w_{k}}yincógnitai{\displaystyle x_{i}}tienen la misma clase, entonces no pasa nada.

LVQ3

Algunos círculos apolíneos. Cada círculo azul interseca a cada círculo rojo en ángulo recto. Cada círculo rojo pasa por los puntos C y D , y cada círculo azul separa dichos puntos.

Inicialice varios vectores de código por etiqueta. Repita hasta que se alcancen los criterios de convergencia.

  1. Muestra de un datoincógnitai{\displaystyle x_{i}}y encontrar dos vectores de códigowj,wk{\displaystyle w_{j},w_{k}}más cercano a ello.
  2. Dejardj:=incógnitaiwj,dk:=incógnitaiwk{\displaystyle d_{j}:=\|x_{i}-w_{j}\|,d_{k}:=\|x_{i}-w_{k}\|}.
  3. Simin(djdk,dkdj)>s{\displaystyle \min \left({\frac {d_{j}}{d_{k}}},{\frac {d_{k}}{d_{j}}}\right)>s}, dóndes=1w1+w{\displaystyle s={\frac {1-w}{1+w}}}, entonces
    • Siwj{\displaystyle w_{j}}yincógnitai{\displaystyle x_{i}}tienen la misma clase ywk{\displaystyle w_{k}}yincógnitai{\displaystyle x_{i}}tener diferentes clases, entonceswjwj+αt(incógnitaiwj){\displaystyle w_{j}\leftarrow w_{j}+\alpha _{t}(x_{i}-w_{j})}ywkwkαt(incógnitaiwk){\displaystyle w_{k}\leftarrow w_{k}-\alpha _{t}(x_{i}-w_{k})}.
    • Siwk{\displaystyle w_{k}}yincógnitai{\displaystyle x_{i}}tienen la misma clase ywj{\displaystyle w_{j}}yincógnitai{\displaystyle x_{i}}tener diferentes clases, entonceswjwjαt(incógnitaiwj){\displaystyle w_{j}\leftarrow w_{j}-\alpha _{t}(x_{i}-w_{j})}ywkwk+αt(incógnitaiwk){\displaystyle w_{k}\leftarrow w_{k}+\alpha _{t}(x_{i}-w_{k})}.
    • Siwj{\displaystyle w_{j}}ywk{\displaystyle w_{k}}yincógnitai{\displaystyle x_{i}}tienen la misma clase, entonceswjwjϵαt(incógnitaiwj){\displaystyle w_{j}\leftarrow w_{j}-\epsilon \alpha _{t}(x_{i}-w_{j})}ywkwk+ϵαt(incógnitaiwk){\displaystyle w_{k}\leftarrow w_{k}+\epsilon \alpha _{t}(x_{i}-w_{k})}.
    • Siwk{\displaystyle w_{k}}yincógnitai{\displaystyle x_{i}}tienen diferentes clases ywj{\displaystyle w_{j}}yincógnitai{\displaystyle x_{i}}Si hay clases diferentes, entonces el artículo original simplemente no explica qué sucede en este caso, pero presumiblemente no sucede nada en este caso.
  4. De lo contrario, omítalo.

Tenga en cuenta que la condiciónmin(djdk,dkdj)>s{\displaystyle \min \left({\frac {d_{j}}{d_{k}}},{\frac {d_{k}}{d_{j}}}\right)>s}, dóndes=1w1+w{\displaystyle s={\frac {1-w}{1+w}}}, precisamente significa que el puntoincógnitai{\displaystyle x_{i}}cae entre dos esferas apolíneas .

Referencias

  1. T. Kohonen. Mapas autoorganizados. Springer, Berlín, 1997.
  2. T. Kohonen (1995), "Aprendizaje de la cuantización vectorial", en MA Arbib (ed.), The Handbook of Brain Theory and Neural Networks , Cambridge, MA: MIT Press, pp . 537–540 
  3. P. Schneider; B. Hammer; M. Biehl (2009). "Matrices de relevancia adaptativas en el aprendizaje de la cuantización vectorial". Neural Computation . 21 (10): 3532– 3561. CiteSeerX 10.1.1.216.1183 . doi : 10.1162/neco.2009.10-08-892 . PMID 19635012 . S2CID 17306078 .   
  4. ^ Kohonen, Teuvo (2001), "Aprendizaje de la cuantización de vectores" , Mapas autoorganizados , vol. 30, Berlín, Heidelberg: Springer Berlin Heidelberg, págs. 245–261 , doi : 10.1007/978-3-642-56927-2_6 , ISBN   978-3-540-67921-9

Lecturas adicionales

  • Somervuo, Panu; Kohonen, Teuvo (1999). "Mapas autoorganizados y cuantización vectorial de aprendizaje para secuencias de características". Neural Processing Letters . 10 (2): 151– 159. doi : 10.1023/A:1018741720065 .
  • Nova, David; Estévez, Pablo A. (2014-09-01). "Una revisión de los clasificadores de cuantización vectorial de aprendizaje" . Neural Computing and Applications . 25 (3): 511– 524. arXiv : 1509.07093 . doi : 10.1007/s00521-013-1535-3 . ISSN 1433-3058 . 
  • Lanzamiento oficial de lvq_pak (1996) por Kohonen y su equipo