Articulo de referencia

clasificador de margen

En el aprendizaje automático (ML), un clasificador de margen es un tipo de modelo de clasificación capaz de proporcionar una distancia asociada al límite de decisión para cada m...

En el aprendizaje automático (ML), un clasificador de margen es un tipo de modelo de clasificación capaz de proporcionar una distancia asociada al límite de decisión para cada muestra de datos. Por ejemplo, si se utiliza un clasificador lineal , la distancia (normalmente euclidiana , aunque se pueden usar otras) de una muestra al hiperplano separador es el margen de esa muestra.

El concepto de márgenes es importante en varios algoritmos de clasificación de aprendizaje automático, ya que permite acotar el error de generalización de estos clasificadores. Estos límites se suelen representar mediante la dimensión VC . El límite del error de generalización en los algoritmos de boosting y las máquinas de vectores de soporte es especialmente relevante.

Margen para algoritmos de impulso

El margen para un algoritmo de boosting iterativo dado un conjunto de datos con dos clases se puede definir de la siguiente manera: al clasificador se le da un par de muestras.(incógnita,y){\displaystyle (x,y)}, dóndeincógnitaincógnita{\displaystyle x\in X}es un espacio de dominio yyY={1,+1}{\displaystyle y\in Y=\{-1,+1\}}es la etiqueta de la muestra. El algoritmo luego selecciona un clasificador.hjdo{\displaystyle h_{j}\in C}en cada iteraciónj{\displaystyle j}dóndedo{\displaystyle C}es un espacio de posibles clasificadores que predicen valores reales. Esta hipótesis se pondera entonces porαjR{\displaystyle \alpha _{j}\in R}según lo seleccionado por el algoritmo de boosting. En la iteraciónt{\displaystyle t}, el margen de una muestraincógnita{\displaystyle x}por lo tanto, puede definirse como

yjtαjhj(incógnita)|αj|.{\displaystyle {\frac {y\sum _{j}^{t}\alpha _{j}h_{j}(x)}{\sum |\alpha _{j}|}}.}

Según esta definición, el margen es positivo si la muestra está etiquetada correctamente, o negativo si la muestra está etiquetada incorrectamente.

Esta definición puede modificarse y no es la única forma de definir el margen para los algoritmos de boosting. Sin embargo, existen razones por las que esta definición puede resultar atractiva. [ 1 ]

Ejemplos de algoritmos basados ​​en márgenes

Muchos clasificadores pueden proporcionar un margen asociado para cada muestra. Sin embargo, solo algunos clasificadores utilizan la información del margen al aprender de un conjunto de datos.

Muchos algoritmos de boosting se basan en el concepto de margen para asignar ponderaciones a las muestras. Si se utiliza una función de pérdida convexa (como en AdaBoost o LogitBoost , por ejemplo), una muestra con un margen mayor recibirá una ponderación menor (o igual) que una muestra con un margen menor. Esto lleva al algoritmo de boosting a concentrar la ponderación en las muestras con márgenes bajos. En los algoritmos no convexos (por ejemplo, BrownBoost ), el margen sigue determinando la ponderación de una muestra, aunque esta ponderación no es monótona con respecto al margen.

Límites de error de generalización

Una motivación teórica detrás de los clasificadores de margen es que su error de generalización puede estar limitado por los parámetros del algoritmo y un término de margen. Un ejemplo de tal límite es el algoritmo AdaBoost. [ 1 ] SeaS{\displaystyle S}ser un conjunto demetro{\displaystyle m}puntos de datos, muestreados independientemente al azar de una distribuciónD{\displaystyle D}. Supongamos que la dimensión VC del clasificador base subyacente esd{\displaystyle d}ymetrod1{\displaystyle m\geq d\geq 1}. Entonces, con probabilidad1δ{\displaystyle 1-\delta }, tenemos el límite:

PAGD(yjtαjhj(incógnita)|αj|0)PAGS(yjtαjhj(incógnita)|αj|θ)+O(1metrodregistro2(metro/d)/θ2+registro(1/δ)){\displaystyle P_{D}\left({\frac {y\sum _{j}^{t}\alpha _{j}h_{j}(x)}{\sum |\alpha _{j}|}}\leq 0\right)\leq P_{S}\left({\frac {y\sum _{j}^{t}\alpha _{j}h_{j}(x)}{\sum |\alpha _{j}|}}\leq \theta \right)+O\left({\frac {1}{\sqrt {m}}}{\sqrt {d\log ^{2}(m/d)/\theta ^{2}+\log(1/\delta )}}\right)}

a pesar deθ>0{\displaystyle \theta >0}.

Referencias

  1. 1 2 Robert E. Schapire, Yoav Freund, Peter Bartlett y Wee Sun Lee.(1998) " Aumentando el margen: Una nueva explicación de la efectividad de los métodos de votación ", The Annals of Statistics , 26(5):1651–1686