Articulo de referencia

Escalado de características

El escalado de características es un método utilizado para normalizar el rango de variables independientes o características de los datos. En el procesamiento de datos , también...

El escalado de características es un método utilizado para normalizar el rango de variables independientes o características de los datos. En el procesamiento de datos , también se conoce como normalización de datos y generalmente se realiza durante la etapa de preprocesamiento de datos .

Motivación

Dado que el rango de valores de los datos brutos varía considerablemente, en algunos algoritmos de aprendizaje automático , las funciones objetivo no funcionan correctamente sin normalización . Por ejemplo, muchos clasificadores calculan la distancia entre dos puntos mediante la distancia euclidiana . Si una de las características presenta un amplio rango de valores, la distancia estará determinada por dicha característica. Por lo tanto, es necesario normalizar el rango de todas las características para que cada una contribuya de forma aproximadamente proporcional a la distancia final.

Otra razón por la que se aplica el escalado de características es que el descenso de gradiente converge mucho más rápido con el escalado de características que sin él. [ 1 ]

También es importante aplicar el escalado de características si se utiliza la regularización como parte de la función de pérdida (para que los coeficientes se penalicen adecuadamente).

Empíricamente, el escalado de características puede mejorar la velocidad de convergencia del descenso de gradiente estocástico . En las máquinas de vectores de soporte, [ 2 ] puede reducir el tiempo necesario para encontrar los vectores de soporte. El escalado de características también se utiliza con frecuencia en aplicaciones que implican distancias y similitudes entre puntos de datos, como la agrupación y la búsqueda de similitudes. Por ejemplo, el algoritmo de agrupamiento K-means es sensible a las escalas de características.

Métodos

Reescalado (normalización min-max)

También conocido como escalado min-max o normalización min-max, el reescalado es el método más simple y consiste en reescalar el rango de características para escalar el rango en [0, 1] o [−1, 1]. La selección del rango objetivo depende de la naturaleza de los datos. La fórmula general para un min-max de [0, 1] se da como: [ 3 ]

incógnita=incógnitamin(incógnita)máximo(incógnita)min(incógnita){\displaystyle x'={\frac {x-{\text{min}}(x)}{{\text{max}}(x)-{\text{min}}(x)}}}

dóndeincógnita{\displaystyle x}es un valor original,incógnita{\displaystyle x'}es el valor normalizado. Por ejemplo, supongamos que tenemos los datos de peso de los estudiantes, y que sus pesos oscilan entre [160 libras, 200 libras]. Para reescalar estos datos, primero restamos 160 al peso de cada estudiante y dividimos el resultado entre 40 (la diferencia entre el peso máximo y el mínimo).

Para reescalar un rango entre un conjunto arbitrario de valores [a, b], la fórmula se convierte en:

incógnita=a+(incógnitamin(incógnita))(ba)máximo(incógnita)min(incógnita){\displaystyle x'=a+{\frac {(x-{\text{min}}(x))(ba)}{{\text{max}}(x)-{\text{min}}(x)}}}

dóndea,b{\displaystyle a,b}son los valores mínimo y máximo.

Normalización de la media

incógnita=incógnitaincógnita¯máximo(incógnita)min(incógnita){\displaystyle x'={\frac {x-{\bar {x}}}{{\text{máx}}(x)-{\text{mín}}(x)}}}

dóndeincógnita{\displaystyle x}es un valor original,incógnita{\displaystyle x'}es el valor normalizado,incógnita¯=promedio(incógnita){\displaystyle {\bar {x}}={\text{promedio}}(x)}es la media de ese vector de características. Existe otra forma de normalización de la media que divide por la desviación estándar, que también se denomina estandarización.

Estandarización (normalización de la puntuación Z)

El efecto de la normalización de la puntuación z en la agrupación k-means. Se generan 4 grupos gaussianos de puntos, luego se comprimen a lo largo del eje y , y unk=4{\displaystyle k=4}Se realizó el agrupamiento. Sin normalización, los grupos se alinearon a lo largo del eje x , ya que es el eje con mayor variación. Tras la normalización, los grupos se recuperaron como se esperaba.

En el aprendizaje automático, podemos manejar varios tipos de datos, por ejemplo, señales de audio y valores de píxeles para datos de imágenes, y estos datos pueden incluir múltiples dimensiones . La estandarización de características hace que los valores de cada característica en los datos tengan una media cero (cuando se resta la media en el numerador) y una varianza unitaria. Este método se usa ampliamente para la normalización en muchos algoritmos de aprendizaje automático (por ejemplo, máquinas de vectores de soporte , regresión logística y redes neuronales artificiales ). [ 4 ] [ 5 ] El método general de cálculo es determinar la media de distribución y la desviación estándar para cada característica. Luego restamos la media a cada característica. Luego dividimos los valores (la media ya está restada) de cada característica por su desviación estándar.

incógnita=incógnitaincógnita¯σ{\displaystyle x'={\frac {x-{\bar {x}}}{\sigma }}}

Dóndeincógnita{\displaystyle x}es el vector de características original,incógnita¯=promedio(incógnita){\displaystyle {\bar {x}}={\text{promedio}}(x)}es la media de ese vector de características, yσ{\displaystyle \sigma }es su desviación estándar.

Escalabilidad robusta

El escalado robusto , también conocido como estandarización mediante la mediana y el rango intercuartil (RIC), está diseñado para ser robusto ante valores atípicos . Escala las características utilizando la mediana y el RIC como puntos de referencia en lugar de la media y la desviación estándar:incógnita=incógnitaQ2(incógnita)Q3(incógnita)Q1(incógnita){\displaystyle x'={\frac {x-Q_{2}(x)}{Q_{3}(x)-Q_{1}(x)}}}dóndeQ1(incógnita),Q2(incógnita),Q3(incógnita){\displaystyle Q_{1}(x),Q_{2}(x),Q_{3}(x)}son los tres cuartiles (percentil 25, 50 y 75) de la característica.

Normalización del vector unitario

La normalización del vector unitario considera cada punto de datos individual como un vector y divide cada uno por su norma vectorial para obtenerincógnita=incógnita/incógnita{\displaystyle x'=x/\|x\|}Se puede utilizar cualquier norma vectorial, pero las más comunes son la norma L1 y la norma L2 .

Por ejemplo, siincógnita=(v1,v2,v3){\ Displaystyle x = (v_ {1}, v_ {2}, v_ {3})}, entonces su versión normalizada Lp es:(v1(|v1|pag+|v2|pag+|v3|pag)1/pag,v2(|v1|pag+|v2|pag+|v3|pag)1/pag,v3(|v1|pag+|v2|pag+|v3|pag)1/pag){\displaystyle \left({\frac {v_{1}}{(|v_{1}|^{p}+|v_{2}|^{p}+|v_{3}|^{p})^{1/p}}},{\frac {v_{2}}{(|v_{1}|^{p}+|v_{2}|^{p}+|v_{3}|^{p})^{1/p}}},{\frac {v_{3}}{(|v_{1}|^{p}+|v_{2}|^{p}+|v_{3}|^{p})^{1/p}}}\right)}

Véase también

Referencias

  1. Ioffe, Sergey; Christian Szegedy (2015). "Normalización por lotes: acelerando el entrenamiento de redes neuronales profundas mediante la reducción del desplazamiento de covariables internas". arXiv : 1502.03167 [ cs.LG ].
  2. Juszczak, P.; DMJ Tax; RPW Dui (2002). "Escalado de características en descripciones de datos de vectores de soporte". Actas de la 8.ª Conferencia Anual de la Escuela Avanzada de Imágenes Computacionales : 25–30 . CiteSeerX 10.1.1.100.2524 . 
  3. "Normalización Mín-Máx" . ml-concepts.com . Archivado del original el 5 de abril de 2023. Consultado el 14 de diciembre de 2022 .
  4. Grus, Joel (2015). Ciencia de datos desde cero . Sebastopol, CA: O'Reilly. pp. 99, 100. ISBN  978-1-491-90142-7.
  5. Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome H. (2009). Los elementos del aprendizaje estadístico: minería de datos, inferencia y predicción . Springer. ISBN 978-0-387-84884-6.

Lecturas adicionales

  • Han, Jiawei; Kamber, Micheline; Pei, Jian (2011). «Transformación y discretización de datos» . Minería de datos: conceptos y técnicas . Elsevier. pp. 111–118 . ISBN  9780123814807.
  • Conferencia de Andrew Ng sobre escalado de características. Archivada el 14 de marzo de 2017 en Wayback Machine.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Feature_scaling&oldid=1304314661 "