Articulo de referencia

Normalización de cuantiles

En estadística, la normalización por cuantiles es una técnica para lograr que dos distribuciones tengan propiedades estadísticas idénticas. Para normalizar una distribución de p...

En estadística, la normalización por cuantiles es una técnica para lograr que dos distribuciones tengan propiedades estadísticas idénticas. Para normalizar una distribución de prueba con respecto a una distribución de referencia de la misma longitud, se ordenan ambas distribuciones. El valor más alto de la distribución de prueba toma el valor del valor más alto de la distribución de referencia, luego el siguiente valor más alto, y así sucesivamente, hasta que la distribución de prueba sea una perturbación de la distribución de referencia.

Para normalizar por cuantiles dos o más distribuciones entre sí, sin una distribución de referencia, ordénelas como antes y luego establezca el valor promedio (generalmente, la media aritmética ) de las distribuciones. De esta manera, el valor más alto en todos los casos se convierte en la media de los valores más altos, el segundo valor más alto se convierte en la media de los segundos valores más altos, y así sucesivamente.

Generalmente, una distribución de referencia será una de las distribuciones estadísticas estándar, como la distribución gaussiana o la distribución de Poisson . Esta distribución puede generarse aleatoriamente o mediante el muestreo periódico de la función de distribución acumulativa . Sin embargo, se puede utilizar cualquier distribución de referencia.

La normalización de cuantiles se utiliza frecuentemente en el análisis de datos de microarrays . Se introdujo como estandarización de cuantiles [ 1 ] y luego se renombró como normalización de cuantiles [ 2 ] .

Ejemplo

Un ejemplo rápido de dicha normalización en un conjunto de datos muy pequeño, organizado en columnas (1-3) y filas (AD):

A:B:do:D:1_2_3_543214346428{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5&4&3\\2&1&4\\3&4&6\\4&2&8\end{matrix}}}

Para cada columna, clasifique las entradas de menor a mayor (i a iv):

A:B:do:D:1_2_3_5432143464281_2_3_iviiiiiiiiiiiiiiiiiiiiiiv{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5&4&3\\2&1&4\\3&4&6\\4&2&8\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]{\rm {iv}}&{\rm {iii}}&{\rm {i}}\\{\rm {i}}&{\rm {i}}&{\rm {ii}}\\{\rm {ii}}&{\rm {iii}}&{\rm {iii}}\\{\rm {iii}}&{\rm {ii}}&{\rm {iv}}\end{matrix}}}

Guarda estos valores de clasificación para usarlos más adelante. Vuelve al primer conjunto de datos. Reorganiza los valores de cada columna de manera que cada columna esté ordenada de menor a mayor. El resultado es:

A:B:do:D:1_2_3_5432143464281_2_3_213324446548{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5&4&3\\2&1&4\\3&4&6\\4&2&8\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]2&1&3\\3&2&4\\4&4&6\\5&4&8\end{matrix}}}

Ahora, calcula la media de cada fila y ordénalas de menor a mayor (de i a iv):

(2+1+3)/3=2.00 (rango i)(3+2+4)/3=3.00 (rango ii)(4+4+6)/3=4,67 (rango iii)(5+4+8)/3=5,67 (rango iv){\displaystyle {\begin{aligned}(2+1+3)/3&=2.00{\text{ (rango i)}}\\(3+2+4)/3&=3.00{\text{ (rango ii)}}\\(4+4+6)/3&=4.67{\text{ (rango iii)}}\\(5+4+8)/3&=5.67{\text{ (rango iv)}}\end{aligned}}}

Ahora tome el orden de clasificación anterior y sustituya las medias según sus rangos correspondientes:

A:B:do:D:1_2_3_iviiiiiiiiiiiiiiiiiiiiiiv1_2_3_5,674,672.002.002.003.003.004,674,674,673.005,67{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]{\rm {iv}}&{\rm {iii}}&{\rm {i}}\\{\rm {i}}&{\rm {i}}&{\rm {ii}}\\{\rm {ii}}&{\rm {iii}}&{\rm {iii}}\\{\rm {iii}}&{\rm {ii}}&{\rm {iv}}\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5.67&4.67&2.00\\2.00&2.00&3.00\\3.00&4.67&4.67\\4.67&3.00&5.67\end{matrix}}}

Estos son los nuevos valores normalizados.

Sin embargo, tenga en cuenta que cuando, como en la columna dos, los valores tienen el mismo rango, se les debe asignar la media de los valores que corresponderían a los rangos que normalmente representarían si fueran diferentes. En el caso de la columna 2, representan los rangos iii y iv. Por lo tanto, asignamos a las dos entradas empatadas en el rango iii el promedio de los rangos iii y iv ((4,67 + 5,67)/2 = 5,17). Así, obtenemos el siguiente conjunto de valores normalizados:

A:B:do:D:1_2_3_5,674,672.002.002.003.003.004,674,674,673.005,671_2_3_5,675.172.002.002.003.003.005.174,674,673.005,67{\displaystyle {\begin{matrix}&{}\\[6pt]&A:\\&B:\\&C:\\&D:\end{matrix}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5.67&{\mathbf {4.67}}&2.00\\2.00&2.00&3.00\\3.00&{\mathbf {4.67}}&4.67\\4.67&3.00&5.67\end{matrix}}\quad \longrightarrow \quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]5.67&{\mathbf {5.17}}&2.00\\2.00&2.00&3.00\\3.00&{\mathbf {5.17}}&4.67\\4.67&3.00&5.67\end{matrix}}}

Los nuevos valores tienen la misma distribución y ahora se pueden comparar fácilmente. A continuación se muestran las estadísticas descriptivas de cada una de las tres columnas:

Min:Primer trimestre:Mediana:Significar:3er trimestre:Máximo:1_2_3_2.002.002.002,752,752,753.834.083.833.833.833.834.925.174.925,675.175,67{\displaystyle {\begin{array}{r}&{}\\[6pt]&{\text{Min}}:\\&{\text{1st Qrt}}:\\&{\text{Median}}:\\&{\text{Mean}}:\\&{\text{3rd Qrt}}:\\&{\text{Max}}:\end{array}}\quad {\begin{matrix}{\underline {1}}&{\underline {2}}&{\underline {3}}\\[6pt]2.00&2.00&2.00\\2.75&2.75&2.75\\3.83&4.08&3.83\\3.83&3.83&3.83\\4.92&5.17&4.92\\5.67&5.17&5.67\end{matrix}}}

Referencias

  1. Amaratunga, D.; Cabrera, J. (2001). "Análisis de datos de microchips de ADN viral". Journal of the American Statistical Association . 96 (456): 1161. doi : 10.1198/016214501753381814 . S2CID 18154109 . 
  2. Bolstad, BM; Irizarry, RA; Astrand, M.; Speed, TP (2003). "Una comparación de métodos de normalización para datos de matrices de oligonucleótidos de alta densidad basados ​​en la varianza y el sesgo" . Bioinformatics . 19 (2): 185– 193. doi : 10.1093/bioinformatics/19.2.185 . PMID 12538238 . 
  • Normalización de chips Affymetrix Archivado el 23/04/2016 en Wayback Machine