Articulo de referencia

Análisis de componentes simultáneos (ANOVA)

El análisis de componentes simultáneos ( ASCA o ANOVA-SCA ) es una técnica estadística utilizada para analizar conjuntos de datos complejos, especialmente aquellos que surgen de...

El análisis de componentes simultáneos ( ASCA o ANOVA-SCA ) es una técnica estadística utilizada para analizar conjuntos de datos complejos, especialmente aquellos que surgen de experimentos diseñados con múltiples factores , particularmente en los campos de la biología computacional y la bioinformática . Combina los principios de otros dos métodos: el análisis de varianza (ANOVA), que evalúa qué parte de la variación en un conjunto de datos se explica por diferentes condiciones o factores experimentales, y el análisis de componentes simultáneos (SCA), matemáticamente equivalente al análisis de componentes principales (PCA), que simplifica la interpretación de datos multidimensionales.

Este método es una extensión multivariada o incluso megavariada del análisis de varianza (ANOVA) . La partición de la variación es similar a la del ANOVA. Cada partición coincide con toda la variación inducida por un efecto o factor , generalmente un régimen de tratamiento o una condición experimental. Las particiones de efecto calculadas se denominan estimaciones de efecto. Dado que incluso las estimaciones de efecto son multivariadas, su interpretación no es intuitiva. Al aplicar SCA a las estimaciones de efecto se obtiene un resultado simple e interpretable. [ 1 ] [ 2 ] [ 3 ] En caso de más de un efecto, este método estima los efectos de tal manera que los diferentes efectos no estén correlacionados.

Detalles

En muchas áreas de investigación se observa un número cada vez mayor de variables en pocas muestras . La baja proporción de muestras por variable genera problemas conocidos como multicolinealidad y singularidad . Por ello, la mayoría de los métodos estadísticos multivariantes tradicionales no pueden aplicarse.

Algoritmo ASCA

Esta sección detalla cómo calcular el modelo ASCA en un caso con dos efectos principales y un efecto de interacción. Es fácil extender la justificación descrita a más efectos principales y más efectos de interacción. Si el primer efecto es el tiempo y el segundo es la dosis, solo existe la interacción entre el tiempo y la dosis. Suponemos que hay cuatro puntos temporales y tres niveles de dosis.

Sea X una matriz que contiene los datos. X está centrada en la media, por lo que tiene columnas con media cero . Sean A y B los efectos principales y AB la interacción de estos efectos. Dos efectos principales en un experimento biológico pueden ser el tiempo (A) y el pH (B), y estos dos efectos pueden interactuar. Al diseñar tales experimentos, se controlan los efectos principales a varios (al menos dos) niveles. Los diferentes niveles de un efecto pueden denominarse A1, A2, A3 y A4, que representan 2, 3, 4 y 5 horas desde el inicio del experimento. Lo mismo se aplica al efecto B; por ejemplo, pH 6, pH 7 y pH 8 pueden considerarse niveles del efecto.

Se requiere que A y B estén balanceadas si las estimaciones del efecto deben ser ortogonales y la partición única. La matriz E contiene la información que no está asignada a ningún efecto. La partición proporciona la siguiente notación:

incógnita=A+B+AB+mi{\displaystyle X=A+B+AB+E\,}

Cálculo de la estimación del efecto principal A (o B)

Encuentra todas las filas que corresponden al efecto A nivel 1 y calcula el promedio de estas filas. El resultado es un vector . Repite esto para los demás niveles del efecto. Crea una nueva matriz del mismo tamaño que X y coloca los promedios calculados en las filas correspondientes. Es decir, asigna a todas las filas que coinciden con el efecto (es decir) A nivel 1 el promedio del efecto A nivel 1. Después de completar las estimaciones de nivel para el efecto, realiza un SCA. Las puntuaciones de este SCA son las desviaciones de la muestra para el efecto; las variables importantes de este efecto están en los pesos del vector de cargas del SCA.

Calculando la estimación del efecto de interacción AB

La estimación del efecto de interacción es similar a la estimación de los efectos principales. La diferencia radica en que, para las estimaciones de interacción, las filas que coinciden con el nivel 1 del efecto A se combinan con el nivel 1 del efecto B, y se recorren todas las combinaciones de efectos y niveles. En nuestro ejemplo, con cuatro puntos temporales y tres niveles de dosis, existen 12 conjuntos de interacción {A1-B1, A1B2, A2B1, A2B2, etc.}. Es importante eliminar los efectos principales antes de estimar el efecto de interacción.

SCA en las particiones A, B y AB

El análisis de componentes simultáneos es matemáticamente idéntico al PCA, pero semánticamente diferente, ya que modela diferentes objetos o sujetos al mismo tiempo. La notación estándar para un modelo SCA (y PCA) es:

incógnita=TPAG+mi{\displaystyle X=TP^{'}+E\,}

donde X son los datos, T son las puntuaciones de los componentes y P son las cargas de los componentes. E es la matriz residual o de error . Dado que ASCA modela las particiones de variación por SCA, el modelo para las estimaciones de efectos se ve así:

A=TaPAGa+mia{\displaystyle A=T_{a}P_{a}^{'}+E_{a}\,}
B=TbPAGb+mib{\displaystyle B=T_{b}P_{b}^{'}+E_{b}\,}
AB=TabPAGab+miab{\displaystyle AB=T_{ab}P_{ab}^{'}+E_{ab}\,}
mi=TmiPAGmi+mimi{\displaystyle E=T_{e}P_{e}^{'}+E_{e}\,}

Cabe destacar que cada partición tiene su propia matriz de error. Sin embargo, el álgebra establece que en un conjunto de datos equilibrado y centrado en la media, cada sistema de dos niveles tiene rango 1. Esto resulta en cero errores, ya que cualquier matriz de rango 1 puede expresarse como el producto de la puntuación de un único componente y su vector de carga.

El modelo ASCA completo con dos efectos e interacción, incluyendo el SCA, se ve así:

Descomposición:

incógnita=A+B+AB+mi{\displaystyle X=A+B+AB+E\,}
incógnita=TaPAGa+TbPAGb+TabPAGab+TmiPAGmi+mia+mib+miab+mimi+mi{\displaystyle X=T_{a}P_{a}^{'}+T_{b}P_{b}^{'}+T_{ab}P_{ab}^{'}+T_{e}P_{e}^{'}+E_{a}+E_{b}+E_{ab}+E_{e}+E\,}

El tiempo como efecto

Dado que el "tiempo" se trata como un factor cualitativo en la descomposición ANOVA que precede a ASCA, se puede modelar una trayectoria temporal multivariante no lineal. Un ejemplo de esto se muestra en la Figura 10 de esta referencia. [ 4 ]

Referencias

  1. Smilde, Edad K.; Jansen, Jeroen J.; Hoefsloot, Huub CJ; Lamers, Robert-Jan AN; van der Greef, enero; Timmerman, Marieke E. (2005) "Análisis de componentes simultáneos ANOVA (ASCA): una nueva herramienta para analizar datos metabolómicos diseñados", Bioinformatics , 21 (13), 3043-3048. doi : 10.1093/bioinformática/bti476
  2. ^ Jansen, JJ; Hoefsloot, HCJ; van der Greef, J.; Timmerman, YO; Westerhuis, JA; Smilde, AK (2005) "ASCA: análisis de datos multivariados obtenidos de un diseño experimental". Revista de quimiometría , 19: 469–481. doi : 10.1002/cem.952
  3. ^ Daniel J Vis, Johan A Westerhuis, Age K Smilde: Jan van der Greef (2007) "Validación estadística de efectos megavariados en ASCA", BMC Bioinformatics", 8:322 doi : 10.1186/1471-2105-8-322
  4. ^ Smilde, AK, Hoefsloot, HC y Westerhuis, JA (2008), "La geometría de ASCA". Revista de quimiometría , 22, 464–471. doi : 10.1002/cem.1175