En estadística , el análisis de correlación canónica ( CCA ), también llamado análisis de variables canónicas , es una forma de inferir información a partir de matrices de covarianza cruzada . Si tenemos dos vectores X = ( X₁ , ..., Xₙ ) e Y = ( Y₁ , ... , Yₙ ) de variables aleatorias , y existen correlaciones entre las variables, entonces el análisis de correlación canónica encontrará combinaciones lineales de X e Y que tengan una correlación máxima entre sí. [ 1 ] TR Knapp señala que "prácticamente todas las pruebas paramétricas de significancia que se encuentran comúnmente pueden tratarse como casos especiales del análisis de correlación canónica, que es el procedimiento general para investigar las relaciones entre dos conjuntos de variables". [ 2 ] El método fue introducido por primera vez por Harold Hotelling en 1936, [ 3 ] aunque en el contexto de ángulos entre planos el concepto matemático fue publicado por Camille Jordan en 1875. [ 4 ]
El análisis de correspondencia canónica (CCA) es ahora un pilar fundamental de la estadística multivariante y el aprendizaje multivista, y se han propuesto numerosas interpretaciones y extensiones, como el CCA probabilístico, el CCA disperso, el CCA multivista, el CCA profundo [ 5 ] y el DeepGeoCCA [ 6 ] . Desafortunadamente, quizás debido a su popularidad, la literatura puede presentar inconsistencias en la notación. En este artículo, intentamos destacar dichas inconsistencias para ayudar al lector a aprovechar al máximo la literatura y las técnicas disponibles.
Al igual que su método hermano PCA , CCA puede verse en forma de población (correspondiente a vectores aleatorios y sus matrices de covarianza) o en forma de muestra (correspondiente a conjuntos de datos y sus matrices de covarianza de muestra). Estas dos formas son casi análogas entre sí, razón por la cual su distinción a menudo se pasa por alto, pero pueden comportarse de manera muy diferente en entornos de alta dimensionalidad. [ 7 ] A continuación, proporcionamos definiciones matemáticas explícitas para el problema de población y destacamos los diferentes objetos en la llamada descomposición canónica ; comprender las diferencias entre estos objetos es crucial para la interpretación de la técnica.
Definición de CCA poblacional mediante correlaciones
Dados dos vectores columnayde variables aleatorias con segundos momentos finitos , se puede definir la covarianza cruzadaser elmatriz cuyoLa entrada es la covarianzaEn la práctica, estimaríamos la matriz de covarianza basándonos en datos muestreados dey(es decir, a partir de un par de matrices de datos).
El análisis de correlación canónica busca una secuencia de vectores () y() de tal manera que las variables aleatoriasymaximizar la correlaciónLas variables aleatorias (escalares)yson el primer par de variables canónicas . Luego se buscan vectores que maximicen la misma correlación, sujetos a la restricción de que no estén correlacionados con el primer par de variables canónicas; esto da el segundo par de variables canónicas . Este procedimiento puede continuarse hastaveces.
Los conjuntos de vectoresse denominan direcciones canónicas o vectores de peso o simplemente pesos . Los conjuntos 'duales' de vectoresse denominan vectores de carga canónicos o simplemente cargas ; estos suelen ser más fáciles de interpretar que los pesos. [ 8 ]
Cálculo
Derivación
Dejarsea la matriz de covarianza cruzada para cualquier par de variables aleatorias (en forma de vector)yLa función objetivo a maximizar es
El primer paso es definir un cambio de base y definir
dóndeyse puede obtener a partir de la descomposición en valores propios (o por diagonalización ):
y
De este modo
Por la desigualdad de Cauchy-Schwarz ,
Hay igualdad si los vectoresyson colineales. Además, la correlación máxima se alcanza sies el vector propio con el valor propio máximo para la matriz(Véase el cociente de Rayleigh ). Los pares subsiguientes se obtienen utilizando valores propios de magnitud decreciente. La ortogonalidad está garantizada por la simetría de las matrices de correlación.
Otra forma de ver este cálculo es queyson los vectores singulares izquierdo y derecho de la matriz de correlación de X e Y correspondientes al valor singular más alto.
Solución
Por lo tanto, la solución es:
- es un vector propio de
- es proporcional a
Recíprocamente, también existe:
- es un vector propio de
- es proporcional a
Invirtiendo el cambio de coordenadas, tenemos que
- es un vector propio de,
- es proporcional a
- es un vector propio de
- es proporcional a.
Las variables canónicas se definen mediante:
Implementación
CCA se puede calcular utilizando la descomposición en valores singulares de una matriz de correlación. [ 9 ] Está disponible como una función en [ 10 ]
- MATLAB como canoncorr ( también en Octave )
- R como la función estándar cancor y varios otros paquetes, incluidos candisc , CCA y vegan . CCP para pruebas de hipótesis estadísticas en análisis de correlación canónica.
- SAS como procedimiento cancorr
- Python en la biblioteca scikit-learn , como descomposición cruzada y en statsmodels, como CanCorr . La biblioteca CCA-Zoo [ 11 ] implementa extensiones de CCA, como CCA probabilística, CCA dispersa, CCA multivista y CCA profunda.
- SPSS como macro CanCorr incluido con el software principal
- Julia (lenguaje de programación) en el paquete MultivariateStats.jl .
El cálculo de CCA mediante descomposición en valores singulares en una matriz de correlación está relacionado con el coseno de los ángulos entre planos . La función coseno está mal condicionada para ángulos pequeños, lo que lleva a un cálculo muy impreciso de vectores principales altamente correlacionados en aritmética computacional de precisión finita . Para solucionar este problema , existen algoritmos alternativos [ 12 ] disponibles en
Prueba de hipótesis
Cada fila puede ser probada para determinar su significancia con el siguiente método. Dado que las correlaciones están ordenadas, decir que la filaes cero implica que todas las correlaciones posteriores también son cero. Si tenemosobservaciones independientes en una muestra yes la correlación estimada para. Para elEn la fila n, el estadístico de prueba es:
que se distribuye asintóticamente como una chi-cuadrado congrados de libertad para grandes. [ 13 ] Dado que todas las correlaciones deason lógicamente cero (y se estiman de esa manera también) el producto para los términos después de este punto es irrelevante.
Tenga en cuenta que en el límite de tamaño de muestra pequeño conentonces tenemos la garantía de que lo mejorLas correlaciones serán idénticamente 1 y, por lo tanto, la prueba carece de sentido. [ 14 ]
Usos prácticos
Un uso típico de la correlación canónica en el contexto experimental es tomar dos conjuntos de variables y ver qué tienen en común. [ 15 ] Por ejemplo, en las pruebas psicológicas, se podrían tomar dos pruebas de personalidad multidimensionales bien establecidas , como el Inventario Multifásico de Personalidad de Minnesota (MMPI-2) y el NEO . Al ver cómo se relacionan los factores del MMPI-2 con los factores del NEO, se podría obtener información sobre qué dimensiones eran comunes entre las pruebas y cuánta varianza se compartía. Por ejemplo, se podría encontrar que una dimensión de extraversión o neuroticismo explicaba una cantidad sustancial de varianza compartida entre las dos pruebas.
También se puede utilizar el análisis de correlación canónica para generar una ecuación modelo que relacione dos conjuntos de variables, por ejemplo, un conjunto de medidas de rendimiento y un conjunto de variables explicativas, o un conjunto de salidas y un conjunto de entradas. Se pueden imponer restricciones a dicho modelo para asegurar que refleje los requisitos teóricos o condiciones intuitivamente obvias. Este tipo de modelo se conoce como modelo de correlación máxima. [ 16 ]
La visualización de los resultados de la correlación canónica se realiza generalmente mediante gráficos de barras de los coeficientes de los dos conjuntos de variables para los pares de variables canónicas que muestran una correlación significativa. Algunos autores sugieren que la mejor manera de visualizarlos es representándolos como heliógrafos, un formato circular con barras en forma de rayos, donde cada mitad representa los dos conjuntos de variables. [ 17 ]
Ejemplos
Dejarcon valor esperado cero , es decir,.
- Si, es decir,yestán perfectamente correlacionados, entonces, por ejemplo,y, de modo que el primer (y único en este ejemplo) par de variables canónicas esy.
- Si, es decir,yestán perfectamente anticorrelacionados, entonces, por ejemplo,y, de modo que el primer (y único en este ejemplo) par de variables canónicas esy.
Observamos que en ambos casos, lo que demuestra que el análisis de correlación canónica trata las variables correlacionadas y anticorrelacionadas de manera similar.
Conexión con los ángulos principales
Suponiendo queytienen valores esperados cero , es decir,, sus matrices de covarianzaypueden verse como matrices de Gram en un producto interno para las entradas de y, correspondientemente. En esta interpretación, las variables aleatorias, entradasde ydese tratan como elementos de un espacio vectorial con un producto interno dado por la covarianza; véase Covarianza#Relación con productos internos .
La definición de las variables canónicasyes entonces equivalente a la definición de vectores principales para el par de subespacios generados por las entradas de ycon respecto a este producto interno . Las correlaciones canónicases igual al coseno de los ángulos principales .
Blanqueamiento y análisis de correlación canónica probabilística
CCA también puede considerarse una transformación de blanqueamiento especial donde los vectores aleatoriosyse transforman simultáneamente de tal manera que la correlación cruzada entre los vectores blanqueadosyes diagonal. [ 18 ] Las correlaciones canónicas se interpretan entonces como coeficientes de regresión que vinculanyy también puede ser negativo. La perspectiva de regresión del CCA también proporciona una forma de construir un modelo generativo probabilístico de variables latentes para el CCA, con variables ocultas no correlacionadas que representan la variabilidad compartida y no compartida. [ 19 ]
Véase también
Enlaces externos
- Análisis de correlación discriminante (DCA) [ 20 ] ( MATLAB )
- Hardoon, DR; Szedmak, S.; Shawe-Taylor, J. (2004). "Análisis de correlación canónica: una visión general con aplicación a métodos de aprendizaje". Neural Computation . 16 (12): 2639– 2664. CiteSeerX 10.1.1.14.6452 . doi : 10.1162/0899766042321814 . PMID 15516276 . S2CID 202473 .
- Una nota sobre el análisis de correlación canónica ordinal de dos conjuntos de puntuaciones de clasificación (también proporciona un programa FORTRAN ) - en Journal of Quantitative Economics 7(2), 2009, pp. 173–199
- Análisis de correlación canónica con restricciones de representación: una hibridación de la correlación canónica y el análisis de componentes principales (también incluye un programa en FORTRAN ) - en Journal of Applied Economic Sciences 4(1), 2009, pp. 115–124
Referencias
- ↑ Härdle, Wolfgang; Simar, Léopold (2007). «Análisis de correlación canónica». Análisis estadístico multivariante aplicado . págs. 321–330 . CiteSeerX 10.1.1.324.403 . doi : 10.1007/978-3-540-72244-1_14 . ISBN 978-3-540-72243-4.
- ↑ Knapp, TR (1978). "Análisis de correlación canónica: un sistema general de prueba de significancia paramétrica". Psychological Bulletin . 85 (2): 410– 416. doi : 10.1037/0033-2909.85.2.410 .
- ↑ Hotelling, H. (1936). "Relaciones entre dos conjuntos de variables". Biometrika . 28 ( 3–4 ): 321–377 . doi : 10.1093/biomet/28.3-4.321 . JSTOR 2333955 .
- ^ Jordania, C. (1875). "Ensayo sobre la geometríadimensiones" . Bull. Soc. Math. France . 3 : 103.
- ↑ Andrew, Galen; Arora, Raman; Bilmes, Jeff; Livescu, Karen (26 de mayo de 2013). "Análisis de correlación canónica profunda" . Actas de la 30.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1247–1255 .
- ↑ Ju, Ce; Kobler, Reinmar J; Tang, Liyao; Guan, Cuntai; Kawanabe, Motoaki (2024). Análisis de correlación canónica geodésica profunda para datos de neuroimagen basados en covarianza . Duodécima Conferencia Internacional sobre Representaciones de Aprendizaje (ICLR 2024, Spotlight).
- ↑ "Aprendizaje estadístico con escasez: el Lasso y generalizaciones" . hastie.su.domains . Consultado el 12 de septiembre de 2023 .
- ↑ Gu, Fei; Wu, Hao (2018-04-01). "Análisis de correlación canónica simultánea con cargas canónicas invariantes" . Behaviormetrika . 45 (1): 111– 132. doi : 10.1007/s41237-017-0042-8 . ISSN 1349-6964 .
- ↑ Hsu, D.; Kakade, SM; Zhang, T. (2012). "Un algoritmo espectral para el aprendizaje de modelos ocultos de Markov" (PDF) . Journal of Computer and System Sciences . 78 (5): 1460. arXiv : 0811.4413 . doi : 10.1016/j.jcss.2011.12.025 . S2CID 220740158 .
- ↑ Huang, SY; Lee, MH; Hsiao, CK (2009). "Medidas no lineales de asociación con análisis de correlación canónica de núcleo y aplicaciones" (PDF) . Journal of Statistical Planning and Inference . 139 (7): 2162. doi : 10.1016/j.jspi.2008.10.011 . Archivado del original (PDF) el 13 de marzo de 2017. Recuperado el 4 de septiembre de 2015 .
- ↑ Chapman, James; Wang, Hao-Ting (18 de diciembre de 2021). "CCA-Zoo: Una colección de métodos CCA regularizados, basados en aprendizaje profundo, kernel y probabilísticos en un marco de estilo scikit-learn" . Journal of Open Source Software . 6 (68): 3823. Bibcode : 2021JOSS....6.3823C . doi : 10.21105/joss.03823 . ISSN 2475-9066 .
- ↑ Knyazev, AV; Argentati, ME (2002), "Ángulos principales entre subespacios en un producto escalar basado en A: algoritmos y estimaciones de perturbación", SIAM Journal on Scientific Computing , 23 (6): 2009–2041 , Bibcode : 2002SJSC...23.2008K , CiteSeerX 10.1.1.73.2914 , doi : 10.1137/S1064827500377332
- ↑ Kanti V. Mardia , JT Kent y JM Bibby (1979). Análisis multivariado . Academic Press .
- ↑ Yang Song, Peter J. Schreier, David Ramírez y Tanuj Hasija Análisis de correlación canónica de datos de alta dimensión con soporte de muestra muy pequeño arXiv : 1604.02047
- ↑ Sieranoja, S.; Sahidullah, Md; Kinnunen, T.; Komulainen, J.; Hadid, A. (julio de 2018). "Detección de sincronía audiovisual con características de audio optimizadas" (PDF) . 2018 IEEE 3rd International Conference on Signal and Image Processing (ICSIP) . pp. 377–381 . doi : 10.1109/SIPROCESS.2018.8600424 . ISBN 978-1-5386-6396-7. S2CID 51682024 .
- ↑ Tofallis, C. (1999). "Model Building with Multiple Dependent Variables and Constraints". Journal of the Royal Statistical Society, Series D . 48 (3): 371– 378. arXiv : 1109.0725 . doi : 10.1111/1467-9884.00195 . S2CID 8942357 .
- ↑ Degani, A.; Shafto, M.; Olson, L. (2006). "Análisis de correlación canónica: uso de heliógrafos compuestos para representar múltiples patrones" (PDF) . Representación diagramática e inferencia . Notas de clase en ciencias de la computación. Vol. 4045. pág. 93. CiteSeerX 10.1.1.538.5217 . doi : 10.1007/11783183_11 . ISBN 978-3-540-35623-3.
- ↑ Jendoubi, T.; Strimmer, K. (2018). "Un enfoque de blanqueamiento para el análisis de correlación canónica probabilística para la integración de datos ómicos" . BMC Bioinformatics . 20 (1): 15. arXiv : 1802.03490 . doi : 10.1186/ s12859-018-2572-9 . PMC 6327589. PMID 30626338 .
- ↑ Jendoubi, Takoua; Strimmer, Korbinian (9 de enero de 2019). "Un enfoque de blanqueamiento para el análisis de correlación canónica probabilística para la integración de datos ómicos" . BMC Bioinformatics . 20 (1): 15. doi : 10.1186/s12859-018-2572-9 . ISSN 1471-2105 . PMC 6327589. PMID 30626338 .
- ↑ Haghighat, Mohammad; Abdel-Mottaleb, Mohamed; Alhalabi, Wadee (2016). "Análisis de correlación discriminante: fusión de características en tiempo real para el reconocimiento biométrico multimodal" . IEEE Transactions on Information Forensics and Security . 11 (9): 1984–1996 . doi : 10.1109/TIFS.2016.2569061 . S2CID 15624506 .
- Covarianza y correlación