Articulo de referencia

Coeficiente de información máxima

En estadística , el coeficiente de información máxima ( MIC ) es una medida de la fuerza de la asociación lineal o no lineal entre dos variables X e Y. El MIC pertenece a la c...

En estadística , el coeficiente de información máxima ( MIC ) es una medida de la fuerza de la asociación lineal o no lineal entre dos variables X e Y. 

El MIC pertenece a la clase de estadística de exploración no paramétrica basada en información máxima (MINE). [ 1 ] En un estudio de simulación, el MIC superó a algunas pruebas de baja potencia seleccionadas, [ 1 ] sin embargo, se han planteado preocupaciones con respecto a la reducción de la potencia estadística en la detección de algunas asociaciones en entornos con un tamaño de muestra pequeño cuando se compara con métodos potentes como la correlación de distancia y Heller-Heller- Gorfine (HHG). [ 2 ] Las comparaciones con estos métodos, en las que el MIC fue superado, se hicieron en Simon y Tibshirani [ 3 ] y en Gorfine, Heller y Heller. [ 4 ] Se afirma [ 1 ] que el MIC satisface aproximadamente una propiedad llamada equitatividad que se ilustra con estudios de simulación seleccionados. [ 1 ] Posteriormente se demostró que ningún coeficiente no trivial puede satisfacer exactamente la propiedad de equitatividad tal como la definen Reshef et al., [ 1 ] [ 5 ] aunque este resultado ha sido cuestionado. [ 6 ] Algunas críticas a MIC son abordadas por Reshef et al. en estudios posteriores publicados en arXiv . [ 7 ]

Descripción general

El coeficiente de información máxima utiliza la discretización para aplicar información mutua a variables aleatorias continuas. La discretización se ha utilizado durante algún tiempo para aplicar información mutua a distribuciones continuas; además, el coeficiente de información máxima aporta una metodología para seleccionar el número de intervalos y elegir el máximo entre muchas cuadrículas posibles.

La razón es que los intervalos para ambas variables deben elegirse de tal manera que la información mutua entre las variables sea máxima. Eso se logra siempre queH(incógnitab)=H(Yb)=H(incógnitab,Yb){\displaystyle \mathrm {H} \left(X_{b}\right)=\mathrm {H} \left(Y_{b}\right)=\mathrm {H} \left(X_{b},Y_{b}\right)}. [ Nota 1 ] Por lo tanto, cuando la información mutua es máxima sobre una agrupación de los datos, deberíamos esperar que se cumplan las dos propiedades siguientes, en la medida en que lo permita la propia naturaleza de los datos. Primero, los intervalos tendrían aproximadamente el mismo tamaño, porque las entropíasH(incógnitab){\displaystyle \mathrm {H} (X_{b})}yH(Yb){\displaystyle \mathrm {H} (Y_ {b})}se maximizan mediante la agrupación en intervalos de igual tamaño. Y segundo, cada intervalo de X corresponderá aproximadamente a un intervalo en Y.

Debido a que las variables X e Y son números reales , casi siempre es posible crear exactamente un intervalo para cada punto de datos ( x , y ), lo que produciría un valor muy alto del MI. Para evitar formar este tipo de partición trivial, los autores del artículo proponen tomar un número de intervalos.norteincógnita{\displaystyle n_{x}}para X ynortey{\displaystyle n_{y}}cuyo producto es relativamente pequeño en comparación con el tamaño N de la muestra de datos . Concretamente, proponen:

norteincógnita×norteynorte0,6{\displaystyle n_{x}\times n_{y}\leq \mathrm {N} ^{0.6}}

En algunos casos es posible lograr una buena correspondencia entreincógnitab{\displaystyle X_{b}}yYb{\displaystyle Y_{b}}con cifras tan bajas comonorteincógnita=2{\displaystyle n_{x}=2}ynortey=2{\displaystyle n_{y}=2}, mientras que en otros casos el número de contenedores requeridos puede ser mayor. El máximo paraI(incógnitab;Yb){\displaystyle \mathrm {I} (X_{b};Y_{b})}está determinado por H(X), que a su vez está determinado por el número de intervalos en cada eje; por lo tanto, el valor de la información mutua dependerá del número de intervalos seleccionados para cada variable. Para comparar los valores de información mutua obtenidos con particiones de diferentes tamaños, el valor de la información mutua se normaliza dividiéndolo por el valor máximo alcanzable para el tamaño de partición dado. Cabe destacar que anteriormente se propuso un procedimiento de discretización adaptativa similar para estimar la información mutua. [ 8 ] La entropía se maximiza mediante distribuciones de probabilidad uniformes, o en este caso, intervalos con el mismo número de elementos. Además, la entropía conjunta se minimiza al tener una correspondencia uno a uno entre los intervalos. Si sustituimos dichos valores en la fórmula I(incógnita;Y)=H(incógnita)+H(Y)H(incógnita,Y){\displaystyle I(X;Y)=H(X)+H(Y)-H(X,Y)}, podemos ver que el valor máximo alcanzable por el MI para un par dadonorteincógnita,nortey{\displaystyle n_{x},n_{y}}de recuentos de contenedores esregistromin(norteincógnita,nortey){\displaystyle \log \min \left(n_{x},n_{y}\right)}Por lo tanto, este valor se utiliza como divisor de normalización para cada par de recuentos de intervalos.

Por último, el valor máximo de información mutua normalizado para diferentes combinaciones denorteincógnita{\displaystyle n_{x}}ynortey{\displaystyle n_{y}}Se tabula y se selecciona el valor máximo de la tabla como valor del estadístico.

Probar todos los esquemas de clasificación posibles que satisfagan norteincógnita×norteynorte0,6{\displaystyle n_{x}\times n_{y}\leq \mathrm {N} ^{0.6}} Es computacionalmente inviable incluso para valores pequeños de n. Por lo tanto, en la práctica, los autores aplican una heurística que puede o no encontrar el máximo verdadero.

Notas

  1. Los subíndices "b" se han utilizado para enfatizar que la información mutua se calcula utilizando los intervalos.

Referencias

  1. 1 2 3 4 5 Reshef, DN; Reshef, YA; Finucane, HK; Grossman, SR; McVean, G. ; Turnbaugh, PJ; Lander, ES ; Mitzenmacher, M.; Sabeti, PC (2011). "Detección de nuevas asociaciones en grandes conjuntos de datos" . Science . 334 (6062): 1518– 1524. Bibcode : 2011Sci...334.1518R . doi : 10.1126/science.1205438 . PMC 3325791 . PMID 22174245 .  
  2. Heller, R.; Heller, Y.; Gorfine, M. (2012). "Una prueba multivariada consistente de asociación basada en rangos de distancias". Biometrika . 100 (2): 503– 510. arXiv : 1201.3522 . doi : 10.1093/biomet/ass070 .
  3. Noah Simon y Robert Tibshirani, Comentario sobre “Detección de nuevas asociaciones en grandes conjuntos de datos” de Reshef et al., Science, 16 de diciembre de 2011
  4. "Comentario sobre "Detección de asociaciones novedosas en grandes conjuntos de datos"" (PDF) . Archivado del original (PDF) el 08-08-2017.
  5. Equidad, información mutua y coeficiente de información máxima por Justin B. Kinney, Gurinder S. Atwal, arXiv, 31 de enero de 2013
  6. Murrell, Ben; Murrell, Daniel; Murrell, Hugh (2014). " La equidad R2 es satisfacible" . Actas de la Academia Nacional de Ciencias . 111 (21): E2160. Bibcode : 2014PNAS..111E2160M . doi : 10.1073/pnas.1403623111 . PMC 4040619. PMID 24782547 .  
  7. Análisis de equidad del coeficiente de información máxima, con comparaciones por David Reshef, Yakir Reshef, Michael Mitzenmacher, Pardis Sabeti, arXiv, 27 de enero de 2013
  8. Fraser, Andrew M.; Swinney, Harry L. (1986-02-01). "Coordenadas independientes para atractores extraños a partir de información mutua". Physical Review A . 33 (2): 1134– 1140. Bibcode : 1986PhRvA..33.1134F . doi : 10.1103/PhysRevA.33.1134 . PMID 9896728 .