Articulo de referencia

Coeficiente de incertidumbre

En estadística , el coeficiente de incertidumbre , también llamado coeficiente de competencia , coeficiente de entropía o U de Theil , es una medida de asociación nominal . Fue ...

En estadística , el coeficiente de incertidumbre , también llamado coeficiente de competencia , coeficiente de entropía o U de Theil , es una medida de asociación nominal . Fue introducido por primera vez por Henri Theil y se basa en el concepto de entropía de la información .

Definición

Supongamos que tenemos muestras de dos variables aleatorias discretas, X e Y. Al construir la distribución conjunta, P X,Y ( x , y )  , a partir de la cual podemos calcular las distribuciones condicionales , P X | Y ( x | y )  = P X,Y ( x , y )/ P Y ( y )   y P Y |X ( y | x )  = P X,Y ( x , y )/ P X ( x )   , y calculando las diversas entropías, podemos determinar el grado de asociación entre las dos variables.

La entropía de una única distribución se da como: [ 1 ]

H(incógnita)=incógnitaPAGincógnita(incógnita)registroPAGincógnita(incógnita),{\displaystyle H(X)=-\sum _{x}P_{X}(x)\log P_{X}(x),}

mientras que la entropía condicional se da como: [ 1 ]

H(incógnita|Y)=incógnita, yPAGincógnita,Y(incógnita, y)registroPAGincógnita|Y(incógnita|y).{\displaystyle H(X|Y)=-\sum _{x,~y}P_{X,Y}(x,~y)\log P_{X|Y}(x|y).}

El coeficiente de incertidumbre [ 2 ] o la competencia [ 3 ] se define como:

U(incógnita|Y)=H(incógnita)H(incógnita|Y)H(incógnita)=I(incógnita;Y)H(incógnita),{\displaystyle U(X|Y)={\frac {H(X)-H(X|Y)}{H(X)}}={\frac {I(X;Y)}{H(X)}},}

y nos dice: dado Y , ¿qué fracción de los bits de X podemos predecir? En este caso, podemos pensar que X contiene la información total, y que Y permite predecir parte de dicha información.

La expresión anterior deja claro que el coeficiente de incertidumbre es una información mutua normalizada I(X;Y) . En particular, el coeficiente de incertidumbre varía en [0, 1] cuando I(X;Y) < H(X) y tanto I(X,Y) como H(X) son positivos o nulos.

Tenga en cuenta que el valor de U (¡pero no el de H !) es independiente de la base del logaritmo, ya que todos los logaritmos son proporcionales.

El coeficiente de incertidumbre es útil para medir la validez de un algoritmo de clasificación estadística y tiene la ventaja, frente a medidas de precisión más simples como la precisión y la exhaustividad, de que no se ve afectado por las fracciones relativas de las diferentes clases, es decir, P ( x ). [ 4 ] También posee la propiedad única de que no penaliza a un algoritmo por predecir clases incorrectas, siempre que lo haga de forma consistente (es decir, simplemente reordenando las clases). Esto resulta útil para evaluar algoritmos de agrupamiento, ya que las etiquetas de los clústeres normalmente no tienen un orden particular. [ 3 ]

Variaciones

El coeficiente de incertidumbre no es simétrico con respecto a los roles de X e Y. Los roles pueden invertirse y, por lo tanto, se puede definir una medida simétrica como un promedio ponderado entre los dos: [ 2 ]

U(incógnita, Y)=H(incógnita)U(incógnita|Y)+H(Y)U(Y|incógnita)H(incógnita)+H(Y)=2[H(incógnita)+H(Y)H(incógnita, Y)H(incógnita)+H(Y)].{\displaystyle {\begin{aligned}U(X,~Y)&={\frac {H(X)U(X|Y)+H(Y)U(Y|X)}{H(X)+H(Y)}}\\[8pt]&=2\left[{\frac {H(X)+H(Y)-H(X,~Y)}{H(X)+H(Y)}}\right].\end{aligned}}}

Aunque normalmente se aplica a variables discretas, el coeficiente de incertidumbre puede extenderse a variables continuas [ 1 ] utilizando la estimación de densidad .

Véase también

Referencias

  1. 1 2 3 Claude E. Shannon; Warren Weaver (1963). La teoría matemática de la comunicación . University of Illinois Press.
  2. 1 2 William H. Press; Brian P. Flannery; Saul A. Teukolsky; William T. Vetterling (1992). "14.7.4". Numerical Recipes: the Art of Scientific Computing (3.ª ed.). Cambridge University Press. pág. 761.  
  3. 1 2 White, Jim; Steingold, Sam; Fournelle, Connie. "Métricas de rendimiento para algoritmos de detección de grupos" (PDF) . Interface 2004. Archivado del original el 13 de abril de 2012.{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  4. Peter, Mills (2011). "Clasificación estadística eficiente de mediciones satelitales" (PDF) . International Journal of Remote Sensing . 32 (21): 6109– 6132. arXiv : 1202.2194 . Bibcode : 2011IJRS...32.6109M . doi : 10.1080/01431161.2010.507795 . S2CID 88518570. Archivado del original (PDF) el 26 de abril de 2012. 
  • libagf Incluye software para calcular coeficientes de incertidumbre.