Articulo de referencia

Entropía condicional

Diagrama de Venn que muestra relaciones aditivas y sustractivas de varias medidas de información asociadas con variables correlacionadas y . El área contenida por ambos círculos...

Diagrama de Venn que muestra relaciones aditivas y sustractivas de varias medidas de información asociadas con variables correlacionadas y . El área contenida por ambos círculos es la entropía conjunta . El círculo de la izquierda (rojo y violeta) es la entropía individual , siendo el rojo la entropía condicional . El círculo de la derecha (azul y violeta) es , siendo el azul . El violeta es la información mutua . incógnita {\estilo de visualización X} Y {\estilo de visualización Y} yo ( incógnita , Y ) {\displaystyle \mathrm {H} (X,Y)} yo ( incógnita ) {\displaystyle \mathrm {H} (X)} yo ( incógnita | Y ) {\displaystyle \mathrm {H} (X|Y)} yo ( Y ) {\displaystyle \mathrm {H} (Y)} yo ( Y | incógnita ) {\displaystyle \mathrm {H} (Y|X)} I ( incógnita ; Y ) {\displaystyle \operatorname {I} (X;Y)}

En la teoría de la información , la entropía condicional cuantifica la cantidad de información necesaria para describir el resultado de una variable aleatoria dado que se conoce el valor de otra variable aleatoria . Aquí, la información se mide en shannons , nats o hartleys . La entropía de condicionado se escribe como . Y {\estilo de visualización Y} incógnita {\estilo de visualización X} Y {\estilo de visualización Y} incógnita {\estilo de visualización X} yo ( Y | incógnita ) {\displaystyle \mathrm {H} (Y|X)}

Definición

La entropía condicional de un dato se define como Y {\estilo de visualización Y} incógnita {\estilo de visualización X}

donde y denotan los conjuntos de soporte de y . incógnita {\displaystyle {\mathcal {X}}} Y {\displaystyle {\mathcal {Y}}} incógnita {\estilo de visualización X} Y {\estilo de visualización Y}

Nota: Aquí, la convención es que la expresión debe considerarse igual a cero. Esto se debe a que . [1] 0 registro 0 {\estilo de visualización 0\log 0} límite θ 0 + θ registro θ = 0 {\displaystyle \lim _{\theta \to 0^{+}}\theta \,\log \theta =0}

Intuitivamente, observe que por definición de valor esperado y de probabilidad condicional , se puede escribir como , donde se define como . Se puede pensar en asociar cada par con una cantidad que mide el contenido de información de dado . Esta cantidad está directamente relacionada con la cantidad de información necesaria para describir el evento dado . Por lo tanto, al calcular el valor esperado de sobre todos los pares de valores , la entropía condicional mide cuánta información, en promedio, codifica la variable sobre . yo ( Y | incógnita ) {\displaystyle \displaystyle H(Y|X)} yo ( Y | incógnita ) = mi [ F ( incógnita , Y ) ] {\displaystyle H(Y|X)=\mathbb {E}[f(X,Y)]} F {\estilo de visualización f} F ( incógnita , y ) := registro ( pag ( incógnita , y ) pag ( incógnita ) ) = registro ( pag ( y | incógnita ) ) {\displaystyle \displaystyle f(x,y):=-\log \left({\frac {p(x,y)}{p(x)}}\right)=-\log(p(y|x))} F {\displaystyle \displaystyle f} ( incógnita , y ) {\displaystyle \displaystyle (x,y)} ( Y = y ) {\displaystyle \displaystyle (Y=y)} ( incógnita = incógnita ) {\displaystyle \displaystyle (X=x)} ( Y = y ) {\displaystyle \displaystyle (Y=y)} ( incógnita = incógnita ) {\estilo de visualización (X=x)} F {\displaystyle \displaystyle f} ( incógnita , y ) incógnita × Y {\displaystyle (x,y)\en {\mathcal {X}}\times {\mathcal {Y}}} yo ( Y | incógnita ) {\displaystyle \displaystyle H(Y|X)} incógnita {\estilo de visualización X} Y {\estilo de visualización Y}

Motivación

Sea la entropía de la variable aleatoria discreta condicionada a que la variable aleatoria discreta tome un cierto valor . Denotemos los conjuntos de soporte de y por y . Sea la función de masa de probabilidad . La entropía incondicional de se calcula como , es decir yo ( Y | incógnita = incógnita ) {\displaystyle \mathrm {H} (Y|X=x)} Y {\estilo de visualización Y} incógnita {\estilo de visualización X} incógnita {\estilo de visualización x} incógnita {\estilo de visualización X} Y {\estilo de visualización Y} incógnita {\displaystyle {\mathcal {X}}} Y {\displaystyle {\mathcal {Y}}} Y {\estilo de visualización Y} pag Y ( y ) {\displaystyle p_{Y}{(y)}} Y {\estilo de visualización Y} yo ( Y ) := mi [ I ( Y ) ] {\displaystyle \mathrm {H} (Y):=\mathbb {E} [\operatorname {I} (Y)]}

yo ( Y ) = y Y PAG a ( Y = y ) I ( y ) = y Y pag Y ( y ) registro 2 pag Y ( y ) , {\displaystyle \mathrm {H} (Y)=\sum _{y\in {\mathcal {Y}}}{\mathrm {Pr} (Y=y)\,\mathrm {I} (y)}= -\sum _{y\in {\mathcal {Y}}}{p_{Y}(y)\log _{2}{p_{Y}(y)}},}

donde es el contenido de información del resultado de tomar el valor . La entropía de condicionado a tomar el valor se define de manera análoga por la expectativa condicional : I ( y i ) {\displaystyle \operatorname {I} (y_ {i})} Y {\estilo de visualización Y} y i {\displaystyle y_{i}} Y {\estilo de visualización Y} incógnita {\estilo de visualización X} incógnita {\estilo de visualización x}

yo ( Y | incógnita = incógnita ) = y Y Pr ( Y = y | incógnita = incógnita ) registro 2 Pr ( Y = y | incógnita = incógnita ) . {\displaystyle \mathrm {H} (Y|X=x)=-\sum _{y\in {\mathcal {Y}}}{\Pr(Y=y|X=x)\log _{2} {\Pr(Y=y|X=x)}}.}

Tenga en cuenta que es el resultado de promediar todos los valores posibles que pueden tomarse. Además, si la suma anterior se toma sobre una muestra , el valor esperado se conoce en algunos dominios como yo ( Y | incógnita ) {\displaystyle \mathrm {H} (Y|X)} yo ( Y | incógnita = incógnita ) {\displaystyle \mathrm {H} (Y|X=x)} incógnita {\estilo de visualización x} incógnita {\estilo de visualización X} y 1 , , y norte {\displaystyle y_{1},\puntos ,y_{n}} mi incógnita [ yo ( y 1 , , y norte incógnita = incógnita ) ] {\displaystyle E_{X}[\mathrm {H} (y_{1},\puntos ,y_{n}\mid X=x)]} equivocación .[2]

Dadas variables aleatorias discretas con imagen y con imagen , la entropía condicional de dada se define como la suma ponderada de para cada valor posible de , utilizando como pesos: [3] : 15  incógnita {\estilo de visualización X} incógnita {\displaystyle {\mathcal {X}}} Y {\estilo de visualización Y} Y {\displaystyle {\mathcal {Y}}} Y {\estilo de visualización Y} incógnita {\estilo de visualización X} yo ( Y | incógnita = incógnita ) {\displaystyle \mathrm {H} (Y|X=x)} incógnita {\estilo de visualización x} pag ( incógnita ) {\estilo de visualización p(x)}

yo ( Y | incógnita )   incógnita incógnita pag ( incógnita ) yo ( Y | incógnita = incógnita ) = incógnita incógnita pag ( incógnita ) y Y pag ( y | incógnita ) registro 2 pag ( y | incógnita ) = incógnita incógnita , y Y pag ( incógnita ) pag ( y | incógnita ) registro 2 pag ( y | incógnita ) = incógnita incógnita , y Y pag ( incógnita , y ) registro 2 pag ( incógnita , y ) pag ( incógnita ) . {\displaystyle {\begin{alineado}\mathrm {H} (Y|X)\ &\equiv \sum _{x\in {\mathcal {X}}}\,p(x)\,\mathrm {H } (Y|X=x)\\&=-\sum _{x\in {\mathcal {X}}}p(x)\sum _{y\in {\mathcal {Y}}}\,p (y|x)\,\log _{2}\,p(y|x)\\&=-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y} }}\,p(x)p(y|x)\,\log _{2}\,p(y|x)\\&=-\sum _{x\in {\mathcal {X}}, y\in {\mathcal {Y}}}p(x,y)\log _{2}{\frac {p(x,y)}{p(x)}}.\end{alineado}}}

Propiedades

La entropía condicional es igual a cero

yo ( Y | incógnita ) = 0 {\displaystyle \mathrm {H} (Y|X)=0} si y sólo si el valor de está completamente determinado por el valor de . Y {\estilo de visualización Y} incógnita {\estilo de visualización X}

Entropía condicional de variables aleatorias independientes

Por el contrario, si y sólo si y son variables aleatorias independientes . yo ( Y | incógnita ) = yo ( Y ) {\displaystyle \mathrm {H} (Y|X)=\mathrm {H} (Y)} Y {\displaystyle Y} X {\displaystyle X}

Regla de la cadena

Supongamos que el sistema combinado determinado por dos variables aleatorias y tiene entropía conjunta , es decir, necesitamos bits de información en promedio para describir su estado exacto. Ahora bien, si primero conocemos el valor de , hemos obtenido bits de información. Una vez que se conoce , solo necesitamos bits para describir el estado de todo el sistema. Esta cantidad es exactamente , lo que da la regla de la cadena de la entropía condicional: X {\displaystyle X} Y {\displaystyle Y} H ( X , Y ) {\displaystyle \mathrm {H} (X,Y)} H ( X , Y ) {\displaystyle \mathrm {H} (X,Y)} X {\displaystyle X} H ( X ) {\displaystyle \mathrm {H} (X)} X {\displaystyle X} H ( X , Y ) H ( X ) {\displaystyle \mathrm {H} (X,Y)-\mathrm {H} (X)} H ( Y | X ) {\displaystyle \mathrm {H} (Y|X)}

H ( Y | X ) = H ( X , Y ) H ( X ) . {\displaystyle \mathrm {H} (Y|X)\,=\,\mathrm {H} (X,Y)-\mathrm {H} (X).} [3] : 17 

La regla de la cadena se desprende de la definición anterior de entropía condicional:

H ( Y | X ) = x X , y Y p ( x , y ) log ( p ( x ) p ( x , y ) ) = x X , y Y p ( x , y ) ( log ( p ( x ) ) log ( p ( x , y ) ) ) = x X , y Y p ( x , y ) log ( p ( x , y ) ) + x X , y Y p ( x , y ) log ( p ( x ) ) = H ( X , Y ) + x X p ( x ) log ( p ( x ) ) = H ( X , Y ) H ( X ) . {\displaystyle {\begin{aligned}\mathrm {H} (Y|X)&=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)\log \left({\frac {p(x)}{p(x,y)}}\right)\\[4pt]&=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)(\log(p(x))-\log(p(x,y)))\\[4pt]&=-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)\log(p(x,y))+\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}{p(x,y)\log(p(x))}\\[4pt]&=\mathrm {H} (X,Y)+\sum _{x\in {\mathcal {X}}}p(x)\log(p(x))\\[4pt]&=\mathrm {H} (X,Y)-\mathrm {H} (X).\end{aligned}}}

En general, se cumple una regla de cadena para múltiples variables aleatorias:

H ( X 1 , X 2 , , X n ) = i = 1 n H ( X i | X 1 , , X i 1 ) {\displaystyle \mathrm {H} (X_{1},X_{2},\ldots ,X_{n})=\sum _{i=1}^{n}\mathrm {H} (X_{i}|X_{1},\ldots ,X_{i-1})} [3] : 22 

Tiene una forma similar a la regla de la cadena en la teoría de probabilidad, excepto que se utiliza la suma en lugar de la multiplicación.

Regla de Bayes

Regla de Bayes para estados de entropía condicional

H ( Y | X ) = H ( X | Y ) H ( X ) + H ( Y ) . {\displaystyle \mathrm {H} (Y|X)\,=\,\mathrm {H} (X|Y)-\mathrm {H} (X)+\mathrm {H} (Y).}

Demostración. y . La simetría implica . Restar las dos ecuaciones implica la regla de Bayes. H ( Y | X ) = H ( X , Y ) H ( X ) {\displaystyle \mathrm {H} (Y|X)=\mathrm {H} (X,Y)-\mathrm {H} (X)} H ( X | Y ) = H ( Y , X ) H ( Y ) {\displaystyle \mathrm {H} (X|Y)=\mathrm {H} (Y,X)-\mathrm {H} (Y)} H ( X , Y ) = H ( Y , X ) {\displaystyle \mathrm {H} (X,Y)=\mathrm {H} (Y,X)}

Si es condicionalmente independiente de lo dado tenemos: Y {\displaystyle Y} Z {\displaystyle Z} X {\displaystyle X}

H ( Y | X , Z ) = H ( Y | X ) . {\displaystyle \mathrm {H} (Y|X,Z)\,=\,\mathrm {H} (Y|X).}

Otras propiedades

Para cualquier y : X {\displaystyle X} Y {\displaystyle Y}

H ( Y | X ) H ( Y ) H ( X , Y ) = H ( X | Y ) + H ( Y | X ) + I ( X ; Y ) , H ( X , Y ) = H ( X ) + H ( Y ) I ( X ; Y ) , I ( X ; Y ) H ( X ) , {\displaystyle {\begin{aligned}\mathrm {H} (Y|X)&\leq \mathrm {H} (Y)\,\\\mathrm {H} (X,Y)&=\mathrm {H} (X|Y)+\mathrm {H} (Y|X)+\operatorname {I} (X;Y),\qquad \\\mathrm {H} (X,Y)&=\mathrm {H} (X)+\mathrm {H} (Y)-\operatorname {I} (X;Y),\,\\\operatorname {I} (X;Y)&\leq \mathrm {H} (X),\,\end{aligned}}}

¿Dónde está la información mutua entre y ? I ( X ; Y ) {\displaystyle \operatorname {I} (X;Y)} X {\displaystyle X} Y {\displaystyle Y}

Para independientes y : X {\displaystyle X} Y {\displaystyle Y}

H ( Y | X ) = H ( Y ) {\displaystyle \mathrm {H} (Y|X)=\mathrm {H} (Y)} y H ( X | Y ) = H ( X ) {\displaystyle \mathrm {H} (X|Y)=\mathrm {H} (X)\,}

Aunque la entropía condicional específica puede ser menor o mayor que para una variable aleatoria dada de , nunca puede exceder de . H ( X | Y = y ) {\displaystyle \mathrm {H} (X|Y=y)} H ( X ) {\displaystyle \mathrm {H} (X)} y {\displaystyle y} Y {\displaystyle Y} H ( X | Y ) {\displaystyle \mathrm {H} (X|Y)} H ( X ) {\displaystyle \mathrm {H} (X)}

Entropía diferencial condicional

Definición

La definición anterior es para variables aleatorias discretas. La versión continua de la entropía condicional discreta se denomina entropía diferencial condicional (o continua) . Sean y variables aleatorias continuas con una función de densidad de probabilidad conjunta . La entropía condicional diferencial se define como [3] : 249  X {\displaystyle X} Y {\displaystyle Y} f ( x , y ) {\displaystyle f(x,y)} h ( X | Y ) {\displaystyle h(X|Y)}

Propiedades

A diferencia de la entropía condicional para variables aleatorias discretas, la entropía diferencial condicional puede ser negativa.

Como en el caso discreto, existe una regla de cadena para la entropía diferencial:

h ( Y | X ) = h ( X , Y ) h ( X ) {\displaystyle h(Y|X)\,=\,h(X,Y)-h(X)} [3] : 253 

Sin embargo, tenga en cuenta que esta regla puede no ser verdadera si las entropías diferenciales involucradas no existen o son infinitas.

La entropía diferencial conjunta también se utiliza en la definición de la información mutua entre variables aleatorias continuas:

I ( X , Y ) = h ( X ) h ( X | Y ) = h ( Y ) h ( Y | X ) {\displaystyle \operatorname {I} (X,Y)=h(X)-h(X|Y)=h(Y)-h(Y|X)}

h ( X | Y ) h ( X ) {\displaystyle h(X|Y)\leq h(X)} con igualdad si y sólo si y son independientes. [3] : 253  X {\displaystyle X} Y {\displaystyle Y}

Relación con el error del estimador

La entropía diferencial condicional produce un límite inferior para el error cuadrático esperado de un estimador . Para cualquier variable aleatoria , observación y estimador, se cumple lo siguiente: [3] : 255  X {\displaystyle X} Y {\displaystyle Y} X ^ {\displaystyle {\widehat {X}}}

E [ ( X X ^ ( Y ) ) 2 ] 1 2 π e e 2 h ( X | Y ) {\displaystyle \mathbb {E} \left[{\bigl (}X-{\widehat {X}}{(Y)}{\bigr )}^{2}\right]\geq {\frac {1}{2\pi e}}e^{2h(X|Y)}}

Esto está relacionado con el principio de incertidumbre de la mecánica cuántica .

Generalización a la teoría cuántica

En la teoría de la información cuántica , la entropía condicional se generaliza a la entropía cuántica condicional . Esta última puede tomar valores negativos, a diferencia de su contraparte clásica.

Véase también

Referencias

  1. ^ "David MacKay: teoría de la información, reconocimiento de patrones y redes neuronales: el libro". www.inference.org.uk . Consultado el 25 de octubre de 2019 .
  2. ^ Hellman, M.; Raviv, J. (1970). "Probabilidad de error, equivocación y límite de Chernoff". IEEE Transactions on Information Theory . 16 (4): 368–372. CiteSeerX 10.1.1.131.2865 . doi :10.1109/TIT.1970.1054466. 
  3. ^ abcdefg T. Cover ; J. Thomas (1991). Elementos de la teoría de la información . Wiley. ISBN 0-471-06259-6.
Retrieved from "https://en.wikipedia.org/w/index.php?title=Conditional_entropy&oldid=1233991266"