Articulo de referencia

Entropía condicional

Diagrama de Venn que muestra relaciones aditivas y sustractivas de diversas medidas de información asociadas con variables correlacionadas incógnita {\displaystyle X} y Y {\disp...

Diagrama de Venn que muestra relaciones aditivas y sustractivas de diversas medidas de información asociadas con variables correlacionadasincógnita{\displaystyle X}yY{\displaystyle Y}El área contenida por ambos círculos es la entropía conjunta .H(incógnita,Y){\displaystyle \mathrm {H} (X,Y)}El círculo de la izquierda (rojo y violeta) es la entropía individual .H(incógnita){\displaystyle \mathrm {H} (X)}donde el rojo representa la entropía condicionalH(incógnita|Y){\displaystyle \mathrm {H} (X|Y)}. El círculo de la derecha (azul y violeta) esH(Y){\displaystyle \mathrm {H} (Y)}, siendo el azul elH(Y|incógnita){\displaystyle \mathrm {H} (Y|X)}La violeta es la información mutuaI(incógnita;Y){\displaystyle \operatorname {I} (X;Y)}.

En teoría de la información , la entropía condicional cuantifica la cantidad de información necesaria para describir el resultado de una variable aleatoria.Y{\displaystyle Y}dado que el valor de otra variable aleatoriaincógnita{\displaystyle X}es conocido. Aquí, la información se mide en shannons , nats o hartleys . La "entropía deY{\displaystyle Y}condicionado aincógnita{\displaystyle X}" se denota comoH(Y|incógnita){\displaystyle \mathrm {H} (Y|X)}.

Definición

La entropía condicional deY{\displaystyle Y}dadoincógnita{\displaystyle X}se define como

H(Y|incógnita) =incógnitaincógnita,yYpag(incógnita,y)registropag(incógnita,y)pag(incógnita){\displaystyle \mathrm {H} (Y|X)\ =-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)\log {\frac {p(x,y)}{p(x)}}}

dóndeincógnita{\displaystyle {\mathcal {X}}}yY{\displaystyle {\mathcal {Y}}}denotamos los conjuntos de soporte deincógnita{\displaystyle X}yY{\displaystyle Y}.

Nota: Aquí, la convención es que la expresión0registro0{\displaystyle 0\log 0}debe tratarse como igual a cero. Esto se debe a quelímiteθ0+θregistroθ=0{\displaystyle \lim _{\theta \to 0^{+}}\theta \,\log \theta =0}. [ 1 ]

Intuitivamente, observe que por definición de valor esperado y de probabilidad condicional ,H(Y|incógnita){\displaystyle \displaystyle H(Y|X)}se puede escribir comoH(Y|incógnita)=mi[F(incógnita,Y)]{\displaystyle H(Y|X)=\mathbb {E} [f(X,Y)]}, dóndeF{\displaystyle f}se define comoF(incógnita,y):=registro(pag(incógnita,y)pag(incógnita))=registro(pag(y|incógnita)){\displaystyle \displaystyle f(x,y):=-\log \left({\frac {p(x,y)}{p(x)}}\right)=-\log(p(y|x))}Uno puede pensar enF{\displaystyle \displaystyle f}como asociando cada par(incógnita,y){\displaystyle \displaystyle (x,y)}con una cantidad que mide el contenido de información de(Y=y){\displaystyle \displaystyle (Y=y)}dado(incógnita=incógnita){\displaystyle \displaystyle (X=x)}Esta cantidad está directamente relacionada con la cantidad de información necesaria para describir el evento.(Y=y){\displaystyle \displaystyle (Y=y)}dado(incógnita=incógnita){\displaystyle (X=x)}. Por lo tanto, al calcular el valor esperado deF{\displaystyle \displaystyle f}sobre todos los pares de valores(incógnita,y)incógnita×Y{\displaystyle (x,y)\in {\mathcal {X}}\times {\mathcal {Y}}}, la entropía condicionalH(Y|incógnita){\displaystyle \displaystyle H(Y|X)}mide cuánta información, en promedio, la variableincógnita{\displaystyle X}codifica sobreY{\displaystyle Y}.

Motivación

DejarH(Y|incógnita=incógnita){\displaystyle \mathrm {H} (Y|X=x)}sea ​​la entropía de la variable aleatoria discretaY{\displaystyle Y}condicionado a la variable aleatoria discretaincógnita{\displaystyle X}tomando cierto valorincógnita{\displaystyle x}. Denotemos los conjuntos de soporte deincógnita{\displaystyle X}yY{\displaystyle Y}porincógnita{\displaystyle {\mathcal {X}}}yY{\displaystyle {\mathcal {Y}}}. DejarY{\displaystyle Y}tienen función de masa de probabilidadpagY(y){\displaystyle p_{Y}{(y)}}. La entropía incondicional deY{\displaystyle Y}se calcula comoH(Y):=mi[I(Y)]{\displaystyle \mathrm {H} (Y):=\mathbb {E} [\operatorname {I} (Y)]}, es decir

H(Y)=yYPAGr(Y=y)I(y)=yYpagY(y)registro2pagY(y),{\displaystyle \mathrm {H} (Y)=\sum _{y\in {\mathcal {Y}}}{\mathrm {Pr} (Y=y)\,\mathrm {I} (y)}=-\sum _{y\in {\mathcal {Y}}}{p_{Y}(y)\log _{2}{p_{Y}(y)}},}

dóndeI(yi){\displaystyle \operatorname {I} (y_{i})}es el contenido informativo del resultado deY{\displaystyle Y}tomando el valoryi{\displaystyle y_{i}}. La entropía deY{\displaystyle Y}condicionado aincógnita{\displaystyle X}tomando el valorincógnita{\displaystyle x}se define por:

H(Y|incógnita=incógnita)=yYPr(Y=y|incógnita=incógnita)registro2Pr(Y=y|incógnita=incógnita).{\displaystyle \mathrm {H} (Y|X=x)=-\sum _{y\in {\mathcal {Y}}}{\Pr(Y=y|X=x)\log _{2}{\Pr(Y=y|X=x)}}.}

Tenga en cuenta queH(Y|incógnita){\displaystyle \mathrm {H} (Y|X)}es el resultado de promediarH(Y|incógnita=incógnita){\displaystyle \mathrm {H} (Y|X=x)}sobre todos los valores posiblesincógnita{\displaystyle x}esoincógnita{\displaystyle X}puede tomar. Además, si la suma anterior se toma sobre una muestray1,,ynorte{\displaystyle y_{1},\dots ,y_{n}}, el valor esperadomiincógnita[H(y1,,ynorteincógnita=incógnita)]{\displaystyle E_{X}[\mathrm {H} (y_{1},\dots ,y_{n}\mid X=x)]}es conocido en algunos dominios comoequivocación . [ 2 ]

Dadas variables aleatorias discretasincógnita{\displaystyle X}con imagenincógnita{\displaystyle {\mathcal {X}}}yY{\displaystyle Y}con imagenY{\displaystyle {\mathcal {Y}}}, la entropía condicional deY{\displaystyle Y}dadoincógnita{\displaystyle X}se define como la suma ponderada deH(Y|incógnita=incógnita){\displaystyle \mathrm {H} (Y|X=x)}para cada posible valor deincógnita{\displaystyle x}, usando pag(incógnita){\displaystyle p(x)}como los pesos: [ 3 ] : 15

H(Y|incógnita) incógnitaincógnitapag(incógnita)H(Y|incógnita=incógnita)=incógnitaincógnitapag(incógnita)yYpag(y|incógnita)registro2pag(y|incógnita)=incógnitaincógnita,yYpag(incógnita)pag(y|incógnita)registro2pag(y|incógnita)=incógnitaincógnita,yYpag(incógnita)pag(y|incógnita)registro2(pag(y|incógnita)pag(incógnita)pag(incógnita))=incógnitaincógnita,yYpag(incógnita,y)registro2pag(incógnita,y)pag(incógnita).{\displaystyle {\begin{aligned}\mathrm {H} (Y|X)\ &\equiv \sum _{x\in {\mathcal {X}}}\,p(x)\,\mathrm {H} (Y|X=x)\\&=-\sum _{x\in {\mathcal {X}}}p(x)\sum _{y\in {\mathcal {Y}}}\,p(y|x)\,\log _{2}\,p(y|x)\\&=-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}\,p(x)p(y|x)\,\log _{2}\,p(y|x)\\&=-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}\,p(x)p(y|x)\,\log _{2}\,\left(p(y|x){\frac {p(x)}{p(x)}}\right)\\&=-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)\log _{2}{\frac {p(x,y)}{p(x)}}.\end{aligned}}}

Propiedades

La entropía condicional es igual a cero.

H(Y|incógnita)=0{\displaystyle \mathrm {H} (Y|X)=0}si y solo si el valor deY{\displaystyle Y}está completamente determinado por el valor deincógnita{\displaystyle X}.

Entropía condicional de variables aleatorias independientes

En cambio,H(Y|incógnita)=H(Y){\displaystyle \mathrm {H} (Y|X)=\mathrm {H} (Y)}si y solo siY{\displaystyle Y}yincógnita{\displaystyle X}son variables aleatorias independientes .

Regla de la cadena

Supongamos que el sistema combinado está determinado por dos variables aleatorias.incógnita{\displaystyle X}yY{\displaystyle Y}tiene entropía conjuntaH(incógnita,Y){\displaystyle \mathrm {H} (X,Y)}, es decir, necesitamosH(incógnita,Y){\displaystyle \mathrm {H} (X,Y)}bits de información en promedio para describir su estado exacto. Ahora bien, si primero aprendemos el valor deincógnita{\displaystyle X}, hemos ganadoH(incógnita){\displaystyle \mathrm {H} (X)}fragmentos de información. Una vezincógnita{\displaystyle X}Se sabe, solo necesitamosH(incógnita,Y)H(incógnita){\displaystyle \mathrm {H} (X,Y)-\mathrm {H} (X)}bits para describir el estado de todo el sistema. Esta cantidad es exactamenteH(Y|incógnita){\displaystyle \mathrm {H} (Y|X)}, lo que da como resultado la regla de la cadena de la entropía condicional:

H(Y|incógnita)=H(incógnita,Y)H(incógnita).{\displaystyle \mathrm {H} (Y|X)\,=\,\mathrm {H} (X,Y)-\mathrm {H} (X).}[ 3 ] : 17

La regla de la cadena se deduce de la definición anterior de entropía condicional:

H(Y|incógnita)=incógnitaincógnita,yYpag(incógnita,y)registro(pag(incógnita)pag(incógnita,y))=incógnitaincógnita,yYpag(incógnita,y)(registro(pag(incógnita))registro(pag(incógnita,y)))=incógnitaincógnita,yYpag(incógnita,y)registro(pag(incógnita,y))+incógnitaincógnita,yYpag(incógnita,y)registro(pag(incógnita))=H(incógnita,Y)+incógnitaincógnitapag(incógnita)registro(pag(incógnita))=H(incógnita,Y)H(incógnita).{\displaystyle {\begin{aligned}\mathrm {H} (Y|X)&=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)\log \left({\frac {p(x)}{p(x,y)}}\right)\\[4pt]&=\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)(\log(p(x))-\log(p(x,y)))\\[4pt]&=-\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}p(x,y)\log(p(x,y))+\sum _{x\in {\mathcal {X}},y\in {\mathcal {Y}}}{p(x,y)\log(p(x))}\\[4pt]&=\mathrm {H} (X,Y)+\sum _{x\in {\mathcal {X}}}p(x)\log(p(x))\\[4pt]&=\mathrm {H} (X,Y)-\mathrm {H} (X).\end{aligned}}}

En general, se cumple la regla de la cadena para múltiples variables aleatorias:

H(incógnita1,incógnita2,,incógnitanorte)=i=1norteH(incógnitai|incógnita1,,incógnitai1){\displaystyle \mathrm {H} (X_{1},X_{2},\ldots ,X_{n})=\sum _{i=1}^{n}\mathrm {H} (X_{i}|X_{1},\ldots ,X_{i-1})}[ 3 ] : 22

Tiene una forma similar a la regla de la cadena en la teoría de la probabilidad , excepto que se utiliza la suma en lugar de la multiplicación.

Regla de Bayes

Regla de Bayes para estados de entropía condicional

H(Y|incógnita)=H(incógnita|Y)H(incógnita)+H(Y).{\displaystyle \mathrm {H} (Y|X)\,=\,\mathrm {H} (X|Y)-\mathrm {H} (X)+\mathrm {H} (Y).}

Prueba.H(Y|incógnita)=H(incógnita,Y)H(incógnita){\displaystyle \mathrm {H} (Y|X)=\mathrm {H} (X,Y)-\mathrm {H} (X)}yH(incógnita|Y)=H(Y,incógnita)H(Y){\displaystyle \mathrm {H} (X|Y)=\mathrm {H} (Y,X)-\mathrm {H} (Y)}La simetría implicaH(incógnita,Y)=H(Y,incógnita){\displaystyle \mathrm {H} (X,Y)=\mathrm {H} (Y,X)}Al restar las dos ecuaciones se cumple la regla de Bayes.

SiY{\displaystyle Y}es condicionalmente independiente deZ{\displaystyle Z}dadoincógnita{\displaystyle X}tenemos:

H(Y|incógnita,Z)=H(Y|incógnita).{\displaystyle \mathrm {H} (Y|X,Z)\,=\,\mathrm {H} (Y|X).}

Otras propiedades

Para cualquierincógnita{\displaystyle X}yY{\displaystyle Y}:

H(Y|incógnita)H(Y)H(incógnita,Y)=H(incógnita|Y)+H(Y|incógnita)+I(incógnita;Y),H(incógnita,Y)=H(incógnita)+H(Y)I(incógnita;Y),I(incógnita;Y)H(incógnita),{\displaystyle {\begin{aligned}\mathrm {H} (Y|X)&\leq \mathrm {H} (Y)\,\\\mathrm {H} (X,Y)&=\mathrm {H} (X|Y)+\mathrm {H} (Y|X)+\operatorname {I} (X;Y),\qquad \\\mathrm {H} (X,Y)&=\mathrm {H} (X)+\mathrm {H} (Y)-\operatorname {I} (X;Y),\,\\\operatorname {I} (X;Y)&\leq \mathrm {H} (X),\,\end{aligned}}}

dóndeI(incógnita;Y){\displaystyle \operatorname {I} (X;Y)}es la información mutua entreincógnita{\displaystyle X}yY{\displaystyle Y}.

Para independientesincógnita{\displaystyle X}yY{\displaystyle Y}:

H(Y|incógnita)=H(Y){\displaystyle \mathrm {H} (Y|X)=\mathrm {H} (Y)}yH(incógnita|Y)=H(incógnita){\displaystyle \mathrm {H} (X|Y)=\mathrm {H} (X)\,}

Aunque la entropía específica-condicionalH(incógnita|Y=y){\displaystyle \mathrm {H} (X|Y=y)}puede ser menor o mayor queH(incógnita){\displaystyle \mathrm {H} (X)}para una variable aleatoria daday{\displaystyle y}deY{\displaystyle Y},H(incógnita|Y){\displaystyle \mathrm {H} (X|Y)}nunca puede excederH(incógnita){\displaystyle \mathrm {H} (X)}.

Entropía diferencial condicional

Definición

La definición anterior es para variables aleatorias discretas. La versión continua de la entropía condicional discreta se llama entropía diferencial condicional (o continua) . Seaincógnita{\displaystyle X}yY{\displaystyle Y}sea ​​una variable aleatoria continua con una función de densidad de probabilidad conjunta.F(incógnita,y){\displaystyle f(x,y)}. La entropía condicional diferencialh(incógnita|Y){\displaystyle h(X|Y)}se define como [ 3 ] : 249

h(incógnita|Y)=incógnita,YF(incógnita,y)registroF(incógnita|y)dincógnitady{\displaystyle h(X|Y)=-\int _{{\mathcal {X}},{\mathcal {Y}}}f(x,y)\log f(x|y)\,dxdy}.

Propiedades

A diferencia de la entropía condicional para variables aleatorias discretas, la entropía diferencial condicional puede ser negativa.

Al igual que en el caso discreto, existe una regla de la cadena para la entropía diferencial:

h(Y|incógnita)=h(incógnita,Y)h(incógnita){\displaystyle h(Y|X)\,=\,h(X,Y)-h(X)}[ 3 ] : 253

Sin embargo, tenga en cuenta que esta regla puede no ser cierta si las entropías diferenciales involucradas no existen o son infinitas.

La entropía diferencial conjunta también se utiliza en la definición de la información mutua entre variables aleatorias continuas:

I(incógnita,Y)=h(incógnita)h(incógnita|Y)=h(Y)h(Y|incógnita){\displaystyle \operatorname {I} (X,Y)=h(X)-h(X|Y)=h(Y)-h(Y|X)}
h(incógnita|Y)h(incógnita){\displaystyle h(X|Y)\leq h(X)}con igualdad si y solo siincógnita{\displaystyle X}yY{\displaystyle Y}son independientes. [ 3 ] : 253

Relación con el error del estimador

La entropía diferencial condicional proporciona una cota inferior para el error cuadrático esperado de un estimador . Para cualquier variable aleatoria gaussianaincógnita{\displaystyle X}, observaciónY{\displaystyle Y}y estimadorincógnita^{\displaystyle {\widehat {X}}}Se cumple lo siguiente: [ 3 ] : 255

mi[(incógnitaincógnita^(Y))2]12πmimi2h(incógnita|Y){\displaystyle \mathbb {E} \left[{\bigl (}X-{\widehat {X}}{(Y)}{\bigr )}^{2}\right]\geq {\frac {1}{2\pi e}}e^{2h(X|Y)}}

Esto está relacionado con el principio de incertidumbre de la mecánica cuántica .

Generalización a la teoría cuántica

En la teoría de la información cuántica , la entropía condicional se generaliza a la entropía cuántica condicional . Esta última puede tomar valores negativos, a diferencia de su contraparte clásica.

Véase también

Referencias

  1. "David MacKay: Teoría de la información, reconocimiento de patrones y redes neuronales: El libro" . www.inference.org.uk . Consultado el 25 de octubre de 2019 .
  2. Hellman, M.; Raviv, J. (1970). "Probabilidad de error, equivocación y el límite de Chernoff". IEEE Transactions on Information Theory . 16 (4): 368– 372. CiteSeerX 10.1.1.131.2865 . doi : 10.1109/TIT.1970.1054466 . 
  3. 1 2 3 4 5 6 7 T. Cover ; J. Thomas (1991). Elementos de la teoría de la información . Wiley. ISBN 0-471-06259-6.