Articulo de referencia

distribución de probabilidad de entropía máxima

En estadística y teoría de la información , una distribución de probabilidad de máxima entropía tiene una entropía al menos igual a la de todos los demás miembros de una clase e...

En estadística y teoría de la información , una distribución de probabilidad de máxima entropía tiene una entropía al menos igual a la de todos los demás miembros de una clase específica de distribuciones de probabilidad . Según el principio de máxima entropía , si no se sabe nada sobre una distribución excepto que pertenece a una clase determinada (generalmente definida en términos de propiedades o medidas específicas), entonces la distribución con la mayor entropía debe elegirse como la menos informativa por defecto. La motivación es doble: primero, maximizar la entropía minimiza la cantidad de información previa incorporada en la distribución; segundo, muchos sistemas físicos tienden a evolucionar hacia configuraciones de máxima entropía con el tiempo.

Definición de entropía y entropía diferencial

Siincógnita{\displaystyle X}es una variable aleatoria continua con densidad de probabilidadpag(incógnita){\displaystyle p(x)}, entonces la entropía diferencial deincógnita{\displaystyle X}se define como [ 1 ] [ 2 ] [ 3 ]

H(incógnita)=pag(incógnita)registropag(incógnita)dincógnita .{\displaystyle H(X)=-\int _{-\infty }^{\infty }p(x)\log p(x)\,dx~.}

Siincógnita{\displaystyle X}es una variable aleatoria discreta con distribución dada por Pr(incógnita=incógnitak)=pagk para k=1,2,{\displaystyle \Pr(X{=}x_{k})=p_{k}\qquad {\text{ para }}\quad k=1,2,\ldots } entonces la entropía deincógnita{\displaystyle X}se define como H(incógnita)=k1pagkregistropagk.{\displaystyle H(X)=-\sum _{k\geq 1}p_{k}\log p_{k}\,.}

El término aparentemente divergentepag(incógnita)registropag(incógnita){\displaystyle p(x)\log p(x)}se reemplaza por cero, siempre quepag(incógnita)=0.{\displaystyle p(x)=0\,.}

Este es un caso especial de formas más generales descritas en los artículos Entropía (teoría de la información) , Principio de máxima entropía y Entropía diferencial. En relación con las distribuciones de máxima entropía, esta es la única necesaria, porque maximizarH(incógnita){\displaystyle H(X)}También maximizará las formas más generales.

La base del logaritmo no es importante, siempre que se utilice la misma de forma consistente: un cambio de base simplemente produce un reescalamiento de la entropía. Los teóricos de la información pueden preferir usar la base  2 para expresar la entropía en bits ; los matemáticos y físicos suelen preferir el logaritmo natural , lo que da como resultado una unidad de "nat" para la entropía.

Sin embargo, la medida elegidadincógnita{\displaystyle dx}Es crucial, aunque el uso típico de la medida de Lebesgue se defiende a menudo como una elección "natural": la medida que se elija determina la entropía y la consiguiente distribución de entropía máxima.

Distribuciones con constantes medidas

Muchas distribuciones estadísticas de interés práctico son aquellas en las que los momentos u otras cantidades medibles están restringidos a ser constantes. El siguiente teorema de Ludwig Boltzmann proporciona la forma de la densidad de probabilidad bajo estas restricciones.

caso continuo

SuponerS{\displaystyle S}es un subconjunto continuo y cerrado de los números realesR{\displaystyle \mathbb {R} }y elegimos especificarnorte{\displaystyle n}funciones mediblesF1,,Fnorte{\displaystyle f_{1},\ldots ,f_{n}}ynorte{\displaystyle n}númerosa1,,anorte.{\displaystyle a_{1},\ldots ,a_{n}.}Consideramos la clasedo{\displaystyle C}de todas las variables aleatorias de valor real que están soportadas enS{\displaystyle S}(es decir, cuya función de densidad es cero fuera deS{\displaystyle S}) y que satisfacen lanorte{\displaystyle n}condiciones del momento:

mi[Fj(incógnita)]ajpara j=1,,norte{\displaystyle \operatorname {E} [f_{j}(X)]\geq a_{j}\qquad {\text{para }}\quad j=1,\ldots ,n}

Si hay un miembro endo{\displaystyle C}cuya función de densidad es positiva en todas partesS,{\displaystyle S,}y si existe una distribución de entropía máxima parado,{\displaystyle C,}entonces su densidad de probabilidadpag(incógnita){\displaystyle p(x)}tiene la siguiente forma:

pag(incógnita)=exp(j=0norteλjFj(incógnita)) a pesar de  incógnitaS{\displaystyle p(x)=\exp \left(\sum _{j=0}^{n}\lambda _{j}f_{j}(x)\right)\qquad {\text{ para todo }}~x\in S}

donde asumimos queF0(incógnita)=1.{\displaystyle f_{0}(x)=1\,.}La constanteλ0{\displaystyle \lambda _{0}}y elnorte{\displaystyle n}multiplicadores de Lagrangeλ=(λ1,,λnorte){\displaystyle {\boldsymbol {\lambda }}=(\lambda _{1},\ldots ,\lambda _{n})}resolver el problema de optimización con restricciones cona0=1{\displaystyle a_{0}=1}(lo que garantiza quepag{\displaystyle p}se integra a la unidad): [ 4 ]

máximoλ0;λ{j=0norteλjajexp(j=0norteλjFj(incógnita))dincógnita}  sujeto a  λ0{\displaystyle \max _{\lambda _{0};\,{\boldsymbol {\lambda }}}\left\{\sum _{j=0}^{n}\lambda _{j}a_{j}-\int \exp \left(\sum _{j=0}^{n}\lambda _{j}f_{j}(x)\right)dx\right\}\qquad ~{\text{ sujeto a }}~{\boldsymbol {\lambda }}\geq \mathbf {0} }

Utilizando las condiciones de Karush-Kuhn-Tucker , se puede demostrar que el problema de optimización tiene una solución única porque la función objetivo en la optimización es cóncava enλ.{\displaystyle {\boldsymbol {\lambda }}\,.}

Tenga en cuenta que cuando las restricciones de momento son igualdades (en lugar de desigualdades), es decir,

mi[Fj(incógnita)]=aj para  j=1,,norte,{\displaystyle \operatorname {E} [f_{j}(X)]=a_{j}\qquad {\text{ para }}~j=1,\ldots ,n\,,}

entonces la condición de restricciónλ0{\displaystyle {\boldsymbol {\lambda }}\geq \mathbf {0} }se puede omitir, lo que hace que la optimización sobre los multiplicadores de Lagrange no tenga restricciones.

Caso discreto

SuponerS={incógnita1,incógnita2,}{\displaystyle S=\{x_{1},x_{2},\ldots \}}es un subconjunto discreto (finito o infinito) de los números reales, y que elegimos especificarnorte{\displaystyle n}funcionesF1,,Fnorte{\displaystyle f_{1},\ldots ,f_{n}}ynorte{\displaystyle n}númerosa1,,anorte.{\displaystyle a_{1},\ldots ,a_{n}\,.}Consideramos la clasedo{\displaystyle C}de todas las variables aleatorias discretasincógnita{\displaystyle X}que son compatibles conS{\displaystyle S}y que satisfacen lanorte{\displaystyle n}condiciones de momento

mi[Fj(incógnita)]aj  para  j=1,,norte{\displaystyle \operatorname {E} [f_{j}(X)]\geq a_{j}\qquad ~{\text{ para }}~j=1,\ldots ,n}

Si existe un miembro de la clasedo{\displaystyle C}que asigna probabilidad positiva a todos los miembros deS{\displaystyle S}y si existe una distribución de entropía máxima parado,{\displaystyle C,}Entonces, esta distribución tiene la siguiente forma:

Pr(incógnita=incógnitak)=exp(j=0norteλjFj(incógnitak)) para  k=1,2,{\displaystyle \Pr(X{=}x_{k})=\exp \left(\sum _{j=0}^{n}\lambda _{j}f_{j}(x_{k})\right)\qquad {\text{ para }}~k=1,2,\ldots }

donde asumimos queF0=1{\displaystyle f_{0}=1}y las constantesλ0,λ(λ1,,λnorte){\displaystyle \lambda _{0},\,{\boldsymbol {\lambda }}\equiv (\lambda _{1},\ldots ,\lambda _{n})}resolver el problema de optimización con restricciones cona0=1{\displaystyle a_{0}=1}: [ 5 ]

máximoλ0;λ{j=0norteλjajk1exp(j=0norteλjFj(incógnitak))} para qué  λ0{\displaystyle \max _{\lambda _{0};\,{\boldsymbol {\lambda }}}\left\{\sum _{j=0}^{n}\lambda _{j}a_{j}-\sum _{k\geq 1}\exp \left(\sum _{j=0}^{n}\lambda _{j}f_{j}(x_{k})\right)\right\}\qquad {\text{ para el cual }}~{\boldsymbol {\lambda }}\geq \mathbf {0} }

Nuevamente como se indicó anteriormente, si las condiciones de momento son igualdades (en lugar de desigualdades), entonces la condición de restricciónλ0{\displaystyle {\boldsymbol {\lambda }}\geq \mathbf {0} }no está presente en la optimización.

Demostración en el caso de restricciones de igualdad

En el caso de restricciones de igualdad, este teorema se demuestra con el cálculo de variaciones y los multiplicadores de Lagrange . Las restricciones se pueden escribir como

Fj(incógnita)pag(incógnita)dincógnita=aj{\displaystyle \int _{-\infty }^{\infty }f_{j}(x)p(x)\,dx=a_{j}}

Consideramos la función

J(pag)=pag(incógnita)lnpag(incógnita)dincógnitaη0(pag(incógnita)dincógnita1)j=1norteλj(Fj(incógnita)pag(incógnita)dincógnitaaj){\displaystyle J(p)=\int _{-\infty }^{\infty }p(x)\ln {p(x)}\,dx-\eta _{0}\left(\int _{-\infty }^{\infty }p(x)\,dx-1\right)-\sum _{j=1}^{n}\lambda _{j}\left(\int _{-\infty }^{\infty }f_{j}(x)p(x)\,dx-a_{j}\right)}

dóndeη0{\displaystyle \eta _{0}}yλj,j1{\displaystyle \lambda _{j},j\geq 1}son los multiplicadores de Lagrange. La restricción cero garantiza el segundo axioma de probabilidad . Las otras restricciones son que las mediciones de la función se dan como constantes hasta el ordennorte{\displaystyle n}La entropía alcanza un valor extremo cuando la derivada funcional es igual a cero:

δJ(pag)δpag=lnpag(incógnita)+1η0j=1norteλjFj(incógnita)=0{\displaystyle {\frac {\delta J(p)}{\delta p}}=\ln {p(x)}+1-\eta _{0}-\sum _{j=1}^{n}\lambda _{j}f_{j}(x)=0}

Por lo tanto, la distribución de probabilidad de entropía extremal en este caso debe tener la forma (λ0:=η01{\displaystyle \lambda _{0}:=\eta _{0}-1}),

pag(incógnita)=mi1+η0mij=1norteλjFj(incógnita)=exp(j=0norteλjFj(incógnita)),{\displaystyle p(x)=e^{-1+\eta _{0}}\,e^{\sum _{j=1}^{n}\lambda _{j}f_{j}(x)}=\exp \left(\sum _{j=0}^{n}\lambda _{j}f_{j}(x)\right),}

recordando queF0(incógnita)=1{\displaystyle f_{0}(x)=1}Se puede verificar que esta es la solución máxima comprobando que la variación alrededor de esta solución es siempre negativa.

Unicidad del máximo

Suponerpag{\displaystyle p}ypag{\displaystyle p'}son distribuciones que satisfacen las restricciones de expectativa. Seaα(0,1){\displaystyle \alpha \in (0,1)}y considerando la distribuciónq=αpag+(1α)pag{\displaystyle q=\alpha \,p+(1-\alpha )\,p'}Es evidente que esta distribución satisface las restricciones de expectativa y además tiene como soportesuplemento(q)=suplemento(pag)suplemento(pag).{\displaystyle \operatorname {supp} (q)=\operatorname {supp} (p)\cup \operatorname {supp} (p')\,.}A partir de hechos básicos sobre la entropía, se sostiene queH(q)αH(pag)+(1α)H(pag).{\displaystyle {\mathcal {H}}(q)\geq \alpha \,{\mathcal {H}}(p)+(1-\alpha )\,{\mathcal {H}}(p').}Tomar límitesα1{\displaystyle \alpha \to 1}yα0,{\displaystyle \alpha \to 0\,,}respectivamente, rendimientosH(q)H(pag),H(pag).{\displaystyle {\mathcal {H}}(q)\geq {\mathcal {H}}(p),{\mathcal {H}}(p')\,.}

De ello se deduce que una distribución que satisface las restricciones de expectativa y maximiza la entropía debe necesariamente tener soporte completo, es decir, la distribución es casi en todas partes estrictamente positiva. Por consiguiente, la distribución que maximiza la entropía debe ser un punto interno en el espacio de distribuciones que satisfacen dichas restricciones, es decir, debe ser un extremo local. Por lo tanto, basta con demostrar que el extremo local es único para demostrar que la distribución que maximiza la entropía es única (y esto también demuestra que el extremo local es el máximo global).

Suponerpag{\displaystyle p}ypag{\displaystyle p'}son extremos locales. Reformulando los cálculos anteriores, estos se caracterizan por parámetrosλ,λRnorte{\displaystyle {\boldsymbol {\lambda }},\,{\boldsymbol {\lambda }}'\in \mathbb {R} ^{n}}a través depag(incógnita)=expλ,F(incógnita)/do(λ){\displaystyle p(x)={\exp \left\langle {\boldsymbol {\lambda }},\mathbf {f} (x)\right\rangle }/{C({\boldsymbol {\lambda }})}}y de manera similar parapag,{\displaystyle p',}dóndedo(λ)=Rexpλ,F(incógnita)dincógnita.{\textstyle C({\boldsymbol {\lambda }})=\int _{\mathbb {R} }\exp \left\langle {\boldsymbol {\lambda }},\mathbf {f} (x)\right\rangle \,dx\,.}Ahora observamos una serie de identidades: Mediante la satisfacción de las restricciones de expectativa y la utilización de gradientes / derivadas direccionales, se tiene

Dregistrodo()|λ=Ddo()do()|λ=mipag[F(incógnita)]=a{\displaystyle {\left.D\log C(\cdot )\right|}_{\boldsymbol {\lambda }}={\left.{\tfrac {DC(\cdot )}{C(\cdot )}}\right|}_{\boldsymbol {\lambda }}=\operatorname {E} _{p}\left[\mathbf {f} (X)\right]=\mathbf {a} }y de manera similar paraλ .{\displaystyle {\boldsymbol {\lambda }}'~.}Alquiler=λλRnorte{\displaystyle u={\boldsymbol {\lambda }}'-{\boldsymbol {\lambda }}\in \mathbb {R} ^{n}}se obtiene:

0=,aa=Dregistrodo()|λDregistrodo()|λ=D2registrodo()|γ{\displaystyle 0=\left\langle u,\mathbf {a} -\mathbf {a} \right\rangle ={\left.D_{u}\log C(\cdot )\right|}_{{\boldsymbol {\lambda }}'}-{\left.D_{u}\log C(\cdot )\right|}_{\boldsymbol {\lambda }}={\left.D_{u}^{2}\log C(\cdot )\right|}_{\boldsymbol {\gamma }}}

dóndeγ=θλ+(1θ)λ{\displaystyle {\boldsymbol {\gamma }}=\theta {\boldsymbol {\lambda }}+(1-\theta ){\boldsymbol {\lambda }}'}para algunosθ(0,1).{\displaystyle \theta \in (0,1).}Calculando más a fondo, uno tiene

0=D2registrodo()|γ=D(Ddo()do())|γ=D2do()do()|γ(Ddo())2do()2|γ=miq[,F(incógnita)2](miq[,F(incógnita)])2=Varq[,F(incógnita)]{\displaystyle {\begin{aligned}0&={\left.D_{u}^{2}\log C(\cdot )\right|}_{\boldsymbol {\gamma }}\\[1ex]&={\left.D_{u}\left({\frac {D_{u}C(\cdot )}{C(\cdot )}}\right)\right|}_{\boldsymbol {\gamma }}={\left.{\frac {D_{u}^{2}C(\cdot )}{C(\cdot )}}\right|}_{\boldsymbol {\gamma }}-{\left.{\frac {{\left(D_{u}C(\cdot )\right)}^{2}}{C(\cdot )^{2}}}\right|}_{\boldsymbol {\gamma }}\\[1ex]&=\operatorname {E} _{q}\left[{\left\langle u,\mathbf {f} (X)\right\rangle }^{2}\right]-{\left(\operatorname {E} _{q}\left[\left\langle u,\mathbf {f} (X)\right\rangle \right]\right)}^{2}\\[2ex]&=\operatorname {Var} _{q}\left[\left\langle u,\mathbf {f} (X)\right\rangle \right]\end{aligned}}}

dóndeq{\displaystyle q}es similar a la distribución anterior, solo que parametrizada porγ ,{\displaystyle {\boldsymbol {\gamma }}~,}Suponiendo que ninguna combinación lineal no trivial de las observables es casi en todas partes (ae) constante, (lo cual, por ejemplo, se cumple si las observables son independientes y no ae constantes), se cumple que,F(incógnita){\displaystyle \langle u,\mathbf {f} (X)\rangle }tiene varianza distinta de cero, a menos que=0 .{\displaystyle u=0~.}De la ecuación anterior se deduce que esto último debe ser cierto. Por lo tanto,λλ==0,{\displaystyle {\boldsymbol {\lambda }}'-{\boldsymbol {\lambda }}=u=0\,,}por lo tanto los parámetros que caracterizan los extremos localespag,pag{\displaystyle p,\,p'}son idénticas, lo que significa que las distribuciones en sí mismas son idénticas. Por lo tanto, el extremo local es único y, según lo expuesto anteriormente, el máximo es único, siempre que exista realmente un extremo local.

Advertencias

Nótese que no todas las clases de distribuciones contienen una distribución de entropía máxima. Es posible que una clase contenga distribuciones de entropía arbitrariamente grande (por ejemplo, la clase de todas las distribuciones continuas en R con media 0 pero desviación estándar arbitraria), o que las entropías estén acotadas superiormente pero no haya ninguna distribución que alcance la entropía máxima. [ a ] ​​También es posible que las restricciones del valor esperado para la clase C obliguen a que la distribución de probabilidad sea cero en ciertos subconjuntos de S. En ese caso , nuestro teorema no se aplica, pero se puede solucionar reduciendo el conjunto S.

Ejemplos

Toda distribución de probabilidad es trivialmente una distribución de probabilidad de máxima entropía bajo la restricción de que la distribución tiene su propia entropía. Para ver esto, reescribamos la densidad comopag(incógnita)=exp(lnpag(incógnita)){\displaystyle p(x)=\exp {(\ln {p(x)})}}y comparar con la expresión del teorema anterior. Al elegirlnpag(incógnita)F(incógnita){\displaystyle \ln {p(x)}\rightarrow f(x)}ser la función medible y

exp(F(incógnita))F(incógnita)dincógnita=H{\displaystyle \int \exp {(f(x))}f(x)dx=-H}

ser la constante,pag(incógnita){\displaystyle p(x)}es la distribución de probabilidad de entropía máxima bajo la restricción

pag(incógnita)F(incógnita)dincógnita=H.{\displaystyle \int p(x)f(x)\,dx=-H.}

Ejemplos no triviales son distribuciones que están sujetas a múltiples restricciones que son diferentes de la asignación de la entropía. Estos se encuentran a menudo comenzando con el mismo procedimiento.lnpag(incógnita)F(incógnita){\displaystyle \ln {p(x)}\to f(x)}y descubriendo queF(incógnita){\displaystyle f(x)}puede separarse en partes.

En Lisman (1972) [ 6 ] y Park & ​​Bera (2009) [ 7 ] se presenta una tabla con ejemplos de distribuciones de máxima entropía.

Distribuciones uniformes y uniformes por partes

La distribución uniforme en el intervalo [ a , b ] es la distribución de máxima entropía entre todas las distribuciones continuas que se encuentran en el intervalo [ a , b ], y por lo tanto la densidad de probabilidad es 0 fuera del intervalo. Esta densidad uniforme puede relacionarse con el principio de indiferencia de Laplace , a veces llamado principio de razón insuficiente. De manera más general, si se nos da una subdivisión a = a₀ < a₁ < ... < aᵏ = b del intervalo [ a , b ] y probabilidades p₁ , ..., pᵏ que suman uno, entonces podemos considerar la clase de todas las distribuciones continuas tales quePr(aj1incógnita<aj)=pagj para j=1,,k{\displaystyle \Pr(a_{j-1}\leq X<a_{j})=p_{j}\quad {\text{ for }}j=1,\ldots ,k} La densidad de la distribución de máxima entropía para esta clase es constante en cada uno de los intervalos [ a j −1 , a j ). La distribución uniforme en el conjunto finito { x 1 ,..., x n } (que asigna una probabilidad de 1/ n a cada uno de estos valores) es la distribución de máxima entropía entre todas las distribuciones discretas admitidas en este conjunto.

Media positiva y especificada: la distribución exponencial

La distribución exponencial , para la cual la función de densidad es

pag(incógnita|λ)={λmiλincógnitaincógnita0,0incógnita<0,{\displaystyle p(x|\lambda )={\begin{cases}\lambda e^{-\lambda x}&x\geq 0,\\0&x<0,\end{cases}}}

es la distribución de entropía máxima entre todas las distribuciones continuas admitidas en [0,∞) que tienen una media especificada de 1/λ.

En el caso de distribuciones con soporte en [0,∞), la distribución de máxima entropía depende de las relaciones entre el primer y el segundo momento. En casos específicos, puede ser la distribución exponencial, otra distribución o incluso indefinible. [ 8 ]

Media y varianza especificadas: la distribución normal

La distribución normal N ( μ , σ 2 ), para la cual la función de densidad es

pag(incógnita|μ,σ)=1σ2πmi(incógnitaμ)22σ2,{\displaystyle p(x|\mu ,\sigma )={\frac {1}{\sigma {\sqrt {2\pi }}}}e^{-{\frac {(x-\mu )^{2}}{2\sigma ^{2}}}},}

Presenta la máxima entropía entre todas las distribuciones de valores reales soportadas en ( ∞,∞) con una varianza σ 2 especificada (un momento particular ). Lo mismo ocurre cuando se especifican la media μ y la varianza σ 2 (los dos primeros momentos), ya que la entropía es invariante bajo traslaciones en ( ∞,∞). Por lo tanto, la suposición de normalidad impone la restricción estructural a priori mínima más allá de estos momentos. (Véase el artículo sobre entropía diferencial para una derivación).

Distribuciones discretas con media especificada

Entre todas las distribuciones discretas admitidas en el conjunto { x 1 ,..., x n } con una media μ especificada, la distribución de máxima entropía tiene la siguiente forma: Pr(incógnita=incógnitak)=dorincógnitak para k=1,,norte{\displaystyle \Pr(X{=}x_{k})=Cr^{x_{k}}\quad {\text{ for }}k=1,\ldots ,n} donde las constantes positivas C y r pueden determinarse mediante los requisitos de que la suma de todas las probabilidades debe ser 1 y el valor esperado debe ser μ.

Por ejemplo, si se lanza un gran número N de dados y se le dice que la suma de todos los números mostrados es S. Basándose únicamente en esta información, ¿cuál sería una suposición razonable para la cantidad de dados que muestran 1, 2, ..., 6? Este es un ejemplo de la situación considerada anteriormente, con { x 1 , ... , x 6 } = {1,...,6} y μ = S / N.

Finalmente, entre todas las distribuciones discretas soportadas en el conjunto infinito{incógnita1,incógnita2,...}{\displaystyle \{x_{1},x_{2},...\}}con media μ , la distribución de máxima entropía tiene la forma: Pr(incógnita=incógnitak)=dorincógnitak para k=1,2,,{\displaystyle \Pr(X{=}x_{k})=Cr^{x_{k}}\quad {\text{ for }}k=1,2,\ldots ,} donde nuevamente las constantes C y r se determinaron por los requisitos de que la suma de todas las probabilidades debe ser 1 y el valor esperado debe ser μ. Por ejemplo, en el caso de que x k = k , esto da do=1μ1,r=μ1μ,{\displaystyle C={\frac {1}{\mu -1}},\quad \quad r={\frac {\mu -1}{\mu }},}

de tal manera que la distribución de máxima entropía respectiva sea la distribución geométrica .

Variables aleatorias circulares

Para una variable aleatoria continuaθi{\displaystyle \theta _{i}}Distribuida alrededor del círculo unitario, la distribución de Von Mises maximiza la entropía cuando se especifican las partes real e imaginaria del primer momento circular [ 9 ] o, equivalentemente, se especifican la media circular y la varianza circular .

Cuando la media y la varianza de los ángulosθi{\displaystyle \theta _{i}}módulo2π{\displaystyle 2\pi }Se especifican, la distribución normal envuelta maximiza la entropía. [ 9 ]

Maximizador para media, varianza y asimetría especificadas.

Existe un límite superior para la entropía de variables aleatorias continuas enR{\displaystyle \mathbb {R} }con una media, varianza y asimetría especificadas. Sin embargo, no existe ninguna distribución que alcance este límite superior , porquepag(incógnita)=doexp(λ1incógnita+λ2incógnita2+λ3incógnita3){\displaystyle p(x)=c\exp {(\lambda _{1}x+\lambda _{2}x^{2}+\lambda _{3}x^{3})}}es ilimitado cuandoλ30{\displaystyle \lambda _{3}\neq 0}(véase Cover  y Thomas (2006: capítulo 12)).

Sin embargo, la entropía máxima es alcanzable con una entropía ε : la entropía de una distribución puede estar arbitrariamente cerca del límite superior. Partimos de una distribución normal con la media y la varianza especificadas. Para introducir una asimetría positiva, perturbamos la distribución normal ligeramente hacia arriba, con un valor varias σ mayor que la media. La asimetría, al ser proporcional al tercer momento, se verá más afectada que los momentos de orden inferior.

Este es un caso especial del caso general en el que la exponencial de cualquier polinomio de orden impar en x no estará acotada.R{\displaystyle \mathbb {R} }. Por ejemplo,domiλincógnita{\displaystyle ce^{\lambda x}}Asimismo, no tendrá límites.R{\displaystyle \mathbb {R} }, pero cuando el soporte se limita a un intervalo acotado o semiacotado, se puede alcanzar el límite superior de entropía (por ejemplo, si x se encuentra en el intervalo [0, ] y λ <  0 , se obtendrá la distribución exponencial ).

Maximizador para una medida de riesgo de media y desviación especificada

Toda distribución con densidad logarítmicamente cóncava es una distribución de entropía máxima con media μ y medida de riesgo de desviación D  especificadas . [ 10 ]

En particular, la distribución de entropía máxima con media especificadami(incógnita)μ{\displaystyle E(X)\equiv \mu }y desviaciónD(incógnita)d{\displaystyle D(X)\equiv d}es:

  • La distribución normalnorte(metro,d2),{\displaystyle {\mathcal {N}}(m,d^{2}),}siD(incógnita)=mi[(incógnitaμ)2]{\textstyle D(X)={\sqrt {\operatorname {E} \left[{\left(X-\mu \right)}^{2}\right]}}}es la desviación estándar ;
  • La distribución de Laplace , siD(incógnita)=mi{|incógnitaμ|}{\displaystyle D(X)=\operatorname {E} \left\{\left|X-\mu \right|\right\}}es la desviación absoluta media ; [ 6 ]
  • La distribución con densidad de la formaF(incógnita)=doexp(aincógnita+bincógnitaμ2){\displaystyle f(x)=c\exp \left(ax+b{\downharpoonright x-\mu \downharpoonleft }_{-}^{2}\right)}siD(incógnita)=mi{incógnitaμ2}{\textstyle D(X)={\sqrt {\operatorname {E} \left\{{\downharpoonright X-\mu \downharpoonleft }_{-}^{2}\right\}}}}es la semidesviación estándar inferior, dondea,b,do{\displaystyle a,b,c}son constantes y la funciónymin{0,y}  para cualquier yR,{\displaystyle \downharpoonright y\downharpoonleft _{-}\equiv \min \left\{0,y\right\}~{\text{ for any }}y\in \mathbb {R} \,,}Devuelve solo los valores negativos de su argumento, de lo contrario cero. [ 10 ]

Otros ejemplos

En la tabla siguiente, cada distribución enumerada maximiza la entropía para un conjunto particular de restricciones funcionales enumeradas en la tercera columna, y la restricción queincógnita{\displaystyle x}estar incluido en el soporte de la densidad de probabilidad, que se enumera en la cuarta columna. [ 6 ] [ 7 ]

Varios ejemplos enumerados ( Bernoulli , geométrico , exponencial , Laplace , Pareto ) son trivialmente ciertos, ya que sus restricciones asociadas son equivalentes a la asignación de su entropía. Se incluyen de todos modos porque su restricción está relacionada con una magnitud común o fácilmente medible.

Para referencia,Γ(incógnita)=0mittincógnita1dt{\displaystyle \Gamma (x)=\int _{0}^{\infty }e^{-t}t^{x-1}\,dt}es la función gamma ,ψ(incógnita)=ddincógnitalnΓ(incógnita)=Γ(incógnita)Γ(incógnita){\displaystyle \psi (x)={\frac {d}{dx}}\ln \Gamma (x)={\frac {\Gamma '(x)}{\Gamma (x)}}}es la función digamma ,B(pag,q)=Γ(pag)Γ(q)Γ(pag+q){\displaystyle B(p,q)={\frac {\Gamma (p)\,\Gamma (q)}{\Gamma (p+q)}}}es la función beta yγmi{\displaystyle \gamma _{\mathsf {E}}}es la constante de Euler-Mascheroni .

El principio de máxima entropía puede utilizarse para establecer un límite superior a la entropía de las mezclas estadísticas. [ 13 ]

Véase también

Notas

  1. Por ejemplo, la clase de todas las distribuciones continuas X en R con E( X ) = 0 y E( X 2 ) = E( X 3 ) = 1 (ver Portada, Cap. 12).

Citas

  1. Williams, D. (2001). Sopesando las probabilidades . Cambridge University Press . págs. 197–199 . ISBN  0-521-00618-X.
  2. Bernardo, JM; Smith, AFM (2000). Teoría bayesiana . Wiley. págs. 209, 366. ISBN  0-471-49464-X.
  3. O'Hagan, A. (1994), Inferencia bayesiana . Teoría avanzada de la estadística de Kendall. Vol. 2B. Edward Arnold . 1994. Sección 5.40. ISBN   0-340-52922-9.
  4. Botev, ZI; Kroese, DP (2011). "El método generalizado de entropía cruzada, con aplicaciones a la estimación de la densidad de probabilidad" (PDF) . Metodología y computación en probabilidad aplicada . 13 (1): 1– 27. doi : 10.1007/s11009-009-9133-7 . S2CID 18155189 . 
  5. Botev, ZI; Kroese, DP (2008). "Selección de ancho de banda no asintótico para la estimación de densidad de datos discretos". Metodología y computación en probabilidad aplicada . 10 (3): 435. doi : 10.1007/s11009-007-9057-zv (inactivo el 1 de julio de 2025). S2CID 122047337 . {{cite journal}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace )
  6. 1 2 3 Lisman, JHC; van Zuylen, MCA (1972). "Nota sobre la generación de distribuciones de frecuencia más probables". Statistica Neerlandica . 26 (1): 19– 23. doi : 10.1111/j.1467-9574.1972.tb00152.x .
  7. 1 2 Park, Sung Y.; Bera, Anil K. (2009). "Modelo de heterocedasticidad condicional autorregresiva de máxima entropía" (PDF) . Journal of Econometrics . 150 (2): 219– 230. CiteSeerX 10.1.1.511.9750 . doi : 10.1016/j.jeconom.2008.12.014 . Archivado del original (PDF) el 7 de marzo de 2016. Recuperado el 2 de junio de 2011 . 
  8. Dowson, D.; Wragg, A. (septiembre de 1973). "Distribuciones de máxima entropía con primeros y segundos momentos prescritos". IEEE Transactions on Information Theory (correspondencia). 19 (5): 689– 693. doi : 10.1109/tit.1973.1055060 . ISSN 0018-9448 . 
  9. 1 2 Jammalamadaka, S. Rao; SenGupta, A. (2001). Temas de estadística circular . Nueva Jersey: World Scientific. ISBN 978-981-02-3778-3. Consultado el 15 de mayo de 2011 .
  10. 1 2 Grechuk, Bogdan; Molyboha, Anton; Zabarankin, Michael (2009). "Principio de máxima entropía con medidas de desviación generales" . Matemáticas de la Investigación Operativa . 34 (2): 445– 467. doi : 10.1287/moor.1090.0377 vía researchgate.net.
  11. 1 2 Harremös, Peter (2001). "Distribuciones binomiales y de Poisson como distribuciones de máxima entropía". IEEE Transactions on Information Theory . 47 (5): 2039– 2041. doi : 10.1109/18.930936 . S2CID 16171405 . 
  12. ^ Baek, Seung Ki; Bernhardsson, Sebastián; Minnhagen, Petter (7 de abril de 2011). «La ley de Zipf descomprimida» (PDF) . Nueva Revista de Física . 13 .
  13. Nielsen, Frank; Nock, Richard (2017). "Límites superiores de MaxEnt para la entropía diferencial de distribuciones continuas univariadas". IEEE Signal Processing Letters . 24 (4). IEEE : 402–406 . Bibcode : 2017ISPL...24..402N . doi : 10.1109/LSP.2017.2666792 . S2CID 14092514 . 

Referencias

  • Cover, TM ; Thomas, JA (2006). «Capítulo 12, Entropía máxima» (PDF) . Elementos de la teoría de la información (2.ª  ed.). Wiley. ISBN 978-0471241959.
  • F. Nielsen, R. Nock (2017), Límites superiores de MaxEnt para la entropía diferencial de distribuciones continuas univariadas , IEEE Signal Processing Letters , 24(4), 402–406
  • IJ Taneja (2001), Medidas de información generalizadas y sus aplicaciones . Capítulo 1
  • Nader Ebrahimi, Ehsan S. Soofi, Refik Soyer (2008), "Identificación, transformación y dependencia de la entropía máxima multivariante", Journal of Multivariate Analysis 99: 1217–1231, doi : 10.1016/j.jmva.2007.08.004