En estadística y teoría de la información , una distribución de probabilidad de máxima entropía tiene una entropía al menos igual a la de todos los demás miembros de una clase específica de distribuciones de probabilidad . Según el principio de máxima entropía , si no se sabe nada sobre una distribución excepto que pertenece a una clase determinada (generalmente definida en términos de propiedades o medidas específicas), entonces la distribución con la mayor entropía debe elegirse como la menos informativa por defecto. La motivación es doble: primero, maximizar la entropía minimiza la cantidad de información previa incorporada en la distribución; segundo, muchos sistemas físicos tienden a evolucionar hacia configuraciones de máxima entropía con el tiempo.
Definición de entropía y entropía diferencial
Sies una variable aleatoria continua con densidad de probabilidad, entonces la entropía diferencial dese define como [ 1 ] [ 2 ] [ 3 ]
Sies una variable aleatoria discreta con distribución dada por entonces la entropía dese define como
El término aparentemente divergentese reemplaza por cero, siempre que
Este es un caso especial de formas más generales descritas en los artículos Entropía (teoría de la información) , Principio de máxima entropía y Entropía diferencial. En relación con las distribuciones de máxima entropía, esta es la única necesaria, porque maximizarTambién maximizará las formas más generales.
La base del logaritmo no es importante, siempre que se utilice la misma de forma consistente: un cambio de base simplemente produce un reescalamiento de la entropía. Los teóricos de la información pueden preferir usar la base 2 para expresar la entropía en bits ; los matemáticos y físicos suelen preferir el logaritmo natural , lo que da como resultado una unidad de "nat" para la entropía.
Sin embargo, la medida elegidaEs crucial, aunque el uso típico de la medida de Lebesgue se defiende a menudo como una elección "natural": la medida que se elija determina la entropía y la consiguiente distribución de entropía máxima.
Distribuciones con constantes medidas
Muchas distribuciones estadísticas de interés práctico son aquellas en las que los momentos u otras cantidades medibles están restringidos a ser constantes. El siguiente teorema de Ludwig Boltzmann proporciona la forma de la densidad de probabilidad bajo estas restricciones.
caso continuo
Suponeres un subconjunto continuo y cerrado de los números realesy elegimos especificarfunciones mediblesynúmerosConsideramos la clasede todas las variables aleatorias de valor real que están soportadas en(es decir, cuya función de densidad es cero fuera de) y que satisfacen lacondiciones del momento:
Si hay un miembro encuya función de densidad es positiva en todas partesy si existe una distribución de entropía máxima paraentonces su densidad de probabilidadtiene la siguiente forma:
donde asumimos queLa constantey elmultiplicadores de Lagrangeresolver el problema de optimización con restricciones con(lo que garantiza quese integra a la unidad): [ 4 ]
Utilizando las condiciones de Karush-Kuhn-Tucker , se puede demostrar que el problema de optimización tiene una solución única porque la función objetivo en la optimización es cóncava en
Tenga en cuenta que cuando las restricciones de momento son igualdades (en lugar de desigualdades), es decir,
entonces la condición de restricciónse puede omitir, lo que hace que la optimización sobre los multiplicadores de Lagrange no tenga restricciones.
Caso discreto
Suponeres un subconjunto discreto (finito o infinito) de los números reales, y que elegimos especificarfuncionesynúmerosConsideramos la clasede todas las variables aleatorias discretasque son compatibles cony que satisfacen lacondiciones de momento
Si existe un miembro de la claseque asigna probabilidad positiva a todos los miembros dey si existe una distribución de entropía máxima paraEntonces, esta distribución tiene la siguiente forma:
donde asumimos quey las constantesresolver el problema de optimización con restricciones con: [ 5 ]
Nuevamente como se indicó anteriormente, si las condiciones de momento son igualdades (en lugar de desigualdades), entonces la condición de restricciónno está presente en la optimización.
Demostración en el caso de restricciones de igualdad
En el caso de restricciones de igualdad, este teorema se demuestra con el cálculo de variaciones y los multiplicadores de Lagrange . Las restricciones se pueden escribir como
Consideramos la función
dóndeyson los multiplicadores de Lagrange. La restricción cero garantiza el segundo axioma de probabilidad . Las otras restricciones son que las mediciones de la función se dan como constantes hasta el ordenLa entropía alcanza un valor extremo cuando la derivada funcional es igual a cero:
Por lo tanto, la distribución de probabilidad de entropía extremal en este caso debe tener la forma (),
recordando queSe puede verificar que esta es la solución máxima comprobando que la variación alrededor de esta solución es siempre negativa.
Unicidad del máximo
Suponeryson distribuciones que satisfacen las restricciones de expectativa. Seay considerando la distribuciónEs evidente que esta distribución satisface las restricciones de expectativa y además tiene como soporteA partir de hechos básicos sobre la entropía, se sostiene queTomar límitesyrespectivamente, rendimientos
De ello se deduce que una distribución que satisface las restricciones de expectativa y maximiza la entropía debe necesariamente tener soporte completo, es decir, la distribución es casi en todas partes estrictamente positiva. Por consiguiente, la distribución que maximiza la entropía debe ser un punto interno en el espacio de distribuciones que satisfacen dichas restricciones, es decir, debe ser un extremo local. Por lo tanto, basta con demostrar que el extremo local es único para demostrar que la distribución que maximiza la entropía es única (y esto también demuestra que el extremo local es el máximo global).
Suponeryson extremos locales. Reformulando los cálculos anteriores, estos se caracterizan por parámetrosa través dey de manera similar paradóndeAhora observamos una serie de identidades: Mediante la satisfacción de las restricciones de expectativa y la utilización de gradientes / derivadas direccionales, se tiene
y de manera similar paraAlquilerse obtiene:
dóndepara algunosCalculando más a fondo, uno tiene
dóndees similar a la distribución anterior, solo que parametrizada porSuponiendo que ninguna combinación lineal no trivial de las observables es casi en todas partes (ae) constante, (lo cual, por ejemplo, se cumple si las observables son independientes y no ae constantes), se cumple quetiene varianza distinta de cero, a menos queDe la ecuación anterior se deduce que esto último debe ser cierto. Por lo tanto,por lo tanto los parámetros que caracterizan los extremos localesson idénticas, lo que significa que las distribuciones en sí mismas son idénticas. Por lo tanto, el extremo local es único y, según lo expuesto anteriormente, el máximo es único, siempre que exista realmente un extremo local.
Advertencias
Nótese que no todas las clases de distribuciones contienen una distribución de entropía máxima. Es posible que una clase contenga distribuciones de entropía arbitrariamente grande (por ejemplo, la clase de todas las distribuciones continuas en R con media 0 pero desviación estándar arbitraria), o que las entropías estén acotadas superiormente pero no haya ninguna distribución que alcance la entropía máxima. [ a ] También es posible que las restricciones del valor esperado para la clase C obliguen a que la distribución de probabilidad sea cero en ciertos subconjuntos de S. En ese caso , nuestro teorema no se aplica, pero se puede solucionar reduciendo el conjunto S.
Ejemplos
Toda distribución de probabilidad es trivialmente una distribución de probabilidad de máxima entropía bajo la restricción de que la distribución tiene su propia entropía. Para ver esto, reescribamos la densidad comoy comparar con la expresión del teorema anterior. Al elegirser la función medible y
ser la constante,es la distribución de probabilidad de entropía máxima bajo la restricción
Ejemplos no triviales son distribuciones que están sujetas a múltiples restricciones que son diferentes de la asignación de la entropía. Estos se encuentran a menudo comenzando con el mismo procedimiento.y descubriendo quepuede separarse en partes.
En Lisman (1972) [ 6 ] y Park & Bera (2009) [ 7 ] se presenta una tabla con ejemplos de distribuciones de máxima entropía.
Distribuciones uniformes y uniformes por partes
La distribución uniforme en el intervalo [ a , b ] es la distribución de máxima entropía entre todas las distribuciones continuas que se encuentran en el intervalo [ a , b ], y por lo tanto la densidad de probabilidad es 0 fuera del intervalo. Esta densidad uniforme puede relacionarse con el principio de indiferencia de Laplace , a veces llamado principio de razón insuficiente. De manera más general, si se nos da una subdivisión a = a₀ < a₁ < ... < aᵏ = b del intervalo [ a , b ] y probabilidades p₁ , ..., pᵏ que suman uno, entonces podemos considerar la clase de todas las distribuciones continuas tales que La densidad de la distribución de máxima entropía para esta clase es constante en cada uno de los intervalos [ a j −1 , a j ). La distribución uniforme en el conjunto finito { x 1 ,..., x n } (que asigna una probabilidad de 1/ n a cada uno de estos valores) es la distribución de máxima entropía entre todas las distribuciones discretas admitidas en este conjunto.
Media positiva y especificada: la distribución exponencial
La distribución exponencial , para la cual la función de densidad es
es la distribución de entropía máxima entre todas las distribuciones continuas admitidas en [0,∞) que tienen una media especificada de 1/λ.
En el caso de distribuciones con soporte en [0,∞), la distribución de máxima entropía depende de las relaciones entre el primer y el segundo momento. En casos específicos, puede ser la distribución exponencial, otra distribución o incluso indefinible. [ 8 ]
Media y varianza especificadas: la distribución normal
La distribución normal N ( μ , σ 2 ), para la cual la función de densidad es
Presenta la máxima entropía entre todas las distribuciones de valores reales soportadas en ( − ∞,∞) con una varianza σ 2 especificada (un momento particular ). Lo mismo ocurre cuando se especifican la media μ y la varianza σ 2 (los dos primeros momentos), ya que la entropía es invariante bajo traslaciones en ( − ∞,∞). Por lo tanto, la suposición de normalidad impone la restricción estructural a priori mínima más allá de estos momentos. (Véase el artículo sobre entropía diferencial para una derivación).
Distribuciones discretas con media especificada
Entre todas las distribuciones discretas admitidas en el conjunto { x 1 ,..., x n } con una media μ especificada, la distribución de máxima entropía tiene la siguiente forma: donde las constantes positivas C y r pueden determinarse mediante los requisitos de que la suma de todas las probabilidades debe ser 1 y el valor esperado debe ser μ.
Por ejemplo, si se lanza un gran número N de dados y se le dice que la suma de todos los números mostrados es S. Basándose únicamente en esta información, ¿cuál sería una suposición razonable para la cantidad de dados que muestran 1, 2, ..., 6? Este es un ejemplo de la situación considerada anteriormente, con { x 1 , ... , x 6 } = {1,...,6} y μ = S / N.
Finalmente, entre todas las distribuciones discretas soportadas en el conjunto infinitocon media μ , la distribución de máxima entropía tiene la forma: donde nuevamente las constantes C y r se determinaron por los requisitos de que la suma de todas las probabilidades debe ser 1 y el valor esperado debe ser μ. Por ejemplo, en el caso de que x k = k , esto da
de tal manera que la distribución de máxima entropía respectiva sea la distribución geométrica .
Variables aleatorias circulares
Para una variable aleatoria continuaDistribuida alrededor del círculo unitario, la distribución de Von Mises maximiza la entropía cuando se especifican las partes real e imaginaria del primer momento circular [ 9 ] o, equivalentemente, se especifican la media circular y la varianza circular .
Cuando la media y la varianza de los ángulosmóduloSe especifican, la distribución normal envuelta maximiza la entropía. [ 9 ]
Maximizador para media, varianza y asimetría especificadas.
Existe un límite superior para la entropía de variables aleatorias continuas encon una media, varianza y asimetría especificadas. Sin embargo, no existe ninguna distribución que alcance este límite superior , porquees ilimitado cuando(véase Cover y Thomas (2006: capítulo 12)).
Sin embargo, la entropía máxima es alcanzable con una entropía ε : la entropía de una distribución puede estar arbitrariamente cerca del límite superior. Partimos de una distribución normal con la media y la varianza especificadas. Para introducir una asimetría positiva, perturbamos la distribución normal ligeramente hacia arriba, con un valor varias σ mayor que la media. La asimetría, al ser proporcional al tercer momento, se verá más afectada que los momentos de orden inferior.
Este es un caso especial del caso general en el que la exponencial de cualquier polinomio de orden impar en x no estará acotada.. Por ejemplo,Asimismo, no tendrá límites., pero cuando el soporte se limita a un intervalo acotado o semiacotado, se puede alcanzar el límite superior de entropía (por ejemplo, si x se encuentra en el intervalo [0, ∞ ] y λ < 0 , se obtendrá la distribución exponencial ).
Maximizador para una medida de riesgo de media y desviación especificada
Toda distribución con densidad logarítmicamente cóncava es una distribución de entropía máxima con media μ y medida de riesgo de desviación D especificadas . [ 10 ]
En particular, la distribución de entropía máxima con media especificaday desviaciónes:
- La distribución normalsies la desviación estándar ;
- La distribución de Laplace , sies la desviación absoluta media ; [ 6 ]
- La distribución con densidad de la formasies la semidesviación estándar inferior, dondeson constantes y la funciónDevuelve solo los valores negativos de su argumento, de lo contrario cero. [ 10 ]
Otros ejemplos
En la tabla siguiente, cada distribución enumerada maximiza la entropía para un conjunto particular de restricciones funcionales enumeradas en la tercera columna, y la restricción queestar incluido en el soporte de la densidad de probabilidad, que se enumera en la cuarta columna. [ 6 ] [ 7 ]
Varios ejemplos enumerados ( Bernoulli , geométrico , exponencial , Laplace , Pareto ) son trivialmente ciertos, ya que sus restricciones asociadas son equivalentes a la asignación de su entropía. Se incluyen de todos modos porque su restricción está relacionada con una magnitud común o fácilmente medible.
Para referencia,es la función gamma ,es la función digamma ,es la función beta yes la constante de Euler-Mascheroni .
El principio de máxima entropía puede utilizarse para establecer un límite superior a la entropía de las mezclas estadísticas. [ 13 ]
Véase también
- Familia exponencial
- Medida de Gibbs
- Función de partición (matemáticas)
- Paseo aleatorio de entropía máxima : maximizar la tasa de entropía para un grafo.
Notas
- ↑ Por ejemplo, la clase de todas las distribuciones continuas X en R con E( X ) = 0 y E( X 2 ) = E( X 3 ) = 1 (ver Portada, Cap. 12).
Citas
- ↑ Williams, D. (2001). Sopesando las probabilidades . Cambridge University Press . págs. 197–199 . ISBN 0-521-00618-X.
- ↑ Bernardo, JM; Smith, AFM (2000). Teoría bayesiana . Wiley. págs. 209, 366. ISBN 0-471-49464-X.
- ↑ O'Hagan, A. (1994), Inferencia bayesiana . Teoría avanzada de la estadística de Kendall. Vol. 2B. Edward Arnold . 1994. Sección 5.40. ISBN 0-340-52922-9.
- ↑ Botev, ZI; Kroese, DP (2011). "El método generalizado de entropía cruzada, con aplicaciones a la estimación de la densidad de probabilidad" (PDF) . Metodología y computación en probabilidad aplicada . 13 (1): 1– 27. doi : 10.1007/s11009-009-9133-7 . S2CID 18155189 .
- ↑ Botev, ZI; Kroese, DP (2008). "Selección de ancho de banda no asintótico para la estimación de densidad de datos discretos". Metodología y computación en probabilidad aplicada . 10 (3): 435. doi : 10.1007/s11009-007-9057-zv (inactivo el 1 de julio de 2025). S2CID 122047337 .
{{cite journal}}: CS1 maint: DOI inactivo desde julio de 2025 ( enlace ) - 1 2 3 Lisman, JHC; van Zuylen, MCA (1972). "Nota sobre la generación de distribuciones de frecuencia más probables". Statistica Neerlandica . 26 (1): 19– 23. doi : 10.1111/j.1467-9574.1972.tb00152.x .
- 1 2 Park, Sung Y.; Bera, Anil K. (2009). "Modelo de heterocedasticidad condicional autorregresiva de máxima entropía" (PDF) . Journal of Econometrics . 150 (2): 219– 230. CiteSeerX 10.1.1.511.9750 . doi : 10.1016/j.jeconom.2008.12.014 . Archivado del original (PDF) el 7 de marzo de 2016. Recuperado el 2 de junio de 2011 .
- ↑ Dowson, D.; Wragg, A. (septiembre de 1973). "Distribuciones de máxima entropía con primeros y segundos momentos prescritos". IEEE Transactions on Information Theory (correspondencia). 19 (5): 689– 693. doi : 10.1109/tit.1973.1055060 . ISSN 0018-9448 .
- 1 2 Jammalamadaka, S. Rao; SenGupta, A. (2001). Temas de estadística circular . Nueva Jersey: World Scientific. ISBN 978-981-02-3778-3. Consultado el 15 de mayo de 2011 .
- 1 2 Grechuk, Bogdan; Molyboha, Anton; Zabarankin, Michael (2009). "Principio de máxima entropía con medidas de desviación generales" . Matemáticas de la Investigación Operativa . 34 (2): 445– 467. doi : 10.1287/moor.1090.0377 – vía researchgate.net.
- 1 2 Harremös, Peter (2001). "Distribuciones binomiales y de Poisson como distribuciones de máxima entropía". IEEE Transactions on Information Theory . 47 (5): 2039– 2041. doi : 10.1109/18.930936 . S2CID 16171405 .
- ^ Baek, Seung Ki; Bernhardsson, Sebastián; Minnhagen, Petter (7 de abril de 2011). «La ley de Zipf descomprimida» (PDF) . Nueva Revista de Física . 13 .
- ↑ Nielsen, Frank; Nock, Richard (2017). "Límites superiores de MaxEnt para la entropía diferencial de distribuciones continuas univariadas". IEEE Signal Processing Letters . 24 (4). IEEE : 402–406 . Bibcode : 2017ISPL...24..402N . doi : 10.1109/LSP.2017.2666792 . S2CID 14092514 .
Referencias
- Cover, TM ; Thomas, JA (2006). «Capítulo 12, Entropía máxima» (PDF) . Elementos de la teoría de la información (2.ª ed.). Wiley. ISBN 978-0471241959.
- F. Nielsen, R. Nock (2017), Límites superiores de MaxEnt para la entropía diferencial de distribuciones continuas univariadas , IEEE Signal Processing Letters , 24(4), 402–406
- IJ Taneja (2001), Medidas de información generalizadas y sus aplicaciones . Capítulo 1
- Nader Ebrahimi, Ehsan S. Soofi, Refik Soyer (2008), "Identificación, transformación y dependencia de la entropía máxima multivariante", Journal of Multivariate Analysis 99: 1217–1231, doi : 10.1016/j.jmva.2007.08.004
- Entropía e información
- Distribuciones continuas
- Distribuciones discretas
- estadística de partículas
- Tipos de distribuciones de probabilidad