En probabilidad y estadística , una familia exponencial es un conjunto paramétrico de distribuciones de probabilidad de una forma determinada, especificada a continuación. Esta forma especial se elige por conveniencia matemática, incluyendo la posibilidad de que el usuario calcule esperanzas, covarianzas usando diferenciación basada en algunas propiedades algebraicas útiles, así como por generalidad, ya que las familias exponenciales son, en cierto sentido, conjuntos de distribuciones muy naturales para considerar. El término clase exponencial se usa a veces en lugar de "familia exponencial" [ 1 ] o el término más antiguo familia de Koopman-Darmois . A veces denominada informalmente familia exponencial, esta clase de distribuciones es distinta porque todas poseen una variedad de propiedades deseables, la más importante la existencia de una estadística suficiente .
El concepto de familias exponenciales se atribuye a [ 2 ] EJG Pitman , [ 3 ] G. Darmois , [ 4 ] y BO Koopman [ 5 ] en 1935 – 1936. Las familias exponenciales de distribuciones proporcionan un marco general para seleccionar una posible parametrización alternativa de una familia paramétrica de distribuciones, en términos de parámetros naturales, y para definir estadísticas de muestra útiles , llamadas estadísticas suficientes naturales de la familia.
Dificultad de nomenclatura
Los términos "distribución" y "familia" se utilizan a menudo de forma imprecisa: específicamente, una familia exponencial es un conjunto de distribuciones, donde la distribución específica varía con el parámetro; [ a ] sin embargo, a una familia paramétrica de distribuciones se la suele denominar " una distribución" (como "la distribución normal", que significa "la familia de distribuciones normales"), y al conjunto de todas las familias exponenciales a veces se le denomina imprecisamente "la" familia exponencial.
Definición
La mayoría de las distribuciones de uso común forman una familia exponencial o un subconjunto de una familia exponencial, como se detalla en la subsección siguiente. Las subsecciones posteriores presentan definiciones matemáticas cada vez más generales de una familia exponencial. Un lector ocasional podría centrarse en la primera y más sencilla definición, que corresponde a una familia de distribuciones de probabilidad discretas o continuas con un solo parámetro.
Ejemplos de distribuciones de la familia exponencial
Las familias exponenciales incluyen muchas de las distribuciones más comunes. Entre muchas otras, las familias exponenciales incluyen las siguientes: [ 6 ]
Varias distribuciones comunes pertenecen a familias exponenciales, pero solo cuando ciertos parámetros son fijos y conocidos. Por ejemplo:
- binomial (con un número fijo de ensayos)
- multinomial (con un número fijo de ensayos)
- binomial negativa (con número fijo de fallos)
Cabe señalar que, en cada caso, los parámetros que deben fijarse son aquellos que establecen un límite al rango de valores que pueden observarse.
Ejemplos de distribuciones comunes que no pertenecen a familias exponenciales son la t de Student , la mayoría de las distribuciones de mezcla e incluso la familia de distribuciones uniformes cuando los límites no son fijos. Consulte la sección siguiente sobre ejemplos para obtener más información.
Parámetro escalar
El valor dese denomina parámetro de la familia.
Una familia exponencial de un solo parámetro es un conjunto de distribuciones de probabilidad cuya función de densidad de probabilidad (o función de masa de probabilidad , para el caso de una distribución discreta ) puede expresarse en la forma
donde T ( x ) , h ( x ) , η ( θ ) , y A ( θ ) son funciones conocidas. La función h ( x ) debe ser no negativa.
Una forma alternativa y equivalente que se suele dar es
o equivalentemente
En términos de probabilidad logarítmica ,
Tenga en cuenta quey.
El soporte debe ser independiente de θ
Es importante destacar el apoyo de(todos los posiblesvalores para los cualeses mayor que) se requiere que no dependa de[ 7 ] Este requisito puede utilizarse para excluir una distribución de familia paramétrica de ser una familia exponencial.
Por ejemplo: La distribución de Pareto tiene una función de densidad de probabilidad que se define para(el valor mínimo,siendo el parámetro de escala) y su soporte, por lo tanto, tiene un límite inferior deDesde el apoyo dedepende del valor del parámetro, la familia de distribuciones de Pareto no forma una familia exponencial de distribuciones (al menos cuandose desconoce).
Otro ejemplo: las distribuciones de tipo Bernoulli ( binomial , binomial negativa , distribución geométrica y similares) solo pueden incluirse en la clase exponencial si el número de ensayos de Bernoulli , n , se trata como una constante fija, excluida del/de los parámetro(s) libre(s).– puesto que el número permitido de ensayos establece los límites para el número de "éxitos" o "fracasos" que se pueden observar en un conjunto de ensayos.
Valores vectoriales x y θ
A menudoes un vector de mediciones, en cuyo casopuede ser una función del espacio de posibles valores dea las cifras reales.
En términos más generales,ycada uno puede ser un vector de valores tal quees de valor real. Sin embargo, consulte la discusión a continuación sobre parámetros vectoriales , en relación con la familia exponencial curva .
Formulación canónica
SiEntonces se dice que la familia exponencial está en forma canónica . Al definir un parámetro transformadoSiempre es posible convertir una familia exponencial a forma canónica. La forma canónica no es única, ya quepuede multiplicarse por cualquier constante distinta de cero, siempre que T ( x ) se multiplique por el recíproco de esa constante, o se puede sumar una constante c ay h ( x ) multiplicado porpara compensarlo. En el caso especial quey T ( x ) = x , entonces la familia se llama familia exponencial natural .
Incluso cuandoes un escalar y solo hay un parámetro, las funcionesyaún pueden ser vectores, como se describe a continuación.
La funcióno equivalentementese determina automáticamente una vez que se han elegido las otras funciones, ya que debe asumir una forma que provoque que la distribución se normalice (suma o integral a uno en todo el dominio). Además, ambas funciones siempre se pueden escribir como funciones deincluso cuandono es una función uno a uno , es decir dos o más valores diferentes demapear al mismo valor dey por lo tantono se puede invertir. En tal caso, todos los valores demapeo al mismotambién tendrá el mismo valor paray
Factorización de las variables involucradas
Es importante destacar, y esto caracteriza a todas las variantes de la familia exponencial, que el/los parámetro(s) y la/s variable(s) de observación deben factorizarse (pueden separarse en productos, cada uno de los cuales involucra un solo tipo de variable), ya sea directamente o dentro de cualquiera de las partes (la base o el exponente) de una operación de exponenciación . En general, esto significa que todos los factores que constituyen la función de densidad o de masa deben tener una de las siguientes formas:
donde f y h son funciones arbitrarias de x , la variable estadística observada; g y j son funciones arbitrarias delos parámetros fijos que definen la forma de la distribución; y c es cualquier expresión constante arbitraria (es decir, un número o una expresión que no cambia con x o).
Existen restricciones adicionales sobre la cantidad de factores de este tipo que pueden ocurrir. Por ejemplo, las dos expresiones:
son lo mismo, es decir, un producto de dos factores "permitidos". Sin embargo, cuando se reescribe en la forma factorizada,
Se puede observar que no se puede expresar en la forma requerida. (Sin embargo, una forma de este tipo pertenece a una familia exponencial curva , que permite múltiples términos factorizados en el exponente ) .
Para ver por qué una expresión de la forma
califica,
y por lo tanto se factoriza dentro del exponente. De manera similar,
y de nuevo se factoriza dentro del exponente.
Un factor que consiste en una suma donde intervienen ambos tipos de variables (por ejemplo, un factor de la forma) no se puede factorizar de esta manera (excepto en algunos casos donde aparece directamente en un exponente); por eso, por ejemplo, la distribución de Cauchy y la distribución t de Student no son familias exponenciales.
Parámetro vectorial
La definición en términos de un parámetro numérico real puede extenderse a un parámetro vectorial real.
Se dice que una familia de distribuciones pertenece a una familia exponencial vectorial si la función de densidad de probabilidad (o función de masa de probabilidad, para distribuciones discretas) se puede escribir como
o en una forma más compacta,
Esta forma escribe la suma como un producto escalar de funciones con valores vectoriales.y T ( x ) .
Una forma alternativa y equivalente que se ve a menudo es
Al igual que en el caso de valores escalares, se dice que la familia exponencial está en forma canónica si
Se dice que una familia exponencial vectorial es curva si la dimensión de
es menor que la dimensión del vector
Es decir, si la dimensión , d , del vector de parámetros es menor que el número de funciones , s , del vector de parámetros en la representación anterior de la función de densidad de probabilidad. La mayoría de las distribuciones comunes en la familia exponencial no son curvas, y muchos algoritmos diseñados para trabajar con cualquier familia exponencial asumen implícita o explícitamente que la distribución no es curva.
Al igual que en el caso de un parámetro escalar, la funcióno equivalentementese determina automáticamente por la restricción de normalización, una vez que se han elegido las demás funciones. Incluso sino es uno a uno, funcionesyse puede definir exigiendo que la distribución esté normalizada para cada valor del parámetro natural.Esto da como resultado la forma canónica .
o equivalentemente
Las formas anteriores a veces pueden verse conen lugar deEstas formulaciones son exactamente equivalentes, utilizando simplemente una notación diferente para el producto escalar .
Parámetro vectorial, variable vectorial
La forma de parámetro vectorial sobre una única variable aleatoria escalar se puede extender trivialmente para cubrir una distribución conjunta sobre un vector de variables aleatorias. La distribución resultante es simplemente la misma que la distribución anterior para una variable aleatoria escalar, donde cada ocurrencia del escalar x se reemplaza por el vector.
Las dimensiones k de la variable aleatoria no tienen por qué coincidir con la dimensión d del vector de parámetros, ni (en el caso de una función exponencial curva) con la dimensión s del parámetro natural.y estadístico suficiente T ( x ) .
La distribución en este caso se escribe como
O de forma más compacta como
O alternativamente como
Formulación basada en la teoría de la medida
Utilizamos funciones de distribución acumulativa (CDF) para abarcar tanto distribuciones discretas como continuas.
Supongamos que H es una función no decreciente de una variable real. Entonces, las integrales de Lebesgue-Stieltjes con respecto ason integrales con respecto a la medida de referencia de la familia exponencial generada por H.
Cualquier miembro de esa familia exponencial tiene función de distribución acumulativa
H ( x ) es un integrador de Lebesgue-Stieltjes para la medida de referencia. Cuando la medida de referencia es finita, se puede normalizar y H es en realidad la función de distribución acumulativa de una distribución de probabilidad. Si F es absolutamente continua con una densidadcon respecto a una medida de referencia(típicamente la medida de Lebesgue ), se puede escribirEn este caso, H también es absolutamente continua y se puede escribirPor lo tanto, las fórmulas se reducen a las de los párrafos anteriores. Si F es discreta, entonces H es una función escalonada (con escalones en el soporte de F ).
Alternativamente, podemos escribir la medida de probabilidad directamente como
para alguna medida de referencia.
Interpretación
En las definiciones anteriores, las funciones T ( x ) , η ( θ ) y A ( η ) eran arbitrarias. Sin embargo, estas funciones tienen interpretaciones importantes en la distribución de probabilidad resultante.
- T ( x ) es un estadístico suficiente de la distribución. Para las familias exponenciales, el estadístico suficiente es una función de los datos que contiene toda la información que los datos x proporcionan con respecto a los valores de los parámetros desconocidos. Esto significa que, para cualquier conjunto de datosy, la razón de verosimilitud es la misma, es decirSi T ( x ) = T ( y ) , esto se cumple incluso si x e y no son iguales. La dimensión de T ( x ) es igual al número de parámetros de θ y abarca toda la información relativa a los datos relacionados con dicho parámetro . El estadístico suficiente de un conjunto de observaciones de datos independientes e idénticamente distribuidas es simplemente la suma de los estadísticos suficientes individuales, y encapsula toda la información necesaria para describir la distribución posterior de los parámetros, dados los datos (y, por lo tanto, para obtener cualquier estimación deseada de los parámetros). (Esta importante propiedad se analiza con más detalle a continuación ).
- η se denomina parámetro natural . El conjunto de valores de η para los cuales la funciónSi es integrable, se le llama espacio de parámetros natural . Se puede demostrar que el espacio de parámetros natural es siempre convexo .
- A ( η ) se llama elfunción de partición logarítmica [ b ] porque es el logaritmo de un factor de normalización , sin el cualno sería una distribución de probabilidad:
La función A es importante por derecho propio, porque la media , la varianza y otros momentos del estadístico suficiente T ( x ) se pueden derivar simplemente diferenciando A ( η ) . Por ejemplo, debido a que log( x ) es uno de los componentes del estadístico suficiente de la distribución gamma ,se puede determinar fácilmente para esta distribución usando A ( η ) . Técnicamente, esto es cierto porquees la función generadora de cumulantes de la estadística suficiente.
Propiedades
Las familias exponenciales poseen numerosas propiedades que las hacen extremadamente útiles para el análisis estadístico. En muchos casos, se puede demostrar que solo las familias exponenciales poseen estas propiedades. Ejemplos:
- Las familias exponenciales son las únicas familias con estadísticas suficientes que pueden resumir cantidades arbitrarias de datos independientes e idénticamente distribuidos utilizando un número fijo de valores. ( Teorema de Pitman - Koopman - Darmois )
- Las familias exponenciales tienen distribuciones a priori conjugadas , una propiedad importante en la estadística bayesiana .
- La distribución predictiva posterior de una variable aleatoria de la familia exponencial con una distribución a priori conjugada siempre se puede escribir en forma cerrada (siempre que el factor de normalización de la distribución de la familia exponencial también se pueda escribir en forma cerrada). [ c ]
- En la aproximación de campo medio en Bayes variacional (utilizada para aproximar la distribución posterior en grandes redes bayesianas ), la mejor aproximación de la distribución posterior de un nodo de la familia exponencial (un nodo es una variable aleatoria en el contexto de las redes bayesianas) con una distribución a priori conjugada pertenece a la misma familia que el nodo. [ 8 ]
Dada una familia exponencial definida por, dóndees el espacio de parámetros, tal que. Entonces
- Sitiene interior no vacío en, luego dadas las muestras IID, la estadísticaes una estadística completa para. [ 9 ] [ 10 ]
- es una estadística mínima parasi y solo si para todos, yen apoyo de, si, entonceso. [ 11 ]
Ejemplos
Al considerar los ejemplos de esta sección, es fundamental recordar la discusión anterior sobre lo que significa decir que una "distribución" es una familia exponencial, y en particular tener presente que el conjunto de parámetros que se permiten variar es crucial para determinar si una "distribución" es o no una familia exponencial.
Las distribuciones normal , exponencial , log-normal , gamma , chi-cuadrado , beta , Dirichlet , Bernoulli , categórica , Poisson , geométrica , gaussiana inversa , ALAAM , von Mises y von Mises-Fisher son todas familias exponenciales.
Algunas distribuciones son familias exponenciales solo si algunos de sus parámetros se mantienen fijos. La familia de distribuciones de Pareto con un límite mínimo fijo x m forma una familia exponencial. Las familias de distribuciones binomiales y multinomiales con un número fijo de ensayos n pero con parámetros de probabilidad desconocidos son familias exponenciales. La familia de distribuciones binomiales negativas con un número fijo de fallos (también conocido como parámetro de tiempo de parada) r es una familia exponencial. Sin embargo, cuando se permite que varíe cualquiera de los parámetros fijos mencionados anteriormente, la familia resultante no es una familia exponencial.
Como se mencionó anteriormente, por regla general, el soporte de una familia exponencial debe permanecer constante para todos los parámetros de la familia. Por esta razón, los casos anteriores (por ejemplo, la distribución binomial con un número variable de ensayos y la distribución de Pareto con un límite mínimo variable) no son familias exponenciales: en todos los casos, el parámetro en cuestión afecta el soporte (en particular, modifica el valor mínimo o máximo posible). Por razones similares, ni la distribución uniforme discreta ni la distribución uniforme continua son familias exponenciales, ya que uno o ambos límites varían.
La distribución de Weibull con parámetro de forma fijo k pertenece a la familia exponencial. A diferencia de los ejemplos anteriores, el parámetro de forma no afecta al soporte; el hecho de que al permitirle variar la distribución de Weibull deje de ser exponencial se debe más bien a la forma particular de su función de densidad de probabilidad ( k aparece en el exponente de un exponente).
En general, las distribuciones que resultan de una mezcla finita o infinita de otras distribuciones, por ejemplo, las densidades de modelos de mezcla y las distribuciones de probabilidad compuestas , no son familias exponenciales. Ejemplos de ello son los modelos de mezcla gaussianos típicos , así como muchas distribuciones de cola pesada que resultan de la composición (es decir, la mezcla infinita) de una distribución con una distribución a priori sobre uno de sus parámetros, por ejemplo, la distribución t de Student (composición de una distribución normal sobre una distribución a priori de precisión con distribución gamma ), y las distribuciones beta-binomial y multinomial de Dirichlet . Otros ejemplos de distribuciones que no son familias exponenciales son la distribución F , la distribución de Cauchy , la distribución hipergeométrica y la distribución logística .
A continuación se presentan algunos ejemplos detallados de la representación de algunas distribuciones útiles como familias exponenciales.
Distribución normal: media desconocida, varianza conocida.
Como primer ejemplo, consideremos una variable aleatoria con distribución normal, con media desconocida μ y varianza conocida σ² . La función de densidad de probabilidad es entonces
Esta es una familia exponencial de un solo parámetro, como se puede ver al establecer
Si σ = 1, esto está en forma canónica, ya que entonces η ( μ ) = μ .
Distribución normal: media desconocida y varianza desconocida.
A continuación, consideremos el caso de una distribución normal con media y varianza desconocidas. La función de densidad de probabilidad es entonces
Esta es una familia exponencial que se puede escribir en forma canónica definiendo
Distribución binomial
Como ejemplo de una familia exponencial discreta, consideremos la distribución binomial con un número conocido de ensayos n . La función de probabilidad para esta distribución es Esto se puede escribir de forma equivalente como lo que demuestra que la distribución binomial es una familia exponencial, cuyo parámetro natural es Esta función de p se conoce como logit .
Tabla de distribuciones
La siguiente tabla muestra cómo reescribir varias distribuciones comunes como distribuciones de la familia exponencial con parámetros naturales. Consulte las tarjetas didácticas [ 12 ] para conocer las principales familias exponenciales.
Para una variable escalar y un parámetro escalar, la forma es la siguiente:
Para una variable escalar y un parámetro vectorial:
Para una variable vectorial y un parámetro vectorial:
Las fórmulas anteriores eligen la forma funcional de la familia exponencial con una función de partición logarítmica.La razón de esto es que los momentos de la estadística suficiente se pueden calcular fácilmente, simplemente diferenciando esta función. Las formas alternativas implican parametrizar esta función en términos del parámetro normal.en lugar del parámetro natural, y/o utilizando un factorfuera de la exponencial. La relación entre esta última y la primera es: Para convertir entre las representaciones que involucran los dos tipos de parámetros, utilice las fórmulas a continuación para escribir un tipo de parámetro en términos del otro.
- 1 2 3 El corchete de Iverson es una generalización de la función delta discreta: si la expresión entre corchetes es verdadera, el corchete tiene valor 1; si la afirmación encerrada es falsa, el corchete de Iverson es cero. Hay muchas notaciones variantes, por ejemplo, corchetes ondulados: ⧙ a = b ⧘ es equivalente a la notación [ a = b ] utilizada anteriormente.
Las tres variantes de la distribución categórica y la distribución multinomial se deben al hecho de que los parámetrosestán restringidos, de tal manera que
Por lo tanto, solo hayparámetros independientes.
- La variante 1 utilizaparámetros naturales con una relación simple entre los parámetros estándar y naturales; sin embargo, solode los parámetros naturales son independientes y el conjunto deLos parámetros naturales no son identificables . La restricción sobre los parámetros habituales se traduce en una restricción similar sobre los parámetros naturales.
- La variante 2 demuestra que el conjunto completo de parámetros naturales no es identificable: añadir cualquier valor constante a los parámetros naturales no afecta a la distribución resultante. Sin embargo, al utilizar la restricción sobre los parámetros naturales, la fórmula para los parámetros normales en función de estos parámetros puede escribirse de forma independiente de la constante que se añada.
- La variante 3 muestra cómo hacer que los parámetros sean identificables de una manera conveniente mediante la configuraciónEsto efectivamente "gira" alrededory hace que el último parámetro natural tenga el valor constante de 0. Todas las fórmulas restantes están escritas de una manera que no accede, de modo que efectivamente el modelo solo tieneparámetros, tanto del tipo habitual como del natural.
Las variantes 1 y 2 no son en realidad familias exponenciales estándar. Más bien son familias exponenciales curvas , es decir, hayparámetros independientes incrustados en unEspacio de parámetros de dimensión. [ 13 ] Muchos de los resultados estándar para familias exponenciales no se aplican a familias exponenciales curvas. Un ejemplo es la función de partición logarítmica., que tiene el valor de 0 en los casos curvos. En las familias exponenciales estándar, las derivadas de esta función corresponden a los momentos (más técnicamente, los cumulantes ) de las estadísticas suficientes, por ejemplo, la media y la varianza. Sin embargo, un valor de 0 sugiere que la media y la varianza de todas las estadísticas suficientes son uniformemente 0, mientras que, de hecho, la media de lasEl estadístico suficiente debería ser. (Esto sí se revela correctamente al usar la forma demostrado en la variante 3.)
Momentos y cumulantes del estadístico suficiente
Normalización de la distribución
Comenzamos con la normalización de la distribución de probabilidad. En general, cualquier función no negativa f ( x ) que sirva como núcleo de una distribución de probabilidad (la parte que codifica toda la dependencia de x ) puede convertirse en una distribución propia normalizándola : es decir
dónde
El factor Z a veces se denomina función normalizadora o función de partición , basándose en una analogía con la física estadística .
En el caso de una familia exponencial donde
el núcleo es y la función de partición es
Dado que la distribución debe ser normalizada, tenemos
En otras palabras, o equivalentemente
Esto justifica llamar a A la función de normalización logarítmica o de partición logarítmica .
Función generadora de momentos del estadístico suficiente
Ahora, la función generadora de momentos de T ( x ) es
probando la afirmación anterior de que
es la función generadora de cumulantes para T.
Una subclase importante de familias exponenciales son las familias exponenciales naturales , que tienen una forma similar para la función generadora de momentos para la distribución de x .
Identidades diferenciales para cumulantes
En particular, utilizando las propiedades de la función generadora de cumulantes,
y
Los dos primeros momentos brutos y todos los segundos momentos mixtos se pueden recuperar a partir de estas dos identidades. Los momentos y cumulantes de orden superior se obtienen mediante derivadas de orden superior. Esta técnica suele ser útil cuando T es una función compleja de los datos, cuyos momentos son difíciles de calcular mediante integración.
Otra forma de ver esto, sin recurrir a la teoría de los cumulantes , es partir del hecho de que la distribución de una familia exponencial debe normalizarse y, a continuación, derivarla. Lo ilustramos con el caso sencillo de un parámetro unidimensional, pero una derivación análoga es válida de forma más general.
En el caso unidimensional, tenemos
Esto debe normalizarse, por lo tanto
Derivamos ambos lados con respecto a η :
Por lo tanto,
Ejemplo 1
Como ejemplo introductorio, consideremos la distribución gamma , cuya distribución se define por
Consultando la tabla anterior, podemos ver que el parámetro natural viene dado por
Las sustituciones inversas son
Las estadísticas suficientes son (log x , x) , y la función de partición logarítmica es
Podemos hallar la media de las estadísticas suficientes de la siguiente manera. Primero, para η 1 :
Dóndees la función digamma (derivada del logaritmo de gamma), y utilizamos las sustituciones inversas en el último paso.
Ahora, para η 2 :
Realizando nuevamente la sustitución inversa en el último paso.
Para calcular la varianza de x , simplemente volvemos a derivar:
Todos estos cálculos se pueden realizar mediante integración, utilizando diversas propiedades de la función gamma , pero esto requiere mucho más trabajo.
Ejemplo 2
Como otro ejemplo, consideremos una variable aleatoria de valor real X con densidad
indexado por parámetro de forma(esto se denomina distribución logística asimétrica ). La densidad se puede reescribir como
Nótese que se trata de una familia exponencial con parámetro natural.
estadística suficiente
y función de partición de registros
Entonces, usando la primera identidad,
y utilizando la segunda identidad
Este ejemplo ilustra un caso en el que usar este método es muy sencillo, pero el cálculo directo sería prácticamente imposible.
Ejemplo 3
El último ejemplo es uno en el que la integración sería extremadamente difícil. Se trata de la distribución de Wishart , definida sobre matrices. Incluso calcular derivadas resulta algo complicado, ya que implica cálculo matricial , pero las identidades correspondientes se encuentran en dicho artículo.
De la tabla anterior, podemos ver que el parámetro natural viene dado por
Las sustituciones inversas son
y las estadísticas suficientes son
La función de partición logarítmica se escribe de diversas formas en la tabla para facilitar la diferenciación y la sustitución hacia atrás. Utilizamos las siguientes formas:
- Expectativa de X (asociada con η 1 )
Para diferenciar con respecto a η 1 , necesitamos la siguiente identidad de cálculo matricial :
Entonces:
La última línea utiliza el hecho de que V es simétrica y, por lo tanto, es la misma cuando se transpone.
- Expectativa de log | X | (asociada con η 2 )
Ahora, para η 2 , primero necesitamos expandir la parte de la función de partición logarítmica que involucra la función gamma multivariada :
También necesitamos la función digamma :
Entonces:
Esta última fórmula se encuentra en el artículo sobre la distribución de Wishart . Ambas expectativas son necesarias al derivar las ecuaciones de actualización variacional de Bayes en una red bayesiana que involucra una distribución de Wishart (que es la distribución a priori conjugada de la distribución normal multivariada ).
Calcular estas fórmulas mediante integración sería mucho más difícil. La primera, por ejemplo, requeriría integración matricial.
Entropía
Entropía relativa
La entropía relativa ( divergencia de Kullback-Leibler , divergencia KL) de dos distribuciones en una familia exponencial tiene una expresión simple como la divergencia de Bregman entre los parámetros naturales con respecto al logaritmo normalizador. [ 14 ] La entropía relativa se define en términos de una integral, mientras que la divergencia de Bregman se define en términos de una derivada y un producto interno, por lo que es más fácil de calcular y tiene una expresión de forma cerrada (suponiendo que la derivada tenga una expresión de forma cerrada). Además, la divergencia de Bregman en términos de los parámetros naturales y el logaritmo normalizador es igual a la divergencia de Bregman de los parámetros duales (parámetros de expectativa), en orden inverso, para la función conjugada convexa . [ 15 ]
Corrección de una familia exponencial con log- normalizador( con conjugado convexo )) , escribiendopara la distribución en esta familia correspondiente a un valor fijo del parámetro natural ( escritura )para otro valor, y con para los parámetros de expectativa/momento duales correspondientes), escribiendo KL para la divergencia KL, y Para la divergencia de Bregman, las divergencias se relacionan de la siguiente manera:
La divergencia KL se escribe convencionalmente con respecto al primer parámetro, mientras que la divergencia de Bregman se escribe convencionalmente con respecto al segundo parámetro, y por lo tanto esto se puede leer como "la entropía relativa es igual a la divergencia de Bregman definida por el log-normalizador en los parámetros naturales intercambiados", o equivalentemente como "igual a la divergencia de Bregman definida por el dual del log-normalizador en los parámetros de expectativa".
Derivación de máxima entropía
Las familias exponenciales surgen naturalmente como respuesta a la siguiente pregunta: ¿cuál es la distribución de máxima entropía consistente con las restricciones dadas sobre los valores esperados? [ 16 ]
La entropía de información de una distribución de probabilidad dF ( x ) solo puede calcularse con respecto a otra distribución de probabilidad (o, más generalmente, una medida positiva), y ambas medidas deben ser mutuamente absolutamente continuas . Por consiguiente, necesitamos elegir una medida de referencia dH ( x ) con el mismo soporte que dF ( x ) .
La entropía de dF ( x ) relativa a dH ( x ) es
o
donde dF / dH y dH / dF son derivadas de Radon-Nikodym . La definición ordinaria de entropía para una distribución discreta soportada en un conjunto I , a saber:
asume , aunque rara vez se señala, que dH se elige como la medida de conteo en I.
Consideremos ahora una colección de cantidades observables (variables aleatorias) T i . La distribución de probabilidad dF cuya entropía con respecto a dH es mayor, sujeta a las condiciones de que el valor esperado de T i sea igual a t i , es una familia exponencial con dH como medida de referencia y ( T 1 , ..., T n ) como estadístico suficiente.
La derivación es un cálculo variacional simple que utiliza multiplicadores de Lagrange . La normalización se impone estableciendo T₀ = 1 como una de las restricciones. Los parámetros naturales de la distribución son los multiplicadores de Lagrange, y el factor de normalización es el multiplicador de Lagrange asociado a T₀ .
Para ver ejemplos de dichas derivaciones, consulte la distribución de probabilidad de entropía máxima .
Papel en la estadística
Estimación clásica: suficiencia
Según el teorema de Pitman - Koopman - Darmois , entre las familias de distribuciones de probabilidad cuyo dominio no varía con el parámetro que se estima, solo en las familias exponenciales existe un estadístico suficiente cuya dimensión permanece acotada a medida que aumenta el tamaño de la muestra.
En términos menos concisos, supongamos que X k , (donde k = 1, 2, 3, ..., n ) son variables aleatorias independientes e idénticamente distribuidas. Solo si su distribución pertenece a la familia exponencial existe un estadístico suficiente T ( X 1 , ..., X n ) cuyo número de componentes escalares no aumenta a medida que aumenta el tamaño de la muestra n ; el estadístico T puede ser un vector o un único número escalar , pero sea cual sea su naturaleza, su tamaño no crecerá ni disminuirá al obtenerse más datos.
Como contraejemplo, si se relajan estas condiciones, la familia de distribuciones uniformes (ya sean discretas o continuas , con uno o ambos límites desconocidos) tiene una estadística suficiente, a saber, el máximo de la muestra, el mínimo de la muestra y el tamaño de la muestra, pero no forma una familia exponencial, ya que el dominio varía con los parámetros.
Estimación bayesiana: distribuciones conjugadas
Las familias exponenciales también son importantes en la estadística bayesiana . En la estadística bayesiana, una distribución a priori se multiplica por una función de verosimilitud y luego se normaliza para producir una distribución a posteriori . En el caso de una función de verosimilitud que pertenece a una familia exponencial, existe una distribución a priori conjugada , que a menudo también pertenece a una familia exponencial. Una distribución a priori conjugada π para el parámetrode una familia exponencial
es dado por
o equivalentemente
donde s es la dimensión deyyson hiperparámetros (parámetros que controlan otros parámetros).corresponde al número efectivo de observaciones que aporta la distribución previa, ycorresponde a la cantidad total que estas pseudo-observaciones aportan al estadístico suficiente sobre todas las observaciones y pseudo-observaciones.es una constante de normalización que se determina automáticamente mediante las funciones restantes y sirve para garantizar que la función dada sea una función de densidad de probabilidad (es decir, que esté normalizada ).y equivalentementeson las mismas funciones que en la definición de la distribución sobre la cual π es la distribución a priori conjugada.
Una distribución a priori conjugada es aquella que, al combinarse con la función de verosimilitud y normalizarse, produce una distribución a posteriori del mismo tipo que la distribución a priori. Por ejemplo, si se estima la probabilidad de éxito de una distribución binomial, al elegir una distribución beta como distribución a priori, la distribución a posteriori será otra distribución beta. Esto simplifica considerablemente el cálculo de la distribución a posteriori. De manera similar, si se estima el parámetro de una distribución de Poisson, el uso de una distribución a priori gamma dará como resultado otra distribución a posteriori gamma. Las distribuciones a priori conjugadas suelen ser muy flexibles y convenientes. Sin embargo, si la creencia sobre el valor probable del parámetro theta de una distribución binomial está representada por (por ejemplo) una distribución a priori bimodal (de dos picos), esta no puede representarse mediante una distribución beta. En cambio, puede representarse utilizando una densidad de mezcla como distribución a priori, en este caso una combinación de dos distribuciones beta; esta es una forma de hiperdistribución a priori .
Una función de verosimilitud arbitraria no pertenecerá a una familia exponencial y, por lo tanto, en general, no existe una distribución a priori conjugada. La distribución a posteriori deberá calcularse entonces mediante métodos numéricos.
Para demostrar que la distribución previa anterior es una distribución previa conjugada, podemos derivar la distribución posterior.
Primero, supongamos que la probabilidad de una sola observación sigue una familia exponencial, parametrizada mediante su parámetro natural:
Luego, para los datosLa probabilidad se calcula de la siguiente manera:
Entonces, para la distribución a priori conjugada anterior:
Podemos entonces calcular la distribución posterior de la siguiente manera:
La última línea es el núcleo de la distribución posterior, es decir
Esto demuestra que la distribución posterior tiene la misma forma que la distribución previa.
Los datos X entran en esta ecuación solo en la expresión
lo que se denomina estadístico suficiente de los datos. Es decir, el valor del estadístico suficiente es suficiente para determinar completamente la distribución posterior. Los puntos de datos reales en sí mismos no son necesarios, y todos los conjuntos de puntos de datos con el mismo estadístico suficiente tendrán la misma distribución. Esto es importante porque la dimensión del estadístico suficiente no crece con el tamaño de los datos; solo tiene tantos componentes como componentes de los datos.(equivalentemente, el número de parámetros de la distribución de un único punto de datos).
Las ecuaciones de actualización son las siguientes:
Esto demuestra que las ecuaciones de actualización se pueden escribir simplemente en términos del número de puntos de datos y la estadística suficiente de los datos. Esto se puede ver claramente en los diversos ejemplos de ecuaciones de actualización que se muestran en la página de la distribución a priori conjugada . Debido a la forma en que se calcula la estadística suficiente, necesariamente implica sumas de componentes de los datos (en algunos casos disfrazadas de productos u otras formas; un producto se puede escribir en términos de una suma de logaritmos ). Los casos en los que las ecuaciones de actualización para distribuciones particulares no coinciden exactamente con las formas anteriores son casos en los que la distribución a priori conjugada se ha expresado utilizando una parametrización diferente a la que produce una distribución a priori conjugada de la forma anterior, a menudo específicamente porque la forma anterior está definida sobre el parámetro natural.mientras que las distribuciones a priori conjugadas generalmente se definen sobre el parámetro real
Estimación insesgada
Si la probabilidades una familia exponencial, entonces el estimador insesgado dees. [ 17 ]
Pruebas de hipótesis: pruebas uniformemente más potentes
Una familia exponencial de un parámetro tiene una razón de verosimilitud monótona no decreciente en el estadístico suficiente T ( x ) , siempre que η ( θ ) sea no decreciente. Como consecuencia, existe una prueba uniformemente más potente para contrastar la hipótesis H 0 : θ ≥ θ 0 frente a H 1 : θ < θ 0 .
Modelos lineales generalizados
Las familias exponenciales constituyen la base de las funciones de distribución utilizadas en los modelos lineales generalizados (GLM), una clase de modelos que abarca muchos de los modelos de regresión más utilizados en estadística. Algunos ejemplos son la regresión logística con la familia binomial y la regresión de Poisson .
Véase también
Notas a pie de página
- ↑ Por ejemplo, la familia de distribuciones normales incluye la distribución normal estándar N (0, 1) con media 0 y varianza 1, así como otras distribuciones normales con media y varianza diferentes.
- ↑ "Función de partición" se usa a menudo en estadística como sinónimo de "factor de normalización".
- ↑ Estas distribuciones a menudo no son familias exponenciales. Ejemplos comunes de familias no exponenciales que surgen de las exponenciales son la distribución t de Student , la distribución beta-binomial y la distribución multinomial de Dirichlet .
Referencias
Citas
- ↑ Kupperman, M. (1958). "Probabilidades de hipótesis y estadística de la información en el muestreo de poblaciones de clase exponencial" . Annals of Mathematical Statistics . 9 (2): 571– 575. doi : 10.1214/aoms/1177706633 . JSTOR 2237349 .
- ↑ Andersen, Erling (septiembre de 1970). "Suficiencia y familias exponenciales para espacios muestrales discretos". Journal of the American Statistical Association . 65 ( 331 ). Journal of the American Statistical Association: 1248–1255 . doi : 10.2307/2284291 . JSTOR 2284291. MR 0268992 .
- ↑ Pitman, E. ; Wishart, J. (1936). "Estadística suficiente y precisión intrínseca". Actas matemáticas de la Sociedad Filosófica de Cambridge . 32 (4): 567– 579. Bibcode : 1936PCPS...32..567P . doi : 10.1017/S0305004100019307 . S2CID 120708376 .
- ^ Darmois, G. (1935). "Sur les lois de probabilites una estimación exhaustiva". CR Acad. Ciencia. París (en francés). 200 : 1265-1266 .
- ↑ Koopman, B. (1936). " Sobre la distribución que admite una estadística suficiente" . Transactions of the American Mathematical Society . 39 (3). American Mathematical Society : 399–409 . doi : 10.2307/1989758 . JSTOR 1989758. MR 1501854 .
- ↑ "Familias exponenciales generales" . www.randomservices.org . Consultado el 30 de agosto de 2022 .
- ↑ Abramovich y Ritov (2013). Teoría estadística: Una introducción concisa . Chapman & Hall. ISBN 978-1439851845.
- ↑ Blei, David. "Inferencia variacional" (PDF) . Universidad de Princeton.
- ↑ Casella, George (2002). Inferencia estadística . Roger L. Berger (2.ª ed.). Australia: Thomson Learning. Teorema 6.2.25. ISBN 0-534-24312-6OCLC 46538638
- ↑ Brown, Lawrence D. (1986). Fundamentos de familias exponenciales estadísticas : con aplicaciones en la teoría de la decisión estadística . Hayward, California: Instituto de Estadística Matemática. Teorema 2.12. ISBN 0-940600-10-2OCLC 15986663
- ↑ Keener, Robert W. (2010). Estadística teórica : temas para un curso básico . Nueva York. pp. 47, Ejemplo 3.12. ISBN 978-0-387-93839-4OCLC 676700036
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - ↑ Nielsen, Frank; Garcia, Vincent (2009). "Familias exponenciales estadísticas: Un resumen con tarjetas didácticas". arXiv : 0911.4863 [ cs.LG ].
- ↑ van Garderen, Kees Jan (1997). "Modelos exponenciales curvos en econometría". Teoría econométrica . 13 (6): 771– 790. doi : 10.1017/S0266466600006253 . S2CID 122742807 .
- ↑ Nielsen & Nock 2010 , 4. Divergencias de Bregman y entropía relativa de familias exponenciales.
- ↑ Barndorff-Nielsen 1978 , 9.1 Dualidad convexa y familias exponenciales.
- ↑ Strimmer, K. (2026). De la física a la estadística: una ruta sencilla hacia las familias exponenciales mediante la entropía máxima. ArXiv:2604.22752. https://arxiv.org/abs/2604.22752
- ↑ Efron, Bradley (diciembre de 2011). "La fórmula de Tweedie y el sesgo de selección" . Journal of the American Statistical Association . 106 (496): 1602– 1614. doi : 10.1198/jasa.2011.tm11181 . ISSN 0162-1459 . PMC 3325056. PMID 22505788 .
Fuentes
- Barndorff-Nielsen, Ole (1978). Información y familias exponenciales en teoría estadística . Serie Wiley en Probabilidad y Estadística Matemática. Chichester: John Wiley & Sons, Ltd. pp. ix+238 pp. ISBN 0-471-99545-2. SR 0489333 .
- Nielsen, Frank; Garcia, Vincent (2009). "Familias exponenciales estadísticas: Un resumen con tarjetas didácticas". arXiv : 0911.4863 . Bibcode : 2009arXiv0911.4863N .
- Nielsen, Frank; Nock, Richard (2010). Entropías y entropías cruzadas de familias exponenciales (PDF) . Conferencia Internacional IEEE sobre Procesamiento de Imágenes. doi : 10.1109/ICIP.2010.5652054 . Archivado del original (PDF) el 31 de marzo de 2019.
Lecturas adicionales
- Fahrmeir, Ludwig; Tutz, G. (1994). Modelado estadístico multivariante basado en modelos lineales generalizados . Springer. pp. 18–22 , 345–349 . ISBN 0-387-94233-5.
- Keener, Robert W. (2006). Estadística teórica: Temas para un curso básico . Springer. pp. 27–28 , 32–33 . ISBN 978-0-387-93838-7.
- Lehmann, EL; Casella, G. (1998). Teoría de la estimación puntual (2ª ed.). segundo. 1.5. ISBN 0-387-98502-6.
Enlaces externos
- Introducción a la familia exponencial de distribuciones
- Familia exponencial de distribuciones en los primeros usos conocidos de algunas de las palabras de matemáticas
- jMEF: Una biblioteca Java para familias exponenciales. Enlace obsoleto archivado el 11/04/2013 en archive.today.
- Modelos gráficos, familias exponenciales e inferencia variacional por Wainwright y Jordan (2008)
- exponenciales
- Distribuciones continuas
- Distribuciones discretas
- Tipos de distribuciones de probabilidad