Articulo de referencia

Familia exponencial

En probabilidad y estadística , una familia exponencial es un conjunto paramétrico de distribuciones de probabilidad de una forma determinada, especificada a continuación. Esta ...

En probabilidad y estadística , una familia exponencial es un conjunto paramétrico de distribuciones de probabilidad de una forma determinada, especificada a continuación. Esta forma especial se elige por conveniencia matemática, incluyendo la posibilidad de que el usuario calcule esperanzas, covarianzas usando diferenciación basada en algunas propiedades algebraicas útiles, así como por generalidad, ya que las familias exponenciales son, en cierto sentido, conjuntos de distribuciones muy naturales para considerar. El término clase exponencial se usa a veces en lugar de "familia exponencial" [ 1 ] o el término más antiguo familia de Koopman-Darmois . A veces denominada informalmente familia exponencial, esta clase de distribuciones es distinta porque todas poseen una variedad de propiedades deseables, la más importante la existencia de una estadística suficiente .

El concepto de familias exponenciales se atribuye a [ 2 ] EJG Pitman , [ 3 ] G. Darmois , [ 4 ] y BO Koopman [ 5 ] en 1935 1936. Las familias exponenciales de distribuciones proporcionan un marco general para seleccionar una posible parametrización alternativa de una familia paramétrica de distribuciones, en términos de parámetros naturales, y para definir estadísticas de muestra útiles , llamadas estadísticas suficientes naturales de la familia.

Dificultad de nomenclatura

Los términos "distribución" y "familia" se utilizan a menudo de forma imprecisa: específicamente, una familia exponencial es un conjunto de distribuciones, donde la distribución específica varía con el parámetro; [ a ] ​​sin embargo, a una familia paramétrica de distribuciones se la suele denominar " una distribución" (como "la distribución normal", que significa "la familia de distribuciones normales"), y al conjunto de todas las familias exponenciales a veces se le denomina imprecisamente "la" familia exponencial.

Definición

La mayoría de las distribuciones de uso común forman una familia exponencial o un subconjunto de una familia exponencial, como se detalla en la subsección siguiente. Las subsecciones posteriores presentan definiciones matemáticas cada vez más generales de una familia exponencial. Un lector ocasional podría centrarse en la primera y más sencilla definición, que corresponde a una familia de distribuciones de probabilidad discretas o continuas con un solo parámetro.

Ejemplos de distribuciones de la familia exponencial

Las familias exponenciales incluyen muchas de las distribuciones más comunes. Entre muchas otras, las familias exponenciales incluyen las siguientes: [ 6 ]

Varias distribuciones comunes pertenecen a familias exponenciales, pero solo cuando ciertos parámetros son fijos y conocidos. Por ejemplo:

Cabe señalar que, en cada caso, los parámetros que deben fijarse son aquellos que establecen un límite al rango de valores que pueden observarse.

Ejemplos de distribuciones comunes que no pertenecen a familias exponenciales son la t de Student , la mayoría de las distribuciones de mezcla e incluso la familia de distribuciones uniformes cuando los límites no son fijos. Consulte la sección siguiente sobre ejemplos para obtener más información.

Parámetro escalar

El valor deθ{\displaystyle \theta }se denomina parámetro de la familia.

Una familia exponencial de un solo parámetro es un conjunto de distribuciones de probabilidad cuya función de densidad de probabilidad (o función de masa de probabilidad , para el caso de una distribución discreta ) puede expresarse en la forma

Fincógnita(incógnita|θ)=h(incógnita)exp[η(θ)T(incógnita)A(θ)]{\displaystyle f_{X}{\left(x\,{\big |}\,\theta \right)}=h(x)\,\exp \left[\eta (\theta )\cdot T(x)-A(\theta )\right]}

donde T ( x ) , h ( x ) , η ( θ ) , y A ( θ ) son funciones conocidas. La función h ( x ) debe ser no negativa.

Una forma alternativa y equivalente que se suele dar es

Fincógnita(incógnita | θ)=h(incógnita)gramo(θ)exp[η(θ)T(incógnita)]{\displaystyle f_{X}{\left(x\ {\big |}\ \theta \right)}=h(x)\,g(\theta )\,\exp \left[\eta (\theta )\cdot T(x)\right]}

o equivalentemente

Fincógnita(incógnita | θ)=exp[η(θ)T(incógnita)A(θ)+B(incógnita)].{\displaystyle f_{X}{\left(x\ {\big |}\ \theta \right)}=\exp \left[\eta (\theta )\cdot T(x)-A(\theta )+B(x)\right].}

En términos de probabilidad logarítmica , registro(Fincógnita(incógnita | θ))=η(θ)T(incógnita)A(θ)+B(incógnita).{\displaystyle \log(f_{X}{\left(x\ {\big |}\ \theta \right)})=\eta (\theta )\cdot T(x)-A(\theta )+B(x).}

Tenga en cuenta quegramo(θ)=miA(θ){\displaystyle g(\theta )=e^{-A(\theta )}}yh(incógnita)=miB(incógnita){\displaystyle h(x)=e^{B(x)}}.

El soporte debe ser independiente de θ

Es importante destacar el apoyo deFincógnita(incógnita|θ){\displaystyle f_{X}{\left(x{\big |}\theta \right)}}(todos los posiblesincógnita{\displaystyle x}valores para los cualesFincógnita(incógnita|θ){\displaystyle f_{X}\!\left(x{\big |}\theta \right)}es mayor que0{\displaystyle 0}) se requiere que no dependa deθ .{\displaystyle \theta ~.}[ 7 ] Este requisito puede utilizarse para excluir una distribución de familia paramétrica de ser una familia exponencial.

Por ejemplo: La distribución de Pareto tiene una función de densidad de probabilidad que se define paraincógnitaincógnitametro{\displaystyle x\geq x_{\mathsf {m}}}(el valor mínimo,incógnitametro ,{\displaystyle x_{m}\ ,}siendo el parámetro de escala) y su soporte, por lo tanto, tiene un límite inferior deincógnitametro .{\displaystyle x_{\mathsf {m}}~.}Desde el apoyo deFα,incógnitametro(incógnita){\displaystyle f_{\alpha ,x_{m}}\!(x)}depende del valor del parámetro, la familia de distribuciones de Pareto no forma una familia exponencial de distribuciones (al menos cuandoincógnitametro{\displaystyle x_{m}}se desconoce).

Otro ejemplo: las distribuciones de tipo Bernoulli ( binomial , binomial negativa , distribución geométrica y similares) solo pueden incluirse en la clase exponencial si el número de ensayos de Bernoulli , n , se trata como una constante fija, excluida del/de los parámetro(s) libre(s).θ{\displaystyle \theta }– puesto que el número permitido de ensayos establece los límites para el número de "éxitos" o "fracasos" que se pueden observar en un conjunto de ensayos.

Valores vectoriales x y θ

A menudoincógnita{\displaystyle x}es un vector de mediciones, en cuyo casoT(incógnita){\displaystyle T(x)}puede ser una función del espacio de posibles valores deincógnita{\displaystyle x}a las cifras reales.

En términos más generales,η(θ){\displaystyle \eta (\theta )}yT(incógnita){\displaystyle T(x)}cada uno puede ser un vector de valores tal queη(θ)T(incógnita){\displaystyle \eta (\theta )\cdot T(x)}es de valor real. Sin embargo, consulte la discusión a continuación sobre parámetros vectoriales , en relación con la familia exponencial curva .

Formulación canónica

Siη(θ)=θ ,{\displaystyle \eta (\theta )=\theta \ ,}Entonces se dice que la familia exponencial está en forma canónica . Al definir un parámetro transformadoη=η(θ) ,{\displaystyle \eta =\eta (\theta )\ ,}Siempre es posible convertir una familia exponencial a forma canónica. La forma canónica no es única, ya queη(θ){\displaystyle \eta (\theta )}puede multiplicarse por cualquier constante distinta de cero, siempre que T ( x ) se multiplique por el recíproco de esa constante, o se puede sumar una constante c aη(θ){\displaystyle \eta (\theta )}y h ( x ) multiplicado porexp[doT(incógnita)]{\displaystyle \exp \left[{-c}\cdot T(x)\,\right]}para compensarlo. En el caso especial queη(θ)=θ{\displaystyle \eta (\theta )=\theta }y T ( x ) = x , entonces la familia se llama familia exponencial natural .

Incluso cuandoincógnita{\displaystyle x}es un escalar y solo hay un parámetro, las funcionesη(θ){\displaystyle \eta (\theta )}yT(incógnita){\displaystyle T(x)}aún pueden ser vectores, como se describe a continuación.

La funciónA(θ) ,{\displaystyle A(\theta )\ ,}o equivalentementegramo(θ) ,{\displaystyle g(\theta )\ ,}se determina automáticamente una vez que se han elegido las otras funciones, ya que debe asumir una forma que provoque que la distribución se normalice (suma o integral a uno en todo el dominio). Además, ambas funciones siempre se pueden escribir como funciones deη ,{\displaystyle \eta \ ,}incluso cuandoη(θ){\displaystyle \eta (\theta )}no es una función uno a uno , es decir dos o más valores diferentes deθ{\displaystyle \theta }mapear al mismo valor deη(θ) ,{\displaystyle \eta (\theta )\ ,}y por lo tantoη(θ){\displaystyle \eta (\theta )}no se puede invertir. En tal caso, todos los valores deθ{\displaystyle \theta }mapeo al mismoη(θ){\displaystyle \eta (\theta )}también tendrá el mismo valor paraA(θ){\displaystyle A(\theta )}ygramo(θ) .{\displaystyle g(\theta )~.}

Factorización de las variables involucradas

Es importante destacar, y esto caracteriza a todas las variantes de la familia exponencial, que el/los parámetro(s) y la/s variable(s) de observación deben factorizarse (pueden separarse en productos, cada uno de los cuales involucra un solo tipo de variable), ya sea directamente o dentro de cualquiera de las partes (la base o el exponente) de una operación de exponenciación . En general, esto significa que todos los factores que constituyen la función de densidad o de masa deben tener una de las siguientes formas:

F(incógnita),doF(incógnita),[F(incógnita)]do,[F(incógnita)]gramo(θ),[F(incógnita)]h(incógnita)gramo(θ),gramo(θ),dogramo(θ),[gramo(θ)]do,[gramo(θ)]F(incógnita),  or  [gramo(θ)]h(incógnita)j(θ),{\displaystyle {\begin{aligned}f(x),&&c^{f(x)},&&{[f(x)]}^{c},&&{[f(x)]}^{g(\theta )},&&{[f(x)]}^{h(x)g(\theta )},\\g(\theta ),&&c^{g(\theta )},&&{[g(\theta )]}^{c},&&{[g(\theta )]}^{f(x)},&&~~{\mathsf {or}}~~{[g(\theta )]}^{h(x)j(\theta )},\end{aligned}}}

donde f y h son funciones arbitrarias de x , la variable estadística observada; g y j son funciones arbitrarias deθ,{\displaystyle \theta ,}los parámetros fijos que definen la forma de la distribución; y c es cualquier expresión constante arbitraria (es decir, un número o una expresión que no cambia con x oθ{\displaystyle \theta }).

Existen restricciones adicionales sobre la cantidad de factores de este tipo que pueden ocurrir. Por ejemplo, las dos expresiones:

[F(incógnita)gramo(θ)]h(incógnita)j(θ),[F(incógnita)]h(incógnita)j(θ)[gramo(θ)]h(incógnita)j(θ),{\displaystyle {[f(x)g(\theta )]}^{h(x)j(\theta )},\qquad {[f(x)]}^{h(x)j(\theta )}{[g(\theta )]}^{h(x)j(\theta )},}

son lo mismo, es decir, un producto de dos factores "permitidos". Sin embargo, cuando se reescribe en la forma factorizada,

[F(incógnita)gramo(θ)]h(incógnita)j(θ)=[F(incógnita)]h(incógnita)j(θ)[gramo(θ)]h(incógnita)j(θ)=exp{[h(incógnita)registroF(incógnita)]j(θ)+h(incógnita)[j(θ)registrogramo(θ)]},{\displaystyle {\begin{aligned}{\left[f(x)g(\theta )\right]}^{h(x)j(\theta )}&={\left[f(x)\right]}^{h(x)j(\theta )}{\left[g(\theta )\right]}^{h(x)j(\theta )}\\[4pt]&=\exp \left\{{[h(x)\log f(x)]j(\theta )+h(x)[j(\theta )\log g(\theta )]}\right\},\end{aligned}}}

Se puede observar que no se puede expresar en la forma requerida. (Sin embargo, una forma de este tipo pertenece a una familia exponencial curva , que permite múltiples términos factorizados en el exponente ) .

Para ver por qué una expresión de la forma

[F(incógnita)]gramo(θ){\displaystyle {[f(x)]}^{g(\theta )}}

califica, [F(incógnita)]gramo(θ)=migramo(θ)registroF(incógnita){\displaystyle {[f(x)]}^{g(\theta )}=e^{g(\theta )\log f(x)}}

y por lo tanto se factoriza dentro del exponente. De manera similar,

[F(incógnita)]h(incógnita)gramo(θ)=mih(incógnita)gramo(θ)registroF(incógnita)=mi[h(incógnita)registroF(incógnita)]gramo(θ){\displaystyle {[f(x)]}^{h(x)g(\theta )}=e^{h(x)g(\theta )\log f(x)}=e^{[h(x)\log f(x)]g(\theta )}}

y de nuevo se factoriza dentro del exponente.

Un factor que consiste en una suma donde intervienen ambos tipos de variables (por ejemplo, un factor de la forma1+F(incógnita)gramo(θ){\displaystyle 1+f(x)g(\theta )}) no se puede factorizar de esta manera (excepto en algunos casos donde aparece directamente en un exponente); por eso, por ejemplo, la distribución de Cauchy y la distribución t de Student no son familias exponenciales.

Parámetro vectorial

La definición en términos de un parámetro numérico real puede extenderse a un parámetro vectorial real.

θ[θ1θ2θs]T.{\displaystyle {\boldsymbol {\theta }}\equiv {\begin{bmatrix}\theta _{1}&\theta _{2}&\cdots &\theta _{s}\end{bmatrix}}^{\mathsf {T}}.}

Se dice que una familia de distribuciones pertenece a una familia exponencial vectorial si la función de densidad de probabilidad (o función de masa de probabilidad, para distribuciones discretas) se puede escribir como

Fincógnita(incógnitaθ)=h(incógnita)exp(i=1sηi(θ)Ti(incógnita)A(θ)) ,{\displaystyle f_{X}(x\mid {\boldsymbol {\theta }})=h(x)\,\exp \left(\sum _{i=1}^{s}\eta _{i}({\boldsymbol {\theta }})T_{i}(x)-A({\boldsymbol {\theta }})\right)~,}

o en una forma más compacta,

Fincógnita(incógnitaθ)=h(incógnita)exp[η(θ)T(incógnita)A(θ)]{\displaystyle f_{X}(x\mid {\boldsymbol {\theta }})=h(x)\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (x)-A({\boldsymbol {\theta }})\right]}

Esta forma escribe la suma como un producto escalar de funciones con valores vectoriales.η(θ){\displaystyle {\boldsymbol {\eta }}({\boldsymbol {\theta }})}y T ( x ) .

Una forma alternativa y equivalente que se ve a menudo es

Fincógnita(incógnitaθ)=h(incógnita)gramo(θ)exp[η(θ)T(incógnita)]{\displaystyle f_{X}(x\mid {\boldsymbol {\theta }})=h(x)\,g({\boldsymbol {\theta }})\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (x)\right]}

Al igual que en el caso de valores escalares, se dice que la familia exponencial está en forma canónica si

ηi(θ)=θi ,i.{\displaystyle \eta _{i}({\boldsymbol {\theta }})=\theta _{i}~,\quad \forall i\,.}

Se dice que una familia exponencial vectorial es curva si la dimensión de

θ[θ1θ2θd]T{\displaystyle {\boldsymbol {\theta }}\equiv {\begin{bmatrix}\theta _{1}&\theta _{2}&\cdots &\theta _{d}\end{bmatrix}}^{\mathsf {T}}}

es menor que la dimensión del vector

η(θ)[η1(θ)η2(θ)ηs(θ)]T .{\displaystyle {\boldsymbol {\eta }}({\boldsymbol {\theta }})\equiv {\begin{bmatrix}\eta _{1}{\!({\boldsymbol {\theta }})}&\eta _{2}{\!({\boldsymbol {\theta }})}&\cdots &\eta _{s}{\!({\boldsymbol {\theta }})}\end{bmatrix}}^{\mathsf {T}}~.}

Es decir, si la dimensión , d , del vector de parámetros es menor que el número de funciones , s , del vector de parámetros en la representación anterior de la función de densidad de probabilidad. La mayoría de las distribuciones comunes en la familia exponencial no son curvas, y muchos algoritmos diseñados para trabajar con cualquier familia exponencial asumen implícita o explícitamente que la distribución no es curva.

Al igual que en el caso de un parámetro escalar, la funciónA(θ){\displaystyle A({\boldsymbol {\theta }})}o equivalentementegramo(θ){\displaystyle g({\boldsymbol {\theta }})}se determina automáticamente por la restricción de normalización, una vez que se han elegido las demás funciones. Incluso siη(θ){\displaystyle {\boldsymbol {\eta }}({\boldsymbol {\theta }})}no es uno a uno, funcionesA(η){\displaystyle A({\boldsymbol {\eta }})}ygramo(η){\displaystyle g({\boldsymbol {\eta }})}se puede definir exigiendo que la distribución esté normalizada para cada valor del parámetro natural.η{\displaystyle {\boldsymbol {\eta }}}Esto da como resultado la forma canónica .

Fincógnita(incógnitaη)=h(incógnita)exp[ηT(incógnita)A(η)],{\displaystyle f_{X}(x\mid {\boldsymbol {\eta }})=h(x)\exp \left[{\boldsymbol {\eta }}\cdot \mathbf {T} (x)-A({\boldsymbol {\eta }})\right],}

o equivalentemente

Fincógnita(incógnitaη)=h(incógnita)gramo(η)exp[ηT(incógnita)].{\displaystyle f_{X}(x\mid {\boldsymbol {\eta }})=h(x)g({\boldsymbol {\eta }})\exp \left[{\boldsymbol {\eta }}\cdot \mathbf {T} (x)\right].}

Las formas anteriores a veces pueden verse conηTT(incógnita){\displaystyle {\boldsymbol {\eta }}^{\mathsf {T}}\mathbf {T} (x)}en lugar deηT(incógnita){\displaystyle {\boldsymbol {\eta }}\cdot \mathbf {T} (x)\,}Estas formulaciones son exactamente equivalentes, utilizando simplemente una notación diferente para el producto escalar .

Parámetro vectorial, variable vectorial

La forma de parámetro vectorial sobre una única variable aleatoria escalar se puede extender trivialmente para cubrir una distribución conjunta sobre un vector de variables aleatorias. La distribución resultante es simplemente la misma que la distribución anterior para una variable aleatoria escalar, donde cada ocurrencia del escalar x se reemplaza por el vector.

incógnita=[incógnita1incógnita2incógnitak]T.{\displaystyle \mathbf {x} ={\begin{bmatrix}x_{1}&x_{2}&\cdots &x_{k}\end{bmatrix}}^{\mathsf {T}}.}

Las dimensiones k de la variable aleatoria no tienen por qué coincidir con la dimensión d del vector de parámetros, ni (en el caso de una función exponencial curva) con la dimensión s del parámetro natural.η{\displaystyle {\boldsymbol {\eta }}}y estadístico suficiente T ( x )  .

La distribución en este caso se escribe como

Fincógnita(incógnitaθ)=h(incógnita)exp[i=1sηi(θ)Ti(incógnita)A(θ)]{\displaystyle f_{X}{\left(\mathbf {x} \mid {\boldsymbol {\theta }}\right)}=h(\mathbf {x} )\,\exp \!\left[\sum _{i=1}^{s}\eta _{i}({\boldsymbol {\theta }})T_{i}(\mathbf {x} )-A({\boldsymbol {\theta }})\right]}

O de forma más compacta como

Fincógnita(incógnitaθ)=h(incógnita)exp[η(θ)T(incógnita)A(θ)]{\displaystyle f_{X}{\left(\mathbf {x} \mid {\boldsymbol {\theta }}\right)}=h(\mathbf {x} )\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (\mathbf {x} )-A({\boldsymbol {\theta }})\right]}

O alternativamente como

Fincógnita(incógnitaθ)=gramo(θ)h(incógnita)exp[η(θ)T(incógnita)]{\displaystyle f_{X}{\left(\mathbf {x} \mid {\boldsymbol {\theta }}\right)}=g({\boldsymbol {\theta }})\,h(\mathbf {x} )\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (\mathbf {x} )\right]}

Formulación basada en la teoría de la medida

Utilizamos funciones de distribución acumulativa (CDF) para abarcar tanto distribuciones discretas como continuas.

Supongamos que H es una función no decreciente de una variable real. Entonces, las integrales de Lebesgue-Stieltjes con respecto adH(incógnita){\displaystyle dH(\mathbf {x} )}son integrales con respecto a la medida de referencia de la familia exponencial generada por H. 

Cualquier miembro de esa familia exponencial tiene función de distribución acumulativa

dF(incógnitaθ)=exp[η(θ)T(incógnita)A(θ)] dH(incógnita).{\displaystyle dF{\left(\mathbf {x} \mid {\boldsymbol {\theta }}\right)}=\exp \left[{\boldsymbol {\eta }}(\theta )\cdot \mathbf {T} (\mathbf {x} )-A({\boldsymbol {\theta }})\right]~dH(\mathbf {x} )\,.}

H ( x ) es un integrador de Lebesgue-Stieltjes para la medida de referencia. Cuando la medida de referencia es finita, se puede normalizar y H es en realidad la función de distribución acumulativa de una distribución de probabilidad. Si F es absolutamente continua con una densidadF(incógnita){\displaystyle f(x)}con respecto a una medida de referenciadincógnita{\displaystyle dx}(típicamente la medida de Lebesgue ), se puede escribirdF(incógnita)=F(incógnita)dincógnita{\displaystyle dF(x)=f(x)\,dx}En este caso, H también es absolutamente continua y se puede escribirdH(incógnita)=h(incógnita)dincógnita{\displaystyle dH(x)=h(x)\,dx}Por lo tanto, las fórmulas se reducen a las de los párrafos anteriores. Si F es discreta, entonces H es una función escalonada (con escalones en el soporte de F ).

Alternativamente, podemos escribir la medida de probabilidad directamente como

PAG(dincógnitaθ)=exp[η(θ)T(incógnita)A(θ)] μ(dincógnita).{\displaystyle P\left(d\mathbf {x} \mid {\boldsymbol {\theta }}\right)=\exp \left[{\boldsymbol {\eta }}(\theta )\cdot \mathbf {T} (\mathbf {x} )-A({\boldsymbol {\theta }})\right]~\mu (d\mathbf {x} )\,.}

para alguna medida de referenciaμ{\displaystyle \mu \,}.

Interpretación

En las definiciones anteriores, las funciones T ( x ) , η ( θ ) y A ( η ) eran arbitrarias. Sin embargo, estas funciones tienen interpretaciones importantes en la distribución de probabilidad resultante.

  • T ( x ) es un estadístico suficiente de la distribución. Para las familias exponenciales, el estadístico suficiente es una función de los datos que contiene toda la información que los datos x proporcionan con respecto a los valores de los parámetros desconocidos. Esto significa que, para cualquier conjunto de datosincógnita{\displaystyle x}yy{\displaystyle y}, la razón de verosimilitud es la misma, es decirF(incógnita;θ1)F(incógnita;θ2)=F(y;θ1)F(y;θ2){\displaystyle {\frac {f(x;\theta _{1})}{f(x;\theta _{2})}}={\frac {f(y;\theta _{1})}{f(y;\theta _{2})}}}Si T ( x ) = T ( y ) , esto se cumple incluso si x e y no son iguales. La dimensión de T ( x ) es igual al número de parámetros de θ y abarca toda la información relativa a los datos relacionados con dicho parámetro . El estadístico suficiente de un conjunto de observaciones de datos independientes e idénticamente distribuidas es simplemente la suma de los estadísticos suficientes individuales, y encapsula toda la información necesaria para describir la distribución posterior de los parámetros, dados los datos (y, por lo tanto, para obtener cualquier estimación deseada de los parámetros). (Esta importante propiedad se analiza con más detalle a continuación ).
  • η se denomina parámetro natural . El conjunto de valores de η para los cuales la funciónFincógnita(incógnita;η){\displaystyle f_{X}(x;\eta )}Si es integrable, se le llama espacio de parámetros natural . Se puede demostrar que el espacio de parámetros natural es siempre convexo .
  • A ( η ) se llama elfunción de partición logarítmica [ b ] porque es el logaritmo de un factor de normalización , sin el cualFincógnita(incógnita;θ){\displaystyle f_{X}(x;\theta )}no sería una distribución de probabilidad:A(η)=registro(incógnitah(incógnita)exp[η(θ)T(incógnita)]dincógnita){\displaystyle A(\eta )=\log \left(\int _{X}h(x)\,\exp \left[\eta (\theta )\cdot T(x)\right]\,dx\right)}

La función A es importante por derecho propio, porque la media , la varianza y otros momentos del estadístico suficiente T ( x ) se pueden derivar simplemente diferenciando A ( η ) . Por ejemplo, debido a que log( x ) es uno de los componentes del estadístico suficiente de la distribución gamma ,mi[registroincógnita]{\displaystyle \operatorname {\mathcal {E}} [\log x]}se puede determinar fácilmente para esta distribución usando A ( η ) . Técnicamente, esto es cierto porqueK(η)=A(η+)A(η),{\displaystyle K{\left(u\mid \eta \right)}=A(\eta +u)-A(\eta )\,,}es la función generadora de cumulantes de la estadística suficiente.

Propiedades

Las familias exponenciales poseen numerosas propiedades que las hacen extremadamente útiles para el análisis estadístico. En muchos casos, se puede demostrar que solo las familias exponenciales poseen estas propiedades. Ejemplos:

Dada una familia exponencial definida porFincógnita(incógnitaθ)=h(incógnita)exp[θT(incógnita)A(θ)]{\displaystyle f_{X}{\!(x\mid \theta )}=h(x)\exp \left[\theta \cdot T(x)-A(\theta )\right]}, dóndeΘ{\displaystyle \Theta }es el espacio de parámetros, tal queθΘRk{\displaystyle \theta \in \Theta \subset \mathbb {R} ^{k}}. Entonces

  • SiΘ{\displaystyle \Theta }tiene interior no vacío enRk{\displaystyle \mathbb {R} ^{k}}, luego dadas las muestras IIDincógnita1,...,incógnitanorteFincógnita{\displaystyle X_{1},...,X_{n}\sim f_{X}}, la estadísticaT(incógnita1,,incógnitanorte):=i=1norteT(incógnitai){\textstyle T(X_{1},\dots ,X_{n}):=\sum _{i=1}^{n}T(X_{i})}es una estadística completa paraθ{\displaystyle \theta }. [ 9 ] [ 10 ]
  • T{\displaystyle T}es una estadística mínima paraθ{\displaystyle \theta }si y solo si para todosθ1,θ2Θ{\displaystyle \theta _{1},\theta _{2}\in \Theta }, yincógnita1,incógnita2{\displaystyle x_{1},x_{2}}en apoyo deincógnita{\displaystyle X}, si(θ1θ2)[T(incógnita1)T(incógnita2)]=0{\displaystyle (\theta _{1}-\theta _{2})\cdot [T(x_{1})-T(x_{2})]=0}, entoncesθ1=θ2{\displaystyle \theta _{1}=\theta _{2}}oincógnita1=incógnita2{\displaystyle x_{1}=x_{2}}. [ 11 ]

Ejemplos

Al considerar los ejemplos de esta sección, es fundamental recordar la discusión anterior sobre lo que significa decir que una "distribución" es una familia exponencial, y en particular tener presente que el conjunto de parámetros que se permiten variar es crucial para determinar si una "distribución" es o no una familia exponencial.

Las distribuciones normal , exponencial , log-normal , gamma , chi-cuadrado , beta , Dirichlet , Bernoulli , categórica , Poisson , geométrica , gaussiana inversa , ALAAM , von Mises y von Mises-Fisher son todas familias exponenciales.

Algunas distribuciones son familias exponenciales solo si algunos de sus parámetros se mantienen fijos. La familia de distribuciones de Pareto con un límite mínimo fijo x m ​​forma una familia exponencial. Las familias de distribuciones binomiales y multinomiales con un número fijo de ensayos n pero con parámetros de probabilidad desconocidos son familias exponenciales. La familia de distribuciones binomiales negativas con un número fijo de fallos (también conocido como parámetro de tiempo de parada) r es una familia exponencial. Sin embargo, cuando se permite que varíe cualquiera de los parámetros fijos mencionados anteriormente, la familia resultante no es una familia exponencial.

Como se mencionó anteriormente, por regla general, el soporte de una familia exponencial debe permanecer constante para todos los parámetros de la familia. Por esta razón, los casos anteriores (por ejemplo, la distribución binomial con un número variable de ensayos y la distribución de Pareto con un límite mínimo variable) no son familias exponenciales: en todos los casos, el parámetro en cuestión afecta el soporte (en particular, modifica el valor mínimo o máximo posible). Por razones similares, ni la distribución uniforme discreta ni la distribución uniforme continua son familias exponenciales, ya que uno o ambos límites varían.

La distribución de Weibull con parámetro de forma fijo k pertenece a la familia exponencial. A diferencia de los ejemplos anteriores, el parámetro de forma no afecta al soporte; el hecho de que al permitirle variar la distribución de Weibull deje de ser exponencial se debe más bien a la forma particular de su función de densidad de probabilidad ( k aparece en el exponente de un exponente).

En general, las distribuciones que resultan de una mezcla finita o infinita de otras distribuciones, por ejemplo, las densidades de modelos de mezcla y las distribuciones de probabilidad compuestas , no son familias exponenciales. Ejemplos de ello son los modelos de mezcla gaussianos típicos , así como muchas distribuciones de cola pesada que resultan de la composición (es decir, la mezcla infinita) de una distribución con una distribución a priori sobre uno de sus parámetros, por ejemplo, la distribución t de Student (composición de una distribución normal sobre una distribución a priori de precisión con distribución gamma ), y las distribuciones beta-binomial y multinomial de Dirichlet . Otros ejemplos de distribuciones que no son familias exponenciales son la distribución F , la distribución de Cauchy , la distribución hipergeométrica y la distribución logística .

A continuación se presentan algunos ejemplos detallados de la representación de algunas distribuciones útiles como familias exponenciales.

Distribución normal: media desconocida, varianza conocida.

Como primer ejemplo, consideremos una variable aleatoria con distribución normal, con media desconocida μ y varianza conocida σ² . La función de densidad de probabilidad es entonces

Fσ(incógnita;μ)=12πσ2mi(incógnitaμ)2/2σ2.{\displaystyle f_{\sigma }(x;\mu )={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{-(x-\mu )^{2}/2\sigma ^{2}}.}

Esta es una familia exponencial de un solo parámetro, como se puede ver al establecer

Tσ(incógnita)=incógnitaσ,hσ(incógnita)=12πσ2miincógnita2/2σ2,Aσ(μ)=μ22σ2,ησ(μ)=μσ.{\displaystyle {\begin{aligned}T_{\sigma }(x)&={\frac {x}{\sigma }},&h_{\sigma }(x)&={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{-x^{2}/2\sigma ^{2}},\\[4pt]A_{\sigma }(\mu )&={\frac {\mu ^{2}}{2\sigma ^{2}}},&\eta _{\sigma }(\mu )&={\frac {\mu }{\sigma }}.\end{aligned}}}

Si σ = 1, esto está en forma canónica, ya que entonces η ( μ ) = μ . 

Distribución normal: media desconocida y varianza desconocida.

A continuación, consideremos el caso de una distribución normal con media y varianza desconocidas. La función de densidad de probabilidad es entonces

F(y;μ,σ2)=12πσ2mi(yμ)2/2σ2.{\displaystyle f(y;\mu ,\sigma ^{2})={\frac {1}{\sqrt {2\pi \sigma ^{2}}}}e^{-(y-\mu )^{2}/2\sigma ^{2}}.}

Esta es una familia exponencial que se puede escribir en forma canónica definiendo

h(y)=12π,η=[μσ2, 12σ2],T(y)=(y,y2)T,A(η)=μ22σ2+registro|σ|=η124η2+12registro|12η2|{\displaystyle {\begin{aligned}h(y)&={\frac {1}{\sqrt {2\pi }}},&{\boldsymbol {\eta }}&=\left[{\frac {\mu }{\sigma ^{2}}},~-{\frac {1}{2\sigma ^{2}}}\right],\\T(y)&=\left(y,y^{2}\right)^{\mathsf {T}},&A({\boldsymbol {\eta }})&={\frac {\mu ^{2}}{2\sigma ^{2}}}+\log |\sigma |=-{\frac {\eta _{1}^{2}}{4\eta _{2}}}+{\frac {1}{2}}\log \left|{\frac {1}{2\eta _{2}}}\right|\end{aligned}}}

Distribución binomial

Como ejemplo de una familia exponencial discreta, consideremos la distribución binomial con un número conocido de ensayos n . La función de probabilidad para esta distribución es F(incógnita)=(norteincógnita)pagincógnita(1pag)norteincógnita,incógnita{0,1,2,,norte}.{\displaystyle f(x)={\binom {n}{x}}p^{x}{\left(1-p\right)}^{n-x},\quad x\in \{0,1,2,\ldots ,n\}.} Esto se puede escribir de forma equivalente como F(incógnita)=(norteincógnita)exp[incógnitaregistro(pag1pag)+norteregistro(1pag)],{\displaystyle f(x)={\binom {n}{x}}\exp \left[x\log \left({\frac {p}{1-p}}\right)+n\log(1-p)\right],} lo que demuestra que la distribución binomial es una familia exponencial, cuyo parámetro natural es η=registropag1pag.{\displaystyle \eta =\log {\frac {p}{1-p}}.} Esta función de p se conoce como logit .

Tabla de distribuciones

La siguiente tabla muestra cómo reescribir varias distribuciones comunes como distribuciones de la familia exponencial con parámetros naturales. Consulte las tarjetas didácticas [ 12 ] para conocer las principales familias exponenciales.

Para una variable escalar y un parámetro escalar, la forma es la siguiente:

Fincógnita(incógnitaθ)=h(incógnita)exp[η(θ)T(incógnita)A(η)]{\displaystyle f_{X}(x\mid \theta )=h(x)\exp \left[\eta ({\theta })T(x)-A(\eta )\right]}

Para una variable escalar y un parámetro vectorial:

Fincógnita(incógnitaθ)=h(incógnita)exp[η(θ)T(incógnita)A(η)]Fincógnita(incógnitaθ)=h(incógnita)gramo(θ)exp[η(θ)T(incógnita)]{\displaystyle {\begin{aligned}f_{X}(x\mid {\boldsymbol {\theta }})&=h(x)\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (x)-A({\boldsymbol {\eta }})\right]\\[4pt]f_{X}(x\mid {\boldsymbol {\theta }})&=h(x)\,g({\boldsymbol {\theta }})\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (x)\right]\end{aligned}}}

Para una variable vectorial y un parámetro vectorial:

Fincógnita(incógnitaθ)=h(incógnita)exp[η(θ)T(incógnita)A(η)]{\displaystyle f_{X}(\mathbf {x} \mid {\boldsymbol {\theta }})=h(\mathbf {x} )\,\exp \left[{\boldsymbol {\eta }}({\boldsymbol {\theta }})\cdot \mathbf {T} (\mathbf {x} )-A({\boldsymbol {\eta }})\right]}

Las fórmulas anteriores eligen la forma funcional de la familia exponencial con una función de partición logarítmica.A(η){\displaystyle A({\boldsymbol {\eta }})}La razón de esto es que los momentos de la estadística suficiente se pueden calcular fácilmente, simplemente diferenciando esta función. Las formas alternativas implican parametrizar esta función en términos del parámetro normal.θ{\displaystyle {\boldsymbol {\theta }}}en lugar del parámetro natural, y/o utilizando un factorgramo(η){\displaystyle g({\boldsymbol {\eta }})}fuera de la exponencial. La relación entre esta última y la primera es: A(η)=registrogramo(η),gramo(η)=miA(η){\displaystyle {\begin{aligned}A({\boldsymbol {\eta }})&=-\log g({\boldsymbol {\eta }}),\\[2pt]g({\boldsymbol {\eta }})&=e^{-A({\boldsymbol {\eta }})}\end{aligned}}} Para convertir entre las representaciones que involucran los dos tipos de parámetros, utilice las fórmulas a continuación para escribir un tipo de parámetro en términos del otro.

  1. 1 2 3 El corchete de Iverson es una generalización de la función delta discreta: si la expresión entre corchetes es verdadera, el corchete tiene valor 1; si la afirmación encerrada es falsa, el corchete de Iverson es cero. Hay muchas notaciones variantes, por ejemplo, corchetes ondulados:a = b es equivalente a la notación [ a = b ] utilizada anteriormente.

Las tres variantes de la distribución categórica y la distribución multinomial se deben al hecho de que los parámetrospagi{\displaystyle p_{i}}están restringidos, de tal manera que

i=1kpagi=1.{\displaystyle \sum _{i=1}^{k}p_{i}=1\,.}

Por lo tanto, solo hayk1{\displaystyle k-1}parámetros independientes.

  • La variante 1 utilizak{\displaystyle k}parámetros naturales con una relación simple entre los parámetros estándar y naturales; sin embargo, solok1{\displaystyle k-1}de los parámetros naturales son independientes y el conjunto dek{\displaystyle k}Los parámetros naturales no son identificables . La restricción sobre los parámetros habituales se traduce en una restricción similar sobre los parámetros naturales.
  • La variante 2 demuestra que el conjunto completo de parámetros naturales no es identificable: añadir cualquier valor constante a los parámetros naturales no afecta a la distribución resultante. Sin embargo, al utilizar la restricción sobre los parámetros naturales, la fórmula para los parámetros normales en función de estos parámetros puede escribirse de forma independiente de la constante que se añada.
  • La variante 3 muestra cómo hacer que los parámetros sean identificables de una manera conveniente mediante la configuracióndo=registropagk .{\displaystyle C=-\log p_{k}\ .}Esto efectivamente "gira" alrededorpagk{\displaystyle p_{k}}y hace que el último parámetro natural tenga el valor constante de 0. Todas las fórmulas restantes están escritas de una manera que no accedepagk{\displaystyle p_{k}}, de modo que efectivamente el modelo solo tienek1{\displaystyle k-1}parámetros, tanto del tipo habitual como del natural.

Las variantes 1 y 2 no son en realidad familias exponenciales estándar. Más bien son familias exponenciales curvas , es decir, hayk1{\displaystyle k-1}parámetros independientes incrustados en unk{\displaystyle k}Espacio de parámetros de dimensión. [ 13 ] Muchos de los resultados estándar para familias exponenciales no se aplican a familias exponenciales curvas. Un ejemplo es la función de partición logarítmica.A(incógnita){\displaystyle A(x)}, que tiene el valor de 0 en los casos curvos. En las familias exponenciales estándar, las derivadas de esta función corresponden a los momentos (más técnicamente, los cumulantes ) de las estadísticas suficientes, por ejemplo, la media y la varianza. Sin embargo, un valor de 0 sugiere que la media y la varianza de todas las estadísticas suficientes son uniformemente 0, mientras que, de hecho, la media de lasi{\displaystyle i}El estadístico suficiente debería serpagi{\displaystyle p_{i}}. (Esto sí se revela correctamente al usar la forma deA(incógnita){\displaystyle A(x)}mostrado en la variante 3.)

Momentos y cumulantes del estadístico suficiente

Normalización de la distribución

Comenzamos con la normalización de la distribución de probabilidad. En general, cualquier función no negativa f ( x ) que sirva como núcleo de una distribución de probabilidad (la parte que codifica toda la dependencia de x ) puede convertirse en una distribución propia normalizándola : es decir

pag(incógnita)=1ZF(incógnita){\displaystyle p(x)={\frac {1}{Z}}f(x)}

dónde

Z=incógnitaF(incógnita)dincógnita.{\displaystyle Z=\int _{x}f(x)\,dx.}

El factor Z a veces se denomina función normalizadora o función de partición , basándose en una analogía con la física estadística .

En el caso de una familia exponencial donde pag(incógnita;η)=gramo(η)h(incógnita)miηT(incógnita),{\displaystyle p(x;{\boldsymbol {\eta }})=g({\boldsymbol {\eta }})h(x)e^{{\boldsymbol {\eta }}\cdot \mathbf {T} (x)},}

el núcleo es K(incógnita)=h(incógnita)miηT(incógnita){\displaystyle K(x)=h(x)e^{{\boldsymbol {\eta }}\cdot \mathbf {T} (x)}} y la función de partición es Z=incógnitah(incógnita)miηT(incógnita)dincógnita.{\displaystyle Z=\int _{x}h(x)e^{{\boldsymbol {\eta }}\cdot \mathbf {T} (x)}\,dx.}

Dado que la distribución debe ser normalizada, tenemos

1=incógnitagramo(η)h(incógnita)miηT(incógnita)dincógnita=gramo(η)incógnitah(incógnita)miηT(incógnita)dincógnita=gramo(η)Z.{\displaystyle {\begin{aligned}1&=\int _{x}g({\boldsymbol {\eta }})h(x)e^{{\boldsymbol {\eta }}\cdot \mathbf {T} (x)}\,dx\\&=g({\boldsymbol {\eta }})\int _{x}h(x)e^{{\boldsymbol {\eta }}\cdot \mathbf {T} (x)}\,dx\\[1ex]&=g({\boldsymbol {\eta }})Z.\end{aligned}}}

En otras palabras, gramo(η)=1Z{\displaystyle g({\boldsymbol {\eta }})={\frac {1}{Z}}} o equivalentemente A(η)=registrogramo(η)=registroZ.{\displaystyle A({\boldsymbol {\eta }})=-\log g({\boldsymbol {\eta }})=\log Z.}

Esto justifica llamar a A la función de normalización logarítmica o de partición logarítmica .

Función generadora de momentos del estadístico suficiente

Ahora, la función generadora de momentos de T ( x ) es

METROT()mi[exp(TT(incógnita))η]=incógnitah(incógnita)exp[(η+)TT(incógnita)A(η)]dincógnita=miA(η+)A(η){\displaystyle {\begin{aligned}M_{T}(u)&\equiv \operatorname {E} \left[\exp \left(u^{\mathsf {T}}T(x)\right)\mid \eta \right]\\&=\int _{x}h(x)\,\exp \left[(\eta +u)^{\mathsf {T}}T(x)-A(\eta )\right]\,dx\\[1ex]&=e^{A(\eta +u)-A(\eta )}\end{aligned}}}

probando la afirmación anterior de que

K(η)=A(η+)A(η){\displaystyle K(u\mid \eta )=A(\eta +u)-A(\eta )}

es la función generadora de cumulantes para T.

Una subclase importante de familias exponenciales son las familias exponenciales naturales , que tienen una forma similar para la función generadora de momentos para la distribución de x .

Identidades diferenciales para cumulantes

En particular, utilizando las propiedades de la función generadora de cumulantes,

mi(Tj)=A(η)ηj{\displaystyle \operatorname {E} (T_{j})={\frac {\partial A(\eta )}{\partial \eta _{j}}}}

y

cobertura(Ti,Tj)=2A(η)ηiηj.{\displaystyle \operatorname {cov} \left(T_{i},\,T_{j}\right)={\frac {\partial ^{2}A(\eta )}{\partial \eta _{i}\,\partial \eta _{j}}}.}

Los dos primeros momentos brutos y todos los segundos momentos mixtos se pueden recuperar a partir de estas dos identidades. Los momentos y cumulantes de orden superior se obtienen mediante derivadas de orden superior. Esta técnica suele ser útil cuando T es una función compleja de los datos, cuyos momentos son difíciles de calcular mediante integración.

Otra forma de ver esto, sin recurrir a la teoría de los cumulantes , es partir del hecho de que la distribución de una familia exponencial debe normalizarse y, a continuación, derivarla. Lo ilustramos con el caso sencillo de un parámetro unidimensional, pero una derivación análoga es válida de forma más general.

En el caso unidimensional, tenemos pag(incógnita)=gramo(η)h(incógnita)miηT(incógnita).{\displaystyle p(x)=g(\eta )h(x)e^{\eta T(x)}.}

Esto debe normalizarse, por lo tanto

1=incógnitapag(incógnita)dincógnita=incógnitagramo(η)h(incógnita)miηT(incógnita)dincógnita=gramo(η)incógnitah(incógnita)miηT(incógnita)dincógnita.{\displaystyle 1=\int _{x}p(x)\,dx=\int _{x}g(\eta )h(x)e^{\eta T(x)}\,dx=g(\eta )\int _{x}h(x)e^{\eta T(x)}\,dx.}

Derivamos ambos lados con respecto a η :

0=gramo(η)ddηincógnitah(incógnita)miηT(incógnita)dincógnita+gramo(η)incógnitah(incógnita)miηT(incógnita)dincógnita=gramo(η)incógnitah(incógnita)(ddηmiηT(incógnita))dincógnita+gramo(η)incógnitah(incógnita)miηT(incógnita)dincógnita=gramo(η)incógnitah(incógnita)miηT(incógnita)T(incógnita)dincógnita+gramo(η)incógnitah(incógnita)miηT(incógnita)dincógnita=incógnitaT(incógnita)gramo(η)h(incógnita)miηT(incógnita)dincógnita+gramo(η)gramo(η)incógnitagramo(η)h(incógnita)miηT(incógnita)dincógnita=incógnitaT(incógnita)pag(incógnita)dincógnita+gramo(η)gramo(η)incógnitapag(incógnita)dincógnita=mi[T(incógnita)]+gramo(η)gramo(η)=mi[T(incógnita)]+ddηregistrogramo(η){\displaystyle {\begin{aligned}0&=g(\eta ){\frac {d}{d\eta }}\int _{x}h(x)e^{\eta T(x)}\,dx+g'(\eta )\int _{x}h(x)e^{\eta T(x)}\,dx\\[1ex]&=g(\eta )\int _{x}h(x)\left({\frac {d}{d\eta }}e^{\eta T(x)}\right)\,dx+g'(\eta )\int _{x}h(x)e^{\eta T(x)}\,dx\\[1ex]&=g(\eta )\int _{x}h(x)e^{\eta T(x)}T(x)\,dx+g'(\eta )\int _{x}h(x)e^{\eta T(x)}\,dx\\[1ex]&=\int _{x}T(x)g(\eta )h(x)e^{\eta T(x)}\,dx+{\frac {g'(\eta )}{g(\eta )}}\int _{x}g(\eta )h(x)e^{\eta T(x)}\,dx\\[1ex]&=\int _{x}T(x)p(x)\,dx+{\frac {g'(\eta )}{g(\eta )}}\int _{x}p(x)\,dx\\[1ex]&=\operatorname {E} [T(x)]+{\frac {g'(\eta )}{g(\eta )}}\\[1ex]&=\operatorname {E} [T(x)]+{\frac {d}{d\eta }}\log g(\eta )\end{aligned}}}

Por lo tanto, mi[T(incógnita)]=ddηregistrogramo(η)=ddηA(η).{\displaystyle \operatorname {E} [T(x)]=-{\frac {d}{d\eta }}\log g(\eta )={\frac {d}{d\eta }}A(\eta ).}

Ejemplo 1

Como ejemplo introductorio, consideremos la distribución gamma , cuya distribución se define por

pag(incógnita)=βαΓ(α)incógnitaα1miβincógnita.{\displaystyle p(x)={\frac {\beta ^{\alpha }}{\Gamma (\alpha )}}x^{\alpha -1}e^{-\beta x}.}

Consultando la tabla anterior, podemos ver que el parámetro natural viene dado por

η1=α1,η2=β,{\displaystyle {\begin{aligned}\eta _{1}&=\alpha -1,\\\eta _{2}&=-\beta ,\end{aligned}}}

Las sustituciones inversas son

α=η1+1,β=η2,{\displaystyle {\begin{aligned}\alpha &=\eta _{1}+1,\\\beta &=-\eta _{2},\end{aligned}}}

Las estadísticas suficientes son (log x , x) , y la función de partición logarítmica es

A(η1,η2)=registroΓ(η1+1)(η1+1)registro(η2).{\displaystyle A(\eta _{1},\eta _{2})=\log \Gamma (\eta _{1}+1)-(\eta _{1}+1)\log(-\eta _{2}).}

Podemos hallar la media de las estadísticas suficientes de la siguiente manera. Primero, para η 1 :

mi[registroincógnita]=η1A(η1,η2)=η1[registroΓ(η1+1)(η1+1)registro(η2)]=ψ(η1+1)registro(η2)=ψ(α)registroβ,{\displaystyle {\begin{aligned}\operatorname {E} [\log x]&={\frac {\partial }{\partial \eta _{1}}}A(\eta _{1},\eta _{2})\\[0.5ex]&={\frac {\partial }{\partial \eta _{1}}}\left[\log \Gamma (\eta _{1}+1)-(\eta _{1}+1)\log(-\eta _{2})\right]\\[1ex]&=\psi (\eta _{1}+1)-\log(-\eta _{2})\\[1ex]&=\psi (\alpha )-\log \beta ,\end{aligned}}}

Dóndeψ(incógnita){\displaystyle \psi (x)}es la función digamma (derivada del logaritmo de gamma), y utilizamos las sustituciones inversas en el último paso.

Ahora, para η 2 :

mi[incógnita]=η2A(η1,η2)=η2[registroΓ(η1+1)(η1+1)registro(η2)]=(η1+1)1η2(1)=η1+1η2=αβ,{\displaystyle {\begin{aligned}\operatorname {E} [x]&={\frac {\partial }{\partial \eta _{2}}}A(\eta _{1},\eta _{2})\\[1ex]&={\frac {\partial }{\partial \eta _{2}}}\left[\log \Gamma (\eta _{1}+1)-(\eta _{1}+1)\log(-\eta _{2})\right]\\[1ex]&=-(\eta _{1}+1){\frac {1}{-\eta _{2}}}(-1)={\frac {\eta _{1}+1}{-\eta _{2}}}={\frac {\alpha }{\beta }},\end{aligned}}}

Realizando nuevamente la sustitución inversa en el último paso.

Para calcular la varianza de x , simplemente volvemos a derivar:

Var(incógnita)=2η22A(η1,η2)=η2η1+1η2=η1+1η22=αβ2.{\displaystyle {\begin{aligned}\operatorname {Var} (x)&={\frac {\partial ^{2}}{\partial \eta _{2}^{2}}}A{\left(\eta _{1},\eta _{2}\right)}={\frac {\partial }{\partial \eta _{2}}}{\frac {\eta _{1}+1}{-\eta _{2}}}\\[1ex]&={\frac {\eta _{1}+1}{\eta _{2}^{2}}}={\frac {\alpha }{\beta ^{2}}}.\end{aligned}}}

Todos estos cálculos se pueden realizar mediante integración, utilizando diversas propiedades de la función gamma , pero esto requiere mucho más trabajo.

Ejemplo 2

Como otro ejemplo, consideremos una variable aleatoria de valor real X con densidad

pagθ(incógnita)=θmiincógnita(1+miincógnita)θ+1{\displaystyle p_{\theta }(x)={\frac {\theta e^{-x}}{\left(1+e^{-x}\right)^{\theta +1}}}}

indexado por parámetro de formaθ(0,){\displaystyle \theta \in (0,\infty )}(esto se denomina distribución logística asimétrica ). La densidad se puede reescribir como

miincógnita1+miincógnitaexp[θregistro(1+miincógnita)+registro(θ)]{\displaystyle {\frac {e^{-x}}{1+e^{-x}}}\exp[-\theta \log \left(1+e^{-x})+\log(\theta )\right]}

Nótese que se trata de una familia exponencial con parámetro natural.

η=θ,{\displaystyle \eta =-\theta ,}

estadística suficiente

T=registro(1+miincógnita),{\displaystyle T=\log \left(1+e^{-x}\right),}

y función de partición de registros

A(η)=registro(θ)=registro(η){\displaystyle A(\eta )=-\log(\theta )=-\log(-\eta )}

Entonces, usando la primera identidad,

mi[registro(1+miincógnita)]=mi(T)=A(η)η=η[registro(η)]=1η=1θ,{\displaystyle \operatorname {E} \left[\log \left(1+e^{-X}\right)\right]=\operatorname {E} (T)={\frac {\partial A(\eta )}{\partial \eta }}={\frac {\partial }{\partial \eta }}[-\log(-\eta )]={\frac {1}{-\eta }}={\frac {1}{\theta }},}

y utilizando la segunda identidad

var[registro(1+miincógnita)]=2A(η)η2=η[1η]=1(η)2=1θ2.{\displaystyle \operatorname {var} \left[\log \left(1+e^{-X}\right)\right]={\frac {\partial ^{2}A(\eta )}{\partial \eta ^{2}}}={\frac {\partial }{\partial \eta }}\left[{\frac {1}{-\eta }}\right]={\frac {1}{{\left(-\eta \right)}^{2}}}={\frac {1}{\theta ^{2}}}.}

Este ejemplo ilustra un caso en el que usar este método es muy sencillo, pero el cálculo directo sería prácticamente imposible.

Ejemplo 3

El último ejemplo es uno en el que la integración sería extremadamente difícil. Se trata de la distribución de Wishart , definida sobre matrices. Incluso calcular derivadas resulta algo complicado, ya que implica cálculo matricial , pero las identidades correspondientes se encuentran en dicho artículo.

De la tabla anterior, podemos ver que el parámetro natural viene dado por

η1=12V1,η2=12(nortepag1),{\displaystyle {\begin{aligned}{\boldsymbol {\eta }}_{1}&=-{\tfrac {1}{2}}\mathbf {V} ^{-1},\\\eta _{2}&={\hphantom {-}}{\tfrac {1}{2}}\left(np-1\right),\end{aligned}}}

Las sustituciones inversas son

V=12η11,norte=2η2+pag+1,{\displaystyle {\begin{aligned}\mathbf {V} &=-{\tfrac {1}{2}}{\boldsymbol {\eta }}_{1}^{-1},\\n&=2\eta _{2}+p+1,\end{aligned}}}

y las estadísticas suficientes son(incógnita,registro|incógnita|).{\displaystyle (\mathbf {X} ,\log |\mathbf {X} |).}

La función de partición logarítmica se escribe de diversas formas en la tabla para facilitar la diferenciación y la sustitución hacia atrás. Utilizamos las siguientes formas:

A(η1,norte)=norte2registro|η1|+registroΓpag(norte2),A(V,η2)=(η2+pag+12)registro(2pag|V|)+registroΓpag(η2+pag+12).{\displaystyle {\begin{aligned}A({\boldsymbol {\eta }}_{1},n)&=-{\frac {n}{2}}\log \left|-{\boldsymbol {\eta }}_{1}\right|+\log \Gamma _{p}{\left({\frac {n}{2}}\right)},\\[1ex]A(\mathbf {V} ,\eta _{2})&=\left(\eta _{2}+{\frac {p+1}{2}}\right)\log \left(2^{p}\left|\mathbf {V} \right|\right)+\log \Gamma _{p}{\left(\eta _{2}+{\frac {p+1}{2}}\right)}.\end{aligned}}}

Expectativa de X (asociada con η 1 )

Para diferenciar con respecto a η 1 , necesitamos la siguiente identidad de cálculo matricial :

registro|aincógnita|incógnita=(incógnita1)T{\displaystyle {\frac {\partial \log |a\mathbf {X} |}{\partial \mathbf {X} }}=(\mathbf {X} ^{-1})^{\mathsf {T}}}

Entonces:

mi[incógnita]=η1A(η1,)=η1[norte2registro|η1|+registroΓpag(norte2)]=norte2(η11)T=norte2(η11)T=norte(V)T=norteV{\displaystyle {\begin{aligned}\operatorname {E} [\mathbf {X} ]&={\frac {\partial }{\partial {\boldsymbol {\eta }}_{1}}}A\left({\boldsymbol {\eta }}_{1},\ldots \right)\\[1ex]&={\frac {\partial }{\partial {\boldsymbol {\eta }}_{1}}}\left[-{\frac {n}{2}}\log \left|-{\boldsymbol {\eta }}_{1}\right|+\log \Gamma _{p}{\left({\frac {n}{2}}\right)}\right]\\[1ex]&=-{\frac {n}{2}}({\boldsymbol {\eta }}_{1}^{-1})^{\mathsf {T}}\\[1ex]&={\frac {n}{2}}(-{\boldsymbol {\eta }}_{1}^{-1})^{\mathsf {T}}\\[1ex]&=n(\mathbf {V} )^{\mathsf {T}}\\[1ex]&=n\mathbf {V} \end{aligned}}}

La última línea utiliza el hecho de que V es simétrica y, por lo tanto, es la misma cuando se transpone.

Expectativa de log | X | (asociada con η 2 )

Ahora, para η 2 , primero necesitamos expandir la parte de la función de partición logarítmica que involucra la función gamma multivariada :

registroΓpag(a)=registro(πpag(pag1)4j=1pagΓ(a+1j2))=pag(pag1)4registroπ+j=1pagregistroΓ(a+1j2){\displaystyle {\begin{aligned}\log \Gamma _{p}(a)&=\log \left(\pi ^{\frac {p(p-1)}{4}}\prod _{j=1}^{p}\Gamma {\left(a+{\frac {1-j}{2}}\right)}\right)\\&={\frac {p(p-1)}{4}}\log \pi +\sum _{j=1}^{p}\log \Gamma {\left(a+{\frac {1-j}{2}}\right)}\end{aligned}}}

También necesitamos la función digamma :

ψ(incógnita)=ddincógnitaregistroΓ(incógnita).{\displaystyle \psi (x)={\frac {d}{dx}}\log \Gamma (x).}

Entonces:

mi[registro|incógnita|]=η2A(,η2)=η2[(η2+pag+12)registro(2pag|V|)+registroΓpag(η2+pag+12)]=η2[(η2+pag+12)registro(2pag|V|)]+η2[pag(pag1)4registroπ]=+η2j=1pagregistroΓ(η2+pag+12+1j2)=pagregistro2+registro|V|+j=1pagψ(η2+pag+12+1j2)=pagregistro2+registro|V|+j=1pagψ(nortepag12+pag+12+1j2)=pagregistro2+registro|V|+j=1pagψ(norte+1j2){\displaystyle {\begin{aligned}\operatorname {E} [\log |\mathbf {X} |]&={\frac {\partial }{\partial \eta _{2}}}A\left(\ldots ,\eta _{2}\right)\\[1ex]&={\frac {\partial }{\partial \eta _{2}}}\left[-\left(\eta _{2}+{\frac {p+1}{2}}\right)\log \left(2^{p}\left|\mathbf {V} \right|\right)+\log \Gamma _{p}{\left(\eta _{2}+{\frac {p+1}{2}}\right)}\right]\\[1ex]&={\frac {\partial }{\partial \eta _{2}}}\left[\left(\eta _{2}+{\frac {p+1}{2}}\right)\log \left(2^{p}\left|\mathbf {V} \right|\right)\right]+{\frac {\partial }{\partial \eta _{2}}}\left[{\frac {p(p-1)}{4}}\log \pi \right]\\&{\hphantom {=}}+{\frac {\partial }{\partial \eta _{2}}}\sum _{j=1}^{p}\log \Gamma {\left(\eta _{2}+{\frac {p+1}{2}}+{\frac {1-j}{2}}\right)}\\[1ex]&=p\log 2+\log |\mathbf {V} |+\sum _{j=1}^{p}\psi {\left(\eta _{2}+{\frac {p+1}{2}}+{\frac {1-j}{2}}\right)}\\[1ex]&=p\log 2+\log |\mathbf {V} |+\sum _{j=1}^{p}\psi {\left({\frac {n-p-1}{2}}+{\frac {p+1}{2}}+{\frac {1-j}{2}}\right)}\\[1ex]&=p\log 2+\log |\mathbf {V} |+\sum _{j=1}^{p}\psi {\left({\frac {n+1-j}{2}}\right)}\end{aligned}}}

Esta última fórmula se encuentra en el artículo sobre la distribución de Wishart . Ambas expectativas son necesarias al derivar las ecuaciones de actualización variacional de Bayes en una red bayesiana que involucra una distribución de Wishart (que es la distribución a priori conjugada de la distribución normal multivariada ).

Calcular estas fórmulas mediante integración sería mucho más difícil. La primera, por ejemplo, requeriría integración matricial.

Entropía

Entropía relativa

La entropía relativa ( divergencia de Kullback-Leibler , divergencia KL) de dos distribuciones en una familia exponencial tiene una expresión simple como la divergencia de Bregman entre los parámetros naturales con respecto al logaritmo normalizador. [ 14 ] La entropía relativa se define en términos de una integral, mientras que la divergencia de Bregman se define en términos de una derivada y un producto interno, por lo que es más fácil de calcular y tiene una expresión de forma cerrada (suponiendo que la derivada tenga una expresión de forma cerrada). Además, la divergencia de Bregman en términos de los parámetros naturales y el logaritmo normalizador es igual a la divergencia de Bregman de los parámetros duales (parámetros de expectativa), en orden inverso, para la función conjugada convexa . [ 15 ]

Corrección de una familia exponencial con log- normalizadorA{\displaystyle A}( con conjugado convexo )A{\displaystyle A^{*}}) , escribiendoPAGA,θ{\displaystyle P_{A,\theta }}para la distribución en esta familia correspondiente a un valor fijo del parámetro natural θ{\displaystyle \theta }( escritura )θ{\displaystyle \theta '}para otro valor, y conη,η{\displaystyle \eta ,\eta '} para los parámetros de expectativa/momento duales correspondientes), escribiendo KL para la divergencia KL, yBA{\displaystyle B_{A}}Para la divergencia de Bregman, las divergencias se relacionan de la siguiente manera: KL(PAGA,θPAGA,θ)=BA(θθ)=BA(ηη).{\displaystyle \operatorname {KL} (P_{A,\theta }\parallel P_{A,\theta '})=B_{A}(\theta '\parallel \theta )=B_{A^{*}}(\eta \parallel \eta ').}

La divergencia KL se escribe convencionalmente con respecto al primer parámetro, mientras que la divergencia de Bregman se escribe convencionalmente con respecto al segundo parámetro, y por lo tanto esto se puede leer como "la entropía relativa es igual a la divergencia de Bregman definida por el log-normalizador en los parámetros naturales intercambiados", o equivalentemente como "igual a la divergencia de Bregman definida por el dual del log-normalizador en los parámetros de expectativa".

Derivación de máxima entropía

Las familias exponenciales surgen naturalmente como respuesta a la siguiente pregunta: ¿cuál es la distribución de máxima entropía consistente con las restricciones dadas sobre los valores esperados? [ 16 ]

La entropía de información de una distribución de probabilidad dF ( x ) solo puede calcularse con respecto a otra distribución de probabilidad (o, más generalmente, una medida positiva), y ambas medidas deben ser mutuamente absolutamente continuas . Por consiguiente, necesitamos elegir una medida de referencia dH ( x ) con el mismo soporte que dF ( x ) .

La entropía de dF ( x ) relativa a dH ( x ) es

S[dFdH]=dFdHregistrodFdHdH{\displaystyle S[dF\mid dH]=-\int {\frac {dF}{dH}}\log {\frac {dF}{dH}}\,dH}

o

S[dFdH]=registrodHdFdF{\displaystyle S[dF\mid dH]=\int \log {\frac {dH}{dF}}\,dF}

donde dF / dH y dH / dF son derivadas de Radon-Nikodym . La definición ordinaria de entropía para una distribución discreta soportada en un conjunto I , a saber:

S=iIpagiregistropagi{\displaystyle S=-\sum _{i\in I}p_{i}\log p_{i}}

asume , aunque rara vez se señala, que dH se elige como la medida de conteo en I.

Consideremos ahora una colección de cantidades observables (variables aleatorias) T i . La distribución de probabilidad dF cuya entropía con respecto a dH es mayor, sujeta a las condiciones de que el valor esperado de T i sea igual a t i , es una familia exponencial con dH como medida de referencia y ( T 1 , ..., T n ) como estadístico suficiente.

La derivación es un cálculo variacional simple que utiliza multiplicadores de Lagrange . La normalización se impone estableciendo T₀ = 1 como una de las restricciones. Los parámetros naturales de la distribución son los multiplicadores de Lagrange, y el factor de normalización es el multiplicador de Lagrange asociado a T₀ .

Para ver ejemplos de dichas derivaciones, consulte la distribución de probabilidad de entropía máxima .

Papel en la estadística

Estimación clásica: suficiencia

Según el teorema de Pitman - Koopman - Darmois , entre las familias de distribuciones de probabilidad cuyo dominio no varía con el parámetro que se estima, solo en las familias exponenciales existe un estadístico suficiente cuya dimensión permanece acotada a medida que aumenta el tamaño de la muestra.

En términos menos concisos, supongamos que X k , (donde k = 1, 2, 3, ..., n ) son variables aleatorias independientes e idénticamente distribuidas. Solo si su distribución pertenece a la familia exponencial existe un estadístico suficiente T ( X 1 , ..., X n ) cuyo número de componentes escalares no aumenta a medida que aumenta el tamaño de la muestra n ; el estadístico T puede ser un vector o un único número escalar , pero sea cual sea su naturaleza, su tamaño no crecerá ni disminuirá al obtenerse más datos.

Como contraejemplo, si se relajan estas condiciones, la familia de distribuciones uniformes (ya sean discretas o continuas , con uno o ambos límites desconocidos) tiene una estadística suficiente, a saber, el máximo de la muestra, el mínimo de la muestra y el tamaño de la muestra, pero no forma una familia exponencial, ya que el dominio varía con los parámetros.

Estimación bayesiana: distribuciones conjugadas

Las familias exponenciales también son importantes en la estadística bayesiana . En la estadística bayesiana, una distribución a priori se multiplica por una función de verosimilitud y luego se normaliza para producir una distribución a posteriori . En el caso de una función de verosimilitud que pertenece a una familia exponencial, existe una distribución a priori conjugada , que a menudo también pertenece a una familia exponencial. Una distribución a priori conjugada π para el parámetroη{\displaystyle {\boldsymbol {\eta }}}de una familia exponencial

F(incógnitaη)=h(incógnita)exp[ηTT(incógnita)A(η)]{\displaystyle f(x\mid {\boldsymbol {\eta }})=h(x)\,\exp \left[{\boldsymbol {\eta }}^{\mathsf {T}}\mathbf {T} (x)-A({\boldsymbol {\eta }})\right]}

es dado por

pagπ(ηχ,ν)=F(χ,ν)exp[ηTχνA(η)],{\displaystyle p_{\pi }({\boldsymbol {\eta }}\mid {\boldsymbol {\chi }},\nu )=f({\boldsymbol {\chi }},\nu )\,\exp \left[{\boldsymbol {\eta }}^{\mathsf {T}}{\boldsymbol {\chi }}-\nu A({\boldsymbol {\eta }})\right],}

o equivalentemente

pagπ(ηχ,ν)=F(χ,ν)gramo(η)νexp(ηTχ),χRs{\displaystyle p_{\pi }({\boldsymbol {\eta }}\mid {\boldsymbol {\chi }},\nu )=f({\boldsymbol {\chi }},\nu )\,g({\boldsymbol {\eta }})^{\nu }\,\exp \left({\boldsymbol {\eta }}^{\mathsf {T}}{\boldsymbol {\chi }}\right),\qquad {\boldsymbol {\chi }}\in \mathbb {R} ^{s}}

donde s es la dimensión deη{\displaystyle {\boldsymbol {\eta }}}yν>0{\displaystyle \nu >0}yχ{\displaystyle {\boldsymbol {\chi }}}son hiperparámetros (parámetros que controlan otros parámetros).ν{\displaystyle \nu }corresponde al número efectivo de observaciones que aporta la distribución previa, yχ{\displaystyle {\boldsymbol {\chi }}}corresponde a la cantidad total que estas pseudo-observaciones aportan al estadístico suficiente sobre todas las observaciones y pseudo-observaciones.F(χ,ν){\displaystyle f({\boldsymbol {\chi }},\nu )}es una constante de normalización que se determina automáticamente mediante las funciones restantes y sirve para garantizar que la función dada sea una función de densidad de probabilidad (es decir, que esté normalizada ).A(η){\displaystyle A({\boldsymbol {\eta }})}y equivalentementegramo(η){\displaystyle g({\boldsymbol {\eta }})}son las mismas funciones que en la definición de la distribución sobre la cual π es la distribución a priori conjugada.

Una distribución a priori conjugada es aquella que, al combinarse con la función de verosimilitud y normalizarse, produce una distribución a posteriori del mismo tipo que la distribución a priori. Por ejemplo, si se estima la probabilidad de éxito de una distribución binomial, al elegir una distribución beta como distribución a priori, la distribución a posteriori será otra distribución beta. Esto simplifica considerablemente el cálculo de la distribución a posteriori. De manera similar, si se estima el parámetro de una distribución de Poisson, el uso de una distribución a priori gamma dará como resultado otra distribución a posteriori gamma. Las distribuciones a priori conjugadas suelen ser muy flexibles y convenientes. Sin embargo, si la creencia sobre el valor probable del parámetro theta de una distribución binomial está representada por (por ejemplo) una distribución a priori bimodal (de dos picos), esta no puede representarse mediante una distribución beta. En cambio, puede representarse utilizando una densidad de mezcla como distribución a priori, en este caso una combinación de dos distribuciones beta; esta es una forma de hiperdistribución a priori .

Una función de verosimilitud arbitraria no pertenecerá a una familia exponencial y, por lo tanto, en general, no existe una distribución a priori conjugada. La distribución a posteriori deberá calcularse entonces mediante métodos numéricos.

Para demostrar que la distribución previa anterior es una distribución previa conjugada, podemos derivar la distribución posterior.

Primero, supongamos que la probabilidad de una sola observación sigue una familia exponencial, parametrizada mediante su parámetro natural:

pagF(incógnitaη)=h(incógnita)gramo(η)exp[ηTT(incógnita)]{\displaystyle p_{F}(x\mid {\boldsymbol {\eta }})=h(x)\,g({\boldsymbol {\eta }})\,\exp \left[{\boldsymbol {\eta }}^{\mathsf {T}}\mathbf {T} (x)\right]}

Luego, para los datosincógnita=(incógnita1,,incógnitanorte){\displaystyle \mathbf {X} =(x_{1},\ldots ,x_{n})}La probabilidad se calcula de la siguiente manera:

pag(incógnitaη)=(i=1norteh(incógnitai))gramo(η)norteexp(ηTi=1norteT(incógnitai)){\displaystyle p(\mathbf {X} \mid {\boldsymbol {\eta }})=\left(\prod _{i=1}^{n}h(x_{i})\right)g({\boldsymbol {\eta }})^{n}\exp \left({\boldsymbol {\eta }}^{\mathsf {T}}\sum _{i=1}^{n}\mathbf {T} (x_{i})\right)}

Entonces, para la distribución a priori conjugada anterior:

pagπ(ηχ,ν)=F(χ,ν)gramo(η)νexp(ηTχ)gramo(η)νexp(ηTχ){\displaystyle {\begin{aligned}p_{\pi }({\boldsymbol {\eta }}\mid {\boldsymbol {\chi }},\nu )&=f({\boldsymbol {\chi }},\nu )g({\boldsymbol {\eta }})^{\nu }\exp({\boldsymbol {\eta }}^{\mathsf {T}}{\boldsymbol {\chi }})\propto g({\boldsymbol {\eta }})^{\nu }\exp({\boldsymbol {\eta }}^{\mathsf {T}}{\boldsymbol {\chi }})\end{aligned}}}

Podemos entonces calcular la distribución posterior de la siguiente manera:

pag(ηincógnita,χ,ν)pag(incógnitaη)pagπ(ηχ,ν)=(i=1norteh(incógnitai))gramo(η)norteexp(ηTi=1norteT(incógnitai))F(χ,ν)gramo(η)νexp(ηTχ)gramo(η)norteexp(ηTi=1norteT(incógnitai))gramo(η)νexp(ηTχ)=gramo(η)ν+norteexp(ηT(χ+i=1norteT(incógnitai))){\displaystyle {\begin{aligned}p({\boldsymbol {\eta }}\mid \mathbf {X} ,{\boldsymbol {\chi }},\nu )&\propto p(\mathbf {X} \mid {\boldsymbol {\eta }})p_{\pi }({\boldsymbol {\eta }}\mid {\boldsymbol {\chi }},\nu )\\&=\left(\prod _{i=1}^{n}h(x_{i})\right)g({\boldsymbol {\eta }})^{n}\exp \left({\boldsymbol {\eta }}^{\mathsf {T}}\sum _{i=1}^{n}\mathbf {T} (x_{i})\right)f({\boldsymbol {\chi }},\nu )g({\boldsymbol {\eta }})^{\nu }\exp({\boldsymbol {\eta }}^{\mathsf {T}}{\boldsymbol {\chi }})\\&\propto g({\boldsymbol {\eta }})^{n}\exp \left({\boldsymbol {\eta }}^{\mathsf {T}}\sum _{i=1}^{n}\mathbf {T} (x_{i})\right)g({\boldsymbol {\eta }})^{\nu }\exp({\boldsymbol {\eta }}^{\mathsf {T}}{\boldsymbol {\chi }})\\&=g({\boldsymbol {\eta }})^{\nu +n}\exp \left({\boldsymbol {\eta }}^{\mathsf {T}}\left({\boldsymbol {\chi }}+\sum _{i=1}^{n}\mathbf {T} (x_{i})\right)\right)\end{aligned}}}

La última línea es el núcleo de la distribución posterior, es decir

pag(ηincógnita,χ,ν)=pagπ(η| χ+i=1norteT(incógnitai),ν+norte){\displaystyle p({\boldsymbol {\eta }}\mid \mathbf {X} ,{\boldsymbol {\chi }},\nu )=p_{\pi }\left({\boldsymbol {\eta }}\left|~{\boldsymbol {\chi }}+\sum _{i=1}^{n}\mathbf {T} (x_{i}),\nu +n\right.\right)}

Esto demuestra que la distribución posterior tiene la misma forma que la distribución previa.

Los datos X entran en esta ecuación solo en la expresión

T(incógnita)=i=1norteT(incógnitai),{\displaystyle \mathbf {T} (\mathbf {X} )=\sum _{i=1}^{n}\mathbf {T} (x_{i}),}

lo que se denomina estadístico suficiente de los datos. Es decir, el valor del estadístico suficiente es suficiente para determinar completamente la distribución posterior. Los puntos de datos reales en sí mismos no son necesarios, y todos los conjuntos de puntos de datos con el mismo estadístico suficiente tendrán la misma distribución. Esto es importante porque la dimensión del estadístico suficiente no crece con el tamaño de los datos; solo tiene tantos componentes como componentes de los datos.η{\displaystyle {\boldsymbol {\eta }}}(equivalentemente, el número de parámetros de la distribución de un único punto de datos).

Las ecuaciones de actualización son las siguientes:

χ=χ+T(incógnita)=χ+i=1norteT(incógnitai)ν=ν+norte{\displaystyle {\begin{aligned}{\boldsymbol {\chi }}'&={\boldsymbol {\chi }}+\mathbf {T} (\mathbf {X} )\\&={\boldsymbol {\chi }}+\sum _{i=1}^{n}\mathbf {T} (x_{i})\\\nu '&=\nu +n\end{aligned}}}

Esto demuestra que las ecuaciones de actualización se pueden escribir simplemente en términos del número de puntos de datos y la estadística suficiente de los datos. Esto se puede ver claramente en los diversos ejemplos de ecuaciones de actualización que se muestran en la página de la distribución a priori conjugada . Debido a la forma en que se calcula la estadística suficiente, necesariamente implica sumas de componentes de los datos (en algunos casos disfrazadas de productos u otras formas; un producto se puede escribir en términos de una suma de logaritmos ). Los casos en los que las ecuaciones de actualización para distribuciones particulares no coinciden exactamente con las formas anteriores son casos en los que la distribución a priori conjugada se ha expresado utilizando una parametrización diferente a la que produce una distribución a priori conjugada de la forma anterior, a menudo específicamente porque la forma anterior está definida sobre el parámetro natural.η{\displaystyle {\boldsymbol {\eta }}}mientras que las distribuciones a priori conjugadas generalmente se definen sobre el parámetro realθ.{\displaystyle {\boldsymbol {\theta }}.}

Estimación insesgada

Si la probabilidadz|ηmiηzF1(η)F0(z){\displaystyle z|\eta \sim e^{\eta z}f_{1}(\eta )f_{0}(z)}es una familia exponencial, entonces el estimador insesgado deη{\displaystyle \eta }esddzlnF0(z){\displaystyle -{\frac {d}{dz}}\ln f_{0}(z)}. [ 17 ]

Pruebas de hipótesis: pruebas uniformemente más potentes

Una familia exponencial de un parámetro tiene una razón de verosimilitud monótona no decreciente en el estadístico suficiente T ( x ) , siempre que η ( θ ) sea no decreciente. Como consecuencia, existe una prueba uniformemente más potente para contrastar la hipótesis H 0 : θθ 0 frente a H 1 : θ < θ 0 .

Modelos lineales generalizados

Las familias exponenciales constituyen la base de las funciones de distribución utilizadas en los modelos lineales generalizados (GLM), una clase de modelos que abarca muchos de los modelos de regresión más utilizados en estadística. Algunos ejemplos son la regresión logística con la familia binomial y la regresión de Poisson .

Véase también

Notas a pie de página

  1. Por ejemplo, la familia de distribuciones normales incluye la distribución normal estándar N (0, 1) con media 0 y varianza 1, así como otras distribuciones normales con media y varianza diferentes.
  2. "Función de partición" se usa a menudo en estadística como sinónimo de "factor de normalización".
  3. Estas distribuciones a menudo no son familias exponenciales. Ejemplos comunes de familias no exponenciales que surgen de las exponenciales son la distribución t de Student , la distribución beta-binomial y la distribución multinomial de Dirichlet .

Referencias

Citas

  1. Kupperman, M. (1958). "Probabilidades de hipótesis y estadística de la información en el muestreo de poblaciones de clase exponencial" . Annals of Mathematical Statistics . 9 (2): 571– 575. doi : 10.1214/aoms/1177706633 . JSTOR 2237349 . 
  2. Andersen, Erling (septiembre de 1970). "Suficiencia y familias exponenciales para espacios muestrales discretos". Journal of the American Statistical Association . 65 ( 331 ). Journal of the American Statistical Association: 1248–1255 . doi : 10.2307/2284291 . JSTOR 2284291. MR 0268992 .  
  3. Pitman, E. ; Wishart, J. (1936). "Estadística suficiente y precisión intrínseca". Actas matemáticas de la Sociedad Filosófica de Cambridge . 32 (4): 567– 579. Bibcode : 1936PCPS...32..567P . doi : 10.1017/S0305004100019307 . S2CID 120708376 . 
  4. ^ Darmois, G. (1935). "Sur les lois de probabilites una estimación exhaustiva". CR Acad. Ciencia. París (en francés). 200 : 1265-1266 .
  5. Koopman, B. (1936). " Sobre la distribución que admite una estadística suficiente" . Transactions of the American Mathematical Society . 39 (3). American Mathematical Society : 399–409 . doi : 10.2307/1989758 . JSTOR 1989758. MR 1501854 .  
  6. "Familias exponenciales generales" . www.randomservices.org . Consultado el 30 de agosto de 2022 .
  7. Abramovich y Ritov (2013). Teoría estadística: Una introducción concisa . Chapman & Hall. ISBN 978-1439851845.
  8. Blei, David. "Inferencia variacional" (PDF) . Universidad de Princeton.
  9. Casella, George (2002). Inferencia estadística . Roger L. Berger (2.ª ed.). Australia: Thomson Learning. Teorema 6.2.25. ISBN  0-534-24312-6OCLC 46538638 
  10. Brown, Lawrence D. (1986). Fundamentos de familias exponenciales estadísticas : con aplicaciones en la teoría de la decisión estadística . Hayward, California: Instituto de Estadística Matemática. Teorema 2.12. ISBN  0-940600-10-2OCLC 15986663 
  11. Keener, Robert W. (2010). Estadística teórica : temas para un curso básico . Nueva York. pp. 47, Ejemplo 3.12. ISBN   978-0-387-93839-4OCLC 676700036 {{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  12. Nielsen, Frank; Garcia, Vincent (2009). "Familias exponenciales estadísticas: Un resumen con tarjetas didácticas". arXiv : 0911.4863 [ cs.LG ].
  13. van Garderen, Kees Jan (1997). "Modelos exponenciales curvos en econometría". Teoría econométrica . 13 (6): 771– 790. doi : 10.1017/S0266466600006253 . S2CID 122742807 . 
  14. Nielsen & Nock 2010 , 4. Divergencias de Bregman y entropía relativa de familias exponenciales.
  15. Barndorff-Nielsen 1978 , 9.1 Dualidad convexa y familias exponenciales.
  16. Strimmer, K. (2026). De la física a la estadística: una ruta sencilla hacia las familias exponenciales mediante la entropía máxima. ArXiv:2604.22752. https://arxiv.org/abs/2604.22752
  17. Efron, Bradley (diciembre de 2011). "La fórmula de Tweedie y el sesgo de selección" . Journal of the American Statistical Association . 106 (496): 1602– 1614. doi : 10.1198/jasa.2011.tm11181 . ISSN 0162-1459 . PMC 3325056. PMID 22505788 .   

Fuentes

  • Barndorff-Nielsen, Ole (1978). Información y familias exponenciales en teoría estadística . Serie Wiley en Probabilidad y Estadística Matemática. Chichester: John Wiley & Sons, Ltd. pp.  ix+238 pp. ISBN 0-471-99545-2. SR 0489333 . 
    • Reimpreso como Barndorff-Nielsen, Ole (2014). Information and exponential families in statistical theory . John Wiley & Sons, Ltd. doi : 10.1002/9781118857281 . ISBN 978-111885750-2.
  • Nielsen, Frank; Garcia, Vincent (2009). "Familias exponenciales estadísticas: Un resumen con tarjetas didácticas". arXiv : 0911.4863 . Bibcode : 2009arXiv0911.4863N .
  • Nielsen, Frank; Nock, Richard (2010). Entropías y entropías cruzadas de familias exponenciales (PDF) . Conferencia Internacional IEEE sobre Procesamiento de Imágenes. doi : 10.1109/ICIP.2010.5652054 . Archivado del original (PDF) el 31 de marzo de 2019.

Lecturas adicionales

  • Fahrmeir, Ludwig; Tutz, G. (1994). Modelado estadístico multivariante basado en modelos lineales generalizados . Springer. pp. 18–22 , 345–349 . ISBN  0-387-94233-5.
  • Keener, Robert W. (2006). Estadística teórica: Temas para un curso básico . Springer. pp. 27–28 , 32–33 . ISBN  978-0-387-93838-7.
  • Lehmann, EL; Casella, G. (1998). Teoría de la estimación puntual (2ª  ed.). segundo. 1.5. ISBN 0-387-98502-6.
  • Introducción a la familia exponencial de distribuciones
  • Familia exponencial de distribuciones en los primeros usos conocidos de algunas de las palabras de matemáticas
  • jMEF: Una biblioteca Java para familias exponenciales. Enlace obsoleto archivado el 11/04/2013 en archive.today.
  • Modelos gráficos, familias exponenciales e inferencia variacional por Wainwright y Jordan (2008)