Articulo de referencia

Distribución de probabilidad compuesta

En probabilidad y estadística , una distribución de probabilidad compuesta (también conocida como distribución de mezcla o distribución contagiosa ) es la distribución de probab...

En probabilidad y estadística , una distribución de probabilidad compuesta (también conocida como distribución de mezcla o distribución contagiosa ) es la distribución de probabilidad que resulta de suponer que una variable aleatoria se distribuye según una distribución parametrizada, donde algunos de los parámetros de dicha distribución son variables aleatorias. Si el parámetro es un parámetro de escala , la mezcla resultante también se denomina mezcla de escala .

La distribución compuesta ("distribución incondicional") es el resultado de marginalizar (integrar) sobre la (s) variable(s) aleatoria(s) latente (s) que representa(n) el/los parámetro(s) de la distribución parametrizada ("distribución condicional").

Definición

Una distribución de probabilidad compuesta es la distribución de probabilidad que resulta de asumir que una variable aleatoriaincógnita{\displaystyle X}se distribuye según alguna distribución parametrizadaF{\displaystyle F}con un parámetro desconocidoθ{\displaystyle \theta }que a su vez se distribuye según alguna otra distribuciónGRAMO{\displaystyle G}La distribución resultanteH{\displaystyle H}Se dice que es la distribución que resulta de la capitalización compuesta.F{\displaystyle F}conGRAMO{\displaystyle G}La distribución del parámetroGRAMO{\displaystyle G}También se la denomina distribución de mezcla o distribución latente . Técnicamente, la distribución incondicional .H{\displaystyle H}resultados de la marginación sobreGRAMO{\displaystyle G}, es decir, integrando el/los parámetro(s) desconocido(s)θ{\displaystyle \theta }Su función de densidad de probabilidad viene dada por:

pagH(incógnita)=pagF(incógnita|θ)pagGRAMO(θ)dθ{\displaystyle p_{H}(x)={\displaystyle \int \limits p_{F}(x|\theta )\,p_{G}(\theta )\operatorname {d} \!\theta }}

La misma fórmula se aplica de forma análoga si algunas o todas las variables son vectores.

De la fórmula anterior, se puede ver que una distribución compuesta es esencialmente un caso especial de una distribución marginal : La distribución conjunta deincógnita{\displaystyle x}yθ{\displaystyle \theta }es dado por pag(incógnita,θ)=pag(incógnita|θ)pag(θ){\displaystyle p(x,\theta )=p(x|\theta )p(\theta )}y el compuesto resulta como su distribución marginal: pag(incógnita)=pag(incógnita,θ)dθ{\displaystyle {\textstyle p(x)=\int p(x,\theta )\operatorname {d} \!\theta }}. Si el dominio deθ{\displaystyle \theta }Si es discreta, entonces la distribución es nuevamente un caso especial de una distribución de mezcla .

Propiedades

General

La distribución compuestaH{\displaystyle H}dependerá de la expresión específica de cada distribución, así como de qué parámetro deF{\displaystyle F}se distribuye según la distribuciónGRAMO{\displaystyle G}y los parámetros deH{\displaystyle H}incluirá cualquier parámetro deGRAMO{\displaystyle G}que no están marginados o integrados. El apoyo deH{\displaystyle H}es lo mismo que el deF{\displaystyle F}y si esta última es una distribución de dos parámetros parametrizada con la media y la varianza, existen algunas propiedades generales.

Media y varianza

Los dos primeros momentos de la distribución compuesta vienen dados por la ley de la esperanza total y la ley de la varianza total :

miH[incógnita]=miGRAMO[miF[incógnita|θ]]{\displaystyle \operatorname {E} _{H}[X]=\operatorname {E} _{G}{\bigl [}\operatorname {E} _{F}[X|\theta ]{\bigr ]}}

VarH(incógnita)=miGRAMO[VarF(incógnita|θ)]+VarGRAMO(miF[incógnita|θ]){\displaystyle \operatorname {Var} _{H}(X)=\operatorname {E} _{G}{\bigl [}\operatorname {Var} _{F}(X|\theta ){\bigr ]}+\operatorname {Var} _{G}{\bigl (}\operatorname {E} _{F}[X|\theta ]{\bigr )}}

Si la media deF{\displaystyle F}se distribuye comoGRAMO{\displaystyle G}, lo cual a su vez significaμ{\displaystyle \mu }y varianzaσ2{\displaystyle \sigma ^{2}}Las expresiones anteriores implicanmiH[incógnita]=miGRAMO[θ]=μ{\displaystyle \operatorname {E} _{H}[X]=\operatorname {E} _{G}[\theta ]=\mu }yVarH(incógnita)=VarF(incógnita|θ)+VarGRAMO(Y)=τ2+σ2{\displaystyle \operatorname {Var} _{H}(X)=\operatorname {Var} _{F}(X|\theta )+\operatorname {Var} _{G}(Y)=\tau ^{2}+\sigma ^{2}}, dóndeτ2{\displaystyle \tau ^{2}}es la varianza deF{\displaystyle F}.

Prueba

dejarF{\displaystyle F}yGRAMO{\displaystyle G}sean distribuciones de probabilidad parametrizadas con media y varianza comoincógnitaF(θ,τ2)θGRAMO(μ,σ2){\displaystyle {\begin{aligned}x&\sim {\mathcal {F}}(\theta ,\tau ^{2})\\\theta &\sim {\mathcal {G}}(\mu ,\sigma ^{2})\end{aligned}}}luego denotando las funciones de densidad de probabilidad comoF(incógnita|θ)=pagF(incógnita|θ){\displaystyle f(x|\theta )=p_{F}(x|\theta )}ygramo(θ)=pagGRAMO(θ){\displaystyle g(\theta )=p_{G}(\theta )}respectivamente yh(incógnita){\displaystyle h(x)}siendo la densidad de probabilidad deH{\displaystyle H}tenemosmiH[incógnita]=Fincógnitah(incógnita)dincógnita=FincógnitaGRAMOF(incógnita|θ)gramo(θ)dθdincógnita=GRAMOFincógnitaF(incógnita|θ)dincógnita gramo(θ)dθ=GRAMOmiF[incógnita|θ]gramo(θ)dθ{\displaystyle {\begin{aligned}\operatorname {E} _{H}[X]=\int _{F}xh(x)dx&=\int _{F}x\int _{G}f(x|\theta )g(\theta )d\theta dx\\&=\int _{G}\int _{F}xf(x|\theta )dx\ g(\theta )d\theta \\&=\int _{G}\operatorname {E} _{F}[X|\theta ]g(\theta )d\theta \end{aligned}}}y tenemos de la parametrizaciónF{\displaystyle {\mathcal {F}}}yGRAMO{\displaystyle {\mathcal {G}}}esomiF[incógnita|θ]=FincógnitaF(incógnita|θ)dincógnita=θmiGRAMO[θ]=GRAMOθgramo(θ)dθ=μ{\displaystyle {\begin{aligned}\operatorname {E} _{F}[X|\theta ]&=\int _{F}xf(x|\theta )dx=\theta \\\operatorname {E} _{G}[\theta ]&=\int _{G}\theta g(\theta )d\theta =\mu \end{aligned}}}y por lo tanto la media de la distribución compuestamiH[incógnita]=μ{\displaystyle \operatorname {E} _{H}[X]=\mu }según la expresión para su primer momento arriba.

La varianza deH{\displaystyle H}es dado pormiH[incógnita2](miH[incógnita])2{\displaystyle \operatorname {E} _{H}[X^{2}]-(\operatorname {E} _{H}[X])^{2}}, ymiH[incógnita2]=Fincógnita2h(incógnita)dincógnita=Fincógnita2GRAMOF(incógnita|θ)gramo(θ)dθdincógnita=GRAMOgramo(θ)Fincógnita2F(incógnita|θ)dincógnita dθ=GRAMOgramo(θ)(τ2+θ2)dθ=τ2GRAMOgramo(θ)dθ+GRAMOgramo(θ)θ2dθ=τ2+(σ2+μ2),{\displaystyle {\begin{aligned}\operatorname {E} _{H}[X^{2}]=\int _{F}x^{2}h(x)dx&=\int _{F}x^{2}\int _{G}f(x|\theta )g(\theta )d\theta dx\\&=\int _{G}g(\theta )\int _{F}x^{2}f(x|\theta )dx\ d\theta \\&=\int _{G}g(\theta )(\tau ^{2}+\theta ^{2})d\theta \\&=\tau ^{2}\int _{G}g(\theta )d\theta +\int _{G}g(\theta )\theta ^{2}d\theta \\&=\tau ^{2}+(\sigma ^{2}+\mu ^{2}),\end{aligned}}}dado el hecho de queFincógnita2F(incógnitaθ)dincógnita=miF[incógnita2θ]=VarF(incógnitaθ)+(miF[incógnitaθ])2{\displaystyle \int _{F}x^{2}f(x\mid \theta )dx=\operatorname {E} _{F}[X^{2}\mid \theta ]=\operatorname {Var} _{F}(X\mid \theta )+(\operatorname {E} _{F}[X\mid \theta ])^{2}}yGRAMOθ2gramo(θ)dθ=miGRAMO[θ2]=VarGRAMO(θ)+(miGRAMO[θ])2{\displaystyle \int _{G}\theta ^{2}g(\theta )d\theta =\operatorname {E} _{G}[\theta ^{2}]=\operatorname {Var} _{G}(\theta )+(\operatorname {E} _{G}[\theta ])^{2}}. Finalmente llegamosVarH(incógnita)=miH[incógnita2](miH[incógnita])2=τ2+σ2{\displaystyle {\begin{aligned}\operatorname {Var} _{H}(X)&=\operatorname {E} _{H}[X^{2}]-(\operatorname {E} _{H}[X])^{2}\\&=\tau ^{2}+\sigma ^{2}\end{aligned}}}

Aplicaciones

Pruebas

Las distribuciones de los estadísticos de prueba comunes resultan ser distribuciones compuestas bajo su hipótesis nula, por ejemplo en la prueba t de Student (donde el estadístico de prueba resulta como la razón de una variable aleatoria normal y una variable aleatoria chi-cuadrado ), o en la prueba F (donde el estadístico de prueba es la razón de dos variables aleatorias chi-cuadrado ).

Modelado de sobredispersión

Las distribuciones compuestas son útiles para modelar resultados que presentan sobredispersión , es decir, una mayor variabilidad de la esperada bajo un modelo determinado. Por ejemplo, los datos de conteo se modelan comúnmente utilizando la distribución de Poisson , cuya varianza es igual a su media. La distribución se puede generalizar permitiendo variabilidad en su parámetro de tasa , implementada a través de una distribución gamma , lo que resulta en una distribución binomial negativa marginal . Esta distribución es similar en su forma a la distribución de Poisson, pero permite mayores varianzas. De manera similar, una distribución binomial se puede generalizar para permitir variabilidad adicional componiéndola con una distribución beta para su parámetro de probabilidad de éxito, lo que resulta en una distribución beta-binomial .

Inferencia bayesiana

Además de las distribuciones marginales omnipresentes que pueden considerarse casos especiales de distribuciones compuestas, en la inferencia bayesiana , las distribuciones compuestas surgen cuando, en la notación anterior, F representa la distribución de observaciones futuras y G es la distribución posterior de los parámetros de F , dada la información en un conjunto de datos observados. Esto da como resultado una distribución predictiva posterior . De manera similar, para la distribución predictiva previa , F es la distribución de un nuevo punto de datos, mientras que G es la distribución previa de los parámetros.

Circunvolución

La convolución de distribuciones de probabilidad (para derivar la distribución de probabilidad de sumas de variables aleatorias) también puede verse como un caso especial de composición; aquí la distribución de la suma resulta esencialmente de considerar un sumando como un parámetro de ubicación aleatorio para el otro sumando. [ 1 ]

Cálculo

Las distribuciones compuestas derivadas de distribuciones de la familia exponencial suelen tener una forma cerrada. Si la integración analítica no es posible, pueden ser necesarios métodos numéricos.

Las distribuciones compuestas pueden investigarse con relativa facilidad utilizando métodos de Monte Carlo , es decir, generando muestras aleatorias. A menudo es fácil generar números aleatorios a partir de las distribuciones.pag(θ){\displaystyle p(\theta )}así comopag(incógnita|θ){\displaystyle p(x|\theta )}y luego utilizarlos para realizar un muestreo de Gibbs colapsado para generar muestras depag(incógnita){\displaystyle p(x)}.

Una distribución compuesta también puede aproximarse generalmente en un grado suficiente mediante una distribución de mezcla que utiliza un número finito de componentes de mezcla, lo que permite derivar la densidad aproximada, la función de distribución, etc. [ 1 ]

La estimación de parámetros ( estimación de máxima verosimilitud o de máxima probabilidad a posteriori ) dentro de un modelo de distribución compuesto a veces puede simplificarse utilizando el algoritmo EM . [ 2 ]

Ejemplos

Términos similares

La noción de "distribución compuesta", tal como se usa, por ejemplo, en la definición de una distribución de Poisson compuesta o un proceso de Poisson compuesto, difiere de la definición que se encuentra en este artículo. El significado en este artículo corresponde al que se usa, por ejemplo, en el modelado jerárquico bayesiano .

El caso especial para distribuciones de probabilidad compuestas donde la distribución parametrizadaF{\displaystyle F}La distribución de Poisson también se denomina distribución de Poisson mixta .

Véase también

Referencias

  1. 1 2 Röver, C.; Friede, T. (2017). "Aproximación discreta de una distribución de mezcla mediante divergencia restringida" . Journal of Computational and Graphical Statistics . 26 (1): 217– 222. arXiv : 1602.04060 . doi : 10.1080/10618600.2016.1276840 .
  2. Gelman, A.; Carlin, JB; Stern, H.; Rubin, DB (1997). "9.5 Hallar modos posteriores marginales usando EM y algoritmos relacionados ". Análisis de datos bayesianos (1.ª ed.). Boca Raton: Chapman & Hall / CRC. p. 276.  
  3. 1 2 Lee, SX; McLachlan, GJ (2019). "Distribución de mezcla de escalas". Wiley StatsRef: Statistics Reference Online . págs. 1–16 . doi : 10.1002/9781118445112.stat08201 . ISBN  978-1-118-44511-2.
  4. Gneiting, T. (1997). "Mezclas de escala normal y densidades de probabilidad duales". Journal of Statistical Computation and Simulation . 59 (4): 375– 384. doi : 10.1080/00949659708811867 .
  5. Mood, AM; Graybill, FA; Boes, DC (1974). Introducción a la teoría de la estadística (3.ª ed.). Nueva York: McGraw-Hill. 
  6. Andrews, DF; Mallows, CL (1974), "Mezclas de escala de distribuciones normales", Journal of the Royal Statistical Society, Serie B , 36 (1): 99–102 , doi : 10.1111/j.2517-6161.1974.tb00989.x
  7. Johnson, NL; Kemp, AW ; Kotz, S. (2005). "6.2.2". Distribuciones discretas univariadas (3.ª ed.). Nueva York: Wiley. p. 253.  
  8. Gelman, A.; Carlin, JB; Stern, H.; Dunson, DB; Vehtari, A.; Rubin, DB (2014). Análisis de datos bayesianos (3.ª ed.). Boca Raton: Chapman & Hall / CRC. Bibcode : 2014bda..book.....G . 
  9. Lawless, JF (1987). "Regresión binomial negativa y de Poisson mixta". The Canadian Journal of Statistics . 15 (3): 209– 225. doi : 10.2307/3314912 . JSTOR 3314912 . 
  10. ^ Teich, MC; Diament, P. (1989). "Multiplicar representaciones estocásticas para distribuciones K y sus transformadas de Poisson". Revista de la Sociedad Óptica de América A. 6 (1): 80– 91. Bibcode : 1989JOSAA...6...80T . CiteSeerX 10.1.1.64.596 . doi : 10.1364/JOSAA.6.000080 . 
  11. Johnson, NL; Kotz, S.; Balakrishnan, N. (1994). "20 distribuciones de Pareto ". Distribuciones univariadas continuas . Vol. 1 (2.ª ed.). Nueva York: Wiley. p. 573.   
  12. Dubey, SD (1970). "Distribuciones gamma, beta y F compuestas". Metrika . 16 : 27–31 . doi : 10.1007/BF02613934 .

Lecturas adicionales

  • Lindsay, BG (1995), Modelos de mezcla: teoría, geometría y aplicaciones , NSF-CBMS Regional Conference Series in Probability and Statistics, vol.  5, Hayward, CA, EE. UU.: Institute of Mathematical Statistics, pp.  i–163, ISBN 978-0-940600-32-4, JSTOR 4153184 
  • Seidel, W. (2010), "Modelos de mezcla", en Lovric, M. (ed.), Enciclopedia internacional de la ciencia estadística , Heidelberg: Springer, pp. 827–829 , doi : 10.1007/978-3-642-04898-2_368 , ISBN  978-3-642-04898-2
  • Mood, AM; Graybill, FA; Boes, DC (1974), "III.4.3 Distribuciones contagiosas y distribuciones truncadas ", Introducción a la teoría de la estadística (3.ª  ed.), Nueva York: McGraw-Hill, ISBN 978-0-07-042864-5
  • Johnson, NL; Kemp, AW ; Kotz, S. (2005), "8 distribuciones de mezcla ", distribuciones discretas univariadas , Nueva York: Wiley, ISBN 978-0-471-27246-5