Articulo de referencia

Probabilidad posterior

La probabilidad posterior es un tipo de probabilidad condicional que resulta de actualizar la probabilidad previa con información resumida por la verosimilitud mediante la aplic...

La probabilidad posterior es un tipo de probabilidad condicional que resulta de actualizar la probabilidad previa con información resumida por la verosimilitud mediante la aplicación de la regla de Bayes . [ 1 ] Desde una perspectiva epistemológica , la probabilidad posterior contiene todo lo que se puede saber sobre una proposición incierta (como una hipótesis científica o valores de parámetros), dado el conocimiento previo y un modelo matemático que describe las observaciones disponibles en un momento determinado. [ 2 ] Tras la llegada de nueva información, la probabilidad posterior actual puede servir como probabilidad previa en otra ronda de actualización bayesiana. [ 3 ]

En el contexto de la estadística bayesiana , la distribución de probabilidad posterior suele describir la incertidumbre epistémica sobre los parámetros estadísticos condicionada a un conjunto de datos observados. A partir de una distribución posterior dada, se pueden derivar diversas estimaciones puntuales y por intervalos , como la estimación a posteriori máxima (MAP) o el intervalo de mayor densidad posterior (HPDI). [ 4 ] Sin embargo, aunque conceptualmente sencilla, la distribución posterior generalmente no es manejable y, por lo tanto, necesita ser aproximada analítica o numéricamente. [ 5 ]

Definición en el caso distributivo

En estadística bayesiana, la probabilidad posterior es la distribución de probabilidad de los parámetros.θ{\displaystyle \theta }dada la evidenciaincógnita{\displaystyle X}y se denotapag(θ|incógnita){\displaystyle p(\theta |X)}.

Esto contrasta con la función de verosimilitud , que es la probabilidad de la evidencia dados los parámetros:pag(incógnita|θ){\displaystyle p(X|\theta )}.

Ambos se relacionan de la siguiente manera:

Dada la creencia previa de que una función de distribución de probabilidad espag(θ){\displaystyle p(\theta )}y que las observacionesincógnita{\displaystyle x}tener una probabilidadpag(incógnita|θ){\displaystyle p(x|\theta )}, entonces la probabilidad posterior se define como

pag(θ|incógnita)=pag(incógnita|θ)pag(incógnita)pag(θ){\displaystyle p(\theta |x)={\frac {p(x|\theta )}{p(x)}}p(\theta )}, [ 6 ]

dóndepag(incógnita){\displaystyle p(x)}es la constante de normalización y se calcula como

pag(incógnita)=pag(incógnita|θ)pag(θ)dθ{\displaystyle p(x)=\int p(x|\theta )p(\theta )d\theta }

para continuoθ{\displaystyle \theta }o sumandopag(incógnita|θ)pag(θ){\displaystyle p(x|\theta )p(\theta )} sobre todos los valores posibles deθ{\displaystyle \theta }para discretoθ{\displaystyle \theta }. [ 7 ]

Por lo tanto, la probabilidad posterior es proporcional al producto Probabilidad · Probabilidad previa . [ 8 ]

Ejemplo

Supongamos que hay una escuela con un 60% de alumnos varones y un 40% de alumnas. Las niñas usan pantalones o faldas en igual proporción; todos los niños usan pantalones. Un observador ve a un alumno (elegido al azar) desde la distancia; lo único que puede ver es que este alumno lleva pantalones. ¿Cuál es la probabilidad de que este alumno sea una niña? La respuesta correcta se puede calcular utilizando el teorema de Bayes.

El evento G es que el estudiante observado sea una niña, y el evento T es que el estudiante observado lleve pantalones. Para calcular la probabilidad posteriorPAG(GRAMO|T){\displaystyle P(G|T)}Primero necesitamos saber:

  • PAG(GRAMO){\displaystyle P(G)}o la probabilidad de que el estudiante sea una niña independientemente de cualquier otra información. Dado que el observador ve a un estudiante al azar, lo que significa que todos los estudiantes tienen la misma probabilidad de ser observados, y el porcentaje de niñas entre los estudiantes es del 40%, esta probabilidad es igual a 0,4.
  • PAG(B){\displaystyle P(B)}o la probabilidad de que el estudiante no sea una niña (es decir, un niño) independientemente de cualquier otra información ( B es el evento complementario a G ). Esto es 60%, o 0,6.
  • PAG(T|GRAMO){\displaystyle P(T|G)}o la probabilidad de que el estudiante use pantalones dado que es una chica. Como tienen la misma probabilidad de usar faldas que pantalones, esto es 0,5.
  • PAG(T|B){\displaystyle P(T|B)}, o la probabilidad de que el estudiante use pantalones dado que el estudiante es un niño. Esto se da como 1.
  • PAG(T){\displaystyle P(T)}o la probabilidad de que un estudiante (seleccionado al azar) use pantalones independientemente de cualquier otra información. Dado quePAG(T)=PAG(T|GRAMO)PAG(GRAMO)+PAG(T|B)PAG(B){\displaystyle P(T)=P(T|G)P(G)+P(T|B)P(B)}(a través de la ley de probabilidad total ), esto esPAG(T)=0,5×0,4+1×0,6=0,8{\displaystyle P(T)=0.5\times 0.4+1\times 0.6=0.8}.

Dada toda esta información, la probabilidad posterior de que el observador haya visto a una chica dado que el estudiante observado lleva pantalones se puede calcular sustituyendo estos valores en la fórmula:

PAG(GRAMO|T)=PAG(T|GRAMO)PAG(GRAMO)PAG(T)=0,5×0,40,8=0,25.{\displaystyle P(G|T)={\frac {P(T|G)P(G)}{P(T)}}={\frac {0.5\times 0.4}{0.8}}=0.25.}

Una forma intuitiva de resolver esto es suponer que la escuela tiene N estudiantes. El número de chicos es 0,6 N y el número de chicas es 0,4 N. Si N es lo suficientemente grande como para ignorar los errores de redondeo, el número total de personas que usan pantalones es 0,6 N + 50% de 0,4 N. Y el número de chicas que usan pantalones es 50% de 0,4 N. Por lo tanto, en la población de personas que usan pantalones, las chicas son (50% de 0,4 N ) / (0,6 N + 50% de 0,4 N ) = 25%. En otras palabras, si se separara el grupo de personas que usan pantalones, una cuarta parte de ese grupo serían chicas. Por lo tanto, si se ven pantalones, lo máximo que se puede deducir es que se está viendo una sola muestra de un subconjunto de estudiantes donde el 25% son chicas. Y por definición, la probabilidad de que este estudiante elegido al azar sea una chica es del 25%. Cualquier problema del teorema de Bayes se puede resolver de esta manera. [ 9 ]

Cálculo

The posterior probability distribution of one random variable given the value of another can be calculated with Bayes' theorem by multiplying the prior probability distribution by the likelihood function, and then dividing by the normalizing constant, as follows:

fXY=y(x)=fX(x)LXY=y(x)fX(u)LXY=y(u)du{\displaystyle f_{X\mid Y=y}(x)={f_{X}(x){\mathcal {L}}_{X\mid Y=y}(x) \over {\int _{-\infty }^{\infty }f_{X}(u){\mathcal {L}}_{X\mid Y=y}(u)\,du}}}

gives the posterior probability density function for a random variable X{\displaystyle X} given the data Y=y{\displaystyle Y=y}, where

  • fX(x){\displaystyle f_{X}(x)} is the prior density of X{\displaystyle X},
  • LXY=y(x)=fYX=x(y){\displaystyle {\mathcal {L}}_{X\mid Y=y}(x)=f_{Y\mid X=x}(y)} is the likelihood function as a function of x{\displaystyle x},
  • fX(u)LXY=y(u)du{\displaystyle \int _{-\infty }^{\infty }f_{X}(u){\mathcal {L}}_{X\mid Y=y}(u)\,du} is the normalizing constant, and
  • fXY=y(x){\displaystyle f_{X\mid Y=y}(x)} is the posterior density of X{\displaystyle X} given the data Y=y{\displaystyle Y=y}.[10]

Credible interval

Posterior probability is a conditional probability conditioned on randomly observed data. Hence it is a random variable. For a random variable, it is important to summarize its amount of uncertainty. One way to achieve this goal is to provide a credible interval of the posterior probability.[11]

Classification

In classification, posterior probabilities reflect the uncertainty of assessing an observation to particular class, see also class-membership probabilities. While statistical classification methods by definition generate posterior probabilities, Machine Learners usually supply membership values which do not induce any probabilistic confidence. It is desirable to transform or rescale membership values to class-membership probabilities, since they are comparable and additionally more easily applicable for post-processing.[12]

See also

References

  1. Lambert, Ben (2018). "The posterior – the goal of Bayesian inference". A Student's Guide to Bayesian Statistics. Sage. pp. 121–140. ISBN 978-1-4739-1636-4.
  2. Grossman, Jason (2005). Inferences from observations to simple statistical hypotheses (PhD thesis). University of Sydney. hdl:2123/9107.
  3. Etz, Alex (2015-07-25). "Understanding Bayes: Updating priors via the likelihood". The Etz-Files. Retrieved 2022-08-18.
  4. Gill, Jeff (2014). "Summarizing Posterior Distributions with Intervals". Bayesian Methods: A Social and Behavioral Sciences Approach (Third ed.). Chapman & Hall. pp. 42–48. ISBN 978-1-4398-6248-3.
  5. Press, S. James (1989). «Aproximaciones, métodos numéricos y programas informáticos». Estadística bayesiana : principios, modelos y aplicaciones . Nueva York: John Wiley & Sons. págs. 69-102 . ISBN   0-471-63729-7.
  6. Christopher M. Bishop (2006). Reconocimiento de patrones y aprendizaje automático . Springer. págs. 21–24 . ISBN  978-0-387-31073-2.
  7. Andrew Gelman, John B. Carlin, Hal S. Stern, David B. Dunson, Aki Vehtari y Donald B. Rubin (2014). Análisis de datos bayesianos . CRC Press. pág. 7. ISBN  978-1-4398-4095-5.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  8. Ross, Kevin. Capítulo 8 Introducción a las distribuciones previas y posteriores continuas | Una introducción al razonamiento y los métodos bayesianos .
  9. "Teorema de Bayes - C o T ex T" . sites.google.com . Consultado el 18 de agosto de 2022 .
  10. "Probabilidad posterior - formulasearchengine" . formulasearchengine.com . Consultado el 19 de agosto de 2022 .
  11. Clyde, Merlise; Çetinkaya-Rundel, Mine; Rundel, Colin; Banks, David; Chai, Christine; Huang, Lizzy. Capítulo 1 Los fundamentos de la estadística bayesiana | Una introducción al pensamiento bayesiano .
  12. Boedeker, Peter; Kearns, Nathan T. (2019-07-09). "Análisis discriminante lineal para la predicción de la pertenencia a grupos: una introducción fácil de usar" . Advances in Methods and Practices in Psychological Science . 2 (3): 250– 263. doi : 10.1177/2515245919849378 . ISSN 2515-2459 . S2CID 199007973 .  

Lecturas adicionales

  • Lancaster, Tony (2004). Introducción a la econometría bayesiana moderna . Oxford: Blackwell. ISBN 1-4051-1720-6.
  • Lee, Peter M. (2004). Estadística bayesiana  : una introducción (3.ª  ed.). Wiley . ISBN 0-340-81405-5.