Articulo de referencia

Probabilidad condicional

En teoría de la probabilidad , la probabilidad condicional es una medida de la probabilidad de que ocurra un evento , dado que se sabe que otro evento (por suposición, presunció...

En teoría de la probabilidad , la probabilidad condicional es una medida de la probabilidad de que ocurra un evento , dado que se sabe que otro evento (por suposición, presunción, afirmación o evidencia) ya ha ocurrido. [ 1 ] Este método particular se basa en que el evento A ocurra con algún tipo de relación con otro evento B. En esta situación, el evento A puede analizarse mediante una probabilidad condicional con respecto a B. Si el evento de interés es A y se sabe o se supone que el evento B ha ocurrido, "la probabilidad condicional de A dado B ", o "la probabilidad de A bajo la condición B ", se suele escribir como P( A | B ) [ 2 ] o, en ocasiones, P B ( A ) . Esto también puede entenderse como la fracción de probabilidad B que se cruza con A, o la razón de las probabilidades de que ocurran ambos eventos con respecto a que ocurra el "dado" (cuántas veces ocurre A en lugar de no suponer que B ha ocurrido):

PAG(AB)=PAG(AB)PAG(B){\displaystyle P(A\mid B)={\frac {P(A\cap B)}{P(B)}}}. [ 3 ]

Por ejemplo, la probabilidad de que una persona tenga tos en un día cualquiera puede ser solo del 5%. Pero si sabemos o suponemos que la persona está enferma, entonces es mucho más probable que tosa. Por ejemplo, la probabilidad condicional de que alguien enfermo tosa podría ser del 75%, en cuyo caso tendríamos que P(Tos) = 5% y P(Tos|Enfermo) = 75%. Si bien existe una relación entre A y B en este ejemplo, dicha relación o dependencia entre A y B no es necesaria, ni tampoco tienen que ocurrir simultáneamente.

P( A | B ) puede ser igual o no a P( A ) , es decir, la probabilidad incondicional o absoluta de A. Si P( A | B ) = P( A ) , entonces se dice que los eventos A y B son independientes : en tal caso, el conocimiento de uno de los eventos no altera la probabilidad del otro. P( A | B ) (la probabilidad condicional de A dado B ) generalmente difiere de P( B | A ) . Por ejemplo, si una persona tiene dengue , podría tener un 90% de probabilidad de dar positivo en la prueba de la enfermedad. En este caso, lo que se mide es que si el evento B ( tener dengue ) ha ocurrido, la probabilidad de A ( dar positivo en la prueba ) dado que B ocurrió es del 90%, simplemente escribiendo P( A | B ) = 90%. Alternativamente, si una persona da positivo en la prueba de dengue, puede tener solo un 15% de probabilidad de tener realmente esta enfermedad rara debido a las altas tasas de falsos positivos . En este caso, la probabilidad del evento B ( tener dengue ) dado que el evento A ( dar positivo en la prueba ) ha ocurrido es del 15%, o P( B | A ) = 15%. Ahora debería ser evidente que igualar erróneamente ambas probabilidades puede conducir a diversos errores de razonamiento, como las falacias de la tasa base .

Si bien las probabilidades condicionales pueden proporcionar información extremadamente útil, a menudo se dispone de información limitada. Por lo tanto, puede ser útil invertir o convertir una probabilidad condicional utilizando el teorema de Bayes :PAG(AB)=PAG(BA)PAG(A)PAG(B){\displaystyle P(A\mid B)={{P(B\mid A)P(A)} \over {P(B)}}}. [ 4 ] Otra opción es mostrar probabilidades condicionales en una tabla de probabilidad condicional para ilustrar la relación entre eventos.

Definición

Ilustración de probabilidades condicionales con un diagrama de Euler . La probabilidad incondicional P( A ) = 0,30 + 0,10 + 0,12 = 0,52. Sin embargo, la probabilidad condicional P ( A | B1 ) = 1, P ( A | B2 ) = 0,12 ÷ (0,12 + 0,04) = 0,75 y P( A | B3 ) = 0.
En un diagrama de árbol , las probabilidades de las ramas dependen del evento asociado al nodo padre. (Aquí, las barras superiores indican que el evento no ocurre).
Diagrama circular de Venn que describe probabilidades condicionales

Condicionamiento en un evento

Definición de Kolmogorov

Dados dos eventos A y B del campo sigma de un espacio de probabilidad , con la probabilidad incondicional de B siendo mayor que cero (es decir, P( B ) > 0) , la probabilidad condicional de A dado B (PAG(AB){\displaystyle P(A\mid B)}) es la probabilidad de que ocurra A si B ha ocurrido o se supone que ha ocurrido. [ 5 ] Se supone que A es el conjunto de todos los resultados posibles de un experimento o ensayo aleatorio que tiene un espacio muestral restringido o reducido. La probabilidad condicional se puede encontrar mediante el cociente de la probabilidad de la intersección conjunta de los eventos A y B , es decir,PAG(AB){\displaystyle P(A\cap B)}, la probabilidad de que A y B ocurran juntos, y la probabilidad de B : [ 2 ] [ 6 ] [ 7 ]

PAG(AB)=PAG(AB)PAG(B).{\displaystyle P(A\mid B)={\frac {P(A\cap B)}{P(B)}}.}

Para un espacio muestral que consta de resultados de igual probabilidad, la probabilidad del evento A se entiende como la fracción del número de resultados en A con respecto al número de todos los resultados en el espacio muestral. Entonces, esta ecuación se entiende como la fracción del conjuntoAB{\displaystyle A\cap B}al conjunto B. Nótese que la ecuación anterior es una definición, no solo un resultado teórico. Denotamos la cantidadPAG(AB)PAG(B){\displaystyle {\frac {P(A\cap B)}{P(B)}}}comoPAG(AB){\displaystyle P(A\mid B)}y la llamamos la "probabilidad condicional de A dado B ".

Como axioma de probabilidad

Algunos autores, como de Finetti , prefieren introducir la probabilidad condicional como un axioma de probabilidad :

PAG(AB)=PAG(AB)PAG(B).{\displaystyle P(A\cap B)=P(A\mid B)P(B).}

Esta ecuación para una probabilidad condicional, aunque matemáticamente equivalente, puede ser intuitivamente más fácil de entender. Puede interpretarse como "la probabilidad de que ocurra B multiplicada por la probabilidad de que ocurra A , siempre que B haya ocurrido, es igual a la probabilidad de que ocurran A y B juntas, aunque no necesariamente al mismo tiempo". Además, esto puede ser preferible desde un punto de vista filosófico; bajo las principales interpretaciones de la probabilidad , como la teoría subjetiva , la probabilidad condicional se considera una entidad primitiva. Además, esta "regla de multiplicación" puede ser prácticamente útil para calcular la probabilidad deAB{\displaystyle A\cap B}e introduce una simetría con el axioma de suma para la fórmula de Poincaré:

PAG(AB)=PAG(A)+PAG(B)PAG(AB){\displaystyle P(A\cup B)=P(A)+P(B)-P(A\cap B)}
De este modo, las ecuaciones pueden combinarse para encontrar una nueva representación de la  :
PAG(AB)=PAG(A)+PAG(B)PAG(AB)=PAG(AB)PAG(B){\displaystyle P(A\cap B)=P(A)+P(B)-P(A\cup B)=P(A\mid B)P(B)}
PAG(AB)=PAG(A)+PAG(B)PAG(AB)PAG(B){\displaystyle P(A\cup B)={P(A)+P(B)-P(A\mid B){P(B)}}}

Como la probabilidad de un evento condicional

La probabilidad condicional se puede definir como la probabilidad de un evento condicional.AB{\displaystyle A_{B}}El evento condicional de Goodman-Nguyen-Van Fraassen se puede definir como:

AB=i1(j<iB¯j,AiBi),{\displaystyle A_{B}=\bigcup _{i\geq 1}\left(\bigcap _{j<i}{\overline {B}}_{j},A_{i}B_{i}\right),}dóndeAi{\displaystyle A_{i}}yBi{\displaystyle B_{i}}representan estados o elementos de A o B. [ 8 ]

Se puede demostrar que

PAG(AB)=PAG(AB)PAG(B){\displaystyle P(A_{B})={\frac {P(A\cap B)}{P(B)}}}

que cumple con la definición de probabilidad condicional de Kolmogorov. [ 9 ]

Condicionamiento a un evento de probabilidad cero

SiPAG(B)=0{\displaystyle P(B)=0}, entonces según la definición,PAG(AB){\displaystyle P(A\mid B)}no está definido .

El caso de mayor interés es el de una variable aleatoria Y , condicionada a una variable aleatoria continua X que resulta en un resultado particular x . El eventoB={incógnita=incógnita}{\displaystyle B=\{X=x\}}tiene probabilidad cero y, como tal, no se puede condicionar.

En lugar de condicionar a que X sea exactamente x , podríamos condicionar a que esté más cerca que la distanciaε{\displaystyle \varepsilon }lejos de x . El eventoB={incógnitaε<incógnita<incógnita+ε}{\displaystyle B=\{x-\varepsilon <X<x+\varepsilon \}}En general, tendrá una probabilidad distinta de cero y, por lo tanto, se puede condicionar. Entonces podemos tomar el límite.

Por ejemplo, si dos variables aleatorias continuas X e Y tienen una densidad conjuntaFincógnita,Y(incógnita,y){\displaystyle f_{X,Y}(x,y)}, luego por la regla de L'Hôpital y la regla integral de Leibniz , al diferenciar con respecto aε{\displaystyle \varepsilon }:

límiteε0PAG(YUincógnita0ε<incógnita<incógnita0+ε)=límiteε0incógnita0εincógnita0+εUFincógnita,Y(incógnita,y)dydincógnitaincógnita0εincógnita0+εRFincógnita,Y(incógnita,y)dydincógnita=UFincógnita,Y(incógnita0,y)dyRFincógnita,Y(incógnita0,y)dy.{\displaystyle {\begin{aligned}\lim _{\varepsilon \to 0}P(Y\in U\mid x_{0}-\varepsilon <X<x_{0}+\varepsilon )&=\lim _{\varepsilon \to 0}{\frac {\int _{x_{0}-\varepsilon }^{x_{0}+\varepsilon }\int _{U}f_{X,Y}(x,y)\,\mathrm {d} y\,\mathrm {d} x}{\int _{x_{0}-\varepsilon }^{x_{0}+\varepsilon }\int _{\mathbb {R} }f_{X,Y}(x,y)\,\mathrm {d} y\,\mathrm {d} x}}\\[6pt]&={\frac {\int _{U}f_{X,Y}(x_{0},y)\,\mathrm {d} y}{\int _{\mathbb {R} }f_{X,Y}(x_{0},y)\,\mathrm {d} y}}.\end{aligned}}}

El límite resultante es la distribución de probabilidad condicional de Y dado X y existe cuando el denominador, la densidad de probabilidadFincógnita(incógnita0){\displaystyle f_{X}(x_{0})}, es estrictamente positivo.

Resulta tentador definir la probabilidad indefinida.PAG(Aincógnita=incógnita){\displaystyle P(A\mid X=x)}utilizando limit( 1 ), pero esto no se puede hacer de manera consistente. En particular, es posible encontrar variables aleatorias X y W y valores x , w tales que los eventos{incógnita=incógnita}{\displaystyle \{X=x\}}y{W=w}{\displaystyle \{W=w\}}son idénticos, pero los límites resultantes no lo son:

límiteε0PAG(Aincógnitaεincógnitaincógnita+ε)límiteε0PAG(AwεWw+ε).{\displaystyle \lim _{\varepsilon \to 0}P(A\mid x-\varepsilon \leq X\leq x+\varepsilon )\neq \lim _{\varepsilon \to 0}P(A\mid w-\varepsilon \leq W\leq w+\varepsilon ).}

La paradoja de Borel-Kolmogorov lo demuestra mediante un argumento geométrico.

Condicionamiento sobre una variable aleatoria discreta

Sea X una variable aleatoria discreta y sus posibles resultados denotemos V. Por ejemplo, si X representa el valor de un dado lanzado, entonces V es el conjunto{1,2,3,4,5,6}{\displaystyle \{1,2,3,4,5,6\}}Supongamos, a efectos de presentación, que X es una variable aleatoria discreta, de modo que cada valor en V tiene una probabilidad distinta de cero.

Para un valor x en V y un evento A , la probabilidad condicional viene dada porPAG(Aincógnita=incógnita){\displaystyle P(A\mid X=x)}. Escribiendo

do(incógnita,A)=PAG(Aincógnita=incógnita){\displaystyle c(x,A)=P(A\mid X=x)}

En resumen, vemos que es una función de dos variables, x y A.

Para un A fijo , podemos formar la variable aleatoriaY=do(incógnita,A){\displaystyle Y=c(X,A)}Representa un resultado dePAG(Aincógnita=incógnita){\displaystyle P(A\mid X=x)}siempre que se observe un valor x de X.

La probabilidad condicional de A dado X puede tratarse, por lo tanto, como una variable aleatoria Y con resultados en el intervalo[0,1]{\displaystyle [0,1]}. Según la ley de probabilidad total , su valor esperado es igual a la probabilidad incondicional de A.

Probabilidad condicional parcial

La probabilidad condicional parcial PAG(AB1b1,,Bmetrobmetro){\displaystyle P(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})} se trata de la probabilidad de un evento A{\displaystyle A}dado que cada uno de los eventos de condición Bi{\displaystyle B_{i}}ha ocurrido en cierta medida bi{\displaystyle b_{i}}(grado de creencia, grado de experiencia) que podría ser diferente del 100%. Frecuentísticamente, la probabilidad condicional parcial tiene sentido si las condiciones se prueban en repeticiones experimentales de duración apropiada. norte{\displaystyle n}. [ 10 ] Tal norte{\displaystyle n}La probabilidad condicional parcial acotada se puede definir como la ocurrencia promedio esperada condicionalmente del evento.A{\displaystyle A}en bancos de prueba de longitud norte{\displaystyle n}que se ajustan a todas las especificaciones de probabilidad Bibi{\displaystyle B_{i}\equiv b_{i}}, es decir:

PAGnorte(AB1b1,,Bmetrobmetro)=mi(A¯norteB¯1norte=b1,,B¯metronorte=bmetro){\displaystyle P^{n}(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})=\operatorname {E} ({\overline {A}}^{n}\mid {\overline {B}}_{1}^{n}=b_{1},\ldots ,{\overline {B}}_{m}^{n}=b_{m})}[ 10 ]

Sobre esa base, la probabilidad condicional parcial se puede definir como

PAG(AB1b1,,Bmetrobmetro)=límitenortePAGnorte(AB1b1,,Bmetrobmetro),{\displaystyle P(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})=\lim _{n\to \infty }P^{n}(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m}),}

dóndebinortenorte{\displaystyle b_{i}n\in \mathbb {N} }[ 10 ]

La condicionalización de Jeffrey [ 11 ] [ 12 ] es un caso especial de probabilidad condicional parcial, en el que los eventos de condición deben formar una partición :

PAG(AB1b1,,Bmetrobmetro)=i=1metrobiPAG(ABi){\displaystyle P(A\mid B_{1}\equiv b_{1},\ldots ,B_{m}\equiv b_{m})=\sum _{i=1}^{m}b_{i}P(A\mid B_{i})}

Ejemplo

Suppose that somebody secretly rolls two fair six-sided dice, and we wish to compute the probability that the face-up value of the first one is 2, given the information that their sum is no greater than 5.

  • Let D1 be the value rolled on dice 1.
  • Let D2 be the value rolled on dice 2.

Probability thatD1 = 2

Table 1 shows the sample space of 36 combinations of rolled values of the two dice, each of which occurs with probability 1/36, with the numbers displayed in the red and dark gray cells being D1 + D2.

D1 = 2 in exactly 6 of the 36 outcomes; thus P(D1 = 2) = 636 = 16:

Probability thatD1 + D2  5

Table 2 shows that D1 + D2  5 for exactly 10 of the 36 outcomes, thus P(D1 + D2  5) = 1036:

Probability thatD1 = 2 given thatD1 + D2  5

Table 3 shows that for 3 of these 10 outcomes, D1 = 2.

Thus, the conditional probability P(D1 = 2 | D1+D2  5) = 310 = 0.3:

Here, in the earlier notation for the definition of conditional probability, the conditioning event B is that D1 + D2  5, and the event A is D1 = 2. We have P(AB)=P(AB)P(B)=3/3610/36=310,{\displaystyle P(A\mid B)={\tfrac {P(A\cap B)}{P(B)}}={\tfrac {3/36}{10/36}}={\tfrac {3}{10}},} as seen in the table.

Use in inference

In statistical inference, the conditional probability is an update of the probability of an event based on new information.[13] The new information can be incorporated as follows:[1]

  • Let A, the event of interest, be in the sample space, say (X,P).
  • The occurrence of the event A knowing that event B has or will have occurred, means the occurrence of A as it is restricted to B, i.e. AB{\displaystyle A\cap B}.
  • Without the knowledge of the occurrence of B, the information about the occurrence of A would simply be P(A)
  • The probability of A knowing that event B has or will have occurred, will be the probability of AB{\displaystyle A\cap B} relative to P(B), the probability that B has occurred.
  • This results in P(AB)=P(AB)/P(B){\textstyle P(A\mid B)=P(A\cap B)/P(B)} whenever P(B) > 0 and 0 otherwise.

This approach results in a probability measure that is consistent with the original probability measure and satisfies all the Kolmogorov axioms. This conditional probability measure also could have resulted by assuming that the relative magnitude of the probability of A with respect to X will be preserved with respect to B (cf. a Formal Derivation below).

The wording "evidence" or "information" is generally used in the Bayesian interpretation of probability. The conditioning event is interpreted as evidence for the conditioned event. That is, P(A) is the probability of A before accounting for evidence E, and P(A|E) is the probability of A after having accounted for evidence E or after having updated P(A). This is consistent with the frequentist interpretation, which is the first definition given above.

Example

When Morse code is transmitted, there is a certain probability that the "dot" or "dash" that was received is erroneous. This is often taken as interference in the transmission of a message. Therefore, it is important to consider when sending a "dot", for example, the probability that a "dot" was received. This is represented by: P(dot sent | dot received)=P(dot received | dot sent)P(dot sent)P(dot received).{\displaystyle P({\text{dot sent }}|{\text{ dot received}})=P({\text{dot received }}|{\text{ dot sent}}){\frac {P({\text{dot sent}})}{P({\text{dot received}})}}.} In Morse code, the ratio of dots to dashes is 3:4 at the point of sending, so the probabilities of a "dot" and "dash" are P(dot sent)=37 and P(dash sent)=47{\displaystyle P({\text{dot sent}})={\frac {3}{7}}{\text{ and }}P({\text{dash sent}})={\frac {4}{7}}}. If it is assumed that the probability that a dot is transmitted as a dash is 1/10, and that the probability that a dash is transmitted as a dot is likewise 1/10, then Bayes's rule can be used to calculate P(dot received){\displaystyle P({\text{dot received}})}.

P(dot received)=P(dot receiveddot sent)+P(dot receiveddash sent){\displaystyle P({\text{dot received}})=P({\text{dot received}}\cap {\text{dot sent}})+P({\text{dot received}}\cap {\text{dash sent}})}
P(dot received)=P(dot receiveddot sent)P(dot sent)+P(dot receiveddash sent)P(dash sent){\displaystyle P({\text{dot received}})=P({\text{dot received}}\mid {\text{dot sent}})P({\text{dot sent}})+P({\text{dot received}}\mid {\text{dash sent}})P({\text{dash sent}})}
P(dot received)=910×37+110×47=3170{\displaystyle P({\text{dot received}})={\frac {9}{10}}\times {\frac {3}{7}}+{\frac {1}{10}}\times {\frac {4}{7}}={\frac {31}{70}}}

Now, P(dot sentdot received){\displaystyle P({\text{dot sent}}\mid {\text{dot received}})} can be calculated:

P(dot sentdot received)=P(dot receiveddot sent)P(dot sent)P(dot received)=910×373170=2731{\displaystyle P({\text{dot sent}}\mid {\text{dot received}})=P({\text{dot received}}\mid {\text{dot sent}}){\frac {P({\text{dot sent}})}{P({\text{dot received}})}}={\frac {9}{10}}\times {\frac {\frac {3}{7}}{\frac {31}{70}}}={\frac {27}{31}}}[14]

Information, Conditional Probability, and Statistical Independence

The concepts of conditional probability and statistical independence can be understood through the idea of how new information changes an individual's uncertainty about an event.

Example 1

Dependent Events (Six-Sided Die)

Consider the experiment of rolling a fair six-sided die, where the sample space is S={1,2,3,4,5,6}{\displaystyle S=\{1,2,3,4,5,6\}}. Let event A denote the occurrence of an even number, so A={2,4,6}{\displaystyle A=\{2,4,6\}}, and let event B denote the occurrence of a number less than or equal to 3, so B={1,2,3}{\displaystyle B=\{1,2,3\}}. Before any additional information is available, the probabilities of these events are P(A)=36=12{\displaystyle P(A)={\frac {3}{6}}={\frac {1}{2}}} and P(B)=36=12{\displaystyle P(B)={\frac {3}{6}}={\frac {1}{2}}}. The intersection of the two events is AB={2}{\displaystyle A\cap B=\{2\}}, and therefore P(AB)=16{\displaystyle P(A\cap B)={\frac {1}{6}}}. If the events were statistically independent, we would expect P(AB)=P(A)P(B){\displaystyle P(A\cap B)=P(A)P(B)}. However, 1612×12=14{\displaystyle {\frac {1}{6}}\neq {\frac {1}{2}}\times {\frac {1}{2}}={\frac {1}{4}}}, indicating that events A and B are not independent but are instead statistically dependent.

Now suppose that an observer reveals that event A has occurred; that is, the outcome is known to be an even number. This new information reduces the effective sample space from S={1,2,3,4,5,6}{\displaystyle S=\{1,2,3,4,5,6\}} to A={2,4,6}{\displaystyle A=\{2,4,6\}}. Within this reduced sample space, event B can occur only when the outcome is 2, so the relevant event becomes AB={2}{\displaystyle A\cap B=\{2\}}. Consequently, the conditional probability of event B given that event A has occurred is P(BA)=P(AB)P(A)=1/61/2=13{\displaystyle P(B\mid A)={\frac {P(A\cap B)}{P(A)}}={\frac {1/6}{1/2}}={\frac {1}{3}}}. Thus, the probability of event B changes from 12{\displaystyle {\frac {1}{2}}} to 13{\displaystyle {\frac {1}{3}}} after the additional information is provided. This change in probability demonstrates that knowledge of event A affects the likelihood of event B, confirming that the two events are statistically dependent. In such situations, additional information reduces uncertainty and can significantly influence rational decision-making, prediction, and betting behaviour.

Example 2

Independent Events (Eight-Sided Die)

Consider the experiment of rolling a fair eight-sided die with sample space S={1,2,3,4,5,6,7,8}{\displaystyle S=\{1,2,3,4,5,6,7,8\}}. Let event A represent the outcome being less than 5, so that A={1,2,3,4}{\displaystyle A=\{1,2,3,4\}}, and let event B represent the outcome being either 3, 4, 5, or 6, so that B={3,4,5,6}{\displaystyle B=\{3,4,5,6\}}. Initially, the probabilities of these events are P(A)=48=12{\displaystyle P(A)={\frac {4}{8}}={\frac {1}{2}}} and P(B)=48=12{\displaystyle P(B)={\frac {4}{8}}={\frac {1}{2}}}. The intersection of the two events is AB={3,4}{\displaystyle A\cap B=\{3,4\}}, and therefore P(AB)=28=14{\displaystyle P(A\cap B)={\frac {2}{8}}={\frac {1}{4}}}. Since P(A)P(B=12×12=14{\displaystyle P(A)P(B={\frac {1}{2}}\times {\frac {1}{2}}={\frac {1}{4}}}, we obtain P(AB)=P(A)P(B){\displaystyle P(A\cap B)=P(A)P(B)}, which confirms that events A and B are statistically independent.

Now suppose that an observer reveals that event (A) has occurred. This information reduces the effective sample space from S={1,2,3,4,5,6,7,8}{\displaystyle S=\{1,2,3,4,5,6,7,8\}} to A={1,2,3,4}{\displaystyle A=\{1,2,3,4\}}. Within this reduced sample space, the outcomes that also satisfy event B are AB={3,4}{\displaystyle A\cap B=\{3,4\}}. Consequently, the conditional probability of event B given that event A has occurred is P(BA)=P(AB)P(A)=1/41/2=12{\displaystyle P(B\mid A)={\frac {P(A\cap B)}{P(A)}}={\frac {1/4}{1/2}}={\frac {1}{2}}}. Notice that this conditional probability is equal to the original probability of event B, that is, P(BA)=P(B){\displaystyle P(B\mid A)=P(B)}. Therefore, learning that event A has occurred does not change the likelihood of event B. The information provided by event A has no effect on the uncertainty associated with event B, demonstrating the fundamental property of statistical independence: knowledge of one event does not alter the probability of the other event.

Interpretation

Statistical independence can therefore be interpreted as the absence of informational value between events. If knowledge of one event changes the probability of another event, the events are dependent. Conversely, if the probability remains unchanged after obtaining new information, the events are independent.

Formally, two events A and B are independent if and only if:

P(BA)=P(B),{\displaystyle P(B\mid A)=P(B),} which is equivalent to: P(AB)=P(A)P(B).{\displaystyle P(A\cap B)=P(A)P(B).}

In this sense, independence implies that observing one event provides no additional information about the occurrence of the other event.

Statistical independence

Events A and B are defined to be statistically independent if the probability of the intersection of A and B is equal to the product of the probabilities of A and B:

P(AB)=P(A)P(B).{\displaystyle P(A\cap B)=P(A)P(B).}

If P(B) is not zero, then this is equivalent to the statement that

P(AB)=P(A).{\displaystyle P(A\mid B)=P(A).}

Similarly, if P(A) is not zero, then

P(BA)=P(B){\displaystyle P(B\mid A)=P(B)}

is also equivalent. Although the derived forms may seem more intuitive, they are not the preferred definition as the conditional probabilities may be undefined, and the preferred definition is symmetrical in A and B. Independence does not refer to a disjoint event.[15]

It should also be noted that given the independent event pair [A,B] and an event C, the pair is defined to be conditionally independent if[16]

P(ABC)=P(AC)P(BC).{\displaystyle P(AB\mid C)=P(A\mid C)P(B\mid C).}

This theorem is useful in applications where multiple independent events are being observed.

Independent events vs. mutually exclusive events

Los conceptos de eventos mutuamente independientes y eventos mutuamente excluyentes son distintos e independientes. La siguiente tabla compara los resultados para ambos casos (siempre que la probabilidad del evento condicionante no sea cero).

De hecho, los eventos mutuamente excluyentes no pueden ser estadísticamente independientes (a menos que ambos sean imposibles), ya que saber que uno ocurre proporciona información sobre el otro (en particular, que este último ciertamente no ocurrirá).

Asociación independiente frente a asociación positiva frente a asociación negativa de eventos

falacias comunes

Estas falacias no deben confundirse con la "falacia condicional" de Robert K. Shope de 1978 , que trata sobre ejemplos contrafactuales que incurren en una petición de principio .

Suponiendo que la probabilidad condicional es de un tamaño similar a su inversa

Una visualización geométrica del teorema de Bayes. En la tabla, los valores 2, 3, 6 y 9 dan los pesos relativos de cada condición y caso correspondiente. Las figuras denotan las celdas de la tabla involucradas en cada métrica, siendo la probabilidad la fracción de cada figura que está sombreada. Esto muestra quePAG(AB)PAG(B)=PAG(BA)PAG(A){\displaystyle P(A\mid B)P(B)=P(B\mid A)P(A)}es decirPAG(AB)=PAG(BA)PAG(A)PAG(B){\displaystyle P(A\mid B)={\frac {P(B\mid A)P(A)}{P(B)}}}. Se puede utilizar un razonamiento similar para demostrar quePAG(A¯B)=PAG(BA¯)PAG(A¯)PAG(B){\displaystyle P({\bar {A}}\mid B)={\frac {P(B\mid {\bar {A}})P({\bar {A}})}{P(B)}}}etc.

En general, no se puede asumir que P ( A | B )  P ( B | A ). Esto puede ser un error insidioso, incluso para aquellos que están muy familiarizados con la estadística. [ 17 ] La relación entre P ( A | B ) y P ( B | A ) viene dada por el teorema de Bayes : 

PAG(BA)=PAG(AB)PAG(B)PAG(A)PAG(BA)PAG(AB)=PAG(B)PAG(A){\displaystyle {\begin{aligned}P(B\mid A)&={\frac {P(A\mid B)P(B)}{P(A)}}\\\Leftrightarrow {\frac {P(B\mid A)}{P(A\mid B)}}&={\frac {P(B)}{P(A)}}\end{aligned}}}

Es decir, P ( A | B )  P ( B | A ) solo si P ( B )/ P ( A ) ≈ 1, o equivalentemente, P ( A ) ≈ P ( B ).     

Suponiendo que las probabilidades marginales y condicionales son de tamaño similar.

En general, no se puede asumir que P ( A )  P ( A | B ). Estas probabilidades están vinculadas a través de la ley de la probabilidad total : 

PAG(A)=nortePAG(ABnorte)=nortePAG(ABnorte)PAG(Bnorte).{\displaystyle P(A)=\sum _{n}P(A\cap B_{n})=\sum _{n}P(A\mid B_{n})P(B_{n}).}

donde los eventos(Bnorte){\displaystyle (B_{n})}formar una partición contable deΩ{\displaystyle \Omega }.

Esta falacia puede surgir a través de un sesgo de selección . [ 18 ] Por ejemplo, en el contexto de una reclamación médica, sea S C el evento de que una secuela (enfermedad crónica) S ocurra como consecuencia de una circunstancia (afección aguda) C. Sea H el evento de que un individuo busque ayuda médica. Supongamos que en la mayoría de los casos, C no causa S (de modo que P ( S C ) es baja). Supongamos también que la atención médica solo se busca si S ha ocurrido debido a C. Por lo tanto, a partir de la experiencia de los pacientes, un médico puede concluir erróneamente que P ( S C ) es alta. La probabilidad real observada por el médico es P ( S C | H ).

Sobreponderar o infraponderar las probabilidades a priori

No tener en cuenta la probabilidad previa, ya sea parcial o totalmente, se denomina negligencia de la tasa base . Lo contrario, un ajuste insuficiente a partir de la probabilidad previa, se denomina conservadurismo .

Derivación formal

Formalmente, P ( A  | B ) se define como la probabilidad de A según una nueva función de probabilidad en el espacio muestral, de modo que los resultados que no están en B tienen probabilidad 0 y que es consistente con todas las medidas de probabilidad originales . [ 19 ] [ 20 ] 

Sea Ω un espacio muestral discreto con eventos elementales { ω }, y sea P la medida de probabilidad con respecto al σ-álgebra de Ω. Supongamos que se nos dice que ha ocurrido el evento B  ⊆ Ω. Se debe asignar  una nueva distribución de probabilidad (denotada por la notación condicional) a { ω } para reflejar esto. Todos los eventos que no están en B tendrán probabilidad nula en la nueva distribución. Para los eventos en B , deben cumplirse dos condiciones: la probabilidad de B es uno y las magnitudes relativas de las probabilidades deben conservarse. La primera es requerida por los axiomas de probabilidad , y la segunda se deriva del hecho de que la nueva medida de probabilidad debe ser el análogo de P en el que la probabilidad de B es uno; por lo tanto, todo evento que no está en B tiene una probabilidad nula. Por consiguiente, para algún factor de escala α , la nueva distribución debe satisfacer:

  1. ωB:PAG(ωB)=αPAG(ω){\displaystyle \omega \in B:P(\omega \mid B)=\alpha P(\omega )}
  2. ωB:PAG(ωB)=0{\displaystyle \omega \notin B:P(\omega \mid B)=0}
  3. ωΩPAG(ωB)=1.{\displaystyle \sum _{\omega \in \Omega }{P(\omega \mid B)}=1.}

Sustituyendo 1 y 2 en 3 para seleccionar α :

1=ωΩPAG(ωB)=ωBPAG(ωB)+ωBPAG(ωB)0=αωBPAG(ω)=αPAG(B)α=1PAG(B){\displaystyle {\begin{aligned}1&=\sum _{\omega \in \Omega }{P(\omega \mid B)}\\&=\sum _{\omega \in B}{P(\omega \mid B)}+{\cancelto {0}{\sum _{\omega \notin B}P(\omega \mid B)}}\\&=\alpha \sum _{\omega \in B}{P(\omega )}\\[5pt]&=\alpha \cdot P(B)\\[5pt]\Rightarrow \alpha &={\frac {1}{P(B)}}\end{aligned}}}

Entonces, la nueva distribución de probabilidad es

  1. ωB:PAG(ωB)=PAG(ω)PAG(B){\displaystyle \omega \in B:P(\omega \mid B)={\frac {P(\omega )}{P(B)}}}
  2. ωB:PAG(ωB)=0{\displaystyle \omega \notin B:P(\omega \mid B)=0}

Ahora, para un evento general A ,

PAG(AB)=ωABPAG(ωB)+ωABdoPAG(ωB)0=ωABPAG(ω)PAG(B)=PAG(AB)PAG(B){\displaystyle {\begin{aligned}P(A\mid B)&=\sum _{\omega \in A\cap B}{P(\omega \mid B)}+{\cancelto {0}{\sum _{\omega \in A\cap B^{c}}P(\omega \mid B)}}\\&=\sum _{\omega \in A\cap B}{\frac {P(\omega )}{P(B)}}\\[5pt]&={\frac {P(A\cap B)}{P(B)}}\end{aligned}}}

Véase también

Referencias

  1. 1 2 Gut, Allan (2013). Probabilidad: Un curso de posgrado (Segunda  edición). Nueva York, NY: Springer. ISBN 978-1-4614-4707-8.
  2. 1 2 "Probabilidad condicional" . www.mathsisfun.com . Consultado el 11 de septiembre de 2020 .
  3. ^ Dekking, Frederik Michel; Kraaikamp, ​​Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). "Una introducción moderna a la probabilidad y la estadística" . Textos de Springer en estadística : 26. doi : 10.1007/1-84628-168-7 . ISBN 978-1-85233-896-1ISSN 1431-875X 
  4. ^ Dekking, Frederik Michel; Kraaikamp, ​​Cornelis; Lopuhaä, Hendrik Paul; Meester, Ludolf Erwin (2005). "Una introducción moderna a la probabilidad y la estadística" . Textos de Springer en estadística : 25– 40. doi : 10.1007/1-84628-168-7 . ISBN 978-1-85233-896-1ISSN 1431-875X 
  5. Reichl, Linda Elizabeth (2016). "2.3 Probabilidad". Un curso moderno de física estadística (4.ª ed. revisada y actualizada). WILEY-VCH. ISBN  978-3-527-69049-7.
  6. Kolmogorov, Andrey (1956), Fundamentos de la teoría de la probabilidad , Chelsea
  7. "Probabilidad condicional" . www.stat.yale.edu . Consultado el 11 de septiembre de 2020 .
  8. Flaminio, Tommaso; Godo, Lluis; Hosni, Hykel (2020-09-01). "Álgebras booleanas de condicionales, probabilidad y lógica" . Inteligencia Artificial . 286 103347. arXiv : 2006.04673 . doi : 10.1016/j.artint.2020.103347 . ISSN 0004-3702 . S2CID 214584872 .  
  9. Van Fraassen, Bas C. (1976), "Probabilidades de condicionales" , en Harper, William L.; Hooker, Clifford Alan (eds.), Fundamentos de la teoría de la probabilidad, inferencia estadística y teorías estadísticas de la ciencia: Volumen I Fundamentos y filosofía de las aplicaciones epistémicas de la teoría de la probabilidad , The University of Western Ontario Series in Philosophy of Science, Dordrecht: Springer Netherlands, pp. 261–308 , doi : 10.1007/978-94-010-1853-1_10 , ISBN  978-94-010-1853-1, consultado el 4 de diciembre de 2021
  10. 1 2 3 Draheim, Dirk (2017). "Condicionalización de Jeffrey generalizada (una semántica frecuentista de la condicionalización parcial)" . Springer . Recuperado el 19 de diciembre de 2017 .
  11. Jeffrey, Richard C. (1983), La lógica de la decisión (2.ª ed.), University of Chicago Press, ISBN  9780226395821
  12. "Epistemología bayesiana" . Enciclopedia de filosofía de Stanford. 2017. Consultado el 29 de diciembre de 2017 .
  13. Casella, George ; Berger, Roger L. (2002). Inferencia estadística . Duxbury Press. ISBN 0-534-24312-6.
  14. "Probabilidad condicional e independencia" (PDF) . Consultado el 22 de diciembre de 2021 .
  15. Tijms, Henk (2012). Comprensión de la probabilidad (3.ª ed.). Cambridge: Cambridge University Press. doi : 10.1017/cbo9781139206990 . ISBN  978-1-107-65856-1.
  16. Pfeiffer, Paul E. (1978). Independencia condicional en probabilidad aplicada . Boston, MA: Birkhäuser Boston. ISBN 978-1-4612-6335-7OCLC 858880328 .​ 
  17. ^ Paulos, JA (1988). Analfabetismo: analfabetismo matemático y sus consecuencias . Hill y Wang. pag. 63 y siguientes . ISBN 0-8090-7447-8.
  18. ^ Bruss, F. Thomas (2007). "Der Wyatt-Earp-Effekt oder die betörende Macht kleiner Wahrscheinlichkeiten". Spektrum der Wissenschaft (en alemán). 2 : 110-113 .
  19. George Casella y Roger L. Berger (1990), Inferencia estadística , Duxbury Press, ISBN 0-534-11958-1(pág. 18 y siguientes )
  20. Introducción a la probabilidad de Grinstead y Snell , pág. 134