Articulo de referencia

Regla de la cadena (probabilidad)

En teoría de la probabilidad , la regla de la cadena [1] (también llamada regla general del producto [2] [3] ) describe cómo calcular la probabilidad de la intersección de event...

En teoría de la probabilidad , la regla de la cadena [1] (también llamada regla general del producto [2] [3] ) describe cómo calcular la probabilidad de la intersección de eventos no necesariamente independientes o la distribución conjunta de variables aleatorias respectivamente, utilizando probabilidades condicionales . Esta regla permite expresar una probabilidad conjunta en términos de probabilidades condicionales únicamente. [4] La regla se utiliza notablemente en el contexto de procesos estocásticos discretos y en aplicaciones, por ejemplo, el estudio de redes bayesianas , que describen una distribución de probabilidad en términos de probabilidades condicionales.

Regla de la cadena para eventos

Dos eventos

Para dos eventos y , la regla de la cadena establece que A {\estilo de visualización A} B {\estilo de visualización B}

PAG ( A B ) = PAG ( B A ) PAG ( A ) {\displaystyle \mathbb {P} (A\cap B)=\mathbb {P} (B\mid A)\mathbb {P} (A)} ,

donde denota la probabilidad condicional de un valor dado . PAG ( B A ) {\displaystyle \mathbb {P} (B\mid A)} B {\estilo de visualización B} A {\estilo de visualización A}

Ejemplo

Una urna A tiene 1 bola negra y 2 bolas blancas y otra urna B tiene 1 bola negra y 3 bolas blancas. Supongamos que elegimos una urna al azar y luego seleccionamos una bola de esa urna. Sea evento elegir la primera urna, es decir , donde es el evento complementario de . Sea evento la probabilidad de que elijamos una bola blanca. La probabilidad de elegir una bola blanca, dado que hemos elegido la primera urna, es La intersección describe entonces la elección de la primera urna y una bola blanca de ella. La probabilidad se puede calcular mediante la regla de la cadena de la siguiente manera: A {\estilo de visualización A} PAG ( A ) = PAG ( A ¯ ) = 1 / 2 {\displaystyle \mathbb {P}(A)=\mathbb {P}({\overline {A}})=1/2} A ¯ {\displaystyle {\overline {A}}} A {\estilo de visualización A} B {\estilo de visualización B} PAG ( B | A ) = 2 / 3. {\displaystyle \mathbb {P} (B|A)=2/3.} A B {\displaystyle A\cap B}

P ( A B ) = P ( B A ) P ( A ) = 2 3 1 2 = 1 3 . {\displaystyle \mathbb {P} (A\cap B)=\mathbb {P} (B\mid A)\mathbb {P} (A)={\frac {2}{3}}\cdot {\frac {1}{2}}={\frac {1}{3}}.}

Un número finito de eventos

Para los eventos cuya intersección no tiene probabilidad cero, la regla de la cadena establece A 1 , , A n {\displaystyle A_{1},\ldots ,A_{n}}

P ( A 1 A 2 A n ) = P ( A n A 1 A n 1 ) P ( A 1 A n 1 ) = P ( A n A 1 A n 1 ) P ( A n 1 A 1 A n 2 ) P ( A 1 A n 2 ) = P ( A n A 1 A n 1 ) P ( A n 1 A 1 A n 2 ) P ( A 3 A 1 A 2 ) P ( A 2 A 1 ) P ( A 1 ) = P ( A 1 ) P ( A 2 A 1 ) P ( A 3 A 1 A 2 ) P ( A n A 1 A n 1 ) = k = 1 n P ( A k A 1 A k 1 ) = k = 1 n P ( A k | j = 1 k 1 A j ) . {\displaystyle {\begin{aligned}\mathbb {P} \left(A_{1}\cap A_{2}\cap \ldots \cap A_{n}\right)&=\mathbb {P} \left(A_{n}\mid A_{1}\cap \ldots \cap A_{n-1}\right)\mathbb {P} \left(A_{1}\cap \ldots \cap A_{n-1}\right)\\&=\mathbb {P} \left(A_{n}\mid A_{1}\cap \ldots \cap A_{n-1}\right)\mathbb {P} \left(A_{n-1}\mid A_{1}\cap \ldots \cap A_{n-2}\right)\mathbb {P} \left(A_{1}\cap \ldots \cap A_{n-2}\right)\\&=\mathbb {P} \left(A_{n}\mid A_{1}\cap \ldots \cap A_{n-1}\right)\mathbb {P} \left(A_{n-1}\mid A_{1}\cap \ldots \cap A_{n-2}\right)\cdot \ldots \cdot \mathbb {P} (A_{3}\mid A_{1}\cap A_{2})\mathbb {P} (A_{2}\mid A_{1})\mathbb {P} (A_{1})\\&=\mathbb {P} (A_{1})\mathbb {P} (A_{2}\mid A_{1})\mathbb {P} (A_{3}\mid A_{1}\cap A_{2})\cdot \ldots \cdot \mathbb {P} (A_{n}\mid A_{1}\cap \dots \cap A_{n-1})\\&=\prod _{k=1}^{n}\mathbb {P} (A_{k}\mid A_{1}\cap \dots \cap A_{k-1})\\&=\prod _{k=1}^{n}\mathbb {P} \left(A_{k}\,{\Bigg |}\,\bigcap _{j=1}^{k-1}A_{j}\right).\end{aligned}}}

Ejemplo 1

Para , es decir, cuatro eventos, la regla de la cadena dice n = 4 {\displaystyle n=4}

P ( A 1 A 2 A 3 A 4 ) = P ( A 4 A 3 A 2 A 1 ) P ( A 3 A 2 A 1 ) = P ( A 4 A 3 A 2 A 1 ) P ( A 3 A 2 A 1 ) P ( A 2 A 1 ) = P ( A 4 A 3 A 2 A 1 ) P ( A 3 A 2 A 1 ) P ( A 2 A 1 ) P ( A 1 ) {\displaystyle {\begin{aligned}\mathbb {P} (A_{1}\cap A_{2}\cap A_{3}\cap A_{4})&=\mathbb {P} (A_{4}\mid A_{3}\cap A_{2}\cap A_{1})\mathbb {P} (A_{3}\cap A_{2}\cap A_{1})\\&=\mathbb {P} (A_{4}\mid A_{3}\cap A_{2}\cap A_{1})\mathbb {P} (A_{3}\mid A_{2}\cap A_{1})\mathbb {P} (A_{2}\cap A_{1})\\&=\mathbb {P} (A_{4}\mid A_{3}\cap A_{2}\cap A_{1})\mathbb {P} (A_{3}\mid A_{2}\cap A_{1})\mathbb {P} (A_{2}\mid A_{1})\mathbb {P} (A_{1})\end{aligned}}} .

Ejemplo 2

Extraemos al azar 4 cartas sin reposición de una baraja de 52 cartas. ¿Cuál es la probabilidad de que hayamos sacado 4 ases?

Primero, establecemos . Obviamente, obtenemos las siguientes probabilidades A n := { draw an ace in the  n th  try } {\textstyle A_{n}:=\left\{{\text{draw an ace in the }}n^{\text{th}}{\text{ try}}\right\}}

P ( A 1 ) = 4 52 , P ( A 2 A 1 ) = 3 51 , P ( A 3 A 1 A 2 ) = 2 50 , P ( A 4 A 1 A 2 A 3 ) = 1 49 {\displaystyle \mathbb {P} (A_{1})={\frac {4}{52}},\qquad \mathbb {P} (A_{2}\mid A_{1})={\frac {3}{51}},\qquad \mathbb {P} (A_{3}\mid A_{1}\cap A_{2})={\frac {2}{50}},\qquad \mathbb {P} (A_{4}\mid A_{1}\cap A_{2}\cap A_{3})={\frac {1}{49}}} .

Aplicando la regla de la cadena,

P ( A 1 A 2 A 3 A 4 ) = 4 52 3 51 2 50 1 49 {\displaystyle \mathbb {P} (A_{1}\cap A_{2}\cap A_{3}\cap A_{4})={\frac {4}{52}}\cdot {\frac {3}{51}}\cdot {\frac {2}{50}}\cdot {\frac {1}{49}}} .

Enunciado del teorema y demostración

Sea un espacio de probabilidad. Recordemos que la probabilidad condicional de un dato se define como ( Ω , A , P ) {\displaystyle (\Omega ,{\mathcal {A}},\mathbb {P} )} A A {\displaystyle A\in {\mathcal {A}}} B A {\displaystyle B\in {\mathcal {A}}}

P ( A B ) := { P ( A B ) P ( B ) , P ( B ) > 0 , 0 P ( B ) = 0. {\displaystyle {\begin{aligned}\mathbb {P} (A\mid B):={\begin{cases}{\frac {\mathbb {P} (A\cap B)}{\mathbb {P} (B)}},&\mathbb {P} (B)>0,\\0&\mathbb {P} (B)=0.\end{cases}}\end{aligned}}}

Entonces tenemos el siguiente teorema.

Regla de la cadena  :  Sea un espacio de probabilidad. Sea . Entonces ( Ω , A , P ) {\displaystyle (\Omega ,{\mathcal {A}},\mathbb {P} )} A 1 , . . . , A n A {\displaystyle A_{1},...,A_{n}\in {\mathcal {A}}}

P ( A 1 A 2 A n ) = P ( A 1 ) P ( A 2 A 1 ) P ( A 3 A 1 A 2 ) P ( A n A 1 A n 1 ) = P ( A 1 ) j = 2 n P ( A j A 1 A j 1 ) . {\displaystyle {\begin{aligned}\mathbb {P} \left(A_{1}\cap A_{2}\cap \ldots \cap A_{n}\right)&=\mathbb {P} (A_{1})\mathbb {P} (A_{2}\mid A_{1})\mathbb {P} (A_{3}\mid A_{1}\cap A_{2})\cdot \ldots \cdot \mathbb {P} (A_{n}\mid A_{1}\cap \dots \cap A_{n-1})\\&=\mathbb {P} (A_{1})\prod _{j=2}^{n}\mathbb {P} (A_{j}\mid A_{1}\cap \dots \cap A_{j-1}).\end{aligned}}}
Prueba

La fórmula se deduce inmediatamente por recursión.

( 1 ) P ( A 1 ) P ( A 2 A 1 ) = P ( A 1 A 2 ) ( 2 ) P ( A 1 ) P ( A 2 A 1 ) P ( A 3 A 1 A 2 ) = P ( A 1 A 2 ) P ( A 3 A 1 A 2 ) = P ( A 1 A 2 A 3 ) , {\displaystyle {\begin{aligned}(1)&&&\mathbb {P} (A_{1})\mathbb {P} (A_{2}\mid A_{1})&=&\qquad \mathbb {P} (A_{1}\cap A_{2})\\(2)&&&\mathbb {P} (A_{1})\mathbb {P} (A_{2}\mid A_{1})\mathbb {P} (A_{3}\mid A_{1}\cap A_{2})&=&\qquad \mathbb {P} (A_{1}\cap A_{2})\mathbb {P} (A_{3}\mid A_{1}\cap A_{2})\\&&&&=&\qquad \mathbb {P} (A_{1}\cap A_{2}\cap A_{3}),\end{aligned}}}

donde utilizamos la definición de la probabilidad condicional en el primer paso.

Regla de la cadena para variables aleatorias discretas

Dos variables aleatorias

Para dos variables aleatorias discretas , utilizamos los eventos y en la definición anterior, y encontramos la distribución conjunta como X , Y {\displaystyle X,Y} A := { X = x } {\displaystyle A:=\{X=x\}} B := { Y = y } {\displaystyle B:=\{Y=y\}}

P ( X = x , Y = y ) = P ( X = x Y = y ) P ( Y = y ) , {\displaystyle \mathbb {P} (X=x,Y=y)=\mathbb {P} (X=x\mid Y=y)\mathbb {P} (Y=y),}

o

P ( X , Y ) ( x , y ) = P X Y ( x y ) P Y ( y ) , {\displaystyle \mathbb {P} _{(X,Y)}(x,y)=\mathbb {P} _{X\mid Y}(x\mid y)\mathbb {P} _{Y}(y),}

¿Dónde está la distribución de probabilidad de y la distribución de probabilidad condicional de dada ? P X ( x ) := P ( X = x ) {\displaystyle \mathbb {P} _{X}(x):=\mathbb {P} (X=x)} X {\displaystyle X} P X Y ( x y ) {\displaystyle \mathbb {P} _{X\mid Y}(x\mid y)} X {\displaystyle X} Y {\displaystyle Y}

Un número finito de variables aleatorias

Sean variables aleatorias y . Por la definición de probabilidad condicional, X 1 , , X n {\displaystyle X_{1},\ldots ,X_{n}} x 1 , , x n R {\displaystyle x_{1},\dots ,x_{n}\in \mathbb {R} }

P ( X n = x n , , X 1 = x 1 ) = P ( X n = x n | X n 1 = x n 1 , , X 1 = x 1 ) P ( X n 1 = x n 1 , , X 1 = x 1 ) {\displaystyle \mathbb {P} \left(X_{n}=x_{n},\ldots ,X_{1}=x_{1}\right)=\mathbb {P} \left(X_{n}=x_{n}|X_{n-1}=x_{n-1},\ldots ,X_{1}=x_{1}\right)\mathbb {P} \left(X_{n-1}=x_{n-1},\ldots ,X_{1}=x_{1}\right)}

y usando la regla de la cadena, donde establecemos , podemos encontrar la distribución conjunta como A k := { X k = x k } {\displaystyle A_{k}:=\{X_{k}=x_{k}\}}

P ( X 1 = x 1 , X n = x n ) = P ( X 1 = x 1 X 2 = x 2 , , X n = x n ) P ( X 2 = x 2 , , X n = x n ) = P ( X 1 = x 1 ) P ( X 2 = x 2 X 1 = x 1 ) P ( X 3 = x 3 X 1 = x 1 , X 2 = x 2 ) P ( X n = x n X 1 = x 1 , , X n 1 = x n 1 ) {\displaystyle {\begin{aligned}\mathbb {P} \left(X_{1}=x_{1},\ldots X_{n}=x_{n}\right)&=\mathbb {P} \left(X_{1}=x_{1}\mid X_{2}=x_{2},\ldots ,X_{n}=x_{n}\right)\mathbb {P} \left(X_{2}=x_{2},\ldots ,X_{n}=x_{n}\right)\\&=\mathbb {P} (X_{1}=x_{1})\mathbb {P} (X_{2}=x_{2}\mid X_{1}=x_{1})\mathbb {P} (X_{3}=x_{3}\mid X_{1}=x_{1},X_{2}=x_{2})\cdot \ldots \\&\qquad \cdot \mathbb {P} (X_{n}=x_{n}\mid X_{1}=x_{1},\dots ,X_{n-1}=x_{n-1})\\\end{aligned}}}

Ejemplo

Para , es decir, considerando tres variables aleatorias, entonces la regla de la cadena dice n = 3 {\displaystyle n=3}

P ( X 1 , X 2 , X 3 ) ( x 1 , x 2 , x 3 ) = P ( X 1 = x 1 , X 2 = x 2 , X 3 = x 3 ) = P ( X 3 = x 3 X 2 = x 2 , X 1 = x 1 ) P ( X 2 = x 2 , X 1 = x 1 ) = P ( X 3 = x 3 X 2 = x 2 , X 1 = x 1 ) P ( X 2 = x 2 X 1 = x 1 ) P ( X 1 = x 1 ) = P X 3 X 2 , X 1 ( x 3 x 2 , x 1 ) P X 2 X 1 ( x 2 x 1 ) P X 1 ( x 1 ) . {\displaystyle {\begin{aligned}\mathbb {P} _{(X_{1},X_{2},X_{3})}(x_{1},x_{2},x_{3})&=\mathbb {P} (X_{1}=x_{1},X_{2}=x_{2},X_{3}=x_{3})\\&=\mathbb {P} (X_{3}=x_{3}\mid X_{2}=x_{2},X_{1}=x_{1})\mathbb {P} (X_{2}=x_{2},X_{1}=x_{1})\\&=\mathbb {P} (X_{3}=x_{3}\mid X_{2}=x_{2},X_{1}=x_{1})\mathbb {P} (X_{2}=x_{2}\mid X_{1}=x_{1})\mathbb {P} (X_{1}=x_{1})\\&=\mathbb {P} _{X_{3}\mid X_{2},X_{1}}(x_{3}\mid x_{2},x_{1})\mathbb {P} _{X_{2}\mid X_{1}}(x_{2}\mid x_{1})\mathbb {P} _{X_{1}}(x_{1}).\end{aligned}}}

Bibliografía

  • René L. Schilling (2021), Medida, integral, probabilidad y procesos: Proba(lísticamente) el mínimo teórico (1.ª ed.), Technische Universität Dresden, Alemania, ISBN 979-8-5991-0488-9{{citation}}: CS1 maint: location missing publisher (link)
  • William Feller (1968), Introducción a la teoría de la probabilidad y sus aplicaciones , vol. I (3.ª ed.), Nueva York/Londres/Sydney: Wiley, ISBN 978-0-471-25708-0
  • Russell, Stuart J. ; Norvig, Peter (2003), Inteligencia artificial: un enfoque moderno (2.ª ed.), Upper Saddle River, Nueva Jersey: Prentice Hall, ISBN 0-13-790395-2, pág. 496.

Referencias

  1. ^ Schilling, René L. (2021). Medida, integral, probabilidad y procesos: Probabilidad(ilística)mente el mínimo teórico . Technische Universität Dresden, Alemania. pág. 136ff. ISBN 979-8-5991-0488-9.{{cite book}}: CS1 maint: location missing publisher (link)
  2. ^ Schum, David A. (1994). Fundamentos evidenciales del razonamiento probabilístico . Northwestern University Press. pág. 49. ISBN 978-0-8101-1821-8.
  3. ^ Klugh, Henry E. (2013). Estadísticas: elementos esenciales para la investigación (3.ª ed.). Psychology Press. pág. 149. ISBN 978-1-134-92862-0.
  4. ^ Virtud, Pat. "10-606: Fundamentos matemáticos para el aprendizaje automático" (PDF) .
Retrieved from "https://en.wikipedia.org/w/index.php?title=Chain_rule_(probability)&oldid=1228720091"