Articulo de referencia

Distribución hipergeométrica

\\mathrm{Hypergeometric}(N,K,n) "},"parameters":{"wt":" \\begin{align}N&\\in \\left\\{0,1,2,\\dots\\right\\} \\\\\n K&\\in \\left\\{0,1,2,\\dots,N\\right\\} \\\\\n n&\\in \\left...

En teoría de la probabilidad y estadística , la distribución hipergeométrica es una distribución de probabilidad discreta que describe la probabilidad dek{\displaystyle k}éxitos (extracciones aleatorias en las que el objeto extraído tiene una característica específica) ennorte{\displaystyle n}extrae, sin reemplazo, de una población finita de tamañonorte{\displaystyle N}que contiene exactamenteK{\displaystyle K}objetos con esa característica, donde en cada extracción hay un éxito o un fracaso. En contraste, la distribución binomial describe la probabilidad dek{\displaystyle k}éxitos ennorte{\displaystyle n}empata con reemplazo.

Definiciones

Función de masa de probabilidad

Las siguientes condiciones caracterizan la distribución hipergeométrica:

  • El resultado de cada extracción (los elementos de la población muestreada) se puede clasificar en una de dos categorías mutuamente excluyentes (por ejemplo, Aprobado/Reprobado o Empleado/Desempleado).
  • La probabilidad de éxito cambia en cada extracción, ya que cada extracción disminuye la población ( muestreo sin reemplazo de una población finita).

Una variable aleatoriaincógnita{\displaystyle X}sigue la distribución hipergeométrica si su función de masa de probabilidad (pmf) está dada por [ 2 ].

pagincógnita(k)=Pr(incógnita=k)=(Kk)(norteKnortek)(nortenorte),{\displaystyle p_{X}(k)=\Pr(X=k)={\frac {{\binom {K}{k}}{\binom {NK}{nk}}}{\binom {N}{n}}},}

dónde

  • norte{\displaystyle N}es el tamaño de la población,
  • K{\displaystyle K}es el número de estados de éxito en la población,
  • norte{\displaystyle n}es el número de extracciones (es decir, la cantidad extraída en cada prueba),
  • k{\displaystyle k}es el número de éxitos observados,
  • (ab){\textstyle \textstyle {a \elegir b}}es un coeficiente binomial .

La fuerza de probabilidad es positiva cuandomáximo(0,norte+Knorte)kmin(K,norte){\displaystyle \max(0,n+KN)\leq k\leq \min(K,n)}.

Una variable aleatoria distribuida hipergeométricamente con parámetrosnorte{\displaystyle N},K{\displaystyle K}ynorte{\displaystyle n}está escritoincógnitaHipergeométrica(norte,K,norte){\textstyle X\sim \operatorname {Hipergeométrico} (N,K,n)}y tiene función de masa de probabilidadpagincógnita(k){\textstyle p_{X}(k)}arriba.

Identidades combinatorias

Según lo requerido, tenemos

0kmin(norte,K)(Kk)(norteKnortek)(nortenorte)=1,{\displaystyle \sum _{0\leq k\leq {\textrm {min}}(n,K)}{{K \choose k}{NK \choose nk} \over {N \choose n}}=1,}

lo cual se deduce esencialmente de la identidad de Vandermonde en combinatoria .

Tenga en cuenta también que

(Kk)(norteKnortek)(nortenorte)=(nortek)(nortenorteKk)(norteK);{\displaystyle {{K \choose k}{NK \choose nk} \over {N \choose n}}={{{n \choose k}{{Nn} \choose {Kk}}} \over {N \choose K}};}

Esta identidad se puede demostrar expresando los coeficientes binomiales en términos de factoriales y reordenando estos últimos. Además, se deduce de la simetría del problema, descrita de dos maneras diferentes pero intercambiables.

Por ejemplo, consideremos dos rondas de sorteo sin reemplazo. En la primera ronda,K{\displaystyle K}fuera denorte{\displaystyle N}Se extraen canicas neutras de una urna sin reemplazo y se tiñen de verde. Luego se vuelven a colocar las canicas de color. En la segunda ronda,norte{\displaystyle n}Se extraen canicas sin reemplazo y se colorean de rojo. Luego, el número de canicas con ambos colores (es decir, el número de canicas que se han extraído dos veces) tiene la distribución hipergeométrica. La simetría enK{\displaystyle K}ynorte{\displaystyle n}Esto se debe a que las dos rondas son independientes, y uno podría haber comenzado dibujandonorte{\displaystyle n}bolas y pintándolas de rojo primero.

Tenga en cuenta que estamos interesados ​​en la probabilidad dek{\displaystyle k}éxitos ennorte{\displaystyle n}extracciones sin reemplazo , ya que la probabilidad de éxito en cada ensayo no es la misma, puesto que el tamaño de la población restante cambia a medida que retiramos cada canica. Tenga en cuenta no confundir con la distribución binomial , que describe la probabilidad dek{\displaystyle k}éxitos ennorte{\displaystyle n}empata con reemplazo.

Propiedades

Ejemplo práctico

La aplicación clásica de la distribución hipergeométrica es el muestreo sin reemplazo . Imaginemos una urna con dos colores de canicas : roja y verde. Definimos extraer una canica verde como un éxito y extraer una canica roja como un fracaso. Sea N el número total de canicas en la urna (véase la tabla de contingencia a continuación) y K el número de canicas verdes ; entonces, N K corresponde al número de canicas rojas . Ahora, de pie junto a la urna, cerramos los ojos y extraemos n canicas sin reemplazo. Definimos X como una variable aleatoria cuyo resultado es k , el número de canicas verdes extraídas en el experimento. Esta situación se ilustra en la siguiente tabla de contingencia : 

En efecto, nos interesa calcular la probabilidad de extraer k canicas verdes en n extracciones, dado que hay K canicas verdes de un total de N canicas. Para este ejemplo, supongamos que hay 5 canicas verdes y 45 rojas en la urna. De pie junto a la urna, cierras los ojos y extraes 10 canicas sin reemplazo. ¿Cuál es la probabilidad de que exactamente 4 de las 10 sean verdes?

Este problema se resume en la siguiente tabla de contingencia:

Para hallar la probabilidad de extraer k canicas verdes en exactamente n extracciones de un total de N extracciones , identificamos X como una variable aleatoria hipergeométrica para usar la fórmula

PAG(incógnita=k)=F(k;norte,K,norte)=(Kk)(norteKnortek)(nortenorte).{\displaystyle P(X=k)=f(k;N,K,n)={{{K \choose k}{{NK} \choose {nk}}} \over {N \choose n}}.}

Para explicar intuitivamente la fórmula dada, consideremos los dos problemas simétricos representados por la identidad.

(Kk)(norteKnortek)(nortenorte)=(nortek)(nortenorteKk)(norteK){\displaystyle {{K \choose k}{NK \choose nk} \over {N \choose n}}={{{n \choose k}{{Nn} \choose {Kk}}} \over {N \choose K}}}

  1. Lado izquierdo: extraer un total de solo n canicas de la urna. Queremos hallar la probabilidad de extraer k canicas verdes de un total de K canicas verdes, y extraer nk canicas rojas de NK canicas rojas, en estas n rondas.
  2. lado derecho - alternativamente, extraer las N canicas de la urna. Queremos hallar la probabilidad de extraer k canicas verdes en n extracciones de un total de N extracciones, y Kk canicas verdes en las Nn extracciones restantes.

Volviendo a los cálculos, usamos la fórmula anterior para calcular la probabilidad de sacar exactamente k canicas verdes.

PAG(incógnita=4)=F(4;50,5,10)=(54)(456)(5010)=5814506010272278170=0,003964583.{\displaystyle P(X=4)=f(4;50,5,10)={{{5 \choose 4}{{45} \choose {6}}} \over {50 \choose 10}}={5\cdot 8145060 \over 10272278170}=0.003964583\dots .}

Intuitivamente, cabría esperar que fuera aún más improbable que las 5 canicas verdes estuvieran entre las 10 extraídas.

PAG(incógnita=5)=F(5;50,5,10)=(55)(455)(5010)=1122175910272278170=0,0001189375,{\displaystyle P(X=5)=f(5;50,5,10)={{{5 \choose 5}{{45} \choose {5}}} \over {50 \choose 10}}={1\cdot 1221759 \over 10272278170}=0.0001189375\dots ,}

Como era de esperar, la probabilidad de sacar 5 canicas verdes es aproximadamente 35 veces menor que la de sacar 4.

Simetrías

Intercambiar los roles de las canicas verdes y rojas:

F(k;norte,K,norte)=F(nortek;norte,norteK,norte){\displaystyle f(k;N,K,n)=f(nk;N,NK,n)}

Intercambiar los roles de las canicas extraídas y no extraídas:

F(k;norte,K,norte)=F(Kk;norte,K,nortenorte){\displaystyle f(k;N,K,n)=f(Kk;N,K,Nn)}

Intercambiar los roles de las canicas verdes y las dibujadas:

F(k;norte,K,norte)=F(k;norte,norte,K){\displaystyle f(k;N,K,n)=f(k;N,n,K)}

Estas simetrías generan el grupo diedral.D4{\displaystyle D_{4}}.

Orden de los sorteos

La probabilidad de extraer cualquier conjunto de canicas verdes y rojas (la distribución hipergeométrica) depende únicamente de la cantidad de canicas verdes y rojas, no del orden en que aparecen; es decir, es una distribución intercambiable . Como resultado, la probabilidad de extraer una canica verde en eliel{\displaystyle i^{\text{th}}}El sorteo es [ 3 ]

PAG(GRAMOi)=Knorte.{\displaystyle P(G_{i})={\frac {K}{N}}.}

Se trata de una probabilidad ex ante , es decir, se basa en desconocer los resultados de los sorteos anteriores.

límites de cola

DejarincógnitaHipergeométrica(norte,K,norte){\displaystyle X\sim \operatorname {Hipergeométrica} (N,K,n)}ypag=K/norte{\displaystyle p=K/N}. Luego para0<t<K/norte{\displaystyle 0<t<K/N}Podemos derivar los siguientes límites: [ 4 ]

Pr[incógnita(pagt)norte]minorteD(pagtpag)mi2t2nortePr[incógnita(pag+t)norte]minorteD(pag+tpag)mi2t2norte{\displaystyle {\begin{aligned}\Pr[X\leq (p-t)n]&\leq e^{-n{\text{D}}(p-t\parallel p)}\leq e^{-2t^{2}n}\\\Pr[X\geq (p+t)n]&\leq e^{-n{\text{D}}(p+t\parallel p)}\leq e^{-2t^{2}n}\\\end{aligned}}\!}

dónde

D(ab)=aregistroab+(1a)registro1a1b{\displaystyle D(a\parallel b)=a\log {\frac {a}{b}}+(1-a)\log {\frac {1-a}{1-b}}}

es la divergencia de Kullback-Leibler y se utiliza queD(ab)2(ab)2{\displaystyle D(a\parallel b)\geq 2(a-b)^{2}}. [ 5 ]

Nota : Para derivar los límites anteriores, hay que empezar observando queincógnita=i=1norteYinorte{\displaystyle X={\frac {\sum _{i=1}^{n}Y_{i}}{n}}}dóndeYi{\displaystyle Y_{i}}son variables aleatorias dependientes con una distribución específicaD{\displaystyle D}Dado que la mayoría de los teoremas sobre límites en la suma de variables aleatorias se refieren a secuencias independientes de las mismas, primero hay que crear una secuencia.Zi{\displaystyle Z_{i}}de variables aleatorias independientes con la misma distribuciónD{\displaystyle D}y aplicar los teoremas enincógnita=i=1norteZinorte{\displaystyle X'={\frac {\sum _{i=1}^{n}Z_{i}}{n}}}. Luego, se demuestra a partir de Hoeffding [ 4 ] que los resultados y límites obtenidos a través de este proceso se mantienen paraincógnita{\displaystyle X}también.

Si n es mayor que N /2, puede ser útil aplicar simetría para "invertir" los límites, lo que da como resultado lo siguiente: [ 5 ] [ 6 ]

Pr[incógnita(pagt)norte]mi(nortenorte)D(pag+tnortenortenorte||pag)mi2t2nortenortenortenortePr[incógnita(pag+t)norte]mi(nortenorte)D(pagtnortenortenorte||pag)mi2t2nortenortenortenorte{\displaystyle {\begin{aligned}\Pr[X\leq (p-t)n]&\leq e^{-(N-n){\text{D}}(p+{\tfrac {tn}{N-n}}||p)}\leq e^{-2t^{2}n{\tfrac {n}{N-n}}}\\\\\Pr[X\geq (p+t)n]&\leq e^{-(N-n){\text{D}}(p-{\tfrac {tn}{N-n}}||p)}\leq e^{-2t^{2}n{\tfrac {n}{N-n}}}\\\end{aligned}}\!}

Inferencia estadística

Prueba hipergeométrica

La prueba hipergeométrica utiliza la distribución hipergeométrica para medir la significación estadística de haber extraído una muestra que consta de un número específico dek{\displaystyle k}éxitos (denorte{\displaystyle n}extracciones totales) de una población de tamañonorte{\displaystyle N}que contieneK{\displaystyle K}éxitos. En una prueba de sobrerrepresentación de éxitos en la muestra, el valor p hipergeométrico se calcula como la probabilidad de extraer aleatoriamentek{\displaystyle k}o más éxitos de la población ennorte{\displaystyle n}total de extracciones. En una prueba de subrepresentación, el valor p es la probabilidad de extraer aleatoriamente.k{\displaystyle k}o menos éxitos.

El biólogo y estadístico Ronald Fisher

La prueba basada en la distribución hipergeométrica (prueba hipergeométrica) es idéntica a la versión unilateral correspondiente de la prueba exacta de Fisher . [ 7 ] Recíprocamente, el valor p de una prueba exacta de Fisher bilateral se puede calcular como la suma de dos pruebas hipergeométricas apropiadas (para más información, consulte [ 8 ] ).

Esta prueba se utiliza a menudo para identificar qué subpoblaciones están sobrerrepresentadas o infrarrepresentadas en una muestra. Tiene una amplia gama de aplicaciones. Por ejemplo, un departamento de marketing podría usarla para comprender mejor a su clientela analizando a un grupo de clientes conocidos para detectar la sobrerrepresentación de diversos subgrupos demográficos (por ejemplo, mujeres, menores de 30 años).

DejarincógnitaHipergeométrica(norte,K,norte){\displaystyle X\sim \operatorname {Hypergeometric} (N,K,n)}ypag=K/norte{\displaystyle p=K/N}.

  • Sinorte=1{\displaystyle n=1}entoncesincógnita{\displaystyle X}tiene una distribución de Bernoulli con parámetropag{\displaystyle p}.
  • DejarY{\displaystyle Y}tienen una distribución binomial con parámetrosnorte{\displaystyle n}ypag{\displaystyle p}; esto modela el número de éxitos en el problema de muestreo análogo con reemplazo. Sinorte{\displaystyle N}yK{\displaystyle K}son grandes en comparación connorte{\displaystyle n}, ypag{\displaystyle p}no está cerca de 0 o 1, entoncesincógnita{\displaystyle X}yY{\displaystyle Y}tienen distribuciones similares, es decir,PAG(incógnitak)PAG(Yk){\displaystyle P(X\leq k)\approx P(Y\leq k)}.
  • Sinorte{\displaystyle n}es grande,norte{\displaystyle N}yK{\displaystyle K}son grandes en comparación connorte{\displaystyle n}, ypag{\displaystyle p}no está cerca de 0 o 1, entonces
PAG(incógnitak)Φ(knortepagnortepag(1pag)){\displaystyle P(X\leq k)\approx \Phi \left({\frac {k-np}{\sqrt {np(1-p)}}}\right)}

dóndeΦ{\displaystyle \Phi }es la función de distribución normal estándar

La siguiente tabla describe cuatro distribuciones relacionadas con el número de éxitos en una secuencia de extracciones:

Distribución hipergeométrica multivariada

El modelo de una urna con canicas verdes y rojas se puede extender al caso en que haya más de dos colores de canicas. Si hay K i canicas de color i en la urna y se toman n canicas al azar sin reemplazo, entonces el número de canicas de cada color en la muestra ( k 1 , k 2 ,..., k c ) tiene la distribución hipergeométrica multivariada:

Pr(incógnita1=k1,,incógnitado=kdo)=i=1do(Kiki)(nortenorte){\displaystyle \Pr(X_{1}=k_{1},\ldots ,X_{c}=k_{c})={\frac {\prod \limits _{i=1}^{c}{\binom {K_{i}}{k_{i}}}}{\binom {N}{n}}}}

Esto guarda la misma relación con la distribución multinomial que la que tiene la distribución hipergeométrica con la distribución binomial: la distribución multinomial es la distribución "con reemplazo" y la hipergeométrica multivariada es la distribución "sin reemplazo".

Las propiedades de esta distribución se dan en la tabla adyacente, [ 9 ] donde c es el número de colores diferentes ynorte=i=1doKi{\displaystyle N=\sum _{i=1}^{c}K_{i}}es el número total de canicas en la urna.

Ejemplo

Supongamos que hay 5 canicas negras, 10 blancas y 15 rojas en una urna. Si se eligen seis canicas sin reemplazo, la probabilidad de que se elijan exactamente dos de cada color es

PAG(2 negro,2 blanco,2 rojo)=(52)(102)(152)(306)=0,079575596816976{\displaystyle P(2{\text{ black}},2{\text{ white}},2{\text{ red}})={{{5 \choose 2}{10 \choose 2}{15 \choose 2}} \over {30 \choose 6}}=0.079575596816976}

Ocurrencia y aplicaciones

Aplicación a la auditoría de elecciones

Muestras utilizadas para auditorías electorales y la consiguiente probabilidad de pasar por alto un problema.

Las auditorías electorales suelen analizar una muestra de distritos electorales con recuentos automáticos para comprobar si los recuentos manuales o automáticos coinciden con los recuentos originales. Las discrepancias dan lugar a un informe o a un recuento mayor. Las tasas de muestreo suelen estar definidas por ley, no por diseño estadístico, por lo que para un tamaño de muestra n definido legalmente , ¿cuál es la probabilidad de pasar por alto un problema presente en K distritos electorales, como un ataque informático o un fallo de software? Esta es la probabilidad de que k = 0. Los fallos de software suelen ser difíciles de detectar, y un atacante informático puede minimizar su detección afectando solo a unos pocos distritos electorales, lo que aún afectará a elecciones ajustadas, por lo que un escenario plausible es que K sea del orden del 5 % de N. Las auditorías suelen cubrir entre el 1 % y el 10 % de los distritos electorales (a menudo el 3 %), [ 10 ] [ 11 ] [ 12 ] por lo que tienen una alta probabilidad de pasar por alto un problema. Por ejemplo, si un problema está presente en 5 de 100 distritos electorales, una muestra del 3% tiene una probabilidad del 86% de que k = 0, por lo que el problema no se detectaría, y solo una probabilidad del 14% de que el problema aparezca en la muestra ( k positivo ):

PAG{ incógnita=0 }= [ (Cortar0)(norte  Cortarnorte  0) ] [ (nortenorte) ]= [ (norte  Cortarnorte) ] [ (nortenorte) ] = [  (norte  Cortar)¡ norte¡(norte  Cortarnorte)¡ ] [ norte¡norte¡(norte  norte)¡ ]= [ (norteCortar)¡(norte  Cortar  norte)¡ ] [ norte¡(norte  norte)¡ ]= [ (10053) ]  [ (1003) ] = [ (1005)¡(10053)¡ ] [ 100¡(1003)¡ ]= [ 95¡92¡ ]  [ 100¡97¡ ] = 95×94×93 100×99×98=86%{\displaystyle {\begin{aligned}\operatorname {\boldsymbol {\mathcal {P}}} \{\ X=0\ \}&={\frac {\ \left[\ {\binom {\text{Hack}}{0}}{\binom {N\ -\ {\text{Hack}}}{n\ -\ 0}}\ \right]\ }{\left[\ {\binom {N}{n}}\ \right]}}={\frac {\ \left[\ {\binom {N\ -\ {\text{Hack}}}{n}}\ \right]}{\ \left[\ {\binom {N}{n}}\ \right]\ }}={\frac {\ \left[\ {\frac {\ (N\ -\ {\text{Hack}})!\ }{n!(N\ -\ {\text{Hack}}-n)!}}\ \right]\ }{\left[\ {\frac {N!}{n!(N\ -\ n)!}}\ \right]}}={\frac {\ \left[\ {\frac {(N-{\text{Hack}})!}{(N\ -\ {\text{Hack}}\ -\ n)!}}\ \right]\ }{\left[\ {\frac {N!}{(N\ -\ n)!}}\ \right]}}\\[8pt]&={\frac {\ \left[\ {\binom {100-5}{3}}\ \right]\ }{\ \left[\ {\binom {100}{3}}\ \right]\ }}={\frac {\ \left[\ {\frac {(100-5)!}{(100-5-3)!}}\ \right]\ }{\left[\ {\frac {100!}{(100-3)!}}\ \right]}}={\frac {\ \left[\ {\frac {95!}{92!}}\ \right]\ }{\ \left[\ {\frac {100!}{97!}}\ \right]\ }}={\frac {\ 95\times 94\times 93\ }{100\times 99\times 98}}=86\%\end{aligned}}}

La muestra necesitaría 45 distritos electorales para tener una probabilidad inferior al 5% de que k  =  0 en la muestra, y por lo tanto tener una probabilidad superior al 95% de encontrar el problema:

PAG{ incógnita=0 }= [ (100545) ] [ (10045) ]= [ 95¡50¡ ] [ 100¡55¡ ]= 95×94××51  100×99××56 = 55×54×53×52×51  100×99×98×97×96 =4.6% .{\displaystyle \operatorname {\boldsymbol {\mathcal {P}}} \{\ X=0\ \}={\frac {\ \left[\ {\binom {100-5}{45}}\ \right]\ }{\left[\ {\binom {100}{45}}\ \right]}}={\frac {\ \left[\ {\frac {95!}{50!}}\ \right]\ }{\left[\ {\frac {100!}{55!}}\ \right]}}={\frac {\ 95\times 94\times \cdots \times 51\ }{\ 100\times 99\times \cdots \times 56\ }}={\frac {\ 55\times 54\times 53\times 52\times 51\ }{\ 100\times 99\times 98\times 97\times 96\ }}=4.6\%~.}

Aplicación al póker Texas hold'em

En el póker Texas Hold'em , los jugadores forman la mejor mano posible combinando las dos cartas de su mano con las 5 cartas comunitarias que finalmente se revelan sobre la mesa. La baraja tiene 52 cartas y hay 13 de cada palo. Para este ejemplo, supongamos que un jugador tiene 2 tréboles en la mano y hay 3 cartas visibles sobre la mesa, 2 de las cuales también son tréboles. El jugador quiere saber la probabilidad de que una de las próximas 2 cartas que se muestren sea un trébol para completar el color . (Cabe destacar que la probabilidad calculada en este ejemplo asume que no se conoce información sobre las cartas de los demás jugadores; sin embargo, los jugadores de póker experimentados pueden considerar cómo los demás jugadores realizan sus apuestas (pasar, igualar, subir o retirarse) al calcular la probabilidad para cada escenario. Estrictamente hablando, el método para calcular las probabilidades de éxito descrito aquí es preciso en un escenario donde solo hay un jugador en la mesa; en una partida multijugador, esta probabilidad podría ajustarse en función de las apuestas de los oponentes).

Hay 4 tréboles a la vista, por lo que quedan 9 tréboles sin ver. Hay 5 cartas a la vista (2 en la mano y 3 sobre la mesa), por lo que hay525=47{\displaystyle 52-5=47}Aún no se ha visto.

La probabilidad de que exactamente una de las dos próximas cartas reveladas sea un trébol se puede calcular utilizando la distribución hipergeométrica conk=1,norte=2,K=9{\displaystyle k=1,n=2,K=9}ynorte=47{\displaystyle N=47}(aproximadamente el 31,64%)

La probabilidad de que las dos siguientes cartas reveladas sean tréboles se puede calcular utilizando hipergeométrica conk=2,norte=2,K=9{\displaystyle k=2,n=2,K=9}ynorte=47{\displaystyle N=47}(aproximadamente 3,33%)

La probabilidad de que ninguna de las dos cartas siguientes que se muestren sean tréboles se puede calcular utilizando hipergeométrica conk=0,norte=2,K=9{\displaystyle k=0,n=2,K=9}ynorte=47{\displaystyle N=47}(aproximadamente el 65,03%)

Aplicación para Keno

La distribución hipergeométrica es indispensable para calcular las probabilidades del Keno . En el Keno, se extraen aleatoriamente 20 bolas de una colección de 80 bolas numeradas en un recipiente, de forma similar al Bingo americano . Antes de cada extracción, el jugador selecciona una cierta cantidad de números marcando un formulario de papel proporcionado para tal fin. Por ejemplo, un jugador podría jugar con 6 números , marcando 6 números del 1 al 80 inclusive. Luego (después de que todos los jugadores hayan entregado sus formularios a un cajero, recibido una copia de su formulario marcado y pagado su apuesta) se extraen 20 bolas. Algunas de las bolas extraídas pueden coincidir con algunos o todos los números seleccionados por el jugador. En general, cuantos más números coincidan (bolas extraídas que coincidan con los números seleccionados por el jugador), mayor será el premio.

Por ejemplo, si un cliente apuesta 1 dólar a un 6 (un ejemplo bastante común) y acierta 4 de los 6, el casino le pagaría 4 dólares. Los pagos pueden variar de un casino a otro, pero 4 dólares es un valor típico. La probabilidad de este evento es:

PAG(incógnita=4)=F(4;80,6,20)=(64)(806204)(8020)0,02853791{\displaystyle P(X=4)=f(4;80,6,20)={{{6 \choose 4}{{80-6} \choose {20-4}}} \over {80 \choose 20}}\approx 0.02853791}

De manera similar, la probabilidad de acertar 5 de los 6 lugares seleccionados es (65)(7415)(8020)0,003095639{\displaystyle {{{6 \choose 5}{{74} \choose {15}}} \over {80 \choose 20}}\approx 0.003095639} Mientras que un premio típico podría ser de $88. El premio por acertar los 6 números sería de alrededor de $1500 (probabilidad ≈ 0,000128985 o 7752 a 1). El único otro premio distinto de cero podría ser de $1 por acertar 3 números (es decir, recuperas tu apuesta), lo cual tiene una probabilidad cercana a 0,129819548.

Si sumamos los productos de los pagos por las probabilidades correspondientes, obtenemos una rentabilidad esperada de 0,70986492, o aproximadamente un 71%, para una máquina tragamonedas de 6 números, lo que representa una ventaja de la casa del 29%. Las demás máquinas tragamonedas ofrecen una rentabilidad esperada similar. Esta baja rentabilidad (para el jugador) suele explicarse por los elevados costes operativos (espacio físico, equipamiento, personal) que requiere el juego.

Véase también

Referencias

Citas

  1. Cooper, Joshua N; Ellis, Robert B (2009). "Liantes linealmente acotados, códigos de cobertura adaptativos y caminatas aleatorias deterministas". arXiv : 0909.0029 [ math.CO ]., pág. 15.
  2. Rice, John A. (2007). Estadística matemática y análisis de datos (Tercera ed.). Duxbury Press. pág. 42.  
  3. Pollard, David (Primavera de 2010). "Simetría" (PDF) . Materiales del curso Stat 330/600 . Universidad de Yale . Consultado el 19 de enero de 2025 .
  4. 1 2 Hoeffding, Wassily (1963). "Desigualdades de probabilidad para sumas de variables aleatorias acotadas" (PDF) . Journal of the American Statistical Association . 58 (301): 13– 30. doi : 10.2307/2282952 . JSTOR 2282952 . .
  5. 1 2 "Otra cola de la distribución hipergeométrica" . wordpress.com . 8 de diciembre de 2015. Consultado el 19 de marzo de 2018 .
  6. Serfling, Robert (1974). "Desigualdades de probabilidad para la suma en el muestreo sin reemplazo". The Annals of Statistics . 2 (1): 39– 48. doi : 10.1214/aos/1176342611 ..
  7. Rivals, I.; Personnaz, L.; Taing, L.; Potier, M.-C (2007). "Enriquecimiento o agotamiento de una categoría GO dentro de una clase de genes: ¿qué prueba?" . Bioinformatics . 23 (4): 401– 407. doi : 10.1093/bioinformatics/btl633 . PMID 17182697 . 
  8. K. Preacher y N. Briggs. "Cálculo para la prueba exacta de Fisher: una herramienta de cálculo interactiva para la prueba de probabilidad exacta de Fisher para tablas de 2 x 2 (página interactiva)" .
  9. Duan, XG (2021). "Mejor comprensión de la distribución hipergeométrica multivariada con implicaciones en el muestreo de encuestas basado en el diseño". arXiv : 2101.00548 [ math.ST ].
  10. Glazer, Amanda; Spertus, Jacob (10 de febrero de 2020). "Comiencen a difundir la noticia: la auditoría postelectoral de Nueva York tiene fallas importantes". SSRN . doi : 10.2139/ssrn.3536011 . SSRN 3536011 . 
  11. "Leyes de auditoría estatal" . Votación verificada . 10 de febrero de 2017. Archivado del original el 4 de enero de 2020. Consultado el 2 de abril de 2018 .
  12. "Auditorías postelectorales" . ncsl.org . Conferencia Nacional de Legislaturas Estatales . Consultado el 2 de abril de 2018 .

Fuentes

  • Berkopec, Aleš (2007). "Algoritmo HyperQuick para distribución hipergeométrica discreta" . Journal of Discrete Algorithms . 5 (2): 341– 347. doi : 10.1016/j.jda.2006.01.001 .
  • Skala, M. (2011). "Desigualdades de cola hipergeométricas: acabando con la locura". arXiv : 1311.5939 [ math.PR ].nota no publicada