En teoría de la probabilidad y estadística , la distribución hipergeométrica es una distribución de probabilidad discreta que describe la probabilidad deéxitos (extracciones aleatorias en las que el objeto extraído tiene una característica específica) enextrae, sin reemplazo, de una población finita de tamañoque contiene exactamenteobjetos con esa característica, donde en cada extracción hay un éxito o un fracaso. En contraste, la distribución binomial describe la probabilidad deéxitos enempata con reemplazo.
Definiciones
Función de masa de probabilidad
Las siguientes condiciones caracterizan la distribución hipergeométrica:
- El resultado de cada extracción (los elementos de la población muestreada) se puede clasificar en una de dos categorías mutuamente excluyentes (por ejemplo, Aprobado/Reprobado o Empleado/Desempleado).
- La probabilidad de éxito cambia en cada extracción, ya que cada extracción disminuye la población ( muestreo sin reemplazo de una población finita).
Una variable aleatoriasigue la distribución hipergeométrica si su función de masa de probabilidad (pmf) está dada por [ 2 ].
dónde
- es el tamaño de la población,
- es el número de estados de éxito en la población,
- es el número de extracciones (es decir, la cantidad extraída en cada prueba),
- es el número de éxitos observados,
- es un coeficiente binomial .
La fuerza de probabilidad es positiva cuando.
Una variable aleatoria distribuida hipergeométricamente con parámetros,yestá escritoy tiene función de masa de probabilidadarriba.
Identidades combinatorias
Según lo requerido, tenemos
lo cual se deduce esencialmente de la identidad de Vandermonde en combinatoria .
Tenga en cuenta también que
Esta identidad se puede demostrar expresando los coeficientes binomiales en términos de factoriales y reordenando estos últimos. Además, se deduce de la simetría del problema, descrita de dos maneras diferentes pero intercambiables.
Por ejemplo, consideremos dos rondas de sorteo sin reemplazo. En la primera ronda,fuera deSe extraen canicas neutras de una urna sin reemplazo y se tiñen de verde. Luego se vuelven a colocar las canicas de color. En la segunda ronda,Se extraen canicas sin reemplazo y se colorean de rojo. Luego, el número de canicas con ambos colores (es decir, el número de canicas que se han extraído dos veces) tiene la distribución hipergeométrica. La simetría enyEsto se debe a que las dos rondas son independientes, y uno podría haber comenzado dibujandobolas y pintándolas de rojo primero.
Tenga en cuenta que estamos interesados en la probabilidad deéxitos enextracciones sin reemplazo , ya que la probabilidad de éxito en cada ensayo no es la misma, puesto que el tamaño de la población restante cambia a medida que retiramos cada canica. Tenga en cuenta no confundir con la distribución binomial , que describe la probabilidad deéxitos enempata con reemplazo.
Propiedades
Ejemplo práctico
La aplicación clásica de la distribución hipergeométrica es el muestreo sin reemplazo . Imaginemos una urna con dos colores de canicas : roja y verde. Definimos extraer una canica verde como un éxito y extraer una canica roja como un fracaso. Sea N el número total de canicas en la urna (véase la tabla de contingencia a continuación) y K el número de canicas verdes ; entonces, N − K corresponde al número de canicas rojas . Ahora, de pie junto a la urna, cerramos los ojos y extraemos n canicas sin reemplazo. Definimos X como una variable aleatoria cuyo resultado es k , el número de canicas verdes extraídas en el experimento. Esta situación se ilustra en la siguiente tabla de contingencia :
En efecto, nos interesa calcular la probabilidad de extraer k canicas verdes en n extracciones, dado que hay K canicas verdes de un total de N canicas. Para este ejemplo, supongamos que hay 5 canicas verdes y 45 rojas en la urna. De pie junto a la urna, cierras los ojos y extraes 10 canicas sin reemplazo. ¿Cuál es la probabilidad de que exactamente 4 de las 10 sean verdes?
Este problema se resume en la siguiente tabla de contingencia:
Para hallar la probabilidad de extraer k canicas verdes en exactamente n extracciones de un total de N extracciones , identificamos X como una variable aleatoria hipergeométrica para usar la fórmula
Para explicar intuitivamente la fórmula dada, consideremos los dos problemas simétricos representados por la identidad.
- Lado izquierdo: extraer un total de solo n canicas de la urna. Queremos hallar la probabilidad de extraer k canicas verdes de un total de K canicas verdes, y extraer nk canicas rojas de NK canicas rojas, en estas n rondas.
- lado derecho - alternativamente, extraer las N canicas de la urna. Queremos hallar la probabilidad de extraer k canicas verdes en n extracciones de un total de N extracciones, y Kk canicas verdes en las Nn extracciones restantes.
Volviendo a los cálculos, usamos la fórmula anterior para calcular la probabilidad de sacar exactamente k canicas verdes.
Intuitivamente, cabría esperar que fuera aún más improbable que las 5 canicas verdes estuvieran entre las 10 extraídas.
Como era de esperar, la probabilidad de sacar 5 canicas verdes es aproximadamente 35 veces menor que la de sacar 4.
Simetrías
Intercambiar los roles de las canicas verdes y rojas:
Intercambiar los roles de las canicas extraídas y no extraídas:
Intercambiar los roles de las canicas verdes y las dibujadas:
Estas simetrías generan el grupo diedral..
Orden de los sorteos
La probabilidad de extraer cualquier conjunto de canicas verdes y rojas (la distribución hipergeométrica) depende únicamente de la cantidad de canicas verdes y rojas, no del orden en que aparecen; es decir, es una distribución intercambiable . Como resultado, la probabilidad de extraer una canica verde en elEl sorteo es [ 3 ]
Se trata de una probabilidad ex ante , es decir, se basa en desconocer los resultados de los sorteos anteriores.
límites de cola
Dejary. Luego paraPodemos derivar los siguientes límites: [ 4 ]
dónde
es la divergencia de Kullback-Leibler y se utiliza que. [ 5 ]
Nota : Para derivar los límites anteriores, hay que empezar observando quedóndeson variables aleatorias dependientes con una distribución específicaDado que la mayoría de los teoremas sobre límites en la suma de variables aleatorias se refieren a secuencias independientes de las mismas, primero hay que crear una secuencia.de variables aleatorias independientes con la misma distribucióny aplicar los teoremas en. Luego, se demuestra a partir de Hoeffding [ 4 ] que los resultados y límites obtenidos a través de este proceso se mantienen paratambién.
Si n es mayor que N /2, puede ser útil aplicar simetría para "invertir" los límites, lo que da como resultado lo siguiente: [ 5 ] [ 6 ]
Inferencia estadística
Prueba hipergeométrica
La prueba hipergeométrica utiliza la distribución hipergeométrica para medir la significación estadística de haber extraído una muestra que consta de un número específico deéxitos (deextracciones totales) de una población de tamañoque contieneéxitos. En una prueba de sobrerrepresentación de éxitos en la muestra, el valor p hipergeométrico se calcula como la probabilidad de extraer aleatoriamenteo más éxitos de la población entotal de extracciones. En una prueba de subrepresentación, el valor p es la probabilidad de extraer aleatoriamente.o menos éxitos.
La prueba basada en la distribución hipergeométrica (prueba hipergeométrica) es idéntica a la versión unilateral correspondiente de la prueba exacta de Fisher . [ 7 ] Recíprocamente, el valor p de una prueba exacta de Fisher bilateral se puede calcular como la suma de dos pruebas hipergeométricas apropiadas (para más información, consulte [ 8 ] ).
Esta prueba se utiliza a menudo para identificar qué subpoblaciones están sobrerrepresentadas o infrarrepresentadas en una muestra. Tiene una amplia gama de aplicaciones. Por ejemplo, un departamento de marketing podría usarla para comprender mejor a su clientela analizando a un grupo de clientes conocidos para detectar la sobrerrepresentación de diversos subgrupos demográficos (por ejemplo, mujeres, menores de 30 años).
Distribuciones relacionadas
Dejary.
- Sientoncestiene una distribución de Bernoulli con parámetro.
- Dejartienen una distribución binomial con parámetrosy; esto modela el número de éxitos en el problema de muestreo análogo con reemplazo. Siyson grandes en comparación con, yno está cerca de 0 o 1, entoncesytienen distribuciones similares, es decir,.
- Sies grande,yson grandes en comparación con, yno está cerca de 0 o 1, entonces
dóndees la función de distribución normal estándar
- Si las probabilidades de sacar una canica verde o roja no son iguales (por ejemplo, porque las canicas verdes son más grandes/más fáciles de agarrar que las rojas), entoncestiene una distribución hipergeométrica no central
- La distribución beta-binomial es una distribución a priori conjugada para la distribución hipergeométrica.
La siguiente tabla describe cuatro distribuciones relacionadas con el número de éxitos en una secuencia de extracciones:
Distribución hipergeométrica multivariada
El modelo de una urna con canicas verdes y rojas se puede extender al caso en que haya más de dos colores de canicas. Si hay K i canicas de color i en la urna y se toman n canicas al azar sin reemplazo, entonces el número de canicas de cada color en la muestra ( k 1 , k 2 ,..., k c ) tiene la distribución hipergeométrica multivariada:
Esto guarda la misma relación con la distribución multinomial que la que tiene la distribución hipergeométrica con la distribución binomial: la distribución multinomial es la distribución "con reemplazo" y la hipergeométrica multivariada es la distribución "sin reemplazo".
Las propiedades de esta distribución se dan en la tabla adyacente, [ 9 ] donde c es el número de colores diferentes yes el número total de canicas en la urna.
Ejemplo
Supongamos que hay 5 canicas negras, 10 blancas y 15 rojas en una urna. Si se eligen seis canicas sin reemplazo, la probabilidad de que se elijan exactamente dos de cada color es
Ocurrencia y aplicaciones
Aplicación a la auditoría de elecciones

Las auditorías electorales suelen analizar una muestra de distritos electorales con recuentos automáticos para comprobar si los recuentos manuales o automáticos coinciden con los recuentos originales. Las discrepancias dan lugar a un informe o a un recuento mayor. Las tasas de muestreo suelen estar definidas por ley, no por diseño estadístico, por lo que para un tamaño de muestra n definido legalmente , ¿cuál es la probabilidad de pasar por alto un problema presente en K distritos electorales, como un ataque informático o un fallo de software? Esta es la probabilidad de que k = 0. Los fallos de software suelen ser difíciles de detectar, y un atacante informático puede minimizar su detección afectando solo a unos pocos distritos electorales, lo que aún afectará a elecciones ajustadas, por lo que un escenario plausible es que K sea del orden del 5 % de N. Las auditorías suelen cubrir entre el 1 % y el 10 % de los distritos electorales (a menudo el 3 %), [ 10 ] [ 11 ] [ 12 ] por lo que tienen una alta probabilidad de pasar por alto un problema. Por ejemplo, si un problema está presente en 5 de 100 distritos electorales, una muestra del 3% tiene una probabilidad del 86% de que k = 0, por lo que el problema no se detectaría, y solo una probabilidad del 14% de que el problema aparezca en la muestra ( k positivo ):
La muestra necesitaría 45 distritos electorales para tener una probabilidad inferior al 5% de que k = 0 en la muestra, y por lo tanto tener una probabilidad superior al 95% de encontrar el problema:
Aplicación al póker Texas hold'em
En el póker Texas Hold'em , los jugadores forman la mejor mano posible combinando las dos cartas de su mano con las 5 cartas comunitarias que finalmente se revelan sobre la mesa. La baraja tiene 52 cartas y hay 13 de cada palo. Para este ejemplo, supongamos que un jugador tiene 2 tréboles en la mano y hay 3 cartas visibles sobre la mesa, 2 de las cuales también son tréboles. El jugador quiere saber la probabilidad de que una de las próximas 2 cartas que se muestren sea un trébol para completar el color . (Cabe destacar que la probabilidad calculada en este ejemplo asume que no se conoce información sobre las cartas de los demás jugadores; sin embargo, los jugadores de póker experimentados pueden considerar cómo los demás jugadores realizan sus apuestas (pasar, igualar, subir o retirarse) al calcular la probabilidad para cada escenario. Estrictamente hablando, el método para calcular las probabilidades de éxito descrito aquí es preciso en un escenario donde solo hay un jugador en la mesa; en una partida multijugador, esta probabilidad podría ajustarse en función de las apuestas de los oponentes).
Hay 4 tréboles a la vista, por lo que quedan 9 tréboles sin ver. Hay 5 cartas a la vista (2 en la mano y 3 sobre la mesa), por lo que hayAún no se ha visto.
La probabilidad de que exactamente una de las dos próximas cartas reveladas sea un trébol se puede calcular utilizando la distribución hipergeométrica cony(aproximadamente el 31,64%)
La probabilidad de que las dos siguientes cartas reveladas sean tréboles se puede calcular utilizando hipergeométrica cony(aproximadamente 3,33%)
La probabilidad de que ninguna de las dos cartas siguientes que se muestren sean tréboles se puede calcular utilizando hipergeométrica cony(aproximadamente el 65,03%)
Aplicación para Keno
La distribución hipergeométrica es indispensable para calcular las probabilidades del Keno . En el Keno, se extraen aleatoriamente 20 bolas de una colección de 80 bolas numeradas en un recipiente, de forma similar al Bingo americano . Antes de cada extracción, el jugador selecciona una cierta cantidad de números marcando un formulario de papel proporcionado para tal fin. Por ejemplo, un jugador podría jugar con 6 números , marcando 6 números del 1 al 80 inclusive. Luego (después de que todos los jugadores hayan entregado sus formularios a un cajero, recibido una copia de su formulario marcado y pagado su apuesta) se extraen 20 bolas. Algunas de las bolas extraídas pueden coincidir con algunos o todos los números seleccionados por el jugador. En general, cuantos más números coincidan (bolas extraídas que coincidan con los números seleccionados por el jugador), mayor será el premio.
Por ejemplo, si un cliente apuesta 1 dólar a un 6 (un ejemplo bastante común) y acierta 4 de los 6, el casino le pagaría 4 dólares. Los pagos pueden variar de un casino a otro, pero 4 dólares es un valor típico. La probabilidad de este evento es:
De manera similar, la probabilidad de acertar 5 de los 6 lugares seleccionados es Mientras que un premio típico podría ser de $88. El premio por acertar los 6 números sería de alrededor de $1500 (probabilidad ≈ 0,000128985 o 7752 a 1). El único otro premio distinto de cero podría ser de $1 por acertar 3 números (es decir, recuperas tu apuesta), lo cual tiene una probabilidad cercana a 0,129819548.
Si sumamos los productos de los pagos por las probabilidades correspondientes, obtenemos una rentabilidad esperada de 0,70986492, o aproximadamente un 71%, para una máquina tragamonedas de 6 números, lo que representa una ventaja de la casa del 29%. Las demás máquinas tragamonedas ofrecen una rentabilidad esperada similar. Esta baja rentabilidad (para el jugador) suele explicarse por los elevados costes operativos (espacio físico, equipamiento, personal) que requiere el juego.
Véase también
Referencias
Citas
- ↑ Cooper, Joshua N; Ellis, Robert B (2009). "Liantes linealmente acotados, códigos de cobertura adaptativos y caminatas aleatorias deterministas". arXiv : 0909.0029 [ math.CO ]., pág. 15.
- ↑ Rice, John A. (2007). Estadística matemática y análisis de datos (Tercera ed.). Duxbury Press. pág. 42.
- ↑ Pollard, David (Primavera de 2010). "Simetría" (PDF) . Materiales del curso Stat 330/600 . Universidad de Yale . Consultado el 19 de enero de 2025 .
- 1 2 Hoeffding, Wassily (1963). "Desigualdades de probabilidad para sumas de variables aleatorias acotadas" (PDF) . Journal of the American Statistical Association . 58 (301): 13– 30. doi : 10.2307/2282952 . JSTOR 2282952 . .
- 1 2 "Otra cola de la distribución hipergeométrica" . wordpress.com . 8 de diciembre de 2015. Consultado el 19 de marzo de 2018 .
- ↑ Serfling, Robert (1974). "Desigualdades de probabilidad para la suma en el muestreo sin reemplazo". The Annals of Statistics . 2 (1): 39– 48. doi : 10.1214/aos/1176342611 ..
- ↑ Rivals, I.; Personnaz, L.; Taing, L.; Potier, M.-C (2007). "Enriquecimiento o agotamiento de una categoría GO dentro de una clase de genes: ¿qué prueba?" . Bioinformatics . 23 (4): 401– 407. doi : 10.1093/bioinformatics/btl633 . PMID 17182697 .
- ↑ K. Preacher y N. Briggs. "Cálculo para la prueba exacta de Fisher: una herramienta de cálculo interactiva para la prueba de probabilidad exacta de Fisher para tablas de 2 x 2 (página interactiva)" .
- ↑ Duan, XG (2021). "Mejor comprensión de la distribución hipergeométrica multivariada con implicaciones en el muestreo de encuestas basado en el diseño". arXiv : 2101.00548 [ math.ST ].
- ↑ Glazer, Amanda; Spertus, Jacob (10 de febrero de 2020). "Comiencen a difundir la noticia: la auditoría postelectoral de Nueva York tiene fallas importantes". SSRN . doi : 10.2139/ssrn.3536011 . SSRN 3536011 .
- ↑ "Leyes de auditoría estatal" . Votación verificada . 10 de febrero de 2017. Archivado del original el 4 de enero de 2020. Consultado el 2 de abril de 2018 .
- ↑ "Auditorías postelectorales" . ncsl.org . Conferencia Nacional de Legislaturas Estatales . Consultado el 2 de abril de 2018 .
Fuentes
- Berkopec, Aleš (2007). "Algoritmo HyperQuick para distribución hipergeométrica discreta" . Journal of Discrete Algorithms . 5 (2): 341– 347. doi : 10.1016/j.jda.2006.01.001 .
- Skala, M. (2011). "Desigualdades de cola hipergeométricas: acabando con la locura". arXiv : 1311.5939 [ math.PR ].nota no publicada
Enlaces externos
- La distribución hipergeométrica y la aproximación binomial a una variable aleatoria hipergeométrica, por Chris Boucher, Proyecto de demostraciones de Wolfram .
- Weisstein, Eric W. "Distribución hipergeométrica" . MathWorld .
- Distribuciones discretas
- Temas factoriales y binomiales