Articulo de referencia

Distribución hipergeométrica negativa

N \\in \\left\\{0,1,2,\\dots\\right\\} - total number of elements \n K \\in \\left\\{0,1,2,\\dots,N\\right\\} - total number of 'success' elements \n r \\in \\left\\{0,1,2,\\dot...

En teoría de la probabilidad y estadística , la distribución hipergeométrica negativa describe las probabilidades al muestrear sin reemplazo una población finita en la que cada muestra se puede clasificar en dos categorías mutuamente excluyentes, como Aprobado/Reprobado o Empleado/Desempleado. A medida que se realizan selecciones aleatorias de la población, cada extracción posterior disminuye la población, lo que provoca que la probabilidad de éxito cambie con cada extracción. A diferencia de la distribución hipergeométrica estándar , que describe el número de éxitos en un tamaño de muestra fijo, en la distribución hipergeométrica negativa, las muestras se extraen hastar{\displaystyle r}Se han encontrado fallos y la distribución describe la probabilidad de encontrarlos.k{\displaystyle k}éxitos en dicha muestra. En otras palabras, la distribución hipergeométrica negativa describe la probabilidad dek{\displaystyle k}éxitos en una muestra con exactamenter{\displaystyle r}fracasos.

Definición

Haynorte{\displaystyle N}elementos, de los cualesK{\displaystyle K}se definen como "éxitos" y el resto como "fracasos".

Los elementos se dibujan uno tras otro, sin reemplazos, hasta quer{\displaystyle r}Se producen fallos. Entonces, el dibujo se detiene y el númerok{\displaystyle k}de éxitos se cuenta. La distribución hipergeométrica negativa,norteHGRAMOnorte,K,r(k){\displaystyle NHG_{N,K,r}(k)}es la distribución discreta de estek{\displaystyle k}.

[ 1 ]

La distribución hipergeométrica negativa es un caso especial de la distribución beta-binomial [ 2 ] con parámetrosα=r{\displaystyle \alpha =r}yβ=norteKr+1{\displaystyle \beta =NK-r+1}ambos son números enteros (ynorte=K{\displaystyle n=K}).

El resultado requiere que observemosk{\displaystyle k}éxitos en(k+r1){\displaystyle (k+r-1)}sorteos y el(k+r)-th{\displaystyle (k+r){\text{-th}}}El bit debe ser un fallo. La probabilidad de lo primero se puede encontrar mediante la aplicación directa de la distribución hipergeométrica.(HGRAMOnorte,K,k+r1(k)){\displaystyle (HG_{N,K,k+r-1}(k))}y la probabilidad de este último es simplemente el número de fallos restantes (=norteK(r1){\displaystyle =NK-(r-1)}) dividido por el tamaño de la población restante (=norte(k+r1){\displaystyle =N-(k+r-1)}). La probabilidad de tener exactamentek{\displaystyle k}éxitos hasta elr-th{\displaystyle r{\text{-th}}}fallo (es decir, el dibujo se detiene tan pronto como la muestra incluye el número predefinido der{\displaystyle r}fallas) es entonces el producto de estas dos probabilidades:

(Kk)(norteKk+r1k)(nortek+r1)norteK(r1)norte(k+r1)=(k+r1k)(norterkKk)(norteK).{\displaystyle {\frac {{\binom {K}{k}}{\binom {NK}{k+r-1-k}}}{\binom {N}{k+r-1}}}\cdot {\frac {NK-(r-1)}{N-(k+r-1)}}={\frac {{{k+r-1} \choose {k}}{{Nrk} \choose {Kk}}}{N \choose K}}.}

Por lo tanto, una variable aleatoriaincógnita{\displaystyle X}sigue la distribución hipergeométrica negativa si su función de masa de probabilidad (pmf) está dada por

F(k;norte,K,r)Pr(incógnita=k)=(k+r1k)(norterkKk)(norteK)para k=0,1,2,,K{\displaystyle f(k;N,K,r)\equiv \Pr(X=k)={\frac {{{k+r-1} \choose {k}}{{Nrk} \choose {Kk}}}{N \choose K}}\quad {\text{para }}k=0,1,2,\dotsc ,K}

dónde

  • norte{\displaystyle N}es el tamaño de la población,
  • K{\displaystyle K}es el número de estados de éxito en la población,
  • r{\displaystyle r}es el número de fallos,
  • k{\displaystyle k}es el número de éxitos observados,
  • (ab){\displaystyle a \choose b}es un coeficiente binomial

Por diseño, las probabilidades suman 1. Sin embargo, en caso de que queramos mostrarlo explícitamente, tenemos:

k=0KPr(incógnita=k)=k=0K(k+r1k)(norterkKk)(norteK)=1(norteK)k=0K(k+r1k)(norterkKk)=1(norteK)(norteK)=1,{\displaystyle \sum _{k=0}^{K}\Pr(X=k)=\sum _{k=0}^{K}{\frac {{{k+r-1} \choose {k}}{{Nrk} \choose {Kk}}}{N \choose K}}={\frac {1}{N \choose K}}\sum _{k=0}^{K}{{k+r-1} \choose {k}}{{Nrk} \choose {Kk}}={\frac {1}{N \choose K}}{N \choose K}=1,}

donde lo hemos usado,

j=0k(j+metroj)(nortemetrojkj)=j=0k(1)j(metro1j)(1)kj(metro+1+knorte2kj)=(1)kj=0k(metro1j)(knorte2(metro1)kj)=(1)k(knorte2k)=(1)k(k(norte+1)1k)=(norte+1k),{\displaystyle {\begin{aligned}\sum _{j=0}^{k}{\binom {j+m}{j}}{\binom {nmj}{kj}}&=\sum _{j=0}^{k}(-1)^{j}{\binom {-m-1}{j}}(-1)^{kj}{\binom {m+1+kn-2}{kj}}\\&=(-1)^{k}\sum _{j=0}^{k}{\binom {-m-1}{j}}{\binom {kn-2-(-m-1)}{kj}}\\&=(-1)^{k}{\binom {kn-2}{k}}\\&=(-1)^{k}{\binom {k-(n+1)-1}{k}}\\&={\binom {n+1}{k}},\end{aligned}}}

que se puede derivar utilizando la identidad binomial ,

(nortek)=(1)k(knorte1k),{\displaystyle {{n \choose k}=(-1)^{k}{kn-1 \choose k}},}

y la identidad Chu-Vandermonde ,

j=0k(metroj)(nortemetrokj)=(nortek),{\displaystyle \sum _{j=0}^{k}{\binom {m}{j}}{\binom {nm}{kj}}={\binom {n}{k}},}

lo cual es válido para cualquier valor complejo.metro{\displaystyle m}ynorte{\displaystyle n}y cualquier número entero no negativok{\displaystyle k}.

Expectativa

Al contar el númerok{\displaystyle k}de éxitos anterioresr{\displaystyle r}fracasos, el número esperado de éxitos esrKnorteK+1{\displaystyle {\frac {rK}{N-K+1}}}y se puede derivar de la siguiente manera.

mi[incógnita]=k=0KkPr(incógnita=k)=k=0Kk(k+r1k)(norterkKk)(norteK)=r(norteK)[k=0K(k+r)r(k+r1r1)(norterkKk)]r=r(norteK)[k=0K(k+rr)(norterkKk)]r=r(norteK)[k=0K(k+rk)(norterkKk)]r=r(norteK)[(norte+1K)]r=rKnorteK+1,{\displaystyle {\begin{aligned}E[X]&=\sum _{k=0}^{K}k\Pr(X=k)=\sum _{k=0}^{K}k{\frac {{{k+r-1} \choose {k}}{{Nrk} \choose {Kk}}}{N \choose K}}={\frac {r}{N \choose K}}\left[\sum _{k=0}^{K}{\frac {(k+r)}{r}}{{k+r-1} \choose {r-1}}{{Nrk} \choose {Kk}}\right]-r\\&={\frac {r}{N \choose K}}\left[\sum _{k=0}^{K}{{k+r} \choose {r}}{{Nrk} \choose {Kk}}\right]-r={\frac {r}{N \choose K}}\left[\sum _{k=0}^{K}{{k+r} \choose {k}}{{Nrk} \choose {Kk}}\right]-r\\&={\frac {r}{N \choose K}}\left[{{N+1} \choose K}\right]-r={\frac {rK}{N-K+1}},\end{aligned}}}

donde hemos utilizado la relaciónj=0k(j+metroj)(nortemetrojkj)=(norte+1k){\displaystyle \sum _{j=0}^{k}{\binom {j+m}{j}}{\binom {n-m-j}{k-j}}={\binom {n+1}{k}}}, que derivamos anteriormente para demostrar que la distribución hipergeométrica negativa estaba correctamente normalizada.

Diferencia

La varianza se puede obtener mediante el siguiente cálculo.

mi[incógnita2]=k=0Kk2Pr(incógnita=k)=[k=0K(k+r)(k+r+1)Pr(incógnita=k)](2r+1)mi[incógnita]r2r=r(r+1)(norteK)[k=0K(k+r+1r+1)(norte+1(r+1)kKk)](2r+1)mi[incógnita]r2r=r(r+1)(norteK)[(norte+2K)](2r+1)mi[incógnita]r2r=rK(norter+Kr+1)(norteK+1)(norteK+2){\displaystyle {\begin{aligned}E[X^{2}]&=\sum _{k=0}^{K}k^{2}\Pr(X=k)=\left[\sum _{k=0}^{K}(k+r)(k+r+1)\Pr(X=k)\right]-(2r+1)E[X]-r^{2}-r\\&={\frac {r(r+1)}{N \choose K}}\left[\sum _{k=0}^{K}{{k+r+1} \choose {r+1}}{{N+1-(r+1)-k} \choose {K-k}}\right]-(2r+1)E[X]-r^{2}-r\\&={\frac {r(r+1)}{N \choose K}}\left[{{N+2} \choose K}\right]-(2r+1)E[X]-r^{2}-r={\frac {rK(N-r+Kr+1)}{(N-K+1)(N-K+2)}}\end{aligned}}}

Entonces la varianza esVar[incógnita]=mi[incógnita2](mi[incógnita])2=rK(norte+1)(norteKr+1)(norteK+1)2(norteK+2){\displaystyle {\textrm {Var}}[X]=E[X^{2}]-\left(E[X]\right)^{2}={\frac {rK(N+1)(N-K-r+1)}{(N-K+1)^{2}(N-K+2)}}}

Si el dibujo se detiene después de un número constantenorte{\displaystyle n}de sorteos (independientemente del número de fallos), entonces el número de éxitos tiene la distribución hipergeométrica ,HGRAMOnorte,K,norte(k){\displaystyle HG_{N,K,n}(k)}. Las dos funciones están relacionadas de la siguiente manera: [ 1 ]

norteHGRAMOnorte,K,r(k)=1HGRAMOnorte,norteK,k+r(r1){\displaystyle NHG_{N,K,r}(k)=1-HG_{N,N-K,k+r}(r-1)}

La distribución hipergeométrica negativa (al igual que la distribución hipergeométrica) se aplica a extracciones sin reemplazo , de modo que la probabilidad de éxito es diferente en cada extracción. En cambio, la distribución binomial negativa (al igual que la distribución binomial) se aplica a extracciones con reemplazo , de modo que la probabilidad de éxito es la misma y los ensayos son independientes. La siguiente tabla resume las cuatro distribuciones relacionadas con las extracciones de objetos:

Algunos autores [ 3 ] [ 4 ] definen la distribución hipergeométrica negativa como el número de extracciones necesarias para obtener lar{\displaystyle r}el fracaso. Si dejamosY{\displaystyle Y}Denotemos este número entonces queda claro queY=incógnita+r{\displaystyle Y=X+r}dóndeincógnita{\displaystyle X}es como se definió anteriormente. Por lo tanto, la PMF es

Pr(Y=y)=(y1r1)(norteynorteKr)(nortenorteK).{\displaystyle \Pr(Y=y)={\binom {y-1}{r-1}}{\frac {\binom {N-y}{N-K-r}}{\binom {N}{N-K}}}.}

Si dejamos que el número de fallosnorteK{\displaystyle N-K}ser denotado porMETRO{\displaystyle M}significa que tenemos

Pr(Y=y)=(y1r1)(norteyMETROr)(norteMETRO).{\displaystyle \Pr(Y=y)={\binom {y-1}{r-1}}{\frac {\binom {N-y}{M-r}}{\binom {N}{M}}}.}

El apoyo deY{\displaystyle Y}es el conjunto{r,r+1,,norteMETRO+r}{\displaystyle \{r,r+1,\dots ,N-M+r\}}Está claro que:

mi[Y]=mi[incógnita]+r=r(norte+1)METRO+1{\displaystyle E[Y]=E[X]+r={\frac {r(N+1)}{M+1}}}

yVar[incógnita]=Var[Y]{\displaystyle {\textrm {Var}}[X]={\textrm {Var}}[Y]}.

Referencias

  1. 1 2 Distribución hipergeométrica negativa en la Enciclopedia de Matemáticas.
  2. Johnson, Norman L.; Kemp, Adrienne W. ; Kotz, Samuel (2005). Distribuciones discretas univariadas . Wiley. ISBN 0-471-27246-9.§6.2.2 (págs. 253-254)
  3. Rohatgi, Vijay K., y AK Md Ehsanes Saleh. Introducción a la probabilidad y la estadística. John Wiley & Sons, 2015.
  4. Khan, RA (1994). Una nota sobre la función generadora de una distribución hipergeométrica negativa. Sankhya: The Indian Journal of Statistics B, 56(3), 309-313.