Articulo de referencia

Intervalo de confianza de proporción binomial

En estadística , un intervalo de confianza de proporción binomial es un intervalo de confianza para la probabilidad de éxito calculado a partir del resultado de una serie de exp...

En estadística , un intervalo de confianza de proporción binomial es un intervalo de confianza para la probabilidad de éxito calculado a partir del resultado de una serie de experimentos de éxito-fracaso ( ensayos de Bernoulli ). En otras palabras, un intervalo de confianza de proporción binomial es una estimación por intervalo de una probabilidad de éxito.pag{\displaystyle p}cuando solo el número de experimentosnorte{\displaystyle n}y el número de éxitosnortes{\displaystyle n_{\mathsf {s}}}son conocidos.

Existen varias fórmulas para calcular un intervalo de confianza binomial, pero todas se basan en la suposición de una distribución binomial . En general, una distribución binomial se aplica cuando un experimento se repite un número fijo de veces, cada ensayo tiene dos resultados posibles (éxito y fracaso), la probabilidad de éxito es la misma para cada ensayo y los ensayos son estadísticamente independientes . Dado que la distribución binomial es una distribución de probabilidad discreta (es decir, no continua) y resulta difícil de calcular para un gran número de ensayos, se utilizan diversas aproximaciones para calcular este intervalo de confianza, cada una con sus propias ventajas e inconvenientes en cuanto a precisión e intensidad computacional.

Un ejemplo sencillo de distribución binomial es el conjunto de posibles resultados, y sus probabilidades, para el número de caras observadas al lanzar una moneda diez veces. La proporción binomial observada es la fracción de lanzamientos que resultan en cara. Dada esta proporción observada, el intervalo de confianza para la probabilidad real de que la moneda caiga en cara es un rango de proporciones posibles, que puede o no contener la proporción real. Un intervalo de confianza del 95 % para la proporción, por ejemplo, contendrá la proporción real el 95 % de las veces que se utilice el procedimiento para construir el intervalo de confianza. [ 1 ]

Problemas al usar una aproximación normal o "intervalo de Wald".

Al representar gráficamente el intervalo de aproximación normal en una curva logística arbitraria , se revelan problemas de sobreimpulso e intervalos de ancho cero . [ 2 ]

Una fórmula comúnmente utilizada para un intervalo de confianza binomial se basa en aproximar la distribución del error alrededor de una observación con distribución binomial, pag^ ,{\displaystyle \ {\sombrero {p}}\ ,}con una distribución normal . [ 3 ] La aproximación normal depende del teorema de De Moivre-Laplace (la versión original, solo binomial , del teorema del límite central ) y se vuelve poco fiable cuando viola las premisas de los teoremas, ya que el tamaño de la muestra se vuelve pequeño o la probabilidad de éxito crece cerca de 0 o 1. [ 4 ]

Utilizando la aproximación normal, la probabilidad de éxito pag {\displaystyle \ p\ }se estima por

pag  pag^±zαnorte pag^(1pag^)  ,{\displaystyle p~\approx ~{\hat {p}}\pm {\frac {z_{\alpha }}{\sqrt {n\ }}}{\sqrt {{\hat {p}}\left(1-{\hat {p}}\right)\ }}\ ,}

dónde pag^nortesnorte {\displaystyle \ {\hat {p}}\equiv {\frac {n_{\mathsf {s}}}{n}}\ }es la proporción de éxitos en un proceso de ensayo de Bernoulli y un estimador parapag{\displaystyle p}en la distribución de Bernoulli subyacente . La fórmula equivalente en términos de recuentos de observaciones es

pag  nortesnorte±zαnorte nortesnortenorteFnorte  ,{\displaystyle p~\approx ~{\frac {n_{\mathsf {s}}}{n}}\pm {\frac {z_{\alpha }}{\sqrt {n\ }}}{\sqrt {{\frac {n_{\mathsf {s}}}{n}}{\frac {n_{\mathsf {f}}}{n}}\ }}\ ,}

donde los datos son los resultados de norte {\displaystyle \ n\ }ensayos que arrojaron nortes {\displaystyle \ n_{\mathsf {s}}\ }éxitos y norteF=nortenortes {\displaystyle \ n_{\mathsf {f}}=n-n_{\mathsf {s}}\ }fallos. El argumento de la función de distribución zα {\displaystyle \ z_{\alpha }\ }es el 1α2 {\displaystyle \ 1-{\tfrac {\alpha }{2}}\ }cuantil de una distribución normal estándar (es decir, el probit ) correspondiente a la tasa de error objetivo α .{\displaystyle \ \alpha ~.}Para un nivel de confianza del 95%, el error α = 10,95 = 0,05 ,{\displaystyle \ \alpha ~=~1-0.95~=~0.05\ ,}de modo que 1α2=0,975 {\displaystyle \ 1-{\tfrac {\alpha }{2}}=0,975\ }y z0,05=1,96 .{\displaystyle \ z_{.05}=1,96~.}

Al utilizar la fórmula de Wald para estimar pag ,{\displaystyle \ p\ ,}o simplemente considerando los posibles resultados de este cálculo, dos problemas se hacen evidentes de inmediato:

  • Primero, para pag^ {\displaystyle \ {\sombrero {p}}\ }Al aproximarse a 1 o a 0 , el intervalo se reduce a un ancho cero (lo que implica falsamente certeza).
  • Segundo, para valores de pag^<11+norte/zα2 {\displaystyle \ {\hat {p}}<{\frac {1}{1+n/z_{\alpha }^{2}}}\ }(probabilidad demasiado baja / demasiado cercana a 0 ), los límites del intervalo se exceden [0,1] {\displaystyle \ [0,1]\ }( sobrepaso ).

(Otra versión del segundo problema de sobreimpulso surge cuando en lugar de 1pag^ {\displaystyle \ 1-{\sombrero {p}}\ }cae por debajo del mismo límite superior: probabilidad demasiado alta / demasiado cercana a 1.  )

Una derivación teórica importante de este intervalo de confianza implica la inversión de una prueba de hipótesis. Bajo esta formulación, el intervalo de confianza representa aquellos valores del parámetro poblacional que tendrían valores p grandes si se probaran como una proporción poblacional hipotética . El conjunto de valores, θ ,{\displaystyle \ \theta \ ,}para los cuales la aproximación normal es válida se puede representar como

{θ|yα  pag^θ1norte pag^(1pag^)   zα} ,{\displaystyle \left\{\quad \theta \quad {\Bigg \vert }\quad y_{\alpha }~\leq ~{\frac {{\hat {p}}-\theta }{\sqrt {{\tfrac {1}{n}}\ {\hat {p}}\left(1-{\hat {p}}\right)\ }}}~\leq ~z_{\alpha }\quad \right\}\ ,}

dónde yα {\displaystyle \ y_{\alpha }\ }es el menor α2 {\displaystyle \ {\tfrac {\alpha }{2}}\ }cuantil de una distribución normal estándar , vs. zα ,{\displaystyle \ z_{\alpha }\ ,}que es la superior ( es decir, 1α2 {\displaystyle \ 1-{\tfrac {\alpha }{2}}\ }) cuantil.

Dado que la prueba en medio de la desigualdad es una prueba de Wald , el intervalo de aproximación normal a veces se denomina intervalo de Wald o método de Wald , en honor a Abraham Wald , pero fue descrito por primera vez por Laplace (1812). [ 5 ]

Error estándar de una estimación de proporción al usar datos ponderados

Para aplicar correctamente los principios de los datos ponderados, es necesario comprender el tipo de ponderación [ 6 ] con la que se está trabajando. Para ponderaciones analíticas, se puede aplicar el siguiente cálculo.

Dejar incógnita1, , incógnitanorte {\displaystyle \ X_{1},\ \ldots ,\ X_{n}\ }sea ​​tal que cada incógnitai {\displaystyle \ X_{i}\ }es i.i.d. de una distribución de Bernoulli ( p ) y peso wi {\displaystyle \ w_{i}\ }es el peso para cada observación, con los pesos (positivos) wi {\displaystyle \ w_{i}\ }normalizados de modo que sumen 1. La proporción ponderada de la muestra es : pag^=i=1nortewiincógnitai .{\textstyle \ {\hat {p}}=\sum _{i=1}^{n}w_{i}X_{i}~.}Dado que cada uno de los incógnitai {\displaystyle \ X_{i}\ }es independiente de todos los demás, y cada uno tiene varianza var{ incógnitai }=pag(1pag) {\displaystyle \ \operatorname {var} \{\ X_{i}\ \}=p\left(1-p\right)\ }por cada i=1, , norte ;{\displaystyle \ i=1,\ \ldots ,\ n\ ;} la varianza muestral de la proporción es, por lo tanto: [ 7 ]

var{ pag^ } = i=1nortevar{ wiincógnitai } = pag(1pag)i=1nortewi2 .{\displaystyle \operatorname {var} \left\{\ {\hat {p}}\ \right\}~=~\sum _{i=1}^{n}\operatorname {var} \left\{\ w_{i}X_{i}\ \right\}~=~p\left(1-p\right)\sum _{i=1}^{n}w_{i}^{2}~.}

El error estándar de pag^ {\displaystyle \ {\hat {p}}\ }es la raíz cuadrada de esta cantidad. Porque no lo sabemos pag(1pag) ,{\displaystyle \ p\left(1-p\right)\ ,}tenemos que estimarlo. Aunque hay muchos estimadores posibles, uno convencional es usar pag^ ,{\displaystyle \ {\hat {p}}\ ,}la media muestral, y sustituimos este valor en la fórmula. Esto da como resultado:

SE{ pag^ }  pag^(1pag^)i=1nortewi2  .{\displaystyle \operatorname {SE} \left\{\ {\hat {p}}\ \right\}~\approx ~{\sqrt {{\hat {p}}\left(1-{\hat {p}}\right)\sum _{i=1}^{n}w_{i}^{2}~}}~.}

Para los datos que no están ponderados de otra manera, los pesos efectivos son uniformes. wi=1norte ,{\textstyle \ w_{i}={\frac {1}{n}}\ ,}donación i=1nortewi2=1norte .{\textstyle \ \sum _{i=1}^{n}w_{i}^{2}={\frac {1}{n}}~.}El SE {\displaystyle \ \operatorname {SE} \ }se convierte 1norte pag^(1pag^)  ,{\textstyle \ {\sqrt {{\tfrac {1}{n}}\ {\hat {p}}\left(1-{\hat {p}}\right)\ }}\ ,}Esto conduce a las fórmulas conocidas, demostrando que el cálculo para datos ponderados es una generalización directa de las mismas.

Si los pesos en cuestión son los pesos del diseño de muestreo complejo, se debe utilizar el software estadístico apropiado (paquete survey de R [ 8 ] ; paquete svy de Python [ 9 ] ) para obtener errores estándar corregidos para el diseño de muestreo de la encuesta . Una extensión del intervalo de Clopper-Pearson que se presenta a continuación para los datos de encuestas complejas también se conoce como intervalo de confianza de Korn-Graubard [ 10 ] . 

intervalo de puntuación de Wilson

Los intervalos de puntuación de Wilson se representan en una curva logística, revelando asimetría y un buen rendimiento para valores pequeños de n y donde p es igual o cercano a 0 o 1.

El intervalo de puntuación de Wilson fue desarrollado por EB Wilson (1927). [ 11 ] Es una mejora con respecto al intervalo de aproximación normal en múltiples aspectos: a diferencia del intervalo de aproximación normal simétrico (arriba), el intervalo de puntuación de Wilson es asimétrico y no sufre los problemas de sobreimpulso e intervalos de ancho cero que afectan al intervalo normal. Puede emplearse de forma segura con muestras pequeñas y observaciones sesgadas. [ 3 ] La probabilidad de cobertura observada está consistentemente más cerca del valor nominal, 1α .{\displaystyle \ 1-\alpha ~.}[ 2 ] [ 12 ] .

Al igual que el intervalo normal, el intervalo se puede calcular directamente a partir de una fórmula.

Wilson comenzó con la aproximación normal a la distribución binomial: zα  pagpag^σnorte{\displaystyle z_{\alpha }\ \approx \ {\frac {p-{\hat {p}}}{\sigma _{n}}}} dónde zα {\displaystyle \ z_{\alpha }\ }es la semianchura del intervalo normal estándar correspondiente al nivel de confianza deseado. 1α .{\displaystyle \ 1-\alpha ~.}La fórmula analítica para la desviación estándar de una muestra binomial es σnorte=pag(1pag)norte .{\displaystyle \sigma _{n}={\sqrt {\frac {p\left(1-p\right)}{n}}}~.} Combinando las dos y elevando al cuadrado el radical, se obtiene una ecuación que es cuadrática en pag :{\displaystyle \ p\ :} (pagpag^)2 =  zα2norte pag(1pag){\displaystyle \left(p-{\hat {p}}\right)^{2}~=~{\frac {\ z_{\alpha }^{2}}{n}}\ p\left(1-p\right)}o pag2  2 pag pag^ + pag^2 = pag zα2norte  pag2 zα2norte .{\displaystyle p^{2}\ -\ 2\ p\ {\hat {p}}\ +\ {\hat {p}}^{2}~=~p\ {\frac {z_{\alpha }^{2}}{n}}\ -\ p^{2}\ {\frac {z_{\alpha }^{2}}{n}}~.}Transformando la relación en una ecuación cuadrática de forma estándar para pag ,{\displaystyle \ p\ ,}tratamiento pag^ {\displaystyle \ {\hat {p}}\ }y norte {\displaystyle \ n\ }como valores conocidos de la muestra (ver sección anterior) y utilizando el valor de zα {\displaystyle \ z_{\alpha }\ }que corresponde a la confianza deseada 1α {\displaystyle \ 1-\alpha \ }para la estimación de pag {\displaystyle \ p\ }da esto: (1+zα2norte)pag2(2pag^+zα2norte)pag+( pag^2)=0 ,{\displaystyle \left(1+{\frac {z_{\alpha }^{2}}{n}}\right)p^{2}-\left(2{\hat {p}}+{\frac {z_{\alpha }^{2}}{n}}\right)p+{\biggl (}\ {\hat {p}}^{2}{\biggr )}=0\ ,} donde todos los valores entre paréntesis son cantidades conocidas. La solución para pag {\displaystyle \ p\ }estima los límites superior e inferior del intervalo de confianza para pag .{\displaystyle \ p~.}Por lo tanto, la probabilidad de éxito pag {\displaystyle \ p\ }se estima por pag^ {\displaystyle \ {\hat {p}}\ }y con 1α {\displaystyle \ 1-\alpha \ }confianza entre paréntesis en el intervalo pag  α( w,w+ ) = 11+zα2/norte( pag^+zα22 norte ± zα2 norte4 norte pag^(1pag^)+zα2  ){\displaystyle p~~{\underset {\approx }{\in }}_{\alpha }\;\left(\ w^{-},w^{+}\ \right)~=~{\frac {1}{1+z_{\alpha }^{2}/n}}\left(\ {\hat {p}}+{\frac {z_{\alpha }^{2}}{2\ n}}\ \pm \ {\frac {z_{\alpha }}{2\ n}}{\sqrt {4\ n\ {\hat {p}}\left(1-{\hat {p}}\right)+z_{\alpha }^{2}\ }}\ \right)}

dónde α {\displaystyle \ {\underset {\approx }{\in }}_{\alpha }\ }es una abreviatura de

PAG{ pag(w,w+) }=1α .{\displaystyle \operatorname {\mathbb {P} } \left\{\ p\in \left(w^{-},w^{+}\right)\ \right\}=1-\alpha ~.}

Una expresión equivalente utilizando el número de observaciones nortes {\displaystyle \ n_{\mathsf {s}}\ }y norteF {\displaystyle \ n_{\mathsf {f}}\ }es pag  α nortes+12 zα2 norte+zα2 ±  zα norte+zα2  nortes norteFnorte+ zα24  ,{\displaystyle p~~{\underset {\approx }{\in }}_{\alpha }\;{\frac {\ n_{\mathsf {s}}+{\tfrac {1}{2}}\ z_{\alpha }^{2}}{\ n+z_{\alpha }^{2}}}~\pm ~{\frac {\ z_{\alpha }}{~n+z_{\alpha }^{2}\ }}{\sqrt {{\frac {\ n_{\mathsf {s}}\ n_{\mathsf {f}}}{n}}+{\frac {\ z_{\alpha }^{2}}{4}}~}}\ ,}

con los recuentos indicados anteriormente: nortes{\displaystyle \ n_{\mathsf {s}}\equiv }el recuento de "éxitos" observados, norteF{\displaystyle \ n_{\mathsf {f}}\equiv }el recuento de "fallos" observados, y su suma es el número total de observaciones. norte=nortes+norteF .{\displaystyle \ n=n_{\mathsf {s}}+n_{\mathsf {f}}~.}

En las pruebas prácticas de los resultados de la fórmula, los usuarios encuentran que este intervalo tiene buenas propiedades incluso para un número pequeño de ensayos y/o los extremos de la estimación de probabilidad, pag^nortesnorte .{\displaystyle \ {\hat {p}}\equiv {\frac {n_{\mathsf {s}}}{n}}~.}[ 2 ] [ 3 ] [ 13 ]

Intuitivamente, el valor central de este intervalo es el promedio ponderado de pag^ {\displaystyle \ {\hat {p}}\ }y 12 ,{\textstyle \ {\tfrac {1}{2}}\ ,}con pag^ {\displaystyle \ {\hat {p}}\ }recibiendo mayor peso a medida que aumenta el tamaño de la muestra. Formalmente, el valor central corresponde al uso de un pseudoconteo de 12zα2 ,{\displaystyle \ {\tfrac {1}{2}}z_{\alpha }^{2}\ ,}El número de desviaciones estándar del intervalo de confianza: Sume este número tanto al recuento de éxitos como al de fracasos para obtener la estimación de la razón. Para el intervalo común de dos desviaciones estándar en cada dirección (aproximadamente una cobertura del 95%, que a su vez es aproximadamente 1,96  desviaciones estándar), esto produce la estimación nortes+2norte+4 ,{\displaystyle \ {\frac {n_{\mathsf {s}}+2}{n+4}}\ ,}que se conoce como la "regla de los cuatro más".

Aunque la ecuación cuadrática se puede resolver explícitamente, en la mayoría de los casos las ecuaciones de Wilson también se pueden resolver numéricamente utilizando la iteración de punto fijo.pagk+1=pag^±zα1nortepagk(1pagk) {\displaystyle p_{k+1}={\hat {p}}\pm z_{\alpha }{\sqrt {{\tfrac {1}{n}}p_{k}\left(1-p_{k}\right)~}}} con pag0=pag^ .{\displaystyle \ p_{0}={\hat {p}}~.}

El intervalo de Wilson también se puede derivar de la prueba z de una sola muestra o de la prueba chi-cuadrado de Pearson con dos categorías. El intervalo resultante,

{ θ|yα    pag^θ1norteθ(1θ)     zα } ,{\displaystyle \left\{~\theta \quad {\Bigg |}\quad y_{\alpha }~~\leq ~~{\frac {{\hat {p}}-\theta }{\sqrt {{\tfrac {\!1\!}{n}}\theta \left(1-\theta \right)~}}}~~\leq ~~z_{\alpha }~\right\}\ ,}

(conyα{\displaystyle y_{\alpha }}la parte inferiorα{\displaystyle \alpha }El cuantil) se puede resolver entonces paraθ{\displaystyle \theta }para producir el intervalo de puntuación de Wilson. La prueba en el medio de la desigualdad es una prueba de puntuación .

El principio de igualdad de intervalos

La función de densidad de probabilidad ( pdf ) para el intervalo de puntuación de Wilson, más las pdf en los límites del intervalo. Las áreas de las colas son iguales.

Dado que el intervalo se deriva resolviendo a partir de la aproximación normal a la binomial, el intervalo de puntuación de Wilson (w,w+) {\displaystyle \ \left(w^{-},w^{+}\right)\ }tiene la propiedad de garantizar la obtención del mismo resultado que la prueba z o la prueba chi-cuadrado equivalente .

Esta propiedad se puede visualizar graficando la función de densidad de probabilidad para el intervalo de puntuación de Wilson ( véase Wallis). [ 13 ] (pp. 399-421) Después, también se grafica una función de densidad de probabilidad normal en cada límite. Las áreas de las colas de las distribuciones de Wilson y normal resultantes representan la probabilidad de un resultado significativo; en esa dirección, deben ser iguales.

El intervalo de puntuación de Wilson corregido por continuidad y el intervalo de Clopper-Pearson también cumplen con esta propiedad. La importancia práctica radica en que estos intervalos pueden emplearse como pruebas de significancia , con resultados idénticos a los de la prueba original, y pueden derivarse nuevas pruebas mediante geometría. [ 13 ]

Intervalo de puntuación de Wilson con corrección de continuidad

El intervalo de Wilson puede modificarse empleando una corrección de continuidad , con el fin de alinear la probabilidad de cobertura mínima , en lugar de la probabilidad de cobertura promedio, con el valor nominal, 1α .{\displaystyle \ 1-\alpha ~.}

Así como el intervalo de Wilson refleja la prueba chi-cuadrado de Pearson , el intervalo de Wilson con corrección de continuidad refleja la prueba chi-cuadrado equivalente de Yates .

Las siguientes fórmulas para los límites inferior y superior del intervalo de puntuación de Wilson con corrección de continuidad (wdodo,wdodo+) {\displaystyle \ \left(w_{\mathsf {cc}}^{-},w_{\mathsf {cc}}^{+}\right)\ }se derivan de Newcombe: [ 2 ]wdodo=máximo{ 0, 2nortepag^+zα2[zαzα21norte+4nortepag^(1pag^)+(4pag^2) +1]2(norte+zα2) } ,wdodo+=min{  1,  2nortepag^+zα2+[zαzα21norte+4nortepag^(1pag^)(4pag^2) +1]2(norte+zα2)  } ,{\displaystyle {\begin{aligned}w_{\mathsf {cc}}^{-}&=\max \left\{~0,~{\frac {2n{\hat {p}}+z_{\alpha }^{2}-\left[z_{\alpha }{\sqrt {z_{\alpha }^{2}-{\frac {1}{n}}+4n{\hat {p}}\left(1-{\hat {p}}\right)+\left(4{\hat {p}}-2\right)~}}+1\right]}{2\left(n+z_{\alpha }^{2}\right)~}}\right\}\ ,\\w_{\mathsf {cc}}^{+}&=\min \left\{~~1,~~{\frac {2n{\hat {p}}+z_{\alpha }^{2}+\left[z_{\alpha }{\sqrt {z_{\alpha }^{2}-{\frac {1}{n}}+4n{\hat {p}}\left(1-{\hat {p}}\right)-\left(4{\hat {p}}-2\right)~}}+1\right]}{2\left(n+z_{\alpha }^{2}\right)~~}}\right\}\ ,\end{aligned}}} para pag^0 {\displaystyle \ {\hat {p}}\neq 0\ }y pag^1 .{\displaystyle \ {\hat {p}}\neq 1~.}

Si pag^=0 ,{\displaystyle \ {\hat {p}}=0\ ,}entonces wdodo {\displaystyle \ w_{\mathsf {cc}}^{-}\ }en su lugar debe establecerse en 0 ;{\displaystyle \ 0\ ;} si pag^=1 ,{\displaystyle \ {\hat {p}}=1\ ,}entonces wdodo+ {\displaystyle \ w_{\mathsf {cc}}^{+}\ }debe establecerse en su lugar 1 .{\displaystyle \ 1~.}

Wallis (2026) [ 13 ] identifica un método más simple para calcular intervalos de Wilson corregidos por continuidad que emplea una función especial basada en la fórmula de Wilson: En la notación de Wallis, para el límite inferior, sea Wilsonortelowmir( pag^, norte, α)  w = 1 1+zα2/norte ( pag^+zα22norte     zα2norte4nortepag^(1pag^)+zα2  ) ,{\displaystyle {\mathsf {Wilson_{lower}}}\!\left(\ {\hat {p}},\ n,\ \alpha \right)~\equiv ~w^{-}~=~{\frac {1}{~1+z_{\alpha }^{2}/n~}}{\Biggl (}\ {\hat {p}}+{\frac {\;z_{\alpha }^{2}}{2n}}~~-~~{\frac {\ z_{\alpha }}{2n}}{\sqrt {4n{\hat {p}}(1-{\hat {p}})+z_{\alpha }^{2}~}}~{\Biggr )}\ ,}dónde α {\displaystyle \ \alpha \ }es el nivel de error tolerable seleccionado para zα{\displaystyle \ z_{\alpha }}. El límite superior,Wilsonortepagpagmir{\displaystyle {\mathsf {Wilson_{upper}}}}se obtiene deWilsonortepagpagmir( pag^, norte, α)  w+ = 1 1+zα2/norte ( pag^+zα22norte  +   zα2norte4nortepag^(1pag^)+zα2  ) .{\displaystyle {\mathsf {Wilson_{upper}}}\!\left(\ {\hat {p}},\ n,\ \alpha \right)~\equiv ~w^{+}~=~{\frac {1}{~1+z_{\alpha }^{2}/n~}}{\Biggl (}\ {\hat {p}}+{\frac {\;z_{\alpha }^{2}}{2n}}~~+~~{\frac {\ z_{\alpha }}{2n}}{\sqrt {4n{\hat {p}}(1-{\hat {p}})+z_{\alpha }^{2}~}}~{\Biggr )}\ .}Entonces wdodo = Wilsonortelowmir( máximo{ pag^12norte, 0 }, norte,  α) ,{\displaystyle w_{\mathsf {cc}}^{-}~=~{\mathsf {Wilson_{lower}}}\!\left(\ \max \left\{\ {\hat {p}}-{\tfrac {1}{2n}},\ 0\ \right\},\ n,~~\alpha \right)~,}ywdodo+ = Wilsonortepagpagmir( min{ pag^+12norte, 1 }, norte,  α) .{\displaystyle w_{\mathsf {cc}}^{+}~=~{\mathsf {Wilson_{upper}}}\!\left(\ \min \left\{\ {\hat {p}}+{\tfrac {1}{2n}},\ 1\ \right\},\ n,~~\alpha \right)~.}Este método tiene la ventaja de ser aún más descomponible.

Para aplicar una corrección de continuidad al intervalo de Wilson con un ajuste de este tiponorte~{\displaystyle {\tilde {n}}}Modificamos el segundo parámetro de las fórmulas de Wilson de Wallis mencionadas anteriormente, pero mantenemos el término de ajuste de continuidad.12norte{\displaystyle {\tfrac {1}{2n}}}inalterado (Wallis 2026). [ 13 ]

Intervalo de Wilson con datos de encuestas complejas

Para datos de encuestas complejos, como cuando se toma una muestra de una población finita o se toma una muestra con ponderación y agrupamiento desiguales, el tamaño de la muestranorte{\displaystyle n}debe ser reemplazado por el tamaño efectivo de la muestranorte~=norte/DmiFF{\displaystyle {\tilde {n}}=n/{\rm {DEFF}}}Eso explica el efecto del diseño del muestreo.

También puede ser razonable reemplazar los cuantiles normales.zα{\displaystyle z_{\alpha }}con los cuantiles de distribución de Studenttα(d){\displaystyle t_{\alpha }(d)}dónded{\displaystyle d}son los grados de libertad del diseño de muestreo .

Intervalo de Jeffreys

Los intervalos de Jeffreys se representan en una curva logística, revelando asimetría y un buen rendimiento para valores pequeños de n y donde p es igual o cercano a 0 o 1.

El intervalo de Jeffreys tiene una derivación bayesiana, pero buenas propiedades frecuentistas (superando a la mayoría de las construcciones frecuentistas). En particular, tiene propiedades de cobertura similares a las del intervalo de Wilson, pero es uno de los pocos intervalos con la ventaja de tener colas iguales (por ejemplo, para un intervalo de confianza del 95%, las probabilidades de que el intervalo se encuentre por encima o por debajo del valor verdadero son ambas cercanas al 2,5%). En cambio, el intervalo de Wilson tiene un sesgo sistemático, de modo que está centrado demasiado cerca del valor verdadero.pag=0,5{\displaystyle p=0.5}. [ 14 ]

El intervalo de Jeffreys es el intervalo de credibilidad bayesiano que se obtiene al utilizar la distribución a priori no informativa de Jeffreys para la proporción binomial.pag .{\displaystyle p~.}La distribución previa de Jeffreys para este problema es una distribución Beta con parámetros(12,12),{\displaystyle \left({\tfrac {\!1\!}{2}},{\tfrac {\!1\!}{2}}\right),}una distribución a priori conjugada . Después de observarincógnita{\displaystyle x}éxitos ennorte{\displaystyle n}ensayos, la distribución posterior parapag{\displaystyle p}es una distribución Beta con parámetros(incógnita+12,norteincógnita+12) .{\displaystyle \left(x+{\tfrac {\!1\!}{2}},n-x+{\tfrac {\!1\!}{2}}\right)~.}

Cuandoincógnita0{\displaystyle x\neq 0}yincógnitanorte,{\displaystyle x\neq n,}El intervalo de Jeffreys se considera el100(1α)%{\displaystyle 100\left(1-\alpha \right)\mathrm {\%} }intervalo de probabilidad posterior de cola igual, es decir, el12α{\displaystyle {\tfrac {\!1\!}{2}}\alpha }y112α{\displaystyle 1-{\tfrac {\!1\!}{2}}\alpha }cuantiles de una distribución Beta con parámetros(incógnita+12,norteincógnita+12) .{\displaystyle \left(x+{\tfrac {1}{2}},n-x+{\tfrac {1}{2}}\right)~.}

Para evitar que la probabilidad de cobertura tienda a cero cuandopag0{\displaystyle p\to 0}o 1  , cuandoincógnita=0{\displaystyle x=0}el límite superior se calcula como antes pero el límite inferior se establece en 0  y cuandoincógnita=norte{\displaystyle x=n}El límite inferior se calcula como antes, pero el límite superior se establece en 1. [  4 ]

El intervalo de Jeffreys también puede considerarse un intervalo frecuentista basado en invertir el valor p de la prueba G después de aplicar la corrección de Yates para evitar un valor potencialmente infinito para el estadístico de prueba .

Intervalo de Clopper-Pearson

El intervalo de Clopper-Pearson es un método temprano y muy común para calcular intervalos de confianza binomiales. [ 15 ] A menudo se le llama método "exacto", ya que alcanza el nivel de cobertura nominal en un sentido exacto, lo que significa que el nivel de cobertura nunca es menor que el nominal.1α{\displaystyle 1-\alpha }. [ 2 ]

El intervalo de Clopper-Pearson se puede escribir como

SS{\displaystyle S_{\leq }\cap S_{\geq }}

o equivalentemente,

(infS,sorberS){\displaystyle \left(\inf S_{\geq },\sup S_{\leq }\right)}

con

S  { pag | PAG{ Papelera(norte;pag)incógnita}>α2 } {\displaystyle S_{\leq }~\equiv ~\left\{~p~{\Big |}~\operatorname {\mathbb {P} } \left\{~\operatorname {Bin} \left(n;p\right)\leq x\right\}>{\tfrac {\alpha }{2}}~\right\}~} y S  { pag | PAG{ Papelera(norte;pag)incógnita}>α2 },{\displaystyle S_{\geq }~\equiv ~\left\{~p~{\Big |}~\operatorname {\mathbb {P} } \left\{~\operatorname {Bin} \left(n;p\right)\geq x\right\}>{\tfrac {\alpha }{2}}~\right\},}

dónde0incógnitanorte{\displaystyle 0\leq x\leq n}es el número de éxitos observados en la muestra yBinorte(norte;pag){\displaystyle {\mathsf {Bin}}\left(n;p\right)}es una variable aleatoria binomial connorte{\displaystyle n}ensayos y probabilidad de éxitopag .{\displaystyle p~.}

De forma equivalente podemos decir que el intervalo de Clopper-Pearson es(incógnitanorteε1,incógnitanorte+ε2){\textstyle \left({\frac {\!x\!}{n}}-\varepsilon _{1},{\frac {\!x\!}{n}}+\varepsilon _{2}\right)}con nivel de confianza1α{\displaystyle 1-\alpha }siεi{\displaystyle \varepsilon _{i}}es el ínfimo de aquellos tales que las siguientes pruebas de hipótesis tienen éxito con significanciaα2:{\textstyle {\frac {\!\alpha \!}{2}}:}

  1. H 0 :pag=incógnitanorteε1{\displaystyle p={\frac {\!x\!}{n}}-\varepsilon _{1}}con H A :pag>incógnitanorteε1{\displaystyle p>{\frac {\!x\!}{n}}-\varepsilon _{1}}
  2. H 0 :pag=incógnitanorte+ε2{\displaystyle p={\frac {\!x\!}{n}}+\varepsilon _{2}}con H A :pag<incógnitanorte+ε2 .{\displaystyle p<{\frac {\!x\!}{n}}+\varepsilon _{2}~.}

Debido a una relación entre la distribución binomial y la distribución beta , el intervalo de Clopper-Pearson a veces se presenta en un formato alternativo que utiliza cuantiles de la distribución beta. [ 16 ]

B(α2;incógnita,norteincógnita+1) < pag < B(1α2;incógnita+1,norteincógnita){\displaystyle B\!\left({\tfrac {\!\alpha \!}{2}};x,n-x+1\right)~<~p~<~B\!\left(1-{\tfrac {\!\alpha \!}{2}};x+1,n-x\right)}

dóndeincógnita{\displaystyle x}es el número de éxitos,norte{\displaystyle n}es el número de ensayos, yB(pag;v,w){\displaystyle B\!\left(p;v,w\right)}es el cuantil p de una distribución beta con parámetros de formav{\displaystyle v}yw .{\displaystyle w~.}

De este modo,pagmin < pag< pagmáximo,{\displaystyle p_{\min }~<~p<~p_{\max },}dónde: Γ(norte+1)Γ(incógnita)Γ(norteincógnita+1)0pagmintincógnita1(1t)norteincógnitadt  =  α2,{\displaystyle {\tfrac {\Gamma (n+1)}{\Gamma \!(x)\Gamma \!(n-x+1)}}\int _{0}^{p_{\min }}t^{x-1}(1-t)^{n-x}\mathrm {d} \!t~~=~~{\tfrac {\!\alpha \!}{2}},}Γ(norte+1)Γ(incógnita+1)Γ(norteincógnita)0pagmáximotincógnita(1t)norteincógnita1dt = 1α2 .{\displaystyle {\tfrac {\Gamma (n+1)}{\Gamma (x+1)\Gamma (n-x)}}\int _{0}^{p_{\max }}t^{x}(1-t)^{n-x-1}\mathrm {d} \!t~=~1-{\tfrac {\!\alpha \!}{2}}~.} El intervalo de confianza de la proporción binomial es entonces(pagmin,pagmáximo),{\displaystyle \left(p_{\min },p_{\max }\right),}como se deduce de la relación entre la función de distribución acumulativa de la distribución binomial y la función beta incompleta regularizada .

Cuandoincógnita{\displaystyle x}es 0 onorte,{\displaystyle n,}Se dispone de expresiones de forma cerrada para los límites del intervalo: cuandoincógnita=0{\displaystyle x=0}el intervalo es (0,1(α2)1/norte){\textstyle \left(0,1-\left({\tfrac {\!\alpha \!}{2}}\right)^{1/n}\right)} y cuando incógnita=norte{\displaystyle x=n}es ((α2)1/norte,1) .{\textstyle \left(\left({\tfrac {\!\alpha \!}{2}}\right)^{1/n},1\right)~.}[ 16 ]

La distribución beta, a su vez, está relacionada con la distribución F, por lo que se puede escribir una tercera formulación del intervalo de Clopper-Pearson utilizando cuantiles F :

(1+norteincógnita+1incógnitaF[α2;2incógnita,2(norteincógnita+1)])1 < pag < (1+norteincógnita(incógnita+1)F[1α2;2(incógnita+1),2(norteincógnita)])1{\displaystyle \left(1+{\frac {n-x+1}{xF\!\left[{\tfrac {\alpha }{2}};2x,2(n-x+1)\right]}}\right)^{-1}~<~p~<~\left(1+{\frac {n-x}{(x+1)F\!\left[1-{\tfrac {\alpha }{2}};2(x+1),2(n-x)\right]}}\right)^{-1}}

dóndeincógnita{\displaystyle x}es el número de éxitos,norte{\displaystyle n}es el número de ensayos, yF(do;d1,d2){\displaystyle F\!\left(c;d_{1},d_{2}\right)}es eldo{\displaystyle c}cuantil de una distribución F cond1{\displaystyle d_{1}}yd2{\displaystyle d_{2}}grados de libertad. [ 17 ]

El intervalo de Clopper-Pearson es un intervalo "exacto", ya que se basa directamente en la distribución binomial en lugar de en cualquier aproximación a la misma. Este intervalo nunca tiene una cobertura menor que la nominal para ninguna proporción de la población, pero eso significa que suele ser conservador. Por ejemplo, la tasa de cobertura real de un intervalo de Clopper-Pearson del 95% puede ser muy superior al 95%, dependiendo denorte{\displaystyle n}ypag .{\displaystyle p~.}[ 4 ] Por lo tanto, el intervalo puede ser más amplio de lo necesario para alcanzar un 95 % de confianza, y más amplio que otros intervalos. En contraste, cabe señalar que otros intervalos de confianza pueden tener niveles de cobertura inferiores al nominal.1α,{\displaystyle 1-\alpha ,}Es decir, el intervalo de aproximación normal (o "estándar"), el intervalo de Wilson, [ 11 ] el intervalo de Agresti-Coull, [ 17 ] etc., con una cobertura nominal del 95%, de hecho pueden cubrir menos del 95%, [ 4 ] incluso para tamaños de muestra grandes. [ 16 ]

La definición del intervalo de Clopper-Pearson también puede modificarse para obtener intervalos de confianza exactos para diferentes distribuciones. Por ejemplo, también puede aplicarse al caso en que las muestras se extraen sin reemplazo de una población de tamaño conocido, en lugar de extracciones repetidas de una distribución binomial. En este caso, la distribución subyacente sería la distribución hipergeométrica .

Los límites del intervalo se pueden calcular con las funciones numéricas qbeta [ 18 ] en R y [ 19 ] en Python.scipy.stats.beta.ppf

from scipy.stats import beta import numpy as npk = 20 n = 400 alpha = 0.05 p_u , p_o = beta . ppf ([ alpha / 2 , 1 - alpha / 2 ], [ k , k + 1 ], [ n - k + 1 , n - k ]) if np . isnan ( p_o ): p_o = 1 if np . isnan ( p_u ): p_u = 0

Intervalo de Agresti-Coull

El intervalo de Agresti-Coull es también otro intervalo de confianza binomial aproximado. [ 17 ]

Dadonortes{\displaystyle n_{\mathsf {s}}}éxitos ennorte{\displaystyle n}ensayos, definir norte~norte+zα2{\displaystyle {\tilde {n}}\equiv n+z_{\alpha }^{2}}

y pag~=1norte~(nortes+zα22){\displaystyle {\tilde {p}}={\frac {1}{\tilde {n}}}\left(\!n_{\mathsf {s}}+{\tfrac {z_{\alpha }^{2}}{2}}\!\right)}

Luego, un intervalo de confianza parapag{\displaystyle p}es dado por

pag    pag~ ± zαpag~norte~(1pag~) {\displaystyle p~~\approx ~~{\tilde {p}}~\pm ~z_{\alpha }{\sqrt {{\frac {\!{\tilde {p}}\!}{\tilde {n}}}\left(\!1-{\tilde {p}}\!\right)~}}}

dóndezα=Φ-1(1α2){\displaystyle z_{\alpha }=\operatorname {\Phi ^{-1}} \!\!\left(1-{\tfrac {\!\alpha \!}{2}}\right)}es el cuantil de una distribución normal estándar, como antes (por ejemplo, un intervalo de confianza del 95% requiereα=0,05,{\displaystyle \alpha =0.05,}produciendo asíz0,05=1,96{\displaystyle z_{.05}=1.96}). Según Brown , Cai y DasGupta (2001), [ 4 ] tomandoz=2{\displaystyle z=2}en lugar de 1,96 produce el intervalo "sumar 2 éxitos y 2 fracasos" descrito previamente por Agresti y Coull . [ 17 ]

Este intervalo se puede resumir como el empleo del ajuste del punto central,pag~,{\displaystyle {\tilde {p}},}del intervalo de puntuación de Wilson, y luego aplicando la aproximación normal a este punto. [ 3 ] [ 4 ]

pag~=pag^+zα22norte1+zα2norte{\displaystyle {\tilde {p}}={\frac {\quad {\hat {p}}+{\frac {z_{\alpha }^{2}\!}{2n}}\quad }{\quad 1+{\frac {z_{\alpha }^{2}}{n}}\quad }}}

Transformación arcoseno

La transformación arcoseno tiene el efecto de resaltar los extremos de la distribución. [ 20 ] Si bien puede estabilizar la varianza (y por lo tanto los intervalos de confianza) de los datos de proporción, su uso ha sido criticado en varios contextos. [ 21 ]

Dejarincógnita{\displaystyle X}sea ​​el número de éxitos ennorte{\displaystyle n}pruebas y dejarpag=1norteincógnita .{\displaystyle p={\tfrac {1}{\!n\!}}\!X~.}La varianza depag{\displaystyle p}es

var{  pag  }=1nortepag(1pag) .{\displaystyle \operatorname {var} \{~~p~~\}={\tfrac {1}{\!n\!}}p(1-p)~.}

Utilizando la transformada arcoseno , la varianza del arcoseno depag {\displaystyle {\sqrt {p~}}}es [ 22 ]

var{  arcosenopag   }  var{  pag  }4pag(1pag)=pag(1pag)4nortepag(1pag)=14norte .{\displaystyle \operatorname {var} \left\{~~\arcsin {\sqrt {p~}}~~\right\}~\approx ~{\frac {\operatorname {var} \{~~p~~\}}{4p(1-p)}}={\frac {p(1-p)}{4np(1-p)}}={\frac {1}{4n}}~.}

Así pues, el intervalo de confianza en sí tiene la forma

pecado2(zα2norte+arcosenopag ) < θ < pecado2(+zα2norte+arcosenopag ),{\displaystyle \sin ^{2}\left(-{\frac {z_{\alpha }}{2{\sqrt {n}}}}+\arcsin {\sqrt {p}}~\right)~<~\theta ~<~\sin ^{2}\left(+{\frac {z_{\alpha }}{2{\sqrt {n}}}}+\arcsin {\sqrt {p}}~\right),}

dóndezα{\displaystyle z_{\alpha }}es el1α2{\displaystyle 1-{\tfrac {\!\alpha \!}{2}}}cuantil de una distribución normal estándar.

Este método puede utilizarse para estimar la varianza depag{\displaystyle p}pero su uso es problemático cuandopag{\displaystyle p}está cerca de 0 o 1  .

t una transformación

Dejarpag{\displaystyle p}sea ​​la proporción de éxitos. Para0a2,{\displaystyle 0\leq a\leq 2,}

ta=registro(paga(1pag)2a)=aregistropag(2a)registro(1pag){\displaystyle t_{a}=\log \left({\frac {p^{a}}{(1-p)^{2-a}}}\right)=a\log p-(2-a)\log(1-p)}

Esta familia es una generalización de la transformación logit , que es un caso especial con a = 1 y puede usarse para transformar una distribución de datos proporcional a una distribución aproximadamente normal . El parámetro a debe estimarse para el conjunto de datos .

Regla de tres: para cuando no se observan éxitos.

La regla de tres se utiliza para proporcionar una forma sencilla de establecer un intervalo de confianza aproximado del 95% parapag{\displaystyle p}, en el caso especial de que no haya éxitos (pag^=0{\displaystyle {\hat {p}}=0}) se han observado. [ 23 ] El intervalo es(0,3norte){\displaystyle \left(0,{\tfrac {3}{n}}\right)}.

Por simetría, en el caso de solo éxitos (pag^=1{\displaystyle {\hat {p}}=1}), el intervalo es(13norte,1){\displaystyle \left(1-{\tfrac {3}{n}},1\right)}.

Comparación y debate

Hay varios trabajos de investigación que comparan estos y otros intervalos de confianza para la proporción binomial. [ 3 ] [ 2 ] [ 24 ] [ 25 ] [ 12 ] [ 26 ]

Tanto Ross (2003) [ 27 ] como Agresti y Coull (1998) [ 17 ] señalan que los métodos exactos, como el intervalo de Clopper-Pearson, pueden no funcionar tan bien como algunas aproximaciones. El intervalo de aproximación normal y su presentación en los libros de texto han sido duramente criticados, y muchos estadísticos abogan por que no se utilice. [ 4 ] Los principales problemas son el sobreimpulso (los límites exceden [ 0, 1 ] ), intervalos de ancho cero enpag^=0{\displaystyle {\hat {p}}=0}o 1 (que implica falsamente certeza), [ 2 ] , cobertura inexacta (la cobertura real no es igual al nivel nominal, como el 95%) e inconsistencia general con las pruebas de significancia. [ 3 ]

De las aproximaciones enumeradas anteriormente, los métodos de intervalo de puntuación de Wilson (con o sin corrección de continuidad) han demostrado ser los más precisos y los más robustos, [ 3 ] [ 4 ] [ 2 ] [ 12 ] [ 26 ] aunque algunos prefieren el enfoque de Agresti y Coull para tamaños de muestra más grandes. [ 4 ] Los métodos de Wilson y Clopper-Pearson obtienen resultados consistentes con las pruebas de significancia de la fuente, [ 13 ] y esta propiedad es decisiva para muchos investigadores.

Muchos de estos intervalos se pueden calcular en R usando paquetes como binom [ 28 ] y survey [ 8 ] ; y en Python usando la función proportion_confint() de statsmodels [ 29 ]

Véase también

Referencias

  1. Sullivan, Lisa (27-10-2017). "Intervalos de confianza" . sphweb.bumc.bu.edu (apuntes del curso). Boston, MA: Escuela de Salud Pública de la Universidad de Boston . BS704.
  2. 1 2 3 4 5 6 7 8 Newcombe, RG (1998). "Intervalos de confianza bilaterales para la proporción única: comparación de siete métodos". Statistics in Medicine . 17 (8): 857– 872. doi : 10.1002/(SICI)1097-0258(19980430)17:8 < 857::AID-SIM777 > 3.0.CO ; 2-E . PMID 9595616 . 
  3. 1 2 3 4 5 6 7 Wallis, Sean A. (2013). "Intervalos de confianza binomiales y pruebas de contingencia: fundamentos matemáticos y evaluación de métodos alternativos" (PDF) . Journal of Quantitative Linguistics . 20 (3): 178– 208. doi : 10.1080/09296174.2013.799918 . S2CID 16741749 . 
  4. 1 2 3 4 5 6 7 8 9 Brown, Lawrence D. ; Cai, T. Tony ; DasGupta, Anirban (2001). "Estimación por intervalos para una proporción binomial". Statistical Science . 16 (2): 101– 133. CiteSeerX 10.1.1.50.3025 . doi : 10.1214/ss/1009213286 . MR 1861069 . Zbl 1059.62533 .   
  5. ^ Laplace, PS (1812). Théorie analytique des probabilités [ Teoría analítica de la probabilidad ] (en francés). Ve. Mensajero. pag. 283. 
  6. "¿Qué tipos de ponderaciones admiten los paquetes estadísticos?" . Oficina de Computación Avanzada para la Investigación, Métodos Estadísticos y Análisis de Datos de la UCLA .)
  7. "¿Cómo calcular el error estándar de una proporción usando datos ponderados?" . stats.stackexchange.com . 159220 / 253.
  8. 1 2 Lumley, Thomas. "survey: Analysis of Complex Survey Samples" . The Comprehensive R Archive Network . Recuperado el 1 de abril de 2026 .
  9. Diallo, Mamadou. "svy: Paquete de Python para el diseño y análisis de encuestas complejas" . Recuperado el 1 de abril de 2026 .
  10. Ward, Brian W. "kg_nchs: Un comando para intervalos de confianza de Korn-Graubard y estándares de presentación de datos para proporciones del Centro Nacional de Estadísticas de Salud" . The Stata Journal . 19 (3). Stata Corp: 510–522 . doi : 10.1177/1536867X19874 . Recuperado el 1 de abril de 2026 .
  11. 1 2 Wilson, EB (1927). "Inferencia probable, la ley de sucesión e inferencia estadística". Journal of the American Statistical Association . 22 (158): 209– 212. doi : 10.1080/01621459.1927.10502953 . JSTOR 2276774 . 
  12. 1 2 3 Dean, Natalie; Pagano, Marcello (diciembre de 2015). "Evaluación de métodos de intervalos de confianza para proporciones binomiales en encuestas agrupadas" . Journal of Survey Statistics and Methodology . 3 (4). American Association for Public Opinion Research: 484– 503. doi : 10.1093/jssam/smv024 .
  13. 1 2 3 4 5 6 Wallis, Sean A. (2026). Estadística en lingüística de corpus: Un nuevo enfoque (2.ª ed.). Nueva York, NY: Routledge. ISBN  9781003622697.
  14. Cai, TT (2005). "Intervalos de confianza unilaterales en distribuciones discretas". Journal of Statistical Planning and Inference . 131 (1): 63– 88. doi : 10.1016/j.jspi.2004.01.005 .
  15. Clopper, C.; Pearson, ES (1934). "El uso de límites de confianza o fiduciales ilustrado en el caso del binomial". Biometrika . 26 (4): 404– 413. doi : 10.1093/biomet/26.4.404 .
  16. 1 2 3 Thulin, Måns (2014-01-01). "El costo de usar intervalos de confianza exactos para una proporción binomial". Revista electrónica de estadística . 8 (1): 817– 840. arXiv : 1303.1288 . doi : 10.1214/14-EJS909 . ISSN 1935-7524 . S2CID 88519382 .  
  17. 1 2 3 4 5 Agresti, Alan ; Coull, Brent A. (1998). "Lo aproximado es mejor que lo 'exacto' para la estimación por intervalos de proporciones binomiales". The American Statistician . 52 (2): 119– 126. doi : 10.2307/2685469 . JSTOR 2685469. MR 1628435 .  
  18. "La distribución Beta" . stat.ethz.ch (documentación del software). Manual de R. Consultado el 2 de diciembre de 2023 .
  19. "scipy.stats.beta" . Manual de SciPy. docs.scipy.org (documentación del software) (ed. 1.11.4 ) . Consultado el 2 de diciembre de 2023 . 
  20. Holland, Steven. "Transformaciones de proporciones y porcentajes" . strata.uga.edu . Consultado el 8 de septiembre de 2020 .
  21. Warton, David I.; Hui, Francis KC (enero de 2011). "El arcoseno es absurdo: el análisis de proporciones en ecología" . Ecology . 92 (1): 3– 10. Bibcode : 2011Ecol...92....3W . doi : 10.1890/10-0340.1 . hdl : 1885/152287 . ISSN 0012-9658 . PMID 21560670 .  
  22. Shao, J. (1998). Estadística matemática . Nueva York, NY: Springer.
  23. Simon, Steve (2010). "Intervalo de confianza con cero eventos" . Ask Professor Mean. Kansas City, MO: The Children's Mercy Hospital. Archivado del original el 15 de octubre de 2011.Temas estadísticos sobre investigación médica
  24. Sauro, J.; Lewis, JR (2005). Comparación de las calculadoras de intervalos de Wald, Adj-Wald, exactos y de Wilson (PDF) . Sociedad de Factores Humanos y Ergonomía, 49.ª Reunión Anual (HFES 2005). Orlando, FL. págs. 2100–2104 . Archivado del original (PDF) el 18 de junio de 2012. 
  25. Reiczigel, J. (2003). " Intervalos de confianza para el parámetro binomial: algunas consideraciones nuevas" (PDF) . Statistics in Medicine . 22 (4): 611– 621. doi : 10.1002/sim.1320 . PMID 12590417. S2CID 7715293 .  
  26. 1 2 Franco, Carolina ; Little, Roderick JA; Louis, Thomas A; Slud, Eric V (septiembre de 2019). "Estudio comparativo de intervalos de confianza para proporciones en encuestas de muestras complejas" . Journal of Survey Statistics and Methodology . 7 (3). American Association for Public Opinion Research: 334–364 . doi : 10.1093/jssam/smy019 .
  27. Ross, TD (2003). "Intervalos de confianza precisos para la estimación de la proporción binomial y la tasa de Poisson" . Computers in Biology and Medicine . 33 (6): 509– 531. doi : 10.1016/S0010-4825(03)00019-2 . PMID 12878234 . 
  28. Dorai-Raj, Sundar (2 de mayo de 2022). binom: Intervalos de confianza binomiales para varias parametrizaciones (documentación del software) . Recuperado el 2 de diciembre de 2023 .
  29. "Documentación en línea de statsmodels" . Consultado el 14 de mayo de 2026 .