Articulo de referencia

Potencia (estadística)

En estadística frecuentista , la potencia estadística es la probabilidad de detectar un efecto (es decir, rechazar la hipótesis nula) dado que existe un efecto preespecificado, ...

En estadística frecuentista , la potencia estadística es la probabilidad de detectar un efecto (es decir, rechazar la hipótesis nula) dado que existe un efecto preespecificado, utilizando una prueba determinada en un contexto específico. En su uso habitual, depende de la prueba específica empleada (incluida la elección del estadístico de prueba y el nivel de significación ), del tamaño de la muestra (a mayor cantidad de datos, mayor potencia) y del tamaño del efecto (los efectos o correlaciones grandes en relación con la variabilidad de los datos tienden a proporcionar mayor potencia).

De manera más formal, en el caso de una prueba de hipótesis simple con dos hipótesis, la potencia de la prueba es la probabilidad de que la prueba rechace correctamente la hipótesis nula (H0{\displaystyle H_{0}}) cuando la hipótesis alternativa (H1{\displaystyle H_{1}}) es verdadero. Se suele denotar por1β{\displaystyle 1-\beta }, dóndeβ{\displaystyle \beta }es la probabilidad de cometer un error de tipo  II (un falso negativo ) condicionado a que exista un efecto o asociación verdadero.

Fondo

Las pruebas estadísticas utilizan datos de muestras para evaluar o inferir información sobre una población estadística . Por ejemplo, podemos medir el rendimiento de muestras de dos variedades de un cultivo y utilizar una prueba t de Student para determinar si los valores medios de dicho rendimiento difieren entre las variedades.

En el marco de la prueba de hipótesis frecuentista, esto se logra calculando un estadístico de prueba (como un estadístico t ) para el conjunto de datos, el cual posee una distribución de probabilidad teórica conocida si no existe diferencia (la llamada hipótesis nula). Si el valor real calculado en la muestra es suficientemente improbable que ocurra bajo la hipótesis nula, decimos que hemos identificado un efecto estadísticamente significativo.

El umbral de significancia puede establecerse bajo para garantizar que haya pocas probabilidades de detectar erróneamente un efecto inexistente. Sin embargo, no identificar un efecto significativo no implica que no existiera. Si insistimos en ser cuidadosos para evitar falsos positivos, podríamos generar falsos negativos. Quizás sea demasiado esperar que podamos encontrar evidencia suficientemente sólida de una diferencia muy sutil, incluso si existe. La potencia estadística es un intento de cuantificar este problema.

En el caso de la comparación de las dos variedades de cultivo, nos permite responder preguntas como:

  • ¿Existe un gran riesgo de que dos variedades muy diferentes produzcan muestras que, por pura casualidad, resulten indistinguibles?
  • ¿Cuánto esfuerzo debemos invertir en esta comparación para evitar ese peligro?
  • ¿Qué tan diferentes tienen que ser estas variedades para que podamos notar alguna diferencia?

Descripción

Ilustración de la potencia de una prueba estadística, para una prueba bilateral, a través de la distribución de probabilidad del estadístico de prueba bajo la hipótesis nula y la alternativa. α se muestra como el área azul , la probabilidad de rechazo bajo la hipótesis nula, mientras que el área roja muestra la potencia, 1 − β , la probabilidad de rechazar correctamente bajo la hipótesis alternativa. Nótese que, estrictamente hablando, existe un segundo valor crítico y un área de rechazo correspondiente bajo la hipótesis nula a la izquierda del gráfico, que corresponde a los casos en los que el estadístico se estima en el lado incorrecto de la hipótesis nula a pesar de que la alternativa sea verdadera. Esto se ignora en las implementaciones predeterminadas de los análisis de potencia, [ 1 ] ya que esta probabilidad suele ser muy pequeña y corresponde a un error de tipo S indeseable , no a un hallazgo útil.

Supongamos que estamos realizando una prueba de hipótesis. Definimos dos hipótesisH0{\displaystyle H_{0}}la hipótesis nula yH1{\displaystyle H_{1}}la hipótesis alternativa. Si diseñamos la prueba de tal manera que α sea el nivel de significancia ( siendo α la probabilidad de rechazarH0{\displaystyle H_{0}}cuandoH0{\displaystyle H_{0}}(es cierto) entonces la potencia de la prueba es 1 − β donde β es la probabilidad de no rechazarH0{\displaystyle H_{0}}cuando la alternativaH1{\displaystyle H_{1}}Es cierto.

Para que esto sea más concreto, una prueba estadística típica se basaría en un estadístico de prueba t calculado a partir de los datos muestreados, que tiene una distribución de probabilidad particular bajoH0{\displaystyle H_{0}}. Un nivel de significancia deseado α definiría entonces una "región de rechazo" correspondiente (limitada por ciertos "valores críticos"), un conjunto de valores t que es improbable que tome siH0{\displaystyle H_{0}}era correcto. Si rechazamosH0{\displaystyle H_{0}}a favor deH1{\displaystyle H_{1}}Solo cuando la muestra t toma esos valores, podríamos mantener la probabilidad de rechazar falsamente.H0{\displaystyle H_{0}}dentro de nuestro nivel de significancia deseado. Al mismo tiempo, siH1{\displaystyle H_{1}}define su propia distribución de probabilidad para t (la diferencia entre las dos distribuciones es una función del tamaño del efecto), la potencia de la prueba sería la probabilidad, bajoH1{\displaystyle H_{1}}que la muestra t cae en nuestra región de rechazo definida y causaH0{\displaystyle H_{0}}ser rechazado correctamente.

La potencia estadística es igual a uno menos la  probabilidad de error de tipo II y también representa la sensibilidad del procedimiento de prueba de hipótesis para detectar un efecto real. Generalmente, existe un equilibrio entre exigir pruebas más rigurosas (y, por lo tanto, regiones de rechazo más pequeñas) y tratar de lograr una alta probabilidad de rechazar la hipótesis nula bajo la hipótesis alternativa. La potencia estadística también puede extenderse al caso en que se prueban múltiples hipótesis basadas en un experimento o encuesta. Por lo tanto, también es común referirse a la potencia de un estudio , evaluando un proyecto científico en términos de su capacidad para responder a las preguntas de investigación que busca responder.

Aplicaciones

La principal aplicación de la potencia estadística es el "análisis de potencia", un cálculo de potencia que se suele realizar antes de llevar a cabo un experimento utilizando datos de estudios piloto o una revisión de la literatura. Los análisis de potencia se pueden utilizar para calcular el tamaño mínimo de muestra necesario para que sea razonablemente probable detectar un efecto de un tamaño determinado (es decir, producir un nivel de potencia aceptable). Por ejemplo: "¿Cuántas veces necesito lanzar una moneda para concluir que está trucada por una cierta cantidad?" [ 2 ] Si los recursos y, por lo tanto, los tamaños de muestra son fijos, los análisis de potencia también se pueden utilizar para calcular el tamaño mínimo del efecto que es probable que se detecte.

Las agencias de financiación, los comités de ética y los paneles de revisión de investigación suelen solicitar que un investigador realice un análisis de potencia. Un estudio con potencia insuficiente probablemente resulte inconcluso, al no permitir elegir entre hipótesis con el nivel de significación deseado, mientras que un estudio con potencia excesiva implicará un gran gasto para poder informar efectos significativos, incluso si son mínimos y, por lo tanto, prácticamente irrelevantes. Si se realizan numerosos estudios con potencia insuficiente y se publican resultados estadísticamente significativos , es más probable que los hallazgos publicados sean falsos positivos que resultados verdaderos, lo que contribuye a una crisis de replicación . Sin embargo, las exigencias excesivas de potencia podrían estar relacionadas con el desperdicio de recursos y problemas éticos, por ejemplo, el uso de un gran número de animales de experimentación cuando un número menor habría sido suficiente. También podría inducir a los investigadores que buscan financiación a sobreestimar el tamaño del efecto esperado o a evitar la búsqueda de efectos de interacción más sutiles que no se pueden detectar fácilmente. [ 3 ]

El análisis de potencia es principalmente una herramienta estadística frecuentista . En la estadística bayesiana , no se realizan pruebas de hipótesis del tipo utilizado en el análisis de potencia clásico. En el marco bayesiano, se actualizan las creencias previas utilizando los datos obtenidos en un estudio determinado. En principio, un estudio que se consideraría con poca potencia desde la perspectiva de la prueba de hipótesis aún podría utilizarse en dicho proceso de actualización. Sin embargo, la potencia sigue siendo una medida útil de cuánto se puede esperar que un tamaño de muestra determinado refine las creencias. Es improbable que un estudio con baja potencia conduzca a un cambio significativo en las creencias.

Además, el concepto de potencia se utiliza para comparar diferentes procedimientos de prueba estadística: por ejemplo, entre una prueba paramétrica y una no paramétrica de la misma hipótesis. Las pruebas pueden tener el mismo tamaño y, por lo tanto, las mismas tasas de falsos positivos, pero diferente capacidad para detectar efectos reales. La consideración de sus propiedades teóricas de potencia es una razón clave para el uso común de las pruebas de razón de verosimilitud .

Regla general para la prueba t

La regla general (aproximada) de Lehr [ 4 ] [ 5 ] dice que el tamaño de la muestranorte{\displaystyle n}(para cada grupo) para el caso común de una prueba t de dos muestras de dos lados con una potencia del 80% (β=0,2{\displaystyle \beta =0.2}) y nivel de significanciaα=0,05{\displaystyle \alpha =0.05}debería ser: norte16s2d2,{\displaystyle n\approx 16{\frac {s^{2}}{d^{2}}},} dóndes2{\displaystyle s^{2}}es una estimación de la varianza de la población yd=μ1μ2{\displaystyle d=\mu _{1}-\mu _{2}}la diferencia que se debe detectar en los valores medios de ambas muestras. Esta expresión se puede reorganizar, lo que implica, por ejemplo, que se obtiene una potencia del 80 % cuando se busca una diferencia en las medias que supera aproximadamente 4 veces el error estándar de la media del grupo .

Para una prueba t de una muestra, 16 debe reemplazarse por 8. Otros valores proporcionan una aproximación adecuada cuando la potencia o el nivel de significancia deseados son diferentes. [ 6 ]

Sin embargo, siempre se debe realizar un análisis de potencia completo para confirmar y refinar esta estimación.

Factores que influyen en el poder

Un ejemplo de la relación entre el tamaño de la muestra y los niveles de potencia. Una mayor potencia requiere muestras de mayor tamaño.

La potencia estadística puede depender de varios factores. Algunos factores pueden ser particulares de una situación de prueba específica, pero en el uso normal, la potencia depende de los siguientes tres aspectos que el profesional puede controlar:

Para una prueba dada, el criterio de significancia determina el grado de rigor deseado, especificando cuán improbable es que se rechace la hipótesis nula de ausencia de efecto si, de hecho, es verdadera. El umbral más comúnmente utilizado es una probabilidad de rechazo de 0,05, aunque a veces se utilizan valores menores como 0,01 o 0,001. Este umbral implica que la observación debe ser al menos tan improbable (quizás sugiriendo una estimación suficientemente grande de la diferencia) para considerarse evidencia suficientemente fuerte en contra de la hipótesis nula. Elegir un valor menor para ajustar el umbral, de modo que se reduzca la probabilidad de un falso positivo, también reduciría la potencia (y, por lo tanto, aumentaría la probabilidad de un falso negativo). Algunas pruebas estadísticas producirán inherentemente una mayor potencia , aunque a menudo a costa de requerir supuestos más fuertes.

La magnitud del efecto de interés define lo que se busca en la prueba. Puede ser el tamaño del efecto esperado , si existe, como una hipótesis científica a la que el investigador ha llegado y desea comprobar. Alternativamente, en un contexto más práctico, podría estar determinado por el tamaño que debe tener el efecto para ser útil, por ejemplo, el que se requiere para ser clínicamente significativo . El tamaño del efecto puede ser un valor directo de la cantidad de interés (por ejemplo, una diferencia en la media de un tamaño determinado), o puede ser una medida estandarizada que también tenga en cuenta la variabilidad en la población (como una diferencia en las medias expresada como un múltiplo de la desviación estándar). Si el investigador busca un efecto mayor, entonces debería ser más fácil encontrarlo con una configuración experimental o analítica dada, y por lo tanto, la potencia es mayor.

La naturaleza de la muestra determina la información utilizada en la prueba. Esto generalmente implica el tamaño de la muestra y su variabilidad, si no está implícita en la definición del tamaño del efecto. En términos más generales, la precisión con la que se miden los datos también puede ser un factor importante (como la fiabilidad estadística ), así como el diseño del experimento o estudio observacional. En última instancia, estos factores dan lugar a una cantidad esperada de error de muestreo . Un error de muestreo menor podría obtenerse con tamaños de muestra mayores de una población con menor variabilidad, con mediciones más precisas o con diseños experimentales más eficientes (por ejemplo, con el uso adecuado del bloqueo ), y dichos errores menores conducirían a una mayor potencia, aunque generalmente a un costo en recursos. Cómo se traduce un mayor tamaño de muestra en una mayor potencia es una medida de la eficiencia de la prueba; por ejemplo, el tamaño de muestra requerido para una potencia determinada. [ 7 ]

Discusión

El poder estadístico de una prueba de hipótesis tiene un impacto en la interpretación de sus resultados. No encontrar un resultado con un estudio más potente es una evidencia más fuerte en contra de la existencia del efecto que el mismo hallazgo con un estudio menos potente. Sin embargo, esto no es completamente concluyente. El efecto puede existir, pero ser menor de lo que se buscaba, lo que significa que el estudio en realidad tiene un poder insuficiente y la muestra es, por lo tanto, incapaz de distinguirlo del azar. [ 8 ] Muchos ensayos clínicos , por ejemplo, tienen un poder estadístico bajo para detectar diferencias en los efectos adversos de los tratamientos, ya que tales efectos pueden afectar solo a unos pocos pacientes, incluso si esta diferencia puede ser importante . [ 9 ] Las conclusiones sobre la probabilidad de la presencia real de un efecto también deben considerar más cosas que una sola prueba, especialmente porque el poder en el mundo real rara vez está cerca de 1.

De hecho, aunque no existen estándares formales para la potencia estadística, muchos investigadores y organismos financiadores la evalúan utilizando 0,80 (o 80 %) como estándar de adecuación. Esta convención implica una relación de compensación de cuatro a uno entre el riesgo β y el riesgo α , ya que la probabilidad de un  error de tipo II β se establece en 1 - 0,8 = 0,2, mientras que α, la probabilidad de un  error de tipo I, se suele establecer en 0,05. Algunas aplicaciones requieren niveles de potencia mucho mayores. Las pruebas médicas pueden diseñarse para minimizar el número de falsos negativos (  errores de tipo II) producidos al relajar el umbral de significación, lo que aumenta el riesgo de obtener un falso positivo (un  error de tipo I). La lógica es que es mejor decirle a un paciente sano "puede que hayamos encontrado algo; hagamos más pruebas" que decirle a un paciente enfermo "todo está bien". [ 10 ]

El análisis de potencia se centra en el rechazo correcto de una hipótesis nula. Sin embargo, otras consideraciones pueden motivar un experimento y, por lo tanto, generar diferentes necesidades de tamaño de muestra. En muchos contextos, la cuestión no radica tanto en decidir entre hipótesis, sino en obtener una estimación del tamaño del efecto poblacional con suficiente precisión. Por ejemplo, un análisis de potencia cuidadoso puede indicar que 55 pares de muestras con distribución normal y una correlación de 0,5 serán suficientes para otorgar una potencia del 80 % al rechazar una hipótesis nula que establece que la correlación no es mayor que 0,2 (utilizando una prueba unilateral, α  =  0,05). Pero el intervalo de confianza típico del 95 % con esta muestra estaría alrededor de [0,27, 0,67]. Se requeriría un análisis alternativo, aunque relacionado, si deseamos poder medir la correlación con una precisión de ± 0,1, lo que implica un tamaño de muestra diferente (en este caso, mayor). Alternativamente, múltiples estudios con potencia insuficiente aún pueden ser útiles, si se combinan adecuadamente mediante un metaanálisis .

Muchos análisis estadísticos implican la estimación de varias cantidades desconocidas. En casos sencillos, todas menos una de estas cantidades son parámetros de perturbación . En este contexto, la única potencia relevante se refiere a la cantidad que se someterá a inferencia estadística formal. En algunos casos, sobre todo si los objetivos son más exploratorios, puede haber varias cantidades de interés en el análisis. Por ejemplo, en un análisis de regresión múltiple podemos incluir varias covariables de interés potencial. En situaciones como esta, donde se consideran varias hipótesis, es común que las potencias asociadas a las diferentes hipótesis difieran. Por ejemplo, en un análisis de regresión múltiple, la potencia para detectar un efecto de un tamaño dado está relacionada con la varianza de la covariable. Dado que las diferentes covariables tendrán diferentes varianzas, sus potencias también diferirán.

Surgen complicaciones adicionales al considerar estas múltiples hipótesis en conjunto. Por ejemplo, si consideramos un falso positivo como un rechazo nulo erróneo de cualquiera de estas hipótesis, la probabilidad de este "error de familia" se verá incrementada si no se toman las medidas adecuadas. Dichas medidas suelen implicar la aplicación de un umbral de rigor mayor para rechazar una hipótesis (como con el método de Bonferroni ), lo que reduciría la potencia estadística. Alternativamente, puede haber diferentes nociones de potencia estadística relacionadas con la forma en que se consideran las distintas hipótesis. La "potencia estadística completa" exige que se detecten todos los efectos verdaderos en todas las hipótesis, lo cual es un requisito mucho más estricto que la "potencia estadística mínima" de poder encontrar al menos un efecto verdadero, un tipo de potencia que podría aumentar con un mayor número de hipótesis. [ 11 ]

Análisis a priori frente a análisis post hoc

El análisis de potencia puede realizarse antes ( análisis de potencia a priori o prospectivo) o después (análisis de potencia post hoc o retrospectivo) de la recopilación de datos. El análisis de potencia a priori se lleva a cabo antes del estudio de investigación y se utiliza normalmente para estimar tamaños de muestra suficientes para lograr una potencia adecuada. El análisis post hoc de la "potencia observada" se realiza después de que se haya completado un estudio y utiliza el tamaño de muestra y el tamaño del efecto obtenidos para determinar cuál fue la potencia en el estudio, asumiendo que el tamaño del efecto en la muestra es igual al tamaño del efecto en la población. Si bien la utilidad del análisis de potencia prospectivo en el diseño experimental es universalmente aceptada, el análisis de potencia post hoc es controvertido. Muchos estadísticos han argumentado que los cálculos de potencia post hoc son engañosos y esencialmente carecen de sentido. [ 12 ] [ 13 ]

Ejemplo

El siguiente es un ejemplo que muestra cómo calcular la potencia para un experimento aleatorio: Supongamos que el objetivo de un experimento es estudiar el efecto de un tratamiento sobre alguna cantidad, y por lo tanto compararemos sujetos de investigación midiendo la cantidad antes y después del tratamiento, analizando los datos utilizando una prueba t pareada unilateral , con un umbral de nivel de significancia de 0,05. Estamos interesados ​​en poder detectar un cambio positivo de tamañoθ>0{\displaystyle \theta >0}.

Primero planteamos el problema de acuerdo con nuestra prueba.Ai{\displaystyle A_{i}}yBi{\displaystyle B_{i}}denotan las medidas previas y posteriores al tratamiento en el sujetoi{\displaystyle i}respectivamente. El posible efecto del tratamiento debería ser visible en las diferencias.Di=BiAi,{\displaystyle D_{i}=B_{i}-A_{i},}que se suponen independientes e idénticamente normales en distribución, con un valor medio desconocido.μD{\displaystyle \mu _{D}}y varianzaσD2{\displaystyle \sigma _{D}^{2}}.

Aquí, es natural elegir nuestra hipótesis nula de que la diferencia media esperada es cero, es decirH0:μD=μ0=0.{\displaystyle H_{0}:\mu _{D}=\mu _{0}=0.}Para nuestra prueba unilateral, la hipótesis alternativa sería que existe un efecto positivo, correspondiente aH1:μD=θ>0.{\displaystyle H_{1}:\mu _{D}=\theta >0.}El estadístico de prueba en este caso se define como:

Tnorte=D¯norteμ0σ^D/norte=D¯norte0σ^D/norte,{\displaystyle T_{n}={\frac {{\bar {D}}_{n}-\mu _{0}}{{\hat {\sigma }}_{D}/{\sqrt {n}}}}={\frac {{\bar {D}}_{n}-0}{{\hat {\sigma }}_{D}/{\sqrt {n}}}},}

dóndeμ0{\displaystyle \mu _{0}}es la media bajo la hipótesis nula, por lo que sustituimos en 0, n es el tamaño de la muestra (número de sujetos),D¯norte{\displaystyle {\bar {D}}_{n}}es la media muestral de la diferencia

D¯norte=1nortei=1norteDi,{\displaystyle {\bar {D}}_{n}={\frac {1}{n}}\sum _{i=1}^{n}D_{i},}

yσ^D{\displaystyle {\hat {\sigma }}_{D}}es la desviación estándar muestral de la diferencia.

Solución analítica

Podemos proceder según nuestros conocimientos de teoría estadística, aunque en la práctica, para un caso estándar como este, existirá software para calcular respuestas más precisas.

Gracias a la teoría de la prueba t, sabemos que este estadístico de prueba bajo la hipótesis nula sigue una distribución t de Student connorte1{\displaystyle n-1}grados de libertad. Si deseamos rechazar la hipótesis nula al nivel de significanciaα=0,05{\displaystyle \alpha =0.05\,}Debemos encontrar el valor crítico.tα{\displaystyle t_{\alpha }}de tal manera que la probabilidad deTnorte>tα{\displaystyle T_{n}>t_{\alpha }}bajo el valor nulo es igual aα{\displaystyle \alpha }Si n es grande, la distribución t converge a la distribución normal estándar (por lo que ya no involucra a n ) y así mediante el uso de la función cuantil correspondiente .Φ1{\displaystyle \Phi ^{-1}}, obtenemos que la hipótesis nula debe ser rechazada si

Tnorte>tαΦ1(0,95)1,64.{\displaystyle T_{n}>t_{\alpha }\approx \Phi ^{-1}(0.95)\approx 1.64\,.}

Ahora supongamos que la hipótesis alternativaH1{\displaystyle H_{1}}es cierto entoncesμD=θ{\displaystyle \mu _{D}=\theta }. Luego, escribiendo la potencia como una función del tamaño del efecto,B(θ){\displaystyle B(\theta )}, encontramos la probabilidad deTnorte{\displaystyle T_{n}}estar arribatα{\displaystyle t_{\alpha }}bajoH1{\displaystyle H_{1}}.

B(θ)Pr(Tnorte>1,64 | μD=θ)=Pr(D¯norte0σ^D/norte>1,64 | μD=θ)=1Pr(D¯norte0σ^D/norte<1,64 | μD=θ)=1Pr(D¯norteθσ^D/norte<1,64θσ^D/norte | μD=θ){\displaystyle {\begin{aligned}B(\theta )&\approx \Pr \left(T_{n}>1.64~{\big |}~\mu _{D}=\theta \right)\\&=\Pr \left({\frac {{\bar {D}}_{n}-0}{{\hat {\sigma }}_{D}/{\sqrt {n}}}}>1.64~{\Big |}~\mu _{D}=\theta \right)\\&=1-\Pr \left({\frac {{\bar {D}}_{n}-0}{{\hat {\sigma }}_{D}/{\sqrt {n}}}}<1.64~{\Big |}~\mu _{D}=\theta \right)\\&=1-\Pr \left({\frac {{\bar {D}}_{n}-\theta }{{\hat {\sigma }}_{D}/{\sqrt {n}}}}<1.64-{\frac {\theta }{{\hat {\sigma }}_{D}/{\sqrt {n}}}}~{\Big |}~\mu _{D}=\theta \right)\\\end{aligned}}}

D¯norteθσ^D/norte{\displaystyle {\frac {{\bar {D}}_{n}-\theta }{{\hat {\sigma }}_{D}/{\sqrt {n}}}}}nuevamente sigue una distribución t de Student bajoH1{\displaystyle H_{1}}, convergiendo en una distribución normal estándar para n grande . La estimaciónσ^D{\displaystyle {\hat {\sigma }}_{D}}también convergerá en su valor poblacionalσD{\displaystyle \sigma _{D}}Por lo tanto, la potencia puede aproximarse como

B(θ)1Φ(1,64θσD/norte).{\displaystyle B(\theta )\approx 1-\Phi \left(1.64-{\frac {\theta }{\sigma _{D}/{\sqrt {n}}}}\right).}

Según esta fórmula, la potencia aumenta con los valores del tamaño del efecto.θ{\displaystyle \theta }y el tamaño de la muestra n , y se reduce con el aumento de la variabilidad.σD{\displaystyle \sigma _{D}}En el caso trivial de un tamaño del efecto cero, la potencia es mínima ( ínfimo ) e igual al nivel de significancia de la prueba.α,{\displaystyle \alpha \,,}en este ejemplo 0,05. Para tamaños de muestra finitos y variabilidad distinta de cero, es el caso aquí, como es típico, que la potencia no puede ser igual a 1 excepto en el caso trivial dondeα=1{\displaystyle \alpha =1}Por lo tanto, el valor nulo siempre se rechaza.

Podemos invertirB{\displaystyle B}para obtener los tamaños de muestra requeridos:

norte>σDθ(1,64Φ1(1B(θ))).{\displaystyle {\sqrt {n}}>{\frac {\sigma _{D}}{\theta }}\left(1.64-\Phi ^{-1}\left(1-B(\theta )\right)\right).}

Suponerθ=1{\displaystyle \theta =1}y creemosσD{\displaystyle \sigma _{D}}es alrededor de 2, digamos, entonces requerimos para una potencia deB(θ)=0,8{\displaystyle B(\theta )=0.8}, un tamaño de muestra

norte>4(1,64Φ1(10,8))24(1,64+0,84)224.6.{\displaystyle n>4\left(1.64-\Phi ^{-1}\left(1-0.8\right)\right)^{2}\approx 4\left(1.64+0.84\right)^{2}\approx 24.6.}

Solución de simulación

Alternativamente podemos utilizar un método de simulación de Monte Carlo que funciona de manera más general. [ 14 ] Una vez más, volvemos a la suposición de la distribución deDnorte{\displaystyle D_{n}}y la definición deTnorte{\displaystyle T_{n}}Supongamos que tenemos valores fijos para el tamaño de la muestra, la variabilidad y el tamaño del efecto, y deseamos calcular la potencia estadística. Podemos adoptar este proceso:

1. Generar una gran cantidad de conjuntos deDnorte{\displaystyle D_{n}}Según la hipótesis nula,norte(0,σD){\displaystyle N(0,\sigma _{D})}

2. Calcular el estadístico de prueba resultante.Tnorte{\displaystyle T_{n}}para cada conjunto.

3. Calcular el(1α){\displaystyle (1-\alpha )}cuantil n de la simulaciónTnorte{\displaystyle T_{n}}y usar eso como una estimación detα{\displaystyle t_{\alpha }}.

4. Ahora genere una gran cantidad de conjuntos deDnorte{\displaystyle D_{n}}Según la hipótesis alternativa,norte(θ,σD){\displaystyle N(\theta ,\sigma _{D})}y calcular de nuevo las estadísticas de prueba correspondientes.

5. Observa la proporción de estas alternativas simuladas.Tnorte{\displaystyle T_{n}}que están por encima de latα{\displaystyle t_{\alpha }}calculados en el paso 3 y por lo tanto son rechazados. Esta es la potencia.

Esto se puede realizar con diversos programas informáticos. Al aplicar esta metodología con los valores anteriores, al establecer el tamaño de la muestra en 25 se obtiene una potencia estimada de alrededor de 0,78. La pequeña discrepancia con la sección anterior se debe principalmente a imprecisiones en la aproximación normal.

El poder en diferentes disciplinas

Varios estudios han intentado estimar los niveles típicos de potencia estadística en diferentes campos académicos. Un enfoque común utiliza metaanálisis para evaluar si los estudios individuales tienen suficiente potencia para detectar el tamaño del efecto promedio estimado a partir del propio metaanálisis. Este método básicamente pregunta: ¿qué probabilidad hay de que cada estudio detecte el efecto consensuado encontrado en la literatura más amplia? Estas evaluaciones encuentran consistentemente bajos niveles de potencia estadística en muchas disciplinas. Por ejemplo, utilizando este método, la potencia mediana es del 18 % en economía, [ 15 ] del 10 % en ciencias políticas, [ 16 ] del 36 % en psicología, [ 17 ] y del 15 % en ecología y biología evolutiva. [ 18 ]

Extensión

Poder bayesiano

En el enfoque frecuentista , se asume que los parámetros tienen un valor específico, lo cual es improbable. Este problema se puede solucionar asumiendo que el parámetro sigue una distribución. La potencia resultante se conoce a veces como potencia bayesiana, que se utiliza comúnmente en el diseño de ensayos clínicos .

Probabilidad predictiva de éxito

Tanto la potencia frecuentista como la bayesiana utilizan la significación estadística como criterio de éxito. Sin embargo, la significación estadística a menudo no basta para definir el éxito. Para abordar este problema, el concepto de potencia puede extenderse al concepto de probabilidad predictiva de éxito (PPOS). El criterio de éxito para la PPOS no se limita a la significación estadística y se utiliza comúnmente en el diseño de ensayos clínicos .

Software para cálculos de potencia y tamaño de muestra.

Existen numerosos programas gratuitos y/o de código abierto disponibles para realizar cálculos de potencia y tamaño de muestra. Estos incluyen:

  • G*Power ( https://www.gpower.hhu.de/ )
  • WebPower Análisis de potencia estadística gratuito en línea ( https://webpower.psychstat.org )
  • Calculadoras online gratuitas y de código abierto ( https://powerandsamplesize.com )
  • PowerUp! proporciona funciones basadas en Excel para determinar el tamaño mínimo del efecto detectable y el tamaño mínimo de muestra requerido para diversos diseños experimentales y cuasiexperimentales.
  • PowerUpR es la versión en R del paquete PowerUp! e incluye, además, funciones para determinar el tamaño de la muestra para diversos experimentos aleatorios multinivel con o sin restricciones presupuestarias.
  • Paquete R pwr ( https://cran.r-project.org/web/packages/pwr/ )
  • Paquete R WebPower ( https://cran.r-project.org/web/packages/WebPower/index.html )
  • Paquete R Spower ( https://cran.r-project.org/web/packages/Spower/index.html ) para análisis de potencia de propósito general mediante experimentos de simulación.
  • Modelos de estadísticas del paquete Python ( https://www.statsmodels.org/ )

Véase también

Referencias

  1. Peter Dalgaard. "Cálculos de potencia para la prueba de dos muestras para proporciones" . Documentación de R.
  2. "Potencia estadística y estadísticas con potencia insuficiente: Estadísticas mal aplicadas" . www.statisticsdonewrong.com . Consultado el 30 de septiembre de 2019 .
  3. Nakagawa, Shinichi; Lagisz, Malgorzata; Yang, Yefeng; Drobniak, Szymon M. (2024). "Encontrar el equilibrio de poder adecuado: un mejor diseño de estudio y la colaboración pueden reducir la dependencia del poder estadístico" . PLOS Biology . 22 (1) e3002423. doi : 10.1371/journal.pbio.3002423 . PMC 10773938. PMID 38190355 .  
  4. Robert Lehr (1992), "Dieciséis S al cuadrado sobre D al cuadrado: una relación para estimaciones aproximadas del tamaño de la muestra", Statistics in Medicine (en alemán), vol. 11, n.º 8, págs. 1099–1102, doi : 10.1002/sim.4780110811 , ISSN 0277-6715 , PMID 1496197     
  5. van Belle, Gerald (18 de agosto de 2008). Reglas estadísticas prácticas, segunda edición . Serie Wiley en probabilidad y estadística. Hoboken, NJ, EE. UU.: John Wiley & Sons, Inc. doi : 10.1002/9780470377963 . ISBN 978-0-470-37796-3.
  6. Estimación del tamaño de la muestra en la investigación clínica: desde ensayos controlados aleatorizados hasta estudios observacionales, 2020, doi: 10.1016/j.chest.2020.03.010, Xiaofeng Wang, PhD; y Xinge Ji, MS pdf
  7. Everitt, Brian S. (2002). The Cambridge Dictionary of Statistics . Cambridge University Press. p. 321. ISBN  0-521-81099-X.
  8. Ellis, Paul (2010). The Essential Guide to Effect Sizes: Statistical Power, Meta-Analysis, and the Interpretation of Research Results . Cambridge University Press. p. 52. ISBN  978-0-521-14246-5.
  9. Tsang, R.; Colley, L.; Lynd, LD (2009). "Potencia estadística insuficiente para detectar diferencias clínicamente significativas en las tasas de eventos adversos en ensayos controlados aleatorizados". Journal of Clinical Epidemiology . 62 (6): 609– 616. doi : 10.1016/j.jclinepi.2008.08.005 . PMID 19013761 . 
  10. Ellis, Paul D. (2010). The Essential Guide to Effect Sizes: An Introduction to Statistical Power, Meta-Analysis and the Interpretation of Research Results . Reino Unido: Cambridge University Press. pág. 56. 
  11. "Estimación de la potencia estadística al utilizar procedimientos de pruebas múltiples" . mdrc.org . Noviembre de 2017.
  12. Hoenig; Heisey (2001). "El abuso de poder". The American Statistician . 55 (1): 19– 24. doi : 10.1198/000313001300339897 .
  13. Thomas, L. (1997). "Análisis de potencia retrospectivo" (PDF) . Conservation Biology . 11 (1): 276– 280. Bibcode : 1997ConBi..11..276T . doi : 10.1046/j.1523-1739.1997.96102.x . hdl : 10023/679 .
  14. Graebner, Robert W. (1999). Diseño de estudios con SAS: Estimación de la potencia con métodos de Monte Carlo (PDF) . SUGI 24.
  15. ^ Ioannidis, John PA; Stanley, TD; Doucouliagos, Hristos (1 de octubre de 2017). "El poder del sesgo en la investigación económica". La Revista Económica . 127 (605): F236– F265. doi : 10.1111/ecoj.12461 .
  16. ^ Arel-Bundock, Vicente; Briggs, Ryan C; Doucouliagos, Hristos; Mendoza Aviña, Marco; Stanley, Td (13 de diciembre de 2024). "La investigación cuantitativa en ciencias políticas tiene muy poca potencia". La Revista de Política . doi : 10.1086/734279 .
  17. Stanley, TD; Carter, Evan C.; Doucouliagos, Hristos (diciembre de 2018). "Lo que revelan los metaanálisis sobre la replicabilidad de la investigación psicológica". Psychological Bulletin . 144 (12): 1325– 1346. doi : 10.1037/bul0000169 . PMID 30321017 . 
  18. Yang, Yefeng; Sánchez-Tójar, Alfredo; O'Dea, Rose E.; Noble, Daniel WA; Koricheva, Julia; Jennions, Michael D.; Parker, Timothy H.; Lagisz, Malgorzata; Nakagawa, Shinichi (3 de abril de 2023). "El sesgo de publicación impacta en el tamaño del efecto, la potencia estadística y los errores de magnitud (tipo M) y signo (tipo S) en ecología y biología evolutiva" . BMC Biology . 21 (1) 71. doi : 10.1186/s12915-022-01485-y . PMC 10071700. PMID 37013585 .  

Fuentes

  • Cohen, J. (1988). Análisis de potencia estadística para las ciencias del comportamiento (2.ª  ed.). Lawrence Erlbaum Associates. ISBN 0-8058-0283-5.
  • Aberson, CL (2010). Análisis de potencia aplicada a las ciencias del comportamiento . Routledge. ISBN 978-1-84872-835-6.
  • StatQuest: Errores comunes en el cálculo del valor p y la potencia estadística en YouTube