En estadística, las pruebas de hipótesis casi seguras (o pruebas as) utilizan la convergencia casi segura para determinar la validez de una hipótesis estadística con probabilidad uno. Esto significa que, siempre que la hipótesis nula sea verdadera, una prueba as no la rechazará con probabilidad uno para todas las muestras suficientemente grandes. De manera similar, siempre que la hipótesis alternativa sea verdadera, una prueba as rechazará la hipótesis nula con probabilidad uno para todas las muestras suficientemente grandes. En este mismo sentido, un intervalo de confianza as contiene el parámetro de interés con probabilidad uno. Dembo y Peres (1994) demostraron la existencia de pruebas de hipótesis casi seguras.
Descripción
Para simplificar, supongamos que tenemos una secuencia de variables aleatorias normales independientes e idénticamente distribuidas ,, con mediay varianza unitaria. Supongamos que la naturaleza o la simulación han elegido la media verdadera como, entonces la función de distribución de probabilidad de la media,, se da por
donde se ha utilizado un corchete de Iverson . Un enfoque ingenuo para estimar esta función de distribución sería reemplazar la media verdadera en el lado derecho con una estimación como la media muestral,, pero
lo que significa que la aproximación a la verdadera función de distribución tendrá un desfase de 0,5 en la media verdadera. Sin embargo,no es más que un intervalo de confianza unilateral del 50%; más generalmente, dejemosser el valor crítico utilizado en un análisis unilateralintervalo de confianza, entonces
Si establecemos, entonces el error de la aproximación se reduce de 0,5 a 0,05, lo que es un factor de 10. Por supuesto, si dejamos, entonces
Sin embargo, esto solo muestra que la expectativa está cerca del valor límite. Naaman (2016) demostró que establecer el nivel de significancia encon da como resultado un número finito de errores de tipo I y tipo II wp1 bajo condiciones de regularidad bastante suaves. Esto significa que para cada, existe un, de tal manera que para todo,
donde la igualdad se cumple wp 1. Por lo tanto, la función indicadora de un intervalo de confianza unilateral es una buena aproximación a la verdadera función de distribución.
Aplicaciones
Parada opcional
Por ejemplo, supongamos que una investigadora realizó un experimento con un tamaño de muestra de 10 y no encontró un resultado estadísticamente significativo. Luego, supongamos que decidió agregar una observación más y volver a realizar la prueba, continuando este proceso hasta encontrar un resultado significativo. En este escenario, dado que el lote inicial de 10 observaciones resultó en un resultado no significativo, la probabilidad de que el experimento se detenga en algún tamaño de muestra finito, , puede acotarse utilizando la desigualdad de Boole.
dóndeEsto se compara favorablemente con las pruebas de nivel de significancia fijo que tienen un tiempo de parada finito con probabilidad uno; sin embargo, este límite no será significativo para todas las secuencias de nivel de significancia, ya que la suma anterior puede ser mayor que uno (estableciendosería un ejemplo). Pero incluso usando ese ancho de banda, si las pruebas se hicieran en lotes de 10, entonces
lo que resulta en una probabilidad relativamente alta de que el proceso nunca termine.
Sesgo de publicación
Como otro ejemplo del poder de este enfoque, si una revista académica solo acepta artículos con valores p menores a 0,05, entonces aproximadamente 1 de cada 20 estudios independientes del mismo efecto encontraría un resultado significativo cuando no lo hubiera. Sin embargo, si la revista requiriera un tamaño de muestra mínimo de 100 y un nivel de significancia máximo dado por, entonces cabría esperar que aproximadamente 1 de cada 250 estudios encontrara un efecto cuando no lo hubiera (si el tamaño mínimo de la muestra fuera 30, seguiría siendo 1 de cada 60). Si el nivel máximo de significancia estuviera dado por(que tendrá un mejor desempeño con muestras pequeñas con respecto al error de tipo I cuando las comparaciones múltiples son un problema), se esperaría que aproximadamente 1 de cada 10 000 estudios encontrara un efecto cuando no lo hubiera (si el tamaño mínimo de la muestra fuera 30, sería 1 de cada 900). Además, la prueba de hipótesis AS es robusta ante las comparaciones múltiples.
Paradoja de Jeffreys-Lindley
La paradoja de Lindley ocurre cuando
- El resultado es "significativo" según una prueba frecuentista, por ejemplo, al nivel del 5%, lo que indica evidencia suficiente para rechazar la hipótesis nula, y
- La probabilidad posterior de la hipótesis nula es alta, lo que indica una fuerte evidencia de que la hipótesis nula concuerda mejor con los datos que la hipótesis alternativa.
Sin embargo, la paradoja no se aplica a las pruebas de hipótesis. El bayesiano y el frecuentista llegarán finalmente a la misma conclusión.
Véase también
Referencias
- Naaman, Michael (2016). "Prueba de hipótesis casi segura y una resolución de la paradoja de Jeffreys-Lindley" . Revista electrónica de estadística . 10 (1): 1526– 1550. doi : 10.1214/16-EJS1146 .
- Dembo, Amir; Peres, Yuval (1994). "Un criterio topológico para la prueba de hipótesis". The Annals of Statistics . 22 (1): 106– 117. doi : 10.1214/aos/1176325360 .
- Pruebas de hipótesis estadísticas
- estadística bayesiana