
Una prueba Z es cualquier prueba estadística cuya distribución del estadístico de prueba bajo la hipótesis nula puede aproximarse mediante una distribución normal . La prueba Z evalúa la media de una distribución. Para cada nivel de significancia en el intervalo de confianza , la prueba Z tiene un único valor crítico (por ejemplo, 1,96 para un 5 % bilateral), lo que la hace más conveniente que la prueba t de Student, cuyos valores críticos están definidos por el tamaño de la muestra (a través de los grados de libertad correspondientes ). Tanto la prueba Z como la prueba t de Student comparten la característica de ayudar a determinar la significancia de un conjunto de datos. Sin embargo, la prueba Z requiere conocer la desviación estándar de la población, que a veces es difícil de determinar, lo que hace que la prueba t sea más conveniente.
Aplicabilidad
Debido al teorema del límite central , muchos estadísticos de prueba se distribuyen aproximadamente de forma normal para muestras grandes. Por lo tanto, muchas pruebas estadísticas pueden realizarse convenientemente como pruebas Z aproximadas si el tamaño de la muestra es grande o se conoce la varianza poblacional. Si se desconoce la varianza poblacional (y, por lo tanto, debe estimarse a partir de la propia muestra) y el tamaño de la muestra no es grande ( n < 30), la prueba t de Student puede ser más apropiada (en algunos casos, n < 50, como se describe más adelante).
Procedimiento
El procedimiento para realizar una prueba Z en un estadísticoLa distribución que se encuentra aproximadamente normal bajo la hipótesis nula es la siguiente:
- Estimar el valor esperado μ debajo la hipótesis nula y obtener una estimación s de la desviación estándar de.
- Determinar las propiedades de: de una cola o de dos colas.
- Para la hipótesis nula H 0 : μ ≥ μ 0 frente a la hipótesis alternativa H 1 : μ < μ 0 , es de cola inferior/izquierda (unilateral).
- Para la hipótesis nula H 0 : μ ≤ μ 0 frente a la hipótesis alternativa H 1 : μ > μ 0 , es de cola superior/derecha (unilateral).
- Para la hipótesis nula H 0 : μ = μ 0 frente a la hipótesis alternativa H 1 : μ ≠ μ 0 , es bilateral.
- Calcular la puntuación estándar :
Los valores p unilaterales y bilaterales se pueden calcular como(para pruebas de cola inferior/izquierda),(para pruebas de cola superior/derecha) y(para pruebas de dos colas), dondees la función de distribución acumulativa normal estándar .
Uso en pruebas de localización
- El término " prueba Z " se usa a menudo para referirse específicamente a la prueba de localización de una muestra que compara la media de un conjunto de mediciones con una constante dada cuando se conoce la varianza de la muestra. Por ejemplo, si los datos observados X 1 , ..., X n son (i) independientes, (ii) tienen una media común μ y (iii) tienen una varianza común σ 2 , entonces el promedio de la muestra X tiene media μ y varianza.
- La hipótesis nula es que el valor medio de X es un número dado μ 0 . Podemos usar X como estadístico de prueba, rechazando la hipótesis nula si X − μ 0 es grande.
- Para calcular el estadístico estandarizadoNecesitamos conocer o tener un valor aproximado para σ 2 , a partir del cual podemos calcularEn algunas aplicaciones, se conoce σ 2 , pero esto es poco común.
- Si el tamaño de la muestra es moderado o grande, podemos sustituir la varianza muestral por σ² , lo que da como resultado una prueba de sustitución . La prueba resultante no será una prueba Z exacta , ya que no se tiene en cuenta la incertidumbre de la varianza muestral; sin embargo, será una buena aproximación a menos que el tamaño de la muestra sea pequeño.
- Se puede utilizar una prueba t para tener en cuenta la incertidumbre en la varianza de la muestra cuando los datos son exactamente normales .
- Diferencia entre la prueba Z y la prueba t : La prueba Z se utiliza cuando el tamaño de la muestra es grande ( n > 50) o se conoce la varianza poblacional. La prueba t se utiliza cuando el tamaño de la muestra es pequeño ( n < 50) y se desconoce la varianza poblacional.
- No existe una constante universal que determine si el tamaño de la muestra es lo suficientemente grande como para justificar el uso de la prueba de sustitución. Como regla general, el tamaño de la muestra debe ser de 50 observaciones o más.
- Para tamaños de muestra grandes, el procedimiento de prueba t proporciona valores p casi idénticos a los del procedimiento de prueba Z.
- Otras pruebas de localización que se pueden realizar como pruebas Z son la prueba de localización de dos muestras y la prueba de diferencia pareada .
Condiciones
Para que la prueba Z sea aplicable, deben cumplirse ciertas condiciones.
- Los parámetros de perturbación deben conocerse o estimarse con alta precisión (un ejemplo de parámetro de perturbación sería la desviación estándar en una prueba de localización de una muestra). Las pruebas Z se centran en un único parámetro y consideran que todos los demás parámetros desconocidos tienen sus valores reales fijos. En la práctica, gracias al teorema de Slutsky , se justifica el uso de estimaciones consistentes de los parámetros de perturbación. Sin embargo, si el tamaño de la muestra no es lo suficientemente grande como para que estas estimaciones sean razonablemente precisas, la prueba Z podría no tener un buen desempeño.
- El estadístico de prueba debe seguir una distribución normal . Generalmente, se recurre al teorema del límite central para justificar la suposición de que un estadístico de prueba varía normalmente. Existe una gran cantidad de investigación estadística sobre cuándo un estadístico de prueba varía aproximadamente de forma normal. Si la variación del estadístico de prueba es marcadamente no normal, no se debe utilizar una prueba Z.
Si se utilizan estimaciones de parámetros de perturbación como se explicó anteriormente, es importante emplear estimaciones adecuadas al método de muestreo de los datos . En el caso especial de las pruebas Z para el problema de localización de una o dos muestras, la desviación estándar muestral habitual solo es apropiada si los datos se recopilaron como una muestra independiente.
En ciertas situaciones, es posible diseñar una prueba que tenga en cuenta adecuadamente la variación en las estimaciones de los parámetros de perturbación. En el caso de problemas de localización con una o dos muestras, una prueba t cumple esta función.
Ejemplo
Supongamos que en una región geográfica determinada, la media y la desviación estándar de las puntuaciones en una prueba de lectura son 100 y 12 puntos, respectivamente. Nos interesan las puntuaciones de 55 estudiantes de una escuela específica que obtuvieron una media de 96. Podemos preguntarnos si esta media es significativamente inferior a la media regional; es decir, ¿son los estudiantes de esta escuela comparables a una muestra aleatoria simple de 55 estudiantes de toda la región, o sus puntuaciones son sorprendentemente bajas?
Primero, calcule el error estándar de la media:
dóndees la desviación estándar de la población.
A continuación, calcule la puntuación z , que es la distancia desde la media de la muestra hasta la media de la población en unidades del error estándar:
En este ejemplo, consideramos que la media y la varianza poblacionales son conocidas, lo cual sería apropiado si se evaluara a todos los estudiantes de la región. Cuando se desconocen los parámetros poblacionales, se debe realizar una prueba t de Student .
La puntuación media del aula es 96, que está a -2,47 unidades de error estándar de la media poblacional de 100. Al consultar la puntuación z en una tabla de probabilidad acumulada de la distribución normal estándar , encontramos que la probabilidad de observar un valor normal estándar inferior a -2,47 es aproximadamente 0,5 - 0,4932 = 0,0068. Este es el valor p unilateral para la hipótesis nula de que los 55 estudiantes son comparables a una muestra aleatoria simple de la población de todos los examinados. El valor p bilateral es aproximadamente 0,014 (el doble del valor p unilateral ).
Dicho de otro modo, con una probabilidad de 1 − 0,014 = 0,986, una muestra aleatoria simple de 55 estudiantes tendría una puntuación media en la prueba que estaría dentro de las 4 unidades de la media poblacional. También podríamos decir que, con un 98,6 % de confianza, rechazamos la hipótesis nula de que los 55 examinados son comparables a una muestra aleatoria simple de la población de examinados.
La prueba Z nos indica que los 55 estudiantes de interés obtuvieron una puntuación media en la prueba inusualmente baja en comparación con la mayoría de las muestras aleatorias simples de tamaño similar de la población de examinados. Una deficiencia de este análisis es que no considera si el tamaño del efecto de 4 puntos es significativo. Si en lugar de un aula, consideráramos una subregión con 900 estudiantes cuya puntuación media fuera de 99, se observarían prácticamente la misma puntuación Z y el mismo valor p . Esto demuestra que, si el tamaño de la muestra es suficientemente grande, diferencias muy pequeñas con respecto al valor nulo pueden ser altamente significativas desde el punto de vista estadístico. Consulte la sección sobre pruebas de hipótesis estadísticas para obtener más información sobre este tema.
Ocurrencia y aplicaciones
Para la estimación de máxima verosimilitud de un parámetro
Las pruebas de localización son las pruebas Z más conocidas . Otra clase de pruebas Z surge en la estimación de máxima verosimilitud de los parámetros en un modelo estadístico paramétrico . Las estimaciones de máxima verosimilitud son aproximadamente normales bajo ciertas condiciones, y su varianza asintótica se puede calcular en términos de la información de Fisher. La estimación de máxima verosimilitud dividida por su error estándar se puede utilizar como estadístico de prueba para la hipótesis nula de que el valor poblacional del parámetro es igual a cero. De manera más general, sies la estimación de máxima verosimilitud de un parámetro θ, y θ 0 es el valor de θ bajo la hipótesis nula,
puede utilizarse como estadístico de prueba Z.
Al utilizar una prueba Z para estimaciones de máxima verosimilitud, es importante tener en cuenta que la aproximación normal puede ser deficiente si el tamaño de la muestra no es suficientemente grande. Si bien no existe una regla simple y universal que determine el tamaño mínimo de muestra necesario para utilizar una prueba Z , la simulación puede ofrecer una buena idea de si esta prueba es apropiada en una situación determinada.
Las pruebas Z se emplean siempre que se pueda argumentar que un estadístico de prueba sigue una distribución normal bajo la hipótesis nula de interés. Muchos estadísticos de prueba no paramétricos , como los estadísticos U , se aproximan a una distribución normal para tamaños de muestra suficientemente grandes y, por lo tanto, a menudo se realizan como pruebas Z.
Comparación de las proporciones de dos binomios
La prueba Z para comparar dos proporciones es un método estadístico que se utiliza para evaluar si la proporción de una característica determinada difiere significativamente entre dos muestras independientes. Esta prueba aprovecha la propiedad de que las proporciones muestrales (que son el promedio de las observaciones provenientes de una distribución de Bernoulli ) son asintóticamente normales según el Teorema del Límite Central , lo que permite la construcción de una prueba Z.
El estadístico z para comparar dos proporciones se calcula utilizando:
Dónde:
- = proporción de la muestra en la primera muestra
- = proporción de la muestra en la segunda muestra
- = tamaño de la primera muestra
- = tamaño de la segunda muestra
- = proporción combinada, calculada como, dóndeyson los recuentos de éxitos en las dos muestras.
El intervalo de confianza para la diferencia entre dos proporciones, según las definiciones anteriores, es:
Dónde:
- es el valor crítico de la distribución normal estándar (por ejemplo, 1,96 para un nivel de confianza del 95%).
Dónde:
- : Valor crítico para el nivel de significancia.
- : Cuantil para la potencia deseada.
- : Cuando se asume que la hipótesis nula es correcta.
Véase también
Referencias
Lecturas adicionales
- Sprinthall, RC (2011). Análisis estadístico básico (9.ª ed.). Pearson Education. ISBN 978-0-205-05217-2.
- Casella, G. , Berger, RL (2002). Inferencia estadística . Duxbury Press. ISBN 0-534-24312-6.
- Douglas C. Montgomery, George C. Runger. (2014). Estadística aplicada y probabilidad para ingenieros . (6.ª ed.). John Wiley & Sons, Inc. ISBN 9781118539712,9781118645062.
- Pruebas estadísticas
- Distribución normal