

En las pruebas de significancia estadística , una prueba unilateral y una prueba bilateral son formas alternativas de calcular la significancia estadística de un parámetro inferido de un conjunto de datos, en términos de un estadístico de prueba . Una prueba bilateral es apropiada si el valor estimado es mayor o menor que un cierto rango de valores, por ejemplo, si un examinado puede obtener una puntuación por encima o por debajo de un rango específico de puntuaciones. Este método se utiliza para la prueba de hipótesis nula y, si el valor estimado existe en las áreas críticas, se acepta la hipótesis alternativa sobre la hipótesis nula. Una prueba unilateral es apropiada si el valor estimado puede desviarse del valor de referencia en una sola dirección, izquierda o derecha, pero no en ambas. [ 1 ] Un ejemplo puede ser si una máquina produce más del uno por ciento de productos defectuosos. En esta situación, si el valor estimado existe en una de las áreas críticas unilaterales, dependiendo de la dirección de interés (mayor que o menor que), se acepta la hipótesis alternativa sobre la hipótesis nula. Los nombres alternativos son pruebas unilaterales y bilaterales ; El término "cola" se utiliza porque las porciones extremas de las distribuciones, donde las observaciones llevan al rechazo de la hipótesis nula, son pequeñas y a menudo tienen una "cola" que tiende hacia cero, como en la distribución normal , coloreada en amarillo, o la "curva de campana", que se muestra a la derecha y está coloreada en verde.
Aplicaciones
Las pruebas unilaterales se utilizan para distribuciones asimétricas con una sola cola, como la distribución chi-cuadrado , que son comunes para medir la bondad de ajuste , o para un lado de una distribución con dos colas, como la distribución normal , que es común para estimar la ubicación; esto corresponde a especificar una dirección. Las pruebas bilaterales solo son aplicables cuando hay dos colas, como en la distribución normal, y corresponden a considerar significativa cualquiera de las dos direcciones. [ 2 ] [ 3 ]
En el enfoque de Ronald Fisher , la hipótesis nula H 0 se rechazará cuando el valor p del estadístico de prueba sea suficientemente extremo (en relación con la distribución muestral del estadístico de prueba ) y, por lo tanto, se considere improbable que sea el resultado del azar. Esto generalmente se hace comparando el valor p resultante con el nivel de significancia especificado, denotado por, al calcular la significancia estadística de un parámetro . En una prueba unilateral, "extremo" se decide de antemano como "suficientemente pequeño" o "suficientemente grande"; los valores en la otra dirección se consideran no significativos. Se puede informar que la probabilidad de la cola izquierda o derecha es el valor p unilateral, que en última instancia corresponde a la dirección en la que el estadístico de prueba se desvía de H 0. [ 4 ] En una prueba bilateral, "extremo" significa "suficientemente pequeño o suficientemente grande", y los valores en cualquier dirección se consideran significativos. [ 5 ] Para un estadístico de prueba dado, hay una única prueba bilateral y dos pruebas unilaterales, una para cada dirección. Cuando se proporciona un nivel de significancia, las regiones críticas existirían en los dos extremos de la distribución con un área decada uno para una prueba de dos colas. Alternativamente, la región crítica existiría únicamente en el extremo de una sola cola con un área depara una prueba unilateral. Para un nivel de significancia dado en una prueba bilateral para un estadístico de prueba, las pruebas unilaterales correspondientes para el mismo estadístico de prueba se considerarán dos veces más significativas (la mitad del valor p ) si los datos están en la dirección especificada por la prueba, o no significativas en absoluto ( valor p superior a) si los datos están en la dirección opuesta a la región crítica especificada por la prueba.
Por ejemplo, si lanzamos una moneda , probar si está sesgada hacia cara es una prueba unilateral, y obtener datos de "todas caras" se consideraría altamente significativo, mientras que obtener datos de "todas cruces" no sería significativo en absoluto ( p = 1). Por el contrario, probar si está sesgada en cualquier dirección es una prueba bilateral, y tanto "todas caras" como "todas cruces" se considerarían datos altamente significativos. En las pruebas médicas, si bien generalmente se está interesado en si un tratamiento produce resultados que son mejores que el azar, lo que sugiere una prueba unilateral; un peor resultado también es interesante para el campo científico, por lo que se debería usar una prueba bilateral que corresponda en cambio a probar si el tratamiento produce resultados que son diferentes del azar, ya sea mejor o peor. [ 6 ] En el experimento arquetípico de la dama que prueba el té , Fisher probó si la dama en cuestión era mejor que el azar para distinguir dos tipos de preparación de té, no si su habilidad era diferente del azar, y por lo tanto usó una prueba unilateral.
Ejemplo de lanzamiento de moneda
En el lanzamiento de moneda, la hipótesis nula es una secuencia de ensayos de Bernoulli con probabilidad 0,5, que produce una variable aleatoria X que es 1 para cara y 0 para cruz, y un estadístico de prueba común es la media muestral (del número de caras).Si se prueba si la moneda está sesgada hacia cara, se utilizaría una prueba unilateral: solo un gran número de caras serían significativas. En ese caso, un conjunto de datos de cinco caras (HHHHH), con una media muestral de 1, tiene unaprobabilidad de ocurrir, (5 lanzamientos consecutivos con 2 resultados - ((1/2)^5 =1/32). Esto tendríay sería significativo (rechazando la hipótesis nula) si la prueba se analizara a un nivel de significancia de(el nivel de significancia correspondiente al límite de corte). Sin embargo, si se prueba si la moneda está sesgada hacia cara o cruz, se utilizaría una prueba de dos colas, y un conjunto de datos de cinco caras (media muestral 1) es tan extremo como un conjunto de datos de cinco cruces (media muestral 0). Como resultado, el valor p seríay esto no sería significativo (no rechazar la hipótesis nula) si la prueba se analizara a un nivel de significancia de.
Historia

El valor p fue introducido por Karl Pearson [ 7 ] en la prueba chi-cuadrado de Pearson , donde definió P (notación original) como la probabilidad de que el estadístico sea igual o superior a un nivel dado. Esta es una definición unilateral, y la distribución chi-cuadrado es asimétrica, ya que solo toma valores positivos o cero, y tiene una sola cola, la superior. Mide la bondad de ajuste de los datos a una distribución teórica, donde cero corresponde a una concordancia exacta con la distribución teórica; por lo tanto, el valor p mide la probabilidad de que el ajuste sea igual o peor.

La distinción entre pruebas unilaterales y bilaterales fue popularizada por Ronald Fisher en el influyente libro Métodos estadísticos para investigadores [ 8 ] , donde la aplicó especialmente a la distribución normal , que es una distribución simétrica con dos colas iguales. La distribución normal es una medida común de ubicación, más que de bondad de ajuste, y tiene dos colas, que corresponden a que la estimación de la ubicación esté por encima o por debajo de la ubicación teórica (por ejemplo, la media muestral comparada con la media teórica). En el caso de una distribución simétrica como la distribución normal, el valor p unilateral es exactamente la mitad del valor p bilateral : [ 8 ]
A veces se introduce cierta confusión debido a que en algunos casos deseamos conocer la probabilidad de que la desviación, que se sabe que es positiva, supere un valor observado, mientras que en otros casos la probabilidad requerida es que una desviación, que es igualmente frecuente tanto positiva como negativa, supere un valor observado; esta última probabilidad es siempre la mitad de la primera.
Fisher enfatizó la importancia de medir la cola (el valor observado del estadístico de prueba y todos los resultados más extremos) en lugar de simplemente la probabilidad del resultado específico en sí, en su obra El diseño de experimentos (1935). [ 9 ] Explica esto porque un conjunto específico de datos puede ser improbable (en la hipótesis nula), pero los resultados más extremos son probables, por lo que, visto desde esta perspectiva, los datos específicos pero no extremos improbables no deben considerarse significativos.
Pruebas específicas
Si el estadístico de prueba sigue una distribución t de Student en la hipótesis nula (lo cual es común cuando la variable subyacente sigue una distribución normal con un factor de escala desconocido), entonces la prueba se denomina prueba t unilateral o bilateral . Si la prueba se realiza utilizando la media y la varianza poblacionales reales, en lugar de una estimación a partir de una muestra, se denomina prueba Z unilateral o bilateral .
Las tablas estadísticas para t y para Z proporcionan valores críticos para pruebas unilaterales y bilaterales. Es decir, proporcionan los valores críticos que delimitan una región completa en uno u otro extremo de la distribución muestral, así como los valores críticos que delimitan regiones (de la mitad del tamaño) en ambos extremos de la distribución muestral.
Véase también
- Prueba de diferencia pareada , cuando se comparan dos muestras.
Referencias
- ↑ Magalhães, Marcos Nascimento; Lima, Antonio Carlos Pedroso de (2011). Noções de Probabilidade e Estatística (en portugués brasileño) (7ª ed.). São Paulo: EDUSP. págs. 263–267 . ISBN 978-85-314-0677-5.
- ↑ Mundry, R.; Fischer, J. (1998). "El uso de programas estadísticos para pruebas no paramétricas de muestras pequeñas a menudo conduce a valores p incorrectos: ejemplos del comportamiento animal". Comportamiento animal . 56 (1): 256– 259. doi : 10.1006/anbe.1998.0756 . PMID 9710485 . S2CID 40169869 .
- ↑ Pillemer, DB (1991). "Pruebas de hipótesis unilaterales versus bilaterales en la investigación educativa contemporánea". Educational Researcher . 20 (9): 13– 17. doi : 10.3102/0013189X020009013 . S2CID 145478007 .
- ↑ Introducción moderna a la probabilidad y la estadística : comprender el porqué y el cómo . Dekking, Michel, 1946-. Londres: Springer. 2005. pp. 389–390 . ISBN 9781852338961OCLC 262680588
{{cite book}}: CS1 mantenimiento: otros ( enlace ) - ↑ John E. Freund , (1984) Estadística elemental moderna , sexta edición. Prentice Hall. ISBN 0-13-593525-3(Sección "Inferencias sobre medias", capítulo "Pruebas de significación", página 289).
- ↑ JM Bland, DG Bland (BMJ, 1994) Notas de estadística: Pruebas de significancia unilaterales y bilaterales
- ↑ Pearson, Karl (1900). "Sobre el criterio de que un sistema dado de desviaciones de lo probable en el caso de un sistema de variables correlacionadas es tal que se puede suponer razonablemente que surgió de un muestreo aleatorio" (PDF) . Philosophical Magazine . Serie 5. 50 (302): 157–175 . doi : 10.1080/14786440009463897 .
- 1 2 Fisher, Ronald (1925). Métodos estadísticos para investigadores . Edimburgo: Oliver & Boyd. ISBN 0-05-002170-2.
{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda ) - ↑ Fisher, Ronald A. (1971) [1935]. El diseño de experimentos (9.ª ed.). Macmillan. ISBN 0-02-844690-9.
- Pruebas estadísticas