La prueba de signos es una prueba estadística para detectar diferencias consistentes entre pares de observaciones, como el peso de los sujetos antes y después del tratamiento. Dadas las observaciones de cada sujeto (como el peso antes y después del tratamiento), la prueba de signos determina si un miembro del par (como el peso antes del tratamiento) tiende a ser mayor (o menor) que el otro miembro del par (como el peso después del tratamiento).
Las observaciones pareadas pueden designarse como x e y . Para comparaciones de observaciones pareadas ( x , y), la prueba de signos es más útil si las comparaciones solo pueden expresarse como x > y , x = y o x < y . Si, en cambio, las observaciones pueden expresarse como cantidades numéricas ( x = 7, y = 18) o como rangos (rango de x = 1.º, rango de y = 8.º), entonces la prueba t pareada [ 1 ] o la prueba de rangos con signo de Wilcoxon [ 2 ] suelen tener mayor potencia que la prueba de signos para detectar diferencias consistentes. Sin embargo, requieren supuestos más estrictos, y cuando estos supuestos se incumplen, con frecuencia producen resultados incorrectos. [ 3 ]
Si X e Y son variables cuantitativas, la prueba de signos puede utilizarse para contrastar la hipótesis de que la diferencia entre X e Y tiene mediana cero, suponiendo distribuciones continuas de las dos variables aleatorias X e Y , en la situación en la que podemos extraer muestras pareadas de X e Y. [ 4 ]
La prueba de signos también permite comprobar si la mediana de un conjunto de números es significativamente mayor o menor que un valor específico. Por ejemplo, dada una lista de calificaciones de los alumnos de una clase, la prueba de signos puede determinar si la mediana es significativamente diferente de, digamos, 75 sobre 100.
La prueba de signos es una prueba no paramétrica que hace muy pocas suposiciones sobre la naturaleza de las distribuciones que se están probando; esto significa que tiene una aplicabilidad muy general, pero puede carecer de la potencia estadística de las pruebas alternativas.
Las dos condiciones para la prueba de signos para muestras pareadas son que se debe seleccionar una muestra aleatoriamente de cada población y que las muestras deben ser dependientes o estar emparejadas. Las muestras independientes no pueden emparejarse de forma significativa. Dado que la prueba es no paramétrica, las muestras no necesitan provenir de poblaciones con distribución normal. Además, la prueba funciona para pruebas unilaterales izquierdas, unilaterales derechas y bilaterales.
Método
Sea p = Pr( X > Y ), y luego probemos la hipótesis nula H 0 : p = 0.50. En otras palabras, la hipótesis nula establece que dado un par aleatorio de mediciones ( x i , y i ), entonces x i e y i tienen la misma probabilidad de ser mayores que la otra.
Para probar la hipótesis nula, se recopilan pares independientes de datos de muestra de las poblaciones {( x 1 , y 1 ), ( x 2 , y 2 ), . . ., ( x n , y n )}. Se omiten los pares para los que no hay diferencia, de modo que existe la posibilidad de una muestra reducida de m pares. [ 5 ]
Sea W el número de pares para los cuales y i − x i > 0. Suponiendo que H 0 es verdadera, entonces W sigue una distribución binomial W ~ b( n , 0.5).
Supuestos
Sea Z i = Y i – X i para i = 1, ... , n .
- Se supone que las diferencias Z i son independientes.
- Cada Z i proviene de la misma población continua.
- Los valores X i e Y i que representan están ordenados (al menos en la escala ordinal ), por lo que las comparaciones "mayor que", "menor que" e "igual a" tienen sentido.
Pruebas de significancia
Dado que se espera que el estadístico de prueba siga una distribución binomial , se utiliza la prueba binomial estándar para calcular la significancia . La aproximación normal a la distribución binomial se puede utilizar para tamaños de muestra grandes, m > 25. [ 5 ]
El valor de la cola izquierda se calcula mediante Pr( W ≤ w ), que es el valor p para la alternativa H 1 : p < 0,50. Esta alternativa significa que las mediciones de X tienden a ser más altas.
El valor de la cola derecha se calcula mediante Pr( W ≥ w ), que es el valor p para la alternativa H 1 : p > 0,50. Esta alternativa significa que las mediciones de Y tienden a ser más altas.
Para una alternativa bilateral H 1, el valor p es el doble del valor de la cola más pequeña.
Ejemplo de prueba de signos bilateral para pares coincidentes
Zar da el siguiente ejemplo de la prueba de signos para pares emparejados. Se recopilan datos sobre la longitud de la pata trasera izquierda y la pata delantera izquierda de 10 ciervos. [ 6 ]
La hipótesis nula es que no existe diferencia entre la longitud de las patas traseras y delanteras en los ciervos. La hipótesis alternativa es que sí existe una diferencia entre la longitud de las patas traseras y delanteras. Se trata de una prueba bilateral, no unilateral. En la prueba bilateral, la hipótesis alternativa es que la longitud de las patas traseras puede ser mayor o menor que la de las delanteras. Una prueba unilateral podría plantear que la longitud de las patas traseras es mayor que la de las delanteras, de modo que la diferencia solo puede darse en una dirección (mayor que).
Hay n=10 ciervos. Se observan 8 diferencias positivas y 2 negativas. Si la hipótesis nula es verdadera, es decir, que no hay diferencia en la longitud de las patas traseras y delanteras, entonces el número esperado de diferencias positivas es 5 de 10. ¿Cuál es la probabilidad de que se observen 8 diferencias positivas, o un resultado aún más extremo, si no hay diferencia en la longitud de las patas?
Dado que la prueba es bilateral, un resultado igual o más extremo que 8 diferencias positivas incluye los resultados de 8, 9 o 10 diferencias positivas, así como los resultados de 0, 1 o 2 diferencias positivas. La probabilidad de obtener 8 o más positivos entre 10 ciervos, o 2 o menos positivos entre 10 ciervos, es la misma que la probabilidad de obtener 8 o más caras, o 2 o menos caras, en 10 lanzamientos de una moneda justa. Las probabilidades se pueden calcular mediante la prueba binomial , donde la probabilidad de cara es igual a la probabilidad de cruz, que es igual a 0,5.
- Probabilidad de obtener 0 caras en 10 lanzamientos de una moneda justa = 0,00098
- Probabilidad de obtener 1 cara en 10 lanzamientos de una moneda justa = 0,00977
- Probabilidad de obtener 2 caras en 10 lanzamientos de una moneda justa = 0,04395
- Probabilidad de obtener 8 caras en 10 lanzamientos de una moneda justa = 0,04395
- Probabilidad de obtener 9 caras en 10 lanzamientos de una moneda justa = 0,00977
- Probabilidad de obtener 10 caras en 10 lanzamientos de una moneda justa = 0,00098
La probabilidad bilateral de un resultado tan extremo como 8 de 10 diferencias positivas es la suma de estas probabilidades:
- 0,00098 + 0,00977 + 0,04395 + 0,04395 + 0,00977 + 0,00098 = 0,109375.
Por lo tanto, la probabilidad de observar resultados tan extremos como 8 de 10 diferencias positivas en la longitud de las piernas, si no existe diferencia en dicha longitud, es p = 0,109375. La hipótesis nula no se rechaza a un nivel de significancia de p = 0,05. Con un tamaño de muestra mayor, la evidencia podría ser suficiente para rechazar la hipótesis nula.
Dado que las observaciones pueden expresarse como cantidades numéricas (longitud real de la pata), la prueba t pareada o la prueba de rangos con signo de Wilcoxon suelen tener mayor potencia que la prueba de signos para detectar diferencias consistentes. En este ejemplo, la prueba t pareada para diferencias indica que existe una diferencia significativa entre la longitud de la pata trasera y la de la pata delantera ( p = 0,007).
Si el resultado observado fue de 9 diferencias positivas en 10 comparaciones, la prueba de signos sería significativa. Solo los lanzamientos de moneda con 0, 1, 9 o 10 caras serían tan extremos o más extremos que el resultado observado.
- Probabilidad de obtener 0 caras en 10 lanzamientos de una moneda justa = 0,00098
- Probabilidad de obtener 1 cara en 10 lanzamientos de una moneda justa = 0,00977
- Probabilidad de obtener 9 caras en 10 lanzamientos de una moneda justa = 0,00977
- Probabilidad de obtener 10 caras en 10 lanzamientos de una moneda justa = 0,00098
La probabilidad de un resultado tan extremo como 9 de cada 10 diferencias positivas es la suma de estas probabilidades:
- 0,00098 + 0,00977 + 0,00977 + 0,00098 = 0,0215.
En general, 8 de cada 10 diferencias positivas no son significativas ( p = 0,11), pero 9 de cada 10 diferencias positivas sí lo son ( p = 0,0215).
Ejemplos
Ejemplo de prueba de signos unilateral para pares coincidentes
Conover [ 7 ] da el siguiente ejemplo usando una prueba de signos unilateral para pares coincidentes. Un fabricante produce dos productos, A y B. El fabricante quiere saber si los consumidores prefieren el producto B al producto A. A una muestra de 10 consumidores se les da a cada uno el producto A y el producto B, y se les pregunta cuál prefieren.
La hipótesis nula es que los consumidores no prefieren el producto B al producto A. La hipótesis alternativa es que los consumidores prefieren el producto B al producto A. Esta es una prueba unilateral (direccional).
Al finalizar el estudio, 8 consumidores prefirieron el producto B, 1 consumidor prefirió el producto A y uno no manifestó ninguna preferencia.
- Número de signos + (preferiblemente B) = 8
- Número de – (preferiblemente A) = 1
- Número de empates (sin preferencia) = 1
El empate se excluye del análisis, lo que da como resultado n = número de + y – = 8 + 1 = 9.
¿Cuál es la probabilidad de un resultado tan extremo como 8 positivos a favor de B en 9 pares, si la hipótesis nula es verdadera, es decir, que los consumidores no tienen preferencia por B sobre A? Esta es la probabilidad de obtener 8 o más caras en 9 lanzamientos de una moneda justa, y se puede calcular utilizando la distribución binomial con p(cara) = p(cruz) = 0,5.
P(8 o 9 caras en 9 lanzamientos de una moneda justa) = 0,0195. Se rechaza la hipótesis nula y el fabricante concluye que los consumidores prefieren el producto B al producto A.
Ejemplo de prueba de signos para la mediana de una sola muestra.
Sprent [ 8 ] proporciona el siguiente ejemplo de una prueba de signos para una mediana. En un ensayo clínico, se recopiló el tiempo de supervivencia (semanas) de 10 sujetos con linfoma no Hodgkin. No se conocía el tiempo exacto de supervivencia de un sujeto que seguía vivo después de 362 semanas, cuando finalizó el estudio. Los tiempos de supervivencia de los sujetos fueron:
- 49, 58, 75, 110, 112, 132, 151, 276, 281, 362+
El signo más indica que el sujeto seguía vivo al final del estudio. El investigador quería determinar si el tiempo medio de supervivencia era inferior o superior a 200 semanas.
La hipótesis nula es que la mediana de supervivencia es de 200 semanas. La hipótesis alternativa es que la mediana de supervivencia no es de 200 semanas. Se trata de una prueba bilateral: la mediana alternativa puede ser mayor o menor que 200 semanas.
Si la hipótesis nula es verdadera, es decir, que la mediana de supervivencia es de 200 semanas, entonces, en una muestra aleatoria, aproximadamente la mitad de los sujetos deberían sobrevivir menos de 200 semanas y la otra mitad más. A las observaciones inferiores a 200 se les asigna un signo menos (−); a las superiores a 200 se les asigna un signo más (+). Para los tiempos de supervivencia de los sujetos, hay 7 observaciones inferiores a 200 semanas (−) y 3 superiores a 200 semanas (+) para los n=10 sujetos.
Dado que cualquier observación tiene la misma probabilidad de estar por encima o por debajo de la mediana poblacional, el número de puntuaciones positivas seguirá una distribución binomial con una media de 0,5. ¿Cuál es la probabilidad de que un resultado tan extremo como 7 de cada 10 sujetos esté por debajo de la mediana? Esta probabilidad es exactamente la misma que la de obtener 7 caras en 10 lanzamientos de una moneda justa. Como se trata de una prueba bilateral, un resultado extremo puede ser de tres o menos caras o de siete o más caras.
La probabilidad de observar k caras en 10 lanzamientos de una moneda justa, con p(caras) = 0,5, viene dada por la fórmula binomial:
- Pr(Número de caras = k ) = Elegir(10, k ) × 0.5 10
La probabilidad para cada valor de k se muestra en la tabla a continuación.
La probabilidad de obtener 0, 1, 2, 3, 7, 8, 9 o 10 caras en 10 lanzamientos es la suma de sus probabilidades individuales:
- 0,0010 + 0,0098 + 0,0439 + 0,1172 + 0,1172 + 0,0439 + 0,0098 + 0,0010 = 0,3438.
Por lo tanto, la probabilidad de observar 3 o menos signos de suma o 7 o más signos de suma en los datos de supervivencia, si la mediana de supervivencia es de 200 semanas, es de 0,3438. El número esperado de signos de suma es 5 si la hipótesis nula es verdadera. Observar 3 o menos, o 7 o más signos de suma no difiere significativamente de 5. La hipótesis nula no se rechaza. Debido al tamaño extremadamente pequeño de la muestra, esta muestra tiene poca potencia para detectar una diferencia.
Implementaciones de software
La prueba de signos es un caso especial de la prueba binomial donde la probabilidad de éxito bajo la hipótesis nula es p=0,5. Por lo tanto, la prueba de signos se puede realizar utilizando la prueba binomial, que está disponible en la mayoría de los programas de software estadístico. Se pueden encontrar calculadoras en línea para la prueba de signos buscando "calculadora de prueba de signos". Muchos sitios web ofrecen la prueba binomial, pero generalmente solo ofrecen una versión bilateral.
Software Excel para la prueba de signos
Una plantilla para la prueba de signos en Excel está disponible en http://www.real-statistics.com/non-parametric-tests/sign-test/
Software R para la prueba de signos
En R , la prueba binomial se puede realizar utilizando la función binom.test().
La sintaxis de la función es
binom.test ( x , n , p = 0.5 , alternative = c ( "two.sided" , "less" , "greater" ), conf.level = 0.95 )dónde
x= número de éxitos, o un vector de longitud 2 que indica el número de éxitos y fracasos, respectivamente.n= número de ensayos; se ignora si x tiene longitud 2p= probabilidad hipotética de éxitoalternative=indica la hipótesis alternativa y debe ser una de las siguientes: "bilateral", "mayor" o "menor".conf.level= nivel de confianza para el intervalo de confianza devuelto.
Ejemplos de la prueba de signos utilizando la función binom.test de R.
El ejemplo de prueba de signos de Zar [ 6 ] comparó la longitud de las patas traseras y delanteras de los ciervos. La pata trasera fue más larga que la delantera en 8 de 10 ciervos. Por lo tanto, hay x = 8 éxitos en n = 10 ensayos. La probabilidad hipotética de éxito (definida como pata trasera más larga que la delantera) es p = 0,5 bajo la hipótesis nula de que las patas traseras y delanteras no difieren en longitud. La hipótesis alternativa es que la longitud de la pata trasera puede ser mayor o menor que la longitud de la pata delantera, lo cual es una prueba bilateral, especificada como alternative="two.sided".
El comando R da p=0,1094, como en el ejemplo.binom.test(x=8,n=10,p=0.5,alternative="two.sided")
El ejemplo de prueba de signos en Conover [ 7 ] examinó la preferencia del consumidor por el producto A frente al producto B. La hipótesis nula era que los consumidores no preferían el producto B al producto A. La hipótesis alternativa era que los consumidores preferían el producto B al producto A, una prueba unilateral. En el estudio, 8 de los 9 consumidores que expresaron una preferencia prefirieron el producto B al producto A.
El comando R da p=0,01953, como en el ejemplo.binom.test(x=8,n=9,p=0.5,alternative="greater")
Historia
Conover [ 7 ] y Sprent [ 8 ] describen el uso que hizo John Arbuthnot de la prueba de signos en 1710. Arbuthnot examinó los registros de nacimientos en Londres durante los 82 años comprendidos entre 1629 y 1710. En cada año, el número de varones nacidos en Londres superó al de mujeres. Si la hipótesis nula de igualdad en el número de nacimientos es cierta, la probabilidad del resultado observado es 1/2 82 , lo que llevó a Arbuthnot a concluir que la probabilidad de nacimientos de varones y mujeres no era exactamente igual.
Por sus publicaciones en 1692 y 1710, a Arbuthnot se le atribuye "... el primer uso de pruebas de significancia...", [ 9 ] el primer ejemplo de razonamiento sobre significancia estadística y certeza moral, [ 10 ] y "... quizás el primer informe publicado de una prueba no paramétrica...". [ 7 ]
Hald [ 10 ] describe además el impacto de la investigación de Arbuthnot.
Nicholas Bernoulli (1710-1713) completa el análisis de los datos de Arbuthnot demostrando que la mayor parte de la variación del número anual de nacimientos varones puede explicarse mediante una distribución binomial con p = 18/35. Este es el primer ejemplo de ajuste de una distribución binomial a datos. Por lo tanto, aquí presentamos una prueba de significancia que rechaza la hipótesis p = 0,5, seguida de una estimación de p y una discusión sobre la bondad del ajuste…
Relación con otras pruebas estadísticas
Prueba de rangos con signo de Wilcoxon
La prueba de signos solo requiere que las observaciones de un par estén ordenadas, por ejemplo, x > y . En algunos casos, se puede asignar un valor de rango (1, 2, 3, ...) a las observaciones de todos los sujetos. Si las observaciones se pueden clasificar y cada observación de un par es una muestra aleatoria de una distribución simétrica, entonces la prueba de rangos con signo de Wilcoxon es apropiada. La prueba de Wilcoxon generalmente tendrá mayor poder para detectar diferencias que la prueba de signos. La eficiencia relativa asintótica de la prueba de signos con respecto a la prueba de rangos con signo de Wilcoxon, en estas circunstancias, es de 0,67. [ 7 ]
Prueba t pareada
Si las observaciones pareadas son cantidades numéricas (como la longitud real de la pata trasera y delantera en el ejemplo de Zar), y las diferencias entre las observaciones pareadas son muestras aleatorias de una única distribución normal, entonces la prueba t pareada es apropiada. La prueba t pareada generalmente tendrá mayor potencia para detectar diferencias que la prueba de signos. La eficiencia relativa asintótica de la prueba de signos con respecto a la prueba t pareada, en estas circunstancias, es de 0,637. Sin embargo, si la distribución de las diferencias entre pares no es normal, sino que tiene colas pesadas ( distribución platicúrtica ), la prueba de signos puede tener mayor potencia que la prueba t pareada, con una eficiencia relativa asintótica de 2,0 con respecto a la prueba t pareada y de 1,3 con respecto a la prueba de rangos con signo de Wilcoxon. [ 7 ]
La prueba de McNemar
En algunas aplicaciones, las observaciones dentro de cada par solo pueden tomar los valores 0 o 1. Por ejemplo, 0 puede indicar un fallo y 1 un éxito. Existen 4 pares posibles: {0,0}, {0,1}, {1,0} y {1,1}. En estos casos, se utiliza el mismo procedimiento que en la prueba de signos, pero se conoce como la prueba de McNemar . [ 7 ]
En lugar de observaciones emparejadas como (Producto A, Producto B), los datos pueden constar de tres o más niveles (Producto A, Producto B, Producto C). Si las observaciones individuales se pueden ordenar de la misma manera que para la prueba de signos, por ejemplo B > C > A, entonces se puede utilizar la prueba de Friedman . [ 6 ]
Prueba trinómica
Bian, McAleer y Wong [ 11 ] propusieron en 2011 una prueba no paramétrica para datos pareados cuando hay muchos empates. Demostraron que su prueba trinomial es superior a la prueba de signos en presencia de empates.
Véase también
- Prueba de rangos con signo de Wilcoxon : una variante más potente de la prueba de signos, pero que también presupone una distribución simétrica y datos de intervalo.
- Prueba de la mediana : una alternativa para muestras independientes a la prueba de signos.
Referencias
- ↑ Baguley, Thomas (2012), Serious Stats: A Guide to Advanced Statistics for the Behavioral Sciences , Palgrave Macmillan, p. 281, ISBN 9780230363557.
- ↑ Corder, Gregory W.; Foreman, Dale I. (2014), "3.6 Potencia estadística" , Estadística no paramétrica: un enfoque paso a paso (2.ª ed.), John Wiley & Sons, ISBN 9781118840429.
- ↑ "Prueba de rangos con signo de Wilcoxon" , SpringerReference , Berlín/Heidelberg: Springer-Verlag , consultado el 9 de julio de 2025
- ↑ Prueba de signos para la mediana // STAT 415 Introducción a la estadística matemática. Universidad Estatal de Pensilvania.
- 1 2 Mendenhall W, Wackerly DD, Scheaffer RL (1989), "15: Estadística no paramétrica", Estadística matemática con aplicaciones (Cuarta ed.), PWS-Kent, págs. 674–679 , ISBN 0-534-92026-8
- 1 2 3 Zar, Jerold H. (1999), "Capítulo 24: Más sobre variables dicotómicas", Análisis bioestadístico (Cuarta ed.), Prentice-Hall, págs. 516–570 , ISBN 0-13-081542-X
- 1 2 3 4 5 6 7 Conover, WJ (1999), "Capítulo 3.4: La prueba de signos", Estadística no paramétrica práctica (Tercera ed.), Wiley, págs. 157–176 , ISBN 0-471-16068-7
- 1 2 Sprent, P. (1989), Métodos estadísticos no paramétricos aplicados (Segunda edición), Chapman & Hall, ISBN 0-412-44980-3
- ↑ Bellhouse, P. (2001), "John Arbuthnot", en CC Heyde ; E. Seneta (eds.), en Statisticians of the Centuries , Springer, pp. 39–42 , ISBN 0-387-95329-9
- 1 2 Hald, Anders (1998), "Capítulo 4. Azar o diseño: pruebas de significación", Historia de la estadística matemática de 1750 a 1930 , Wiley, pág. 65
- ↑ Bian G, McAleer M, Wong WK (2011), Una prueba trinomial para datos pareados cuando hay muchos empates. , Matemáticas y computadoras en simulación, 81(6), pp. 1153– 1160
- Gibbons, JD y Chakraborti, S. (1992). Inferencia estadística no paramétrica. Marcel Dekker Inc., Nueva York.
- Kitchens, LJ(2003). Estadística básica y análisis de datos. Duxbury.
- Conover, WJ (1980). Estadística práctica no paramétrica , 2ª ed. Wiley, Nueva York.
- Lehmann, EL (1975). Métodos no paramétricos: métodos estadísticos basados en rangos. Holden and Day, San Francisco.
- Pruebas estadísticas
- estadística no paramétrica