Articulo de referencia

prueba de diferencia pareada

Una prueba de diferencia pareada , también conocida como comparación pareada , es un tipo de prueba de localización que se utiliza al comparar dos conjuntos de mediciones paread...

Una prueba de diferencia pareada , también conocida como comparación pareada , es un tipo de prueba de localización que se utiliza al comparar dos conjuntos de mediciones pareadas para evaluar si sus medias poblacionales difieren. Una prueba de diferencia pareada está diseñada para situaciones en las que existe dependencia entre pares de mediciones (en cuyo caso una prueba diseñada para comparar dos muestras independientes no sería apropiada). Esto se aplica en un diseño de estudio intrasujetos, es decir, en un estudio donde el mismo grupo de sujetos se somete a ambas condiciones que se comparan.

Los métodos específicos para llevar a cabo pruebas de diferencia pareadas incluyen la prueba t de muestras pareadas , la prueba Z pareada , la prueba de rangos con signo de Wilcoxon [ 1 ] y otras.

Uso en la reducción de la varianza

Las pruebas de diferencias pareadas para reducir la varianza constituyen un tipo específico de bloqueo . Para ilustrar esta idea, supongamos que evaluamos el rendimiento de un fármaco para el tratamiento del colesterol alto. En nuestro estudio, reclutamos a 100 sujetos y medimos el nivel de colesterol de cada uno. Posteriormente, todos los sujetos reciben el tratamiento durante seis meses, tras los cuales se vuelven a medir sus niveles de colesterol. Nuestro interés radica en determinar si el fármaco tiene algún efecto sobre los niveles medios de colesterol, lo cual puede inferirse comparando las mediciones posteriores al tratamiento con las previas.

La principal razón para utilizar la prueba de diferencias pareadas es que, a menos que el estudio tenga criterios de inclusión muy estrictos, es probable que los sujetos presenten diferencias sustanciales entre sí antes de que comience el tratamiento. Las diferencias iniciales importantes entre los sujetos pueden deberse a su sexo, edad, tabaquismo, nivel de actividad física y dieta.

Existen dos enfoques naturales para analizar estos datos:

  • En un análisis no pareado, los datos se tratan como si el diseño del estudio hubiera consistido en reclutar a 200 sujetos, seguidos de una asignación aleatoria de 100 sujetos a cada uno de los grupos de tratamiento y control. El grupo de tratamiento en el diseño no pareado se consideraría análogo a las mediciones posteriores al tratamiento en el diseño pareado, y el grupo de control se consideraría análogo a las mediciones previas al tratamiento. A continuación, podríamos calcular las medias muestrales dentro de los grupos de sujetos tratados y no tratados, y compararlas entre sí.
  • En un "análisis de diferencias pareadas", primero restaríamos el valor previo al tratamiento del valor posterior al tratamiento para cada sujeto, y luego compararíamos estas diferencias con cero.

Si solo consideramos las medias, los enfoques pareados y no pareados dan el mismo resultado. Para ver esto, sean Y i 1Y i 2 los datos observados para el i -ésimo par, y sea D i  =  Y i 2  −  Y i 1 . Además, sean D , Y 1 , y Y 2 las medias muestrales de D i , Y i 1 , y Y i 2 . Reordenando los términos podemos ver que

D¯=1nortei(Yi2Yi1)=1norteiYi21norteiYi1=Y¯2Y¯1,{\displaystyle {\bar {D}}={\frac {1}{n}}\sum _{i}(Y_{i2}-Y_{i1})={\frac {1}{n}}\sum _{i}Y_{i2}-{\frac {1}{n}}\sum _{i}Y_{i1}={\bar {Y}}_{2}-{\bar {Y}}_{1},}

donde n es el número de pares. Por lo tanto, la diferencia media entre los grupos no depende de si organizamos los datos en pares.

Aunque la diferencia media es la misma para las estadísticas pareadas y no pareadas, sus niveles de significación estadística pueden ser muy diferentes, porque es fácil sobreestimar la varianza de la estadística no pareada. Mediante la identidad de Bienaymé , la varianza de D es

var(D¯)=var(Y¯2Y¯1)=var(Y¯2)+var(Y¯1)2cobertura(Y¯1,Y¯2)=σ12/norte+σ22/norte2σ1σ2corr(Yi1,Yi2)/norte,{\displaystyle {\begin{aligned}{\rm {var}}({\bar {D}})&=\operatorname {var} ({\bar {Y}}_{2}-{\bar {Y}}_{1})\\&=\operatorname {var} ({\bar {Y}}_{2})+\operatorname {var} ({\bar {Y}}_{1})-2\operatorname {cov} ({\bar {Y}}_{1},{\bar {Y}}_{2})\\&=\sigma _{1}^{2}/n+\sigma _{2}^{2}/n-2\sigma _{1}\sigma _{2}\operatorname {corr} (Y_{i1},Y_{i2})/n,\end{aligned}}}

donde σ 1 y σ 2 son las desviaciones estándar poblacionales de los datos Y i 1 y Y i 2 , respectivamente. Por lo tanto, la varianza de D es menor si existe una correlación positiva dentro de cada par. Dicha correlación es muy común en el contexto de medidas repetidas, ya que muchos factores que influyen en el valor que se compara no se ven afectados por el tratamiento. Por ejemplo, si los niveles de colesterol están asociados con la edad, el efecto de la edad dará lugar a correlaciones positivas entre los niveles de colesterol medidos dentro de los sujetos, siempre que la duración del estudio sea pequeña en relación con la variación de edades en la muestra.

Potencia de la prueba Z pareada

Supongamos que utilizamos una prueba Z para analizar los datos, donde se conocen las varianzas de los datos previos y posteriores al tratamiento σ 1 2 y σ 2 2 (la situación con una prueba t es similar). El estadístico de la prueba Z para muestras independientes es

Y¯2Y¯1σ12/norte+σ22/norte,{\displaystyle {\frac {{\bar {Y}}_{2}-{\bar {Y}}_{1}}{\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}},}

La potencia de la prueba unilateral no pareada realizada al nivel α  = 0,05 se puede calcular de la siguiente manera:

PAG(Y¯2Y¯1σ12/norte+σ22/norte>1.645)=PAG(Y¯2Y¯1S>1.645σ12/norte+σ22/norte/S)=PAG(Y¯2Y¯1δ+δS>1.645σ12/norte+σ22/norte/S)=PAG(Y¯2Y¯1δS>1.645σ12/norte+σ22/norte/Sδ/S)=1Φ(1.645σ12/norte+σ22/norte/Sδ/S),{\displaystyle {\begin{aligned}P\left({\frac {{\bar {Y}}_{2}-{\bar {Y}}_{1}}{\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}}>1.645\right)&=P\left({\frac {{\bar {Y}}_{2}-{\bar {Y}}_{1}}{S}}>1.645{\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}/S\right)\\&=P\left({\frac {{\bar {Y}}_{2}-{\bar {Y}}_{1}-\delta +\delta }{S}}>1.645{\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}/S\right)\\&=P\left({\frac {{\bar {Y}}_{2}-{\bar {Y}}_{1}-\delta }{S}}>1.645{\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}/S-\delta /S\right)\\&=1-\Phi (1.645{\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}/S-\delta /S),\end{aligned}}}

donde S es la desviación estándar de D , Φ es la función de distribución acumulativa normal estándar y δ  = E Y 2  − E Y 1 es el verdadero efecto del tratamiento. La constante 1,645 es el percentil 95 de la distribución normal estándar, que define la región de rechazo de la prueba.

Mediante un cálculo similar, la potencia de la prueba Z pareada es

1Φ(1.645δ/S).{\displaystyle 1-\Phi (1,645-\delta /S).}

Al comparar las expresiones de potencia de las pruebas pareadas y no pareadas, se puede observar que la prueba pareada tiene mayor potencia siempre que

σ12/norte+σ22/norte/S=σ12+σ22σ12+σ222σ1σ2ρ>1 dónde ρ:=corr(Yi1,Yi2).{\displaystyle {\sqrt {\sigma _{1}^{2}/n+\sigma _{2}^{2}/n}}/S={\sqrt {\frac {\sigma _{1}^{2}+\sigma _{2}^{2}}{\sigma _{1}^{2}+\sigma _{2}^{2}-2\sigma _{1}\sigma _{2}\rho }}}>1{\text{ where }}\rho :=\operatorname {corr} (Y_{i1},Y_{i2}).}

Esta condición se cumple siempre que la correlación dentro de los pares sea positiva. ρ{\displaystyle \rho }

Un modelo de efectos aleatorios para pruebas pareadas

El siguiente modelo estadístico es útil para comprender la prueba de diferencia pareada.

Yij=μj+αi+εij{\displaystyle Y_{ij}=\mu _{j}+\alpha _{i}+\varepsilon _{ij}}

donde α i es un efecto aleatorio que se comparte entre los dos valores del par, y ε ij es un término de ruido aleatorio que es independiente en todos los puntos de datos. Los valores constantes μ 1μ 2 son los valores esperados de las dos mediciones que se comparan, y nuestro interés está en δ  =  μ 2  −  μ 1 .

En este modelo, los α i capturan "factores de confusión estables" que tienen el mismo efecto en las mediciones previas y posteriores al tratamiento. Cuando restamos para formar D i , los α i se cancelan, por lo que no contribuyen a la varianza. La covarianza dentro de los pares es

cov(Yi1,Yi2)=var(αi).{\displaystyle \operatorname {cov} (Y_{i1},Y_{i2})=\operatorname {var} (\alpha _{i}).}

Esto no es negativo, por lo que conduce a un mejor rendimiento para la prueba de diferencia pareada en comparación con la prueba no pareada, a menos que los α i sean constantes sobre i , en cuyo caso las pruebas pareadas y no pareadas son equivalentes.

En términos menos matemáticos, la prueba para muestras independientes asume que los datos de los dos grupos que se comparan son independientes. Esta suposición determina la forma de la varianza de D. Sin embargo, cuando se realizan dos mediciones para cada sujeto, es improbable que estas sean independientes. Si las dos mediciones dentro de un sujeto están correlacionadas positivamente, la prueba para muestras independientes sobreestima la varianza de D , lo que la convierte en una prueba conservadora, en el sentido de que su probabilidad real de error de tipo I será menor que el nivel nominal, con la consiguiente pérdida de potencia estadística. En raras ocasiones, los datos pueden estar correlacionados negativamente dentro de los sujetos, en cuyo caso la prueba para muestras independientes se vuelve anticonservadora. La prueba para muestras pareadas se utiliza generalmente cuando se realizan mediciones repetidas en los mismos sujetos, ya que tiene el nivel correcto independientemente de la correlación de las mediciones dentro de los pares.

Uso para reducir factores de confusión

Otra aplicación de las pruebas de diferencia pareada surge al comparar dos grupos en un conjunto de datos observacionales , con el objetivo de aislar el efecto de un factor de interés de los efectos de otros factores que puedan influir. Por ejemplo, supongamos que los profesores adoptan uno de dos enfoques diferentes, denominados "A" y "B", para enseñar un tema matemático en particular. Podríamos estar interesados ​​en saber si el rendimiento de los estudiantes en una prueba estandarizada de matemáticas difiere según el enfoque de enseñanza. Si los profesores tienen la libertad de adoptar el enfoque A o el enfoque B, es posible que aquellos cuyos estudiantes ya tienen un buen rendimiento en matemáticas prefieran el método A (o viceversa). En esta situación, una simple comparación entre el rendimiento promedio de los estudiantes que recibieron enseñanza con el enfoque A y el enfoque B probablemente mostrará una diferencia, pero esta diferencia se debe parcial o totalmente a las diferencias preexistentes entre los dos grupos de estudiantes. En esta situación, las habilidades iniciales de los estudiantes actúan como una variable de confusión , ya que están relacionadas tanto con el resultado (rendimiento en la prueba estandarizada ) como con la asignación del tratamiento al enfoque A o al enfoque B.

Es posible reducir, aunque no necesariamente eliminar, los efectos de las variables de confusión mediante la formación de "pares artificiales" y la realización de una prueba de diferencia por pares. Estos pares artificiales se construyen a partir de variables adicionales que se consideran factores de confusión. Al emparejar a estudiantes cuyos valores en las variables de confusión son similares, una mayor fracción de la diferencia en el valor de interés (por ejemplo, la puntuación de la prueba estandarizada en el ejemplo anterior) se debe al factor de interés, y una menor fracción se debe al factor de confusión. La formación de pares artificiales para la prueba de diferencia por pares es un ejemplo de un enfoque general para reducir los efectos de la confusión al realizar comparaciones utilizando datos observacionales, denominado emparejamiento . [ 2 ] [ 3 ] [ 4 ]

Como ejemplo concreto, supongamos que observamos las puntuaciones de las pruebas de los estudiantes X bajo las estrategias de enseñanza A y B , y que cada estudiante tiene un nivel de conocimiento matemático "alto" o "bajo" antes de que se implementen las dos estrategias de enseñanza. Sin embargo, no sabemos qué estudiantes están en la categoría "alta" y cuáles en la categoría "baja". Las puntuaciones medias de las pruebas de la población en los cuatro grupos posibles son y las proporciones de estudiantes en los grupos son donde p HA  +  p HB  +  p LA  +  p LB  = 1 . ABHighμHAμHBLowμLAμLB{\displaystyle {\begin{array}{l|ll}&A&B\\\hline {\text{High}}&\mu _{HA}&\mu _{HB}\\{\text{Low}}&\mu _{LA}&\mu _{LB}\end{array}}}ABHighpHApHBLowpLApLB{\displaystyle {\begin{array}{l|ll}&A&B\\\hline {\text{High}}&p_{HA}&p_{HB}\\{\text{Low}}&p_{LA}&p_{LB}\end{array}}}

La diferencia de tratamiento entre los estudiantes del grupo de alto rendimiento es μ HA  −  μ HB , y la diferencia de tratamiento entre los estudiantes del grupo de bajo rendimiento es μ LA  −  μ LB. En general, es posible que las dos estrategias de enseñanza difieran en cualquier dirección, o que no muestren ninguna diferencia, y que los efectos difieran en magnitud o incluso en signo entre los grupos de alto y bajo rendimiento. Por ejemplo, si la estrategia B fuera superior a la estrategia A para los estudiantes bien preparados, pero la estrategia A fuera superior a la estrategia B para los estudiantes mal preparados, las dos diferencias de tratamiento tendrían signos opuestos.

Dado que no conocemos los niveles de referencia de los estudiantes, el valor esperado de la puntuación media de la prueba X A entre los estudiantes del grupo A es un promedio de las puntuaciones de los dos niveles de referencia:

EX¯A=μHApHApHA+pLA+μLApLApHA+pLA,{\displaystyle E{\bar {X}}_{A}=\mu _{HA}{\frac {p_{HA}}{p_{HA}+p_{LA}}}+\mu _{LA}{\frac {p_{LA}}{p_{HA}+p_{LA}}},}

y de manera similar, la puntuación promedio de la prueba X B entre los estudiantes del grupo B es

EX¯B=μHBpHBpHB+pLB+μLBpLBpHB+pLB.{\displaystyle E{\bar {X}}_{B}=\mu _{HB}{\frac {p_{HB}}{p_{HB}+p_{LB}}}+\mu _{LB}{\frac {p_{LB}}{p_{HB}+p_{LB}}}.}

Por lo tanto, el valor esperado de la diferencia de tratamiento observada D  =  X A  −  X B es

μHApHApHA+pLAμHBpHBpHB+pLB+μLApLApHA+pLAμLBpLBpHB+pLB.{\displaystyle \mu _{HA}{\frac {p_{HA}}{p_{HA}+p_{LA}}}-\mu _{HB}{\frac {p_{HB}}{p_{HB}+p_{LB}}}+\mu _{LA}{\frac {p_{LA}}{p_{HA}+p_{LA}}}-\mu _{LB}{\frac {p_{LB}}{p_{HB}+p_{LB}}}.}

Una hipótesis nula razonable es que no hay efecto del tratamiento dentro de los grupos de estudiantes "alto" o "bajo", de modo que μ HA  =  μ HB y μ LA  =  μ LB. Bajo esta hipótesis nula, el valor esperado de D será cero si

pHA=(pHA+pLA)(pHA+pHB){\displaystyle p_{HA}=(p_{HA}+p_{LA})(p_{HA}+p_{HB})}

y

pHB=(pHB+pLB)(pHA+pHB).{\displaystyle p_{HB}=(p_{HB}+p_{LB})(p_{HA}+p_{HB}).}

Esta condición afirma que la asignación de estudiantes a los grupos de estrategias de enseñanza A y B es independiente de sus conocimientos matemáticos previos a la implementación de dichas estrategias. Si esto se cumple, los conocimientos matemáticos iniciales no son un factor de confusión; por el contrario, si los conocimientos matemáticos iniciales son un factor de confusión, el valor esperado de D generalmente será distinto de cero. Si el valor esperado de D bajo la hipótesis nula no es igual a cero, entonces una situación en la que rechacemos la hipótesis nula podría deberse a un efecto diferencial real entre las estrategias de enseñanza A y B , o bien a la falta de independencia en la asignación de estudiantes a los grupos A y B (incluso en ausencia total de un efecto debido a la estrategia de enseñanza).

Este ejemplo ilustra que, si realizamos una comparación directa entre dos grupos en presencia de factores de confusión, desconocemos si la diferencia observada se debe a la agrupación en sí o a algún otro factor. Si podemos emparejar a los estudiantes según una medida exacta o estimada de su habilidad matemática inicial, entonces solo estamos comparando estudiantes "dentro de las filas" de la tabla de medias mencionada anteriormente. Por consiguiente, si la hipótesis nula es cierta, el valor esperado de D será igual a cero, y los niveles de significación estadística tendrán la interpretación prevista.

Véase también

Referencias

  1. ^ Derrick, B; Broad, A; Toher, D; White, P (2017). "El impacto de una observación extrema en un diseño de muestras pareadas" . Metodološki Zvezki - Avances en Metodología y Estadística . 14 (2): 1– 17.
  2. ^ Rubin, Donald B. (1973). "Matching to Remove Bias in Observational Studies". Biometrics . 29 (1): 159– 183. doi : 10.2307/2529684 . JSTOR 2529684 . 
  3. ^ Anderson, Dallas W.; Kish, Leslie; Cornell, Richard G. (1980). "Sobre la estratificación, la agrupación y el emparejamiento". Scandinavian Journal of Statistics . 7 (2). Blackwell Publishing: 61– 66. JSTOR 4615774 . 
  4. ^ Kupper, Lawrence L.; Karon, John M.; Kleinbaum, David G.; Morgenstern, Hal; Lewis, Donald K. (1981). "Matching in Epidemiologic Studies: Validity and Efficiency Considerations". Biometrics . 37 (2): 271– 291. CiteSeerX 10.1.1.154.1197 . doi : 10.2307/2530417 . JSTOR 2530417 . PMID 7272415 .   
  • Medición relativa y su generalización en la toma de decisiones: por qué las comparaciones por pares son fundamentales en matemáticas para la medición de factores intangibles: el proceso de jerarquía analítica/red (Thomas L. Saaty)
  • Evaluación de comparación de secuencias por pares
  • Comparación por pares (Filippo A. Salustri)
Obtenido de " https://en.wikipedia.org/w/index.php?title=Paired_difference_test&oldid=1293072605 "