Articulo de referencia

Tamaño del efecto

En estadística , el tamaño del efecto es una medida cuantitativa de la magnitud de un fenómeno . [ 1 ] Puede referirse al valor de una estadística calculada a partir de una mues...

En estadística , el tamaño del efecto es una medida cuantitativa de la magnitud de un fenómeno . [ 1 ] Puede referirse al valor de una estadística calculada a partir de una muestra de datos , al valor de un parámetro para una población hipotética o a la ecuación que operacionaliza cómo las estadísticas o los parámetros conducen al valor del tamaño del efecto. [ 1 ] Ejemplos de tamaños del efecto incluyen la correlación entre dos variables, [ 2 ] el coeficiente de regresión en una regresión, la diferencia de medias y el riesgo de un evento particular (como un ataque cardíaco). Los tamaños del efecto son una herramienta complementaria para la prueba de hipótesis estadísticas y juegan un papel importante en los análisis de potencia estadística para evaluar el tamaño de muestra requerido para nuevos experimentos. [ 3 ] Los cálculos del tamaño del efecto son fundamentales para el metaanálisis , que tiene como objetivo proporcionar el tamaño del efecto combinado basado en datos de múltiples estudios. El grupo de métodos de análisis de datos relacionados con los tamaños del efecto se denomina estadística de estimación .

El tamaño del efecto es un componente esencial en la evaluación de la fuerza de una afirmación estadística, y es el primer elemento (magnitud) en los criterios MAGIC . La desviación estándar del tamaño del efecto es de vital importancia, ya que indica cuánta incertidumbre se incluye en la medición observada. Una desviación estándar demasiado grande hará que la medición sea prácticamente inútil. En el metaanálisis, que busca resumir múltiples tamaños del efecto en una sola estimación, la incertidumbre en los tamaños del efecto de los estudios se utiliza para ponderar la contribución de cada estudio, por lo que los estudios más grandes se consideran más importantes que los más pequeños. La incertidumbre en el tamaño del efecto se calcula de manera diferente para cada tipo de tamaño del efecto, pero generalmente solo requiere conocer el tamaño de la muestra del estudio ( N ) o el número de observaciones ( n ) en cada grupo.

Informar sobre los tamaños del efecto o sus estimaciones (estimación del efecto [EE], estimación del efecto) se considera una buena práctica al presentar los resultados de la investigación empírica en muchos campos. [ 4 ] [ 5 ] Informar sobre los tamaños del efecto facilita la interpretación de la importancia de un resultado de investigación, en contraste con su significación estadística . [ 6 ] Los tamaños del efecto son particularmente significativos en las ciencias sociales y la investigación médica , donde esta última enfatiza la importancia de la magnitud del efecto promedio del tratamiento .

Los tamaños del efecto pueden medirse en términos relativos o absolutos. En los tamaños del efecto relativos, se comparan directamente dos grupos, como en las razones de probabilidades y los riesgos relativos . Un valor absoluto mayor siempre indica un efecto más fuerte en los tamaños del efecto absolutos. Muchos tipos de mediciones pueden expresarse como absolutas o relativas, y pueden usarse conjuntamente porque transmiten información diferente. Un grupo de trabajo destacado en la comunidad de investigación psicológica hizo la siguiente recomendación:

Presente siempre los tamaños del efecto para los resultados primarios... Si las unidades de medida son significativas a nivel práctico (por ejemplo, número de cigarrillos fumados por día), generalmente preferimos una medida no estandarizada (coeficiente de regresión o diferencia de medias) a una medida estandarizada ( r o d ). [ 4 ]

Descripción general

Tamaños del efecto de la población y de la muestra

Como en la estimación estadística , el tamaño del efecto verdadero se distingue del tamaño del efecto observado. Por ejemplo, para medir el riesgo de enfermedad en una población (el tamaño del efecto poblacional), se puede medir el riesgo dentro de una muestra de esa población (el tamaño del efecto muestral). Las convenciones para describir los tamaños del efecto verdadero y observado siguen las prácticas estadísticas estándar; un enfoque común es usar letras griegas como ρ [rho] para denotar los parámetros poblacionales y letras latinas como r para denotar el estadístico correspondiente. Alternativamente, se puede colocar un "sombrero" sobre el parámetro poblacional para denotar el estadístico, por ejemplo, conρ^{\displaystyle {\hat {\rho }}}siendo la estimación del parámetroρ{\displaystyle \rho }.

Como en cualquier contexto estadístico, los tamaños del efecto se estiman con error de muestreo y pueden estar sesgados a menos que el estimador del tamaño del efecto utilizado sea apropiado para la forma en que se muestrearon los datos y la forma en que se realizaron las mediciones. Un ejemplo de esto es el sesgo de publicación , que ocurre cuando los científicos informan resultados solo cuando los tamaños del efecto estimados son grandes o estadísticamente significativos. Como resultado, si muchos investigadores realizan estudios con baja potencia estadística, los tamaños del efecto informados tenderán a ser mayores que los efectos reales (poblacionales), si los hay. [ 7 ] Otro ejemplo donde los tamaños del efecto pueden estar distorsionados es en un experimento de ensayos múltiples, donde el cálculo del tamaño del efecto se basa en la respuesta promedio o agregada a lo largo de los ensayos. [ 8 ]

En ocasiones, los estudios más pequeños muestran tamaños del efecto diferentes, a menudo mayores, que los estudios más grandes. Este fenómeno se conoce como el efecto de estudios pequeños, que puede indicar un sesgo de publicación. [ 9 ]

Relación con las estadísticas de prueba

Los tamaños del efecto basados ​​en muestras se distinguen de las estadísticas de prueba utilizadas en la comprobación de hipótesis, ya que estiman la fuerza (magnitud) de, por ejemplo, una relación aparente, en lugar de asignar un nivel de significación que refleje si la magnitud de la relación observada podría deberse al azar. El tamaño del efecto no determina directamente el nivel de significación, ni viceversa. Con un tamaño de muestra suficientemente grande, una comparación estadística no nula siempre mostrará un resultado estadísticamente significativo, a menos que el tamaño del efecto poblacional sea exactamente cero (e incluso en ese caso, mostrará significación estadística a la tasa del error de tipo I utilizado). Por ejemplo, un coeficiente de correlación de Pearson muestral de 0,01 es estadísticamente significativo si el tamaño de la muestra es 1000. Informar solo el valor p significativo de este análisis podría ser engañoso si una correlación de 0,01 es demasiado pequeña para ser relevante en una aplicación particular.

Tamaños del efecto estandarizados y no estandarizados

El término tamaño del efecto puede referirse a una medida estandarizada del efecto (como r , la d de Cohen o la razón de probabilidades ) o a una medida no estandarizada (por ejemplo, la diferencia entre las medias de los grupos o los coeficientes de regresión no estandarizados). Las medidas estandarizadas del tamaño del efecto se utilizan normalmente cuando:

  • Las métricas de las variables que se estudian no tienen un significado intrínseco (por ejemplo, una puntuación en una prueba de personalidad en una escala arbitraria),
  • Se están combinando los resultados de múltiples estudios,
  • Algunos o todos los estudios utilizan escalas diferentes, o
  • Se busca transmitir la magnitud de un efecto en relación con la variabilidad de la población.

En los metaanálisis, los tamaños del efecto estandarizados se utilizan como una medida común que se puede calcular para diferentes estudios y luego combinar en un resumen general.

Interpretación

La interpretación de un tamaño del efecto como pequeño , mediano o grande depende de su contexto sustantivo y su definición operacional. Jacob Cohen [ 10 ] sugirió pautas de interpretación que son prácticamente universales en muchos campos. Sin embargo, Cohen también advirtió:

Los términos «pequeño», «mediano» y «grande» son relativos, no solo entre sí, sino también al ámbito de las ciencias del comportamiento o, más concretamente, al contenido específico y al método de investigación empleado en cada estudio. Ante esta relatividad, existe cierto riesgo inherente al ofrecer definiciones operativas convencionales para estos términos en el análisis de potencia en un campo de investigación tan diverso como las ciencias del comportamiento. No obstante, se acepta este riesgo con la convicción de que se gana más de lo que se pierde al proporcionar un marco de referencia convencional común, cuyo uso se recomienda únicamente cuando no se dispone de una base mejor para estimar el índice ES. (p. 25)

Sawilowsky [ 11 ] recomendó que se revisaran las reglas generales para los tamaños del efecto y amplió las descripciones para incluir muy pequeños , muy grandes y enormes . Funder y Ozer [ 12 ] sugirieron que los tamaños del efecto se interpretaran en función de los puntos de referencia y las consecuencias de los hallazgos, lo que dio lugar a un ajuste de las recomendaciones de las guías.

Lenth [ 13 ] señaló que para un tamaño del efecto medio , "se elegirá la misma n independientemente de la precisión o confiabilidad del instrumento, o de la estrechez o diversidad de los sujetos. Claramente, se están ignorando consideraciones importantes. Los investigadores deben interpretar la significancia sustantiva de sus resultados fundamentándolos en un contexto significativo o cuantificando su contribución al conocimiento, y las descripciones del tamaño del efecto de Cohen pueden ser útiles como punto de partida". [ 6 ] De manera similar, un informe patrocinado por el Departamento de Educación de EE. UU. argumentó que el uso generalizado e indiscriminado de las pautas de interpretación de Cohen puede ser inapropiado y engañoso. [ 14 ] En cambio, sugirieron que las normas deberían basarse en distribuciones de tamaños del efecto de estudios comparables. Por lo tanto, un efecto pequeño (en números absolutos) podría considerarse grande si el efecto es mayor que el de estudios similares en el campo. Véanse la paradoja de Abelson y la paradoja de Sawilowsky para puntos relacionados. [ 15 ] [ 16 ] [ 17 ]

La tabla que aparece a continuación contiene descriptores para varias magnitudes de d , r , f y omega , como sugirió inicialmente Jacob Cohen, [ 10 ] y posteriormente ampliado por Sawilowsky, [ 11 ] y por Funder y Ozer. [ 12 ]

Tipos

Se conocen entre 50 y 100 medidas diferentes del tamaño del efecto. Muchas medidas de tamaño del efecto de distintos tipos pueden convertirse a otros tipos, ya que muchas estiman la separación de dos distribuciones y, por lo tanto, están relacionadas matemáticamente. Por ejemplo, un coeficiente de correlación puede convertirse en una d de Cohen y viceversa.

Familia de correlación: Tamaños del efecto basados ​​en la "varianza explicada"

Estos tamaños del efecto estiman la cantidad de la varianza dentro de un experimento que es "explicada" o "contabilizada" por el modelo del experimento ( Variación explicada ).

Coeficiente de correlación o r de Pearson

La correlación de Pearson , a menudo denotada como r e introducida por Karl Pearson , se utiliza ampliamente como medida del tamaño del efecto cuando se dispone de datos cuantitativos pareados; por ejemplo, al estudiar la relación entre el peso al nacer y la longevidad. El coeficiente de correlación también puede utilizarse cuando los datos son binarios. El valor de r de Pearson puede variar de -1 a 1, donde -1 indica una relación lineal negativa perfecta, 1 una relación lineal positiva perfecta y 0 la ausencia de relación lineal entre dos variables.

Coeficiente de determinación ( o )

Un tamaño del efecto relacionado es , el coeficiente de determinación (también conocido como o " r al cuadrado"), calculado como el cuadrado de la correlación de Pearson r . En el caso de datos pareados, esta es una medida de la proporción de varianza compartida por las dos variables, y varía de 0 a 1. Por ejemplo, con un r de 0,21, el coeficiente de determinación es 0,0441, lo que significa que el 4,4 % de la varianza de una variable se comparte con la otra. El siempre es positivo, por lo que no indica la dirección de la correlación entre las dos variables.

Eta al cuadrado ( η 2 )

El eta cuadrado describe la proporción de la varianza explicada en la variable dependiente por un predictor , controlando otros predictores, lo que lo hace análogo al . El eta cuadrado es un estimador sesgado de la varianza explicada por el modelo en la población (solo estima el tamaño del efecto en la muestra). Este estimador comparte con el r² la debilidad de que cada variable adicional incrementará automáticamente el valor de η² . Además, mide la varianza explicada de la muestra, no de la población, lo que significa que siempre sobreestimará el tamaño del efecto, aunque el sesgo disminuye a medida que aumenta el tamaño de la muestra. η2=SSTratamientoSSTotal.{\displaystyle \eta ^{2}={\frac {SS_{\text{Tratamiento}}}{SS_{\text{Total}}}}.}

Omega al cuadrado ( ω² )

Un estimador menos sesgado de la varianza explicada en la población es ω 2 [ 18 ]ω2=SStratamientodFtratamientoEMerrorSStotal+EMerror.{\displaystyle \omega ^{2}={\frac {{\text{SS}}_{\text{tratamiento}}-df_{\text{tratamiento}}\cdot {\text{MS}}_{\text{error}}}{{\text{SS}}_{\text{total}}+{\text{MS}}_{\text{error}}}}.}

Esta forma de la fórmula se limita al análisis entre sujetos con tamaños de muestra iguales en todas las celdas. [ 18 ] Dado que es menos sesgada (aunque no insesgada ), ω 2 es preferible a η 2 ; sin embargo, puede ser más inconveniente calcularla para análisis complejos. Se ha publicado una forma generalizada del estimador para análisis entre sujetos y dentro de sujetos, medidas repetidas, diseño mixto y experimentos de diseño de bloques aleatorizados. [ 19 ] Además, se han publicado métodos para calcular ω 2 parcial para factores individuales y factores combinados en diseños con hasta tres variables independientes. [ 19 ]

f 2 de Cohen

El estadístico f 2 de Cohen es una de las varias medidas de tamaño del efecto que se utilizan en el contexto de una prueba F para ANOVA o regresión múltiple . Su grado de sesgo (sobreestimación del tamaño del efecto para el ANOVA) depende del sesgo de su medida subyacente de varianza explicada (por ejemplo, R 2 , η 2 , ω 2 ).

La medida del tamaño del efecto f2 para la regresión múltiple se define como: F2=R21R2.{\displaystyle f^{2}={R^{2} \over 1-R^{2}}.}

Asimismo, f 2 puede definirse como: F2=η21η2{\displaystyle f^{2}={\eta ^{2} \over 1-\eta ^{2}}}oF2=ω21ω2{\displaystyle f^{2}={\omega ^{2} \over 1-\omega ^{2}}} para modelos descritos por esas medidas de tamaño del efecto. [ 20 ]

ElF2{\displaystyle f^{2}}La medida del tamaño del efecto para la regresión múltiple secuencial, y también común para el modelado PLS [ 21 ], se define como: F2=RAB2RA21RAB2{\displaystyle f^{2}={R_{AB}^{2}-R_{A}^{2} \over 1-R_{AB}^{2}}} donde R 2 A es la varianza explicada por un conjunto de una o más variables independientes A , y R 2 AB es la varianza combinada explicada por A y otro conjunto de una o más variables independientes de interés B . Por convención, f 2 tamaños del efecto de0.12{\displaystyle 0.1^{2}},0,252{\displaystyle 0.25^{2}}, y0,42{\displaystyle 0.4^{2}}se denominan pequeños , medianos y grandes , respectivamente. [ 10 ]

CohenF^{\displaystyle {\hat {f}}}También se puede encontrar para el análisis factorial de varianza (ANOVA) trabajando hacia atrás, utilizando: F^efecto=(FefectodFefecto/norte).{\displaystyle {\hat {f}}_{\text{efecto}}={\sqrt {(F_{\text{efecto}}df_{\text{efecto}}/N)}}.}

En un diseño equilibrado (tamaños de muestra equivalentes entre grupos) de ANOVA, el parámetro poblacional correspondiente deF2{\displaystyle f^{2}}es SS(μ1,μ2,,μK)K×σ2,{\displaystyle {SS(\mu _{1},\mu _{2},\dots ,\mu _{K})} \over {K\times \sigma ^{2}},} donde μ j denota la media poblacional dentro del j -ésimo grupo de los K grupos totales, y σ la desviación estándar poblacional equivalente dentro de cada grupo. SS es la suma de cuadrados en ANOVA.

La pregunta de Cohen

Otra medida que se utiliza con las diferencias de correlación es la q de Cohen. Esta es la diferencia entre dos coeficientes de regresión de Pearson transformados de Fisher. En símbolos, esto es q=12registro1+r11r112registro1+r21r2{\displaystyle q={\frac {1}{2}}\log {\frac {1+r_{1}}{1-r_{1}}}-{\frac {1}{2}}\log {\frac {1+r_{2}}{1-r_{2}}}}

donde r 1 y r 2 son las regresiones que se comparan. El valor esperado de q es cero y su varianza es var(q)=1norte13+1norte23{\displaystyle \operatorname {var} (q)={\frac {1}{N_{1}-3}}+{\frac {1}{N_{2}-3}}} donde N 1 y N 2 son el número de puntos de datos en la primera y segunda regresión respectivamente.

Familia de diferencias: Tamaños del efecto basados ​​en diferencias entre medias

El tamaño del efecto bruto en la comparación de dos grupos se calcula intrínsecamente como la diferencia entre sus medias. Sin embargo, para facilitar su interpretación, es común estandarizarlo; a continuación se presentan diversas convenciones para la estandarización estadística.

Diferencia de medias estandarizada

Gráficas de densidades gaussianas que ilustran varios valores de la d de Cohen.

Un tamaño del efecto (poblacional) θ basado en medias generalmente considera la diferencia de medias estandarizada (DME) entre dos poblaciones [ 22 ] : 78θ=μ1μ2σ,{\displaystyle \theta ={\frac {\mu _{1}-\mu _{2}}{\sigma }},} donde μ 1 es la media de una población, μ 2 es la media de la otra población y σ es una desviación estándar basada en una o ambas poblaciones.

En la práctica, los valores poblacionales generalmente se desconocen y deben estimarse a partir de estadísticas muestrales. Las distintas versiones de los tamaños del efecto basadas en las medias difieren en cuanto a las estadísticas que se utilizan.

Esta forma para el tamaño del efecto se asemeja al cálculo para un estadístico de prueba t , con la diferencia crítica de que el estadístico de prueba t incluye un factor denorte{\displaystyle {\sqrt {n}}}Esto significa que, para un tamaño del efecto dado, el nivel de significancia aumenta con el tamaño de la muestra. A diferencia del estadístico t , el tamaño del efecto busca estimar un parámetro poblacional y no se ve afectado por el tamaño de la muestra.

Los valores SMD de 0,2 a 0,5 se consideran pequeños, de 0,5 a 0,8 se consideran medianos y mayores que 0,8 se consideran grandes. [ 23 ]

Cohen's d

La d de Cohen se define como la diferencia entre dos medias dividida por la desviación estándar de los datos, es decir d=incógnita¯1incógnita¯2s.{\displaystyle d={\frac {{\bar {x}}_{1}-{\bar {x}}_{2}}{s}}.}

Jacob Cohen definió s , la desviación estándar combinada , como (para dos muestras independientes): [ 10 ] : 67s=(norte11)s12+(norte21)s22norte1+norte22{\displaystyle s={\sqrt {\frac {(n_{1}-1)s_{1}^{2}+(n_{2}-1)s_{2}^{2}}{n_{1}+n_{2}-2}}}} donde la varianza para uno de los grupos se define como s12=1norte11i=1norte1(incógnita1,iincógnita¯1)2,{\displaystyle s_{1}^{2}={\frac {1}{n_{1}-1}}\sum _{i=1}^{n_{1}}(x_{1,i}-{\bar {x}}_{1})^{2},} y de forma similar para el otro grupo.

Otros autores eligen un cálculo ligeramente diferente de la desviación estándar cuando se refieren a la " d de Cohen " donde el denominador no incluye "-2" [ 24 ] [ 25 ] : 14s=(norte11)s12+(norte21)s22norte1+norte2{\displaystyle s={\sqrt {\frac {(n_{1}-1)s_{1}^{2}+(n_{2}-1)s_{2}^{2}}{n_{1}+n_{2}}}}} Esta definición de " d de Cohen " es denominada estimador de máxima verosimilitud por Hedges y Olkin, [ 22 ] y está relacionada con la g de Hedges mediante un factor de escala (véase más abajo).

Con dos muestras pareadas, un enfoque consiste en observar la distribución de las puntuaciones de diferencia. En ese caso, s es la desviación estándar de esta distribución de puntuaciones de diferencia (cabe destacar que la desviación estándar de las puntuaciones de diferencia depende de la correlación entre las muestras pareadas). Esto crea la siguiente relación entre el estadístico t para probar la diferencia en las medias de los dos grupos pareados y la d' de Cohen (calculada con las puntuaciones de diferencia): t=incógnita¯1incógnita¯2SEdiFF=incógnita¯1incógnita¯2DAKOTA DEL SURdiFFnorte=norte(incógnita¯1incógnita¯2)SDdiFF{\displaystyle t={\frac {{\bar {X}}_{1}-{\bar {X}}_{2}}{{\text{SE}}_{diff}}}={\frac {{\bar {X}}_{1}-{\bar {X}}_{2}}{\frac {{\text{SD}}_{diff}}{\sqrt {N}}}}={\frac {{\sqrt {N}}({\bar {X}}_{1}-{\bar {X}}_{2})}{SD_{diff}}}} y d=incógnita¯1incógnita¯2DAKOTA DEL SURdiFF=tnorte{\displaystyle d'={\frac {{\bar {X}}_{1}-{\bar {X}}_{2}}{{\text{SD}}_{diff}}}={\frac {t}{\sqrt {N}}}}Sin embargo, para muestras pareadas, Cohen afirma que d' no proporciona la estimación correcta para obtener la potencia de la prueba para d, y que antes de buscar los valores en las tablas proporcionadas para d, se debe corregir para r como en la siguiente fórmula: [ 26 ]d1r.{\displaystyle {\frac {d'}{\sqrt {1-r}}}.}donde r es la correlación entre mediciones pareadas. Con el mismo tamaño de muestra, cuanto mayor sea r, mayor será la potencia de una prueba de diferencia pareada.

Dado que d' depende de r, como medida del tamaño del efecto es difícil de interpretar; por lo tanto, en el contexto de análisis pareados, dado que es posible calcular d' o d (estimado con una desviación estándar combinada o la de un grupo o punto temporal), es necesario indicar explícitamente cuál se está informando. Como medida del tamaño del efecto, d (estimado con una desviación estándar combinada o la de un grupo o punto temporal) es más apropiado, por ejemplo, en metaanálisis. [ 27 ]

El coeficiente d de Cohen se utiliza frecuentemente para estimar el tamaño de la muestra en pruebas estadísticas. Un valor bajo de d de Cohen indica la necesidad de un tamaño de muestra mayor, y viceversa, como se puede determinar posteriormente junto con los parámetros adicionales de nivel de significancia y potencia estadística deseados . [ 28 ]

Δ de vidrio

En 1976, Gene V. Glass propuso un estimador del tamaño del efecto que utiliza únicamente la desviación estándar del segundo grupo [ 22 ] : 78Δ=incógnita¯1incógnita¯2s2{\displaystyle \Delta ={\frac {{\bar {x}}_{1}-{\bar {x}}_{2}}{s_{2}}}}

El segundo grupo puede considerarse un grupo de control, y Glass argumentó que si se comparaban varios tratamientos con el grupo de control, sería mejor utilizar solo la desviación estándar calculada a partir del grupo de control, de modo que los tamaños del efecto no difirieran bajo medias iguales y varianzas diferentes.

Bajo el supuesto correcto de que las varianzas poblacionales son iguales, una estimación combinada para σ es más precisa.

Hedges' g

La g de Hedges , sugerida por Larry Hedges en 1981, [ 29 ] es similar a las otras medidas basadas en una diferencia estandarizada [ 22 ] : 79gramo=incógnita¯1incógnita¯2s{\displaystyle g={\frac {{\bar {x}}_{1}-{\bar {x}}_{2}}{s^{*}}}} donde la desviación estándar combinadas{\displaystyle s^{*}}se calcula como: s=(norte11)s12+(norte21)s22norte1+norte22.{\displaystyle s^{*}={\sqrt {\frac {(n_{1}-1)s_{1}^{2}+(n_{2}-1)s_{2}^{2}}{n_{1}+n_{2}-2}}}.}

Sin embargo, como estimador del tamaño del efecto poblacional θ, está sesgado . No obstante, este sesgo puede corregirse aproximadamente mediante la multiplicación por un factor. gramo=J(norte1+norte22)gramo(134(norte1+norte2)9)gramo{\displaystyle g^{*}=J(n_{1}+n_{2}-2)\,\,g\,\approx \,\left(1-{\frac {3}{4(n_{1}+n_{2})-9}}\right)\,\,g} Hedges y Olkin se refieren a este estimador menos sesgado.gramo{\displaystyle g^{*}}como d , [ 22 ] pero no es lo mismo que la d de Cohen . La forma exacta para el factor de corrección J () involucra la función gamma [ 22 ] : 104J(a)=Γ(a/2)a/2Γ((a1)/2).{\displaystyle J(a)={\frac {\Gamma (a/2)}{{\sqrt {a/2\,}}\,\Gamma ((a-1)/2)}}.} También existen variantes multinivel de la g de Hedges, por ejemplo, para su uso en ensayos controlados aleatorizados por conglomerados (ECA). [ 30 ] Los ECA implican la aleatorización de conglomerados, como escuelas o aulas, a diferentes condiciones y se utilizan con frecuencia en la investigación educativa.

Ψ, efecto estandarizado de raíz cuadrática media

Un estimador de tamaño de efecto similar para comparaciones múltiples (por ejemplo, ANOVA ) es el efecto estandarizado de raíz cuadrática media Ψ: [ 20 ]Ψ=1k1j=1k(μjμσ)2{\displaystyle \Psi ={\sqrt {{\frac {1}{k-1}}\cdot \sum _{j=1}^{k}\left({\frac {\mu _{j}-\mu }{\sigma }}\right)^{2}}}} donde k es el número de grupos en las comparaciones.

Esto presenta esencialmente la diferencia global de todo el modelo ajustada por la raíz cuadrática media, análoga a d o g .

Además, se ha proporcionado una generalización para diseños multifactoriales. [ 20 ]

Distribución de los tamaños del efecto en función de las medias

Siempre que los datos tengan una distribución gaussiana , se utiliza una g de Hedges escalada .norte1norte2/(norte1+norte2)gramo{\textstyle {\sqrt {n_{1}n_{2}/(n_{1}+n_{2})}}\,g}, sigue una distribución t no central con el parámetro de no centralidadnorte1norte2/(norte1+norte2)θ{\textstyle {\sqrt {n_{1}n_{2}/(n_{1}+n_{2})}}\theta }y ( n 1 + n 2 − 2) grados de libertad. De igual modo, el Δ de Glass escalado se distribuye con n 2 − 1 grados de libertad.

A partir de la distribución es posible calcular la esperanza matemática y la varianza de los tamaños del efecto.

En algunos casos se utilizan aproximaciones de muestras grandes para la varianza. Una sugerencia para la varianza del estimador insesgado de Hedges es [ 22 ] : 86σ^2(gramo)=norte1+norte2norte1norte2+(gramo)22(norte1+norte2).{\displaystyle {\hat {\sigma }}^{2}(g^{*})={\frac {n_{1}+n_{2}}{n_{1}n_{2}}}+{\frac {(g^{*})^{2}}{2(n_{1}+n_{2})}}.}

Diferencia de medias estrictamente estandarizada (SSMD)

Como parámetro estadístico, SSMD (denominado comoβ{\displaystyle \beta }) se define como la razón entre la media y la desviación estándar de la diferencia de dos valores aleatorios de dos grupos respectivamente. Supongamos que un grupo con valores aleatorios tiene mediaμ1{\displaystyle \mu _{1}}y varianzaσ12{\displaystyle \sigma _{1}^{2}}y otro grupo tiene mediaμ2{\displaystyle \mu _{2}}y varianzaσ22{\displaystyle \sigma _{2}^{2}}La covarianza entre los dos grupos esσ12.{\displaystyle \sigma _{12}.} Entonces, el SSMD para la comparación de estos dos grupos se define como [ 31 ].

β=μ1μ2σ12+σ222σ12.{\displaystyle \beta ={\frac {\mu _{1}-\mu _{2}}{\sqrt {\sigma _{1}^{2}+\sigma _{2}^{2}-2\sigma _{12}}}}.}

Si los dos grupos son independientes,

β=μ1μ2σ12+σ22.{\displaystyle \beta ={\frac {\mu _{1}-\mu _{2}}{\sqrt {\sigma _{1}^{2}+\sigma _{2}^{2}}}}.}

Si los dos grupos independientes tienen varianzas igualesσ2{\displaystyle \sigma ^{2}},

β=μ1μ22σ.{\displaystyle \beta ={\frac {\mu _{1}-\mu _{2}}{{\sqrt {2}}\sigma }}.}

Otras métricas

La distancia de Mahalanobis (D) es una generalización multivariada de la d de Cohen, que tiene en cuenta las relaciones entre las variables. [ 32 ]

La E de Subin (miHBGRAMO{\displaystyle E_{HBG}}) es un tamaño del efecto acotado para datos de evaluaciones repetidas pareadas. Estandariza la ganancia media utilizando una dispersión de referencia, incorpora la heterogeneidad en las puntuaciones de ganancia individuales y aplica una transformación arcotangente acotada. Está diseñado para comparaciones pareadas dentro de un grupo a través de ocasiones de evaluación repetidas. [ 33 ] [ 34 ]

miHBGRAMO=2πarctan(J(incógnita¯2incógnita¯1)kSrmiF1+λ(sDSrmiF)2){\displaystyle E_{HBG}={\frac {2}{\pi }}\arctan \left({\frac {J({\bar {X}}_{2}-{\bar {X}}_{1})}{k\,S_{ref}{\sqrt {1+\lambda \left({\frac {s_{D}}{S_{ref}}}\right)^{2}}}}}\right)}

dónde

SrmiF=s12+s222.{\displaystyle S_{ref}={\sqrt {\frac {s_{1}^{2}+s_{2}^{2}}{2}}}.}

En la calibración publicada del método, los valores de los parámetros recomendados fueron:λ=2.8759{\displaystyle \lambda =2.8759}yk=0,5069{\displaystyle k=0.5069}. [ 33 ]

Aquíincógnita¯1{\displaystyle {\bar {X}}_{1}}yincógnita¯2{\displaystyle {\bar {X}}_{2}}denotan las medias en dos momentos de evaluación,s1{\displaystyle s_{1}}ys2{\displaystyle s_{2}}denotemos las desviaciones estándar correspondientes,sD{\displaystyle s_{D}}es la desviación estándar de las puntuaciones de ganancia individuales, yJ{\displaystyle J}es un factor de corrección para muestras pequeñas. En la aproximación práctica reportada para el método,J134norte5{\displaystyle J\approx 1-{\frac {3}{4n-5}}}. [ 33 ]

En las calibraciones publicadas, los valores absolutos demiHBGRAMO{\displaystyle E_{HBG}}se han interpretado utilizando las siguientes bandas empíricas. [ 33 ] [ 34 ]

Familia categórica: Tamaños del efecto para asociaciones entre variables categóricas

Las medidas de asociación comúnmente utilizadas para la prueba chi-cuadrado son el coeficiente Phi y la V de Cramér (a veces denominada phi de Cramér y denotada como φc ). Phi está relacionado con el coeficiente de correlación biserial puntual y la d de Cohen , y estima el grado de relación entre dos variables (2 × 2). [ 35 ] La V de Cramér puede utilizarse con variables que tengan más de dos niveles.  

El coeficiente phi se puede calcular hallando la raíz cuadrada del estadístico chi-cuadrado dividido por el tamaño de la muestra.

De manera similar, el coeficiente V de Cramér se calcula tomando la raíz cuadrada del estadístico chi-cuadrado dividido por el tamaño de la muestra y la longitud de la dimensión mínima ( k es el menor entre el número de filas r o columnas c ). 

φ c es la intercorrelación de las dos variables discretas [ 36 ] y puede calcularse para cualquier valor de r o c . Sin embargo, como los valores de chi-cuadrado tienden a aumentar con el número de celdas, cuanto mayor sea la diferencia entre r y c , más probable será que V tienda a 1 sin una fuerte evidencia de una correlación significativa.

Omega de Cohen ( ω )

Otra medida del tamaño del efecto utilizada para las pruebas de chi-cuadrado es el omega de Cohen (ω{\displaystyle \omega }). Esto se define como ω=i=1metro(pag1ipag0i)2pag0i{\displaystyle \omega ={\sqrt {\sum _{i=1}^{m}{\frac {(p_{1i}-p_{0i})^{2}}{p_{0i}}}}}} donde p 0 i es la proporción de la i- ésima célula bajo H 0 , p 1 i es la proporción de la i- ésima célula bajo H 1 y m es el número de células.

Razón de probabilidades

La razón de probabilidades (OR) es otra medida útil del tamaño del efecto. Es apropiada cuando la pregunta de investigación se centra en el grado de asociación entre dos variables binarias . Por ejemplo, consideremos un estudio sobre la habilidad ortográfica. En un grupo de control, dos estudiantes aprueban la clase por cada uno que reprueba, por lo que la probabilidad de aprobar es de dos a uno (o 2/1 = 2). En el grupo de tratamiento, seis estudiantes aprueban por cada uno que reprueba, por lo que la probabilidad de aprobar es de seis a uno (o 6/1 = 6). El tamaño del efecto se puede calcular observando que la probabilidad de aprobar en el grupo de tratamiento es tres veces mayor que en el grupo de control (porque 6 dividido entre 2 es 3). Por lo tanto, la razón de probabilidades es 3. Las estadísticas de la razón de probabilidades están en una escala diferente a la d de Cohen, por lo que este '3' no es comparable a una d de Cohen de  3.

Riesgo relativo

El riesgo relativo (RR), también llamado razón de riesgo , es simplemente el riesgo (probabilidad) de un evento en relación con alguna variable independiente. Esta medida del tamaño del efecto difiere de la razón de probabilidades en que compara probabilidades en lugar de razones de probabilidades , pero se aproxima asintóticamente a esta última para probabilidades pequeñas. Usando el ejemplo anterior, las probabilidades de que los del grupo de control y del grupo de tratamiento aprueben son 2/3 (o 0,67) y 6/7 (o 0,86), respectivamente. El tamaño del efecto se puede calcular de la misma manera que antes, pero usando las probabilidades en lugar de la razón de probabilidades. Por lo tanto, el riesgo relativo es 1,28. Dado que se utilizaron probabilidades de aprobar bastante altas, existe una gran diferencia entre el riesgo relativo y la razón de probabilidades. Si se hubiera utilizado el fracaso (una probabilidad menor) como evento (en lugar de aprobar ), la diferencia entre las dos medidas del tamaño del efecto no sería tan grande.

Si bien ambas medidas son útiles, tienen diferentes usos estadísticos. En la investigación médica, la razón de probabilidades se usa comúnmente en estudios de casos y controles , ya que generalmente se estiman las probabilidades, pero no las probabilidades. [ 37 ] El riesgo relativo se usa comúnmente en ensayos controlados aleatorios y estudios de cohortes , pero contribuye a sobreestimar la efectividad de las intervenciones. [ 38 ]

Diferencia de riesgo

La diferencia de riesgo (DR), a veces llamada reducción absoluta del riesgo, es simplemente la diferencia en el riesgo (probabilidad) de un evento entre dos grupos. Es una medida útil en la investigación experimental, ya que la DR indica en qué medida una intervención experimental cambia la probabilidad de un evento o resultado. Siguiendo el ejemplo anterior, las probabilidades de éxito para quienes pertenecen al grupo de control y al grupo de tratamiento son 2/3 (o 0,67) y 6/7 (o 0,86), respectivamente, por lo que el tamaño del efecto de la DR es 0,86   0,67 = 0,19 (o 19 %). La DR es la medida superior para evaluar la efectividad de las intervenciones. [ 38 ]

Cohen's h

Una medida utilizada en el análisis de potencia al comparar dos proporciones independientes es la h de Cohen . Esta se define de la siguiente manera:  h=2(arcosenopag1arcosenopag2){\displaystyle h=2(\arcsin {\sqrt {p_{1}}}-\arcsin {\sqrt {p_{2}}})} donde p 1 y p 2 son las proporciones de las dos muestras que se comparan y arcsin es la transformación arcoseno.

Probabilidad de superioridad

Para describir más fácilmente el significado de un tamaño del efecto a personas ajenas a la estadística, el tamaño del efecto en lenguaje común, como su nombre lo indica, fue diseñado para comunicarlo en un inglés sencillo. Se utiliza para describir una diferencia entre dos grupos y fue propuesto, así como nombrado, por Kenneth McGraw y SP Wong en 1992. [ 39 ] Utilizaron el siguiente ejemplo (sobre las alturas de hombres y mujeres): "en cualquier emparejamiento aleatorio de hombres y mujeres adultos jóvenes, la probabilidad de que el hombre sea más alto que la mujer es de 0,92, o en términos aún más simples, en 92 de cada 100 citas a ciegas entre adultos jóvenes, el hombre será más alto que la mujer", [ 39 ] al describir el valor poblacional del tamaño del efecto en lenguaje común.

Tamaño del efecto para datos ordinales

delta de Cliff od{\displaystyle d}, desarrollado originalmente por Norman Cliff para su uso con datos ordinales, [ 40 ] es una medida de con qué frecuencia los valores de una distribución son mayores que los valores de una segunda distribución. Fundamentalmente, no requiere ninguna suposición sobre la forma o la dispersión de las dos distribuciones.

La estimación de la muestrad{\displaystyle d}está dado por: d=i,j[incógnitai>incógnitaj][incógnitai<incógnitaj]metronorte{\displaystyle d={\frac {\sum _{i,j}[x_{i}>x_{j}]-[x_{i}<x_{j}]}{mn}}} donde las dos distribuciones son de tamañonorte{\displaystyle n}ymetro{\displaystyle m}con artículosincógnitai{\displaystyle x_{i}}yincógnitaj{\displaystyle x_{j}}, respectivamente, y[]{\displaystyle [\cdot ]}es el corchete de Iverson , que es 1 cuando el contenido es verdadero y 0 cuando es falso.

d{\displaystyle d}está linealmente relacionado con el estadístico U de Mann-Whitney ; sin embargo, captura la dirección de la diferencia en su signo. Dado el estadístico U de Mann-WhitneyU{\displaystyle U},d{\displaystyle d}es: d=2Umetronorte1{\displaystyle d={\frac {2U}{mn}}-1}

Cohen's g

Una de las medidas de tamaño del efecto más sencillas para determinar cuánto difiere una proporción del 50% es la g de Cohen. [ 10 ] : 147 Mide cuánto difiere una proporción del 50%. Por ejemplo, si el 85,2% de los arrestos por robo de automóviles son hombres, entonces el tamaño del efecto del sexo en el arresto, medido con la g de Cohen, esgramo=0,8520,5=0,352{\displaystyle g=0.852-0.5=0.352}. En general:

gramo=PAG0,50 o 0,50PAG(direccional),{\displaystyle g=P-0.50{\text{ or }}0.50-P\quad ({\text{directional}}),}

gramo=|PAG0,50|(no direccional).{\displaystyle g=|P-0.50|\quad ({\text{nondirectional}}).}

Las unidades de la g de Cohen son más intuitivas (proporcionales) que en otros tamaños del efecto. A veces se utiliza en combinación con la prueba binomial .

Intervalos de confianza mediante parámetros de no centralidad

Intervalos de confianza de tamaños de efecto estandarizados, especialmente el de Cohen.d{\displaystyle {d}}yF2{\displaystyle f^{2}}, se basan en el cálculo de intervalos de confianza de parámetros de no centralidad ( ncp ). Un enfoque común para construir el intervalo de confianza de ncp es encontrar los valores críticos de ncp para ajustar el estadístico observado a los cuantiles de cola α /2 y (1  α /2). El paquete MBESS de SAS y R proporciona funciones para encontrar valores críticos de ncp . 

Para un solo grupo, M denota la media muestral, μ la media poblacional, SD la desviación estándar muestral, σ la desviación estándar poblacional y n el tamaño de la muestra del grupo. El valor t se utiliza para contrastar la hipótesis sobre la diferencia entre la media y una línea base μ_base . Normalmente, μ_base es cero. En el caso de dos grupos relacionados, el grupo único se construye a partir de las diferencias entre pares de muestras, mientras que SD y σ denotan las desviaciones estándar muestral y poblacional de las diferencias, en lugar de dentro de los dos grupos originales.  t:=METROμbaseSE=METROμbaseDAKOTA DEL SUR/norte=norte(METROμσ)+norte(μμbaseσ)DAKOTA DEL SURσ{\displaystyle t:={\frac {M-\mu _{\text{baseline}}}{\text{SE}}}={\frac {M-\mu _{\text{baseline}}}{{\text{SD}}/{\sqrt {n}}}}={\frac {{\sqrt {n}}\left({\frac {M-\mu }{\sigma }}\right)+{\sqrt {n}}\left({\frac {\mu -\mu _{\text{baseline}}}{\sigma }}\right)}{\frac {\text{SD}}{\sigma }}}}nortedopag=norte(μμbaseσ){\displaystyle ncp={\sqrt {n}}\left({\frac {\mu -\mu _{\text{baseline}}}{\sigma }}\right)} y Cohen d:=METROμbaseDAKOTA DEL SUR{\displaystyle d:={\frac {M-\mu _{\text{baseline}}}{\text{SD}}}}

es la estimación puntual de μμbaseσ.{\displaystyle {\frac {\mu -\mu _{\text{baseline}}}{\sigma }}.}

Entonces,

d~=nortedopagnorte.{\displaystyle {\tilde {d}}={\frac {ncp}{\sqrt {n}}}.}

Prueba t para la diferencia de medias entre dos grupos independientes

n 1 o n 2 son los tamaños de muestra respectivos. t:=METRO1METRO2DAKOTA DEL SURdentro/norte1norte2norte1+norte2,{\displaystyle t:={\frac {M_{1}-M_{2}}{{\text{SD}}_{\text{within}}/{\sqrt {\frac {n_{1}n_{2}}{n_{1}+n_{2}}}}}},}

donde DAKOTA DEL SURdentro:=SSdentrodfdentro=(norte11)DAKOTA DEL SUR12+(norte21)DAKOTA DEL SUR22norte1+norte22.{\displaystyle {\text{SD}}_{\text{within}}:={\sqrt {\frac {{\text{SS}}_{\text{within}}}{{\text{df}}_{\text{within}}}}}={\sqrt {\frac {(n_{1}-1){\text{SD}}_{1}^{2}+(n_{2}-1){\text{SD}}_{2}^{2}}{n_{1}+n_{2}-2}}}.}nortedopag=norte1norte2norte1+norte2μ1μ2σ{\displaystyle ncp={\sqrt {\frac {n_{1}n_{2}}{n_{1}+n_{2}}}}{\frac {\mu _{1}-\mu _{2}}{\sigma }}}

y Cohen d:=METRO1METRO2SDdentro{\displaystyle d:={\frac {M_{1}-M_{2}}{SD_{\text{within}}}}}es la estimación puntual deμ1μ2σ.{\displaystyle {\frac {\mu _{1}-\mu _{2}}{\sigma }}.}

Entonces, d~=nortedopagnorte1norte2norte1+norte2.{\displaystyle {\tilde {d}}={\frac {ncp}{\sqrt {\frac {n_{1}n_{2}}{n_{1}+n_{2}}}}}.}

Prueba ANOVA unidireccional para la diferencia de medias entre múltiples grupos independientes.

La prueba ANOVA unidireccional aplica una distribución F no central . Mientras que con una desviación estándar poblacional dadaσ{\displaystyle \sigma }, la misma pregunta de prueba aplica la distribución chi-cuadrado no central . F:=SSentreσ2/dfentreSSdentroσ2/dfdentro{\displaystyle F:={\frac {{\frac {{\text{SS}}_{\text{between}}}{\sigma ^{2}}}/{\text{df}}_{\text{between}}}{{\frac {{\text{SS}}_{\text{within}}}{\sigma ^{2}}}/{\text{df}}_{\text{within}}}}}

Para cada j -ésima muestra dentro del i -ésimo grupo X i , j , denotemos METROi(incógnitai,j):=w=1norteiincógnitai,wnortei;μi(incógnitai,j):=μi.{\displaystyle M_{i}(X_{i,j}):={\frac {\sum _{w=1}^{n_{i}}X_{i,w}}{n_{i}}};\;\mu _{i}(X_{i,j}):=\mu _{i}.}

Mientras, SSentre/σ2=SS(METROi(incógnitai,j);i=1,2,,K,j=1,2,,nortei)σ2=SS(METROi(incógnitai,jμi)σ+μiσ;i=1,2,,K,j=1,2,,nortei)χ2(df=K1,nortedopag=SS(μi(incógnitai,j)σ;i=1,2,,K,j=1,2,,nortei)){\displaystyle {\begin{aligned}{\text{SS}}_{\text{between}}/\sigma ^{2}&={\frac {{\text{SS}}\left(M_{i}(X_{i,j});i=1,2,\dots ,K,\;j=1,2,\dots ,n_{i}\right)}{\sigma ^{2}}}\\&={\text{SS}}\left({\frac {M_{i}(X_{i,j}-\mu _{i})}{\sigma }}+{\frac {\mu _{i}}{\sigma }};i=1,2,\dots ,K,\;j=1,2,\dots ,n_{i}\right)\\&\sim \chi ^{2}\left({\text{df}}=K-1,\;ncp=SS\left({\frac {\mu _{i}(X_{i,j})}{\sigma }};i=1,2,\dots ,K,\;j=1,2,\dots ,n_{i}\right)\right)\end{aligned}}}

Entonces, tanto ncp ( s ) de F comoχ2{\displaystyle \chi ^{2}}equiparar SS(μi(incógnitai,j)/σ;i=1,2,,K,j=1,2,,nortei).{\displaystyle {\text{SS}}\left(\mu _{i}(X_{i,j})/\sigma ;i=1,2,\dots ,K,\;j=1,2,\dots ,n_{i}\right).}

En caso denorte:=norte1=norte2==norteK{\displaystyle n:=n_{1}=n_{2}=\cdots =n_{K}}Para K grupos independientes del mismo tamaño, el tamaño total de la muestra es N  := n · K .  Cohens F~2:=SS(μ1,μ2,,μK)Kσ2=SS(μi(incógnitai,j)/σ;i=1,2,,K,j=1,2,,nortei)norteK=nortedopagnorteK=nortedopagnorte.{\displaystyle {\text{Cohens }}{\tilde {f}}^{2}:={\frac {{\text{SS}}(\mu _{1},\mu _{2},\dots ,\mu _{K})}{K\cdot \sigma ^{2}}}={\frac {{\text{SS}}\left(\mu _{i}(X_{i,j})/\sigma ;i=1,2,\dots ,K,\;j=1,2,\dots ,n_{i}\right)}{n\cdot K}}={\frac {ncp}{n\cdot K}}={\frac {ncp}{N}}.}

La prueba t para un par de grupos independientes es un caso especial de ANOVA unidireccional. Nótese que el parámetro de no centralidadnortedopagF{\displaystyle ncp_{F}}de F no es comparable al parámetro de no centralidadnortedopagt{\displaystyle ncp_{t}}del t correspondiente . En realidad,nortedopagF=nortedopagt2{\displaystyle ncp_{F}=ncp_{t}^{2}}, yF~=|d~2|{\displaystyle {\tilde {f}}=\left|{\frac {\tilde {d}}{2}}\right|}.

Véase también

Referencias

  1. 1 2 Kelley, Ken; Preacher, Kristopher J. (2012). "Sobre el tamaño del efecto". Métodos psicológicos . 17 (2): 137– 152. doi : 10.1037/a0028086 . PMID 22545595 . S2CID 34152884 .  
  2. Rosenthal, Robert, H. Cooper y L. Hedges. «Medidas paramétricas del tamaño del efecto». The handbook of research synthesis 621 (1994): 231–244. ISBN 978-0871541635
  3. Cohen, J. (2016). «Una introducción al análisis de potencia». En AE Kazdin (ed.). Cuestiones metodológicas y estrategias en la investigación clínica (4.ª ed.). Asociación Americana de Psicología. pp. 279–284 . doi : 10.1037/14805-018 . ISBN   978-1-4338-2091-5.
  4. 1 2 Wilkinson, Leland (1999). "Métodos estadísticos en revistas de psicología: directrices y explicaciones". American Psychologist . 54 (8): 594– 604. doi : 10.1037/0003-066X.54.8.594 . S2CID 428023 . 
  5. Nakagawa, Shinichi; Cuthill, Innes C (2007). "Tamaño del efecto, intervalo de confianza y significación estadística: una guía práctica para biólogos". Biological Reviews of the Cambridge Philosophical Society . 82 (4): 591– 605. doi : 10.1111/j.1469-185X.2007.00027.x . PMID 17944619 . S2CID 615371 .  
  6. 1 2 Ellis, Paul D. (2010). The Essential Guide to Effect Sizes: Statistical Power, Meta-Analysis, and the Interpretation of Research Results . Cambridge University Press. ISBN 978-0-521-14246-5.
  7. Brand A, Bradley MT, Best LA, Stoica G (2008). "Precisión de las estimaciones del tamaño del efecto a partir de investigaciones psicológicas publicadas" ( PDF) . Perceptual and Motor Skills . 106 (2): 645– 649. doi : 10.2466/PMS.106.2.645-649 . PMID 18556917. S2CID 14340449. Archivado del original (PDF) el 17 de diciembre de 2008. Recuperado el 31 de octubre de 2008 .  
  8. Brand A, Bradley MT, Best LA, Stoica G (2011). "Múltiples ensayos pueden generar estimaciones exageradas del tamaño del efecto" ( PDF) . The Journal of General Psychology . 138 (1): 1– 11. doi : 10.1080/00221309.2010.520360 . PMID 21404946. S2CID 932324. Archivado del original el 13 de julio de 2011.  
  9. Sterne, Jonathan AC; Gavaghan, David; Egger, Matthias (2000-11-01). "Sesgo de publicación y sesgo relacionado en metaanálisis: poder de las pruebas estadísticas y prevalencia en la literatura" . Journal of Clinical Epidemiology . 53 (11): 1119– 1129. doi : 10.1016/S0895-4356(00)00242-0 . ISSN 0895-4356 . PMID 11106885 .  
  10. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Cohen, Jacob (1988). Análisis de potencia estadística para las ciencias del comportamiento . Routledge. ISBN 978-1-134-74270-7.
  11. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 Sawilowsky, S (2009). "Nuevas reglas prácticas para el tamaño del efecto" . Journal of Modern Applied Statistical Methods . 8 (2): 467– 474. doi : 10.22237/jmasm/1257035100 .http://digitalcommons.wayne.edu/jmasm/vol8/iss2/26/
  12. 1 2 3 4 5 6 7 8 9 10 11 Funder, DC; Ozer, DJ (2019). "Evaluación del tamaño del efecto en la investigación psicológica: sentido y sinsentido". Avances en métodos y prácticas en la ciencia psicológica . 2 (2): 156– 168. doi : 10.1177/2515245919847202 .
  13. Russell V. Lenth. "Applets de Java para potencia y tamaño de muestra" . División de Ciencias Matemáticas, Facultad de Artes Liberales o Universidad de Iowa . Consultado el 8 de octubre de 2008 .
  14. Lipsey, MW; et al. (2012). Traducción de la representación estadística de los efectos de las intervenciones educativas a formatos más fácilmente interpretables (PDF) . Estados Unidos: Departamento de Educación de EE. UU., Centro Nacional de Investigación en Educación Especial, Instituto de Ciencias de la Educación, NCSER 2013–3000. 
  15. Sawilowsky, SS (2005). "La paradoja de Abelson y el experimento de Michelson-Morley" . Journal of Modern Applied Statistical Methods . 4 (1): 352. doi : 10.22237/jmasm/1114907520 .
  16. Sawilowsky, S.; Sawilowsky, J.; Grissom, RJ (2010). "Tamaño del efecto". En Lovric, M. (ed.). Enciclopedia internacional de la ciencia estadística . Springer.
  17. Sawilowsky, S. (2003). "Deconstruyendo argumentos del caso en contra de la prueba de hipótesis" . Journal of Modern Applied Statistical Methods . 2 (2): 467– 474. doi : 10.22237/jmasm/1067645940 .
  18. 1 2 Tabachnick, BG y Fidell, LS (2007). Capítulo 4: "Poniendo orden en tus acciones. Filtrado de datos antes del análisis", pág. 55 En BG Tabachnick y LS Fidell (Eds.), Uso de estadísticas multivariadas , Quinta edición. Boston: Pearson Education, Inc. / Allyn and Bacon.
  19. 1 2 Olejnik, S.; Algina, J. (2003). "Estadísticas generalizadas de Eta y Omega al cuadrado: medidas del tamaño del efecto para algunos diseños de investigación comunes" ( PDF) . Métodos psicológicos . 8 (4): 434– 447. doi : 10.1037/1082-989x.8.4.434 . PMID 14664681. S2CID 6931663. Archivado del original (PDF) el 10 de junio de 2010. Recuperado el 24 de octubre de 2011 .  
  20. 1 2 3 Steiger, JH (2004). "Más allá de la prueba F: intervalos de confianza del tamaño del efecto y pruebas de ajuste cercano en el análisis de varianza y el análisis de contraste" (PDF) . Métodos Psicológicos . 9 (2): 164– 182. doi : 10.1037/1082-989x.9.2.164 . PMID 15137887 . 
  21. Hair, J.; Hult, TM; Ringle, CM y Sarstedt, M. (2014) A Primer on Partial Least Squares Structural Equation Modeling (PLS-SEM) , Sage, pp. 177–178. ISBN 1452217440
  22. 1 2 3 4 5 6 7 Larry V. Hedges y Ingram Olkin (1985). Métodos estadísticos para el metaanálisis . Orlando: Academic Press . ISBN 978-0-12-336380-0.
  23. Andrade, Chittaranjan (22 de septiembre de 2020). "Diferencia de medias, diferencia de medias estandarizada (DME) y su uso en metaanálisis" . The Journal of Clinical Psychiatry. 81 (5). doi: 10.4088/JCP.20f13681. eISSN 1555-2101. PMID 32965803. S2CID 221865130. Los valores de DME de 0,2-0,5 se consideran pequeños , los valores de 0,5-0,8 se consideran medianos y los valores > 0,8 se consideran grandes. En estudios de psicofarmacología que comparan grupos independientes, las DME que son estadísticamente significativas casi siempre están en el rango pequeño a mediano. Es raro obtener DME grandes.   
  24. Robert E. McGrath; Gregory J. Meyer (2006). "Cuando los tamaños del efecto no coinciden: el caso de r y d" (PDF) . Métodos psicológicos . 11 (4): 386– 401. CiteSeerX 10.1.1.503.754 . doi : 10.1037/1082-989x.11.4.386 . PMID 17154753. Archivado del original (PDF) el 8 de octubre de 2013. Recuperado el 30 de julio de 2014 .  
  25. Hartung, Joachim; Knapp, Guido; Sinha, Bimal K. (2008). Metaanálisis estadístico con aplicaciones . John Wiley & Sons. ISBN 978-1-118-21096-3.
  26. Cohen 1988 , pág. 49.
  27. Dunlap, William P.; Cortina, Jose M.; Vaslow, Joel B.; Burke, Michael J. (1996). "Metaanálisis de experimentos con grupos emparejados o diseños de medidas repetidas" . Métodos Psicológicos . 1 (2): 170– 177. doi : 10.1037/1082-989X.1.2.170 . ISSN 1082-989X . doi : 10.1037//1082-989X.1.2.170
  28. Kenny, David A. (1987). «Capítulo 13» (PDF) . Estadística para las ciencias sociales y del comportamiento . Little, Brown. ISBN 978-0-316-48915-7.
  29. Larry V. Hedges (1981). "Teoría de la distribución para el estimador de Glass del tamaño del efecto y estimadores relacionados". Journal of Educational Statistics . 6 (2): 107– 128. doi : 10.3102/10769986006002107 . S2CID 121719955 . 
  30. Hedges, LV (2011). Tamaños del efecto en experimentos aleatorios por conglomerados de tres niveles. Journal of Educational and Behavioral Statistics, 36(3), 346-380.
  31. Zhang, XHD (2007). "Un par de nuevos parámetros estadísticos para el control de calidad en ensayos de cribado de alto rendimiento de interferencia de ARN". Genomics . 89 (4): 552– 61. doi : 10.1016/j.ygeno.2006.12.014 . PMID 17276655 . 
  32. Del Giudice, Marco (2013-07-18). "Recelos multivariados: ¿Es D una medida válida de las diferencias grupales y sexuales?" . Psicología evolutiva . 11 (5): 1067– 1076. doi : 10.1177/147470491301100511 . PMC 10434404 . PMID 24333840 .  
  33. 1 2 3 4 K S, Subin (2024). "La E de Subin, un tamaño del efecto de ganancia limitada ajustado por heterogeneidad para la investigación de evaluaciones repetidas" . Administración educativa: teoría y práctica . 30 (10): 2770– 2775.
  34. 1 2 Harikrishnan, M; Rawat, Bhopal Singh (2026). "Eficacia del aprendizaje basado en STEAM para mejorar el pensamiento creativo de los estudiantes de secundaria" (PDF) . Revista internacional de investigación multidisciplinaria avanzada y desarrollo educativo . 2 (2): 2329– 2334.
  35. Aaron, B., Kromrey, JD y Ferron, JM (1998, noviembre). Igualación de índices de tamaño del efecto basados ​​en r y d: Problemas con una fórmula comúnmente recomendada. Ponencia presentada en la reunión anual de la Asociación de Investigación Educativa de Florida, Orlando, FL. (Servicio de Reproducción de Documentos ERIC n.° ED433353)
  36. Sheskin, David J. (2003). Manual de procedimientos estadísticos paramétricos y no paramétricos (Tercera ed.). CRC Press. ISBN  978-1-4200-3626-8.
  37. Deeks J (1998). "¿Cuándo pueden inducir a error las razones de probabilidades?: Las razones de probabilidades solo deben utilizarse en estudios de casos y controles y análisis de regresión logística" . BMJ . 317 ( 7166): 1155–6 . doi : 10.1136/bmj.317.7166.1155a . PMC 1114127. PMID 9784470 .   
  38. 1 2 Stegenga, J. (2015). "Medición de la efectividad" . Estudios en historia y filosofía de las ciencias biológicas y biomédicas . 54 : 62–71 . doi : 10.1016/j.shpsc.2015.06.003 . PMID 26199055 . 
  39. 1 2 McGraw KO, Wong SP (1992). "Una estadística de tamaño del efecto en lenguaje común". Psychological Bulletin . 111 (2): 361– 365. doi : 10.1037/0033-2909.111.2.361 .
  40. Cliff, Norman (1993). "Estadísticas de dominancia: análisis ordinales para responder preguntas ordinales". Psychological Bulletin . 114 (3): 494– 509. doi : 10.1037/0033-2909.114.3.494 .

Lecturas adicionales

  • Aaron, B., Kromrey, JD y Ferron, JM (1998, noviembre). Igualación de índices de tamaño del efecto basados ​​en r y d: Problemas con una fórmula comúnmente recomendada. Ponencia presentada en la reunión anual de la Asociación de Investigación Educativa de Florida, Orlando, FL. (Servicio de Reproducción de Documentos ERIC n.° ED433353)
  • Bonett, DG (2008). "Intervalos de confianza para contrastes lineales estandarizados de medias". Métodos Psicológicos . 13 (2): 99– 109. doi : 10.1037/1082-989x.13.2.99 . PMID 18557680 . 
  • Bonett, DG (2009). "Estimación de contrastes lineales estandarizados de medias con la precisión deseada". Métodos Psicológicos . 14 (1): 1– 5. doi : 10.1037/a0014270 . PMID 19271844 . 
  • Brooks, ME; Dalal, DK; Nolan, KP (2013). "¿Son más fáciles de entender los tamaños del efecto en lenguaje común que los tamaños del efecto tradicionales?". Journal of Applied Psychology . 99 (2): 332– 340. doi : 10.1037/a0034745 . PMID 24188393 . 
  • Cumming, G.; Finch, S. (2001). "Una introducción a la comprensión, el uso y el cálculo de intervalos de confianza basados ​​en distribuciones centrales y no centrales". Educational and Psychological Measurement . 61 (4): 530– 572. doi : 10.1177/0013164401614002 . S2CID 120672914 . 
  • Kelley, K (2007). "Intervalos de confianza para tamaños de efecto estandarizados: teoría, aplicación e implementación" . Journal of Statistical Software . 20 (8): 1– 24. doi : 10.18637/jss.v020.i08 .
  • Lipsey, MW, & Wilson, DB (2001). Metaanálisis práctico . Sage: Thousand Oaks, CA.

Explicaciones adicionales

  • Tamaño del efecto (TE)
  • Preguntas frecuentes sobre el tamaño del efecto.com
  • EstimationStats.com es una aplicación web para generar gráficos de tamaño del efecto.
  • Medición del tamaño del efecto
  • Cálculo e interpretación de medidas del tamaño del efecto con ViSta. Archivado el 27/12/2014 en Wayback Machine.
  • Paquete effsize para el proyecto R de computación estadística.