Articulo de referencia

valor p

En las pruebas de significación de hipótesis nula , el valor p {{cite web | title = ASA House Style | url = http://magazine.amstat.org/wp-content/uploads/STATTKadmin/style%5B1%5...

En las pruebas de significación de hipótesis nula , el valor p [ nota 1 ] es la probabilidad de obtener resultados de prueba al menos tan extremos como el resultado observado , bajo el supuesto de que la hipótesis nula es correcta. [ 2 ] [ 3 ] Un valor p muy pequeño significa que un resultado observado tan extremo sería muy improbable bajo la hipótesis nula . Aunque informar los valores p de las pruebas estadísticas es una práctica común en las publicaciones académicas de muchos campos cuantitativos, la mala interpretación y el mal uso de los valores p están muy extendidos y han sido un tema importante en matemáticas y metaciencia . [ 4 ] [ 5 ]

En 2016, la Asociación Estadounidense de Estadística (ASA) emitió una declaración formal en la que afirmaba que « los valores p no miden la probabilidad de que la hipótesis estudiada sea verdadera, ni la probabilidad de que los datos se hayan producido únicamente por azar», y que «un valor p , o significancia estadística, no mide la magnitud de un efecto ni la importancia de un resultado», y que «no proporciona una buena medida de evidencia con respecto a un modelo o hipótesis» sin «contexto u otra evidencia». [ 6 ] Dicho esto, un grupo de trabajo de la ASA de 2019 emitió una declaración sobre significancia estadística y replicabilidad, concluyendo con: « Los valores p y las pruebas de significancia, cuando se aplican e interpretan correctamente, aumentan el rigor de las conclusiones extraídas de los datos». [ 7 ]

Conceptos básicos

En estadística, toda conjetura relativa a la distribución de probabilidad desconocida de una colección de variables aleatorias que representan los datos observadosincógnita{\displaystyle X}En algunos estudios, una hipótesis se denomina hipótesis estadística . Si planteamos una sola hipótesis y el objetivo de la prueba estadística es determinar si esta hipótesis es viable, sin investigar otras hipótesis específicas, entonces dicha prueba se denomina prueba de hipótesis nula .

Como nuestra hipótesis estadística, por definición, enunciará alguna propiedad de la distribución, la hipótesis nula es la hipótesis predeterminada bajo la cual esa propiedad no existe. La hipótesis nula suele ser que algún parámetro (como una correlación o una diferencia entre medias) en las poblaciones de interés es cero. Nuestra hipótesis podría especificar la distribución de probabilidad deincógnita{\displaystyle X}precisamente, o podría simplemente especificar que pertenece a alguna clase de distribuciones. A menudo, reducimos los datos a una sola estadística numérica, por ejemplo,T{\displaystyle T}, cuya distribución de probabilidad marginal está estrechamente relacionada con una cuestión principal de interés en el estudio.

El valor p se utiliza en el contexto de la prueba de hipótesis nula para cuantificar la significación estadística de un resultado, siendo este el valor observado del estadístico elegido.T{\displaystyle T}[ Nota 2 ] Cuanto menor sea el valor p , menor será la probabilidad de obtener ese resultado si la hipótesis nula fuera verdadera. Se dice que un resultado es estadísticamente significativo si nos permite rechazar la hipótesis nula. En igualdad de condiciones, los valores p más pequeños se consideran evidencia más sólida en contra de la hipótesis nula.

En términos generales, el rechazo de la hipótesis nula implica que existen pruebas suficientes en su contra.

Como ejemplo particular, si una hipótesis nula establece que una determinada estadística descriptivaT{\displaystyle T}sigue la distribución normal estándarnorte(0,1),{\displaystyle {\mathcal {N}}(0,1),}entonces el rechazo de esta hipótesis nula podría significar que (i) la media deT{\displaystyle T}no es 0, o (ii) la varianza deT{\displaystyle T}no es 1, o (iii)T{\displaystyle T}no tiene una distribución normal. Diferentes pruebas de la misma hipótesis nula serían más o menos sensibles a diferentes alternativas. Sin embargo, incluso si logramos rechazar la hipótesis nula para las tres alternativas, e incluso si sabemos que la distribución es normal y la varianza es 1, la prueba de hipótesis nula no nos indica qué valores distintos de cero de la media son ahora los más plausibles. Cuantas más observaciones independientes de la misma distribución de probabilidad tengamos, más precisa será la prueba y mayor será la exactitud con la que podremos determinar el valor de la media y demostrar que no es igual a cero; pero esto también aumentará la importancia de evaluar la relevancia científica o en el mundo real de esta desviación.

Definición e interpretación

Definición

El valor p es la probabilidad, bajo la hipótesis nula, de obtener un estadístico de prueba de valor real al menos tan extremo como el obtenido. Consideremos un estadístico de prueba observado.t{\displaystyle t}de distribución desconocidaT{\displaystyle T}. Entonces el valor ppag{\displaystyle p}es cuál sería la probabilidad previa de observar un valor estadístico de prueba al menos tan "extremo" comot{\displaystyle t}si la hipótesis nulaH0{\displaystyle H_{0}}eran ciertas. Es decir:

  • pag=Pr(TtH0){\displaystyle p=\Pr(T\geq t\mid H_{0})}para una distribución de estadístico de prueba unilateral con cola derecha.
  • pag=Pr(TtH0){\displaystyle p=\Pr(T\leq t\mid H_{0})}para una distribución de estadístico de prueba unilateral con cola izquierda.
  • pag=2min{Pr(TtH0),Pr(TtH0)}{\displaystyle p=2\min\{\Pr(T\geq t\mid H_{0}),\Pr(T\leq t\mid H_{0})\}}para una distribución de estadístico de prueba bilateral. Si la distribución deT{\displaystyle T}es simétrico con respecto a cero, entoncespag=Pr(|T||t|H0).{\displaystyle p=\Pr(|T|\geq |t|\mid H_{0}).}

Interpretaciones

El error que un estadístico consideraría más importante evitar (lo cual es un juicio subjetivo) se denomina error de primera especie. La primera exigencia de la teoría matemática es deducir criterios de prueba que garanticen que la probabilidad de cometer un error de primera especie sea igual (o aproximadamente igual, o no exceda) un valor α preestablecido, como α = 0,05 o 0,01, etc. Este valor se denomina nivel de significancia.

Jerzy Neyman, "El surgimiento de la estadística matemática" [ 8 ]

En una prueba de significancia, la hipótesis nulaH0{\displaystyle H_{0}}Se rechaza si el valor p es menor que un valor umbral predefinido.α{\displaystyle \alpha }, que se conoce como nivel alfa o nivel de significancia .α{\displaystyle \alpha }No se deriva de los datos, sino que es establecida por el investigador antes de examinar los datos.α{\displaystyle \alpha }Generalmente se establece en 0,05, aunque a veces se utilizan niveles alfa más bajos. El valor de 0,05 (equivalente a 1/20 de probabilidad) fue propuesto originalmente por Ronald Fisher en 1925 en su famoso libro titulado " Métodos estadísticos para investigadores ". [ 9 ]

Se pueden combinar diferentes valores p basados ​​en conjuntos de datos independientes, por ejemplo, utilizando la prueba de probabilidad combinada de Fisher .

Distribución

El valor p es una función del estadístico de prueba elegido.T{\displaystyle T}y por lo tanto es una variable aleatoria . Si la hipótesis nula fija la distribución de probabilidad deT{\displaystyle T}precisamente (por ejemplo,H0:θ=θ0,{\displaystyle H_{0}:\theta =\theta _{0},}dóndeθ{\displaystyle \theta }es el único parámetro), y si esa distribución es continua, entonces cuando la hipótesis nula es verdadera, el valor p se distribuye uniformemente entre 0 y 1. Independientemente de la veracidad de laH0{\displaystyle H_{0}}El valor p no es fijo; si se repite la misma prueba de forma independiente con datos nuevos, normalmente se obtendrá un valor p diferente en cada iteración.

Por lo general, solo se observa un único valor p relacionado con una hipótesis, por lo que este se interpreta mediante una prueba de significancia y no se intenta estimar la distribución de la que se extrajo. Cuando se dispone de un conjunto de valores p (por ejemplo, al considerar un grupo de estudios sobre el mismo tema), la distribución de valores p significativos se denomina a veces curva p . [ 10 ] Una curva p puede utilizarse para evaluar la fiabilidad de la literatura científica, por ejemplo, para detectar el sesgo de publicación o el p -hacking . [ 10 ] [ 11 ]

Distribución para la hipótesis compuesta

En los problemas de prueba de hipótesis paramétricas, una hipótesis simple o puntual se refiere a una hipótesis donde se supone que el valor del parámetro es un solo número. En cambio, en una hipótesis compuesta , el valor del parámetro viene dado por un conjunto de números. Cuando la hipótesis nula es compuesta (o la distribución del estadístico es discreta), entonces, cuando la hipótesis nula es verdadera, la probabilidad de obtener un valor p menor o igual a cualquier número entre 0 y 1 sigue siendo menor o igual a ese número. En otras palabras, sigue siendo cierto que los valores muy pequeños son relativamente improbables si la hipótesis nula es verdadera, y que una prueba de significancia al nivelα{\displaystyle \alpha }se obtiene rechazando la hipótesis nula si el valor p es menor o igual queα{\displaystyle \alpha }. [ 12 ] [ 13 ]

Por ejemplo, al probar la hipótesis nula de que una distribución es normal con una media menor o igual a cero frente a la alternativa de que la media es mayor que cero (H0:μ0{\displaystyle H_{0}:\mu \leq 0}(varianza conocida), la hipótesis nula no especifica la distribución de probabilidad exacta del estadístico de prueba apropiado. En este ejemplo, sería el estadístico Z perteneciente a la prueba Z unilateral de una muestra . Para cada posible valor de la media teórica, el estadístico de prueba Z tiene una distribución de probabilidad diferente. En estas circunstancias, el valor p se define tomando el caso de hipótesis nula menos favorable, que generalmente se encuentra en el límite entre la hipótesis nula y la alternativa. Esta definición garantiza la complementariedad de los valores p y los niveles alfa.α=0,05{\displaystyle \alpha =0.05}significa que uno solo rechaza la hipótesis nula si el valor p es menor o igual que0,05{\displaystyle 0.05}y la prueba de hipótesis tendrá, de hecho, una tasa máxima de error de tipo 1 de0,05{\displaystyle 0.05}.

Uso

El valor p se utiliza ampliamente en las pruebas de hipótesis estadísticas , específicamente en las pruebas de significancia de la hipótesis nula. En este método, antes de realizar el estudio, se elige un modelo (la hipótesis nula ) y el nivel alfa α (generalmente 0,05). Tras analizar los datos, si el valor p es menor que α , se considera que los datos observados son suficientemente inconsistentes con la hipótesis nula como para rechazarla. Sin embargo, esto no prueba que la hipótesis nula sea falsa. El valor p , por sí mismo, no establece probabilidades de hipótesis. Más bien, es una herramienta para decidir si se rechaza la hipótesis nula. [ 14 ]

Mal uso

Según la ASA, existe un amplio consenso en que los valores p se utilizan y se interpretan erróneamente con frecuencia. [ 3 ] Una práctica que ha sido particularmente criticada es aceptar la hipótesis alternativa para cualquier valor p nominalmente menor que 0,05 sin otra evidencia que la respalde. Si bien los valores p son útiles para evaluar cuán incompatibles son los datos con un modelo estadístico específico, también deben considerarse factores contextuales, como "el diseño de un estudio, la calidad de las mediciones, la evidencia externa del fenómeno en estudio y la validez de los supuestos que subyacen al análisis de datos". [ 3 ] Otra preocupación es que el valor p a menudo se malinterpreta como la probabilidad de que la hipótesis nula sea verdadera. [ 3 ] [ 15 ] Los valores p y las pruebas de significancia tampoco dicen nada sobre la posibilidad de extraer conclusiones de una muestra a una población.

Algunos estadísticos han propuesto abandonar los valores p y centrarse más en otras estadísticas inferenciales, [ 3 ] como intervalos de confianza , [ 16 ] [ 17 ] razones de verosimilitud , [ 18 ] [ 19 ] o factores de Bayes , [ 20 ] [ 21 ] [ 22 ] pero hay un debate acalorado sobre la viabilidad de estas alternativas. [ 23 ] [ 24 ] Al mismo tiempo, el uso de los valores p también se ha defendido como una herramienta estadística útil que no debería abandonarse. [ 25 ] [ 26 ] [ 27 ] [ 28 ] Otros han sugerido eliminar los umbrales de significancia fijos e interpretar los valores p como índices continuos de la fuerza de la evidencia contra la hipótesis nula, [ 29 ] [ 30 ] aunque estas propuestas en sí mismas han sido criticadas. [ 31 ] Otros sugirieron informar junto con los valores p la probabilidad previa de un efecto real que se requeriría para obtener un riesgo de falso positivo (es decir, la probabilidad de que no haya un efecto real) por debajo de un umbral preespecificado (por ejemplo, 5%). [ 32 ]

Dicho esto, en 2019 un grupo de trabajo de la ASA se reunió para considerar el uso de métodos estadísticos en estudios científicos, específicamente pruebas de hipótesis y valores p , y su conexión con la replicabilidad. [ 7 ] Afirma que "Diferentes medidas de incertidumbre pueden complementarse entre sí; ninguna medida por sí sola sirve para todos los propósitos", citando el valor p como una de estas medidas. También destacan que los valores p pueden proporcionar información valiosa al considerar el valor específico, así como al compararlo con algún umbral. En general, subraya que " los valores p y las pruebas de significancia, cuando se aplican e interpretan correctamente, aumentan el rigor de las conclusiones extraídas de los datos". Esta idea fue respaldada además por un comentario en Nature Human Behaviour , que, en respuesta a las recomendaciones de redefinir la significancia estadística a P ≤ 0,005, propuso que "los investigadores deberían informar y justificar de forma transparente todas las decisiones que tomen al diseñar un estudio, incluido el nivel alfa". [ 33 ]

Cálculo

Generalmente,T{\displaystyle T}Un estadístico de prueba es el resultado de una función escalar de todas las observaciones. Este estadístico proporciona un único valor numérico, como un estadístico t o un estadístico F. Por lo tanto, el estadístico de prueba sigue una distribución determinada por la función utilizada para definirlo y la distribución de los datos de observación de entrada.

Para el caso importante en el que se hipotetiza que los datos son una muestra aleatoria de una distribución normal, dependiendo de la naturaleza del estadístico de prueba y las hipótesis de interés sobre su distribución, se han desarrollado diferentes pruebas de hipótesis nula. Algunas de estas pruebas son la prueba z para hipótesis relativas a la media de una distribución normal con varianza conocida, la prueba t basada en la distribución t de Student de un estadístico adecuado para hipótesis relativas a la media de una distribución normal cuando la varianza es desconocida, la prueba F basada en la distribución F de otro estadístico para hipótesis relativas a la varianza. Para datos de otra naturaleza, por ejemplo, datos categóricos (discretos), se pueden construir estadísticos de prueba cuya distribución de hipótesis nula se basa en aproximaciones normales a estadísticos apropiados obtenidos al invocar el teorema del límite central para muestras grandes, como en el caso de la prueba chi-cuadrado de Pearson .

Thus computing a p-value requires a null hypothesis, a test statistic (together with deciding whether the researcher is performing a one-tailed test or a two-tailed test), and data. Even though computing the test statistic on given data may be easy, computing the sampling distribution under the null hypothesis, and then computing its cumulative distribution function (CDF) is often a difficult problem. Today, this computation is done using statistical software, often via numeric methods (rather than exact formulae), but, in the early and mid 20th century, this was instead done via tables of values, and one interpolated or extrapolated p-values from these discrete values. Rather than using a table of p-values, Fisher instead inverted the CDF, publishing a list of values of the test statistic for given fixed p-values; this corresponds to computing the quantile function (inverse CDF).

Example

Testing the fairness of a coin

As an example of a statistical test, an experiment is performed to determine whether a coin flip is fair (equal chance of landing heads or tails) or unfairly biased (one outcome being more likely than the other).

Suppose that the experimental results show the coin turning up heads 14 times out of 20 total flips. The full data X{\displaystyle X} would be a sequence of twenty times the symbol "H" or "T". The statistic on which one might focus could be the total number T{\displaystyle T} of heads. The null hypothesis is that the coin is fair, and coin tosses are independent of one another. If a right-tailed test is considered, which would be the case if one is actually interested in the possibility that the coin is biased towards falling heads, then the p-value of this result is the chance of a fair coin landing on heads at least 14 times out of 20 flips. That probability can be computed from binomial coefficients as

Pr(14 heads)+Pr(15 heads)++Pr(20 heads)=1220[(2014)+(2015)++(2020)]=6046010485760.058.{\displaystyle {\begin{aligned}&\Pr(14{\text{ caras}})+\Pr(15{\text{ caras}})+\cdots +\Pr(20{\text{ caras}})\\&={\frac {1}{2^{20}}}\left[{\binom {20}{14}}+{\binom {20}{15}}+\cdots +{\binom {20}{20}}\right]={\frac {60\,460}{1\,048\,576}}\approx 0.058.\end{aligned}}}

This probability is the p-value, considering only extreme results that favor heads. This is called a one-tailed test. However, one might be interested in deviations in either direction, favoring either heads or tails. The two-tailed p-value, which considers deviations favoring either heads or tails, may instead be calculated. As the binomial distribution is symmetrical for a fair coin, the two-sided p-value is simply twice the above calculated single-sided p-value: the two-sided p-value is 0.115.

In the above example:

  • Hipótesis nula ( H0 ) : La moneda es justa, con Pr(cara) = 0,5.
  • Estadístico de prueba: Número de caras.
  • Nivel alfa (umbral de significancia designado): 0,05.
  • Observación O : 14 caras de 20 lanzamientos.
  • Valor p bilateral de la observación O dado H 0 = 2 × min(Pr(número de caras ≥  14  caras), Pr(número de caras ≤  14  caras)) = 2 × min(0,058, 0,978) = 2 × 0,058 = 0,115.

La probabilidad de obtener ≤  14  caras es igual a 1 - Pr(obtener ≥  14  caras) + Pr(obtener ≥ 14 caras) = ​​1 - 0,058 + 0,036 = 0,978. Sin embargo, la simetría de esta distribución binomial hace innecesario calcular la menor de las dos probabilidades. En este caso, el valor p calculado supera 0,05, lo que significa que los datos se encuentran dentro del rango de lo que ocurriría el 95% de las veces si la moneda fuera justa. Por lo tanto, la hipótesis nula no se rechaza al nivel de significancia de 0,05.

Sin embargo, si se hubiera obtenido una cabeza más, el valor p resultante (bilateral) habría sido 0,0414  (4,14%), en cuyo caso la hipótesis nula se rechazaría al nivel de 0,05.

Parada opcional

La diferencia entre los dos significados de "extremo" aparece cuando consideramos una prueba de hipótesis secuencial, o parada opcional, para la imparcialidad de la moneda. En general, la parada opcional cambia la forma en que se calcula el valor p. [ 34 ] [ 35 ] Supongamos que diseñamos el experimento de la siguiente manera:

  • Lanza la moneda dos veces. Si en ambas ocasiones sale cara o cruz, finaliza el experimento.
  • De lo contrario, lanza la moneda 4 veces más.

Este experimento tiene 7 tipos de resultados: 2  caras, 2  cruces, 5  caras 1  cruz,  ..., 1  cara 5  cruces. Ahora calculamos el valor p del resultado "3  caras 3  cruces".

Si utilizamos el estadístico de prueba #cabezas/cruz{\displaystyle {\text{cara}}/{\text{cruz}}}, entonces bajo la hipótesis nula (es decir #cabezas3{\displaystyle {\text{cabezas}}\leq 3}) el valor p bilateral es exactamente igual a 1, y tanto el valor p unilateral de la cola izquierda como el valor p unilateral de la cola derecha son exactamente iguales a19/32{\displaystyle 19/32}.

Si consideramos que cada resultado que tiene una probabilidad igual o menor que "3  caras 3  cruces" es "al menos tan extremo", entonces el valor p es exactamente1/2.{\displaystyle 1/2.}

Sin embargo, supongamos que hemos planeado simplemente lanzar la moneda 6  veces sin importar lo que suceda, entonces la segunda definición de valor p significaría que el valor p de "3  caras 3  cruces" es exactamente 1.

Por lo tanto, la definición de valor p de "al menos tan extremo" es profundamente contextual y depende de lo que el experimentador planeaba hacer incluso en situaciones que no se dieron.

Historia

Retrato pintado a la altura del pecho de un hombre con túnica marrón y tocado.
Juan Arbuthnot
Pierre-Simon Laplace
Hombre sentado en su escritorio mirando a la cámara.
Karl Pearson
Fotografía en tono sepia de un joven con traje, una medalla y gafas de montura metálica.
Ronald Fisher

Los cálculos del valor p se remontan al siglo XVIII, cuando se calculaban para la proporción de sexos humanos al nacer y se utilizaban para calcular la significación estadística en comparación con la hipótesis nula de igual probabilidad de nacimientos de varones y mujeres. [ 36 ] John Arbuthnot estudió esta cuestión en 1710, [ 37 ] [ 38 ] [ 39 ] [ 40 ] y examinó los registros de nacimientos en Londres para cada uno de los 82 años desde 1629 hasta 1710. En cada año, el número de varones nacidos en Londres superó al número de mujeres. Considerando que más nacimientos de varones o más nacimientos de mujeres son igualmente probables, la probabilidad del resultado observado es 1/2 82 , o aproximadamente 1 en 4.836.000.000.000.000.000.000.000; en términos modernos, el valor p . Esto es insignificante, lo que lleva a Arbuthnot a concluir que esto no se debía al azar, sino a la providencia divina: "De donde se sigue que es el Arte, no el Azar, lo que gobierna". En términos modernos, rechazó la hipótesis nula de nacimientos masculinos y femeninos igualmente probables al nivel de significancia p  =  1/2 82. Este y otros trabajos de Arbuthnot se consideran "... el primer uso de pruebas de significancia ..." [ 41 ] el primer ejemplo de razonamiento sobre la significancia estadística, [ 42 ] y "... quizás el primer informe publicado de una prueba no paramétrica ...", [ 38 ] específicamente la prueba de signos ; ver detalles en Prueba de signos §  Historia .

La misma cuestión fue abordada posteriormente por Pierre-Simon Laplace , quien en su lugar utilizó una prueba paramétrica , modelando el número de nacimientos masculinos con una distribución binomial : [ 43 ]

En la década de 1770, Laplace analizó las estadísticas de casi medio millón de nacimientos. Dichas estadísticas mostraron un exceso de niños en comparación con las niñas. Tras calcular un valor p , concluyó que este exceso era un efecto real, aunque inexplicable.

El valor p fue introducido formalmente por primera vez por Karl Pearson , en su prueba de chi-cuadrado de Pearson , [ 44 ] utilizando la distribución chi-cuadrado y denotada como P mayúscula. [ 44 ] Los valores p para la distribución chi-cuadrado (para varios valores de χ² y grados de libertad), ahora denotados como P, fueron calculados en ( Elderton 1902 ) , recopilados en ( Pearson 1914 , pp. xxxi–xxxiii, 26–28, Tabla XII) . 

Ronald Fisher formalizó y popularizó el uso del valor p en estadística, [ 45 ] [ 46 ] desempeñando un papel central en su enfoque del tema. [ 47 ] En su influyente libro Métodos estadísticos para investigadores (1925), Fisher propuso el nivel p = 0,05, o una probabilidad de 1 entre 20 de ser superado por azar, como límite para la significación estadística , y lo aplicó a una distribución normal (como una prueba bilateral), obteniendo así la regla de dos desviaciones estándar (en una distribución normal) para la significación estadística (véase la regla 68-95-99.7 ). [ 48 ] [ nota 3 ] [ 49 ]

Luego calculó una tabla de valores, similar a la de Elderton pero, importantemente, invirtió los roles de χ² y p . Es decir, en lugar de calcular p para diferentes valores de χ² ( y grados de libertad n ), calculó valores de χ² que producen valores p específicos , concretamente 0,99, 0,98, 0,95, 0,90, 0,80, 0,70, 0,50, 0,30, 0,20, 0,10, 0,05, 0,02 y 0,01. [ 50 ] Esto permitió comparar los valores calculados de χ² con los umbrales y fomentó el uso de valores p (especialmente 0,05, 0,02 y 0,01) como umbrales, en lugar de calcular e informar los valores p en sí mismos. El mismo tipo de tablas se compilaron luego en ( Fisher & Yates 1938 ) , lo que consolidó el enfoque. [ 49 ]

Como ilustración de la aplicación de los valores p al diseño e interpretación de experimentos, en su siguiente libro El diseño de experimentos (1935), Fisher presentó el experimento de la dama que prueba el té , [ 51 ] que es el ejemplo arquetípico del valor p .

Para evaluar la afirmación de una señora ( Muriel Bristol ) de que podía distinguir por el gusto cómo se prepara el té (primero añadiendo la leche a la taza, luego el té, o primero el té, luego la leche), se le presentaron secuencialmente 8 tazas: 4 preparadas de una manera, 4 preparadas de la otra, y se le pidió que determinara la preparación de cada taza (sabiendo que había 4 de cada una). En ese caso, la hipótesis nula era que no tenía ninguna habilidad especial, la prueba era la prueba exacta de Fisher y el valor p era1/(84)=1/700,014,{\displaystyle 1/{\binom {8}{4}}=1/70\approx 0.014,}Así pues, Fisher estaba dispuesto a rechazar la hipótesis nula (considerar que el resultado era muy improbable que se debiera al azar) si todos los vasos se clasificaban correctamente. (En el experimento real, Bristol clasificó correctamente los 8 vasos).

Fisher reiteró el umbral p = 0,05 y explicó su fundamento, afirmando: [ 52 ]

Es habitual y conveniente que los experimentadores tomen el 5 por ciento como nivel de significancia estándar, en el sentido de que están dispuestos a ignorar todos los resultados que no alcancen este estándar y, de este modo, eliminar de la discusión posterior la mayor parte de las fluctuaciones que las causas aleatorias han introducido en sus resultados experimentales.

También aplica este umbral al diseño de experimentos, señalando que si solo se hubieran presentado 6 tazas (3 de cada una), una clasificación perfecta solo habría arrojado un valor p de1/(63)=1/20=0,05,{\displaystyle 1/{\binom {6}{3}}=1/20=0,05,}que no habrían alcanzado este nivel de significancia. [ 52 ] Fisher también subrayó la interpretación de p, como la proporción a largo plazo de valores al menos tan extremos como los datos, suponiendo que la hipótesis nula es verdadera.

En ediciones posteriores, Fisher contrastó explícitamente el uso del valor p para la inferencia estadística en la ciencia con el método de Neyman-Pearson, al que denomina "Procedimientos de Aceptación". [ 53 ] Fisher enfatiza que, si bien los niveles fijos como el 5%, el 2% y el 1% son convenientes, se puede utilizar el valor p exacto , y la fuerza de la evidencia puede y será revisada con experimentación adicional. Por el contrario, los procedimientos de decisión requieren una decisión clara, que produce una acción irreversible, y el procedimiento se basa en costos de error, que, según argumenta, son inaplicables a la investigación científica.

El valor E puede referirse a dos conceptos, ambos relacionados con el valor p y que desempeñan un papel en las pruebas múltiples . Primero, corresponde a una alternativa genérica y más robusta al valor p que puede manejar la continuación opcional de experimentos. Segundo, también se usa para abreviar "valor esperado", que es el número esperado de veces que se espera obtener un estadístico de prueba al menos tan extremo como el que se observó si se asume que la hipótesis nula es verdadera. [ 54 ] Este valor esperado es el producto del número de pruebas y el valor p .

El valor q es el análogo del valor p con respecto a la tasa de falsos descubrimientos positivos . [ 55 ] Se utiliza en pruebas de hipótesis múltiples para mantener la potencia estadística al tiempo que se minimiza la tasa de falsos positivos . [ 56 ]

La probabilidad de dirección ( pd ) es el equivalente numérico bayesiano del valor p . [ 57 ] Corresponde a la proporción de la distribución posterior que tiene el signo de la mediana, que suele variar entre el 50 % y el 100 %, y representa la certeza con la que un efecto es positivo o negativo.

Los valores p de segunda generación extienden el concepto de valores p al no considerar como significativos los tamaños del efecto extremadamente pequeños y prácticamente irrelevantes . [ 58 ]

El valor S, también conocido como valor de sorpresa, se ha definido como una transformación logarítmica del valor p: valor S = - log 2 (valor p). La transformación a valores S tiene como objetivo facilitar la interpretación de los valores p mediante el uso de una escala logarítmica más intuitiva que indica el grado de sorpresa ante un resultado. [ 59 ] [ 60 ] [ 61 ]

Véase también

Notas

  1. La cursiva, el uso de mayúsculas y la división de palabras del término varían. Por ejemplo, el estilo AMA utiliza " P value", el estilo APA utiliza " p value" y la Asociación Estadounidense de Estadística utiliza " p -value". En todos los casos, la "p" significa probabilidad . [ 1 ]
  2. La significación estadística de un resultado no implica que dicho resultado tenga relevancia en el mundo real. Por ejemplo, un medicamento podría tener un efecto estadísticamente significativo, pero demasiado pequeño para resultar interesante.
  3. Para ser más específicos, p = 0,05 corresponde a aproximadamente 1,96 desviaciones estándar para una distribución normal (prueba de dos colas), y 2 desviaciones estándar corresponden a aproximadamente una probabilidad de 1 en 22 de ser superado por azar, o p ≈ 0,045; Fisher señala estas aproximaciones.

Referencias

  1. "Estilo de la ASA" (PDF) . Noticias de Amstat . Asociación Estadounidense de Estadística.
  2. Aschwanden C (24 de noviembre de 2015). "Ni siquiera los científicos pueden explicar fácilmente los valores p" . FiveThirtyEight . Archivado del original el 25 de septiembre de 2019. Consultado el 11 de octubre de 2019 .
  3. 1 2 3 4 5 Wasserstein RL, Lazar NA (7 de marzo de 2016). "Declaración de la ASA sobre los valores p: contexto, proceso y propósito" . The American Statistician . 70 (2): 129– 133. doi : 10.1080/00031305.2016.1154108 .
  4. Hubbard R, Lindsay RM (2008). "Por qué los valores p no son una medida útil de evidencia en las pruebas de significación estadística". Theory & Psychology . 18 (1): 69– 88. doi : 10.1177/0959354307086923 . S2CID 143487211 . 
  5. Munafò MR , Nosek BA, Bishop DV, Button KS, Chambers CD, du Sert NP, et al. (enero de 2017). " Un manifiesto para la ciencia reproducible" . Nature Human Behaviour . 1 (1) 0021. doi : 10.1038/s41562-016-0021 . PMC 7610724. PMID 33954258. S2CID 6326747 .    
  6. Wasserstein, Ronald L.; Lazar, Nicole A. (2016-04-02). "Declaración de la ASA sobre los valores p: contexto, proceso y propósito" . The American Statistician . 70 (2): 129– 133. doi : 10.1080/00031305.2016.1154108 . ISSN 0003-1305 . S2CID 124084622 .  
  7. 1 2 Benjamini, Yoav; De Veaux, Richard D.; Efron, Bradley; Evans, Scott; Glickman, Mark; Graubard, Barry I.; He, Xuming; Meng, Xiao-Li; Reid, Nancy M.; Stigler, Stephen M.; Vardeman, Stephen B.; Wikle, Christopher K.; Wright, Tommy; Young, Linda J.; Kafadar, Karen (2021-10-02). "Declaración del Grupo de Trabajo del Presidente de la ASA sobre la Significancia Estadística y la Replicabilidad" . Chance . 34 (4). Informa UK Limited: 10– 11. doi : 10.1080/09332480.2021.2003631 . ISSN 0933-2480 . 
  8. Neyman, Jerzy (1976). «El surgimiento de la estadística matemática: un esbozo histórico con especial referencia a los Estados Unidos». En Owen, DB (ed.). Sobre la historia de la estadística y la probabilidad . Libros de texto y monografías. Nueva York: Marcel Dekker Inc. pág. 161. 
  9. Fisher, RA (1992), "Métodos estadísticos para investigadores", en Kotz, Samuel; Johnson, Norman L. (eds.), Avances en estadística: metodología y distribución , Springer Series in Statistics, Nueva York, NY: Springer, pp. 66–70 , doi : 10.1007/978-1-4612-4380-9_6 , ISBN  978-1-4612-4380-9
  10. 1 2 Head ML, Holman L, Lanfear R, Kahn AT, Jennions MD (marzo de 2015). "El alcance y las consecuencias del p-hacking en la ciencia" . PLOS Biology . 13 (3) e1002106. doi : 10.1371/journal.pbio.1002106 . PMC 4359000. PMID 25768323 .  
  11. Simonsohn U, Nelson LD, Simmons JP (noviembre de 2014). " Curva p y tamaño del efecto: corrección del sesgo de publicación utilizando solo resultados significativos". Perspectives on Psychological Science . 9 (6): 666– 681. doi : 10.1177/1745691614553988 . PMID 26186117. S2CID 39975518 .  
  12. Bhattacharya B, Habtzghi D (2002). "Mediana del valor p bajo la hipótesis alternativa". The American Statistician . 56 (3): 202– 6. doi : 10.1198/000313002146 . S2CID 33812107 . 
  13. Hung HM, O'Neill RT, Bauer P, Köhne K (marzo de 1997). "El comportamiento del valor p cuando la hipótesis alternativa es verdadera" . Biometrics ( manuscrito enviado). 53 (1): 11– 22. doi : 10.2307/2533093 . JSTOR 2533093. PMID 9147587 .  
  14. Nuzzo R (febrero de 2014). "Método científico: errores estadísticos" . Nature . 506 (7487): 150–152 . Bibcode : 2014Natur.506..150N . doi : 10.1038/506150a . hdl : 11573/685222 . PMID 24522584 . 
  15. Colquhoun D (noviembre de 2014). "Una investigación sobre la tasa de falsos descubrimientos y la mala interpretación de los valores p" . Royal Society Open Science . 1 (3) 140216. arXiv : 1407.5296 . Bibcode : 2014RSOS....140216C . doi : 10.1098/rsos.140216 . PMC 4448847. PMID 26064558 .  
  16. Lee DK (diciembre de 2016). "Alternativas al valor p: intervalo de confianza y tamaño del efecto" . Revista Coreana de Anestesiología . 69 (6): 555– 562. doi : 10.4097/kjae.2016.69.6.555 . PMC 5133225. PMID 27924194 .  
  17. Ranstam J (agosto de 2012). "Por qué la cultura del valor p es mala y los intervalos de confianza una mejor alternativa" . Osteoartritis y cartílago . 20 (8): 805– 808. doi : 10.1016/j.joca.2012.04.001 . PMID 22503814 . 
  18. Perneger TV (mayo de 2001). "Filtrando la evidencia. Las razones de verosimilitud son alternativas a los valores p" . BMJ . 322 ( 7295): 1184–1185 . doi : 10.1136/bmj.322.7295.1184 . PMC 1120301. PMID 11379590 .  
  19. Royall R (2004). "El paradigma de la verosimilitud para la evidencia estadística". La naturaleza de la evidencia científica . págs. 119–152 . doi : 10.7208/chicago/9780226789583.003.0005 . ISBN  978-0-226-78957-6.
  20. Schimmack U (30 de abril de 2015). "Reemplazando los valores p con factores de Bayes: una cura milagrosa para la crisis de replicabilidad en la ciencia psicológica" . Replicability-Index . Consultado el 7 de marzo de 2017 .
  21. Marden JI (diciembre de 2000). "Prueba de hipótesis: de los valores p a los factores de Bayes". Journal of the American Statistical Association . 95 (452): 1316– 1320. doi : 10.2307/2669779 . JSTOR 2669779 . 
  22. Stern HS (16 de febrero de 2016). "Una prueba con cualquier otro nombre: valores p, factores de Bayes e inferencia estadística" . Multivariate Behavioral Research . 51 (1): 23–29 . doi : 10.1080/00273171.2015.1099032 . PMC 4809350. PMID 26881954 .  
  23. Murtaugh PA (marzo de 2014). "En defensa de los valores P" . Ecology . 95 (3): 611– 617. Bibcode : 2014Ecol...95..611M . doi : 10.1890/13-0590.1 . PMID 24804441 . 
  24. Aschwanden C (7 de marzo de 2016). "Los estadísticos encontraron un punto en común: es hora de dejar de usar indebidamente los valores p" . FiveThirtyEight . Archivado del original el 8 de marzo de 2016.
  25. Abelson, Robert P. (enero de 1997). "Sobre la sorprendente longevidad de los caballos azotados: por qué existe un argumento a favor de la prueba de significancia". Psychological Science . 8 (1): 12– 15. doi : 10.1111/j.1467-9280.1997.tb00536.x .
  26. Chow, Siu L. (abril de 1998). "Resumen de la significación estadística: fundamentos, validez y utilidad". Behavioral and Brain Sciences . 21 (2): 169– 194. doi : 10.1017/S0140525X98001162 .
  27. Lakens, Daniël (mayo de 2021). "La alternativa práctica al valor p es el valor p correctamente utilizado". Perspectives on Psychological Science . 16 (3): 639– 648. doi : 10.1177/1745691620958012 .
  28. Nickerson, Raymond S. (2000). "Prueba de significación de la hipótesis nula: una revisión de una controversia antigua y continua". Métodos psicológicos . 5 (2): 241– 301. doi : 10.1037//1082-989X.5.2.241 .
  29. Amrhein V , Korner-Nievergelt F, Roth T (2017). "La Tierra es plana ( p > 0,05): umbrales de significancia y la crisis de la investigación irreplicable" . PeerJ . 5 e3544. doi : 10.7717/peerj.3544 . PMC 5502092 . PMID 28698825 .  
  30. Amrhein V , Greenland S (enero de 2018). "Eliminar, en lugar de redefinir, la significación estadística". Nature Human Behaviour . 2 (1): 4. doi : 10.1038/s41562-017-0224-0 . PMID 30980046 . S2CID 46814177 .  
  31. Lakens, Daniël (abril de 2022). "Por qué los valores p no son medidas de evidencia". Trends in Ecology & Evolution . 37 (4): 289– 290. doi : 10.1016/j.tree.2021.12.006 .
  32. Colquhoun D (diciembre de 2017). " La reproducibilidad de la investigación y la mala interpretación de los valores p " . Royal Society Open Science . 4 (12) 171085. Bibcode : 2017RSOS....471085C . doi : 10.1098/rsos.171085 . PMC 5750014. PMID 29308247 .  
  33. Lakens, D., Adolfi, FG, Albers, CJ et al. Justifica tu alfa. Nat Hum Behav 2, 168–171 (2018). https://doi.org/10.1038/s41562-018-0311-x
  34. Goodman, Steven (1 de julio de 2008). "Doce conceptos erróneos sobre el valor p" . Seminarios en hematología . Interpretación de la investigación cuantitativa. 45 (3): 135–140 . doi : 10.1053/j.seminhematol.2008.04.003 . ISSN 0037-1963 . PMID 18582619 .  
  35. Wagenmakers, Eric-Jan (octubre de 2007). "Una solución práctica a los problemas generalizados de los valores p" . Psychonomic Bulletin & Review . 14 (5): 779–804 . doi : 10.3758/BF03194105 . ISSN 1069-9384 . PMID 18087943 .  
  36. Brian E , Jaisson M (2007). «Fisicoteología y matemáticas (1710–1794)». El origen de la proporción sexual humana al nacer . Springer Science & Business Media. pp. 1–25 . ISBN  978-1-4020-6036-6.
  37. Arbuthnot J (1710). "Un argumento a favor de la Divina Providencia, tomado de la regularidad constante observada en los nacimientos de ambos sexos" (PDF) . Philosophical Transactions of the Royal Society of London . 27 ( 325–336 ): 186–190 . doi : 10.1098/rstl.1710.0011 . S2CID 186209819 . 
  38. 1 2 Conover WJ (1999). «Capítulo 3.4: La prueba de signos». Estadística no paramétrica práctica (Tercera ed.). Wiley. págs. 157–176 . ISBN   978-0-471-16068-7.
  39. Sprent P (1989). Métodos estadísticos no paramétricos aplicados (Segunda edición). Chapman & Hall. ISBN  978-0-412-44980-2.
  40. Stigler SM (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Harvard University Press. págs. 225–226 . ISBN  978-0-67440341-3.
  41. Bellhouse P (2001). «John Arbuthnot». En Heyde CC , Seneta E (eds.). Estadísticos de los siglos . Springer. pp. 39– 42. ISBN  978-0-387-95329-8.
  42. Hald A (1998). "Capítulo 4. Azar o diseño: Pruebas de significación". Historia de la estadística matemática de 1750 a 1930. Wiley. pág. 65. 
  43. Stigler SM (1986). Historia de la estadística: La medición de la incertidumbre antes de 1900. Harvard University Press. pág. 134. ISBN  978-0-67440341-3.
  44. 1 2 Pearson K (1900). "Sobre el criterio de que un sistema dado de desviaciones de lo probable en el caso de un sistema de variables correlacionadas es tal que se puede suponer razonablemente que surgió de un muestreo aleatorio" (PDF) . Philosophical Magazine . Serie 5. 50 (302): 157– 175. doi : 10.1080/14786440009463897 .
  45. Biau, David Jean; Jolles, Brigitte M.; Porcher, Raphaël (2010). "Valor p y la teoría de la prueba de hipótesis: una explicación para nuevos investigadores" . Clinical Orthopaedics and Related Research . 468 (3): 885– 892. doi : 10.1007/s11999-009-1164-4 . ISSN 0009-921X . PMC 2816758. PMID 19921345 .   
  46. Brereton, Richard G. (2021). "Valores p y distribuciones multivariadas: términos no ortogonales en modelos de regresión" . Chemometrics and Intelligent Laboratory Systems . 210 104264. doi : 10.1016/j.chemolab.2021.104264 .
  47. Hubbard R, Bayarri MJ (2003), "Confusión sobre las medidas de evidencia ( p 's) frente a los errores (α's) en las pruebas estadísticas clásicas", The American Statistician , 57 (3): 171–178 [p. 171], doi : 10.1198/0003130031856 , S2CID 55671953 
  48. Fisher 1925 , pág. 47, Capítulo III. Distribuciones .
  49. ^ Dallal 2012 , Nota 31: ¿Por qué P = 0,05? .
  50. Fisher 1925 , págs. 78–79, 98, Capítulo IV. Pruebas de bondad de ajuste, independencia y homogeneidad; con tabla de χ 2 , Tabla III. Tabla de χ 2 .
  51. Fisher 1971 , II. Los principios de la experimentación, ilustrados mediante un experimento psicofísico.
  52. 1 2 Fisher 1971 , Sección 7. La prueba de significancia.
  53. Fisher 1971 , Sección 12.1 Inferencia científica y procedimientos de aceptación.
  54. "Definición de valor E" . Institutos Nacionales de Salud .
  55. Storey JD (2003). "La tasa de falsos descubrimientos positivos: una interpretación bayesiana y el valor q" . The Annals of Statistics . 31 (6): 2013– 2035. doi : 10.1214/aos/1074290335 .
  56. Storey JD, Tibshirani R (agosto de 2003). "Significación estadística para estudios de todo el genoma" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 100 (16): 9440– 9445. Bibcode : 2003PNAS..100.9440S . doi : 10.1073/pnas.1530509100 . PMC 170937. PMID 12883005 .  
  57. Makowski D, Ben-Shachar MS, Chen SH, Lüdecke D (10 de diciembre de 2019). "Índices de existencia y significancia de efectos en el marco bayesiano" . Frontiers in Psychology . 10 2767. doi : 10.3389/fpsyg.2019.02767 . PMC 6914840. PMID 31920819 .  
  58. Introducción a los valores p de segunda generación Jeffrey D. Blume, Robert A. Greevy, Valerie F. Welty, Jeffrey R. Smith y William D. Dupont https://www.tandfonline.com/doi/full/10.1080/00031305.2018.1537893
  59. Die Testentscheidung – Ciencia de datos biológicos
  60. Rafi, Zad; Greenland, Sander (30 de septiembre de 2020). "Herramientas semánticas y cognitivas para ayudar a la ciencia estadística: reemplazar la confianza y la significancia por compatibilidad y sorpresa" . BMC Medical Research Methodology . 20 (1): 244. arXiv : 1909.08579 . doi : 10.1186/s12874-020-01105-9 . ISSN 1471-2288 . 
  61. Rovetta, Alessandro (12 de enero de 2024). "Valores S e intervalos de sorpresa para reemplazar los valores p y los intervalos de confianza: Aceptado - enero de 2024" . REVSTAT-Statistical Journal . ISSN 2183-0371 . Archivado del original el 4 de diciembre de 2024. 

Lecturas adicionales

  • Denworth L (octubre de 2019). "Un problema significativo: los métodos científicos estándar están en entredicho. ¿Cambiará algo?". Scientific American . 321 (4): 62–67 (63). El uso de valores p durante casi un siglo [desde 1925] para determinar la significación estadística de los resultados experimentales ha contribuido a una ilusión de certeza y [a] crisis de reproducibilidad en muchos campos científicos . Hay una creciente determinación de reformar el análisis estadístico... Algunos [investigadores] sugieren cambiar los métodos estadísticos, mientras que otros eliminarían un umbral para definir resultados "significativos".
  • Elderton WP (1902). "Tablas para probar la bondad de ajuste de la teoría a la observación" . Biometrika . 1 (2): 155– 163. doi : 10.1093/biomet/1.2.155 .
  • Pearson, Karl (1914). "Sobre la probabilidad de que dos distribuciones independientes de frecuencia sean realmente muestras de la misma población, con especial referencia a trabajos recientes sobre la identidad de cepas de tripanosomas". Biometrika . 10 : 85–154 . doi : 10.1093/biomet/10.1.85 .
  • Fisher RA (1925). Métodos estadísticos para investigadores . Edimburgo, Escocia: Oliver & Boyd. ISBN 978-0-05-002170-5.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • Fisher RA (1971) [1935]. El diseño de experimentos (9.ª  ed.). Macmillan. ISBN 978-0-02-844690-5.
  • Fisher RA, Yates F (1938). Tablas estadísticas para la investigación biológica, agrícola y médica . Londres, Inglaterra.{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  • Stigler SM (1986). Historia de la estadística: la medición de la incertidumbre antes de 1900. Cambridge, Mass: Belknap Press de Harvard University Press. ISBN 978-0-674-40340-6.
  • Hubbard R, Armstrong JS (2006). "Por qué realmente no sabemos qué significa la significación estadística: implicaciones para los educadores" (PDF) . Journal of Marketing Education . 28 (2): 114– 120. doi : 10.1177/0273475306288399 . hdl : 2092/413 . S2CID 34729227. Archivado del original (PDF) el 18 de mayo de 2006. 
  • Hubbard R, Lindsay RM (2008). "Por qué los valores p no son una medida útil de evidencia en las pruebas de significación estadística" (PDF) . Theory & Psychology . 18 (1): 69– 88. doi : 10.1177/0959354307086923 . S2CID 143487211. Archivado del original (PDF) el 21 de octubre de 2016. Recuperado el 28 de agosto de 2015 . 
  • Stigler S (diciembre de 2008). "Fisher y el nivel del 5%" . Chance . 21 (4): 12. doi : 10.1007/s00144-008-0033-3 .
  • Dallal GE (2012). El pequeño manual de práctica estadística .
  • Biau DJ, Jolles BM, Porcher R (marzo de 2010). "Valor p y la teoría de la prueba de hipótesis: una explicación para nuevos investigadores" . Clinical Orthopaedics and Related Research . 468 (3): 885– 892. doi : 10.1007/s11999-009-1164-4 . PMC 2816758. PMID 19921345 .  
  • Reinhart A (2015). Statistics Done Wrong: The Woefully Complete Guide . No Starch Press . p.  176. ISBN 978-1-59327-620-1.
  • Benjamini, Yoav ; De Veaux, Richard D.; Efron, Bradley ; Evans, Scott; Glickman, Mark; Graubard, Barry I.; He, Xuming; Meng, Xiao-Li ; Reid, Nancy ; Stigler, Stephen M .; Vardeman, Stephen B.; Wikle, Christopher K.; Wright, Tommy; Young, Linda J.; Kafadar, Karen (2021). "Declaración del Grupo de Trabajo del Presidente de la ASA sobre la Significancia Estadística y la Replicabilidad" . Annals of Applied Statistics . 15 (3): 1084– 1085. doi : 10.1214/21-AOAS1501 .
  • Benjamin, Daniel J.; Berger, James O.; Johannesson, Magnus; Nosek, Brian A.; Wagenmakers, E.-J.; Berk, Richard; Bollen, Kenneth A.; Brembs, Björn; Brown, Lawrence; Camerer, Colin; Cesarini, David; Chambers, Christopher D.; Clyde, Merlise; Cook, Thomas D.; De Boeck, Paul; Dienes, Zoltan; Dreber, Anna; Easwaran, Kenny; Efferson, Charles; Fehr, Ernst; Fidler, Fiona; Field, Andy P.; Forster, Malcolm; George, Edward I.; Gonzalez, Richard; Goodman, Steven; Green, Edwin; Green, Donald P.; Greenwald, Anthony G.; Hadfield, Jarrod D.; Hedges, Larry V.; Held, Leonhard; Hua Ho, Teck; Hoijtink, Herbert; Hruschka, Daniel J.; Imai, Kosuke; Imbens, Guido; Ioannidis, John PA; Jeon, Minjeong; Jones, James Holanda; Kirchler, Michael; Laibson, David; Lista, Juan; Pequeño, Rodrigo; Lupia, Arturo; Machéry, Edouard; Maxwell, Scott E.; McCarthy, Michael; Moore, Don A.; Morgan, Stephen L.; Munafó, Marcus; Nakagawa, Shinichi; Nyhan, Brendan; Parker, Timothy H.; Pericchi, Luis; Perugini, Marco; Más rodante, Jeff; Rousseau, Judith; Savalei, Victoria; Schönbrodt, Félix D.; Sellke, Thomas; Sinclair, Betsy; Tingley, Dustin; Van Zandt, Trisha; Vazire, Simine; Watts, Duncan J.; Winship, Christopher; Wolpert, Robert L.; Xie, Yu; Joven, Cristóbal; Zinman, Jonathan; Johnson, Valen E. (1 de septiembre de 2017). "Redefinir la significación estadística". Nature Human Behaviour . 2 (1): 6– 10. doi : 10.1038/s41562-017-0189-z . eISSN 2397-3374 . hdl : 10281/184094 . PMID 30980045. S2CID 256726352 .   
  • Calculadoras gratuitas en línea de valores p para diversas pruebas específicas (chi-cuadrado, prueba F de Fisher, etc.).
  • Comprensión de los valores p , incluyendo un applet de Java que ilustra cómo los valores numéricos de los valores p pueden dar impresiones bastante engañosas sobre la veracidad o falsedad de la hipótesis que se está probando.
  • StatQuest: Valores p, explicados claramente en YouTube
  • StatQuest: Errores comunes en el cálculo del valor p y la potencia estadística en YouTube
  • La ciencia no está rota: artículo sobre cómo se pueden manipular los valores p y una herramienta interactiva para visualizarlo.