Articulo de referencia

Distribución de rango estudentizado

1}}, the number of groups {{nowrap| \\nu > 0}}, the [[Degrees of freedom (statistics)|degrees of freedom]]"},"support":{"wt":" q \\in (0, +\\infty) "},"pdf":{"wt":" \\begin{matr...

En probabilidad y estadística , la distribución del rango estudentizado es la distribución de probabilidad continua del rango estudentizado de una muestra i.i.d. de una población con distribución normal .

Supongamos que tomamos una muestra de tamaño n de cada una de las k poblaciones con la misma distribución normal N ( μ , σ 2 ) y supongamos que y¯min{\displaystyle {\bar {y}}_{\min }}es la más pequeña de estas medias muestrales yy¯máximo{\displaystyle {\bar {y}}_{\max }}es la mayor de estas medias muestrales, y supongamos que es la varianza muestral combinada de estas muestras. Entonces, el siguiente estadístico tiene una distribución de rango estudentizado.

q=y¯máximoy¯mins/norte{\displaystyle q={\frac {{\overline {y}}_{\max }-{\overline {y}}_{\min }}{s/{\sqrt {n\,}}}}}

Definición

Función de densidad de probabilidad

Al diferenciar la función de distribución acumulativa con respecto a q, se obtiene la función de densidad de probabilidad .

FR(q;k,ν)=2πk(k1)νν/2Γ(ν/2)2(ν/21)0sνφ(νs)[φ(z+qs)φ(z)[Φ(z+qs)Φ(z)]k2dz]ds{\displaystyle f_{\text{R}}(q;k,\nu )={\frac {{\sqrt {2\pi \,}}\,k\,(k-1)\,\nu ^{\nu /2}}{\Gamma (\nu /2)\,2^{\left(\nu /2-1\right)}}}\int _{0}^{\infty }s^{\nu }\,\varphi ({\sqrt {\nu \,}}\,s)\,\left[\int _{-\infty }^{\infty }\varphi (z+q\,s)\,\varphi (z)\,\left[\Phi (z+q\,s)-\Phi (z)\right]^{k-2}\,\mathrm {d} z\right]\,\mathrm {d} s}

Nótese que en la parte exterior de la integral, la ecuación

φ(νs)2π=mi(νs2/2){\displaystyle \varphi ({\sqrt {\nu \,}}\,s)\,{\sqrt {2\pi \,}}=e^{-\left(\nu \,s^{2}/2\right)}}

se utilizó para reemplazar un factor exponencial.

Función de distribución acumulativa

La función de distribución acumulativa viene dada por [ 1 ]

FR(q;k,ν)=2πkνν/2Γ(ν/2)2(ν/21)0sν1φ(νs)[φ(z)[Φ(z+qs)Φ(z)]k1dz]ds{\displaystyle F_{\text{R}}(q;k,\nu )={\frac {{\sqrt {2\pi \,}}\,k\,\nu ^{\nu /2}}{\,\Gamma (\nu /2)\,2^{(\nu /2-1)}\,}}\int _ {0}^{\infty }s^{\nu -1}\varphi ({\sqrt {\nu \,}}\,s)\left[\int _{-\infty }^{\infty }\varphi (z)\left[\Phi (z+q\,s)-\Phi (z)\right]^{k-1}\,\mathrm {d} z\right]\,\mathrm {d} s}

Casos especiales

Si k es 2 o 3, [ 2 ] la función de distribución de probabilidad de rango estudentizado se puede evaluar directamente, dondeφ(z){\displaystyle \varphi (z)}es la función de densidad de probabilidad normal estándar yΦ(z){\displaystyle \Phi (z)}es la función de distribución acumulativa normal estándar.

FR(q;k=2)=2φ(q/2){\displaystyle f_{R}(q;k=2)={\sqrt {2\,}}\,\varphi \left(\,q/{\sqrt {2\,}}\right)}
FR(q;k=3)=62φ(q/2)[Φ(q/6)12]{\displaystyle f_{R}(q;k=3)=6{\sqrt {2\,}}\,\varphi \left(\,q/{\sqrt {2\,}}\right)\left[\Phi \left(q/{\sqrt {6\,}}\right)-{\tfrac {1}{2}}\right]}

Cuando los grados de libertad se aproximan al infinito, la distribución acumulativa del rango estudentizado se puede calcular para cualquier k utilizando la distribución normal estándar.

FR(q;k)=kφ(z)[Φ(z+q)Φ(z)]k1dz=k[Φ(z+q)Φ(z)]k1dΦ(z){\displaystyle F_{R}(q;k)=k\,\int _{-\infty }^{\infty }\varphi (z)\,{\Bigl [}\Phi (z+q)-\Phi (z){\Bigr ]}^{k-1}\,\mathrm {d} z=k\,\int _{-\infty }^{\infty }\,{\Bigl [}\Phi (z+q)-\Phi (z){\Bigr ]}^{k-1}\,\mathrm {d} \Phi (z)}

Aplicaciones

Los valores críticos de la distribución del rango estudentizado se utilizan en la prueba de rango de Tukey . [ 3 ]

El rango estudentizado se utiliza para calcular los niveles de significancia de los resultados obtenidos mediante minería de datos , donde se buscan selectivamente diferencias extremas en los datos de la muestra, en lugar de muestrear solo al azar.

La distribución de rango estudentizado tiene aplicaciones en pruebas de hipótesis y procedimientos de comparaciones múltiples . Por ejemplo, la prueba de rango de Tukey y la nueva prueba de rango múltiple (MRT) de Duncan, en la que la muestra x 1 ,  ..., x n es una muestra de medias y q es el estadístico de prueba básico, pueden utilizarse como análisis post hoc para probar entre qué dos grupos de medias existe una diferencia significativa (comparaciones por pares) después de rechazar la hipótesis nula de que todos los grupos provienen de la misma población (es decir, todas las medias son iguales) mediante el análisis de varianza estándar . [ 4 ] 

Cuando solo se cuestiona la igualdad de las medias de los dos grupos (es decir, si μ₁ = μ₂ ) , la distribución de rango estudentizado es similar a la distribución t de Student , diferenciándose únicamente en que la primera tiene en cuenta el número de medias consideradas y el valor crítico se ajusta en consecuencia. Cuantas más medias se consideren, mayor será el valor crítico. Esto tiene sentido, ya que cuantas más medias haya, mayor será la probabilidad de que al menos algunas diferencias entre pares de medias sean significativamente grandes debido únicamente al azar.

Derivación

La función de distribución del rango estudentizado surge al reescalar el rango muestral R mediante la desviación estándar muestral s , ya que el rango estudentizado se suele tabular en unidades de desviaciones estándar, con la variable q = R / s . La derivación comienza con una forma perfectamente general de la función de distribución del rango muestral, que se aplica a cualquier distribución de datos muestrales.

Para obtener la distribución en términos del rango "estudiantizado" q , cambiaremos la variable de R a s y q . Suponiendo que los datos de la muestra siguen una distribución normal , la desviación estándar s tendrá una distribución χ² . Al integrar sobre s, podemos eliminar s como parámetro y obtener la distribución reescalada en términos de q únicamente.

Forma general

Para cualquier función de densidad de probabilidad f X , la densidad de probabilidad de rango f R es: [ 2 ]

FR(r;k)=k(k1)Fincógnita(t+12r)Fincógnita(t12r)[t12rt+12rFincógnita(incógnita)dincógnita]k2dt{\displaystyle f_{R}(r;k)=k\,(k-1)\int _{-\infty }^{\infty }f_{X}\left(t+{\tfrac {1}{2}}r\right)f_{X}\left(t-{\tfrac {1}{2}}r\right)\left[\int _{t-{\tfrac {1}{2}}r}^{t+{\tfrac {1}{2}}r}f_{X}(x)\,\mathrm {d} x\right]^{k-2}\,\mathrm {d} \,t}

Lo que esto significa es que estamos sumando las probabilidades de que, dado k extracciones de una distribución, dos de ellas difieran en r , y las k 2 extracciones restantes caigan todas entre los dos valores extremos. Si cambiamos las variables a u donde  =t12r{\displaystyle u=t-{\tfrac {1}{2}}r}es el extremo inferior del rango, y definimos F X como la función de distribución acumulativa de f X , entonces la ecuación se puede simplificar:

FR(r;k)=k(k1)Fincógnita(+r)Fincógnita()[Fincógnita(+r)Fincógnita()]k2d{\displaystyle f_{R}(r;k)=k\,(k-1)\int _{-\infty }^{\infty }f_{X}(u+r)\,f_{X}(u)\,\left[\,F_{X}(u+r)-F_{X}(u)\,\right]^{k-2}\,\mathrm {d} \,u}

Introducimos una integral similar y observamos que al diferenciar bajo el signo de integral obtenemos

r[kFincógnita()[Fincógnita(+r)Fincógnita()]k1d]=k(k1)Fincógnita(+r)Fincógnita()[Fincógnita(+r)Fincógnita()]k2d{\displaystyle {\begin{aligned}{\frac {\partial }{\partial r}}&\left[k\,\int _{-\infty }^{\infty }f_{X}(u)\,{\Bigl [}\,F_{X}(u+r)-F_{X}(u)\,{\Bigr ]}^{k-1}\,\mathrm {d} \,u\right]\\[5pt]={}&k\,(k-1)\int _{-\infty }^{\infty }f_{X}(u+r)\,f_{X}(u)\,{\Bigl [}\,F_{X}(u+r)-F_{X}(u)\,{\Bigr ]}^{k-2}\,\mathrm {d} \,u\end{aligned}}}

que recupera la integral anterior, [ a ] ​​de modo que la última relación confirma

FR(r;k)=kFincógnita()[Fincógnita(+r)Fincógnita()]k1d=k[Fincógnita(+r)Fincógnita()]k1dFincógnita(){\displaystyle {\begin{aligned}F_{R}(r;k)&=k\int _{-\infty }^{\infty }f_{X}(u){\Bigl [}\,F_{X}(u+r)-F_{X}(u)\,{\Bigr ]}^{k-1}\,\mathrm {d} \,u\\&=k\int _{-\infty }^{\infty }{\Bigl [}\,F_{X}(u+r)-F_{X}(u)\,{\Bigr ]}^{k-1}\,\mathrm {d} \,F_{X}(u)\end{aligned}}}

porque para cualquier función de distribución acumulada continua

FR(r;k)r=FR(r;k){\displaystyle {\frac {\partial F_{R}(r;k)}{\partial r}}=f_{R}(r;k)}

Formulario especial para datos normales

La distribución de rango se utiliza con mayor frecuencia para intervalos de confianza alrededor de las medias de las muestras, que se distribuyen asintóticamente de forma normal según el teorema del límite central .

Para crear la distribución de rango estudentizado para datos normales, primero cambiamos de las funciones de distribución genéricas f X y F X a las funciones de distribución φ y Φ para la distribución normal estándar , y cambiamos la variable r a s·q , donde q es un factor fijo que reescala r por el factor de escala s :

FR(q;k)=sk(k1)φ(+sq)φ()[Φ(+sq)Φ()]k2d{\displaystyle f_{R}(q;k)=s\,k\,(k-1)\int _{-\infty }^{\infty }\varphi (u+sq)\varphi (u)\,\left[\,\Phi (u+sq)-\Phi (u)\right]^{k-2}\,\mathrm {d} u}

Elija el factor de escala s como la desviación estándar de la muestra, de modo que q se convierta en el número de desviaciones estándar de amplitud del rango. Para datos normales , s sigue una distribución chi [ b ] y la función de distribución f S de la distribución chi viene dada por:

FS(s;ν)ds={νν/2sν1miνs2/22(ν/21)Γ(ν/2)dspara 0<s<,0de lo contrario.{\displaystyle f_{S}(s;\nu )\,\mathrm {d} s={\begin{cases}{\dfrac {\nu ^{\nu /2}\,s^{\nu -1}e^{-\nu \,s^{2}/2}\,}{2^{\left(\nu /2-1\right)}\Gamma (\nu /2)}}\,\mathrm {d} s&{\text{for }}\,0<s<\infty ,\\[4pt]0&{\text{otherwise}}.\end{cases}}}

Al multiplicar las distribuciones f R y f S e integrar para eliminar la dependencia de la desviación estándar s, se obtiene la función de distribución de rango estudentizado para datos normales:

FR(q;k,ν)=νν/2k(k1)2(ν/21)Γ(ν/2)0sνmiνs2/2φ(+sq)φ()[Φ(+sq)Φ()]k2dds{\displaystyle f_{R}(q;k,\nu )={\frac {\nu ^{\nu /2}\,k\,(k-1)}{2^{\left(\nu /2-1\right)}\Gamma (\nu /2)}}\int _{0}^{\infty }s^{\nu }e^{-\nu s^{2}/2}\int _{-\infty }^{\infty }\varphi (u+sq)\,\varphi (u)\,\left[\,\Phi (u+sq)-\Phi (u)\right]^{k-2}\,\mathrm {d} u\,\mathrm {d} s}

dónde

q es la amplitud del rango de datos medida en desviaciones estándar,
ν es el número de grados de libertad para determinar la desviación estándar de la muestra, [ c ] y
k es el número de promedios separados que forman los puntos dentro del rango.

La ecuación para la función de densidad de probabilidad que se muestra en las secciones anteriores proviene del uso

miνs2/2=2πφ(νs){\displaystyle e^{-\nu \,s^{2}/2}={\sqrt {2\pi \,}}\,\varphi ({\sqrt {\nu \,}}\,s)}

para reemplazar la expresión exponencial en la integral externa.

Notas

  1. Técnicamente, la relación solo es cierta para puntos.{\displaystyle u}dóndeFincógnita(+r)>0{\displaystyle f_{X}(u+r)>0}, lo cual se cumple en todas partes para datos normales , como se analiza en la siguiente sección, pero no para distribuciones cuyo soporte tiene un límite superior, como los datos distribuidos uniformemente .
  2. ↑ Nótese bien la ausencia de " al cuadrado": El texto se refiere a la distribución χ , no a la distribución χ² .
  3. Normalmenteν=norte1{\displaystyle \nu =n-1}donde n es el número total de todos los puntos de datos utilizados para encontrar los promedios que son los valores en el rango.

Referencias

  1. Lund, RE; Lund, JR (1983). "Algoritmo AS 190: Probabilidades y cuantiles superiores para el rango estudentizado". Journal of the Royal Statistical Society . 32 (2): 204– 210. JSTOR 2347300 . 
  2. 1 2 McKay, AT (1933). "Una nota sobre la distribución del rango en muestras de n ". Biometrika . 25 (3): 415– 420. doi : 10.2307/2332292 . JSTOR 2332292 . 
  3. "StatsExamples | tabla de valores críticos de la distribución Q para alfa=0,05" .
  4. Pearson y Hartley (1970, Sección 14.2)

Lecturas adicionales

  • Pearson, ES ; Hartley, HO (1942). "La integral de probabilidad del rango en muestras de N observaciones de una población normal". Biometrika . 32 (3): 301– 310. doi : 10.1093/biomet/32.3-4.309 . JSTOR 2332134 . 
  • Hartley, HO (1942). "El rango en muestras aleatorias". Biometrika . 32 (3): 334– 348. doi : 10.2307/2332137 . JSTOR 2332137 . 
  • Dunlap, WP; Powell, RS; Konnerth, TK (1977). "Una función de FORTRAN IV para calcular probabilidades asociadas con la estadística de rango estudentizado" . Behavior Research Methods & Instrumentation . 9 (4): 373– 375. doi : 10.3758/BF03202264 .
  • Tabla de valores críticos para la distribución del rango estudentizado