Articulo de referencia

DFFITS

En estadística, DFFIT y DFFITS ("diferencia en ajuste(s)") son diagnósticos destinados a mostrar cuán influyente es un punto en una regresión lineal , propuestos por primera vez...

En estadística, DFFIT y DFFITS ("diferencia en ajuste(s)") son diagnósticos destinados a mostrar cuán influyente es un punto en una regresión lineal , propuestos por primera vez en 1980. [ 1 ]

DFFIT es el cambio en el valor predicho para un punto, obtenido cuando ese punto se excluye de la regresión:

DFFIT=y^iy^i(i){\displaystyle {\text{DFFIT}}={\widehat {y}}_{i}-{\widehat {y}}_{i(i)}}

dóndey^i{\displaystyle {\widehat {y}}_{i}}yy^i(i){\displaystyle {\widehat {y}}_{i(i)}}son la predicción para el punto i con y sin incluir el punto i en la regresión.

DFFITS es el DFFIT estudentizado, donde la estudentización se logra dividiendo por la desviación estándar estimada del ajuste en ese punto:

DFFITS=DFFITs(i)hii{\displaystyle {\text{DFFITS}}={\frac {\text{DFFIT}}{s_{(i)}{\sqrt {h_{ii}}}}}}

dóndes(i){\displaystyle s_{(i)}}es el error estándar estimado sin el punto en cuestión, yhii{\displaystyle h_{ii}}es la palanca para el punto.

DFFITS también es igual a los productos del residuo estudentizado externamente (ti(i){\displaystyle t_{i(i)}}) y el factor de apalancamiento (hii/(1hii){\displaystyle {\sqrt {h_{ii}/(1-h_{ii})}}}): [ 2 ]

DFFITS=ti(i)hii1hii{\displaystyle {\text{DFFITS}}=t_{i(i)}{\sqrt {\frac {h_{ii}}{1-h_{ii}}}}}

Por lo tanto, para niveles de apalancamiento bajos, se espera que DFFITS sea pequeño, mientras que, a medida que el apalancamiento se acerca a 1, la distribución del valor de DFFITS se amplía infinitamente.

Para un diseño experimental perfectamente equilibrado (como un diseño factorial o un diseño factorial parcial equilibrado), el apalancamiento para cada punto es p / n , el número de parámetros dividido por el número de puntos. Esto significa que los valores DFFITS se distribuirán (en el caso gaussiano) comopagnortepagpagnorte{\displaystyle {\sqrt {p \over np}}\approx {\sqrt {p \over n}}}tiempos en variabilidad. Por lo tanto, los autores sugieren investigar aquellos puntos con DFFITS mayor que2pagnorte{\displaystyle 2{\sqrt {p \over n}}}.

Aunque los valores brutos resultantes de las ecuaciones son diferentes, la distancia de Cook y DFFITS son conceptualmente idénticos y existe una fórmula de forma cerrada para convertir un valor en el otro. [ 3 ]

Desarrollo

Anteriormente, al evaluar un conjunto de datos antes de realizar una regresión lineal, la posibilidad de valores atípicos se evaluaba mediante histogramas y diagramas de dispersión. Ambos métodos de evaluación de puntos de datos eran subjetivos y resultaba difícil determinar la influencia de cada posible valor atípico en los resultados. Esto dio lugar a diversas medidas cuantitativas, como DFFIT y DFBETA .

Referencias

  1. Belsley, David A.; Kuh, Edwin; Welsh, Roy E. (1980). Diagnóstico de regresión: identificación de datos influyentes y fuentes de colinealidad . Serie Wiley en probabilidad y estadística matemática. Nueva York: John Wiley & Sons . págs. 11–16 . ISBN  0-471-05856-4.
  2. Montgomery, Douglas C.; Peck, Elizabeth A.; Vining, G. Geoffrey (2012). Introducción al análisis de regresión lineal (5.ª ed.). Wiley. pág. 218. ISBN   978-0-470-54281-1. Recuperado el 22 de febrero de 2013. Por lo tanto, DFFITS i es el valor de R -estudiante multiplicado por el apalancamiento de la i -ésima observación [ h ii /(1  h ii )] 1/2 . 
  3. Cohen, Jacob; Cohen, Patricia; West, Stephen G.; Aiken, Leona S. (2003). Análisis de regresión/correlación múltiple aplicada a las ciencias del comportamiento . ISBN 0-8058-2223-2.