Articulo de referencia

Observación influyente

En el cuarteto de Anscombe, los dos conjuntos de datos inferiores contienen puntos influyentes. Los cuatro conjuntos son idénticos al analizarlos con estadísticas descriptivas s...

En el cuarteto de Anscombe, los dos conjuntos de datos inferiores contienen puntos influyentes. Los cuatro conjuntos son idénticos al analizarlos con estadísticas descriptivas simples, pero varían considerablemente al representarlos gráficamente. Si se elimina un punto, la línea se vería muy diferente.

En estadística , una observación influyente es aquella cuya eliminación del conjunto de datos alteraría notablemente el resultado del cálculo. [ 1 ] En particular, en el análisis de regresión, una observación influyente es aquella cuya eliminación tiene un gran efecto en las estimaciones de los parámetros. [ 2 ]

Evaluación

Se han propuesto varios métodos para medir la influencia. [ 3 ] [ 4 ] Supongamos una regresión estimaday=incógnitab+mi{\displaystyle \mathbf {y} =\mathbf {X} \mathbf {b} +\mathbf {e} }, dóndey{\displaystyle \mathbf {y} }es un vector columna n × 1 para la variable de respuesta,incógnita{\displaystyle \mathbf {X} }es la matriz de diseño n × k de variables explicativas (incluida una constante),mi{\displaystyle \mathbf {e} }es el vector residual n × 1, yb{\displaystyle \mathbf {b} }es un vector k × 1 de estimaciones de algún parámetro poblacionalβRk{\displaystyle \mathbf {\beta } \in \mathbb {R} ^{k}}. Defina tambiénHincógnita(incógnitaTincógnita)1incógnitaT{\displaystyle \mathbf {H} \equiv \mathbf {X} \left(\mathbf {X} ^{\mathsf {T}}\mathbf {X} \right)^{-1}\mathbf {X} ^{\mathsf {T}}}, la matriz de proyección deincógnita{\displaystyle \mathbf {X} }. A continuación, tenemos las siguientes medidas de influencia:

  1. DFBETAibb(i)=(incógnitaTincógnita)1incógnitaiTmii1hii{\displaystyle {\text{DFBETA}}_{i}\equiv \mathbf {b} -\mathbf {b} _{(-i)}={\frac {\left(\mathbf {X} ^{\mathsf {T}}\mathbf {X} \right)^{-1}\mathbf {x} _{i}^{\mathsf {T}}e_{i}}{1-h_{ii}}}}, dóndeb(i){\displaystyle \mathbf {b} _{(-i)}}denota los coeficientes estimados con la i -ésima filaincógnitai{\displaystyle \mathbf {x} _ {i}}deincógnita{\displaystyle \mathbf {X} }eliminado,hii=incógnitai(incógnitaTincógnita)1incógnitaiT{\displaystyle h_{ii}=\mathbf {x} _{i}\left(\mathbf {X} ^{\mathsf {T}}\mathbf {X} \right)^{-1}\mathbf {x} _{i}^{\mathsf {T}}}denota el i -ésimo valor de la matriz.H{\displaystyle \mathbf {H} }diagonal principal. Por lo tanto, DFBETA mide la diferencia en cada estimación de parámetro con y sin el punto influyente. Hay un DFBETA para cada variable y cada observación (si hay N observaciones y k variables, hay N·k DFBETA). [ 5 ] La tabla muestra los DFBETA para el tercer conjunto de datos del cuarteto de Anscombe (gráfico inferior izquierdo en la figura):
  1. DFFITS - diferencia en los ajustes
  2. El coeficiente D de Cook mide el efecto de eliminar un punto de datos sobre todos los parámetros combinados. [ 2 ]

Valores atípicos, influencia y poder de negociación.

Un valor atípico puede definirse como un punto de datos que difiere marcadamente de otras observaciones. [ 6 ] [ 7 ] Un punto de alto apalancamiento son observaciones realizadas en valores extremos de variables independientes. [ 8 ] Ambos tipos de observaciones atípicas obligarán a que la línea de regresión esté cerca del punto. [ 2 ] En el cuarteto de Anscombe, la imagen inferior derecha tiene un punto con alto apalancamiento y la imagen inferior izquierda tiene un punto atípico.

Véase también

Referencias

  1. Burt, James E.; Barber, Gerald M.; Rigby, David L. (2009), Elementary Statistics for Geographers , Guilford Press, p.  513, ISBN 9781572304840.
  2. 1 2 3 Everitt, Brian (1998). The Cambridge Dictionary of Statistics . Cambridge, Reino Unido. Nueva York: Cambridge University Press. ISBN 0-521-59346-8.
  3. Winner, Larry (25 de marzo de 2002). "Estadísticas de influencia, valores atípicos y diagnósticos de colinealidad" .
  4. Belsley, David A.; Kuh, Edwin; Welsh, Roy E. (1980). Diagnóstico de regresión: identificación de datos influyentes y fuentes de colinealidad . Serie Wiley en probabilidad y estadística matemática. Nueva York: John Wiley & Sons . págs. 11–16 . ISBN  0-471-05856-4.
  5. "Valores atípicos y DFBETA" (PDF) . Archivado (PDF) del original el 11 de mayo de 2013.
  6. Grubbs, FE (febrero de 1969). "Procedimientos para detectar observaciones atípicas en muestras". Technometrics . 11 (1): 1– 21. doi : 10.1080/00401706.1969.10490657 . Una observación atípica, o "valor atípico", es aquella que parece desviarse notablemente de los demás miembros de la muestra en la que aparece.
  7. ↑ Maddala , GS (1992). "Valores atípicos" . Introducción a la econometría (2.ª ed.). Nueva York: MacMillan. pp. 89. ISBN   978-0-02-374545-4Un valor atípico es una observación que se encuentra muy alejada del resto de las observaciones.
  8. Everitt, BS (2002). Diccionario de estadística de Cambridge . Cambridge University Press. ISBN 0-521-81099-X.

Lecturas adicionales

  • Dehon, Catherine; Gassner, Marjorie; Verardi, Vincenzo (2009). "Cuidado con los valores atípicos 'buenos' y las conclusiones excesivamente optimistas". Oxford Bulletin of Economics and Statistics . 71 (3): 437– 452. doi : 10.1111/j.1468-0084.2009.00543.x . S2CID 154376487 . 
  • Kennedy, Peter (2003). «Estimación robusta» . Guía de econometría (Quinta  ed.). Cambridge: The MIT Press. pp. 372–388 . ISBN  0-262-61183-X.