Articulo de referencia

regresión de Deming

Regresión de Deming. Las líneas rojas muestran el error en x e y . Esto difiere del método tradicional de mínimos cuadrados, que mide el error paralelamente al eje y . El caso m...

Regresión de Deming. Las líneas rojas muestran el error en x e y . Esto difiere del método tradicional de mínimos cuadrados, que mide el error paralelamente al eje y . El caso mostrado, con desviaciones medidas perpendicularmente, se presenta cuando los errores en x e y tienen varianzas iguales.

En estadística , la regresión de Deming , que recibe su nombre de W. Edwards Deming , es un modelo de errores en las variables que busca la línea de mejor ajuste para un conjunto de datos bidimensional . Se diferencia de la regresión lineal simple en que considera los errores en las observaciones tanto del eje x como del eje y . Es un caso especial de mínimos cuadrados totales , que permite cualquier número de predictores y una estructura de error más compleja.

La regresión de Deming es equivalente a la estimación de máxima verosimilitud de un modelo de errores en las variables en el que se supone que los errores de las dos variables son independientes y siguen una distribución normal , y se conoce la razón de sus varianzas, denotada por δ . [ 1 ] En la práctica, esta razón podría estimarse a partir de fuentes de datos relacionadas; sin embargo, el procedimiento de regresión no tiene en cuenta los posibles errores en la estimación de esta razón.

La regresión de Deming es solo un poco más difícil de calcular que la regresión lineal simple . La mayoría de los paquetes de software estadístico utilizados en química clínica ofrecen la regresión de Deming.

El modelo fue introducido originalmente por Adcock (1878) , quien consideró el caso δ  =  1, y luego, de forma más general, por Kummell (1879) con un δ arbitrario . Sin embargo, sus ideas pasaron prácticamente desapercibidas durante más de 50 años, hasta que fueron retomadas por Koopmans (1936) y posteriormente difundidas aún más por Deming (1943) . Este último libro se hizo tan popular en química clínica y campos afines que el método llegó a denominarse regresión de Deming en dichos campos. [ 2 ]

Especificación

Supongamos que los datos disponibles ( y i , x i ) son observaciones medidas de los valores "verdaderos" ( y i * , x i * ), que se encuentran en la línea de regresión:

yi=yi+εi,incógnitai=incógnitai+ηi,{\displaystyle {\begin{aligned}y_{i}&=y_{i}^{*}+\varepsilon _{i},\\x_{i}&=x_{i}^{*}+\eta _{i},\end{aligned}}}

donde los errores ε y η son independientes y se supone que se conoce la razón de sus varianzas:

δ=σε2ση2.{\displaystyle \delta ={\frac {\sigma _{\varepsilon }^{2}}{\sigma _{\eta }^{2}}}.}

En la práctica, las variaciones de laincógnita{\displaystyle x}yy{\displaystyle y}Los parámetros suelen ser desconocidos, lo que complica la estimación deδ{\displaystyle \delta }. Tenga en cuenta que cuando el método de medición paraincógnita{\displaystyle x}yy{\displaystyle y}es lo mismo, es probable que estas varianzas sean iguales, por lo tantoδ=1{\displaystyle \delta =1}para este caso.

Buscamos encontrar la línea de "mejor ajuste".

y=β0+β1incógnita,{\displaystyle y^{*}=\beta _{0}+\beta _{1}x^{*},}

de tal manera que se minimice la suma ponderada de los residuos al cuadrado del modelo: [ 3 ]

SSR=i=1norte(εi2σε2+ηi2ση2)=1σϵ2i=1norte((yiβ0β1incógnitai)2+δ(incógnitaiincógnitai)2)  minβ0,β1,incógnita1,,incógnitanorteSSR{\displaystyle SSR=\sum _{i=1}^{n}{\bigg (}{\frac {\varepsilon _{i}^{2}}{\sigma _{\varepsilon }^{2}}}+{\frac {\eta _{i}^{2}}{\sigma _{\eta }^{2}}}{\bigg )}={\frac {1}{\sigma _{\epsilon }^{2}}}\sum _{i=1}^{n}{\Big (}(y_{i}-\beta _{0}-\beta _{1}x_{i}^{*})^{2}+\delta (x_{i}-x_{i}^{*})^{2}{\Big )}\ \to \ \min _{\beta _{0},\beta _{1},x_{1}^{*},\ldots ,x_{n}^{*}}SSR}

Véase Jensen (2007) para una derivación completa.

Solución

La solución se puede expresar en términos de los momentos muestrales de segundo grado. Es decir, primero calculamos las siguientes cantidades (todas las sumas van de i  =  1 a n ):

incógnita¯=1norteincógnitaiy¯=1norteyi,sincógnitaincógnita=1norte(incógnitaiincógnita¯)2=incógnita2¯incógnita¯2,sincógnitay=1norte(incógnitaiincógnita¯)(yiy¯)=incógnitay¯incógnita¯y¯,syy=1norte(yiy¯)2=y2¯y¯2.{\displaystyle {\begin{aligned}{\overline {x}}&={\tfrac {1}{n}}\sum x_{i}&{\overline {y}}&={\tfrac {1}{n}}\sum y_{i},\\s_{xx}&={\tfrac {1}{n}}\sum (x_{i}-{\overline {x}})^{2}&&={\overline {x^{2}}}-{\overline {x}}^{2},\\s_{xy}&={\tfrac {1}{n}}\sum (x_{i}-{\overline {x}})(y_{i}-{\overline {y}})&&={\overline {xy}}-{\overline {x}}\,{\overline {y}},\\s_{yy}&={\tfrac {1}{n}}\sum (y_{i}-{\overline {y}})^{2}&&={\overline {y^{2}}}-{\overline {y}}^{2}.\end{aligned}}\,}

Finalmente, las estimaciones de mínimos cuadrados de los parámetros del modelo serán [ 4 ].

β^1=syyδsincógnitaincógnita+(syyδsincógnitaincógnita)2+4δsincógnitay22sincógnitay,β^0=y¯β^1incógnita¯,incógnita^i=incógnitai+β^1β^12+δ(yiβ^0β^1incógnitai).{\displaystyle {\begin{aligned}&{\hat {\beta }}_{1}={\frac {s_{yy}-\delta s_{xx}+{\sqrt {(s_{yy}-\delta s_{xx})^{2}+4\delta s_{xy}^{2}}}}{2s_{xy}}},\\&{\hat {\beta }}_{0}={\overline {y}}-{\hat {\beta }}_{1}{\overline {x}},\\&{\hat {x}}_{i}^{*}=x_{i}+{\frac {{\hat {\beta }}_{1}}{{\hat {\beta }}_{1}^{2}+\delta }}(y_{i}-{\hat {\beta }}_{0}-{\hat {\beta }}_{1}x_{i}).\end{aligned}}}

regresión ortogonal

Para el caso de varianzas de error iguales, es decir, cuandoδ=1{\displaystyle \delta =1}La regresión de Deming se convierte en regresión ortogonal : minimiza la suma de las distancias perpendiculares al cuadrado desde los puntos de datos a la línea de regresión . En este caso, denotamos cada observación como un punto.zj=incógnitaj+iyj{\displaystyle z_{j}=x_{j}+iy_{j}}en el plano complejo (es decir, el punto(incógnitaj,yj){\displaystyle (x_{j},y_{j})}dóndei{\displaystyle i}es la unidad imaginaria ). Denotemos comoS=(zjz¯)2{\displaystyle S=\sum {(z_{j}-{\overline {z}})^{2}}}la suma de las diferencias al cuadrado de los puntos de datos con respecto al centroidez¯=1nortezj{\displaystyle {\overline {z}}={\tfrac {1}{n}}\sum z_{j}}(también denotado en coordenadas complejas), que es el punto cuyas ubicaciones horizontales y verticales son los promedios de las de los puntos de datos. Entonces: [ 5 ]

  • SiS=0{\displaystyle S=0}, entonces cada línea que pasa por el centroide es una línea de mejor ajuste ortogonal.
  • SiS0{\displaystyle S\neq 0}, la línea de regresión ortogonal pasa por el centroide y es paralela al vector desde el origen hastaS{\displaystyle {\sqrt {S}}}.

Coolidge proporcionó en 1913 una representación trigonométrica de la línea de regresión ortogonal. [ 6 ] La distancia también se puede calcular utilizando la ecuación más típica de una línea, dada comoy=metroincógnita+k{\displaystyle y=mx+k}.

Solicitud

En el caso de tres puntos no colineales en el plano, el triángulo con estos puntos como vértices tiene una elipse de Steiner única que es tangente a los lados del triángulo en sus puntos medios. El eje mayor de esta elipse cae sobre la línea de regresión ortogonal para los tres vértices. [ 7 ] La cuantificación del ruido celular intrínseco de una célula biológica puede cuantificarse aplicando la regresión de Deming al comportamiento observado de un circuito biológico sintético de dos reporteros . [ 8 ]

Cuando se les pide a los humanos que dibujen una regresión lineal en un diagrama de dispersión adivinando, sus respuestas se acercan más a la regresión ortogonal que a la regresión de mínimos cuadrados ordinarios . [ 9 ]

Versión invariante a la escala

La relación funcional de la media geométrica es un caso de la regresión de Deming donde δ = σ² x / σ² y . Asume que ambas variables tienen la misma fiabilidad , es decir, σ y / σ ε = σ x / σ η . La pendiente resultante es la media geométrica de la pendiente de mínimos cuadrados ordinarios y la pendiente de mínimos cuadrados inversos, lo que facilita su cálculo con las herramientas existentes. Se ha recomendado su uso en biología. [ 10 ] Este método es invariante ante escalamiento, traslación e intercambio de variables, siendo el único método que depende únicamente de los primeros y segundos momentos para poseer esta propiedad. [ 11 ]

regresión de York

La regresión de York extiende la regresión de Deming al permitir errores correlacionados en x e y. [ 12 ]

Véase también

Referencias

Notas
  1. Linnet 1993 .
  2. Cornbleet y Gochman 1979 .
  3. Fuller 1987 , Cap. 1.3.3.
  4. Glaister 2001 .
  5. Minda y Phelps 2008 , Teorema 2.3.
  6. Coolidge 1913 .
  7. Minda y Phelps 2008 , Corolario 2.4.
  8. Quarton 2020 .
  9. Ciccione, Lorenzo; Dehaene, Stanislas (agosto de 2021). "¿Pueden los humanos realizar una regresión mental en un gráfico? Precisión y sesgo en la percepción de diagramas de dispersión" . Psicología Cognitiva . 128 101406. doi : 10.1016/j.cogpsych.2021.101406 .
  10. Xu, Shaoji (2 de octubre de 2014). "Una propiedad de la regresión de media geométrica" . The American Statistician . 68 (4): 277–281 . doi : 10.1080/00031305.2014.962763 . ISSN 0003-1305 . 
  11. Tofallis, Chris (2002). "Ajuste de modelos para múltiples variables minimizando la desviación media geométrica". En Van Huffel, Sabine ; Lemmerling, P. (eds.). Mínimos cuadrados totales y modelado de errores en variables: análisis, algoritmos y aplicaciones . Dordrecht: Kluwer Academic Publ. doi : 10.1007/978-94-017-3552-0 . ISBN 978-1402004766. SSRN 1077322 . 
  12. York, D., Evensen, NM, Martínez, ML y Delgado, JDB: Ecuaciones unificadas para la pendiente, la intersección y los errores estándar de la mejor línea recta, Am. J. Phys., 72, 367–375, https://doi.org/10.1119/1.1632486 , 2004.
Bibliografía
  • Adcock, RJ (1878). "Un problema de mínimos cuadrados" . The Analyst . 5 (2): 53– 54. doi : 10.2307/2635758 . JSTOR 2635758 . 
  • Coolidge, JL (1913). "Dos aplicaciones geométricas de las matemáticas de mínimos cuadrados". The American Mathematical Monthly . 20 (6): 187– 190. doi : 10.2307/2973072 . JSTOR 2973072 . 
  • Cornbleet, PJ; Gochman, N. (1979). "Coeficientes de regresión de mínimos cuadrados incorrectos" . Química clínica . 25 (3): 432– 438. doi : 10.1093/clinchem/25.3.432 . PMID 262186 . 
  • Deming, WE (1943). Ajuste estadístico de datos . Wiley, NY (edición de Dover Publications, 1985). ISBN 0-486-64685-8.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • Fuller, Wayne A. (1987). Modelos de error de medición . John Wiley & Sons, Inc. ISBN 0-471-86187-1.
  • Glaister, P. (2001). "Revisión de los mínimos cuadrados". The Mathematical Gazette . 85 : 104–107 . doi : 10.2307/3620485 . JSTOR 3620485. S2CID 125949467 .  
  • Jensen, Anders Christian (2007). "Regresión de Deming, paquete MethComp" (PDF) . Gentofte, Dinamarca: Centro de Diabetes Steno.
  • Koopmans, TC (1936). Análisis de regresión lineal de series temporales económicas . DeErven F. Bohn, Haarlem, Países Bajos.
  • Kummell, CH (1879). "Reducción de ecuaciones de observación que contienen más de una cantidad observada" . The Analyst . 6 (4): 97– 105. doi : 10.2307/2635646 . JSTOR 2635646 . 
  • Linnet, K. (1993). "Evaluación de procedimientos de regresión para estudios de comparación de métodos" . Química Clínica . 39 (3): 424– 432. doi : 10.1093/clinchem/39.3.424 . PMID 8448852 . 
  • Minda, D .; Phelps, S. (2008). "Triángulos, elipses y polinomios cúbicos". American Mathematical Monthly . 115 (8): 679– 689. doi : 10.1080/00029890.2008.11920581 . MR 2456092. S2CID 15049234 .  
  • Quarton, TG (2020). " Desacoplamiento del ruido de la expresión génica a lo largo del dogma central mediante líneas celulares humanas modificadas genéticamente" . Nucleic Acids Research . 48 (16): 9406– 9413. doi : 10.1093/nar/gkaa668 . PMC 7498316. PMID 32810265 .