
La dilución de la regresión , también conocida como atenuación de la regresión , es el sesgo de la pendiente de la regresión lineal hacia cero (la subestimación de su valor absoluto ), causado por errores en la variable independiente .
Consideremos el ajuste de una línea recta a la relación entre una variable de respuesta y y una variable predictora x , y la estimación de la pendiente de dicha línea. La variabilidad estadística, el error de medición o el ruido aleatorio en la variable y generan incertidumbre en la pendiente estimada, pero no sesgo : en promedio, el procedimiento calcula la pendiente correcta. Sin embargo, la variabilidad, el error de medición o el ruido aleatorio en la variable x generan sesgo en la pendiente estimada (además de imprecisión). Cuanto mayor sea la varianza en la medición de x , más se aproximará la pendiente estimada a cero en lugar de al valor real.

Puede parecer contraintuitivo que el ruido en la variable predictora x induzca un sesgo, pero el ruido en la variable de resultado y no lo haga. Recordemos que la regresión lineal no es simétrica: la línea de mejor ajuste para predecir y a partir de x (la regresión lineal habitual) no es la misma que la línea de mejor ajuste para predecir x a partir de y . [ 1 ]
Corrección de pendiente
La pendiente de regresión y otros coeficientes de regresión se pueden desatenuar de la siguiente manera.
El caso de una variable x fija
El caso en que x es fijo, pero se mide con ruido, se conoce como modelo funcional o relación funcional . [ 2 ] Se puede corregir utilizando mínimos cuadrados totales [ 3 ] y modelos de errores en las variables en general.
El caso de una variable x distribuida aleatoriamente
El caso en que la variable x surge aleatoriamente se conoce como modelo estructural o relación estructural . Por ejemplo, en un estudio médico, los pacientes son reclutados como una muestra de una población, y sus características, como la presión arterial, pueden considerarse como provenientes de una muestra aleatoria .
Bajo ciertas suposiciones (típicamente, suposiciones de distribución normal ) existe una razón conocida entre la pendiente verdadera y la pendiente estimada esperada. Frost y Thompson (2000) revisan varios métodos para estimar esta razón y, por lo tanto, corregir la pendiente estimada. [ 4 ] El término razón de dilución de regresión , aunque no está definido exactamente de la misma manera por todos los autores, se utiliza para este enfoque general, en el que se ajusta la regresión lineal habitual y luego se aplica una corrección. La respuesta a Frost y Thompson por Longford (2001) remite al lector a otros métodos, ampliando el modelo de regresión para reconocer la variabilidad en la variable x, de modo que no surja ningún sesgo. [ 5 ] Fuller (1987) es una de las referencias estándar para evaluar y corregir la dilución de regresión. [ 6 ]
Hughes (1993) muestra que los métodos de razón de dilución de regresión se aplican aproximadamente en modelos de supervivencia . [ 7 ] Rosner (1992) muestra que los métodos de razón se aplican aproximadamente a modelos de regresión logística . [ 8 ] Carroll et al. (1995) dan más detalles sobre la dilución de regresión en modelos no lineales , presentando los métodos de razón de dilución de regresión como el caso más simple de métodos de calibración de regresión , en el que también se pueden incorporar covariables adicionales. [ 9 ]
En general, los métodos para el modelo estructural requieren una estimación de la variabilidad de la variable x. Esto exige mediciones repetidas de la variable x en los mismos individuos, ya sea en un subestudio del conjunto de datos principal o en un conjunto de datos independiente. Sin esta información, no será posible realizar ninguna corrección.
Múltiples variables x
El caso de múltiples variables predictoras sujetas a variabilidad (posiblemente correlacionadas ) ha sido ampliamente estudiado para la regresión lineal y para algunos modelos de regresión no lineal . [ 6 ] [ 9 ] Otros modelos no lineales, como los modelos de riesgos proporcionales para el análisis de supervivencia , se han considerado únicamente con una sola variable predictora sujeta a variabilidad. [ 7 ]
Corrección de correlación
Charles Spearman desarrolló en 1904 un procedimiento para corregir correlaciones por dilución de regresión, [ 10 ] es decir, para "eliminar un coeficiente de correlación del efecto debilitador del error de medición ". [ 11 ]
En medición y estadística , el procedimiento también se denomina corrección de la correlación o corrección de la correlación . [ 12 ] La corrección asegura que el coeficiente de correlación de Pearson entre unidades de datos (por ejemplo, personas) entre dos conjuntos de variables se estime de manera que se tenga en cuenta el error inherente a la medición de dichas variables. [ 13 ]
Formulación
DejarySean los valores verdaderos de dos atributos de alguna persona o unidad estadística . Estos valores son variables en virtud del supuesto de que difieren para diferentes unidades estadísticas en la población . yser estimaciones deyderivado directamente de la observación con error o de la aplicación de un modelo de medición, como el modelo de Rasch . Además, sea
dóndeyson los errores de medición asociados con las estimacionesy.
La correlación estimada entre dos conjuntos de estimaciones es
lo cual, suponiendo que los errores no están correlacionados entre sí y con los verdaderos valores de los atributos, da como resultado
dóndees el índice de separación del conjunto de estimaciones de, que es análogo al alfa de Cronbach ; es decir, en términos de la teoría clásica de pruebas ,es análogo a un coeficiente de fiabilidad. Específicamente, el índice de separación se define de la siguiente manera:
donde el error estándar cuadrático medio de la estimación de la persona proporciona una estimación de la varianza de los errores,Los errores estándar se producen normalmente como un subproducto del proceso de estimación (véase la estimación del modelo de Rasch ).
Por lo tanto, la estimación corregida de la correlación entre los dos conjuntos de estimaciones de parámetros es:
Es decir, la estimación de correlación corregida se obtiene dividiendo la correlación entre las estimaciones por la media geométrica de los índices de separación de ambos conjuntos de estimaciones. Expresada en términos de la teoría clásica de pruebas, la correlación se divide por la media geométrica de los coeficientes de fiabilidad de dos pruebas.
Simplificación a la teoría clásica de las pruebas
Dadas dos variables aleatoriasymedido comoycon correlación mediday una fiabilidad conocida para cada variable,y, la correlación estimada entreycorregido por atenuación es
- .
La precisión con la que se miden las variables afecta la correlación entre X e Y. La corrección por atenuación indica cuál sería la correlación estimada si se pudieran medir X′ e Y′ con una fiabilidad perfecta.
Por lo tanto, siyse consideran mediciones imperfectas de las variables subyacentesycon errores independientes, entoncesestima la verdadera correlación entrey.
Estimación del nivel de ruido
La estimación de la varianza del ruidoa partir de mediciones(y análogamente para) se denomina estimación del nivel de ruido . Se pueden utilizar diversos estimadores para este propósito. De forma equivalente, se puede estimar la fiabilidad o la relación señal-ruido. [ 14 ] [ 15 ]
Aplicabilidad
En la inferencia estadística basada en coeficientes de regresión , es necesaria una corrección para la atenuación de la regresión . Sin embargo, en las aplicaciones de modelado predictivo , la corrección no es necesaria ni apropiada. En la detección de cambios , la corrección sí es necesaria.
Para entender esto, consideremos el error de medición de la siguiente manera. Sea y la variable de resultado, x la verdadera variable predictora y w una observación aproximada de x . Frost y Thompson sugieren, por ejemplo, que x puede ser la presión arterial verdadera a largo plazo de un paciente, y w puede ser la presión arterial observada en una visita clínica particular. [ 4 ] La dilución de la regresión surge si estamos interesados en la relación entre y y x , pero estimamos la relación entre y y w . Debido a que w se mide con variabilidad, la pendiente de una línea de regresión de y sobre w es menor que la línea de regresión de y sobre x . Los métodos estándar pueden ajustar una regresión de y sobre w sin sesgo. Hay sesgo solo si luego usamos la regresión de y sobre w como una aproximación a la regresión de y sobre x. En el ejemplo, suponiendo que las mediciones de presión arterial son igualmente variables en pacientes futuros, nuestra línea de regresión de y sobre w (presión arterial observada) da predicciones insesgadas.
Un ejemplo de una circunstancia en la que se desea una corrección es la predicción de un cambio. Supongamos que se conoce el cambio en x bajo alguna nueva circunstancia: para estimar el cambio probable en una variable de resultado y , se necesita la pendiente de la regresión de y sobre x , no de y sobre w . Esto surge en epidemiología . Para continuar con el ejemplo en el que x denota la presión arterial, tal vez un ensayo clínico a gran escala haya proporcionado una estimación del cambio en la presión arterial bajo un nuevo tratamiento; entonces el posible efecto sobre y , bajo el nuevo tratamiento, debería estimarse a partir de la pendiente en la regresión de y sobre x .
Otra circunstancia es la modelización predictiva, en la que las observaciones futuras también son variables, pero no (en la frase anterior) "igualmente variables". Por ejemplo, si el conjunto de datos actual incluye la presión arterial medida con mayor precisión de la que se suele utilizar en la práctica clínica. Un ejemplo concreto de esto surgió al desarrollar una ecuación de regresión basada en un ensayo clínico, en el que la presión arterial era el promedio de seis mediciones, para su uso en la práctica clínica, donde la presión arterial suele ser una sola medición. [ 16 ]
Todos estos resultados pueden demostrarse matemáticamente, en el caso de una regresión lineal simple que asume distribuciones normales en todo momento (el marco de Frost y Thompson).
Se ha comentado que una corrección mal ejecutada para la dilución de la regresión, en particular cuando se realiza sin comprobar los supuestos subyacentes, puede perjudicar más una estimación que la ausencia de corrección. [ 17 ]
Lecturas adicionales
La dilución de la regresión fue mencionada por primera vez, bajo el nombre de atenuación, por Spearman (1904). [ 18 ] Quienes busquen un tratamiento matemático legible podrían comenzar con Frost y Thompson (2000). [ 4 ]
Véase también
- modelos de errores en las variables
- Cuantización (procesamiento de señales) : una fuente común de error en las variables explicativas o independientes.
Referencias
- ↑ Draper, NR; Smith, H. (1998). Análisis de regresión aplicada (3.ª ed.). John Wiley. pág. 19. ISBN 0-471-17082-8.
- ↑ Riggs, DS; Guarnieri, JA; et al. (1978). "Ajuste de líneas rectas cuando ambas variables están sujetas a error". Life Sciences . 22 ( 13–15 ): 1305–60 . doi : 10.1016/0024-3205(78)90098-x . PMID 661506 .
- ↑ Golub, Gene H.; van Loan, Charles F. (1980). "An Analysis of the Total Least Squares Problem". SIAM Journal on Numerical Analysis . 17 (6). Society for Industrial & Applied Mathematics (SIAM): 883– 893. doi : 10.1137/0717073 . hdl : 1813/6251 . ISSN 0036-1429 .
- 1 2 3 Frost, C. y S. Thompson (2000). "Corrección del sesgo de dilución de la regresión: comparación de métodos para una sola variable predictora". Journal of the Royal Statistical Society Series A 163: 173–190.
- ↑ Longford, NT (2001). "Correspondencia" . Journal of the Royal Statistical Society, Serie A. 164 ( 3): 565. doi : 10.1111/1467-985x.00219 . S2CID 247674444 .
- 1 2 Fuller, WA (1987). Modelos de error de medición . Nueva York: Wiley. ISBN 978-0-470-31733-4.
- 1 2 Hughes, MD (1993). "Dilución de la regresión en el modelo de riesgos proporcionales". Biometrics . 49 (4): 1056– 1066. doi : 10.2307/2532247 . JSTOR 2532247 . PMID 8117900 .
- ↑ Rosner, B.; Spiegelman, D.; et al. (1992). "Corrección de las estimaciones de riesgo relativo de regresión logística y los intervalos de confianza para el error de medición aleatorio dentro de la persona". American Journal of Epidemiology . 136 (11): 1400– 1403. doi : 10.1093/oxfordjournals.aje.a116453 . PMID 1488967 .
- 1 2 Carroll, RJ, Ruppert, D., y Stefanski, LA (1995). Error de medición en modelos no lineales. Nueva York, Wiley.
- ↑ Spearman, C. (1904). "La prueba y medición de la asociación entre dos cosas" (PDF) . The American Journal of Psychology . 15 (1). University of Illinois Press: 72– 101. doi : 10.2307/1412159 . ISSN 0002-9556 . JSTOR 1412159. Recuperado el 10 de julio de 2021 .
- ↑ Jensen, AR (1998). El factor g: La ciencia de la capacidad mental . Evolución humana, comportamiento e inteligencia. Praeger. ISBN 978-0-275-96103-9.
- ↑ Osborne, Jason W. (27 de mayo de 2003). "Tamaños del efecto y la desatenuación de los coeficientes de correlación y regresión: lecciones de la psicología educativa" . Practical Assessment, Research, and Evaluation . 8 (1). doi : 10.7275/0k9h-tq64 . Recuperado el 10 de julio de 2021 .
- ↑ Franks, Alexander; Airoldi, Edoardo; Slavov, Nikolai (2017-05-08). "Regulación postranscripcional en tejidos humanos" . PLOS Computational Biology . 13 (5 ) e1005535. doi : 10.1371/journal.pcbi.1005535 . ISSN 1553-7358 . PMC 5440056. PMID 28481885 .
- ↑ "Cap. 1 Introducción a la estimación" (PDF) .
- ↑ Moriya, N. (2008). "Análisis conjunto óptimo multivariado relacionado con el ruido en procesos estocásticos longitudinales". En Yang, Fengshan (ed.). Avances en modelado matemático aplicado . Nova Science Publishers, Inc. pp. 223–260 . ISBN 978-1-60021-976-4.
- ↑ Stevens, RJ; Kothari, V.; Adler, AI; Stratton, IM; Holman, RR (2001). "Apéndice de "El motor de riesgo UKPDS: un modelo para el riesgo de enfermedad coronaria en la diabetes tipo 2 UKPDS 56)". Clinical Science . 101 : 671–679 . doi : 10.1042/cs20000335 .
- ↑ Davey Smith, G. ; Phillips, AN (1996). "Inflación en epidemiología: 'La prueba y medición de la asociación entre dos cosas' revisitada" . British Medical Journal . 312 (7047): 1659– 1661. doi : 10.1136/bmj.312.7047.1659 . PMC 2351357 . PMID 8664725 .
- ↑ Spearman, C (1904). "La prueba y medición de la asociación entre dos cosas" . American Journal of Psychology . 15 (1): 72– 101. doi : 10.2307/1412159 . JSTOR 1412159 .
- Modelos de regresión