En estadística , la regresión ponderada unitaria es una versión simplificada y robusta ( Wainer y Thissen, 1976) del análisis de regresión múltiple donde solo se estima el término de intersección. Es decir, ajusta un modelo.
donde cada uno de losson variables binarias , posiblemente multiplicadas por un peso arbitrario.
Compárese esto con el modelo de regresión múltiple más común, donde cada predictor tiene su propio coeficiente estimado:
En las ciencias sociales , la regresión ponderada unitaria se utiliza a veces para la clasificación binaria , es decir, para predecir una respuesta de sí o no dondeindica "no","Sí". Es más fácil de interpretar que la regresión lineal múltiple (conocida como análisis discriminante lineal en el caso de clasificación).
Pesos unitarios
La regresión ponderada unitaria es un método de regresión robusta que consta de tres pasos. Primero, se seleccionan los predictores de la variable de respuesta; idealmente, esta selección debería tener buenas razones empíricas o teóricas. Segundo, los predictores se convierten a una forma estándar. Finalmente, se suman los predictores, y esta suma se denomina variable, la cual se utiliza como predictor de la variable de respuesta.
Método de Burgess
El método Burgess fue presentado por primera vez por el sociólogo Ernest W. Burgess en un estudio de 1928 para determinar el éxito o el fracaso de los reclusos puestos en libertad condicional. Primero, seleccionó 21 variables que se creía que estaban asociadas con el éxito de la libertad condicional. Luego, convirtió cada predictor a la forma estándar de cero o uno (Burgess, 1928). Cuando los predictores tenían dos valores, el valor asociado con el resultado objetivo se codificó como uno. Burgess seleccionó el éxito en la libertad condicional como resultado objetivo, por lo que un predictor como un historial de robo se codificó como "sí" = 0 y "no" = 1. Estos valores codificados se sumaron para crear una puntuación predictiva, de modo que las puntuaciones más altas predecían una mayor probabilidad de éxito. Las puntuaciones podían oscilar entre cero (ningún predictor de éxito) y 21 (los 21 predictores se calificaron como predictores de éxito).
Para predictores con más de dos valores, el método Burgess selecciona un punto de corte basado en un juicio subjetivo. Por ejemplo, un estudio que utilizó el método Burgess (Gottfredson y Snyder, 2005) seleccionó como predictor el número de quejas por conducta delictiva. Con el fracaso en la libertad condicional como resultado objetivo, el número de quejas se codificó de la siguiente manera: "de cero a dos quejas" = 0, y "tres o más quejas" = 1 (Gottfredson y Snyder, 2005, p. 18).
Método de Kerby
El método de Kerby es similar al de Burgess, pero difiere en dos aspectos. En primer lugar, mientras que el método de Burgess utiliza un juicio subjetivo para seleccionar un punto de corte para un predictor multivaluado con un resultado binario, el método de Kerby utiliza el análisis de árboles de clasificación y regresión ( CART ). De esta manera, la selección del punto de corte no se basa en un juicio subjetivo, sino en un criterio estadístico, como el punto donde el valor de chi-cuadrado alcanza su máximo.
La segunda diferencia radica en que, mientras que el método de Burgess se aplica a un resultado binario, el método de Kerby puede aplicarse a un resultado multivaluado, ya que el análisis CART puede identificar puntuaciones de corte en estos casos, utilizando un criterio como el punto donde el valor t alcanza su máximo. Dado que el análisis CART no solo es binario, sino también recursivo, el resultado puede ser que una variable predictora se divida nuevamente, generando dos puntuaciones de corte. La forma estándar para cada predictor es que se suma una puntuación de uno cuando el análisis CART crea una partición.
Un estudio (Kerby, 2003) seleccionó como predictores los cinco rasgos de personalidad del modelo de los Cinco Grandes , prediciendo una medida multivaluada de ideación suicida . A continuación, las puntuaciones de personalidad se convirtieron a formato estándar mediante el análisis CART. Cuando el análisis CART arrojó una partición, el resultado fue similar al método de Burgess, en el que el predictor se codificó como cero o uno. Sin embargo, para la medida de neuroticismo, el resultado fueron dos puntuaciones de corte. Dado que las puntuaciones de neuroticismo más altas se correlacionaron con un mayor pensamiento suicida, las dos puntuaciones de corte dieron lugar a la siguiente codificación: "Neuroticismo bajo" = 0, "Neuroticismo moderado" = 1, "Neuroticismo alto" = 2 (Kerby, 2003).
método de puntuación z
Se puede aplicar otro método cuando las variables predictoras se miden en una escala continua. En tal caso, cada variable predictora se puede convertir en una puntuación estándar , o puntuación z , de modo que todas las variables predictoras tengan una media de cero y una desviación estándar de uno. Con este método de regresión ponderada unitaria, la variable es la suma de las puntuaciones z (por ejemplo, Dawes, 1979; Bobko, Roth y Buster, 2007).
Revisión de literatura
El primer estudio empírico que utilizó regresión ponderada por unidades se considera ampliamente un estudio de 1928 realizado por el sociólogo Ernest W. Burgess . Utilizó 21 variables para predecir el éxito o el fracaso en la libertad condicional, y los resultados sugieren que las ponderaciones por unidades son una herramienta útil para tomar decisiones sobre qué reclusos conceder la libertad condicional. De los reclusos con las mejores puntuaciones, el 98 % logró la libertad condicional; y de los que obtuvieron las peores puntuaciones, solo el 24 % la logró (Burgess, 1928).
Los aspectos matemáticos de la regresión con ponderación unitaria fueron analizados por primera vez en 1938 por Samuel Stanley Wilks , un destacado estadístico con especial interés en el análisis multivariante . Wilks describió cómo se podían utilizar las ponderaciones unitarias en contextos prácticos, cuando no se disponía de datos para estimar los coeficientes beta. Por ejemplo, una universidad pequeña podría querer seleccionar a los mejores estudiantes para su admisión. Sin embargo, es posible que no cuente con los recursos económicos para recopilar datos y realizar un análisis de regresión múltiple estándar. En este caso, la universidad podría utilizar varios predictores: calificaciones de bachillerato, puntuaciones del SAT y valoraciones de los profesores. Wilks (1938) demostró matemáticamente por qué las ponderaciones unitarias deberían funcionar bien en la práctica.
Frank Schmidt (1971) realizó un estudio de simulación sobre pesos unitarios. Sus resultados demostraron que Wilks tenía razón y que los pesos unitarios tienden a funcionar bien en simulaciones de estudios prácticos.
Robyn Dawes (1979) analizó el uso de ponderaciones unitarias en estudios aplicados, destacando la robustez y la belleza de los modelos con ponderación unitaria. Jacob Cohen también abordó el valor de las ponderaciones unitarias y señaló su utilidad práctica. De hecho, escribió: «En la práctica, la mayoría de las veces, nos conviene más usar ponderaciones unitarias» (Cohen, 1990, p. 1306).
Dave Kerby (2003) demostró que los pesos unitarios se comparan bien con la regresión estándar, mediante un estudio de validación cruzada ; es decir, derivó los coeficientes beta en una muestra y los aplicó a una segunda muestra. La variable de interés fue el pensamiento suicida y las variables predictoras fueron rasgos de personalidad generales. En la muestra de validación cruzada, la correlación entre personalidad y pensamiento suicida fue ligeramente más fuerte con la regresión ponderada unitariamente ( r = 0,48) que con la regresión múltiple estándar ( r = 0,47).
Gottfredson y Snyder (2005) compararon el método de Burgess de regresión ponderada unitaria con otros métodos, con una muestra de construcción de N = 1924 y una muestra de validación cruzada de N = 7552. Utilizando el coeficiente de correlación biserial puntual , el tamaño del efecto en la muestra de validación cruzada para el modelo de ponderaciones unitarias fue r = 0,392, que fue algo mayor que para la regresión logística ( r = 0,368) y el análisis de atributos predictivos ( r = 0,387), y menor que la regresión múltiple solo en el tercer lugar decimal ( r = 0,397).
En una revisión de la literatura sobre ponderaciones unitarias, Bobko, Roth y Buster (2007) señalaron que "las ponderaciones unitarias y las ponderaciones de regresión se desempeñan de manera similar en términos de la magnitud de la correlación múltiple validada cruzadamente, y los estudios empíricos han confirmado este resultado a lo largo de varias décadas" (p. 693).
Andreas Graefe aplicó un enfoque de ponderación igual a nueve modelos de regresión múltiple establecidos para pronosticar las elecciones presidenciales de EE. UU . En las diez elecciones celebradas entre 1976 y 2012, los predictores con igual ponderación redujeron el error de pronóstico de los modelos de regresión originales en un promedio del cuatro por ciento. Un modelo de ponderación igual que incluye todas las variables proporcionó pronósticos calibrados que redujeron el error del modelo de regresión más preciso en un 29 por ciento. [ 1 ]
Ejemplo
Un ejemplo puede aclarar cómo las unidades de peso pueden ser útiles en la práctica.
Brenna Bry y sus colegas (1982) abordaron la cuestión de las causas del consumo de drogas en adolescentes. Investigaciones previas habían utilizado la regresión múltiple; con este método, es natural buscar el mejor predictor, aquel con el coeficiente beta más alto. Bry y sus colegas observaron que un estudio anterior había encontrado que el consumo temprano de alcohol era el mejor predictor. Otro estudio había encontrado que el distanciamiento de los padres era el mejor predictor. Un tercer estudio había encontrado que las bajas calificaciones escolares eran el mejor predictor. La falta de replicación era claramente un problema, un problema que podría deberse a la fluctuación de los coeficientes beta.
Bry y sus colegas propusieron un enfoque diferente: en lugar de buscar el mejor predictor, analizaron la cantidad de predictores. En otras palabras, asignaron un peso unitario a cada predictor. Su estudio incluyó seis predictores: 1) bajas calificaciones escolares, 2) falta de afiliación religiosa, 3) inicio temprano del consumo de alcohol, 4) malestar psicológico, 5) baja autoestima y 6) distanciamiento de los padres. Para convertir los predictores a formato estándar, cada factor de riesgo se puntuó como ausente (cero) o presente (uno). Por ejemplo, la codificación para las bajas calificaciones escolares fue la siguiente: "C o superior" = 0, "D o F" = 1. Los resultados mostraron que la cantidad de factores de riesgo era un buen predictor del consumo de drogas: los adolescentes con más factores de riesgo tenían mayor probabilidad de consumir drogas.
El modelo utilizado por Bry y sus colegas postula que los consumidores de drogas no difieren de manera significativa de quienes no las consumen. Más bien, difieren en la cantidad de problemas que deben afrontar. «La cantidad de factores con los que un individuo debe lidiar es más importante que la naturaleza exacta de esos factores» (p. 277). Dado este modelo, la regresión ponderada uniformemente es un método de análisis apropiado.
pesos beta
En la regresión múltiple estándar, cada predictor se multiplica por un número llamado coeficiente beta , coeficiente de regresión o coeficiente de regresión ponderado (denotado βW o BW). [ 2 ] La predicción se obtiene sumando estos productos junto con una constante. Cuando los pesos se eligen para dar la mejor predicción según algún criterio, el modelo se denomina modelo lineal propio . Por lo tanto, la regresión múltiple es un modelo lineal propio. En cambio, la regresión con ponderación unitaria se denomina modelo lineal impropio.
Especificación del modelo
La regresión múltiple estándar se basa en el supuesto de que todos los predictores relevantes del resultado están incluidos en el modelo de regresión. Este supuesto se denomina especificación del modelo. Se dice que un modelo está especificado cuando incluye todos los predictores relevantes y excluye los irrelevantes. En la práctica, es raro que un estudio pueda determinar todos los predictores relevantes a priori. En este caso, los modelos no están especificados y las estimaciones de los coeficientes beta sufren sesgo por variables omitidas. Es decir, los coeficientes beta pueden variar de una muestra a otra, situación que a veces se denomina problema de los coeficientes beta fluctuantes. Es este problema de los coeficientes beta fluctuantes lo que convierte a la regresión ponderada unitaria en un método útil.
Véase también
Referencias
- ↑ Graefe, Andreas (2015). "Mejora de pronósticos mediante predictores con ponderación igual" (PDF) . Journal of Business Research . 68 (8). Elsevier: 1792–1799 . doi : 10.1016/j.jbusres.2015.03.038 .
- ↑ Ziglari, Leily (2017). "Interpretación de los resultados de la regresión múltiple: pesos β y coeficientes de estructura" (PDF) . General Linear Model Journal . 43 (1). GLMJ: 13– 22. doi : 10.31523/glmj.043002.002 .
- Bobko, P., Roth, PL, & Buster, MA (2007). «La utilidad de las ponderaciones unitarias en la creación de puntuaciones compuestas: una revisión de la literatura, su aplicación a la validez de contenido y un metaanálisis». Organizational Research Methods , volumen 10, páginas 689-709. doi : 10.1177/1094428106294734
- Bry, BH; McKeon, P.; Pandina, RJ (1982). "Grado de consumo de drogas en función del número de factores de riesgo". Journal of Abnormal Psychology . 91 (4): 273– 279. doi : 10.1037/0021-843X.91.4.273 . PMID 7130523 .
- Burgess, EW (1928). «Factores que determinan el éxito o el fracaso en la libertad condicional». En AA Bruce (Ed.), El funcionamiento de la ley de sentencia indeterminada y la libertad condicional en Illinois (págs. 205-249). Springfield, Illinois: Junta Estatal de Libertad Condicional de Illinois. Google Books
- Cohen, Jacob. (1990). «Cosas que he aprendido (hasta ahora)». American Psychologist , volumen 45, páginas 1304-1312. doi : 10.1037/0003-066X.45.12.1304
- Dawes, Robyn M. (1979). «La robusta belleza de los modelos lineales impropios en la toma de decisiones». American Psychologist , volumen 34, páginas 571-582. doi : 10.1037/0003-066X.34.7.571 . PDF archivado
- Gottfredson, DM, & Snyder, HN (julio de 2005). Las matemáticas de la clasificación de riesgos: Transformando datos en instrumentos válidos para tribunales de menores . Pittsburgh, Pensilvania: Centro Nacional de Justicia Juvenil. NCJ 209158. Eric.ed.gov pdf
- Kerby, Dave S. (2003). «Análisis CART con regresión ponderada unitaria para predecir la ideación suicida a partir de los rasgos del modelo de los Cinco Grandes». Personality and Individual Differences , volumen 35, páginas 249-261. doi : 10.1016/S0191-8869(02)00174-5
- Schmidt, Frank L. (1971). "La eficiencia relativa de la regresión y los pesos predictores unitarios simples en psicología diferencial aplicada". Educational and Psychological Measurement , volumen 31, páginas 699-714. doi : 10.1177/001316447103100310
- Wainer, H., & Thissen, D. (1976). Tres pasos hacia la regresión robusta. Psychometrika , volumen 41(1), páginas 9–34. doi : 10.1007/BF02291695
- Wilks, SS (1938). "Sistemas de ponderación para funciones lineales de variables correlacionadas cuando no hay variable dependiente". Psychometrika . 3 : 23–40 . doi : 10.1007/BF02287917 .
Lecturas adicionales
- Dana, J., & Dawes, RM (2004). «La superioridad de las alternativas simples a la regresión para predicciones en ciencias sociales». Journal of Educational and Behavioral Statistics , volumen 29(3), páginas 317-331. doi : 10.3102/10769986029003317
- Dawes, RM, & Corrigan, B. (1974). Modelos lineales en la toma de decisiones. Psychological Bulletin , volumen 81, páginas 95–106. doi : 10.1037/h0037613
- Einhorn, HJ, & Hogarth, RM (1975). Esquemas de ponderación de unidades para la toma de decisiones. Organizational Behavior and Human Performance , volumen 13(2), páginas 171-192. doi : 10.1016/0030-5073(75)90044-6
- Hakeem, M. (1948). La validez del método Burgess de predicción de la libertad condicional. American Journal of Sociology , volumen 53(5), páginas 376-386. JSTOR
- Newman, JR, Seaver, D., Edwards, W. (1976). Esquemas de ponderación unitaria versus diferencial para la toma de decisiones: Un método de estudio y algunos resultados preliminares. Los Ángeles, CA: Social Science Research Institute. PDF archivado
- Raju, NS, Bilgic, R., Edwards, JE, Fleer, PF (1997). Revisión metodológica: Estimación de la validez poblacional y la validez cruzada, y el uso de ponderaciones iguales en la predicción. Applied Psychological Measurement , volumen 21(4), páginas 291-305. doi : 10.1177/01466216970214001
- Ree, MJ, Carretta, TR y Earles, JA (1998). «En las decisiones de arriba hacia abajo, la ponderación de variables no importa: una consecuencia del teorema de Wilk». Organizational Research Methods , volumen 1(4), páginas 407-420. doi : 10.1177/109442819814003
- Wainer, Howard (1976). "Estimación de coeficientes en modelos lineales: no importa" (PDF) . Psychological Bulletin . 83 (2): 213. doi : 10.1037/0033-2909.83.2.213 .PDF archivado
- Wainer, H. (1978). Sobre la sensibilidad de la regresión y los regresores. Psychological Bulletin , volumen 85(2), páginas 267-273. doi : 10.1037/0033-2909.85.2.267
Enlaces externos
- Blog de Chis Stucchio : Por qué una lista de pros y contras es un 75 % tan buena como tu sofisticado algoritmo de aprendizaje automático .
- Análisis de regresión