Articulo de referencia

Logit ordenado

En estadística , el modelo logit ordinal o regresión logística de probabilidades proporcionales es un modelo de regresión ordinal —es decir, un modelo de regresión para variable...

En estadística , el modelo logit ordinal o regresión logística de probabilidades proporcionales es un modelo de regresión ordinal —es decir, un modelo de regresión para variables dependientes ordinales— considerado por primera vez por Peter McCullagh . [ 1 ] Por ejemplo, si una pregunta de una encuesta debe responderse eligiendo entre "malo", "regular", "bueno", "muy bueno" y "excelente" , y el propósito del análisis es ver qué tan bien se puede predecir esa respuesta a partir de las respuestas a otras preguntas, algunas de las cuales pueden ser cuantitativas, entonces se puede utilizar la regresión logística ordinal. Puede considerarse como una extensión del modelo de regresión logística que se aplica a variables dependientes dicotómicas , permitiendo más de dos categorías de respuesta (ordenadas).

El modelo y el supuesto de probabilidades proporcionales

El modelo solo se aplica a datos que cumplen con el supuesto de probabilidades proporcionales , cuyo significado se puede ejemplificar de la siguiente manera. Supongamos que hay cinco resultados: "malo", "regular", "bueno", "muy bueno" y "excelente". Suponemos que las probabilidades de estos resultados están dadas por p 1 ( x ), p 2 ( x ), p 3 ( x ) , p 4 ( x ), p 5 ( x ), todas las cuales son funciones de alguna(s) variable(s) independiente(s) x . Entonces, para un valor fijo de x , los logaritmos de las probabilidades (no los logaritmos de las probabilidades) de responder de ciertas maneras son:

pobre: registropag1(incógnita)pag2(incógnita)+pag3(incógnita)+pag4(incógnita)+pag5(incógnita),pobre o regular: registropag1(incógnita)+pag2(incógnita)pag3(incógnita)+pag4(incógnita)+pag5(incógnita),pobre, regular o bueno: registropag1(incógnita)+pag2(incógnita)+pag3(incógnita)pag4(incógnita)+pag5(incógnita),malo, regular, bueno o muy bueno: registropag1(incógnita)+pag2(incógnita)+pag3(incógnita)+pag4(incógnita)pag5(incógnita){\displaystyle {\begin{aligned}{\text{malo: }}&\log {\frac {p_{1}(x)}{p_{2}(x)+p_{3}(x)+p_{4}(x)+p_{5}(x)}},\\[8pt]{\text{malo o regular: }}&\log {\frac {p_{1}(x)+p_{2}(x)}{p_{3}(x)+p_{4}(x)+p_{5}(x)}},\\[8pt]{\text{malo, regular o bueno: }}&\log {\frac {p_{1}(x)+p_{2}(x)+p_{3}(x)}{p_{4}(x)+p_{5}(x)}},\\[8pt]{\text{malo, regular, bueno o muy bueno: }}&\log {\frac {p_{1}(x)+p_{2}(x)+p_{3}(x)+p_{4}(x)}{p_{5}(x)}}\end{aligned}}}

El supuesto de probabilidades proporcionales establece que los números que se suman a cada uno de estos logaritmos para obtener el siguiente son los mismos independientemente de x . En otras palabras, la diferencia entre el logaritmo de las probabilidades de tener mala o regular salud menos el logaritmo de las probabilidades de tener mala salud es la misma independientemente de x ; de manera similar, el logaritmo de las probabilidades de tener mala, regular o buena salud menos el logaritmo de las probabilidades de tener mala o regular salud es la misma independientemente de x ; etc. [ 2 ]

Ejemplos de categorías de respuesta de orden múltiple incluyen calificaciones de bonos, encuestas de opinión con respuestas que van desde "totalmente de acuerdo" hasta "totalmente en desacuerdo", niveles de gasto estatal en programas gubernamentales (alto, medio o bajo), el nivel de cobertura de seguro elegido (ninguno, parcial o completo) y situación laboral (desempleado, empleado a tiempo parcial o empleado a tiempo completo). [ 3 ]

El logit ordenado se puede derivar de un modelo de variables latentes, similar al del que se puede derivar la regresión logística binaria . Supongamos que el proceso subyacente que se va a caracterizar es

y=incógnitaTβ+ε,{\displaystyle y^{*}=\mathbf {x} ^{\mathsf {T}}\beta +\varepsilon ,\,}

dóndey{\displaystyle y^{*}}es una variable dependiente no observada (quizás el nivel exacto de acuerdo con la afirmación propuesta por el encuestador);incógnita{\displaystyle \mathbf {x} }es el vector de variables independientes;ε{\displaystyle \varepsilon }es el término de error , que se supone sigue una distribución logística estándar; yβ{\displaystyle \beta }es el vector de coeficientes de regresión que deseamos estimar. Supongamos además que, si bien no podemos observary{\displaystyle y^{*}}En cambio, solo podemos observar las categorías de respuesta.

y={0si yμ1,1si μ1<yμ2,2si μ2<yμ3,nortesi μnorte<y{\displaystyle y={\begin{cases}0&{\text{si }}y^{*}\leq \mu _{1},\\1&{\text{si }}\mu _{1}<y^{*}\leq \mu _{2},\\2&{\text{si }}\mu _{2}<y^{*}\leq \mu _{3},\\\vdots \\N&{\text{si }}\mu _{N}<y^{*}\end{cases}}}

donde los parámetrosμi{\displaystyle \mu _{i}}son los puntos finales impuestos externamente de las categorías observables. Luego, la técnica logit ordenada utilizará las observaciones en y , que son una forma de datos censurados en y* , para ajustar el vector de parámetros.β{\displaystyle \beta }.

Ajuste del modelo

Como ocurre con la mayoría de los modelos estadísticos, la estimación de máxima verosimilitud o la inferencia bayesiana son las formas más comunes de identificar los parámetros. [ 4 ] Los valores estimados indican la dirección y la magnitud del efecto de cada variable independiente sobre la probabilidad de que la variable dependiente se sitúe en una categoría superior.

Aplicaciones

Las regresiones logísticas ordinales se han utilizado en múltiples campos, como el transporte, [ 5 ] el marketing [ 6 ] o la gestión de desastres. [ 7 ]

En la investigación clínica , el efecto de un fármaco en un paciente puede modelarse mediante regresión ordinal. Las variables independientes pueden incluir el uso o no uso del fármaco, así como variables de control como datos demográficos e información del historial médico. La variable dependiente podría clasificarse en la siguiente lista: curación completa, mejoría de los síntomas, sin cambios, empeoramiento de los síntomas o fallecimiento.

Otro ejemplo de aplicación son los ítems tipo Likert comúnmente empleados en la investigación mediante encuestas, donde los encuestados califican su grado de acuerdo en una escala ordinal (por ejemplo, de "Totalmente en desacuerdo" a "Totalmente de acuerdo"). El modelo logit ordinal proporciona un ajuste adecuado a estos datos, preservando el orden de las opciones de respuesta sin hacer suposiciones sobre las distancias de intervalo entre las opciones. [ 8 ]

Véase también

Referencias

  1. ^ McCullagh, Peter (1980). "Modelos de regresión para datos ordinales". Revista de la Real Sociedad de Estadística . Serie B (Metodológica). 42 (2): 109– 142. doi : 10.1111/j.2517-6161.1980.tb01109.x . JSTOR 2984952 . 
  2. Greene, William H. (2012). Análisis econométrico (Séptima ed.). Boston: Pearson Education. pp. 827–831 . ISBN   978-0-273-75356-8.
  3. Greene, William H. (2012). Análisis econométrico (Séptima ed.). Boston: Pearson Education. pp. 824–827 . ISBN   978-0-273-75356-8.
  4. Greene, William H.; Hensher, David A. (2010-04-08). Modeling Ordered Choices: A Primer . Cambridge University Press. ISBN 978-1-139-48595-1.
  5. dell'Olio, Luigi; Ibeas, Angel; Cecín, Patricia (2010-11-01). "Modelado de la percepción del usuario sobre la calidad del transporte en autobús" . Transport Policy . 17 (6): 388– 397. doi : 10.1016/j.tranpol.2010.04.006 . ISSN 0967-070X . 
  6. Katahira, Hotaka (febrero de 1990). "Mapeo perceptual mediante análisis logit ordenado" . Marketing Science . 9 (1): 1– 17. doi : 10.1287/mksc.9.1.1 . ISSN 0732-2399 . 
  7. Lovreglio, Ruggiero; Kuligowski, Erica; Walpole, Emily; Link, Eric; Gwynne, Steve (2020-11-01). "Calibración del modelo de decisión sobre incendios forestales mediante modelado de elección híbrida" . Revista Internacional de Reducción del Riesgo de Desastres . 50 101770. doi : 10.1016/j.ijdrr.2020.101770 . ISSN 2212-4209 . 
  8. Liddell, T; Kruschke, J (2018). "Análisis de datos ordinales con modelos métricos: ¿Qué podría salir mal?" (PDF) . Journal of Experimental Social Psychology . 79 : 328–348 . doi : 10.1016/j.jesp.2018.08.009 .

Lecturas adicionales

  • Becker, William E.; Kennedy, Peter E. (1992). "Una exposición gráfica del probit ordenado". Teoría econométrica . 8 (1): 127– 131. doi : 10.1017/S0266466600010781 .
  • Gelman, Andrew ; Hill, Jennifer (2007). Análisis de datos mediante modelos de regresión y multinivel/jerárquicos . Nueva York: Cambridge University Press. pp. 119–124 . ISBN  978-0-521-68689-1.
  • Hardin, James; Hilbe, Joseph (2007). Modelos lineales generalizados y extensiones (2.ª  ed.). College Station: Stata Press. ISBN 978-1-59718-014-6.{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace )
  • Woodward, Mark (2005). Epidemiología: Diseño de estudios y análisis de datos (2.ª  ed.). Chapman & Hall/CRC. ISBN 978-1-58488-415-6.
  • Wooldridge, Jeffrey (2010). Análisis econométrico de datos de sección transversal y de panel (Segunda  edición). Cambridge: MIT Press. pp. 643–666 . ISBN  978-0-262-23258-6.
  • Simon, Steve (22 de septiembre de 2004). "Tamaño de la muestra para un resultado ordinal" . ESTADÍSTICA - El intento de Steve de enseñar estadística . Recuperado el 22 de agosto de 2014 .
  • Rodríguez, Germán. "Modelos Logit pedidos" . Universidad de Princeton .