Articulo de referencia

Regresión ordinal

En estadística , la regresión ordinal , también llamada clasificación ordinal , es un tipo de análisis de regresión utilizado para predecir una variable ordinal , es decir, una ...

En estadística , la regresión ordinal , también llamada clasificación ordinal , es un tipo de análisis de regresión utilizado para predecir una variable ordinal , es decir, una variable cuyo valor existe en una escala arbitraria donde solo el orden relativo entre diferentes valores es significativo. Puede considerarse un problema intermedio entre la regresión y la clasificación . [ 1 ] [ 2 ] Ejemplos de regresión ordinal son el logit ordenado y el probit ordenado . La regresión ordinal aparece con frecuencia en las ciencias sociales , por ejemplo, en el modelado de los niveles de preferencia humana (en una escala de, digamos, 1 a 5 para "muy malo" a "excelente"), así como en la recuperación de información . En aprendizaje automático , la regresión ordinal también puede llamarse aprendizaje de clasificación . [ 3 ] [ a ]

Modelos lineales para regresión ordinal

La regresión ordinal se puede realizar utilizando un modelo lineal generalizado (GLM) que ajusta tanto un vector de coeficientes como un conjunto de umbrales a un conjunto de datos. Supongamos que tenemos un conjunto de observaciones, representadas por vectores de longitud p x 1 a x n , con respuestas asociadas y 1 a y n , donde cada y i es una variable ordinal en una escala de 1, ..., K . Para simplificar, y sin pérdida de generalidad, asumimos que y es un vector no decreciente, es decir, y i{\displaystyle \leq }y i+1 . A estos datos, se ajusta un vector de coeficientes de longitud p w y un conjunto de umbrales θ 1 , ..., θ K −1 con la propiedad de que θ 1 < θ 2 < ... < θ K −1 . Este conjunto de umbrales divide la recta numérica real en K segmentos disjuntos, que corresponden a los K niveles de respuesta.

El modelo ahora puede formularse como

Pr(yiincógnita)=σ(θiwincógnita){\displaystyle \Pr(y\leq i\mid \mathbf {x} )=\sigma (\theta _ {i}-\mathbf {w} \cdot \mathbf {x} )}

o bien, la probabilidad acumulada de que la respuesta y sea como máximo i viene dada por una función σ (la función de enlace inversa ) aplicada a una función lineal de x . Existen varias opciones para σ ; la función logística

σ(θiwincógnita)=11+mi(θiwincógnita){\displaystyle \sigma (\theta _ {i}-\mathbf {w} \cdot \mathbf {x} )={\frac {1}{1+e^{-(\theta _ {i}-\mathbf {w} \cdot \mathbf {x} )}}}}

da como resultado el modelo logit ordenado , mientras que usar la función de distribución acumulada de la distribución normal estándar da como resultado el modelo probit ordenado . Una tercera opción es usar una función exponencial.

σ(θiwincógnita)=1exp(exp(θiwincógnita)){\displaystyle \sigma (\theta _ {i}-\mathbf {w} \cdot \mathbf {x} )=1-\exp(-\exp(\theta _ {i}-\mathbf {w} \cdot \mathbf {x} ))}

lo que da lugar al modelo de riesgos proporcionales . [ 4 ]

modelo de variables latentes

La versión probit del modelo anterior se puede justificar asumiendo la existencia de una variable latente de valor real (cantidad no observada) y* , determinada por [ 5 ].

y=wincógnita+ε{\displaystyle y^{*}=\mathbf {w} \cdot \mathbf {x} +\varepsilon }

donde ε se distribuye normalmente con media cero y varianza unitaria, condicionada a x . La variable de respuesta y resulta de una "medición incompleta" de y* , donde solo se determina el intervalo en el que cae y* :

y={1si  yθ1,2si  θ1<yθ2,3si  θ2<yθ3Ksi  θK1<y.{\displaystyle y={\begin{cases}1&{\text{si}}~~y^{*}\leq \theta _{1},\\2&{\text{si}}~~\theta _{1}<y^{*}\leq \theta _{2},\\3&{\text{si}}~~\theta _{2}<y^{*}\leq \theta _{3}\\\vdots \\K&{\text{si}}~~\theta _{K-1}<y^{*}.\end{cases}}}

Definiendo θ 0 = -∞ y θ K = ∞ , lo anterior se puede resumir como y = k si y solo si θ k −1 < y * ≤ θ k .

A partir de estas suposiciones, se puede derivar la distribución condicional de y como [ 5 ].

PAG(y=kincógnita)=PAG(θk1<yθkincógnita)=PAG(θk1<wincógnita+εθk)=Φ(θkwincógnita)Φ(θk1wincógnita){\displaystyle {\begin{aligned}P(y=k\mid \mathbf {x} )&=P(\theta _{k-1}<y^{*}\leq \theta _{k}\mid \mathbf {x} )\\&=P(\theta _{k-1}<\mathbf {w} \cdot \mathbf {x} +\varepsilon \leq \theta _{k})\\&=\Phi (\theta _{k}-\mathbf {w} \cdot \mathbf {x} )-\Phi (\theta _{k-1}-\mathbf {w} \cdot \mathbf {x} )\end{aligned}}}

donde Φ es la función de distribución acumulativa de la distribución normal estándar y asume el rol de la función de enlace inversa σ . La log-verosimilitud del modelo para un único ejemplo de entrenamiento x i , y i ahora se puede expresar como [ 5 ].

registroL(w,θincógnitai,yi)=k=1K[yi=k]registro[Φ(θkwincógnitai)Φ(θk1wincógnitai)]{\displaystyle \log {\mathcal {L}}(\mathbf {w} ,\mathbf {\theta } \mid \mathbf {x} _ {i},y_{i})=\sum _ {k=1}^{K}[y_{i}=k]\log[\Phi (\theta _ {k}-\mathbf {w} \cdot \mathbf {x} _{i})-\Phi (\theta _{k-1}-\mathbf {w} \cdot \mathbf {x} _{i})]}

(utilizando el corchete de Iverson [ y i = k ] .) La log-verosimilitud del modelo logit ordenado es análoga, utilizando la función logística en lugar de Φ . [ 6 ]

Modelos alternativos

En el aprendizaje automático, se han propuesto alternativas a los modelos de variables latentes de regresión ordinal. Un resultado inicial fue PRank, una variante del algoritmo perceptrón que encontró múltiples hiperplanos paralelos que separan los distintos rangos; su salida es un vector de pesos w y un vector ordenado de K −1 umbrales θ , como en los modelos logit/probit ordenados. La regla de predicción para este modelo es generar el rango k más pequeño tal que wx < θ k . [ 7 ]

Otros métodos se basan en el principio de aprendizaje de margen amplio que también subyace a las máquinas de vectores de soporte . [ 8 ] [ 9 ]

Otro enfoque lo ofrecen Rennie y Srebro, quienes, al darse cuenta de que "incluso evaluar la probabilidad de un predictor no es sencillo" en los modelos logit ordenado y probit ordenado, proponen ajustar modelos de regresión ordinal adaptando funciones de pérdida comunes de clasificación (como la pérdida de bisagra y la pérdida logarítmica ) al caso ordinal. [ 10 ]

Software

ORCA (Ordinal Regression and Classification Algorithms) es un marco de trabajo de Octave/MATLAB que incluye un amplio conjunto de métodos de regresión ordinal. [ 11 ]

Los paquetes de R que proporcionan métodos de regresión ordinal incluyen MASS [ 12 ] , Rstan, brms y Ordinal. [ 13 ]

Véase también

Notas

  1. No confundir con aprender a clasificar .

Referencias

  1. Winship, Christopher; Mare, Robert D. (1984). "Modelos de regresión con variables ordinales" (PDF) . American Sociological Review . 49 (4): 512– 525. doi : 10.2307/2095465 . JSTOR 2095465 . 
  2. ^ Gutiérrez, PA; Pérez-Ortiz, M.; Sánchez-Monedero, J.; Fernández-Navarro, F.; Hervás-Martínez, C. (enero 2016). "Métodos de regresión ordinal: encuesta y estudio experimental". Transacciones IEEE sobre conocimiento e ingeniería de datos . 28 (1): 127– 146. doi : 10.1109/TKDE.2015.2457911 . hdl : 10396/14494 . ISSN 1041-4347 . 
  3. Shashua, Amnon; Levin, Anat (2002). Clasificación con principio de margen amplio: dos enfoques . NIPS .
  4. McCullagh, Peter (1980). "Modelos de regresión para datos ordinales". Journal of the Royal Statistical Society . Serie B (Metodológica). 42 (2): 109– 142.
  5. 1 2 3 Wooldridge, Jeffrey M. (2010). Análisis econométrico de datos de sección transversal y de panel . MIT Press. págs. 655–657 . ISBN  9780262232586.
  6. Agresti, Alan (23 de octubre de 2010). "Modelado de datos categóricos ordinales" (PDF) . Recuperado el 23 de julio de 2015 .
  7. Crammer, Koby; Singer, Yoram (2001). Bromas con clasificación . NIPS.
  8. ^ Chu, Wei; Keerthi, S. Sathiya (2007). "Soporte de regresión ordinal de vectores". Computación neuronal . 19 (3): 792–815 . CiteSeerX 10.1.1.297.3637 . doi : 10.1162/neco.2007.19.3.792 . PMID 17298234 .  
  9. Herbrich, Ralf; Graepel, Thore; Obermayer, Klaus (2000). "Large Margin Rank Boundaries for Ordinal Regression" . Advances in Large Margin Classifiers . MIT Press. pp. 115–132 . 
  10. Rennie, Jason DM; Srebro, Nathan (2005). Funciones de pérdida para niveles de preferencia: regresión con etiquetas ordenadas discretas (PDF) . Actas del Taller Multidisciplinario IJCAI sobre Avances en el Manejo de Preferencias.
  11. orca: Algoritmos de regresión y clasificación ordinal , AYRNA, 21/11/2017 , consultado el 21/11/2017
  12. "Estadística Aplicada Moderna con S, 4.ª ed." . www.stats.ox.ac.uk . Consultado el 15 de julio de 2020 .
  13. Christensen, Rune Haubo B. (2020-06-05), runehaubo/ordinal , consultado el 2020-07-15

Lecturas adicionales

  • Agresti, Alan (2010). Análisis de datos categóricos ordinales . Hoboken, NJ: Wiley. ISBN 978-0470082898.
  • Greene, William H. (2012). Análisis econométrico (Séptima  ed.). Boston: Pearson Education. pp. 824–842 . ISBN  978-0-273-75356-8.
  • Hardin, James; Hilbe, Joseph (2007). Modelos lineales generalizados y extensiones (2.ª  ed.). College Station: Stata Press. ISBN 978-1-59718-014-6.{{cite book}}: CS1 mantenimiento: ubicación del editor ( enlace )