Articulo de referencia

Modelo discriminativo

Los modelos discriminativos , también conocidos como modelos condicionales , son una clase de modelos frecuentemente utilizados para la clasificación . En el aprendizaje automát...

Los modelos discriminativos , también conocidos como modelos condicionales , son una clase de modelos frecuentemente utilizados para la clasificación . En el aprendizaje automático , suelen modelar la distribución condicional P(Y∣X) o aprenden una regla de decisión directa que relaciona las entradas X con las salidas Y. Los modelos discriminativos se utilizan comúnmente para la clasificación y la regresión , donde el objetivo principal es la predicción precisa de nuevos datos. Generalmente se emplean para resolver problemas de clasificación binaria , es decir, asignar etiquetas, como aprobado/suspenso, ganador/perdedor, vivo/muerto o sano/enfermo, a los puntos de datos existentes. Los modelos discriminativos suelen entrenarse para separar clases o para minimizar el error de predicción bajo una función de pérdida elegida . A menudo se contraponen a los modelos generativos , cuyo objetivo es modelar cómo se generan los datos y pueden utilizarse para muestrear nuevos datos.

Entre los tipos de modelos discriminativos se incluyen la regresión logística (RL), los campos aleatorios condicionales (CRF), los árboles de decisión , entre muchos otros.

Definición

A diferencia del modelado generativo, que estudia la probabilidad conjuntaPAG(incógnita,y){\displaystyle P(x,y)}, estudios de modelado discriminativoPAG(y|incógnita){\displaystyle P(y|x)}o mapea la variable no observada dada (objetivo)incógnita{\displaystyle x}a una etiqueta de clasey{\displaystyle y}dependiente de las variables observadas (muestras de entrenamiento). Por ejemplo, en el reconocimiento de objetos ,incógnita{\displaystyle x}Es probable que sea un vector de píxeles sin procesar (o características extraídas de los píxeles sin procesar de la imagen). Dentro de un marco probabilístico, esto se hace modelando la distribución de probabilidad condicional.PAG(y|incógnita){\displaystyle P(y|x)}, que se puede utilizar para predeciry{\displaystyle y}deincógnita{\displaystyle x}Cabe señalar que aún existe una distinción entre el modelo condicional y el modelo discriminativo, aunque con mayor frecuencia se los clasifica simplemente como modelo discriminativo.

Modelo discriminativo puro frente a modelo condicional

Un modelo condicional modela la distribución de probabilidad condicional , mientras que el modelo discriminativo tradicional tiene como objetivo optimizar el mapeo de la entrada alrededor de las muestras entrenadas más similares. [ 1 ]

Contraste con el modelo generativo

En la clasificación estadística , existen dos enfoques principales: el enfoque generativo y el enfoque discriminativo . Estos calculan clasificadores mediante diferentes métodos, que difieren en el grado de modelado estadístico . La terminología es inconsistente, [ a ] pero se pueden distinguir tres tipos principales:

  1. Un modelo generativo es un modelo estadístico de la distribución de probabilidad conjunta.PAG(incógnita,Y){\displaystyle P(X,Y)}sobre una variable observable X y una variable objetivo Y dadas ; se puede utilizar un modelo generativo para "generar" instancias aleatorias ( resultados ) de una observación x .
  2. Un modelo discriminativo es un modelo de probabilidad condicional.PAG(Yincógnita=incógnita){\displaystyle P(Y\mid X=x)}del objetivo Y , dada una observación x . Se puede utilizar para "discriminar" el valor de la variable objetivo Y , dada una observación x .
  3. Los clasificadores calculados sin utilizar un modelo de probabilidad también se denominan, de forma informal, "discriminativos".

La distinción entre estas dos últimas clases no se hace de forma consistente.

Una división alternativa los define simétricamente como:

  • un modelo generativo es un modelo de la probabilidad condicional del observable X , dado un objetivo y , simbólicamente,PAG(incógnitaY=y){\displaystyle P(X\mid Y=y)}
  • un modelo discriminativo es un modelo de la probabilidad condicional del objetivo Y , dada una observación x , simbólicamente,PAG(Yincógnita=incógnita){\displaystyle P(Y\mid X=x)}

Independientemente de la definición precisa, la terminología es constitucional porque un modelo generativo puede usarse para "generar" instancias aleatorias ( resultados ), ya sea de una observación y un objetivo.(incógnita,y){\displaystyle (x,y)}, o de una observación x dado un valor objetivo y , mientras que un modelo discriminativo o un clasificador discriminativo (sin un modelo) se puede utilizar para "discriminar" el valor de la variable objetivo Y , dada una observación x .

Contraste en los enfoques

Digamos que nos dan elmetro{\displaystyle m}etiquetas de clase (clasificación) ynorte{\displaystyle n}variables de características,Y:{y1,y2,,ymetro},incógnita:{incógnita1,incógnita2,,incógnitanorte}{\displaystyle Y:\{y_{1},y_{2},\ldots ,y_{m}\},X:\{x_{1},x_{2},\ldots ,x_{n}\}}, como las muestras de entrenamiento.

Un modelo generativo toma la probabilidad conjuntaPAG(incógnita,y){\displaystyle P(x,y)}, dóndeincógnita{\displaystyle x}es la entrada yy{\displaystyle y}es la etiqueta y predice la etiqueta conocida más probabley~Y{\displaystyle {\widetilde {y}}\en Y}para la variable desconocidaincógnita~{\displaystyle {\widetilde {x}}}utilizando el teorema de Bayes .

Los modelos discriminativos, a diferencia de los generativos , no permiten generar muestras a partir de la distribución conjunta de las variables observadas y objetivo. Sin embargo, para tareas como la clasificación y la regresión , que no requieren dicha distribución conjunta, los modelos discriminativos pueden ofrecer un rendimiento superior (en parte porque tienen menos variables que calcular). Por otro lado, los modelos generativos suelen ser más flexibles que los discriminativos a la hora de expresar dependencias en tareas de aprendizaje complejas. Además, la mayoría de los modelos discriminativos son inherentemente supervisados ​​y no pueden soportar fácilmente el aprendizaje no supervisado . En última instancia, los detalles específicos de la aplicación determinan la idoneidad de seleccionar un modelo discriminativo o generativo.

Los modelos discriminativos y los modelos generativos también difieren en la introducción de la posibilidad posterior . Para mantener la pérdida esperada mínima, se debe lograr la minimización de la clasificación errónea del resultado. En el modelo discriminativo, las probabilidades posteriores,PAG(y|incógnita){\displaystyle P(y|x)}Se infiere a partir de un modelo paramétrico, donde los parámetros provienen de los datos de entrenamiento. Los puntos de estimación de los parámetros se obtienen a partir de la maximización de la verosimilitud o el cálculo de la distribución sobre los parámetros. Por otro lado, considerando que los modelos generativos se centran en la probabilidad conjunta, la posibilidad posterior de la clasePAG(k){\displaystyle P(k)}se considera en el teorema de Bayes , que es

PAG(y|incógnita)=pag(incógnita|y)pag(y)ipag(incógnita|i)pag(i)=pag(incógnita|y)pag(y)pag(incógnita){\displaystyle P(y|x)={\frac {p(x|y)p(y)}{\textstyle \sum _{i}p(x|i)p(i)\displaystyle }}={\frac {p(x|y)p(y)}{p(x)}}}.

Ventajas y desventajas en la aplicación

En los experimentos repetidos, se aplicaron la regresión logística y el clasificador bayesiano ingenuo a diferentes modelos en la tarea de clasificación binaria. El aprendizaje discriminativo resultó en errores asintóticos menores, mientras que el generativo resultó en errores asintóticos mayores más rápidamente. Sin embargo, en el trabajo conjunto de Ulusoy y Bishop, " Comparación de técnicas generativas y discriminativas para la detección y clasificación de objetos" , afirman que la afirmación anterior solo es cierta cuando el modelo es el apropiado para los datos (es decir, la distribución de los datos se modela correctamente mediante el modelo generativo).

Ventajas

Las ventajas significativas de utilizar modelos discriminativos son:

  • Mayor precisión, lo que generalmente conlleva mejores resultados de aprendizaje.
  • Permite simplificar la entrada y proporciona un enfoque directo aPAG(y|incógnita){\displaystyle P(y|x)}
  • Ahorra recursos de cálculo
  • Genera errores asintóticos más bajos

En comparación con las ventajas de utilizar el modelado generativo:

  • Toma en consideración todos los datos, lo que podría resultar en un procesamiento más lento como desventaja.
  • Requiere menos muestras de entrenamiento.
  • Un marco flexible que pudiera cooperar fácilmente con otras necesidades de la aplicación.
Desventajas
  • El método de entrenamiento generalmente requiere múltiples técnicas de optimización numérica.
  • De manera similar, por definición, el modelo discriminativo necesitará la combinación de múltiples subtareas para resolver un problema complejo del mundo real.

Enfoques típicos de modelado discriminatorio

El siguiente enfoque se basa en la suposición de que se dispone del conjunto de datos de entrenamiento.D={(incógnitai;yi)|inorteZ}{\displaystyle D=\{(x_{i};y_{i})|i\leq N\in \mathbb {Z} \}}, dóndeyi{\displaystyle y_{i}}es la salida correspondiente a la entradaincógnitai{\displaystyle x_{i}}. [ 2 ]

Clasificador lineal

Tenemos la intención de utilizar la funciónF(incógnita){\displaystyle f(x)}para simular el comportamiento de lo que observamos en el conjunto de datos de entrenamiento mediante el método del clasificador lineal . Utilizando el vector de características conjuntasϕ(incógnita,y){\displaystyle \phi (x,y)}La función de decisión se define como:

F(incógnita;w)=argmáximoywTϕ(incógnita,y){\displaystyle f(x;w)=\arg \max _{y}w^{T}\phi (x,y)}

Según la interpretación de Memisevic, [ 2 ]wTϕ(incógnita,y){\displaystyle w^{T}\phi (x,y)}, que también esdo(incógnita,y;w){\displaystyle c(x,y;w)}, calcula una puntuación que mide la compatibilidad de la entradaincógnita{\displaystyle x}con el resultado potencialy{\displaystyle y}. Entonces elargmáximo{\displaystyle \arg \max }determina la clase con la puntuación más alta.

Regresión logística (RL)

Dado que la función de pérdida 0-1 es una de las más utilizadas en la teoría de la decisión, la distribución de probabilidad condicionalPAG(y|incógnita;w){\displaystyle P(y|x;w)}, dóndew{\displaystyle w}es un vector de parámetros para optimizar los datos de entrenamiento, que podría reconsiderarse de la siguiente manera para el modelo de regresión logística:

PAG(y|incógnita;w)=1Z(incógnita;w)exp(wTϕ(incógnita,y)){\displaystyle P(y|x;w)={\frac {1}{Z(x;w)}}\exp(w^{T}\phi (x,y))}, con
Z(incógnita;w)=yexp(wTϕ(incógnita,y)){\displaystyle Z(x;w)=\textstyle \sum _ {y}\displaystyle \exp(w^{T}\phi (x,y))}

La ecuación anterior representa la regresión logística . Nótese que una distinción importante entre los modelos radica en su forma de introducir la probabilidad posterior. La probabilidad posterior se infiere del modelo paramétrico. A continuación, podemos maximizar el parámetro mediante la siguiente ecuación:

L(w)=iregistropag(yi|incógnitai;w){\displaystyle L(w)=\textstyle \sum _ {i}\displaystyle \log p(y^{i}|x^{i};w)}

También podría sustituirse por la siguiente ecuación de pérdida logarítmica :

lregistro(incógnitai,yi,do(incógnitai;w))=registropag(yi|incógnitai;w)=registroZ(incógnitai;w)wTϕ(incógnitai,yi){\displaystyle l^{\log }(x^{i},y^{i},c(x^{i};w))=-\log p(y^{i}|x^{i};w)=\log Z(x^{i};w)-w^{T}\phi (x^{i},y^{i})}

Dado que la pérdida logarítmica es diferenciable, se puede utilizar un método basado en gradientes para optimizar el modelo. Se garantiza un óptimo global porque la función objetivo es convexa. El gradiente de la verosimilitud logarítmica se representa mediante:

L(w)w=iϕ(incógnitai,yi)mipag(y|incógnitai;w)ϕ(incógnitai,y){\displaystyle {\frac {\partial L(w)}{\partial w}}=\textstyle \sum _ {i}\displaystyle \phi (x^{i},y^{i})-E_{p(y|x^{i};w)}\phi (x^{i},y)}

dóndemipag(y|incógnitai;w){\displaystyle E_{p(y|x^{i};w)}}es la expectativa depag(y|incógnitai;w){\displaystyle p(y|x^{i};w)}.

El método anterior proporcionará un cálculo eficiente para el número relativamente pequeño de clasificaciones.

Objetivos de formación y optimizaciones en las aplicaciones

Dado que ambos métodos de modelado presentan ventajas y desventajas, la combinación de ambos enfoques resulta en un buen modelo práctico. Por ejemplo, en el artículo de Marras, « Un modelo generativo discriminativo conjunto para la construcción y clasificación de modelos deformables» [ 3 ] , él y sus coautores aplican la combinación de ambos modelos a la clasificación facial de los modelos, obteniendo una mayor precisión que con el enfoque tradicional.

De manera similar, Kelm [ 4 ] también propuso la combinación de dos modelos para la clasificación de píxeles en su artículo Combinación de métodos generativos y discriminativos para la clasificación de píxeles con aprendizaje multicondicional .

Durante el proceso de extracción de características discriminatorias previas a la agrupación, el análisis de componentes principales (PCA), aunque comúnmente utilizado, no es necesariamente un enfoque discriminatorio. En contraste, el análisis discriminante lineal (LDA) sí lo es. [ 5 ] El análisis discriminante lineal (LDA) proporciona una forma eficiente de eliminar la desventaja que mencionamos anteriormente. Como sabemos, el modelo discriminatorio requiere una combinación de múltiples subtareas antes de la clasificación, y LDA ofrece una solución adecuada a este problema al reducir la dimensionalidad.

  • Minimización del riesgo empírico
  • Funciones de pérdida comunes (pérdida logarítmica, pérdida de bisagra, pérdida cuadrática)
  • Regularización (L1/L2)
  • Métodos de optimización (familia del descenso de gradiente)

Familias y tipos

Algunos ejemplos de modelos discriminatorios son:

Véase también

Notas

  1. Tres fuentes principales, Ng y Jordan 2002 , Jebara 2004 y Mitchell 2015 , dan diferentes divisiones y definiciones.

Referencias

  1. Ballesteros, Miguel. "Modelos discriminativos" (PDF) . Consultado el 28 de octubre de 2018 .
  2. 1 2 Memisevic, Roland (21 de diciembre de 2006). "Una introducción al aprendizaje discriminativo estructurado" . Recuperado el 29 de octubre de 2018 .
  3. Marras, Ioannis (2017). "Un modelo generativo discriminativo conjunto para la construcción y clasificación de modelos deformables" (PDF) . Recuperado el 5 de noviembre de 2018 .
  4. Kelm, B. Michael. "Combinación de métodos generativos y discriminativos para la clasificación de píxeles con aprendizaje multicondicional" (PDF) . Archivado del original (PDF) el 17 de julio de 2019. Recuperado el 5 de noviembre de 2018 .
  5. Wang, Zhangyang (2015). "Un marco de optimización conjunta de codificación dispersa y agrupamiento discriminativo" (PDF) . Recuperado el 5 de noviembre de 2018 .

Fuentes

  • Jebara, Tony (2004). Aprendizaje automático: discriminativo y generativo . The Springer International Series in Engineering and Computer Science. Kluwer Academic (Springer). ISBN 978-1-4020-7647-3.
  • Mitchell, Tom M. (2015). "3. Clasificadores generativos y discriminativos: Naive Bayes y regresión logística" (PDF) . Aprendizaje automático .
  • Ng, Andrew Y. ; Jordan, Michael I. (2002). "Sobre clasificadores discriminativos vs. generativos: una comparación de regresión logística y bayesianos ingenuos" (PDF) . Avances en sistemas de procesamiento de información neuronal .