Articulo de referencia

Regresión logística multinomial

En estadística , la regresión logística multinomial es un método de clasificación que generaliza la regresión logística a problemas multiclase , es decir, con más de dos posible...

En estadística , la regresión logística multinomial es un método de clasificación que generaliza la regresión logística a problemas multiclase , es decir, con más de dos posibles resultados discretos. [ 1 ] Es decir, es un modelo que se utiliza para predecir las probabilidades de los diferentes resultados posibles de una variable dependiente con distribución categórica , dado un conjunto de variables independientes (que pueden ser de valor real, binario, categórico, etc.).

La regresión logística multinomial se conoce con varios nombres, entre ellos LR politómica , [ 2 ] [ 3 ] LR multiclase , regresión softmax , logit multinomial ( mlogit ), clasificador de máxima entropía ( MaxEnt ) y modelo de máxima entropía condicional . [ 4 ]

Fondo

La regresión logística multinomial se utiliza cuando la variable dependiente en cuestión es nominal (o categórica , lo que significa que pertenece a cualquiera de un conjunto de categorías que no se pueden ordenar de forma significativa) y para la cual existen más de dos categorías. Algunos ejemplos serían:

  • ¿Qué carrera universitaria elegirá un estudiante, teniendo en cuenta sus calificaciones, sus gustos y aversiones, etc.?
  • ¿Qué grupo sanguíneo tiene una persona, según los resultados de diversas pruebas diagnósticas?
  • En una aplicación de marcación telefónica manos libres, ¿qué nombre de persona se pronunció, dadas las distintas propiedades de la señal de voz?
  • ¿Por qué candidato votará una persona, dadas sus características demográficas particulares?
  • ¿En qué país ubicará una empresa una oficina, dadas las características de la empresa y de los distintos países candidatos?

Todos estos son problemas de clasificación estadística . Todos tienen en común una variable dependiente que se debe predecir y que proviene de un conjunto limitado de elementos que no se pueden ordenar de manera significativa, así como un conjunto de variables independientes (también conocidas como características, explicativas, etc.), que se utilizan para predecir la variable dependiente. La regresión logística multinomial es una solución particular a los problemas de clasificación que utiliza una combinación lineal de las características observadas y algunos parámetros específicos del problema para estimar la probabilidad de cada valor particular de la variable dependiente. Los mejores valores de los parámetros para un problema dado generalmente se determinan a partir de algunos datos de entrenamiento (por ejemplo, personas para las que se conocen tanto los resultados de las pruebas de diagnóstico como los grupos sanguíneos, o algunos ejemplos de palabras conocidas pronunciadas).

Supuestos

El modelo logístico multinomial asume que los datos son específicos para cada caso; es decir, cada variable independiente tiene un único valor para cada caso. Al igual que con otros tipos de regresión, no es necesario que las variables independientes sean estadísticamente independientes entre sí (a diferencia, por ejemplo, de un clasificador bayesiano ingenuo ); sin embargo, se asume que la colinealidad es relativamente baja, ya que de lo contrario resulta difícil diferenciar el impacto de varias variables. [ 5 ]

Si se utiliza el modelo logit multinomial para modelar las elecciones, este se basa en el supuesto de independencia de alternativas irrelevantes (IIA), lo cual no siempre es deseable. Este supuesto establece que las probabilidades de preferir una clase sobre otra no dependen de la presencia o ausencia de otras alternativas "irrelevantes". Por ejemplo, las probabilidades relativas de ir al trabajo en coche o autobús no cambian si se añade una bicicleta como posibilidad adicional. Esto permite modelar la elección de K alternativas como un conjunto de K  1 elecciones binarias independientes, en las que una alternativa se elige como "pivote" y las otras K  1 se comparan con ella, una a la vez. La hipótesis IIA es una hipótesis central en la teoría de la elección racional; sin embargo, numerosos estudios en psicología muestran que los individuos a menudo violan este supuesto al tomar decisiones. Un ejemplo de un caso problemático surge cuando las elecciones incluyen un coche y un autobús azul. Supongamos que la razón de probabilidades entre ambos es 1  :1. Ahora bien, si se introduce la opción de un autobús rojo, una persona puede ser indiferente entre un autobús rojo y uno azul, y por lo tanto puede mostrar una razón de probabilidades de automóvil  :autobús azul  :autobús rojo de 1  :0,5  :0,5, manteniendo así una  razón de 1:1 de automóvil  :cualquier autobús, mientras que adopta una  razón de automóvil:autobús azul modificada de 1  :0,5. En este caso, la opción del autobús rojo no era irrelevante, porque un autobús rojo era un sustituto perfecto para un autobús azul.

Si se utiliza el modelo logit multinomial para modelar las elecciones, en algunas situaciones puede imponer demasiadas restricciones a las preferencias relativas entre las diferentes alternativas. Es especialmente importante tenerlo en cuenta si el análisis pretende predecir cómo cambiarían las elecciones si una alternativa desapareciera (por ejemplo, si un candidato político se retira de una contienda con tres candidatos). En estos casos, se pueden utilizar otros modelos, como el logit anidado o el probit multinomial , ya que permiten la violación del IIA. [ 6 ]

Modelo

Introducción

Existen múltiples formas equivalentes de describir el modelo matemático subyacente a la regresión logística multinomial. Esto puede dificultar la comparación de los distintos enfoques del tema en diferentes textos. El artículo sobre regresión logística presenta varias formulaciones equivalentes de la regresión logística simple, muchas de las cuales tienen análogos en el modelo logit multinomial.

La idea subyacente a todas ellas, como en muchas otras técnicas de clasificación estadística , es construir una función predictora lineal que construya una puntuación a partir de un conjunto de ponderaciones que se combinan linealmente con las variables explicativas (características) de una observación dada mediante un producto escalar :

puntaje(incógnitai,k)=βkincógnitai,{\displaystyle \operatorname {score} (\mathbf {X} _{i},k)={\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i},}

donde X i es el vector de variables explicativas que describen la observación i , β k es un vector de ponderaciones (o coeficientes de regresión ) correspondientes al resultado k , y score( X i , k ) es la puntuación asociada a la asignación de la observación i a la categoría k . En la teoría de la elección discreta , donde las observaciones representan personas y los resultados representan elecciones, la puntuación se considera la utilidad asociada a que la persona i elija el resultado k . El resultado predicho es el que tiene la puntuación más alta.

La diferencia entre el modelo logit multinomial y otros numerosos métodos, modelos, algoritmos, etc., con la misma configuración básica (el algoritmo perceptrón , las máquinas de vectores de soporte , el análisis discriminante lineal , etc.) radica en el procedimiento para determinar (entrenar) los pesos/coeficientes óptimos y la forma en que se interpreta la puntuación. En particular, en el modelo logit multinomial, la puntuación se puede convertir directamente en un valor de probabilidad, que indica la probabilidad de que la observación i elija el resultado k dadas las características medidas de la observación. Esto proporciona una forma sistemática de incorporar la predicción de un modelo logit multinomial particular en un procedimiento más amplio que puede involucrar múltiples predicciones de este tipo, cada una con una posible probabilidad de error. Sin este medio para combinar predicciones, los errores tienden a multiplicarse. Por ejemplo, imaginemos un modelo predictivo grande dividido en una serie de submodelos, donde la predicción de un submodelo se usa como entrada para otro, y esta a su vez como entrada para un tercer submodelo, y así sucesivamente. Si cada submodelo tiene una precisión del 90 % en sus predicciones y hay cinco submodelos en serie, entonces el modelo general tiene solo 0,95 = 59 % de precisión. Si cada submodelo tiene una precisión del 80 %, entonces la precisión general se reduce a 0,85 = 33 %. Este problema se conoce como propagación de errores y es un problema grave en los modelos predictivos del mundo real, que generalmente se componen de numerosas partes. Predecir las probabilidades de cada resultado posible, en lugar de simplemente hacer una única predicción óptima, es una forma de mitigar este problema.

Configuración

La configuración básica es la misma que en la regresión logística , con la única diferencia de que las variables dependientes son categóricas en lugar de binarias ; es decir, hay K resultados posibles en vez de solo dos. La siguiente descripción es una versión abreviada; para obtener más detalles, consulte el artículo sobre regresión logística .

Puntos de datos

Específicamente, se supone que tenemos una serie de N puntos de datos observados. Cada punto de datos i (que va de 1 a N ) consta de un conjunto de M variables explicativas x 1, i ... x M,i (también conocidas como variables independientes , variables predictoras, características, etc.) y un resultado categórico asociado Y i (también conocido como variable dependiente , variable de respuesta), que puede tomar uno de K valores posibles. Estos valores posibles representan categorías lógicamente separadas (por ejemplo, diferentes partidos políticos, grupos sanguíneos, etc.) y a menudo se describen matemáticamente asignando arbitrariamente a cada uno un número del 1 al K. Las variables explicativas y el resultado representan propiedades observadas de los puntos de datos y a menudo se consideran originados en las observaciones de N "experimentos", aunque un "experimento" puede consistir simplemente en la recopilación de datos. El objetivo de la regresión logística multinomial es construir un modelo que explique la relación entre las variables explicativas y la variable de respuesta, de modo que el resultado de un nuevo experimento pueda predecirse correctamente para un nuevo dato del que se disponga de las variables explicativas, pero no de la variable de respuesta. En este proceso, el modelo intenta explicar el efecto relativo de las diferentes variables explicativas sobre la variable de respuesta.

Algunos ejemplos:

  • Los resultados observados son diferentes variantes de una enfermedad como la hepatitis (que posiblemente incluyan la ausencia de enfermedad y/o otras enfermedades relacionadas) en un grupo de pacientes, y las variables explicativas podrían ser características de los pacientes que se consideren pertinentes (sexo, raza, edad, presión arterial , resultados de diversas pruebas de función hepática, etc.). El objetivo es predecir qué enfermedad está causando los síntomas hepáticos observados en un nuevo paciente.
  • Los resultados observados son el partido elegido por un grupo de personas en una elección, y las variables explicativas son las características demográficas de cada persona (por ejemplo, sexo, raza, edad, ingresos, etc.). El objetivo es predecir el voto probable de un nuevo votante con características dadas.

Predictor lineal

Al igual que en otras formas de regresión lineal, la regresión logística multinomial utiliza una función predictora lineal.F(k,i){\displaystyle f(k,i)}predecir la probabilidad de que la observación i tenga el resultado k , de la siguiente forma:

F(k,i)=β0,k+β1,kincógnita1,i+β2,kincógnita2,i++βMETRO,kincógnitaMETRO,i,{\displaystyle f(k,i)=\beta _{0,k}+\beta _{1,k}x_{1,i}+\beta _{2,k}x_{2,i}+\cdots +\beta _{M,k}x_{M,i},}

dóndeβmetro,k{\displaystyle \beta _{m,k}}es un coeficiente de regresión asociado con la m -ésima variable explicativa y el k -ésimo resultado. Como se explica en el artículo sobre regresión logística , los coeficientes de regresión y las variables explicativas normalmente se agrupan en vectores de tamaño M  +  1, de modo que la función predictora se puede escribir de forma más compacta:

F(k,i)=βkincógnitai,{\displaystyle f(k,i)={\boldsymbol {\beta }}_{k}\cdot \mathbf {x} _{i},}

dóndeβk{\displaystyle {\boldsymbol {\beta }}_{k}}es el conjunto de coeficientes de regresión asociados con el resultado k yincógnitai{\displaystyle \mathbf {x} _ {i}}(un vector fila) es el conjunto de variables explicativas asociadas con la observación i , precedido por un 1 en la entrada 0.

Como un conjunto de regresiones binarias independientes

Para llegar al modelo logit multinomial, se puede imaginar, para K resultados posibles, ejecutar K modelos de regresión logística binaria independientes, en los que se elige un resultado como "pivote" y luego los otros K  1 resultados se regresan por separado con respecto al resultado pivote. Si se elige el resultado K (el último resultado) como pivote, las K  1 ecuaciones de regresión son:

lnPr(Yi=k)Pr(Yi=K)=βkincógnitai,1k<K{\displaystyle \ln {\frac {\Pr(Y_{i}=k)}{\Pr(Y_{i}=K)}}\,=\,{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i},\;\;\;\;\;\;1\leq k<K}.

Esta formulación también se conoce como la transformación de razón logarítmica aditiva, comúnmente utilizada en el análisis de datos composicionales. En otras aplicaciones se la denomina “riesgo relativo”. [ 7 ]

Si elevamos ambos lados a la potencia y resolvemos para las probabilidades, obtenemos:

Pr(Yi=k)=Pr(Yi=K)miβkincógnitai,1k<K{\displaystyle \Pr(Y_{i}=k)\,=\,{\Pr(Y_{i}=K)}\;e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}},\;\;\;\;\;\;1\leq k<K}

Utilizando el hecho de que la suma de las K probabilidades debe ser igual a uno, encontramos:

Pr(Yi=K)=1j=1K1Pr(Yi=j)=1j=1K1Pr(Yi=K)miβjincógnitaiPr(Yi=K)=11+j=1K1miβjincógnitai.{\displaystyle {\begin{aligned}\Pr(Y_{i}=K)={}&1-\sum _{j=1}^{K-1}\Pr(Y_{i}=j)\\={}&1-\sum _{j=1}^{K-1}{\Pr(Y_{i}=K)}\;e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}\;\;\Rightarrow \;\;\Pr(Y_{i}=K)\\={}&{\frac {1}{1+\sum _{j=1}^{K-1}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}}.\end{aligned}}}

Podemos usar esto para hallar las otras probabilidades:

Pr(Yi=k)=miβkincógnitai1+j=1K1miβjincógnitai,1k<K{\displaystyle \Pr(Y_{i}=k)={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{1+\sum _{j=1}^{K-1}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}},\;\;\;\;\;\;1\leq k<K}.

El hecho de que realicemos múltiples regresiones revela por qué el modelo se basa en el supuesto de independencia de las alternativas irrelevantes descritas anteriormente.

Estimación de los coeficientes

Los parámetros desconocidos en cada vector β k se estiman típicamente de forma conjunta mediante la estimación de máxima a posteriori (MAP), que es una extensión de la máxima verosimilitud que utiliza la regularización de los pesos para evitar soluciones patológicas (generalmente una función de regularización al cuadrado, que es equivalente a colocar una distribución a priori gaussiana de media cero en los pesos, aunque también son posibles otras distribuciones). La solución se encuentra típicamente mediante un procedimiento iterativo como el escalado iterativo generalizado , [ 8 ] mínimos cuadrados reponderados iterativamente (IRLS), [ 9 ] mediante algoritmos de optimización basados ​​en gradientes como L-BFGS , [ 4 ] o mediante algoritmos especializados de descenso de coordenadas . [ 10 ]

Como un modelo log-lineal

La formulación de la regresión logística binaria como un modelo log-lineal puede extenderse directamente a la regresión multivariable. Es decir, modelamos el logaritmo de la probabilidad de ver una salida determinada utilizando el predictor lineal, así como un factor de normalización adicional , el logaritmo de la función de partición :

lnPr(Yi=k)=βkincógnitailnZ,1kK.{\displaystyle \ln \Pr(Y_{i}=k)={\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}-\ln Z,\;\;\;\;\;\;1\leq k\leq K.}

Al igual que en el caso binario, necesitamos un término adicional.lnZ{\displaystyle -\ln Z}para asegurar que el conjunto completo de probabilidades forme una distribución de probabilidad , es decir, que todas sumen uno:

k=1KPr(Yi=k)=1{\displaystyle \sum _ {k=1}^{K}\Pr(Y_{i}=k)=1}

La razón por la que necesitamos agregar un término para asegurar la normalización, en lugar de multiplicar como es habitual, es porque hemos tomado el logaritmo de las probabilidades. Al exponenciar ambos lados, el término aditivo se convierte en un factor multiplicativo, de modo que la probabilidad es simplemente la medida de Gibbs :

Pr(Yi=k)=1Zmiβkincógnitai,1kK.{\displaystyle \Pr(Y_{i}=k)={\frac {1}{Z}}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}},\;\;\;\;\;\;1\leq k\leq K.}

La cantidad Z se denomina función de partición para la distribución. Podemos calcular el valor de la función de partición aplicando la restricción anterior que requiere que todas las probabilidades sumen 1:

1=k=1KPr(Yi=k)=k=1K1Zmiβkincógnitai=1Zk=1Kmiβkincógnitai.{\displaystyle 1=\sum _{k=1}^{K}\Pr(Y_{i}=k)\;=\;\sum _{k=1}^{K}{\frac {1}{Z}}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}\;=\;{\frac {1}{Z}}\sum _{k=1}^{K}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}.}

Por lo tanto

Z=k=1Kmiβkincógnitai.{\displaystyle Z=\sum _{k=1}^{K}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}.}

Cabe señalar que este factor es "constante" en el sentido de que no depende de Y i , la variable sobre la que se define la distribución de probabilidad. Sin embargo, no es constante con respecto a las variables explicativas, ni, lo que es crucial, con respecto a los coeficientes de regresión desconocidos β k , que necesitaremos determinar mediante algún procedimiento de optimización .

Las ecuaciones resultantes para las probabilidades son:

Pr(Yi=k)=miβkincógnitaij=1Kmiβjincógnitai,1kK.{\displaystyle \Pr(Y_{i}=k)={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}},\;\;\;\;\;\;1\leq k\leq K.}

La siguiente función:

softmax(k,s1,,sK)=miskj=1Kmisj{\displaystyle \operatorname {softmax} (k,s_{1},\ldots ,s_{K})={\frac {e^{s_{k}}}{\sum _{j=1}^{K}e^{s_{j}}}}}

se la conoce como la función softmax . La razón es que el efecto de exponenciar los valoress1,,sK{\displaystyle s_{1},\ldots ,s_{K}}es exagerar las diferencias entre ellos. Como resultado,softmax(k,s1,,sK){\displaystyle \operatorname {softmax} (k,s_{1},\ldots ,s_{K})}devolverá un valor cercano a 0 siempre quesk{\displaystyle s_{k}}es significativamente menor que el máximo de todos los valores, y devolverá un valor cercano a 1 cuando se aplique al valor máximo, a menos que esté extremadamente cerca del siguiente valor más grande. Por lo tanto, la función softmax se puede utilizar para construir un promedio ponderado que se comporta como una función suave (que se puede diferenciar convenientemente , etc.) y que se aproxima a la función indicadora.

F(k)={1sik=argmáximojsj,0de lo contrario.{\displaystyle f(k)={\begin{cases}1&{\textrm {if}}\;k=\operatorname {\arg \max } _{j}s_{j},\\0&{\textrm {otherwise}}.\end{cases}}}

Por lo tanto, podemos escribir las ecuaciones de probabilidad como

Pr(Yi=k)=softmax(k,β1incógnitai,,βKincógnitai){\displaystyle \Pr(Y_{i}=k)=\operatorname {softmax} (k,{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i},\ldots ,{\boldsymbol {\beta }}_{K}\cdot \mathbf {X} _{i})}

La función softmax sirve, por lo tanto, como equivalente de la función logística en la regresión logística binaria.

Tenga en cuenta que no todos losβk{\displaystyle {\boldsymbol {\beta }}_{k}}Los vectores de coeficientes son identificables de forma única . Esto se debe a que todas las probabilidades deben sumar 1, lo que hace que una de ellas esté completamente determinada una vez que se conocen todas las demás. Como resultado, solo hayK1{\displaystyle K-1}probabilidades especificables por separado y, por lo tanto,K1{\displaystyle K-1}vectores de coeficientes identificables por separado. Una forma de verlo es observar que si sumamos un vector constante a todos los vectores de coeficientes, las ecuaciones son idénticas:

mi(βk+do)incógnitaij=1Kmi(βj+do)incógnitai=miβkincógnitaimidoincógnitaij=1Kmiβjincógnitaimidoincógnitai=midoincógnitaimiβkincógnitaimidoincógnitaij=1Kmiβjincógnitai=miβkincógnitaij=1Kmiβjincógnitai{\displaystyle {\begin{aligned}{\frac {e^{({\boldsymbol {\beta }}_{k}+\mathbf {C} )\cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{({\boldsymbol {\beta }}_{j}+\mathbf {C} )\cdot \mathbf {X} _{i}}}}&={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}}}\\&={\frac {e^{\mathbf {C} \cdot \mathbf {X} _{i}}e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{e^{\mathbf {C} \cdot \mathbf {X} _{i}}\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}}\\&={\frac {e^{{\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}}}{\sum _{j=1}^{K}e^{{\boldsymbol {\beta }}_{j}\cdot \mathbf {X} _{i}}}}\end{aligned}}}

Como resultado, es convencional establecerdo=βK{\displaystyle \mathbf {C} =-{\boldsymbol {\beta }}_{K}}(o alternativamente, uno de los otros vectores de coeficientes). Esencialmente, establecemos la constante de modo que uno de los vectores se convierta en0{\displaystyle {\boldsymbol {0}}}y todos los demás vectores se transforman en la diferencia entre esos vectores y el vector que elegimos. Esto equivale a "pivotar" alrededor de una de las K opciones y examinar cuánto mejores o peores son las otras K  1 opciones, en relación con la opción alrededor de la cual estamos pivotando. Matemáticamente, transformamos los coeficientes de la siguiente manera:

βk=βkβK,1k<K,βK=0.{\displaystyle {\begin{aligned}{\boldsymbol {\beta }}'_{k}&={\boldsymbol {\beta }}_{k}-{\boldsymbol {\beta }}_{K},\;\;\;\;1\leq k<K,\\{\boldsymbol {\beta }}'_{K}&=0.\end{aligned}}}

Esto nos lleva a las siguientes ecuaciones:

Pr(Yi=k)=miβkincógnitai1+j=1K1miβjincógnitai,1kK{\displaystyle \Pr(Y_{i}=k)={\frac {e^{{\boldsymbol {\beta }}'_{k}\cdot \mathbf {X} _{i}}}{1+\sum _{j=1}^{K-1}e^{{\boldsymbol {\beta }}'_{j}\cdot \mathbf {X} _{i}}}},\;\;\;\;\;\;1\leq k\leq K}

Aparte de los símbolos de prima en los coeficientes de regresión, esto es exactamente igual que la forma del modelo descrito anteriormente, en términos de K  1 regresiones bidireccionales independientes.

Como modelo de variables latentes

También es posible formular la regresión logística multinomial como un modelo de variables latentes, siguiendo el modelo de variables latentes bidireccional descrito para la regresión logística binaria. Esta formulación es común en la teoría de los modelos de elección discreta y facilita la comparación de la regresión logística multinomial con el modelo probit multinomial relacionado , así como su extensión a modelos más complejos.

Imagina que, para cada punto de datos i y posible resultado k  =  1,2,..., K , existe una variable latente continua Y i,k * (es decir, una variable aleatoria no observada ) que se distribuye de la siguiente manera:

Yi,k=βkincógnitai+εk,kK{\displaystyle Y_{i,k}^{\ast }={\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}+\varepsilon _{k}\;\;\;\;,\;\;k\leq K}

dóndeεkVehículo eléctrico1(0,1),{\displaystyle \varepsilon _{k}\sim \operatorname {EV} _{1}(0,1),}es decir, una distribución de valores extremos de tipo 1 estándar .

Esta variable latente puede considerarse como la utilidad asociada con el punto de datos i al elegir el resultado k , donde existe cierta aleatoriedad en la cantidad real de utilidad obtenida, lo que explica otros factores no modelados que influyen en la elección. El valor de la variable realYi{\displaystyle Y_{i}}luego se determina de manera no aleatoria a partir de estas variables latentes (es decir, la aleatoriedad se ha trasladado de los resultados observados a las variables latentes), donde el resultado k se elige si y solo si la utilidad asociada (el valor deYi,k{\displaystyle Y_{i,k}^{\ast }}) es mayor que las utilidades de todas las demás opciones, es decir, si la utilidad asociada con el resultado k es la máxima de todas las utilidades. Dado que las variables latentes son continuas , la probabilidad de que dos tengan exactamente el mismo valor es 0, por lo que ignoramos el escenario. Es decir:

Pr(Yi=1)=Pr(Yi,1>Yi,2 y Yi,1>Yi,3 y  y Yi,1>Yi,K)Pr(Yi=2)=Pr(Yi,2>Yi,1 y Yi,2>Yi,3 y  y Yi,2>Yi,K)Pr(Yi=K)=Pr(Yi,K>Yi,1 y Yi,K>Yi,2 y  y Yi,K>Yi,K1){\displaystyle {\begin{aligned}\Pr(Y_{i}=1)&=\Pr(Y_{i,1}^{\ast }>Y_{i,2}^{\ast }{\text{ and }}Y_{i,1}^{\ast }>Y_{i,3}^{\ast }{\text{ and }}\cdots {\text{ and }}Y_{i,1}^{\ast }>Y_{i,K}^{\ast })\\\Pr(Y_{i}=2)&=\Pr(Y_{i,2}^{\ast }>Y_{i,1}^{\ast }{\text{ and }}Y_{i,2}^{\ast }>Y_{i,3}^{\ast }{\text{ and }}\cdots {\text{ and }}Y_{i,2}^{\ast }>Y_{i,K}^{\ast })\\&\,\,\,\vdots \\\Pr(Y_{i}=K)&=\Pr(Y_{i,K}^{\ast }>Y_{i,1}^{\ast }{\text{ and }}Y_{i,K}^{\ast }>Y_{i,2}^{\ast }{\text{ and }}\cdots {\text{ and }}Y_{i,K}^{\ast }>Y_{i,K-1}^{\ast })\\\end{aligned}}}

O equivalentemente:

Pr(Yi=k)=Pr(máximo(Yi,1,Yi,2,,Yi,K)=Yi,k),kK{\displaystyle \Pr(Y_{i}=k)\;=\;\Pr(\max(Y_{i,1}^{\ast },Y_{i,2}^{\ast },\ldots ,Y_{i,K}^{\ast })=Y_{i,k}^{\ast })\;\;\;\;,\;\;k\leq K}

Analicemos más de cerca la primera ecuación, que podemos escribir de la siguiente manera:

Pr(Yi=1)=Pr(Yi,1>Yi,k  k=2,,K)=Pr(Yi,1Yi,k>0  k=2,,K)=Pr(β1incógnitai+ε1(βkincógnitai+εk)>0  k=2,,K)=Pr((β1βk)incógnitai>εkε1  k=2,,K){\displaystyle {\begin{aligned}\Pr(Y_{i}=1)&=\Pr(Y_{i,1}^{\ast }>Y_{i,k}^{\ast }\ \forall \ k=2,\ldots ,K)\\&=\Pr(Y_{i,1}^{\ast }-Y_{i,k}^{\ast }>0\ \forall \ k=2,\ldots ,K)\\&=\Pr({\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}+\varepsilon _{1}-({\boldsymbol {\beta }}_{k}\cdot \mathbf {X} _{i}+\varepsilon _{k})>0\ \forall \ k=2,\ldots ,K)\\&=\Pr(({\boldsymbol {\beta }}_{1}-{\boldsymbol {\beta }}_{k})\cdot \mathbf {X} _{i}>\varepsilon _{k}-\varepsilon _{1}\ \forall \ k=2,\ldots ,K)\end{aligned}}}

Hay algunas cosas que conviene tener en cuenta aquí:

  1. En general, siincógnitaVehículo eléctrico1(a,b){\displaystyle X\sim \operatorname {EV} _{1}(a,b)}yYVehículo eléctrico1(a,b){\displaystyle Y\sim \operatorname {EV} _{1}(a,b)}entoncesincógnitaYLogístico(0,b).{\displaystyle X-Y\sim \operatorname {Logistic} (0,b).}Es decir, la diferencia de dos variables independientes idénticamente distribuidas con distribución de valores extremos sigue la distribución logística , donde el primer parámetro es irrelevante. Esto es comprensible, ya que el primer parámetro es un parámetro de localización , es decir, desplaza la media en una cantidad fija, y si dos valores se desplazan en la misma cantidad, su diferencia permanece constante. Esto significa que todas las relaciones subyacentes a la probabilidad de una elección dada involucran la distribución logística, lo que hace que la elección inicial de la distribución de valores extremos, que parecía bastante arbitraria, sea algo más comprensible.
  2. El segundo parámetro en una distribución de valores extremos o logística es un parámetro de escala , tal que siincógnitaLogístico(0,1){\displaystyle X\sim \operatorname {Logistic} (0,1)}entoncesbincógnitaLogístico(0,b).{\displaystyle bX\sim \operatorname {Logistic} (0,b).}Esto significa que el efecto de usar una variable de error con un parámetro de escala arbitrario en lugar de la escala 1 se puede compensar simplemente multiplicando todos los vectores de regresión por la misma escala. Junto con lo anterior, esto demuestra que el uso de una distribución estándar de valores extremos (ubicación 0, escala 1) para las variables de error no implica ninguna pérdida de generalidad en comparación con el uso de una distribución arbitraria de valores extremos. De hecho, el modelo no es identificable (no existe un único conjunto de coeficientes óptimos) si se utiliza la distribución más general.
  3. Dado que solo se utilizan las diferencias entre los vectores de coeficientes de regresión, añadir una constante arbitraria a todos los vectores de coeficientes no afecta al modelo. Esto significa que, al igual que en el modelo log-lineal, solo K  1 de los vectores de coeficientes son identificables, y el último puede tomar un valor arbitrario (por ejemplo, 0).

De hecho, hallar los valores de las probabilidades anteriores resulta algo difícil, y se trata de calcular una estadística de orden particular (la primera, es decir, la máxima) de un conjunto de valores. Sin embargo, se puede demostrar que las expresiones resultantes son idénticas a las formulaciones anteriores, es decir, son equivalentes.

Estimación de la intersección

Al utilizar la regresión logística multinomial, se elige una categoría de la variable dependiente como categoría de referencia. Se determinan razones de probabilidad independientes para cada categoría de la variable dependiente, con la excepción de la categoría de referencia, que se omite del análisis. El coeficiente beta exponencial representa el cambio en la probabilidad de que la variable dependiente pertenezca a una categoría determinada en comparación con la categoría de referencia, asociado a un cambio de una unidad en la variable independiente correspondiente.

Función de verosimilitud

Los valores observadosyi{1,,K}{\displaystyle y_{i}\in \{1,\dots ,K\}}parai=1,,norte{\displaystyle i=1,\dots ,n}Las variables explicadas se consideran realizaciones de variables aleatorias estocásticamente independientes y distribuidas categóricamente.Y1,,Ynorte{\displaystyle Y_{1},\dots ,Y_{n}}.

La función de verosimilitud para este modelo se define por

L=i=1nortePAG(Yi=yi)=i=1nortej=1KPAG(Yi=j)δj,yi,{\displaystyle L=\prod _{i=1}^{n}P(Y_{i}=y_{i})=\prod _{i=1}^{n}\prod _{j=1}^{K}P(Y_{i}=j)^{\delta _{j,y_{i}}},}

donde el índicei{\displaystyle i}denota las observaciones 1 a n y el índicej{\displaystyle j}denota las clases 1 a K.δj,yi={1, para j=yi0, de lo contrario{\displaystyle \delta _{j,y_{i}}={\begin{cases}1,{\text{ for }}j=y_{i}\\0,{\text{ otherwise}}\end{cases}}}es el delta de Kronecker .

Por lo tanto, la función de log-verosimilitud negativa es la conocida entropía cruzada:

registroL=i=1nortej=1Kδj,yiregistro(PAG(Yi=j))=j=1Kyi=jregistro(PAG(Yi=j)).{\displaystyle -\log L=-\sum _{i=1}^{n}\sum _{j=1}^{K}\delta _{j,y_{i}}\log(P(Y_{i}=j))=-\sum _{j=1}^{K}\sum _{y_{i}=j}\log(P(Y_{i}=j)).}

Aplicación en el procesamiento del lenguaje natural

En el procesamiento del lenguaje natural , los clasificadores LR multinomiales se utilizan comúnmente como alternativa a los clasificadores bayesianos ingenuos porque no asumen la independencia estadística de las variables aleatorias (comúnmente conocidas como características ) que sirven como predictores. Sin embargo, el aprendizaje en dicho modelo es más lento que para un clasificador bayesiano ingenuo y, por lo tanto, puede no ser apropiado dado un número muy grande de clases para aprender. En particular, el aprendizaje en un clasificador bayesiano ingenuo es una cuestión simple de contar el número de coocurrencias de características y clases, mientras que en un clasificador de entropía máxima los pesos, que normalmente se maximizan utilizando la estimación de máxima a posteriori (MAP), deben aprenderse utilizando un procedimiento iterativo; ver #Estimación de los coeficientes .

Véase también

Referencias

  1. Greene, William H. (2012). Análisis econométrico (Séptima  ed.). Boston: Pearson Education. pp. 803–806 . ISBN  978-0-273-75356-8.
  2. Engel, J. (1988). "Regresión logística politómica". Statistica Neerlandica . 42 (4): 233– 252. doi : 10.1111/j.1467-9574.1988.tb01238.x .
  3. Menard, Scott (2002). Análisis de regresión logística aplicada . SAGE. pág . 91. ISBN  9780761922087.
  4. 1 2 Malouf, Robert (2002). Una comparación de algoritmos para la estimación de parámetros de entropía máxima (PDF) . Sexta Conferencia sobre Aprendizaje del Lenguaje Natural (CoNLL). págs. 49–55 . 
  5. Belsley, David (1991). Diagnóstico del condicionamiento : colinealidad y datos débiles en la regresión . Nueva York: Wiley. ISBN  9780471528890.
  6. Baltas, G.; Doyle, P. (2001). "Modelos de utilidad aleatoria en la investigación de marketing: una revisión". Journal of Business Research . 51 (2): 115– 125. doi : 10.1016/S0148-2963(99)00058-2 .
  7. Manual de Stata “mlogit — Regresión logística multinomial (politómica)”
  8. Darroch, JN y Ratcliff, D. (1972). "Escalado iterativo generalizado para modelos log-lineales" . The Annals of Mathematical Statistics . 43 (5): 1470– 1480. doi : 10.1214/aoms/1177692379 .
  9. Bishop, Christopher M. (2006). Reconocimiento de patrones y aprendizaje automático . Springer. págs. 206–209 . 
  10. Yu, Hsiang-Fu; Huang, Fang-Lan; Lin, Chih-Jen (2011). "Métodos de descenso de coordenadas duales para modelos de regresión logística y entropía máxima" (PDF) . Machine Learning . 85 ( 1–2 ): 41–75 . doi : 10.1007/s10994-010-5221-8 .