Articulo de referencia

Regresión logística

Ejemplo de gráfico de una curva de regresión logística ajustada a los datos. La curva muestra la probabilidad estimada de aprobar un examen (variable dependiente binaria) frente...

Ejemplo de gráfico de una curva de regresión logística ajustada a los datos. La curva muestra la probabilidad estimada de aprobar un examen (variable dependiente binaria) frente a las horas de estudio (variable independiente escalar). Véase el  ejemplo para más detalles.

En estadística , un modelo logístico (o modelo logit ) es un modelo estadístico que modela las probabilidades logarítmicas de un evento como una combinación lineal de una o más variables independientes . En el análisis de regresión , la regresión logística [ 1 ] (o regresión logit ) estima los parámetros de un modelo logístico (los coeficientes en las combinaciones lineales o no lineales). En la regresión logística binaria hay una única variable dependiente binaria , codificada por una variable indicadora , donde los dos valores se etiquetan como "0" y "1", mientras que las variables independientes pueden ser variables binarias (dos clases, codificadas por una variable indicadora) o variables continuas (cualquier valor real). La probabilidad correspondiente del valor etiquetado como "1" puede variar entre 0 (ciertamente el valor "0") y 1 (ciertamente el valor "1"), de ahí la etiqueta; [ 2 ] la función que convierte las probabilidades logarítmicas en probabilidad es la función logística , de ahí su nombre. La unidad de medida para la escala de logaritmos de probabilidades se llama logit , del latín logistic unit , de ahí sus nombres alternativos. Consulte las secciones § Antecedentes y § Definición para obtener información matemática formal, y la sección § Ejemplo para ver un ejemplo resuelto.   

Las variables binarias se utilizan ampliamente en estadística para modelar la probabilidad de que ocurra una determinada clase o evento, como la probabilidad de que un equipo gane, de que un paciente esté sano, etc. (véase §  Aplicaciones ), y el modelo logístico ha sido el modelo más utilizado para la regresión binaria desde aproximadamente 1970. [ 3 ] Las variables binarias se pueden generalizar a variables categóricas cuando hay más de dos valores posibles (por ejemplo, si una imagen es de un gato, un perro, un león, etc.), y la regresión logística binaria se generaliza a la regresión logística multinomial . Si las múltiples categorías están ordenadas , se puede utilizar la regresión logística ordinal (por ejemplo, el modelo logístico ordinal de probabilidades proporcionales [ 4 ] ). Véase §  Extensiones para más extensiones. El modelo de regresión logística en sí mismo simplemente modela la probabilidad de salida en términos de entrada y no realiza una clasificación estadística (no es un clasificador), aunque puede usarse para hacer un clasificador, por ejemplo, eligiendo un valor de corte y clasificando las entradas con probabilidad mayor que el corte como una clase, y por debajo del corte como la otra; esta es una forma común de hacer un clasificador binario .

También se pueden utilizar modelos lineales análogos para variables binarias con una función sigmoide diferente en lugar de la función logística (para convertir la combinación lineal en una probabilidad), en particular el modelo probit ; véase §  Alternativas . La característica definitoria del modelo logístico es que aumentar una de las variables independientes incrementa multiplicativamente las probabilidades del resultado dado a una tasa constante , y cada variable independiente tiene su propio parámetro; para una variable dependiente binaria, esto generaliza la razón de probabilidades . De forma más abstracta, la función logística es el parámetro natural para la distribución de Bernoulli y, en este sentido, es la forma más sencilla de convertir un número real en una probabilidad.

Los parámetros de una regresión logística se estiman más comúnmente mediante la estimación de máxima verosimilitud (EMV). Esta no tiene una expresión de forma cerrada, a diferencia de los mínimos cuadrados lineales ; véase §  Ajuste del modelo . La regresión logística por EMV desempeña un papel básico similar para respuestas binarias o categóricas como lo hace la regresión lineal por mínimos cuadrados ordinarios (MCO) para respuestas escalares : es un modelo base simple y bien analizado; véase §  Comparación con la regresión lineal para más información. La regresión logística como modelo estadístico general fue originalmente desarrollada y popularizada principalmente por Joseph Berkson , [ 5 ] comenzando en Berkson (1944) , donde acuñó "logit"; véase §  Historia .

Aplicaciones

General

La regresión logística se utiliza en diversos campos, incluyendo el aprendizaje automático, la mayoría de las áreas médicas y las ciencias sociales. Por ejemplo, la Escala de Gravedad de Trauma y Lesiones ( TRISS ), ampliamente utilizada para predecir la mortalidad en pacientes lesionados, fue desarrollada originalmente por Boyd et al. utilizando regresión logística. [ 6 ] Muchas otras escalas médicas utilizadas para evaluar la gravedad de un paciente se han desarrollado utilizando regresión logística. [ 7 ] [ 8 ] [ 9 ] [ 10 ] La regresión logística puede utilizarse para predecir el riesgo de desarrollar una determinada enfermedad (por ejemplo, diabetes ; enfermedad coronaria ), basándose en las características observadas del paciente (edad, sexo, índice de masa corporal , resultados de diversas pruebas de sangre , etc.). [ 11 ] [ 12 ] Otro ejemplo podría ser predecir si un votante nepalí votará por el Congreso Nepalí o el Partido Comunista de Nepal o por cualquier otro partido, basándose en la edad, los ingresos, el sexo, la raza, el estado de residencia, los votos en elecciones anteriores, etc. [ 13 ] La técnica también se puede utilizar en ingeniería , especialmente para predecir la probabilidad de fallo de un proceso, sistema o producto determinado. [ 14 ] [ 15 ] También se utiliza en aplicaciones de marketing, como la predicción de la propensión de un cliente a comprar un producto o a cancelar una suscripción, etc. [ 16 ] En economía , se puede utilizar para predecir la probabilidad de que una persona termine en la fuerza laboral, y una aplicación empresarial sería predecir la probabilidad de que un propietario de vivienda incumpla con una hipoteca . Los campos aleatorios condicionales , una extensión de la regresión logística a datos secuenciales, se utilizan en el procesamiento del lenguaje natural . Los planificadores de desastres e ingenieros se basan en estos modelos para predecir las decisiones que toman los propietarios de viviendas u ocupantes de edificios en evacuaciones a pequeña y gran escala, como incendios de edificios, incendios forestales, huracanes, entre otros. [ 17 ] [ 18 ] [ 19 ] Estos modelos ayudan en el desarrollo de planes confiables de gestión de desastres y un diseño más seguro para el entorno construido .

Aprendizaje automático supervisado

La regresión logística es un algoritmo de aprendizaje automático supervisado ampliamente utilizado para tareas de clasificación binaria , como identificar si un correo electrónico es spam o no, y diagnosticar enfermedades evaluando la presencia o ausencia de condiciones específicas según los resultados de las pruebas del paciente. Este enfoque utiliza la función logística (o sigmoide) para transformar una combinación lineal de características de entrada en un valor de probabilidad entre 0 y 1. Esta probabilidad indica la posibilidad de que una entrada dada corresponda a una de dos categorías predefinidas. El mecanismo esencial de la regresión logística se basa en la capacidad de la función logística para modelar con precisión la probabilidad de resultados binarios. Con su distintiva curva en forma de S, la función logística asigna eficazmente cualquier número real a un valor dentro del intervalo de 0 a 1. Esta característica la hace particularmente adecuada para tareas de clasificación binaria, como clasificar correos electrónicos como "spam" o "no spam". Al calcular la probabilidad de que la variable dependiente se clasifique en un grupo específico, la regresión logística proporciona un marco probabilístico que respalda la toma de decisiones informadas. [ 20 ]

Ejemplo

Problema

Como ejemplo sencillo, podemos utilizar una regresión logística con una variable explicativa y dos categorías para responder a la siguiente pregunta:

Un grupo de 20 estudiantes dedica entre 0 y 6 horas a estudiar para un examen. ¿Cómo afecta el número de horas de estudio a la probabilidad de que el estudiante apruebe el examen?

La razón para utilizar la regresión logística en este problema es que los valores de la variable dependiente, aprobado y reprobado, aunque representados por "1" y "0", no son números cardinales . Si el problema se modificara de manera que aprobado/reprobado se reemplazara por una calificación de 0 a 100 (números cardinales), entonces se podría utilizar un análisis de regresión simple.

La tabla muestra el número de horas que cada estudiante dedicó al estudio y si aprobó (1) o suspendió (0).

Deseamos ajustar una función logística a los datos que consisten en las horas estudiadas ( x k ) y el resultado de la prueba ( y k  =1 para aprobado, 0 para suspenso). Los puntos de datos están indexados por el subíndice k que va desdek=1{\displaystyle k=1}ak=K=20{\displaystyle k=K=20}La variable x se denomina " variable explicativa " y la variable y se denomina " variable categórica " ​​que consta de dos categorías: "aprobado" o "suspenso", que corresponden a los valores categóricos 1 y 0 respectivamente.

Modelo

Gráfico de una curva de regresión logística ajustada a los datos ( x m , y m ). La curva muestra la probabilidad de aprobar un examen en función de las horas de estudio.

La función logística tiene la forma:

pag(incógnita)=11+mi(incógnitaμ)/s{\displaystyle p(x)={\frac {1}{1+e^{-(x-\mu )/s}}}}

donde μ es un parámetro de ubicación (el punto medio de la curva, dondepag(μ)=1/2{\displaystyle p(\mu )=1/2}) y s es un parámetro de escala . Esta expresión puede reescribirse como:

pag(incógnita)=11+mi(β0+β1incógnita){\displaystyle p(x)={\frac {1}{1+e^{-(\beta _{0}+\beta _{1}x)}}}}

dóndeβ0=μ/s{\displaystyle \beta _ {0}=-\mu /s}y se conoce como la intersección (es la intersección vertical o intersección con el eje y de la línea).y=β0+β1incógnita{\displaystyle y=\beta _{0}+\beta _{1}x}), yβ1=1/s{\displaystyle \beta _ {1}=1/s}(parámetro de escala inversa o parámetro de tasa ): estos son la intersección con el eje y y la pendiente de las probabilidades logarítmicas en función de x . Por el contrario,μ=β0/β1{\displaystyle \mu =-\beta _{0}/\beta _{1}}ys=1/β1{\displaystyle s=1/\beta _ {1}}.

Tenga en cuenta que este modelo es en realidad una simplificación excesiva, ya que implica que todos los estudiantes aprobarán si estudian indefinidamente (límite = 1).

Adaptar

La medida habitual de bondad de ajuste para una regresión logística utiliza la pérdida logística (o pérdida logarítmica ), el logaritmo negativo de la verosimilitud . Para un x k y un y k dados , escribimos:pagk=pag(incógnitak){\displaystyle p_{k}=p(x_{k})}. Elpagk{\displaystyle p_{k}}son las probabilidades de que el correspondienteyk{\displaystyle y_{k}}será igual a uno, y1pagk{\displaystyle 1-p_{k}}son las probabilidades de que sean cero (véase la distribución de Bernoulli ). Deseamos encontrar los valores deβ0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}}que proporcionan el "mejor ajuste" a los datos. Para comparar un "mejor ajuste" a los datos, véase el caso de la regresión lineal . Allí, la suma de las desviaciones al cuadrado del ajuste a partir de los puntos de datos ( y k ), la pérdida de error al cuadrado , se toma como medida de la bondad del ajuste, y el mejor ajuste se obtiene cuando esta pérdida se minimiza .

La pérdida logarítmica para el k - ésimo puntok{\displaystyle \ell _{k}}es :

k={lnpagk si yk=1,ln(1pagk) si yk=0.{\displaystyle \ell _{k}={\begin{cases}-\ln p_{k}&{\text{ if }}y_{k}=1,\\-\ln(1-p_{k})&{\text{ if }}y_{k}=0.\end{cases}}}

La pérdida logarítmica puede interpretarse como la " sorpresa " del resultado real .yk{\displaystyle y_{k}}en relación con la predicciónpagk{\displaystyle p_{k}} , y es una medida del contenido de información . La pérdida logarítmica siempre es mayor o igual que 0, es igual a 0 solo en caso de una predicción perfecta (es decir, cuandopagk=1{\displaystyle p_{k}=1}yyk=1{\displaystyle y_{k}=1}, opagk=0{\displaystyle p_{k}=0}yyk=0{\displaystyle y_{k}=0}), y se aproxima al infinito a medida que la predicción empeora (es decir, cuandoyk=1{\displaystyle y_{k}=1}ypagk0{\displaystyle p_{k}\to 0}oyk=0{\displaystyle y_{k}=0}ypagk1{\displaystyle p_{k}\to 1}), lo que significa que el resultado real es "más sorprendente". Dado que el valor de la función logística siempre está estrictamente entre cero y uno, la pérdida logarítmica siempre es mayor que cero y menor que infinito. A diferencia de una regresión lineal, donde el modelo puede tener pérdida cero en un punto al pasar por un punto de datos (y pérdida cero en general si todos los puntos están en una línea), en una regresión logística no es posible tener pérdida cero en ningún punto, ya queyk{\displaystyle y_{k}}es 0 o 1, pero0<pagk<1{\displaystyle 0<p_{k}<1}.

Estas expresiones se pueden combinar en una sola:

k=yklnpagk(1yk)ln(1pagk).{\displaystyle \ell _{k}=-y_{k}\ln p_{k}-(1-y_{k})\ln(1-p_{k}).}

Esta expresión se conoce más formalmente como la entropía cruzada de la distribución predicha.(pagk,(1pagk)){\displaystyle {\big (}p_{k},(1-p_{k}){\big )}}de la distribución real(yk,(1yk)){\displaystyle {\big (}y_{k},(1-y_{k}){\big )}}, como distribuciones de probabilidad en el espacio de dos elementos de (aprobar, reprobar).

La suma de estos, la pérdida total, es la log-verosimilitud negativa global .{\displaystyle -\ell } , y el mejor ajuste se obtiene para aquellas elecciones deβ0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}}para el cual{\displaystyle -\ell }se minimiza .​

Alternativamente, en lugar de minimizar la pérdida, se puede maximizar su inversa, la log-verosimilitud (positiva):

=k:yk=1ln(pagk)+k:yk=0ln(1pagk)=k=1K(ykln(pagk)+(1yk)ln(1pagk)){\displaystyle \ell =\sum _{k:y_{k}=1}\ln(p_{k})+\sum _{k:y_{k}=0}\ln(1-p_{k})=\sum _{k=1}^{K}\left(\,y_{k}\ln(p_{k})+(1-y_{k})\ln(1-p_{k})\right)}

o, equivalentemente, maximizar la propia función de verosimilitud , que es la probabilidad de que el conjunto de datos dado sea producido por una función logística particular:

L=k:yk=1pagkk:yk=0(1pagk){\displaystyle L=\prod _{k:y_{k}=1}p_{k}\,\prod _{k:y_{k}=0}(1-p_{k})}

Este método se conoce como estimación de máxima verosimilitud .

Estimación de parámetros

Dado que es no lineal en β0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}} , determinar sus valores óptimos requerirá métodos numéricos. Un método para maximizar es requerir las derivadas de con respecto aβ0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}}ser cero :

0=β0=k=1K(ykpagk){\displaystyle 0={\frac {\partial \ell }{\partial \beta _{0}}}=\sum _{k=1}^{K}(y_{k}-p_{k})}
0=β1=k=1K(ykpagk)incógnitak{\displaystyle 0={\frac {\partial \ell }{\partial \beta _{1}}}=\sum _{k=1}^{K}(y_{k}-p_{k})x_{k}}

y el procedimiento de maximización se puede lograr resolviendo las dos ecuaciones anteriores para β0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}} , lo que, de nuevo, generalmente requerirá el uso de métodos numéricos.

Los valores de β0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}}Las expresiones que maximizan y L utilizando los datos anteriores son las siguientes:

β04.1{\displaystyle \beta _{0}\approx -4.1}
β11.5{\displaystyle \beta _{1}\approx 1.5}

lo que da como resultado un valor para μ y s de:

μ=β0/β12.7{\displaystyle \mu =-\beta _{0}/\beta _{1}\approx 2.7}
s=1/β10,67{\displaystyle s=1/\beta _{1}\approx 0.67}

Predicciones

Elβ0{\displaystyle \beta _{0}}yβ1{\displaystyle \beta _{1}}Los coeficientes pueden introducirse en la ecuación de regresión logística para estimar la probabilidad de aprobar el examen.

Por ejemplo, para un estudiante que estudia 2 horas, al ingresar el valorincógnita=2{\displaystyle x=2}Al sustituir este valor en la ecuación, se obtiene una probabilidad estimada de aprobar el examen de 0,25:

t=β0+2β14.1+21.5=1.1{\displaystyle t=\beta _{0}+2\beta _{1}\approx -4.1+2\cdot 1.5=-1.1}
pag=11+mit0,25=Probabilidad de aprobar el examen{\displaystyle p={\frac {1}{1+e^{-t}}}\approx 0.25={\text{Probability of passing exam}}}

De manera similar, para un estudiante que estudia 4 horas, la probabilidad estimada de aprobar el examen es de 0,87:

t=β0+4β14.1+41.5=1.9{\displaystyle t=\beta _{0}+4\beta _{1}\approx -4.1+4\cdot 1.5=1.9}
pag=11+mit0,87=Probabilidad de aprobar el examen{\displaystyle p={\frac {1}{1+e^{-t}}}\approx 0.87={\text{Probability of passing exam}}}

Esta tabla muestra la probabilidad estimada de aprobar el examen para diferentes valores de horas de estudio.

Evaluación del modelo

El análisis de regresión logística arroja el siguiente resultado.

Según la prueba de Wald , el resultado indica que las horas de estudio están significativamente asociadas con la probabilidad de aprobar el examen (pag=0,017{\displaystyle p=0.017}). En lugar del método de Wald, el método recomendado [ 21 ] para calcular el valor p para la regresión logística es la prueba de razón de verosimilitud (LRT), que para estos datos dapag0,00064{\displaystyle p\approx 0.00064}(Véase el apartado «  Desviación y pruebas de razón de verosimilitud» más adelante).

Generalizaciones

Este modelo simple es un ejemplo de regresión logística binaria y tiene una variable explicativa y una variable categórica binaria que puede asumir uno de dos valores categóricos. La regresión logística multinomial es la generalización de la regresión logística binaria para incluir cualquier número de variables explicativas y cualquier número de categorías.

Fondo

Figura 1. La función logística estándarσ(t){\displaystyle \sigma (t)};σ(t)(0,1){\displaystyle \sigma (t)\in (0,1)}a pesar det{\displaystyle t}.

Definición de la función logística

Una explicación de la regresión logística puede comenzar con una explicación de la función logística estándar . La función logística es una función sigmoide , que toma cualquier valor real de entrada.t{\displaystyle t}y produce un valor entre cero y uno. [ 2 ] Para el logit, esto se interpreta como tomar como entrada el logaritmo de las probabilidades y tener como salida la probabilidad . La función logística estándarσ:R(0,1){\displaystyle \sigma :\mathbb {R} \rightarrow (0,1)} se define de la siguiente manera:

σ(t)=mitmit+1=11+mit{\displaystyle \sigma (t)={\frac {e^{t}}{e^{t}+1}}={\frac {1}{1+e^{-t}}}}

En la Figura 1 se muestra la gráfica de la función logística en el intervalo t (−6,6).

Supongamos quet{\displaystyle t}es una función lineal de una única variable explicativaincógnita{\displaystyle x}(el caso dondet{\displaystyle t}es una combinación lineal de múltiples variables explicativas se trata de manera similar). Entonces podemos expresart{\displaystyle t}como sigue:

t=β0+β1incógnita{\displaystyle t=\beta _{0}+\beta _{1}x}

Y la función logística generalpag:R(0,1){\displaystyle p:\mathbb {R} \rightarrow (0,1)}Ahora se puede escribir como:

pag(incógnita)=σ(t)=11+mi(β0+β1incógnita){\displaystyle p(x)=\sigma (t)={\frac {1}{1+e^{-(\beta _{0}+\beta _{1}x)}}}}

En el modelo logístico,pag(incógnita){\displaystyle p(x)}se interpreta como la probabilidad de la variable dependienteY{\displaystyle Y}lo que equivale a un éxito/caso en lugar de un fracaso/no caso. Está claro que las variables de respuestaYi{\displaystyle Y_{i}}no están distribuidos de forma idéntica:PAG(Yi=1incógnita){\displaystyle P(Y_{i}=1\mid X)}difiere de un punto de datosincógnitai{\displaystyle X_{i}}a otro, aunque son independientes dada la matriz de diseñoincógnita{\displaystyle X}y parámetros compartidosβ{\displaystyle \beta }. [ 11 ]

Definición de la inversa de la función logística

Ahora podemos definir la función logit (logaritmo de las probabilidades) como la inversa.gramo=σ1{\displaystyle g=\sigma ^{-1}}de la función logística estándar. Es fácil ver que satisface:

gramo(pag(incógnita))=σ1(pag(incógnita))=logitpag(incógnita)=ln(pag(incógnita)1pag(incógnita))=β0+β1incógnita,{\displaystyle g(p(x))=\sigma ^{-1}(p(x))=\operatorname {logit} p(x)=\ln \left({\frac {p(x)}{1-p(x)}}\right)=\beta _{0}+\beta _{1}x,}

y, de forma equivalente, después de elevar ambos lados a la potencia tenemos las probabilidades:

pag(incógnita)1pag(incógnita)=miβ0+β1incógnita.{\displaystyle {\frac {p(x)}{1-p(x)}}=e^{\beta _{0}+\beta _{1}x}.}

Interpretación de estos términos

En las ecuaciones anteriores, los términos son los siguientes:

  • gramo{\displaystyle g}es la función logit. La ecuación paragramo(pag(incógnita)){\displaystyle g(p(x))}Esto ilustra que el logit (es decir, el logaritmo de las probabilidades o el logaritmo natural de las probabilidades) es equivalente a la expresión de regresión lineal.
  • ln{\displaystyle \ln }denota el logaritmo natural .
  • pag(incógnita){\displaystyle p(x)}es la probabilidad de que la variable dependiente sea igual a un caso, dada alguna combinación lineal de los predictores. La fórmula parapag(incógnita){\displaystyle p(x)}Esto ilustra que la probabilidad de que la variable dependiente sea igual a un caso es igual al valor de la función logística de la expresión de regresión lineal. Esto es importante porque muestra que el valor de la expresión de regresión lineal puede variar desde menos infinito hasta más infinito y, sin embargo, después de la transformación, la expresión resultante para la probabilidadpag(incógnita){\displaystyle p(x)}varía entre 0 y 1.
  • β0{\displaystyle \beta _{0}}es la intersección de la ecuación de regresión lineal (el valor del criterio cuando el predictor es igual a cero).
  • β1incógnita{\displaystyle \beta _{1}x}es el coeficiente de regresión multiplicado por algún valor del predictor.
  • basemi{\displaystyle e}denota la función exponencial.

Definición de las probabilidades

Las probabilidades de que la variable dependiente sea igual a un caso (dada alguna combinación lineal)incógnita{\displaystyle x}de los predictores) es equivalente a la función exponencial de la expresión de regresión lineal. Esto ilustra cómo el logit sirve como función de enlace entre la probabilidad y la expresión de regresión lineal. Dado que el logit varía entre infinito negativo y positivo, proporciona un criterio adecuado para realizar una regresión lineal y se puede convertir fácilmente de nuevo en probabilidades. [ 2 ]

Entonces definimos las probabilidades de que la variable dependiente sea igual a un caso (dada alguna combinación lineal)incógnita{\displaystyle x}de los predictores) de la siguiente manera:

impares=miβ0+β1incógnita.{\displaystyle {\text{odds}}=e^{\beta _{0}+\beta _{1}x}.}

La razón de probabilidades

Para una variable independiente continua, la razón de probabilidades se puede definir como:

La imagen representa un esquema de cómo se ve una razón de probabilidades por escrito, a través de una plantilla además del ejemplo de puntuación de prueba en la sección "Ejemplo" del contenido. En términos sencillos, si hipotéticamente obtenemos una razón de probabilidades de 2 a 1, podemos decir... "Por cada aumento de una unidad en las horas estudiadas, las probabilidades de aprobar (grupo 1) o reprobar (grupo 0) son (como se espera) de 2 a 1 (Denis, 2019).
OR=impares(incógnita+1)impares(incógnita)=(pag(incógnita+1)1pag(incógnita+1))(pag(incógnita)1pag(incógnita))=miβ0+β1(incógnita+1)miβ0+β1incógnita=miβ1{\displaystyle \mathrm {OR} ={\frac {\operatorname {odds} (x+1)}{\operatorname {odds} (x)}}={\frac {\left({\frac {p(x+1)}{1-p(x+1)}}\right)}{\left({\frac {p(x)}{1-p(x)}}\right)}}={\frac {e^{\beta _{0}+\beta _{1}(x+1)}}{e^{\beta _{0}+\beta _{1}x}}}=e^{\beta _{1}}}

Esta relación exponencial proporciona una interpretación paraβ1{\displaystyle \beta _{1}}: Las probabilidades se multiplican pormiβ1{\displaystyle e^{\beta _{1}}}por cada aumento de 1 unidad en x. [ 22 ]

Para una variable independiente binaria, la razón de probabilidades se define comoadbdo{\displaystyle {\frac {ad}{bc}}}donde a , b , c y d son celdas en una tabla de contingencia de 2×2 . [ 23 ]

Múltiples variables explicativas

Si hay múltiples variables explicativas, la expresión anteriorβ0+β1incógnita{\displaystyle \beta _{0}+\beta _{1}x}puede revisarse aβ0+β1incógnita1+β2incógnita2++βmetroincógnitametro=β0+i=1metroβiincógnitai{\displaystyle \beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2}+\cdots +\beta _{m}x_{m}=\beta _{0}+\sum _{i=1}^{m}\beta _{i}x_{i}}. Entonces, cuando esto se usa en la ecuación que relaciona el logaritmo de las probabilidades de éxito con los valores de los predictores, la regresión lineal será una regresión múltiple con m explicadores; los parámetrosβi{\displaystyle \beta _{i}}a pesar dei=0,1,2,,metro{\displaystyle i=0,1,2,\dots ,m}Todos son estimados.

Nuevamente, las ecuaciones más tradicionales son:

registropag1pag=β0+β1incógnita1+β2incógnita2++βmetroincógnitametro{\displaystyle \log {\frac {p}{1-p}}=\beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2}+\cdots +\beta _{m}x_{m}}

y

pag=11+b(β0+β1incógnita1+β2incógnita2++βmetroincógnitametro){\displaystyle p={\frac {1}{1+b^{-(\beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2}+\cdots +\beta _{m}x_{m})}}}}

donde normalmenteb=mi{\displaystyle b=e}.

Definición

Un conjunto de datos contiene N puntos. Cada punto i consta de un conjunto de m variables de entrada x 1, i ... x m,i (también llamadas variables independientes , variables explicativas, variables predictoras, características o atributos) y una variable de resultado binaria Y i (también conocida como variable dependiente , variable de respuesta, variable de salida o clase), es decir, solo puede tomar los dos valores posibles 0 (que suele significar "no" o "fracaso") o 1 (que suele significar "sí" o "éxito"). El objetivo de la regresión logística es utilizar el conjunto de datos para crear un modelo predictivo de la variable de resultado.

Al igual que en la regresión lineal, se supone que las variables de resultado Y i dependen de las variables explicativas x 1, i ... x m,i .

Variables explicativas

Las variables explicativas pueden ser de cualquier tipo : reales , binarias , categóricas , etc. La principal distinción radica entre variables continuas y variables discretas .

(Las variables discretas que hacen referencia a más de dos opciones posibles se codifican normalmente mediante variables ficticias (o variables indicadoras ); es decir, se crean variables explicativas separadas que toman el valor 0 o 1 para cada valor posible de la variable discreta, donde un 1 significa "la variable tiene el valor dado" y un 0 significa "la variable no tiene ese valor").

Variables de resultado

Formalmente, los resultados Y i se describen como datos con distribución de Bernoulli , donde cada resultado está determinado por una probabilidad no observada p i que es específica para el resultado en cuestión, pero relacionada con las variables explicativas. Esto puede expresarse en cualquiera de las siguientes formas equivalentes:

Yiincógnita1,i,,incógnitametro,i Bernoulli(pagi)mi[Yiincógnita1,i,,incógnitametro,i]=pagiPr(Yi=yincógnita1,i,,incógnitametro,i)={pagisi y=11pagisi y=0Pr(Yi=yincógnita1,i,,incógnitametro,i)=pagiy(1pagi)(1y){\displaystyle {\begin{aligned}Y_{i}\mid x_{1,i},\ldots ,x_{m,i}\ &\sim \operatorname {Bernoulli} (p_{i})\\[5pt]\operatorname {\mathbb {E} } [Y_{i}\mid x_{1,i},\ldots ,x_{m,i}]&=p_{i}\\[5pt]\Pr(Y_{i}=y\mid x_{1,i},\ldots ,x_{m,i})&={\begin{cases}p_{i}&{\text{if }}y=1\\1-p_{i}&{\text{if }}y=0\end{cases}}\\[5pt]\Pr(Y_{i}=y\mid x_{1,i},\ldots ,x_{m,i})&=p_{i}^{y}(1-p_{i})^{(1-y)}\end{aligned}}}

Los significados de estas cuatro líneas son:

  1. La primera línea expresa la distribución de probabilidad de cada Y i  : condicionada a las variables explicativas, sigue una distribución de Bernoulli con parámetros p i , la probabilidad de que el resultado sea 1 para el ensayo i . Como se indicó anteriormente, cada ensayo tiene su propia probabilidad de éxito, al igual que cada ensayo tiene sus propias variables explicativas. La probabilidad de éxito p i no se observa, solo el resultado de un ensayo individual de Bernoulli utilizando dicha probabilidad.
  2. La segunda línea expresa que el valor esperado de cada Y i es igual a la probabilidad de éxito p i , una propiedad general de la distribución de Bernoulli. En otras palabras, si realizamos un gran número de ensayos de Bernoulli con la misma probabilidad de éxito p i y luego calculamos el promedio de todos los resultados 1 y 0, el resultado será cercano a p i . Esto se debe a que calcular el promedio de esta manera simplemente calcula la proporción de éxitos observados, la cual se espera que converja a la probabilidad de éxito subyacente.
  3. La tercera línea describe la función de probabilidad de la distribución de Bernoulli, especificando la probabilidad de observar cada uno de los dos resultados posibles.
  4. La cuarta línea es otra forma de escribir la función de probabilidad, que evita tener que escribir casos separados y resulta más conveniente para ciertos tipos de cálculos. Esto se basa en el hecho de que Y i solo puede tomar el valor 0 o 1. En cada caso, uno de los exponentes será 1, "eligiendo" el valor que se encuentra debajo, mientras que el otro será 0, "cancelando" dicho valor. Por lo tanto, el resultado es p i o 1  p i , como en la línea anterior. 
Función predictora lineal

La idea básica de la regresión logística es utilizar el mecanismo ya desarrollado para la regresión lineal, modelando la probabilidad p i mediante una función predictora lineal , es decir, una combinación lineal de las variables explicativas y un conjunto de coeficientes de regresión específicos del modelo en cuestión, pero iguales para todos los ensayos. La función predictora linealF(i){\displaystyle f(i)}Para un punto de datos particular i , se escribe como:

F(i)=β0+β1incógnita1,i++βmetroincógnitametro,i,{\displaystyle f(i)=\beta _{0}+\beta _{1}x_{1,i}+\cdots +\beta _{m}x_{m,i},}

dóndeβ0,,βmetro{\displaystyle \beta _{0},\ldots ,\beta _{m}}Los coeficientes de regresión indican el efecto relativo de una variable explicativa particular sobre el resultado.

El modelo se suele presentar de forma más compacta de la siguiente manera:

  • Los coeficientes de regresión β 0 , β 1 , ..., β m se agrupan en un único vector β de tamaño m  +  1.
  • Para cada punto de datos i , se agrega una pseudovariable explicativa adicional x 0, i , con un valor fijo de 1, que corresponde al coeficiente de intersección β 0 .
  • Las variables explicativas resultantes x 0, i , x 1, i , ..., x m,i se agrupan luego en un único vector X i de tamaño m  +  1.

Esto permite escribir la función predictora lineal de la siguiente manera:

F(i)=βincógnitai,{\displaystyle f(i)={\boldsymbol {\beta }}\cdot \mathbf {X} _{i},}

utilizando la notación para el producto escalar entre dos vectores.

Este es un ejemplo de la salida de SPSS para un modelo de regresión logística que utiliza tres variables explicativas (consumo de café por semana, consumo de bebidas energéticas por semana y consumo de refrescos por semana) y dos categorías (hombre y mujer).

Muchas variables explicativas, dos categorías

El ejemplo anterior de regresión logística binaria sobre una variable explicativa se puede generalizar a una regresión logística binaria sobre cualquier número de variables explicativas x 1 , x 2 ,... y cualquier número de valores categóricos.y=0,1,2,{\displaystyle y=0,1,2,\dots }.

Para empezar, podemos considerar un modelo logístico con M variables explicativas, x 1 , x 2 ... x M y, como en el ejemplo anterior, dos valores categóricos ( y = 0 y 1 ). Para el modelo de regresión logística binaria simple, asumimos una relación lineal entre la variable predictora y el logaritmo de las probabilidades (también llamado logit ) del evento quey=1{\displaystyle y=1}Esta relación lineal puede extenderse al caso de M variables explicativas:

t=registrobpag1pag=β0+β1incógnita1+β2incógnita2++βMETROincógnitaMETRO{\displaystyle t=\log _{b}{\frac {p}{1-p}}=\beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2}+\cdots +\beta _{M}x_{M}}

donde t es el logaritmo de las probabilidades yβi{\displaystyle \beta _{i}}son parámetros del modelo. Se ha introducido una generalización adicional en la que la base del modelo ( b ) no está restringida al número de Euler e . En la mayoría de las aplicaciones, la baseb{\displaystyle b}El logaritmo se suele tomar como e . Sin embargo, en algunos casos puede ser más fácil comunicar los resultados trabajando en base 2 o base 10.

Para una notación más compacta, especificaremos las variables explicativas y los coeficientes β como (METRO+1){\displaystyle (M+1)}Vectores de -dimensiones :

incógnita={incógnita0,incógnita1,incógnita2,,incógnitaMETRO}{\displaystyle {\boldsymbol {x}}=\{x_{0},x_{1},x_{2},\dots ,x_{M}\}}
β={β0,β1,β2,,βMETRO}{\displaystyle {\boldsymbol {\beta }}=\{\beta _{0},\beta _{1},\beta _{2},\dots ,\beta _{M}\}}

con una variable explicativa añadida x 0 =1. El logit ahora se puede escribir como:

t=metro=0METROβmetroincógnitametro=βincógnita{\displaystyle t=\sum _{m=0}^{M}\beta _{m}x_{m}={\boldsymbol {\beta }}\cdot x}

Resolviendo para la probabilidad p de quey=1{\displaystyle y=1}rendimientos:

pag(incógnita)=bβincógnita1+bβincógnita=11+bβincógnita=Sb(t){\displaystyle p({\boldsymbol {x}})={\frac {b^{{\boldsymbol {\beta }}\cdot {\boldsymbol {x}}}}{1+b^{{\boldsymbol {\beta }}\cdot {\boldsymbol {x}}}}}={\frac {1}{1+b^{-{\boldsymbol {\beta }}\cdot {\boldsymbol {x}}}}}=S_{b}(t)},

dóndeSb{\displaystyle S_{b}}es la función sigmoide con baseb{\displaystyle b}La fórmula anterior muestra que una vez que laβmetro{\displaystyle \beta _{m}}son fijos, podemos calcular fácilmente las probabilidades logarítmicas quey=1{\displaystyle y=1}para una observación dada, o la probabilidad de quey=1{\displaystyle y=1}para una observación dada. El principal caso de uso de un modelo logístico es que se le dé una observación.incógnita{\displaystyle {\boldsymbol {x}}}y estimar la probabilidadpag(incógnita){\displaystyle p({\boldsymbol {x}})}esoy=1{\displaystyle y=1}Los coeficientes beta óptimos pueden encontrarse nuevamente maximizando la log-verosimilitud. Para K mediciones, definiendoincógnitak{\displaystyle {\boldsymbol {x}}_{k}}como el vector explicativo de la k -ésima medición, yyk{\displaystyle y_{k}}Como resultado categórico de esa medición, la verosimilitud logarítmica puede escribirse de una forma muy similar a la simpleMETRO=1{\displaystyle M=1}caso anterior:

=k=1Kykregistrob(pag(incógnitak))+k=1K(1yk)registrob(1pag(incógnitak)){\displaystyle \ell =\sum _{k=1}^{K}y_{k}\log _{b}(p({\boldsymbol {x_{k}}}))+\sum _{k=1}^{K}(1-y_{k})\log _{b}(1-p({\boldsymbol {x_{k}}}))}

Como en el ejemplo sencillo anterior, encontrar los parámetros β óptimos requerirá métodos numéricos. Una técnica útil consiste en igualar a cero las derivadas de la verosimilitud logarítmica con respecto a cada uno de los parámetros β , lo que produce un conjunto de ecuaciones que se cumplen en el valor máximo de la verosimilitud logarítmica:

βmetro=0=k=1Kykincógnitametrokk=1Kpag(incógnitak)incógnitametrok{\displaystyle {\frac {\partial \ell }{\partial \beta _{m}}}=0=\sum _{k=1}^{K}y_{k}x_{mk}-\sum _{k=1}^{K}p({\boldsymbol {x}}_{k})x_{mk}}

donde x mk es el valor de la variable explicativa x m de la k-ésima medición.

Consideremos un ejemplo conMETRO=2{\displaystyle M=2}variables explicativas,b=10{\displaystyle b=10}y coeficientesβ0=3{\displaystyle \beta _{0}=-3},β1=1{\displaystyle \beta _{1}=1}, yβ2=2{\displaystyle \beta _{2}=2}que han sido determinados por el método anterior. Para ser más precisos, el modelo es:

t=registro10pag1pag=3+incógnita1+2incógnita2{\displaystyle t=\log _{10}{\frac {p}{1-p}}=-3+x_{1}+2x_{2}}
pag=bβincógnita1+bβincógnita=bβ0+β1incógnita1+β2incógnita21+bβ0+β1incógnita1+β2incógnita2=11+b(β0+β1incógnita1+β2incógnita2){\displaystyle p={\frac {b^{{\boldsymbol {\beta }}\cdot {\boldsymbol {x}}}}{1+b^{{\boldsymbol {\beta }}\cdot x}}}={\frac {b^{\beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2}}}{1+b^{\beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2}}}}={\frac {1}{1+b^{-(\beta _{0}+\beta _{1}x_{1}+\beta _{2}x_{2})}}}},

donde p es la probabilidad del evento quey=1{\displaystyle y=1}Esto puede interpretarse de la siguiente manera:

  • β0=3{\displaystyle \beta _{0}=-3}es la intersección con el eje y . Es el logaritmo de las probabilidades del evento quey=1{\displaystyle y=1}, cuando los predictoresincógnita1=incógnita2=0{\displaystyle x_{1}=x_{2}=0}Al elevar a la potencia, podemos ver que cuandoincógnita1=incógnita2=0{\displaystyle x_{1}=x_{2}=0}las probabilidades del evento quey=1{\displaystyle y=1}son de 1 a 1000, o103{\displaystyle 10^{-3}}. De manera similar, la probabilidad del evento quey=1{\displaystyle y=1}cuandoincógnita1=incógnita2=0{\displaystyle x_{1}=x_{2}=0}se puede calcular como1/(1000+1)=1/1001.{\displaystyle 1/(1000+1)=1/1001.}
  • β1=1{\displaystyle \beta _{1}=1}significa que aumentarincógnita1{\displaystyle x_{1}}en 1 aumenta las probabilidades logarítmicas en1{\displaystyle 1}. Entonces siincógnita1{\displaystyle x_{1}}aumenta en 1, las probabilidades de quey=1{\displaystyle y=1}aumentar por un factor de101{\displaystyle 10^{1}}. La probabilidad dey=1{\displaystyle y=1}También ha aumentado, pero no tanto como han aumentado las probabilidades.
  • β2=2{\displaystyle \beta _{2}=2}significa que aumentarincógnita2{\displaystyle x_{2}}en 1 aumenta las probabilidades logarítmicas en2{\displaystyle 2}. Entonces siincógnita2{\displaystyle x_{2}}aumenta en 1, las probabilidades de quey=1{\displaystyle y=1}aumentar por un factor de102.{\displaystyle 10^{2}.}Observe cómo el efecto deincógnita2{\displaystyle x_{2}}en el logaritmo de las probabilidades es el doble de grande que el efecto deincógnita1{\displaystyle x_{1}}, pero el efecto sobre las probabilidades es 10 veces mayor. Pero el efecto sobre la probabilidad dey=1{\displaystyle y=1}No es que sea 10 veces mayor, solo el efecto sobre las probabilidades es 10 veces mayor.

Regresión logística multinomial: Muchas variables explicativas y muchas categorías.

En los casos anteriores de dos categorías (regresión logística binomial), las categorías se indexaron con "0" y "1", y teníamos dos probabilidades: La probabilidad de que el resultado estuviera en la categoría 1 estaba dada porpag(incógnita){\displaystyle p({\boldsymbol {x}})}y la probabilidad de que el resultado estuviera en la categoría 0 fue dada por1pag(incógnita){\displaystyle 1-p({\boldsymbol {x}})}La suma de estas probabilidades es igual a 1, lo cual debe ser cierto, ya que "0" y "1" son las únicas categorías posibles en esta configuración.

En general , si tenemosMETRO+1{\displaystyle M+1}Variables explicativas ( incluyendo x 0 ) ynorte+1{\displaystyle N+1} categorías, necesitaremosnorte+1{\displaystyle N+1}Probabilidades separadas, una para cada categoría, indexadas por n , que describen la probabilidad de que el resultado categórico y esté en la categoría y=n , condicionada al vector de covariables x . La suma de estas probabilidades en todas las categorías debe ser igual a 1. Usando la base matemáticamente conveniente e , estas probabilidades son:

pagnorte(incógnita)=miβnorteincógnita1+=1nortemiβincógnita{\displaystyle p_{n}({\boldsymbol {x}})={\frac {e^{{\boldsymbol {\beta }}_{n}\cdot {\boldsymbol {x}}}}{1+\sum _{u=1}^{N}e^{{\boldsymbol {\beta }}_{u}\cdot {\boldsymbol {x}}}}}}paranorte=1,2,,norte{\displaystyle n=1,2,\dots ,N}
pag0(incógnita)=1norte=1nortepagnorte(incógnita)=11+=1nortemiβincógnita{\displaystyle p_{0}({\boldsymbol {x}})=1-\sum _{n=1}^{N}p_{n}({\boldsymbol {x}})={\frac {1}{1+\sum _{u=1}^{N}e^{{\boldsymbol {\beta }}_{u}\cdot {\boldsymbol {x}}}}}}

Cada una de las probabilidades exceptopag0(incógnita){\displaystyle p_{0}({\boldsymbol {x}})}tendrán su propio conjunto de coeficientes de regresiónβnorte{\displaystyle {\boldsymbol {\beta }}_{n}}. Se puede observar que, como se requiere, la suma de lospagnorte(incógnita){\displaystyle p_{n}({\boldsymbol {x}})}sobre todas las categorías n es 1. La selección depag0(incógnita){\displaystyle p_{0}({\boldsymbol {x}})}Definirla en términos de las otras probabilidades es artificial. Cualquiera de las probabilidades podría haberse seleccionado para definirse de esa manera. Este valor especial de n se denomina "índice pivote", y las probabilidades logarítmicas ( t n ) se expresan en términos de la probabilidad pivote y, a su vez, se expresan como una combinación lineal de las variables explicativas:

tnorte=ln(pagnorte(incógnita)pag0(incógnita))=βnorteincógnita{\displaystyle t_{n}=\ln \left({\frac {p_{n}({\boldsymbol {x}})}{p_{0}({\boldsymbol {x}})}}\right)={\boldsymbol {\beta }}_{n}\cdot {\boldsymbol {x}}}

Tenga en cuenta también que para el caso simple denorte=1{\displaystyle N=1}, el caso de dos categorías se recupera, conpag(incógnita)=pag1(incógnita){\displaystyle p({\boldsymbol {x}})=p_{1}({\boldsymbol {x}})}ypag0(incógnita)=1pag1(incógnita){\displaystyle p_{0}({\boldsymbol {x}})=1-p_{1}({\boldsymbol {x}})}.

Ahora se puede calcular la log-verosimilitud de que un conjunto particular de K mediciones o puntos de datos se genere mediante las probabilidades anteriores. Indexando cada medición por k , sea el k -ésimo conjunto de variables explicativas medidas denotado porincógnitak{\displaystyle {\boldsymbol {x}}_{k}}y sus resultados categóricos se denotan poryk{\displaystyle y_{k}}que puede ser igual a cualquier número entero en [0,N]. La verosimilitud logarítmica es entonces:

=k=1Knorte=0norteΔ(norte,yk)ln(pagnorte(incógnitak)){\displaystyle \ell =\sum _{k=1}^{K}\sum _{n=0}^{N}\Delta (n,y_{k})\,\ln(p_{n}({\boldsymbol {x}}_{k}))}

dóndeΔ(norte,yk){\displaystyle \Delta (n,y_{k})}es una función indicadora que es igual a 1 si y k = n y cero en caso contrario. En el caso de dos variables explicativas, esta función indicadora se definió como y k cuando n = 1 y 1-y k cuando n = 0. Esto fue conveniente, pero no necesario. [ 24 ] Nuevamente, los coeficientes beta óptimos pueden encontrarse maximizando la función de log-verosimilitud generalmente mediante métodos numéricos. Un posible método de solución es igualar a cero las derivadas de la log-verosimilitud con respecto a cada coeficiente beta y resolver para los coeficientes beta:

βnortemetro=0=k=1KΔ(norte,yk)incógnitametrokk=1Kpagnorte(incógnitak)incógnitametrok{\displaystyle {\frac {\partial \ell }{\partial \beta _{nm}}}=0=\sum _{k=1}^{K}\Delta (n,y_{k})x_{mk}-\sum _{k=1}^{K}p_{n}({\boldsymbol {x}}_{k})x_{mk}}

dóndeβnortemetro{\displaystyle \beta _{nm}}es el m -ésimo coeficiente de laβnorte{\displaystyle {\boldsymbol {\beta }}_{n}}vector yincógnitametrok{\displaystyle x_{mk}}es la m -ésima variable explicativa de la k -ésima medición. Una vez estimados los coeficientes beta a partir de los datos, podremos estimar la probabilidad de que cualquier conjunto subsiguiente de variables explicativas dé como resultado cualquiera de las posibles categorías de resultados.

Interpretaciones

Existen diversas especificaciones e interpretaciones equivalentes de la regresión logística, que se ajustan a diferentes tipos de modelos más generales y permiten diferentes generalizaciones.

Como un modelo lineal generalizado

El modelo particular utilizado por la regresión logística, que la distingue de la regresión lineal estándar y de otros tipos de análisis de regresión utilizados para resultados binarios , es la forma en que la probabilidad de un resultado particular se vincula con la función predictora lineal:

logit(mi[Yiincógnita1,i,,incógnitametro,i])=logit(pagi)=ln(pagi1pagi)=β0+β1incógnita1,i++βmetroincógnitametro,i{\displaystyle \operatorname {logit} (\operatorname {\mathbb {E} } [Y_{i}\mid x_{1,i},\ldots ,x_{m,i}])=\operatorname {logit} (p_{i})=\ln \left({\frac {p_{i}}{1-p_{i}}}\right)=\beta _{0}+\beta _{1}x_{1,i}+\cdots +\beta _{m}x_{m,i}}

Escrito utilizando la notación más compacta descrita anteriormente, esto es:

logit(mi[Yiincógnitai])=logit(pagi)=ln(pagi1pagi)=βincógnitai{\displaystyle \operatorname {logit} (\operatorname {\mathbb {E} } [Y_{i}\mid \mathbf {X} _{i}])=\operatorname {logit} (p_{i})=\ln \left({\frac {p_{i}}{1-p_{i}}}\right)={\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}

Esta formulación expresa la regresión logística como un tipo de modelo lineal generalizado , que predice variables con varios tipos de distribuciones de probabilidad ajustando una función predictora lineal de la forma anterior a algún tipo de transformación arbitraria del valor esperado de la variable.

La intuición para transformar usando la función logit (el logaritmo natural de las probabilidades) se explicó anteriormente . También tiene el efecto práctico de convertir la probabilidad (que está acotada entre 0 y 1) en una variable que varía entre(,+){\displaystyle (-\infty ,+\infty )}— igualando así el rango potencial de la función de predicción lineal en el lado derecho de la ecuación.

Tanto las probabilidades p i como los coeficientes de regresión no son observables, y el método para determinarlos no forma parte del modelo en sí. Suelen determinarse mediante algún tipo de procedimiento de optimización, por ejemplo, la estimación de máxima verosimilitud , que encuentra los valores que mejor se ajustan a los datos observados (es decir, que dan las predicciones más precisas para los datos ya observados), generalmente sujetos a condiciones de regularización que buscan excluir valores improbables, por ejemplo, valores extremadamente grandes para cualquiera de los coeficientes de regresión. El uso de una condición de regularización es equivalente a realizar una estimación de máxima a posteriori (MAP), una extensión de la máxima verosimilitud. (La regularización se realiza más comúnmente utilizando una función de regularización al cuadrado , que es equivalente a colocar una distribución previa gaussiana de media cero en los coeficientes, pero también son posibles otros regularizadores). Ya sea que se utilice o no la regularización, generalmente no es posible encontrar una solución de forma cerrada; En cambio, debe utilizarse un método numérico iterativo, como el de mínimos cuadrados ponderados iterativamente (IRLS) o, más comúnmente en la actualidad, un método cuasi-Newton como el método L-BFGS . [ 25 ]

La interpretación de las estimaciones del parámetro β j es como el efecto aditivo sobre el logaritmo de las probabilidades para un cambio unitario en la variable explicativa j . En el caso de una variable explicativa dicotómica, por ejemplo, el género.miβ{\displaystyle e^{\beta }}es la estimación de las probabilidades de obtener el resultado, por ejemplo, en hombres en comparación con mujeres.

Una fórmula equivalente utiliza la inversa de la función logit, que es la función logística , es decir:

mi[Yiincógnitai]=pagi=logit1(βincógnitai)=11+miβincógnitai{\displaystyle \operatorname {\mathbb {E} } [Y_{i}\mid \mathbf {X} _{i}]=p_{i}=\operatorname {logit} ^{-1}({\boldsymbol {\beta }}\cdot \mathbf {X} _{i})={\frac {1}{1+e^{-{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}}}

La fórmula también se puede escribir como una distribución de probabilidad (específicamente, utilizando una función de masa de probabilidad ):

Pr(Yi=yincógnitai)=pagiy(1pagi)1y=(miβincógnitai1+miβincógnitai)y(1miβincógnitai1+miβincógnitai)1y=miβincógnitaiy1+miβincógnitai{\displaystyle \Pr(Y_{i}=y\mid \mathbf {X} _{i})={p_{i}}^{y}(1-p_{i})^{1-y}=\left({\frac {e^{{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}{1+e^{{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}}\right)^{y}\left(1-{\frac {e^{{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}{1+e^{{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}}\right)^{1-y}={\frac {e^{{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}\cdot y}}{1+e^{{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}}}

Como modelo de variables latentes

El modelo logístico tiene una formulación equivalente como modelo de variables latentes . Esta formulación es común en la teoría de los modelos de elección discreta y facilita su extensión a ciertos modelos más complejos con múltiples elecciones correlacionadas, así como la comparación de la regresión logística con el modelo probit, estrechamente relacionado .

Imagina que, para cada ensayo i , existe una variable latente continua Y i * (es decir, una variable aleatoria no observada ) que se distribuye de la siguiente manera:

Yi=βincógnitai+εi{\displaystyle Y_{i}^{\ast }={\boldsymbol {\beta }}\cdot \mathbf {X} _{i}+\varepsilon _{i}\,}

dónde

εiLogístico(0,1){\displaystyle \varepsilon _{i}\sim \operatorname {Logistic} (0,1)\,}

es decir, la variable latente se puede escribir directamente en términos de la función predictora lineal y una variable de error aleatorio aditivo que se distribuye según una distribución logística estándar .

Entonces , Y i puede considerarse un indicador de si esta variable latente es positiva:

Yi={1si Yi>0  es decir εi<βincógnitai,0de lo contrario.{\displaystyle Y_{i}={\begin{cases}1&{\text{if }}Y_{i}^{\ast }>0\ {\text{ i.e. }}{-\varepsilon _{i}}<{\boldsymbol {\beta }}\cdot \mathbf {X} _{i},\\0&{\text{otherwise.}}\end{cases}}}

La elección de modelar la variable de error específicamente con una distribución logística estándar, en lugar de una distribución logística general con la ubicación y la escala establecidas en valores arbitrarios, parece restrictiva, pero de hecho, no lo es. Hay que tener en cuenta que podemos elegir nosotros mismos los coeficientes de regresión y, muy a menudo, podemos usarlos para compensar los cambios en los parámetros de la distribución de la variable de error. Por ejemplo, una distribución logística de la variable de error con un parámetro de ubicación distinto de cero μ (que establece la media) es equivalente a una distribución con un parámetro de ubicación cero, donde μ se ha añadido al coeficiente de la intersección. Ambas situaciones producen el mismo valor para Y i * independientemente de la configuración de las variables explicativas. Del mismo modo, un parámetro de escala arbitrario s es equivalente a establecer el parámetro de escala en 1 y luego dividir todos los coeficientes de regresión por s . En este último caso, el valor resultante de Y i * será menor por un factor de s que en el caso anterior, para todos los conjuntos de variables explicativas, pero, fundamentalmente, siempre permanecerá del mismo lado de 0 y, por lo tanto, conducirá a la misma elección de Y i .

(Esto predice que la irrelevancia del parámetro de escala puede no trasladarse a modelos más complejos donde haya más de dos opciones disponibles).

Resulta que esta formulación es exactamente equivalente a la anterior, expresada en términos del modelo lineal generalizado y sin variables latentes . Esto se puede demostrar de la siguiente manera, utilizando el hecho de que la función de distribución acumulada (FDA) de la distribución logística estándar es la función logística , que es la inversa de la función logit , es decir

Pr(εi<incógnita)=logit1(incógnita){\displaystyle \Pr(\varepsilon _{i}<x)=\operatorname {logit} ^{-1}(x)}

Entonces:

Pr(Yi=1incógnitai)=Pr(Yi>0incógnitai)=Pr(βincógnitai+εi>0)=Pr(εi>βincógnitai)=Pr(εi<βincógnitai)(porque la distribución logística es simétrica)=logit1(βincógnitai)=pagi(ver arriba){\displaystyle {\begin{aligned}\Pr(Y_{i}=1\mid \mathbf {X} _{i})&=\Pr(Y_{i}^{\ast }>0\mid \mathbf {X} _{i})\\[5pt]&=\Pr({\boldsymbol {\beta }}\cdot \mathbf {X} _{i}+\varepsilon _{i}>0)\\[5pt]&=\Pr(\varepsilon _{i}>-{\boldsymbol {\beta }}\cdot \mathbf {X} _{i})\\[5pt]&=\Pr(\varepsilon _{i}<{\boldsymbol {\beta }}\cdot \mathbf {X} _{i})&&{\text{(because the logistic distribution is symmetric)}}\\[5pt]&=\operatorname {logit} ^{-1}({\boldsymbol {\beta }}\cdot \mathbf {X} _{i})&\\[5pt]&=p_{i}&&{\text{(see above)}}\end{aligned}}}

Esta formulación —estándar en los modelos de elección discreta— aclara la relación entre la regresión logística (el "modelo logit") y el modelo probit , que utiliza una variable de error distribuida según una distribución normal estándar en lugar de una distribución logística estándar. Tanto la distribución logística como la normal son simétricas, con una forma unimodal básica en forma de campana. La única diferencia radica en que la distribución logística presenta colas algo más pesadas , lo que implica que es menos sensible a los datos atípicos (y, por lo tanto, algo más robusta ante especificaciones incorrectas del modelo o datos erróneos).

Modelo de variables latentes bidireccional

Otra formulación utiliza dos variables latentes separadas:

Yi0=β0incógnitai+ε0Yi1=β1incógnitai+ε1{\displaystyle {\begin{aligned}Y_{i}^{0\ast }&={\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}+\varepsilon _{0}\,\\Y_{i}^{1\ast }&={\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}+\varepsilon _{1}\,\end{aligned}}}

dónde

ε0Vehículo eléctrico1(0,1)ε1Vehículo eléctrico1(0,1){\displaystyle {\begin{aligned}\varepsilon _{0}&\sim \operatorname {EV} _{1}(0,1)\\\varepsilon _{1}&\sim \operatorname {EV} _{1}(0,1)\end{aligned}}}

donde EV 1 (0,1) es una distribución de valores extremos de tipo 1 estándar : es decir

Pr(ε0=incógnita)=Pr(ε1=incógnita)=miincógnitamimiincógnita{\displaystyle \Pr(\varepsilon _{0}=x)=\Pr(\varepsilon _{1}=x)=e^{-x}e^{-e^{-x}}}

Entonces

Yi={1si Yi1>Yi0,0de lo contrario.{\displaystyle Y_{i}={\begin{cases}1&{\text{if }}Y_{i}^{1\ast }>Y_{i}^{0\ast },\\0&{\text{otherwise.}}\end{cases}}}

Este modelo cuenta con una variable latente independiente y un conjunto distinto de coeficientes de regresión para cada posible resultado de la variable dependiente. Esta separación facilita la extensión de la regresión logística a variables categóricas con múltiples resultados, como en el modelo logit multinomial . En dicho modelo, resulta natural modelar cada posible resultado utilizando un conjunto diferente de coeficientes de regresión. También es posible justificar cada una de las variables latentes como la utilidad teórica asociada a la elección correspondiente, y así fundamentar la regresión logística en la teoría de la utilidad . (Según esta teoría, un agente racional siempre elige la opción con la mayor utilidad asociada). Este es el enfoque que adoptan los economistas al formular modelos de elección discreta , ya que proporciona una base teórica sólida y facilita la comprensión intuitiva del modelo, lo que a su vez permite considerar diversas extensiones. (Véase el ejemplo a continuación).

La elección de la distribución de valores extremos de tipo 1 parece bastante arbitraria, pero hace que las matemáticas funcionen y puede ser posible justificar su uso a través de la teoría de la elección racional .

Resulta que este modelo es equivalente al modelo anterior, aunque esto no parezca obvio, ya que ahora hay dos conjuntos de coeficientes de regresión y variables de error, y las variables de error tienen una distribución diferente. De hecho, este modelo se reduce directamente al anterior con las siguientes sustituciones:

β=β1β0{\displaystyle {\boldsymbol {\beta }}={\boldsymbol {\beta }}_{1}-{\boldsymbol {\beta }}_{0}}
ε=ε1ε0{\displaystyle \varepsilon =\varepsilon _{1}-\varepsilon _{0}}

Una intuición para esto proviene del hecho de que, dado que elegimos basándonos en el máximo de dos valores, solo importa su diferencia, no los valores exactos, y esto efectivamente elimina un grado de libertad . Otro hecho crítico es que la diferencia de dos variables con distribución de valores extremos de tipo 1 es una distribución logística, es decirε=ε1ε0Logístico(0,1).{\displaystyle \varepsilon =\varepsilon _{1}-\varepsilon _{0}\sim \operatorname {Logistic} (0,1).}Podemos demostrar el equivalente de la siguiente manera:

Pr(Yi=1incógnitai)=Pr(Yi1>Yi0incógnitai)=Pr(Yi1Yi0>0incógnitai)=Pr(β1incógnitai+ε1(β0incógnitai+ε0)>0)=Pr((β1incógnitaiβ0incógnitai)+(ε1ε0)>0)=Pr((β1β0)incógnitai+(ε1ε0)>0)=Pr((β1β0)incógnitai+ε>0)(sustituto ε como se indicó anteriormente)=Pr(βincógnitai+ε>0)(sustituto β como se indicó anteriormente)=Pr(ε>βincógnitai)(ahora, igual que el modelo anterior)=Pr(ε<βincógnitai)=logit1(βincógnitai)=pagi{\displaystyle {\begin{aligned}\Pr(Y_{i}=1\mid \mathbf {X} _{i})={}&\Pr \left(Y_{i}^{1\ast }>Y_{i}^{0\ast }\mid \mathbf {X} _{i}\right)&\\[5pt]={}&\Pr \left(Y_{i}^{1\ast }-Y_{i}^{0\ast }>0\mid \mathbf {X} _{i}\right)&\\[5pt]={}&\Pr \left({\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}+\varepsilon _{1}-\left({\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}+\varepsilon _{0}\right)>0\right)&\\[5pt]={}&\Pr \left(({\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}-{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i})+(\varepsilon _{1}-\varepsilon _{0})>0\right)&\\[5pt]={}&\Pr(({\boldsymbol {\beta }}_{1}-{\boldsymbol {\beta }}_{0})\cdot \mathbf {X} _{i}+(\varepsilon _{1}-\varepsilon _{0})>0)&\\[5pt]={}&\Pr(({\boldsymbol {\beta }}_{1}-{\boldsymbol {\beta }}_{0})\cdot \mathbf {X} _{i}+\varepsilon >0)&&{\text{(substitute }}\varepsilon {\text{ as above)}}\\[5pt]={}&\Pr({\boldsymbol {\beta }}\cdot \mathbf {X} _{i}+\varepsilon >0)&&{\text{(substitute }}{\boldsymbol {\beta }}{\text{ as above)}}\\[5pt]={}&\Pr(\varepsilon >-{\boldsymbol {\beta }}\cdot \mathbf {X} _{i})&&{\text{(now, same as above model)}}\\[5pt]={}&\Pr(\varepsilon <{\boldsymbol {\beta }}\cdot \mathbf {X} _{i})&\\[5pt]={}&\operatorname {logit} ^{-1}({\boldsymbol {\beta }}\cdot \mathbf {X} _{i})\\[5pt]={}&p_{i}\end{aligned}}}

Como un modelo "log-lineal"

Otra formulación combina la formulación de variables latentes bidireccionales anterior con la formulación original más arriba sin variables latentes y, en el proceso, proporciona un vínculo con una de las formulaciones estándar del logit multinomial .

Aquí, en lugar de escribir el logit de las probabilidades p i como un predictor lineal, separamos el predictor lineal en dos, uno para cada uno de los dos resultados:

lnPr(Yi=0)=β0incógnitailnZlnPr(Yi=1)=β1incógnitailnZ{\displaystyle {\begin{aligned}\ln \Pr(Y_{i}=0)&={\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}-\ln Z\\\ln \Pr(Y_{i}=1)&={\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}-\ln Z\end{aligned}}}

Se han introducido dos conjuntos separados de coeficientes de regresión, al igual que en el modelo de variable latente bidireccional, y las dos ecuaciones aparecen en una forma que escribe el logaritmo de la probabilidad asociada como un predictor lineal, con un término adicional.lnZ{\displaystyle -\ln Z}al final. Este término, como se verá, sirve como factor de normalización, asegurando que el resultado sea una distribución. Esto se puede observar elevando ambos lados a la potencia:

Pr(Yi=0)=1Zmiβ0incógnitaiPr(Yi=1)=1Zmiβ1incógnitai{\displaystyle {\begin{aligned}\Pr(Y_{i}=0)&={\frac {1}{Z}}e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}\\[5pt]\Pr(Y_{i}=1)&={\frac {1}{Z}}e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}\end{aligned}}}

En esta forma queda claro que el propósito de Z es asegurar que la distribución resultante sobre Y i sea de hecho una distribución de probabilidad , es decir, que sume 1. Esto significa que Z es simplemente la suma de todas las probabilidades no normalizadas, y al dividir cada probabilidad por Z , las probabilidades se vuelven " normalizadas ". Es decir:

Z=miβ0incógnitai+miβ1incógnitai{\displaystyle Z=e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}

y las ecuaciones resultantes son

Pr(Yi=0)=miβ0incógnitaimiβ0incógnitai+miβ1incógnitaiPr(Yi=1)=miβ1incógnitaimiβ0incógnitai+miβ1incógnitai.{\displaystyle {\begin{aligned}\Pr(Y_{i}=0)&={\frac {e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}}{e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}}\\[5pt]\Pr(Y_{i}=1)&={\frac {e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}{e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}}.\end{aligned}}}

O en general:

Pr(Yi=do)=miβdoincógnitaihmiβhincógnitai{\displaystyle \Pr(Y_{i}=c)={\frac {e^{{\boldsymbol {\beta }}_{c}\cdot \mathbf {X} _{i}}}{\sum _{h}e^{{\boldsymbol {\beta }}_{h}\cdot \mathbf {X} _{i}}}}}

Esto muestra claramente cómo generalizar esta formulación a más de dos resultados, como en el logit multinomial . Esta formulación general es exactamente la función softmax como en

Pr(Yi=do)=softmax(do,β0incógnitai,β1incógnitai,).{\displaystyle \Pr(Y_{i}=c)=\operatorname {softmax} (c,{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i},{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i},\dots ).}

Para demostrar que esto es equivalente al modelo anterior, comenzamos reconociendo que el modelo anterior está sobreespecificado, en el sentido de quePr(Yi=0){\displaystyle \Pr(Y_{i}=0)}yPr(Yi=1){\displaystyle \Pr(Y_{i}=1)}no se puede especificar de forma independiente: más bienPr(Yi=0)+Pr(Yi=1)=1{\displaystyle \Pr(Y_{i}=0)+\Pr(Y_{i}=1)=1}por lo que conocer uno determina automáticamente el otro. Como resultado, el modelo no es identificable , en el sentido de que existen múltiples combinaciones deβ0{\displaystyle {\boldsymbol {\beta }}_{0}}yβ1{\displaystyle {\boldsymbol {\beta }}_{1}}producirá las mismas probabilidades para todas las posibles variables explicativas. De hecho, se puede observar que sumar cualquier vector constante a ambas producirá las mismas probabilidades:

Pr(Yi=1)=mi(β1+do)incógnitaimi(β0+do)incógnitai+mi(β1+do)incógnitai=miβ1incógnitaimidoincógnitaimiβ0incógnitaimidoincógnitai+miβ1incógnitaimidoincógnitai=midoincógnitaimiβ1incógnitaimidoincógnitai(miβ0incógnitai+miβ1incógnitai)=miβ1incógnitaimiβ0incógnitai+miβ1incógnitai.{\displaystyle {\begin{aligned}\Pr(Y_{i}=1)&={\frac {e^{({\boldsymbol {\beta }}_{1}+\mathbf {C} )\cdot \mathbf {X} _{i}}}{e^{({\boldsymbol {\beta }}_{0}+\mathbf {C} )\cdot \mathbf {X} _{i}}+e^{({\boldsymbol {\beta }}_{1}+\mathbf {C} )\cdot \mathbf {X} _{i}}}}\\[5pt]&={\frac {e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}}{e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}e^{\mathbf {C} \cdot \mathbf {X} _{i}}}}\\[5pt]&={\frac {e^{\mathbf {C} \cdot \mathbf {X} _{i}}e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}{e^{\mathbf {C} \cdot \mathbf {X} _{i}}(e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}})}}\\[5pt]&={\frac {e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}{e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}}.\end{aligned}}}

Como resultado, podemos simplificar las cosas y restaurar la identificabilidad eligiendo un valor arbitrario para uno de los dos vectores. Elegimos establecerβ0=0.{\displaystyle {\boldsymbol {\beta }}_{0}=\mathbf {0} .} Entonces,

miβ0incógnitai=mi0incógnitai=1{\displaystyle e^{{\boldsymbol {\beta }}_{0}\cdot \mathbf {X} _{i}}=e^{\mathbf {0} \cdot \mathbf {X} _{i}}=1}

y entonces

Pr(Yi=1)=miβ1incógnitai1+miβ1incógnitai=11+miβ1incógnitai=pagi{\displaystyle \Pr(Y_{i}=1)={\frac {e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}{1+e^{{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}}={\frac {1}{1+e^{-{\boldsymbol {\beta }}_{1}\cdot \mathbf {X} _{i}}}}=p_{i}}

lo que demuestra que esta formulación es efectivamente equivalente a la formulación anterior. (Como en la formulación de variable latente bidireccional, cualquier configuración dondeβ=β1β0{\displaystyle {\boldsymbol {\beta }}={\boldsymbol {\beta }}_{1}-{\boldsymbol {\beta }}_{0}}producirá resultados equivalentes.)

La mayoría de los análisis del modelo logit multinomial parten de la extensión de la formulación "log-lineal" presentada aquí o de la formulación con variables latentes bidireccionales presentada anteriormente, ya que ambas muestran claramente cómo se puede extender el modelo a resultados multidireccionales. En general, la presentación con variables latentes es más común en econometría y ciencias políticas , donde predominan los modelos de elección discreta y la teoría de la utilidad , mientras que la formulación "log-lineal" aquí presentada es más común en informática , por ejemplo , en aprendizaje automático y procesamiento del lenguaje natural .

Como un perceptrón de una sola capa

El modelo tiene una formulación equivalente

pagi=11+mi(β0+β1incógnita1,i++βkincógnitak,i).{\displaystyle p_{i}={\frac {1}{1+e^{-(\beta _{0}+\beta _{1}x_{1,i}+\cdots +\beta _{k}x_{k,i})}}}.\,}

Esta forma funcional se conoce comúnmente como perceptrón de una sola capa o red neuronal artificial de una sola capa . Una red neuronal de una sola capa calcula una salida continua en lugar de una función escalonada . La derivada de p i con respecto a X  =  ( x 1 , ..., x k ) se calcula a partir de la forma general:

y=11+miF(incógnita){\displaystyle y={\frac {1}{1+e^{-f(X)}}}}

donde f ( X ) es una función analítica en X. Con esta elección, la red neuronal de una sola capa es idéntica al modelo de regresión logística. Esta función tiene una derivada continua, lo que permite utilizarla en la retropropagación . Esta función también es la preferida porque su derivada se calcula fácilmente:

dydincógnita=y(1y)dFdincógnita.{\displaystyle {\frac {\mathrm {d} y}{\mathrm {d} X}}=y(1-y){\frac {\mathrm {d} f}{\mathrm {d} X}}.\,}

En términos de datos binomiales

Un modelo estrechamente relacionado supone que cada i está asociado no con un único ensayo de Bernoulli, sino con n i ensayos independientes e idénticamente distribuidos , donde la observación Y i es el número de éxitos observados (la suma de las variables aleatorias individuales distribuidas según Bernoulli) y, por lo tanto, sigue una distribución binomial :

YiPapelera(nortei,pagi), para i=1,,norte{\displaystyle Y_{i}\,\sim \operatorname {Bin} (n_{i},p_{i}),{\text{ for }}i=1,\dots ,n}

Un ejemplo de esta distribución es la fracción de semillas ( p i ) que germinan después de que se plantan n i .

En términos de valores esperados , este modelo se expresa de la siguiente manera:

pagi=mi[Yinortei|incógnitai],{\displaystyle p_{i}=\operatorname {\mathbb {E} } \left[\left.{\frac {Y_{i}}{n_{i}}}\,\right|\,\mathbf {X} _{i}\right]\,,}

de modo que

logit(mi[Yinortei|incógnitai])=logit(pagi)=ln(pagi1pagi)=βincógnitai,{\displaystyle \operatorname {logit} \left(\operatorname {\mathbb {E} } \left[\left.{\frac {Y_{i}}{n_{i}}}\,\right|\,\mathbf {X} _{i}\right]\right)=\operatorname {logit} (p_{i})=\ln \left({\frac {p_{i}}{1-p_{i}}}\right)={\boldsymbol {\beta }}\cdot \mathbf {X} _{i}\,,}

O equivalentemente:

Pr(Yi=yincógnitai)=(norteiy)pagiy(1pagi)norteiy=(norteiy)(11+miβincógnitai)y(111+miβincógnitai)norteiy.{\displaystyle \Pr(Y_{i}=y\mid \mathbf {X} _{i})={n_{i} \choose y}p_{i}^{y}(1-p_{i})^{n_{i}-y}={n_{i} \choose y}\left({\frac {1}{1+e^{-{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}}\right)^{y}\left(1-{\frac {1}{1+e^{-{\boldsymbol {\beta }}\cdot \mathbf {X} _{i}}}}\right)^{n_{i}-y}\,.}

Este modelo se puede ajustar utilizando los mismos métodos que el modelo más básico descrito anteriormente.

Ajuste del modelo

Estimación de máxima verosimilitud (EMV)

Los coeficientes de regresión se suelen estimar mediante la estimación de máxima verosimilitud . [ 26 ] [ 27 ] A diferencia de la regresión lineal con residuos distribuidos normalmente, no es posible encontrar una expresión analítica para los valores de los coeficientes que maximizan la función de verosimilitud, por lo que se debe utilizar un proceso iterativo; por ejemplo, el método de Newton . Este proceso comienza con una solución tentativa, la revisa ligeramente para ver si se puede mejorar y repite esta revisión hasta que no se produzcan más mejoras, momento en el que se dice que el proceso ha convergido. [ 26 ]

En algunos casos, el modelo puede no converger. La falta de convergencia indica que los coeficientes no son significativos porque el proceso iterativo no pudo encontrar soluciones adecuadas. La falta de convergencia puede deberse a varias razones: una proporción elevada de predictores respecto a los casos, multicolinealidad , escasez de datos o separación completa .

  • Una elevada proporción de variables respecto a los casos da como resultado una estadística de Wald excesivamente conservadora (que se analiza más adelante) y puede provocar la falta de convergencia. La regresión logística regularizada está diseñada específicamente para este tipo de situaciones.
  • La multicolinealidad se refiere a correlaciones inaceptablemente altas entre predictores. A medida que aumenta la multicolinealidad, los coeficientes permanecen insesgados, pero los errores estándar aumentan y la probabilidad de convergencia del modelo disminuye. [ 26 ] Para detectar la multicolinealidad entre los predictores, se puede realizar un análisis de regresión lineal con los predictores de interés con el único propósito de examinar el estadístico de tolerancia [ 26 ] utilizado para evaluar si la multicolinealidad es inaceptablemente alta.
  • La escasez de datos se refiere a la presencia de una gran proporción de celdas vacías (celdas con recuentos cero). Los recuentos cero de celdas son particularmente problemáticos con predictores categóricos. Con predictores continuos, el modelo puede inferir valores para los recuentos cero de celdas, pero esto no ocurre con los predictores categóricos. El modelo no convergerá con recuentos cero de celdas para predictores categóricos porque el logaritmo natural de cero es un valor indefinido, por lo que no se puede alcanzar la solución final del modelo. Para remediar este problema, los investigadores pueden agrupar las categorías de una manera teóricamente significativa o agregar una constante a todas las celdas. [ 26 ]
  • Otro problema numérico que puede provocar una falta de convergencia es la separación completa, que se refiere al caso en que los predictores predicen perfectamente el criterio  : todos los casos se clasifican con precisión y la verosimilitud se maximiza con coeficientes infinitos. En tales casos, conviene reexaminar los datos, ya que puede existir algún tipo de error. [ 2 ]
  • También se pueden adoptar enfoques semiparamétricos o no paramétricos, por ejemplo, mediante métodos de verosimilitud local o cuasi-verosimilitud no paramétrica, que evitan las suposiciones de una forma paramétrica para la función índice y son robustos a la elección de la función de enlace (por ejemplo, probit o logit). [ 28 ]

Mínimos cuadrados ponderados iterativamente (IRLS)

Regresión logística binaria (y=0{\displaystyle y=0}oy=1{\displaystyle y=1}) se puede calcular, por ejemplo, utilizando mínimos cuadrados ponderados iterativamente (IRLS), lo que equivale a maximizar la log-verosimilitud de un proceso distribuido de Bernoulli utilizando el método de Newton . Si el problema se escribe en forma de matriz vectorial, con parámetroswT=[β0,β1,β2,]{\displaystyle \mathbf {w} ^{T}=[\beta _{0},\beta _{1},\beta _{2},\ldots ]}variables explicativasincógnita(i)=[1,incógnita1(i),incógnita2(i),]T{\displaystyle \mathbf {x} (i)=[1,x_{1}(i),x_{2}(i),\ldots ]^{T}}y el valor esperado de la distribución de Bernoulliμ(i)=11+miwTincógnita(i){\displaystyle \mu (i)={\frac {1}{1+e^{-\mathbf {w} ^{T}\mathbf {x} (i)}}}}los parámetrosw{\displaystyle \mathbf {w} }se puede encontrar utilizando el siguiente algoritmo iterativo:

wk+1=(incógnitaTSkincógnita)1incógnitaT(Skincógnitawk+yμk){\displaystyle \mathbf {w} _{k+1}=\left(\mathbf {X} ^{T}\mathbf {S} _{k}\mathbf {X} \right)^{-1}\mathbf {X} ^{T}\left(\mathbf {S} _{k}\mathbf {X} \mathbf {w} _{k}+\mathbf {y} -\mathbf {\boldsymbol {\mu }} _{k}\right)}

dóndeS=diagnóstico(μ(i)(1μ(i))){\displaystyle \mathbf {S} =\operatorname {diag} (\mu (i)(1-\mu (i)))}es una matriz de ponderación diagonal,μ=[μ(1),μ(2),]{\displaystyle {\boldsymbol {\mu }}=[\mu (1),\mu (2),\ldots ]}el vector de valores esperados,

incógnita=[1incógnita1(1)incógnita2(1)1incógnita1(2)incógnita2(2)]{\displaystyle \mathbf {X} ={\begin{bmatrix}1&x_{1}(1)&x_{2}(1)&\ldots \\1&x_{1}(2)&x_{2}(2)&\ldots \\\vdots &\vdots &\vdots \end{bmatrix}}}

la matriz regresora yy(i)=[y(1),y(2),]T{\displaystyle \mathbf {y} (i)=[y(1),y(2),\ldots ]^{T}}El vector de variables de respuesta. Se pueden encontrar más detalles en la literatura. [ 29 ]

Bayesiano

Comparación de la función logística con una función probit inversa escalada (es decir, la función de distribución acumulada de la distribución normal ), comparandoσ(incógnita){\displaystyle \sigma (x)}vs.Φ(π8incógnita){\textstyle \Phi ({\sqrt {\frac {\pi }{8}}}x)}lo que hace que las pendientes sean iguales en el origen. Esto muestra las colas más pesadas de la distribución logística.

En el contexto de la estadística bayesiana , las distribuciones a priori se suelen aplicar a los coeficientes de regresión, por ejemplo, en forma de distribuciones gaussianas . En la regresión logística, no existe una distribución a priori conjugada de la función de verosimilitud . Cuando la inferencia bayesiana se realizaba analíticamente, esto dificultaba el cálculo de la distribución a posteriori, excepto en dimensiones muy bajas. Sin embargo, actualmente, software automático como OpenBUGS , JAGS , PyMC , Stan o Turing.jl permite calcular estas distribuciones a posteriori mediante simulación, por lo que la falta de conjugación ya no supone un problema. No obstante, cuando el tamaño de la muestra o el número de parámetros es grande, la simulación bayesiana completa puede resultar lenta, y a menudo se utilizan métodos aproximados como los métodos bayesianos variacionales y la propagación de expectativas .

"La regla del diez"

La regla de "uno de cada diez", ampliamente utilizada , establece que los modelos de regresión logística dan valores estables para las variables explicativas si se basan en un mínimo de aproximadamente 10 eventos por variable explicativa (VPE); donde evento denota los casos que pertenecen a la categoría menos frecuente en la variable dependiente. Por lo tanto, un estudio diseñado para utilizark{\displaystyle k}variables explicativas para un evento (por ejemplo, infarto de miocardio ) que se espera que ocurra en una proporciónpag{\displaystyle p}de participantes en el estudio requerirá un total de10k/pag{\displaystyle 10k/p}participantes. Sin embargo, existe un debate considerable sobre la fiabilidad de esta regla, que se basa en estudios de simulación y carece de un fundamento teórico sólido. [ 30 ] Según algunos autores [ 31 ] la regla es demasiado conservadora en algunas circunstancias, y los autores afirman: "Si consideramos (de forma algo subjetiva) que una cobertura del intervalo de confianza inferior al 93 por ciento, un error de tipo I superior al 7 por ciento o un sesgo relativo superior al 15 por ciento son problemáticos, nuestros resultados indican que los problemas son bastante frecuentes con 2-4 EPV, poco comunes con 5-9 EPV y aún se observan con 10-16 EPV. Los peores casos de cada problema no fueron graves con 5-9 EPV y generalmente comparables a los de 10-16 EPV". [ 32 ]

Otros han encontrado resultados que no son consistentes con lo anterior, utilizando diferentes criterios. Un criterio útil es si se espera que el modelo ajustado logre la misma discriminación predictiva en una nueva muestra que la que pareció lograr en la muestra de desarrollo del modelo. Para ese criterio, pueden ser necesarios 20 eventos por variable candidata. [ 33 ] Además, se puede argumentar que se necesitan 96 observaciones solo para estimar la intersección del modelo con la precisión suficiente para que el margen de error en las probabilidades predichas sea ±0,1 con un nivel de confianza del 0,95. [ 13 ]

Error y significancia del ajuste

Prueba de desviación y razón de verosimilitud: un caso sencillo

En cualquier procedimiento de ajuste, la adición de un parámetro adicional a un modelo (por ejemplo, los parámetros beta en un modelo de regresión logística) casi siempre mejora la capacidad del modelo para predecir los resultados medidos. Esto se cumple incluso si el término adicional no tiene valor predictivo, ya que el modelo simplemente se estaría " sobreajustando " al ruido de los datos. Surge entonces la pregunta de si la mejora obtenida al añadir otro parámetro de ajuste es lo suficientemente significativa como para recomendar su inclusión, o si se trata simplemente de la mejora esperable por el sobreajuste.

En resumen, para la regresión logística se define una estadística conocida como desviación , que mide el error entre el ajuste del modelo logístico y los datos de resultados. Cuando el número de puntos de datos es elevado, la desviación sigue una distribución chi-cuadrado , lo que permite aplicar una prueba chi-cuadrado para determinar la significancia de las variables explicativas.

La regresión lineal y la regresión logística tienen muchas similitudes. Por ejemplo, en la regresión lineal simple, un conjunto de K puntos de datos ( x k , y k ) se ajustan a una función modelo propuesta de la formay=b0+b1incógnita{\displaystyle y=b_{0}+b_{1}x}El ajuste se obtiene eligiendo los parámetros b que minimizan la suma de los cuadrados de los residuos (el término de error cuadrático) para cada punto de datos:

ε2=k=1K(b0+b1incógnitakyk)2.{\displaystyle \varepsilon ^{2}=\sum _{k=1}^{K}(b_{0}+b_{1}x_{k}-y_{k})^{2}.}

El valor mínimo que constituye el ajuste se denotará porε^2{\displaystyle {\hat {\varepsilon }}^{2}}

Se puede introducir la idea de un modelo nulo , en el que se supone que la variable x no es útil para predecir los resultados y k : Los puntos de datos se ajustan a una función de modelo nulo de la forma y  = b 0 con un término de error cuadrático: 

ε2=k=1K(b0yk)2.{\displaystyle \varepsilon ^{2}=\sum _{k=1}^{K}(b_{0}-y_{k})^{2}.}

El proceso de ajuste consiste en elegir un valor de b 0 que minimiceε2{\displaystyle \varepsilon ^{2}}del ajuste al modelo nulo, denotado por εφ2{\displaystyle \varepsilon _{\varphi }^{2}}donde elφ{\displaystyle \varphi }El subíndice denota el modelo nulo. Se observa que el modelo nulo se optimiza medianteb0=y¯{\displaystyle b_{0}={\overline {y}}}dóndey¯{\displaystyle {\overline {y}}}es la media de los valores y k , y el optimizadoεφ2{\displaystyle \varepsilon _{\varphi }^{2}}es:

ε^φ2=k=1K(y¯yk)2{\displaystyle {\hat {\varepsilon }}_{\varphi }^{2}=\sum _{k=1}^{K}({\overline {y}}-y_{k})^{2}}

que es proporcional al cuadrado de la desviación estándar muestral (sin corregir) de los puntos de datos y k .

Podemos imaginar un caso en el que los puntos de datos y k se asignan aleatoriamente a los distintos x k , y luego se ajustan utilizando el modelo propuesto. Específicamente, podemos considerar los ajustes del modelo propuesto a cada permutación de los resultados y k . Se puede demostrar que el error optimizado de cualquiera de estos ajustes nunca será menor que el error óptimo del modelo nulo, y que la diferencia entre estos errores mínimos seguirá una distribución chi-cuadrado , con grados de libertad iguales a los del modelo propuesto menos los del modelo nulo que, en este caso, serán21=1{\displaystyle 2-1=1}. Usando la prueba chi-cuadrado , podemos estimar cuántos de estos conjuntos permutados de y k producirán un error mínimo menor o igual al error mínimo usando el y k original , y así podemos estimar cuán significativa es una mejora dada por la inclusión de la variable x en el modelo propuesto.

Para la regresión logística, la medida de bondad de ajuste es la función de verosimilitud L , o su logaritmo, la log-verosimilitud . La función de verosimilitud L es análoga a laε2{\displaystyle \varepsilon ^{2}}En el caso de regresión lineal, excepto que la verosimilitud se maximiza en lugar de minimizarse. Denotemos la log-verosimilitud maximizada del modelo propuesto por^{\displaystyle {\hat {\ell }}}.

En el caso de la regresión logística binaria simple, el conjunto de K puntos de datos se ajusta de forma probabilística a una función de la forma:

pag(incógnita)=11+mit{\displaystyle p(x)={\frac {1}{1+e^{-t}}}}

dondepag(incógnita){\displaystyle p(x)}es la probabilidad de quey=1{\displaystyle y=1}Las probabilidades logarítmicas vienen dadas por:

t=β0+β1incógnita{\displaystyle t=\beta _{0}+\beta _{1}x}

y la log-verosimilitud es:

=k=1K(ykln(pag(incógnitak))+(1yk)ln(1pag(incógnitak))){\displaystyle \ell =\sum _{k=1}^{K}\left(y_{k}\ln(p(x_{k}))+(1-y_{k})\ln(1-p(x_{k}))\right)}

Para el modelo nulo, la probabilidad de quey=1{\displaystyle y=1}está dado por:

pagφ(incógnita)=11+mitφ{\displaystyle p_{\varphi }(x)={\frac {1}{1+e^{-t_{\varphi }}}}}

Las probabilidades logarítmicas para el modelo nulo vienen dadas por:

tφ=β0{\displaystyle t_{\varphi }=\beta _{0}}

y la log-verosimilitud es:

φ=k=1K(ykln(pagφ)+(1yk)ln(1pagφ)){\displaystyle \ell _{\varphi }=\sum _{k=1}^{K}\left(y_{k}\ln(p_{\varphi })+(1-y_{k})\ln(1-p_{\varphi })\right)}

Dado que tenemospagφ=y¯{\displaystyle p_{\varphi }={\overline {y}}}En el máximo de L , la máxima verosimilitud logarítmica para el modelo nulo es

^φ=K(y¯ln(y¯)+(1y¯)ln(1y¯)){\displaystyle {\hat {\ell }}_{\varphi }=K(\,{\overline {y}}\ln({\overline {y}})+(1-{\overline {y}})\ln(1-{\overline {y}}))}

El óptimoβ0{\displaystyle \beta _{0}}es:

β0=ln(y¯1y¯){\displaystyle \beta _{0}=\ln \left({\frac {\overline {y}}{1-{\overline {y}}}}\right)}

dóndey¯{\displaystyle {\overline {y}}}es nuevamente la media de los valores y k . Nuevamente, podemos considerar conceptualmente el ajuste del modelo propuesto a cada permutación de y k y se puede demostrar que la máxima verosimilitud logarítmica de estos ajustes de permutación nunca será menor que la del modelo nulo:

^^φ{\displaystyle {\hat {\ell }}\geq {\hat {\ell }}_{\varphi }}

Asimismo, como analogía al error del caso de regresión lineal, podemos definir la desviación de un ajuste de regresión logística como:

D=ln(L^2L^φ2)=2(^^φ){\displaystyle D=\ln \left({\frac {{\hat {L}}^{2}}{{\hat {L}}_{\varphi }^{2}}}\right)=2({\hat {\ell }}-{\hat {\ell }}_{\varphi })}

que siempre será positivo o cero. La razón de esta elección es que la desviación no solo es una buena medida de la bondad del ajuste, sino que también se distribuye aproximadamente como chi-cuadrado, y la aproximación mejora a medida que aumenta el número de puntos de datos ( K ), llegando a ser exactamente chi-cuadrado en el límite de un número infinito de puntos de datos. Como en el caso de la regresión lineal, podemos usar este hecho para estimar la probabilidad de que un conjunto aleatorio de puntos de datos proporcione un mejor ajuste que el obtenido por el modelo propuesto, y así tener una estimación de cuán significativamente mejora el modelo al incluir los x k puntos de datos en el modelo propuesto.

Para el modelo simple de puntuaciones de pruebas de estudiantes descrito anteriormente, el valor máximo de la log-verosimilitud del modelo nulo es^φ=13.8629{\displaystyle {\hat {\ell }}_{\varphi }=-13.8629\ldots }El valor máximo de la log-verosimilitud para el modelo simple es^=8.02988{\displaystyle {\hat {\ell }}=-8.02988\ldots }para que la desviación seaD=2(^^φ)=11.6661{\displaystyle D=2({\hat {\ell }}-{\hat {\ell }}_{\varphi })=11.6661\ldots }

Utilizando la prueba de significancia chi-cuadrado , la integral de la distribución chi-cuadrado con un grado de libertad desde 11.6661... hasta el infinito es igual a 0.00063649...

Esto significa efectivamente que se puede esperar que aproximadamente 6 de cada 10 000 ajustes a y k aleatorios tengan un mejor ajuste (menor desviación) que el y k dado y, por lo tanto, podemos concluir que la inclusión de la variable x y los datos en el modelo propuesto es una mejora muy significativa con respecto al modelo nulo. En otras palabras, rechazamos la hipótesis nula con1D99,94%{\displaystyle 1-D\approx 99.94\%}confianza.

Resumen de bondad de ajuste

La bondad de ajuste en los modelos de regresión lineal generalmente se mide usando . Dado que esto no tiene un análogo directo en la regresión logística, se pueden usar varios métodos [ 34 ] : cap. 21 , incluidos los siguientes.

Pruebas de desviación y de razón de verosimilitud

En el análisis de regresión lineal, se busca particionar la varianza mediante cálculos de suma de cuadrados : la varianza en el criterio se divide esencialmente en varianza explicada por los predictores y varianza residual. En el análisis de regresión logística, se utiliza la desviación en lugar de los cálculos de suma de cuadrados. [ 35 ] La desviación es análoga a los cálculos de suma de cuadrados en la regresión lineal [ 2 ] y es una medida de la falta de ajuste a los datos en un modelo de regresión logística. [ 35 ] Cuando se dispone de un modelo "saturado" (un modelo con un ajuste teóricamente perfecto), la desviación se calcula comparando un modelo dado con el modelo saturado. [ 2 ] Este cálculo proporciona la prueba de razón de verosimilitud : [ 2 ]

D=2lnprobabilidad del modelo ajustadoprobabilidad del modelo saturado.{\displaystyle D=-2\ln {\frac {\text{likelihood of the fitted model}}{\text{likelihood of the saturated model}}}.}

En la ecuación anterior, D representa la desviación y ln representa el logaritmo natural. El logaritmo de esta razón de verosimilitud (la razón entre el modelo ajustado y el modelo saturado) producirá un valor negativo, de ahí la necesidad de un signo negativo. Se puede demostrar que D sigue una distribución chi-cuadrado aproximada . [ 2 ] Valores más pequeños indican un mejor ajuste, ya que el modelo ajustado se desvía menos del modelo saturado. Cuando se evalúa sobre una distribución chi-cuadrado, los valores chi-cuadrado no significativos indican muy poca varianza no explicada y, por lo tanto, un buen ajuste del modelo. Por el contrario, un valor chi-cuadrado significativo indica que una cantidad significativa de la varianza no está explicada.

Cuando el modelo saturado no está disponible (un caso común), la desviación se calcula simplemente como −2·(log verosimilitud del modelo ajustado), y la referencia a la log verosimilitud del modelo saturado puede eliminarse de todo lo que sigue sin ningún problema.

Dos medidas de desviación son particularmente importantes en la regresión logística: la desviación nula y la desviación del modelo. La desviación nula representa la diferencia entre un modelo con solo el intercepto (lo que significa "sin predictores") y el modelo saturado. La desviación del modelo representa la diferencia entre un modelo con al menos un predictor y el modelo saturado. [ 35 ] En este sentido, el modelo nulo proporciona una base sobre la cual comparar los modelos predictores. Dado que la desviación es una medida de la diferencia entre un modelo dado y el modelo saturado, los valores más pequeños indican un mejor ajuste. Por lo tanto, para evaluar la contribución de un predictor o conjunto de predictores, se puede restar la desviación del modelo de la desviación nula y evaluar la diferencia en unχspag2,{\displaystyle \chi _{s-p}^{2},} Distribución chi-cuadrado con grados de libertad [ 2 ] iguales a la diferencia en el número de parámetros estimados.

Dejar

Dnulo=2lnprobabilidad del modelo nuloprobabilidad del modelo saturadoDinstalado=2lnprobabilidad del modelo ajustadoprobabilidad del modelo saturado.{\displaystyle {\begin{aligned}D_{\text{null}}&=-2\ln {\frac {\text{likelihood of null model}}{\text{likelihood of the saturated model}}}\\[6pt]D_{\text{fitted}}&=-2\ln {\frac {\text{likelihood of fitted model}}{\text{likelihood of the saturated model}}}.\end{aligned}}}

Entonces la diferencia entre ambos es:

DnuloDinstalado=2(lnprobabilidad del modelo nuloprobabilidad del modelo saturadolnprobabilidad del modelo ajustadoprobabilidad del modelo saturado)=2ln(probabilidad del modelo nuloprobabilidad del modelo saturado)(probabilidad del modelo ajustadoprobabilidad del modelo saturado)=2lnprobabilidad del modelo nuloprobabilidad del modelo ajustado.{\displaystyle {\begin{aligned}D_{\text{null}}-D_{\text{fitted}}&=-2\left(\ln {\frac {\text{likelihood of null model}}{\text{likelihood of the saturated model}}}-\ln {\frac {\text{likelihood of fitted model}}{\text{likelihood of the saturated model}}}\right)\\[6pt]&=-2\ln {\frac {\left({\dfrac {\text{likelihood of null model}}{\text{likelihood of the saturated model}}}\right)}{\left({\dfrac {\text{likelihood of fitted model}}{\text{likelihood of the saturated model}}}\right)}}\\[6pt]&=-2\ln {\frac {\text{likelihood of the null model}}{\text{likelihood of fitted model}}}.\end{aligned}}}

Si la desviación del modelo es significativamente menor que la desviación nula, se puede concluir que el predictor o conjunto de predictores mejora significativamente el ajuste del modelo. Esto es análogo a la prueba F utilizada en el análisis de regresión lineal para evaluar la significancia de la predicción. [ 35 ]

Pseudo R cuadrado

En la regresión lineal, el coeficiente de correlación múltiple al cuadrado, , se utiliza para evaluar la bondad de ajuste, ya que representa la proporción de la varianza en el criterio que es explicada por los predictores. [ 35 ] En el análisis de regresión logística, no existe una medida análoga consensuada, sino varias medidas alternativas, cada una con sus limitaciones. [ 35 ] [ 36 ]

En esta página se examinan cuatro de los índices más utilizados y uno menos común:

  • Razón de verosimilitud R 2 L
  • Cox y Snell R 2 CS
  • Nagelkerke R 2 N
  • McFadden R 2 McF
  • Tjur R 2 T

Prueba de Hosmer-Lemeshow

La prueba de Hosmer-Lemeshow utiliza un estadístico de prueba que sigue asintóticamente unaχ2{\displaystyle \chi ^{2}}distribución para evaluar si las tasas de eventos observadas coinciden o no con las tasas de eventos esperadas en subgrupos de la población del modelo. Algunos estadísticos consideran que esta prueba es obsoleta debido a su dependencia de la agrupación arbitraria de probabilidades predichas y su potencia relativamente baja. [ 37 ]

Significancia del coeficiente

Después de ajustar el modelo, es probable que los investigadores quieran examinar la contribución de los predictores individuales. Para ello, querrán examinar los coeficientes de regresión. En la regresión lineal, los coeficientes de regresión representan el cambio en el criterio por cada unidad de cambio en el predictor. [ 35 ] En la regresión logística, sin embargo, los coeficientes de regresión representan el cambio en el logit por cada unidad de cambio en el predictor. Dado que el logit no es intuitivo, es probable que los investigadores se centren en el efecto de un predictor sobre la función exponencial del coeficiente de regresión: la razón de probabilidades (véase la definición ). En la regresión lineal, la significancia de un coeficiente de regresión se evalúa mediante el cálculo de una prueba t . En la regresión logística, existen varias pruebas diferentes diseñadas para evaluar la significancia de un predictor individual, principalmente la prueba de razón de verosimilitud y el estadístico de Wald.

Prueba de razón de verosimilitud

La prueba de razón de verosimilitud descrita anteriormente para evaluar el ajuste del modelo es también el procedimiento recomendado para evaluar la contribución de los "predictores" individuales a un modelo dado. [ 2 ] [ 26 ] [ 35 ] En el caso de un modelo con un solo predictor, simplemente se compara la desviación del modelo predictor con la del modelo nulo en una distribución chi-cuadrado con un solo grado de libertad. Si el modelo predictor tiene una desviación significativamente menor (cf chi-cuadrado usando la diferencia en los grados de libertad de los dos modelos), entonces se puede concluir que hay una asociación significativa entre el "predictor" y el resultado. Aunque algunos paquetes estadísticos comunes (por ejemplo, SPSS) proporcionan estadísticas de prueba de razón de verosimilitud, sin esta prueba computacionalmente intensiva sería más difícil evaluar la contribución de los predictores individuales en el caso de regresión logística múltiple. Para evaluar la contribución de los predictores individuales, se pueden ingresar los predictores jerárquicamente, comparando cada nuevo modelo con el anterior para determinar la contribución de cada predictor. [ 35 ] Existe cierto debate entre los estadísticos sobre la idoneidad de los llamados procedimientos "por pasos". El temor es que no conserven las propiedades estadísticas nominales y puedan resultar engañosos. [ 38 ]

Estadístico de Wald

Alternativamente, al evaluar la contribución de predictores individuales en un modelo dado, se puede examinar la significancia del estadístico de Wald . El estadístico de Wald, análogo a la prueba t en regresión lineal, se utiliza para evaluar la significancia de los coeficientes. El estadístico de Wald es la razón entre el cuadrado del coeficiente de regresión y el cuadrado del error estándar del coeficiente, y se distribuye asintóticamente como una distribución chi-cuadrado. [ 26 ]

Wj=βj2Smiβj2{\displaystyle W_{j}={\frac {\beta _{j}^{2}}{SE_{\beta _{j}}^{2}}}}

Aunque varios paquetes estadísticos (por ejemplo, SPSS, SAS) informan la estadística de Wald para evaluar la contribución de los predictores individuales, esta estadística tiene limitaciones. Cuando el coeficiente de regresión es grande, el error estándar del coeficiente de regresión también tiende a ser mayor, lo que aumenta la probabilidad de error de tipo II . La estadística de Wald también tiende a estar sesgada cuando los datos son escasos. [ 35 ]

Muestreo de casos y controles

Supongamos que los casos son raros. Entonces, podríamos querer muestrearlos con mayor frecuencia que su prevalencia en la población. Por ejemplo, supongamos que existe una enfermedad que afecta a 1 persona de cada 10 000 y que para recopilar nuestros datos necesitamos realizar un examen físico completo. Puede resultar demasiado costoso realizar miles de exámenes físicos a personas sanas para obtener datos de tan solo unos pocos individuos enfermos. Por lo tanto, podríamos evaluar a más individuos enfermos, tal vez todos los casos raros. Esto también se conoce como muestreo retrospectivo o, de forma equivalente, como datos desequilibrados. Como regla general, muestrear controles a una tasa cinco veces mayor que el número de casos producirá datos de control suficientes. [ 39 ]

La regresión logística es única porque puede estimarse en datos desequilibrados, en lugar de datos muestreados aleatoriamente, y aun así producir estimaciones correctas de los coeficientes de los efectos de cada variable independiente sobre el resultado. Es decir, si formamos un modelo logístico a partir de dichos datos, si el modelo es correcto en la población general,βj{\displaystyle \beta _{j}}Todos los parámetros son correctos excepto porβ0{\displaystyle \beta _{0}}Podemos corregirloβ0{\displaystyle \beta _{0}}si conocemos la prevalencia real de la siguiente manera: [ 39 ]

β^0=β^0+registroπ1πregistroπ~1π~{\displaystyle {\widehat {\beta }}_{0}^{*}={\widehat {\beta }}_{0}+\log {\frac {\pi }{1-\pi }}-\log {{\tilde {\pi }} \over {1-{\tilde {\pi }}}}}

dóndeπ{\displaystyle \pi }es la verdadera prevalencia yπ~{\displaystyle {\tilde {\pi }}}es la prevalencia en la muestra.

Discusión

Al igual que otras formas de análisis de regresión , la regresión logística utiliza una o más variables predictoras que pueden ser continuas o categóricas. Sin embargo, a diferencia de la regresión lineal ordinaria, la regresión logística se utiliza para predecir variables dependientes que pertenecen a un número limitado de categorías (tratando la variable dependiente en el caso binomial como el resultado de un ensayo de Bernoulli ) en lugar de un resultado continuo. Dada esta diferencia, se incumplen los supuestos de la regresión lineal. En particular, los residuos no pueden tener una distribución normal. Además, la regresión lineal puede generar predicciones sin sentido para una variable dependiente binaria. Lo que se necesita es una forma de convertir una variable binaria en una continua que pueda tomar cualquier valor real (negativo o positivo). Para ello, la regresión logística binomial primero calcula las probabilidades de que ocurra el evento para diferentes niveles de cada variable independiente y luego toma su logaritmo para crear un criterio continuo como una versión transformada de la variable dependiente. El logaritmo de las probabilidades es el logit de la probabilidad, que se define de la siguiente manera: logitpag=lnpag1pagpara 0<pag<1.{\displaystyle \operatorname {logit} p=\ln {\frac {p}{1-p}}\quad {\text{for }}0<p<1\,.}

Aunque la variable dependiente en la regresión logística es de Bernoulli, el logit está en una escala no restringida. [ 2 ] La función logit es la función de enlace en este tipo de modelo lineal generalizado, es decir logitmi(Y)=β0+β1incógnita{\displaystyle \operatorname {logit} \operatorname {\mathcal {E}} (Y)=\beta _{0}+\beta _{1}x}

Y es la variable de respuesta con distribución de Bernoulli y x es la variable predictora; los valores β son los parámetros lineales.

El logit de la probabilidad de éxito se ajusta a las variables predictoras. El valor predicho del logit se convierte de nuevo en probabilidades predichas mediante el inverso del logaritmo natural: la función exponencial . Así, aunque la variable dependiente observada en la regresión logística binaria es una variable binaria (0 o 1), la regresión logística estima las probabilidades, como una variable continua, de que la variable dependiente sea un «éxito». En algunas aplicaciones, las probabilidades son suficientes. En otras, se necesita una predicción específica de sí o no para determinar si la variable dependiente es o no un «éxito»; esta predicción categórica puede basarse en las probabilidades de éxito calculadas, donde las probabilidades predichas por encima de un valor umbral elegido se traducen en una predicción de éxito.

Aprendizaje automático y función de pérdida de entropía cruzada

En las aplicaciones de aprendizaje automático donde se utiliza la regresión logística para la clasificación binaria, el estimador de máxima verosimilitud (MLE) minimiza la función de pérdida de entropía cruzada .

La regresión logística es un algoritmo importante de aprendizaje automático . El objetivo es modelar la probabilidad de una variable aleatoria.Y{\displaystyle Y}ser 0 o 1 dados los datos experimentales. [ 40 ]

Consideremos una función de modelo lineal generalizado parametrizada porθ{\displaystyle \theta },

hθ(incógnita)=11+miθTincógnita=Pr(Y=1incógnita;θ){\displaystyle h_{\theta }(X)={\frac {1}{1+e^{-\theta ^{T}X}}}=\Pr(Y=1\mid X;\theta )}

Por lo tanto,

Pr(Y=0incógnita;θ)=1hθ(incógnita){\displaystyle \Pr(Y=0\mid X;\theta )=1-h_{\theta }(X)}

y desdeY{0,1}{\displaystyle Y\in \{0,1\}}, vemos quePr(yincógnita;θ){\displaystyle \Pr(y\mid X;\theta )}es dado porPr(yincógnita;θ)=hθ(incógnita)y(1hθ(incógnita))(1y).{\displaystyle \Pr(y\mid X;\theta )=h_{\theta }(X)^{y}(1-h_{\theta }(X))^{(1-y)}.}Ahora calculamos la función de verosimilitud suponiendo que todas las observaciones de la muestra siguen una distribución de Bernoulli independiente.

L(θy;incógnita)=Pr(Yincógnita;θ)=iPr(yiincógnitai;θ)=ihθ(incógnitai)yi(1hθ(incógnitai))(1yi){\displaystyle {\begin{aligned}L(\theta \mid y;x)&=\Pr(Y\mid X;\theta )\\&=\prod _{i}\Pr(y_{i}\mid x_{i};\theta )\\&=\prod _{i}h_{\theta }(x_{i})^{y_{i}}(1-h_{\theta }(x_{i}))^{(1-y_{i})}\end{aligned}}}

Normalmente, se maximiza la verosimilitud logarítmica.

norte1registroL(θy;incógnita)=norte1i=1norteregistroPr(yiincógnitai;θ){\displaystyle N^{-1}\log L(\theta \mid y;x)=N^{-1}\sum _{i=1}^{N}\log \Pr(y_{i}\mid x_{i};\theta )}

que se maximiza utilizando técnicas de optimización como el descenso de gradiente .

Suponiendo que(incógnita,y){\displaystyle (x,y)}Los pares se extraen uniformemente de la distribución subyacente, luego en el límite de N grande , 

límitenorte+norte1i=1norteregistroPr(yiincógnitai;θ)=incógnitaincógnitayYPr(incógnita=incógnita,Y=y)registroPr(Y=yincógnita=incógnita;θ)=incógnitaincógnitayYPr(incógnita=incógnita,Y=y)(registroPr(Y=yincógnita=incógnita)Pr(Y=yincógnita=incógnita;θ)+registroPr(Y=yincógnita=incógnita))=DKL(YYθ)H(Yincógnita){\displaystyle {\begin{aligned}&\lim \limits _{N\rightarrow +\infty }N^{-1}\sum _{i=1}^{N}\log \Pr(y_{i}\mid x_{i};\theta )=\sum _{x\in {\mathcal {X}}}\sum _{y\in {\mathcal {Y}}}\Pr(X=x,Y=y)\log \Pr(Y=y\mid X=x;\theta )\\[6pt]={}&\sum _{x\in {\mathcal {X}}}\sum _{y\in {\mathcal {Y}}}\Pr(X=x,Y=y)\left(-\log {\frac {\Pr(Y=y\mid X=x)}{\Pr(Y=y\mid X=x;\theta )}}+\log \Pr(Y=y\mid X=x)\right)\\[6pt]={}&-D_{\text{KL}}(Y\parallel Y_{\theta })-H(Y\mid X)\end{aligned}}}

dóndeH(Yincógnita){\displaystyle H(Y\mid X)}es la entropía condicional yDKL{\displaystyle D_{\text{KL}}}es la divergencia de Kullback-Leibler . Esto lleva a la intuición de que al maximizar la log-verosimilitud de un modelo, se minimiza la divergencia KL de dicho modelo con respecto a la distribución de entropía máxima. Intuitivamente, se busca el modelo que haga la menor cantidad de suposiciones en sus parámetros.

Comparación con la regresión lineal

La regresión logística puede considerarse un caso especial del modelo lineal generalizado y, por lo tanto, análogo a la regresión lineal . Sin embargo, el modelo de regresión logística se basa en supuestos bastante diferentes (sobre la relación entre las variables dependientes e independientes) a los de la regresión lineal. En particular, las diferencias clave entre estos dos modelos se pueden observar en las dos siguientes características de la regresión logística. Primero, la distribución condicional.yincógnita{\displaystyle y\mid x}Se trata de una distribución de Bernoulli en lugar de una distribución gaussiana , ya que la variable dependiente es binaria. En segundo lugar, los valores predichos son probabilidades y, por lo tanto, están restringidos al intervalo (0,1) mediante la función de distribución logística, puesto que la regresión logística predice la probabilidad de determinados resultados, no los resultados en sí mismos.

Alternativas

Una alternativa común al modelo logístico (modelo logit) es el modelo probit , como sugieren sus nombres relacionados. Desde la perspectiva de los modelos lineales generalizados , estos difieren en la elección de la función de enlace : el modelo logístico utiliza la función logit (función logística inversa), mientras que el modelo probit utiliza la función probit ( función de error inversa ). De forma equivalente, en las interpretaciones de variables latentes de estos dos métodos, el primero asume una distribución logística estándar de errores y el segundo una distribución normal estándar de errores. [ 41 ] En su lugar, se pueden utilizar otras funciones sigmoides o distribuciones de error.

La regresión logística es una alternativa al método de Fisher de 1936, el análisis discriminante lineal . [ 42 ] Si se cumplen los supuestos del análisis discriminante lineal, el condicionamiento puede invertirse para producir una regresión logística. Sin embargo, lo contrario no es cierto, ya que la regresión logística no requiere el supuesto de normalidad multivariante del análisis discriminante. [ 43 ]

La suposición de efectos predictores lineales se puede relajar fácilmente utilizando técnicas como las funciones spline . [ 13 ]

Historia

En Cramer (2002) se ofrece una historia detallada de la regresión logística . La función logística fue desarrollada como un modelo de crecimiento poblacional y denominada "logística" por Pierre François Verhulst en las décadas de 1830 y 1840, bajo la dirección de Adolphe Quetelet ; véase Función logística §  Historia para más detalles. [ 44 ] En su primer artículo (1838), Verhulst no especificó cómo ajustó las curvas a los datos. [ 45 ] [ 46 ] En su artículo más detallado (1845), Verhulst determinó los tres parámetros del modelo haciendo que la curva pasara por tres puntos observados, lo que produjo predicciones deficientes. [ 47 ] [ 48 ]

La función logística se desarrolló de forma independiente en química como un modelo de autocatálisis ( Wilhelm Ostwald , 1883). [ 49 ] Una reacción autocatalítica es aquella en la que uno de los productos actúa como catalizador de la misma reacción, mientras que el suministro de uno de los reactivos es fijo. Esto da lugar, naturalmente, a la ecuación logística por la misma razón que el crecimiento poblacional: la reacción se refuerza a sí misma, pero está limitada.

La función logística fue redescubierta de forma independiente como modelo de crecimiento poblacional en 1920 por Raymond Pearl y Lowell Reed , quienes la publicaron como Pearl & Reed (1920) , lo que propició su uso en la estadística moderna. Inicialmente desconocían el trabajo de Verhulst y presumiblemente lo conocieron a través de L. Gustave du Pasquier , pero le dieron poco crédito y no adoptaron su terminología. [ 50 ] Se reconoció la prioridad de Verhulst y el término "logístico" fue recuperado por Udny Yule en 1925 y se ha utilizado desde entonces. [ 51 ] Pearl y Reed aplicaron por primera vez el modelo a la población de los Estados Unidos y también ajustaron inicialmente la curva haciéndola pasar por tres puntos; al igual que con Verhulst, esto también arrojó resultados deficientes. [ 52 ]

En la década de 1930, Chester Ittner Bliss desarrolló y sistematizó el modelo probit , acuñando el término "probit" en Bliss (1934) , y John Gaddum en Gaddum (1933) . Ronald A. Fisher ajustó el modelo mediante estimación de máxima verosimilitud en Fisher (1935) , como un apéndice al trabajo de Bliss. El modelo probit se utilizó principalmente en bioensayos y fue precedido por trabajos anteriores que datan de 1860; véase Modelo probit § Historia . El modelo probit influyó en el desarrollo posterior del modelo logit, y estos modelos compitieron entre sí. [ 53 ] 

El modelo logístico probablemente fue utilizado por primera vez como alternativa al modelo probit en bioensayos por Edwin Bidwell Wilson y su estudiante Jane Worcester en Wilson & Worcester (1943) . [ 54 ] Sin embargo, el desarrollo del modelo logístico como una alternativa general al modelo probit se debió principalmente al trabajo de Joseph Berkson durante muchas décadas, comenzando en Berkson (1944) , donde acuñó "logit", por analogía con "probit", y continuando hasta Berkson (1951) y años posteriores. [ 55 ] El modelo logit fue inicialmente descartado como inferior al modelo probit, pero "gradualmente alcanzó un nivel igual al probit", [ 56 ] particularmente entre 1960 y 1970. Para 1970, el modelo logit alcanzó la paridad con el modelo probit en uso en revistas de estadística y posteriormente lo superó. Esta popularidad relativa se debió a la adopción del modelo logit fuera del bioensayo, en lugar de desplazar al modelo probit dentro del bioensayo, y a su uso informal en la práctica; la popularidad del modelo logit se atribuye a su simplicidad computacional, sus propiedades matemáticas y su generalidad, lo que permite su uso en diversos campos. [ 3 ]

Durante ese tiempo se produjeron varios refinamientos, en particular por David Cox , como en Cox (1958) . [ 4 ]

El modelo logit multinomial fue introducido independientemente por Cox (1966) y Theil (1969) , lo que aumentó considerablemente el alcance de aplicación y la popularidad del modelo logit. [ 57 ] En 1973, Daniel McFadden vinculó el logit multinomial con la teoría de la elección discreta , específicamente con el axioma de elección de Luce , mostrando que el logit multinomial se derivaba del supuesto de independencia de alternativas irrelevantes e interpretando las probabilidades de las alternativas como preferencias relativas; [ 58 ] esto proporcionó una base teórica para la regresión logística. [ 57 ]

Extensiones

Hay un gran número de extensiones:

Véase también

Referencias

  1. Tolles, Juliana; Meurer, William J (2016). "Regresión logística que relaciona las características del paciente con los resultados". JAMA . 316 (5): 533– 4. doi : 10.1001/jama.2016.7653 . ISSN 0098-7484 . OCLC 6823603312 . PMID 27483067 .   
  2. 1 2 3 4 5 6 7 8 9 10 11 Hosmer, David W.; Lemeshow, Stanley (2000). Regresión logística aplicada (2.ª ed.). Wiley. ISBN  978-0-471-35632-5.
  3. 1 2 Cramer 2002 , págs. 10-11.
  4. 1 2 Walker, SH; Duncan, DB (1967). "Estimación de la probabilidad de un evento en función de varias variables independientes". Biometrika . 54 (1/2): 167– 178. doi : 10.2307/2333860 . JSTOR 2333860 . 
  5. Cramer 2002 , pág. 8.
  6. Boyd, CR; Tolson, MA; Copes, WS (1987). "Evaluación de la atención traumatológica: El método TRISS. Puntuación de trauma y puntuación de gravedad de la lesión" . The Journal of Trauma . 27 (4): 370– 378. doi : 10.1097/00005373-198704000-00005 . PMID 3106646 . 
  7. Kologlu, M.; Elker, D.; Altun, H.; Sayek, I. (2001). "Validación de MPI y PIA II en dos grupos diferentes de pacientes con peritonitis secundaria". Hepato-Gastroenterología . 48 (37): 147– 51. PMID 11268952 . 
  8. ^ Biondo, S.; Ramos, E.; Deiros, M.; Ragué, JM; De Oca, J.; Moreno, P.; Farrán, L.; Jaurrieta, E. (2000). "Factores pronósticos de mortalidad en peritonitis del colon izquierdo: un nuevo sistema de puntuación". Revista del Colegio Americano de Cirujanos . 191 (6): 635– 42. doi : 10.1016/S1072-7515(00)00758-4 . PMID 11129812 . 
  9. Marshall, JC; Cook, DJ; Christou, NV; Bernard, GR; Sprung, CL; Sibbald, WJ (1995). "Puntuación de disfunción multiorgánica: un descriptor fiable de un resultado clínico complejo". Critical Care Medicine . 23 (10): 1638– 52. doi : 10.1097/00003246-199510000-00007 . PMID 7587228 . 
  10. Le Gall, JR; Lemeshow, S.; Saulnier, F. (1993). "Una nueva puntuación simplificada de fisiología aguda (SAPS II) basada en un estudio multicéntrico europeo/norteamericano". JAMA . 270 (24): 2957– 63. Bibcode : 1993JAMA..270.2957L . doi : 10.1001/jama.1993.03510240069035 . PMID 8254858 . 
  11. 1 2 David A. Freedman (2009). Modelos estadísticos: teoría y práctica . Cambridge University Press . pág. 128. 
  12. Truett, J; Cornfield, J; Kannel, W (1967). "Análisis multivariado del riesgo de enfermedad coronaria en Framingham". Journal of Chronic Diseases . 20 (7): 511– 24. doi : 10.1016/0021-9681(67)90082-3 . PMID 6028270 . 
  13. 1 2 3 Harrell, Frank E. (2015). Estrategias de modelado de regresión . Springer Series in Statistics (2.ª ed.). Nueva York; Springer. doi : 10.1007/978-3-319-19425-7 . ISBN  978-3-319-19424-0.
  14. M. Strano; BM Colosimo (2006). "Análisis de regresión logística para la determinación experimental de diagramas de límites de conformado". International Journal of Machine Tools and Manufacture . 46 (6): 673– 682. doi : 10.1016/j.ijmachtools.2005.07.005 .
  15. Palei, SK; Das, SK (2009). "Modelo de regresión logística para la predicción de riesgos de caída de techo en trabajos de cámaras y pilares en minas de carbón: Un enfoque". Safety Science . 47 : 88–96 . doi : 10.1016/j.ssci.2008.01.002 .
  16. Berry, Michael JA (1997). Técnicas de minería de datos para marketing, ventas y atención al cliente . Wiley. pág. 10. 
  17. Mesa-Arango, Rodrigo; Hasan, Samiul; Ukkusuri, Satish V.; Murray-Tuite, Pamela (febrero de 2013). "Modelo a nivel de hogar para la elección del tipo de destino de evacuación de huracanes utilizando datos del huracán Iván" . Revisión de peligros naturales . 14 (1): 11– 20. Bibcode : 2013NHRev..14...11M . doi : 10.1061/(ASCE)NH.1527-6996.0000083 . ISSN 1527-6988 . 
  18. Wibbenmeyer, Matthew J.; Hand, Michael S.; Calkin, David E.; Venn, Tyron J.; Thompson, Matthew P. (junio de 2013). "Preferencias de riesgo en la toma de decisiones estratégicas sobre incendios forestales: un experimento de elección con gestores de incendios forestales de EE . UU." . Risk Analysis . 33 (6): 1021– 1037. Bibcode : 2013RiskA..33.1021W . doi : 10.1111/j.1539-6924.2012.01894.x . ISSN 0272-4332 . PMID 23078036 . S2CID 45282555 .   
  19. Lovreglio, Ruggiero; Borri, Dino; dell'Olio, Luigi; Ibeas, Angel (2014-02-01). "Un modelo de elección discreta basado en utilidades aleatorias para la elección de salida en evacuaciones de emergencia" . Safety Science . 62 : 418–426 . doi : 10.1016/j.ssci.2013.10.004 . ISSN 0925-7535 . 
  20. "Regresión logística" . CORP-MIDS1 (MDS) . Consultado el 16 de marzo de 2024 .
  21. Neyman, J.; Pearson , ES (1933), "Sobre el problema de las pruebas más eficientes de hipótesis estadísticas" (PDF) , Philosophical Transactions of the Royal Society of London A , 231 ( 694–706 ): 289–337 , Bibcode : 1933RSPTA.231..289N , doi : 10.1098/rsta.1933.0009 , JSTOR 91247 
  22. "¿Cómo interpretar la razón de probabilidades en la regresión logística?" . Instituto de Investigación y Educación Digital.
  23. Everitt, Brian (1998). The Cambridge Dictionary of Statistics . Cambridge, Reino Unido. Nueva York: Cambridge University Press. ISBN 978-0-521-59346-5.
  24. Por ejemplo, la función indicadora en este caso podría definirse comoΔ(norte,y)=1(ynorte)2{\displaystyle \Delta (n,y)=1-(y-n)^{2}}
  25. Malouf, Robert (2002). "Una comparación de algoritmos para la estimación de parámetros de máxima entropía" . Actas de la Sexta Conferencia sobre Aprendizaje del Lenguaje Natural (CoNLL-2002) . págs. 49–55 . doi : 10.3115/1118853.1118871 . 
  26. 1 2 3 4 5 6 7 Menard, Scott W. (2002). Regresión logística aplicada (2.ª ed.). SAGE. ISBN  978-0-7619-2208-7.
  27. Gourieroux, Christian; Monfort, Alain (1981). "Propiedades asintóticas del estimador de máxima verosimilitud en modelos logit dicotómicos". Journal of Econometrics . 17 (1): 83– 97. doi : 10.1016/0304-4076(81)90060-9 .
  28. Park, Byeong U.; Simar, Léopold; Zelenyuk, Valentin (2017). "Estimación no paramétrica de modelos de elección discreta dinámica para datos de series temporales" (PDF) . Computational Statistics & Data Analysis . 108 : 97–120 . doi : 10.1016/j.csda.2016.10.024 .
  29. Murphy, Kevin P. (2012). Aprendizaje automático: una perspectiva probabilística . The MIT Press. pág. 245. ISBN  978-0-262-01802-9.
  30. Van Smeden, M.; De Groot, JA; Moons, KG; Collins, GS; Altman, DG; Eijkemans, MJ; Reitsma, JB (2016). "No hay justificación para el criterio de 1 variable por cada 10 eventos para el análisis de regresión logística binaria" . BMC Medical Research Methodology . 16 (1): 163. doi : 10.1186/s12874-016-0267-3 . PMC 5122171. PMID 27881078 .  
  31. Peduzzi, P; Concato, J; Kemper, E; Holford, TR; Feinstein, AR (diciembre de 1996). "Un estudio de simulación del número de eventos por variable en el análisis de regresión logística" . Journal of Clinical Epidemiology . 49 (12): 1373–9 . doi : 10.1016/s0895-4356(96)00236-3 . PMID 8970487 . 
  32. Vittinghoff, E.; McCulloch, CE (12 de enero de 2007). "Relajando la regla de diez eventos por variable en la regresión logística y de Cox" . American Journal of Epidemiology . 165 (6): 710– 718. doi : 10.1093/aje/kwk052 . PMID 17182981 . 
  33. van der Ploeg, Tjeerd; Austin, Peter C.; Steyerberg, Ewout W. (2014). "Las técnicas de modelado modernas requieren muchos datos: un estudio de simulación para predecir resultados dicotómicos" . BMC Medical Research Methodology . 14 137. doi : 10.1186/1471-2288-14-137 . PMC 4289553. PMID 25532820 .  
  34. Greene, William N. (2003). Análisis econométrico (Quinta ed.). Prentice-Hall. ISBN  978-0-13-066189-0.
  35. 1 2 3 4 5 6 7 8 9 10 Cohen, Jacob; Cohen, Patricia; West, Steven G.; Aiken, Leona S. (2002). Análisis de regresión/correlación múltiple aplicada a las ciencias del comportamiento (3.ª ed.). Routledge. ISBN  978-0-8058-2223-6.
  36. Allison, Paul D. "Medidas de ajuste para la regresión logística" (PDF) . Statistical Horizons LLC y la Universidad de Pensilvania.
  37. Hosmer, DW (1997). "Una comparación de pruebas de bondad de ajuste para el modelo de regresión logística". Stat Med . 16 (9): 965– 980. doi : 10.1002/(sici)1097-0258(19970515)16:9 < 965::aid-sim509 > 3.3.co ; 2-f . PMID 9160492 . 
  38. Harrell, Frank E. (2010). Estrategias de modelado de regresión: con aplicaciones a modelos lineales, regresión logística y análisis de supervivencia . Nueva York: Springer. ISBN 978-1-4419-2918-1.
  39. 1 2 https://class.stanford.edu/c4x/HumanitiesScience/StatLearning/asset/classification.pdf diapositiva 16
  40. Ng, Andrew (2000). "Apuntes de clase de CS229" (PDF) . Apuntes de clase de CS229 : 16–19 .
  41. Rodríguez, G. (2007). Apuntes de clase sobre modelos lineales generalizados . pp. Capítulo 3, página 45. 
  42. Gareth James; Daniela Witten; Trevor Hastie; Robert Tibshirani (2013). Una introducción al aprendizaje estadístico . Springer. pág. 6. 
  43. Pohar, Maja; Blas, Mateja; Turco, Sandra (2004). "Comparación de regresión logística y análisis discriminante lineal: un estudio de simulación" . Metodološki Zvezki . 1 (1).
  44. Cramer 2002 , págs. 3–5.
  45. ^ Verhulst, Pierre-François (1838). "Aviso sobre la ley que la población poursuit dans son accroissement" (PDF) . Correspondencia Mathématique et Physique . 10 : 113-121 .Consultado el 3 de diciembre de 2014 .
  46. Cramer 2002 , p. 4, "No dijo cómo ajustó las curvas." 
  47. ^ Verhulst, Pierre-François (1845). "Recherches mathématiques sur la loi d'accroissement de la populación" [ Investigaciones matemáticas sobre la ley del aumento del crecimiento demográfico ] . Nouveaux Mémoires de l'Académie Royale des Sciences et Belles-Lettres de Bruxelles . 18 . Consultado el 18 de febrero de 2013 .
  48. Cramer 2002 , pág. 4.
  49. Cramer 2002 , pág. 7.
  50. Cramer 2002 , pág. 6.
  51. Cramer 2002 , págs. 6–7.
  52. Cramer 2002 , pág. 5.
  53. Cramer 2002 , págs. 7–9.
  54. Cramer 2002 , pág. 9.
  55. Cramer 2002 , p. 8, "Hasta donde puedo ver, la introducción de la logística como alternativa a la función de probabilidad normal es obra de una sola persona, Joseph Berkson (1899–1982),..." 
  56. Cramer 2002 , pág. 11.
  57. 1 2 Cramer 2002 , pág. 13.
  58. McFadden, Daniel (1973). "Análisis Logit Condicional del Comportamiento de Elección Cualitativa" (PDF) . En P. Zarembka (ed.). Fronteras en Econometría . Nueva York: Academic Press. pp. 105–142 . Archivado del original (PDF) el 27 de noviembre de 2018. Recuperado el 20 de abril de 2019 . 

Fuentes

  • Berkson, Joseph (1944). "Aplicación de la función logística al bioensayo". Journal of the American Statistical Association . 39 (227): 357– 365. doi : 10.1080/01621459.1944.10500699 . JSTOR 2280041 . 
  • Berkson, Joseph (1951). "Por qué prefiero los logits a los probits". Biometrics . 7 (4): 327– 339. Bibcode : 1951Biome...7..327B . doi : 10.2307/3001655 . ISSN 0006-341X . JSTOR 3001655 .  
  • Bliss, CI (1934). "El método de los probits". Science . 79 ( 2037): 38–39 . Bibcode : 1934Sci....79...38B . doi : 10.1126/science.79.2037.38 . PMID 17813446. Estas unidades de probabilidad arbitrarias se han denominado "probits". 
  • Cox, David R. (1958). "Análisis de regresión de secuencias binarias (con discusión)". JR Stat Soc B . 20 (2): 215– 242. doi : 10.1111/j.2517-6161.1958.tb00292.x . JSTOR 2983890 . 
  • Cox, David R. (1966). "Algunos procedimientos relacionados con la curva de respuesta cualitativa logística". En FN David (ed.). Artículos de investigación en probabilidad y estadística (Homenaje a J. Neyman) . Londres: Wiley. pp. 55–71 . 
  • Cramer, JS (2002). Los orígenes de la regresión logística (PDF) (Informe técnico). Vol.  119. Instituto Tinbergen. pp. 167–178 . doi : 10.2139/ssrn.360300 . 
    • Publicado en: Cramer, JS (2004). "Los orígenes tempranos del modelo logit". Estudios en Historia y Filosofía de la Ciencia Parte C: Estudios en Historia y Filosofía de las Ciencias Biológicas y Biomédicas . 35 (4): 613– 626. doi : 10.1016/j.shpsc.2004.09.003 .
  • Fisher, RA (1935). "El caso de cero supervivientes en ensayos probit" . Annals of Applied Biology . 22 : 164–165 . doi : 10.1111/j.1744-7348.1935.tb07713.x .{{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  • Gaddum, John H. (1933). Informes sobre estándares biológicos: métodos de ensayo biológico que dependen de una respuesta cuántica. III . HM Stationery Office. OCLC 808240121 . 
  • Theil, Henri (1969). "Una extensión multinomial del modelo logit lineal". Revista Económica Internacional . 10 (3): 251– 59. doi : 10.2307/2525642 . JSTOR 2525642 . 
  • Pearl, Raymond; Reed, Lowell J. (junio de 1920). "Sobre la tasa de crecimiento de la población de los Estados Unidos desde 1790 y su representación matemática" . Actas de la Academia Nacional de Ciencias . 6 (6): 275– 288. Bibcode : 1920PNAS....6..275P . doi : 10.1073/pnas.6.6.275 . PMC 1084522. PMID 16576496 .  
  • Wilson, EB ; Worcester, J. (1943). "La determinación de la LD50 y su error de muestreo en el bioensayo" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 29 (2): 79– 85. Bibcode : 1943PNAS...29...79W . doi : 10.1073/pnas.29.2.79 . PMC 1078563. PMID 16588606 .  
  • Agresti, Alan. (2002). Análisis de datos categóricos . Nueva York: Wiley-Interscience. ISBN 978-0-471-36093-3.
  • Amemiya, Takeshi (1985). «Modelos de respuesta cualitativa» . Econometría avanzada . Oxford: Basil Blackwell. pp. 267–359 . ISBN  978-0-631-13345-2.
  • Balakrishnan, N. (1991). Manual de distribución logística . Marcel Dekker, Inc. ISBN 978-0-8247-8587-1.
  • Gouriéroux, Christian (2000). «La dicotomía simple» . Econometría de variables dependientes cualitativas . Nueva York: Cambridge University Press. pp. 6–37 . ISBN  978-0-521-58985-7.
  • Greene, William H. (2003). Análisis econométrico, quinta edición . Prentice Hall. ISBN 978-0-13-066189-0.
  • Hilbe, Joseph M. (2009). Modelos de regresión logística . Chapman & Hall/CRC Press. ISBN 978-1-4200-7575-5.
  • Hosmer, David (2013). Regresión logística aplicada . Hoboken, Nueva Jersey: Wiley. ISBN 978-0-470-58247-3.
  • Howell, David C. (2010). Métodos estadísticos para la psicología, 7.ª ed . Belmont, CA; Thomson Wadsworth. ISBN 978-0-495-59786-5.
  • Peduzzi, P.; J. Concato; E. Kemper; TR Holford; AR Feinstein (1996). "Un estudio de simulación del número de eventos por variable en el análisis de regresión logística" . Journal of Clinical Epidemiology . 49 (12): 1373– 1379. doi : 10.1016/s0895-4356(96)00236-3 . PMID 8970487 . 
  • Berry, Michael JA; Linoff, Gordon (1997). Técnicas de minería de datos para marketing, ventas y atención al cliente . Wiley.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la regresión logística en Wikimedia Commons.
  • Clase de econometría (tema: modelo logit) en YouTube por Mark Thoma
  • Tutorial de regresión logística
  • mlelr : software en C para fines didácticos