Articulo de referencia

Modelo Probit

En estadística , un modelo probit es un tipo de regresión donde la variable dependiente solo puede tomar dos valores, por ejemplo, casado o soltero. La palabra es un acrónimo de...

En estadística , un modelo probit es un tipo de regresión donde la variable dependiente solo puede tomar dos valores, por ejemplo, casado o soltero. La palabra es un acrónimo de "probabilidad" + " unit " [ 1 ] . El propósito del modelo es estimar la probabilidad de que una observación con características particulares se clasifique en una categoría específica; además, clasificar las observaciones según sus probabilidades predichas es un tipo de modelo de clasificación binaria .

Un modelo probit es una especificación popular para un modelo de respuesta binaria . Como tal, trata el mismo conjunto de problemas que la regresión logística utilizando técnicas similares. Cuando se observa en el marco del modelo lineal generalizado , el modelo probit emplea una función de enlace probit . [ 2 ] Generalmente se estima utilizando el procedimiento de máxima verosimilitud , [ 3 ] dicha estimación se denomina regresión probit .

Marco conceptual

Supongamos que una variable de respuesta Y es binaria , es decir, solo puede tener dos resultados posibles que denotaremos como 1 y 0. Por ejemplo, Y puede representar la presencia/ausencia de una determinada condición, el éxito/fracaso de algún dispositivo, la respuesta sí/no en una encuesta, etc. También tenemos un vector de regresores X , que se supone que influyen en el resultado Y. Específicamente, suponemos que el modelo toma la forma

PAG(Y=1incógnita)=Φ(incógnitaTβ),{\displaystyle P(Y=1\mid X)=\Phi (X^{\operatorname {T} }\beta ),}

donde P es la probabilidad yΦ{\displaystyle \Phi }es la función de distribución acumulativa ( CDF ) de la distribución normal estándar . Los parámetros β se estiman típicamente por máxima verosimilitud .

Es posible motivar el modelo probit como un modelo de variable latente . Supongamos que existe una variable aleatoria auxiliar.

Y=incógnitaTβ+ε,{\displaystyle Y^{\ast }=X^{T}\beta +\varepsilon ,}

donde ε ~ N (0, 1). Entonces Y puede considerarse un indicador de si esta variable latente es positiva:

Y={1Y>00de lo contrario}={1incógnitaTβ+ε>00de lo contrario}{\displaystyle Y=\left.{\begin{cases}1&Y^{*}>0\\0&{\text{en otro caso}}\end{cases}}\right\}=\left.{\begin{cases}1&X^{\operatorname {T} }\beta +\varepsilon >0\\0&{\text{en otro caso}}\end{cases}}\right\}}

El uso de la distribución normal estándar no conlleva ninguna pérdida de generalidad en comparación con el uso de una distribución normal con una media y una desviación estándar arbitrarias, porque sumar una cantidad fija a la media se puede compensar restando la misma cantidad del término independiente, y multiplicar la desviación estándar por una cantidad fija se puede compensar multiplicando los pesos por la misma cantidad.

Para comprobar que los dos modelos son equivalentes, observe que

PAG(Y=1incógnita)=PAG(Y>0)=PAG(incógnitaTβ+ε>0)=PAG(ε>incógnitaTβ)=PAG(ε<incógnitaTβ)por simetría de la distribución normal=Φ(incógnitaTβ){\displaystyle {\begin{aligned}P(Y=1\mid X)&=P(Y^{\ast }>0)\\&=P(X^{\operatorname {T} }\beta +\varepsilon >0)\\&=P(\varepsilon >-X^{\operatorname {T} }\beta )\\&=P(\varepsilon <X^{\operatorname {T} }\beta )&{\text{por simetría de la distribución normal}}\\&=\Phi (X^{\operatorname {T} }\beta )\end{aligned}}}

Estimación del modelo

estimación de máxima verosimilitud

Supongamos que el conjunto de datos{yi,incógnitai}i=1norte{\displaystyle \{y_{i},x_{i}\}_{i=1}^{n}}contiene n unidades estadísticas independientes que corresponden al modelo anterior.

Para una sola observación, condicionada al vector de entradas de esa observación, tenemos:

PAG(yi=1|incógnitai)=Φ(incógnitaiTβ){\displaystyle P(y_{i}=1|x_{i})=\Phi (x_{i}^{\operatorname {T} }\beta )}
PAG(yi=0|incógnitai)=1Φ(incógnitaiTβ){\displaystyle P(y_{i}=0|x_{i})=1-\Phi (x_{i}^{\operatorname {T} }\beta )}

dóndeincógnitai{\displaystyle x_{i}}es un vector deK×1{\displaystyle K\times 1}entradas yβ{\displaystyle \beta }es unK×1{\displaystyle K\times 1}vector de coeficientes.

La probabilidad de una sola observación(yi,incógnitai){\displaystyle (y_{i},x_{i})}es entonces

L(β;yi,incógnitai)=Φ(incógnitaiTβ)yi[1Φ(incógnitaiTβ)](1yi){\displaystyle {\mathcal {L}}(\beta ;y_{i},x_{i})=\Phi (x_{i}^{\operatorname {T} }\beta )^{y_{i}}[1-\Phi (x_{i}^{\operatorname {T} }\beta )]^{(1-y_{i})}}

De hecho, siyi=1{\displaystyle y_{i}=1}, entoncesL(β;yi,incógnitai)=Φ(incógnitaiTβ){\displaystyle {\mathcal {L}}(\beta ;y_{i},x_{i})=\Phi (x_{i}^{\operatorname {T} }\beta )}y siyi=0{\displaystyle y_{i}=0}, entoncesL(β;yi,incógnitai)=1Φ(incógnitaiTβ){\displaystyle {\mathcal {L}}(\beta ;y_{i},x_{i})=1-\Phi (x_{i}^{\operatorname {T} }\beta )}.

Dado que las observaciones son independientes e idénticamente distribuidas, la probabilidad de toda la muestra, o la probabilidad conjunta , será igual al producto de las probabilidades de las observaciones individuales:

L(β;Y,incógnita)=i=1norte(Φ(incógnitaiTβ)yi[1Φ(incógnitaiTβ)](1yi)){\displaystyle {\mathcal {L}}(\beta ;Y,X)=\prod _{i=1}^{n}\left(\Phi (x_{i}^{\operatorname {T} }\beta )^{y_{i}}[1-\Phi (x_{i}^{\operatorname {T} }\beta )]^{(1-y_{i})}\right)}

La función de verosimilitud logarítmica conjunta es, por lo tanto,

lnL(β;Y,incógnita)=i=1norte(yilnΦ(incógnitaiTβ)+(1yi)ln(1Φ(incógnitaiTβ))){\displaystyle \ln {\mathcal {L}}(\beta ;Y,X)=\sum _{i=1}^{n}{\bigg (}y_{i}\ln \Phi (x_{i}^{\operatorname {T} }\beta )+(1-y_{i})\ln \!{\big (}1-\Phi (x_{i}^{\operatorname {T} }\beta ){\big )}{\bigg )}}

El estimadorβ^{\displaystyle {\sombrero {\beta }}}que maximiza esta función será consistente , asintóticamente normal y eficiente siempre quemi[incógnitaincógnitaT]{\displaystyle \operatorname {E} [XX^{\operatorname {T} }]}existe y no es singular. Se puede demostrar que esta función de log-verosimilitud es globalmente cóncava enβ{\displaystyle \beta }y, por lo tanto, los algoritmos numéricos estándar para la optimización convergerán rápidamente al máximo único.

Distribución asintótica paraβ^{\displaystyle {\sombrero {\beta }}}es dado por

norte(β^β) d norte(0,Ω1),{\displaystyle {\sqrt {n}}({\hat {\beta }}-\beta )\ {\xrightarrow {d}}\ {\mathcal {N}}(0,\,\Omega ^{-1}),}

dónde

Ω=mi[φ2(incógnitaTβ)Φ(incógnitaTβ)(1Φ(incógnitaTβ))incógnitaincógnitaT],Ω^=1nortei=1norteφ2(incógnitaiTβ^)Φ(incógnitaiTβ^)(1Φ(incógnitaiTβ^))incógnitaiincógnitaiT,{\displaystyle \Omega =\operatorname {E} {\bigg [}{\frac {\varphi ^{2}(X^{\operatorname {T} }\beta )}{\Phi (X^{\operatorname {T} }\beta )(1-\Phi (X^{\operatorname {T} }\beta ))}}XX^{\operatorname {T} }{\bigg ]},\qquad {\hat {\Omega }}={\frac {1}{n}}\sum _{i=1}^{n}{\frac {\varphi ^{2}(x_{i}^{\operatorname {T} }{\hat {\beta }})}{\Phi (x_{i}^{\operatorname {T} }{\hat {\beta }})(1-\Phi (x_{i}^{\operatorname {T} }{\hat {\beta }}))}}x_{i}x_{i}^{\operatorname {T} },}

yφ=Φ{\displaystyle \varphi =\Phi '}es la función de densidad de probabilidad ( PDF ) de la distribución normal estándar.

También se encuentran disponibles métodos de máxima verosimilitud semiparamétricos y no paramétricos para modelos de tipo probit y otros modelos relacionados. [ 4 ]

Método de chi-cuadrado mínimo de Berkson

Este método solo se puede aplicar cuando hay muchas observaciones de la variable de respuesta.yi{\displaystyle y_{i}}tener el mismo valor del vector de regresoresincógnitai{\displaystyle x_{i}}(dicha situación puede denominarse "muchas observaciones por celda"). Más específicamente, el modelo puede formularse de la siguiente manera.

Supongamos que entre n observaciones{yi,incógnitai}i=1norte{\displaystyle \{y_{i},x_{i}\}_{i=1}^{n}}Solo existen T valores distintos de los regresores, que pueden denotarse como{incógnita(1),,incógnita(T)}{\displaystyle \{x_{(1)},\ldots ,x_{(T)}\}}. Dejarnortet{\displaystyle n_{t}}sea ​​el número de observaciones conincógnitai=incógnita(t),{\displaystyle x_{i}=x_{(t)},}yrt{\displaystyle r_{t}}el número de tales observaciones conyi=1{\displaystyle y_{i}=1}. Suponemos que efectivamente hay "muchas" observaciones por cada "celda": por cadat,límitenortenortet/norte=dot>0{\displaystyle t,\lim _{n\rightarrow \infty }n_{t}/n=c_{t}>0}.

Denotar

pag^t=rt/nortet{\displaystyle {\hat {p}}_{t}=r_{t}/n_{t}}
σ^t2=1nortetpag^t(1pag^t)φ2(Φ1(pag^t)){\displaystyle {\hat {\sigma }}_{t}^{2}={\frac {1}{n_{t}}}{\frac {{\hat {p}}_{t}(1-{\hat {p}}_{t})}{\varphi ^{2}{\big (}\Phi ^{-1}({\hat {p}}_{t}){\big )}}}}

Entonces, el estimador chi-cuadrado mínimo de Berkson es un estimador de mínimos cuadrados generalizado en una regresión deΦ1(pag^t){\displaystyle \Phi ^{-1}({\hat {p}}_{t})}enincógnita(t){\displaystyle x_{(t)}}con pesasσ^t2{\displaystyle {\hat {\sigma }}_{t}^{-2}}:

β^=(t=1Tσ^t2incógnita(t)incógnita(t)T)1t=1Tσ^t2incógnita(t)Φ1(pag^t){\displaystyle {\hat {\beta }}={\Bigg (}\sum _{t=1}^{T}{\hat {\sigma }}_{t}^{-2}x_{(t)}x_{(t)}^{\operatorname {T} }{\Bigg )}^{-1}\sum _{t=1}^{T}{\hat {\sigma }}_{t}^{-2}x_{(t)}\Phi ^{-1}({\hat {p}}_{t})}

Se puede demostrar que este estimador es consistente (cuando n → ∞ y T es fijo), asintóticamente normal y eficiente. Su ventaja radica en la existencia de una fórmula analítica para el estimador. Sin embargo, este análisis solo tiene sentido cuando no se dispone de observaciones individuales, sino únicamente de sus recuentos agregados.rt{\displaystyle r_{t}},nortet{\displaystyle n_{t}}, yincógnita(t){\displaystyle x_{(t)}}(por ejemplo, en el análisis del comportamiento electoral).

Método de muestreo de Albert y Chib Gibbs

El muestreo de Gibbs de un modelo probit es posible con la introducción de variables latentes z con distribución normal , que se observan como 1 si son positivas y 0 en caso contrario. Este enfoque fue introducido en Albert y Chib (1993), [ 5 ] que demostró cómo el muestreo de Gibbs podría aplicarse a modelos de respuesta binarios y policotómicos dentro de un marco bayesiano. Bajo una distribución previa normal multivariada sobre los pesos, el modelo puede describirse como

βnorte(b0,B0)ziincógnitai,βnorte(incógnitaiTβ,1)yi={1si zi>00de lo contrario{\displaystyle {\begin{aligned}{\boldsymbol {\beta }}&\sim {\mathcal {N}}(\mathbf {b} _{0},\mathbf {B} _{0})\\[3pt]z_{i}\mid \mathbf {x} _{i},{\boldsymbol {\beta }}&\sim {\mathcal {N}}(\mathbf {x} _{i}^{\operatorname {T} }{\boldsymbol {\beta }},1)\\[3pt]y_{i}&={\begin{cases}1&{\text{if }}z_{i}>0\\0&{\text{otherwise}}\end{cases}}\end{aligned}}}

A partir de esto, Albert y Chib (1993) [ 5 ] derivan las siguientes distribuciones condicionales completas en el algoritmo de muestreo de Gibbs:

B=(B01+incógnitaTincógnita)1βznorte(B(B01b0+incógnitaTz),B)ziyi=0,incógnitai,βnorte(incógnitaiTβ,1)[zi0]ziyi=1,incógnitai,βnorte(incógnitaiTβ,1)[zi>0]{\displaystyle {\begin{aligned}\mathbf {B} &=(\mathbf {B} _{0}^{-1}+\mathbf {X} ^{\operatorname {T} }\mathbf {X} )^{-1}\\[3pt]{\boldsymbol {\beta }}\mid \mathbf {z} &\sim {\mathcal {N}}(\mathbf {B} (\mathbf {B} _{0}^{-1}\mathbf {b} _{0}+\mathbf {X} ^{\operatorname {T} }\mathbf {z} ),\mathbf {B} )\\[3pt]z_{i}\mid y_{i}=0,\mathbf {x} _{i},{\boldsymbol {\beta }}&\sim {\mathcal {N}}(\mathbf {x} _{i}^{\operatorname {T} }{\boldsymbol {\beta }},1)[z_{i}\leq 0]\\[3pt]z_{i}\mid y_{i}=1,\mathbf {x} _{i},{\boldsymbol {\beta }}&\sim {\mathcal {N}}(\mathbf {x} _{i}^{\operatorname {T} }{\boldsymbol {\beta }},1)[z_{i}>0]\end{aligned}}}

El resultado paraβ{\displaystyle {\boldsymbol {\beta }}}se da en el artículo sobre regresión lineal bayesiana , aunque se especifica con una notación diferente, mientras que las distribuciones posteriores condicionales de las variables latentes siguen una distribución normal truncada dentro de los rangos dados. La notación[zi<0]{\displaystyle [z_{i}<0]}es el corchete de Iverson , a veces escritoI(zi<0){\displaystyle {\mathcal {I}}(z_{i}<0)}o similares. Por lo tanto, el conocimiento de los resultados observados sirve para restringir el respaldo a las variables latentes.

Muestreo de los pesosβ{\displaystyle {\boldsymbol {\beta }}} dado el vector latentez{\displaystyle \mathbf {z} }El muestreo de la distribución multinormal es estándar. Para muestrear las variables latentes a partir de las distribuciones posteriores normales truncadas, se puede aprovechar el método de la función de distribución acumulada inversa, implementado en la siguiente función vectorizada de R , lo que facilita su implementación.

zbinprobit <- function ( y , X , beta , n ) { meanv <- X %*% beta u <- runif ( n ) # variables aleatorias uniformes(0,1) cd <- pnorm ( - meanv ) # CDF normal acumulativa pu <- ( u * cd ) * ( 1 - 2 * y ) + ( u + cd ) * y cpui <- qnorm ( pu ) # CDF normal inversa z <- meanv + cpui # vector latente return ( z ) }

Evaluación del modelo

La idoneidad de un modelo binario estimado se puede evaluar contando el número de observaciones verdaderas iguales a 1 y el número igual a cero, para las cuales el modelo asigna una clasificación predicha correcta al tratar cualquier probabilidad estimada superior a 1/2 (o inferior a 1/2) como una asignación de una predicción de 1 (o de 0). Consulte la sección " Modelo de regresión logística"  para obtener más detalles.

Rendimiento bajo especificaciones incorrectas

Consideremos la formulación del modelo de variable latente del modelo probit. Cuando la varianza deε{\displaystyle \varepsilon }condicionado aincógnita{\displaystyle x}no es constante sino que depende deincógnita{\displaystyle x}, entonces surge el problema de la heterocedasticidad . Por ejemplo, supongamos quey=β0+B1incógnita1+ε{\displaystyle y^{*}=\beta _{0}+B_{1}x_{1}+\varepsilon }yεincógnitanorte(0,incógnita12){\displaystyle \varepsilon \mid x\sim N(0,x_{1}^{2})}dóndeincógnita1{\displaystyle x_{1}}es una variable explicativa positiva continua. Bajo heterocedasticidad, el estimador probit paraβ{\displaystyle \beta }suele ser inconsistente, y la mayoría de las pruebas sobre los coeficientes no son válidas. Más importante aún, el estimador paraPAG(y=1incógnita){\displaystyle P(y=1\mid x)}También se vuelve inconsistente. Para abordar este problema, el modelo original debe transformarse para que sea homocedástico. Por ejemplo, en el mismo ejemplo,1[β0+β1incógnita1+ε>0]{\displaystyle 1[\beta _{0}+\beta _{1}x_{1}+\varepsilon >0]}puede reescribirse como1[β0/incógnita1+β1+ε/incógnita1>0]{\displaystyle 1[\beta _{0}/x_{1}+\beta _{1}+\varepsilon /x_{1}>0]}, dóndeε/incógnita1incógnitanorte(0,1){\displaystyle \varepsilon /x_{1}\mid x\sim N(0,1)}. Por lo tanto,PAG(y=1incógnita)=Φ(β1+β0/incógnita1){\displaystyle P(y=1\mid x)=\Phi (\beta _{1}+\beta _{0}/x_{1})}y ejecutando probit en(1,1/incógnita1){\displaystyle (1,1/x_{1})}genera un estimador consistente para la probabilidad condicionalPAG(y=1incógnita).{\displaystyle P(y=1\mid x).}

Cuando la suposición de queε{\displaystyle \varepsilon }Si la distribución normal no se cumple, surge un problema de especificación incorrecta de la forma funcional : si el modelo todavía se estima como un modelo probit, los estimadores de los coeficientesβ{\displaystyle \beta }son inconsistentes. Por ejemplo, siε{\displaystyle \varepsilon }sigue una distribución logística en el modelo verdadero, pero el modelo se estima mediante probit, las estimaciones serán generalmente menores que el valor verdadero. Sin embargo, la inconsistencia de las estimaciones de los coeficientes es prácticamente irrelevante porque las estimaciones para los efectos parciales ,PAG(y=1incógnita)/incógnitai{\displaystyle \partial P(y=1\mid x)/\partial x_{i'}}, estarán cerca de las estimaciones dadas por el verdadero modelo logit. [ 6 ]

Para evitar el problema de la especificación incorrecta de la distribución, se puede adoptar una suposición de distribución general para el término de error, de modo que se puedan incluir muchos tipos diferentes de distribución en el modelo. El costo es un mayor costo computacional y una menor precisión al aumentar el número de parámetros. [ 7 ] En la mayoría de los casos prácticos donde la forma de la distribución está mal especificada, los estimadores para los coeficientes son inconsistentes, pero los estimadores para la probabilidad condicional y los efectos parciales siguen siendo muy buenos.

También se pueden adoptar enfoques semiparamétricos o no paramétricos, por ejemplo, mediante métodos de verosimilitud local o cuasi-verosimilitud no paramétrica , que evitan las suposiciones sobre una forma paramétrica para la función de índice y son robustos a la elección de la función de enlace (por ejemplo, probit o logit). [ 4 ]

Historia

El modelo probit se suele atribuir a Chester Bliss , quien acuñó el término "probit" en 1934, [ 8 ] y a John Gaddum (1933), quien sistematizó trabajos anteriores. [ 9 ] Sin embargo, el modelo básico se remonta a la ley de Weber-Fechner de Gustav Fechner , publicada en Fechner (1860) , y fue redescubierto repetidamente hasta la década de 1930; véase Finney (1971 , capítulo 3.6) y Aitchison y Brown (1957 , capítulo 1.2) . [ 9 ]

Ronald Fisher propuso un método rápido para calcular estimaciones de máxima verosimilitud para el modelo probit como apéndice al trabajo de Bliss en 1935. [ 10 ]

Véase también

Referencias

  1. Oxford English Dictionary , 3.ª ed. sv probit (artículo de junio de 2007): Bliss, CI (1934). "El método de los probits". Science . 79 ( 2037): 38–39 . Bibcode : 1934Sci....79...38B . doi : 10.1126/science.79.2037.38 . PMID 17813446. Estas unidades de probabilidad arbitrarias se han denominado "probits". 
  2. Agresti, Alan (2015). Fundamentos de modelos lineales y generalizados lineales . Nueva York: Wiley. pp. 183–186 . ISBN  978-1-118-73003-4.
  3. Aldrich, John H.; Nelson, Forrest D.; Adler, E. Scott (1984). Probabilidad lineal, modelos logit y probit . Sage. págs. 48–65 . ISBN  0-8039-2133-0.
  4. 1 2 Park, Byeong U.; Simar, Léopold; Zelenyuk, Valentin (2017). "Estimación no paramétrica de modelos de elección discreta dinámica para datos de series temporales" (PDF) . Computational Statistics & Data Analysis . 108 : 97–120 . doi : 10.1016/j.csda.2016.10.024 .
  5. 1 2 Albert, J., & Chib, S. (1993). "Análisis bayesiano de datos de respuesta binarios y policotómicos." Journal of the American Statistical Association, 88(422), 669-679.
  6. Greene, WH (2003), Análisis econométrico, Prentice Hall, Upper Saddle River, NJ.
  7. Para más detalles, consulte: Cappé, O., Moulines, E. y Ryden, T. (2005): "Inferencia en modelos ocultos de Markov", Springer-Verlag Nueva York, Capítulo 2.
  8. Bliss, CI (1934). "El método de los probits". Science . 79 (2037): 38– 39. Bibcode : 1934Sci....79...38B . doi : 10.1126/science.79.2037.38 . PMID 17813446 . 
  9. 1 2 Cramer 2002 , pág. 7.
  10. Fisher, RA (1935). "El caso de cero supervivientes en ensayos probit" . Annals of Applied Biology . 22 : 164–165 . doi : 10.1111/j.1744-7348.1935.tb07713.x .{{cite journal}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  • Aitchison, John; Brown, James Alan Calvert (1957). La distribución lognormal: con especial referencia a sus usos en economía . University Press. ISBN 978-0-521-04011-2.{{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  • Cramer, JS (2002). Los orígenes de la regresión logística (PDF) (Informe técnico). Vol.  119. Instituto Tinbergen. pp. 167–178 . doi : 10.2139/ssrn.360300 . 
    • Publicado en: Cramer, JS (2004). "Los orígenes tempranos del modelo logit". Estudios en Historia y Filosofía de la Ciencia Parte C: Estudios en Historia y Filosofía de las Ciencias Biológicas y Biomédicas . 35 (4): 613– 626. doi : 10.1016/j.shpsc.2004.09.003 .
  • Fechner, Gustav Theodor (1860). Elemente der Psychophysik [ Elementos de la psicofísica ] . vol.  banda 2. Leipzig: Breitkopf und Härtel.
  • Finney, DJ (1971). Análisis probit . Vol.  60. p.  1432. Bibcode : 1971JPhmS..60T1432. . doi : 10.1002/jps.2600600940 .

Lecturas adicionales

  • Albert, JH; Chib, S. (1993). "Análisis bayesiano de datos de respuesta binarios y policotómicos". Journal of the American Statistical Association . 88 (422): 669– 679. Bibcode : 1993JASA...88..669A . doi : 10.1080/01621459.1993.10476321 . JSTOR 2290350 . 
  • Amemiya, Takeshi (1985). «Modelos de respuesta cualitativa» . Econometría avanzada . Oxford: Basil Blackwell. pp. 267–359 . ISBN  0-631-13345-3.
  • Gouriéroux, Christian (2000). «La dicotomía simple» . Econometría de variables dependientes cualitativas . Nueva York: Cambridge University Press. pp. 6–37 . ISBN  0-521-58985-1.
  • Liao, Tim Futing (1994). Interpretación de modelos de probabilidad: Logit, Probit y otros modelos lineales generalizados . Sage. ISBN 0-8039-4999-5.
  • McCullagh, Peter ; John Nelder (1989). Modelos lineales generalizados . Londres: Chapman and Hall. ISBN 0-412-31760-5.
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con el modelo Probit en Wikimedia Commons.
  • Clase de econometría (tema: modelo probit) en YouTube por Mark Thoma