La regresión de pico y placa es un tipo de regresión lineal bayesiana en la que se elige una distribución previa jerárquica particular para los coeficientes de regresión de tal manera que solo se retiene un subconjunto de los posibles regresores . La técnica es particularmente útil cuando el número de predictores posibles es mayor que el número de observaciones. [ 1 ] La idea del modelo de pico y placa fue propuesta originalmente por Mitchell y Beauchamp (1988). [ 2 ] El enfoque fue desarrollado significativamente por Madigan y Raftery (1994) [ 3 ] y George y McCulloch (1997). [ 4 ] Una contribución reciente e importante a esta literatura es la de Ishwaran y Rao (2005). [ 5 ]
Descripción del modelo
Supongamos que tenemos P posibles predictores en algún modelo. El vector γ tiene una longitud igual a P y consta de ceros y unos. Este vector indica si una variable en particular se incluye en la regresión o no. Si no se dispone de información previa específica sobre las probabilidades de inclusión iniciales de variables particulares, una distribución previa de Bernoulli es una opción común por defecto. [ 6 ] Condicionado a que un predictor esté en la regresión, identificamos una distribución previa para el coeficiente del modelo, que corresponde a esa variable ( β ). Una opción común en ese paso es utilizar una distribución previa normal con una media igual a cero y una varianza grande calculada en base a(dóndees una matriz de diseño de variables explicativas del modelo). [ 7 ]
Una extracción de γ de su distribución previa es una lista de las variables incluidas en la regresión. Condicionado a este conjunto de variables seleccionadas, tomamos una extracción de la distribución previa de los coeficientes de regresión (si γ i = 1 entonces β i ≠ 0 y si γ i = 0 entonces β i = 0). βγ denota el subconjunto de β para el cual γ i = 1. En el siguiente paso, calculamos una probabilidad posterior tanto para la inclusión como para los coeficientes aplicando un procedimiento estadístico estándar. [ 8 ] Todos los pasos del algoritmo descrito se repiten miles de veces utilizando la técnica de Monte Carlo de cadena de Markov (MCMC). Como resultado, obtenemos una distribución posterior de γ (inclusión de variables en el modelo), β (valores de los coeficientes de regresión) y la predicción correspondiente de y .
El modelo recibió su nombre (spike-and-slab) debido a la forma de las dos distribuciones previas. El "spike" representa la probabilidad de que un coeficiente específico del modelo sea cero. El "slab" representa la distribución previa de los valores de los coeficientes de regresión.
Una ventaja de las técnicas de selección de variables bayesianas es que pueden utilizar el conocimiento previo sobre el modelo. En ausencia de dicho conocimiento, se pueden utilizar algunos valores predeterminados razonables; citando a Scott y Varian (2013): "Para el analista que prefiere la simplicidad a costa de algunas suposiciones razonables, la información previa útil se puede reducir a un tamaño de modelo esperado, un R² esperado y un tamaño de muestra ν que determina el peso dado a la estimación de R² " . [ 6 ] Algunos investigadores sugieren los siguientes valores predeterminados: R² = 0,5 , ν = 0,01 y π = 0,5 (parámetro de una distribución de Bernoulli previa). [ 6 ]
Véase también
Referencias
- ↑ Varian, Hal R. (2014). "Big Data: Nuevos trucos para la econometría" . Journal of Economic Perspectives . 28 (2): 3– 28. doi : 10.1257/jep.28.2.3 .
- ↑ Mitchell, TJ; Beauchamp, JJ (1988). "Selección bayesiana de variables en regresión lineal". Journal of the American Statistical Association . 83 (404): 1023– 1032. doi : 10.1080/01621459.1988.10478694 .
- ↑ Madigan, David; Raftery, Adrian E. (1994). "Selección de modelos y consideración de la incertidumbre del modelo en modelos gráficos mediante la ventana de Occam". Journal of the American Statistical Association . 89 (428): 1535– 1546. doi : 10.1080/01621459.1994.10476894 .
- ↑ George, Edward I.; McCulloch, Robert E. (1997). "Enfoques para la selección bayesiana de variables". Statistica Sinica . 7 (2): 339– 373. JSTOR 24306083 .
- ↑ Ishwaran, Hemant; Rao, J. Sunil (2005). "Selección de variables Spike y slab: estrategias frecuentistas y bayesianas". The Annals of Statistics . 33 (2): 730– 773. arXiv : math/0505633 . Bibcode : 2005math......5633I . doi : 10.1214/009053604000001147 . S2CID 9004248 .
- 1 2 3 Scott, Steven L.; Varian, Hal R. (2014). "Predicción del presente con series temporales estructurales bayesianas". Revista Internacional de Modelado Matemático y Optimización Numérica . 5 ( 1– 2): 4– 23. CiteSeerX 10.1.1.363.2973 . doi : 10.1504/IJMMNO.2014.059942 .
- ↑ "Selección bayesiana de variables para la predicción a corto plazo de series temporales económicas" (PDF) .
- ↑ Brodersen, Kay H.; Gallusser, Fabian; Koehler, Jim; Remy, Nicolas; Scott, Steven L. (2015). "Inferencia del impacto causal mediante modelos bayesianos estructurales de series temporales" . Annals of Applied Statistics . 9 : 247–274 . arXiv : 1506.00356 . doi : 10.1214/14-AOAS788 . S2CID 2879370 .
Lecturas adicionales
- Congdon, Peter D. (2020). «Técnicas de regresión con priors jerárquicos». Modelos jerárquicos bayesianos (2.ª ed.). Boca Raton: CRC Press. pp. 253–315 . ISBN 978-1-03-217715-1.
- Aprendizaje automático
- Inferencia bayesiana
- estadística bayesiana