En estadística , la regresión de proyección-persecución (PPR) es un modelo estadístico desarrollado por Jerome H. Friedman y Werner Stuetzle que extiende los modelos aditivos . Este modelo adapta los modelos aditivos en el sentido de que primero proyecta la matriz de datos de las variables explicativas en la dirección óptima antes de aplicar funciones de suavizado a estas variables explicativas.
Descripción general del modelo
El modelo consiste en combinaciones lineales de funciones de cresta : transformaciones no lineales de combinaciones lineales de las variables explicativas. El modelo básico toma la forma
donde x i es una fila de 1 × p de la matriz de diseño que contiene las variables explicativas, por ejemplo i , y i es una predicción de 1 × 1, { β j } es una colección de r vectores (cada uno un vector unitario de longitud p ) que contienen los parámetros desconocidos, { f j } es una colección de r funciones suaves inicialmente desconocidas que se asignan a partir de , y r es un hiperparámetro. Se pueden determinar buenos valores para r a través de una validación cruzada o una estrategia de avance por etapas que se detiene cuando el ajuste del modelo no se puede mejorar significativamente. A medida que r se acerca al infinito y con un conjunto apropiado de funciones { f j }, el modelo PPR es un estimador universal , ya que puede aproximar cualquier función continua en .
Estimación del modelo
Para un conjunto de datos dado , el objetivo es minimizar la función de error.
sobre las funciones y vectores . No existe ningún método para resolver sobre todas las variables a la vez, pero se puede resolver mediante optimización alternada. Primero, considere cada par individualmente: supongamos que todos los demás parámetros son fijos y hallemos un "residuo", la varianza de la salida no explicada por esos otros parámetros, dada por
La tarea de minimizar la función de error ahora se reduce a resolver
para cada j por turno. Normalmente, se agregan nuevos pares al modelo en forma progresiva.
Nota aparte: los pares ajustados previamente se pueden reajustar después de que se determinen los nuevos pares ajustados mediante un algoritmo conocido como ajuste posterior , que implica reconsiderar un par anterior, recalcular el residuo considerando cómo han cambiado otros pares, reajustar para tener en cuenta esa nueva información y luego recorrer todos los pares ajustados de esta manera hasta que los parámetros converjan. Este proceso generalmente da como resultado un modelo que funciona mejor con menos pares ajustados, aunque lleva más tiempo entrenarlo y, por lo general, es posible lograr el mismo rendimiento omitiendo el ajuste posterior y simplemente agregando más ajustes al modelo (aumentando r ).
La solución de la función de error simplificada para determinar un par se puede hacer con optimización alternada, donde primero se utiliza un valor aleatorio para proyectar en el espacio 1D, y luego se encuentra el óptimo para describir la relación entre esa proyección y los residuos a través de su método de regresión de diagrama de dispersión favorito. Luego, si se mantiene constante, suponiendo que alguna vez es diferenciable, los pesos actualizados óptimos se pueden encontrar a través del método de Gauss-Newton , un método cuasi-Newton en el que se descarta la parte del hessiano que involucra la segunda derivada. Para derivar esto, primero se desarrolla Taylor , luego se vuelve a introducir la expansión en la función de error simplificada y se realiza alguna manipulación algebraica para ponerla en la forma
Este es un problema de mínimos cuadrados ponderados . Si calculamos todos los pesos y los colocamos en una matriz diagonal , apilamos todos los nuevos objetivos en un vector y usamos la matriz de datos completa en lugar de un solo ejemplo , entonces el óptimo viene dado por la forma cerrada.
Utilice esta actualización para encontrar una nueva proyección y reajustarla al nuevo diagrama de dispersión. Luego, utilice esa nueva para actualizar resolviendo lo anterior y continúe con este proceso alterno hasta que converja.
Se ha demostrado que la tasa de convergencia, el sesgo y la varianza se ven afectados por la estimación de y .
Discusión
El modelo PPR adopta la forma de un modelo aditivo básico pero con el componente adicional, de modo que cada uno se ajusta a un diagrama de dispersión de vs el residuo (varianza inexplicada) durante el entrenamiento en lugar de utilizar las entradas en bruto. Esto limita el problema de encontrar cada uno a una dimensión baja, lo que lo hace solucionable con métodos de ajuste de mínimos cuadrados o spline comunes y evita la maldición de la dimensionalidad durante el entrenamiento. Debido a que se toma de una proyección de , el resultado parece una "cresta" ortogonal a la dimensión de la proyección, por lo que a menudo se denominan "funciones de cresta". Las direcciones se eligen para optimizar el ajuste de sus funciones de cresta correspondientes.
Cabe señalar que, dado que el modelo PPR intenta ajustar las proyecciones de los datos, puede resultar difícil interpretar el modelo ajustado en su totalidad, ya que cada variable de entrada se ha tenido en cuenta de una manera compleja y multifacética. Esto puede hacer que el modelo sea más útil para la predicción que para la comprensión de los datos, aunque visualizar las funciones de cresta individuales y considerar qué proyecciones descubre el modelo puede brindar cierta información.
Ventajas de la estimación PPR
- Utiliza funciones de regresión univariadas en lugar de su forma multivariada, abordando así eficazmente la maldición de la dimensionalidad.
- La regresión univariante permite una estimación simple y eficiente
- En relación con los modelos aditivos generalizados , la PPR puede estimar una clase de funciones mucho más rica.
- A diferencia de los métodos de promedio local (como los k vecinos más cercanos ), la PPR puede ignorar variables con bajo poder explicativo.
Desventajas de la estimación del PPR
- La PPR requiere examinar un espacio de parámetros M-dimensional para estimar .
- Se debe seleccionar el parámetro de suavizado para .
- El modelo es a menudo difícil de interpretar
Extensiones del PPR
- Se han sugerido suavizadores alternativos, como la función radial, la función armónica y la función aditiva, y sus rendimientos varían según los conjuntos de datos utilizados.
- También se han utilizado criterios de optimización alternativos, como las desviaciones absolutas estándar y las desviaciones absolutas medias .
- Los mínimos cuadrados ordinarios se pueden utilizar para simplificar los cálculos, ya que a menudo los datos no presentan fuertes no linealidades.
- Se ha utilizado la regresión inversa cortada (SIR) para elegir los vectores de dirección para PPR.
- La PPR generalizada combina la PPR regular con los mínimos cuadrados reponderados iterativamente (IRLS) y una función de enlace para estimar datos binarios.
PPR frente a redes neuronales (NN)
Tanto la regresión de búsqueda de proyección como las redes neuronales completamente conectadas con una sola capa oculta proyectan el vector de entrada en un hiperplano unidimensional y luego aplican una transformación no lineal de las variables de entrada que luego se agregan de manera lineal. Por lo tanto, ambas siguen los mismos pasos para superar la maldición de la dimensionalidad. La principal diferencia es que las funciones que se ajustan en PPR pueden ser diferentes para cada combinación de variables de entrada y se estiman una a la vez y luego se actualizan con los pesos, mientras que en NN todas estas se especifican por adelantado y se estiman simultáneamente.
Así, en la estimación de PPR las transformaciones de las variables en PPR están impulsadas por los datos, mientras que en una red neuronal de una sola capa estas transformaciones son fijas.
Véase también
Referencias
- Friedman, JH y Stuetzle, W. (1981) Regresión de búsqueda de proyección. Revista de la Asociación Estadounidense de Estadística, 76, 817–823.
- Hand, D., Mannila, H. y Smyth, P. (2001) Principios de minería de datos. MIT Press. ISBN 0-262-08290-X
- Hall, P. (1988) Estimación de la dirección en la que un conjunto de datos es más interesante, Probab. Theory Related Fields, 80, 51–77.
- Hastie, TJ, Tibshirani, RJ y Friedman, JH (2009). Los elementos del aprendizaje estadístico: minería de datos, inferencia y predicción. Springer. ISBN 978-0-387-84857-0
- Klinke, S. y Grassmann, J. (2000) 'Projection Pursuit Regression' en Suavizado y regresión: enfoques, computación y aplicación. Ed. Schimek, MG. Wiley Interscience.
- Lingjarde, OC y Liestol, K. (1998) Regresión de búsqueda de proyección generalizada. SIAM Journal of Scientific Computing, 20, 844–857.