En estadística y aprendizaje automático , una función predictora lineal es una función lineal ( combinación lineal ) de un conjunto de coeficientes y variables explicativas ( variables independientes ), cuyo valor se utiliza para predecir el resultado de una variable dependiente . [ 1 ] Este tipo de función suele aparecer en la regresión lineal , donde los coeficientes se denominan coeficientes de regresión . Sin embargo, también aparecen en varios tipos de clasificadores lineales (por ejemplo, regresión logística , [ 2 ] perceptrones , [ 3 ] máquinas de vectores de soporte , [ 4 ] y análisis discriminante lineal [ 5 ] ), así como en otros modelos, como el análisis de componentes principales [ 6 ] y el análisis factorial . En muchos de estos modelos, los coeficientes se denominan "pesos".
Definición
La forma básica de una función predictora linealpara el punto de datos i (que consta de p variables explicativas ), para i = 1, ..., n , es
dónde, para k = 1, ..., p , es el valor de la k -ésima variable explicativa para el punto de datos i , yson los coeficientes (coeficientes de regresión, ponderaciones, etc.) que indican el efecto relativo de una variable explicativa particular sobre el resultado .
Notaciones
Es común escribir la función predictora de forma más compacta, como se muestra a continuación:
- Los coeficientes β 0 , β 1 , ..., β p se agrupan en un único vector β de tamaño p + 1.
- Para cada punto de datos i , se agrega una pseudovariable explicativa adicional x i 0 , con un valor fijo de 1, que corresponde al coeficiente de intersección β 0 .
- Las variables explicativas resultantes x i0 (= 1), x i 1 , ..., x ip se agrupan luego en un único vector x i de tamaño p + 1.
Notación vectorial
Esto permite escribir la función predictora lineal de la siguiente manera:
utilizando la notación para el producto escalar entre dos vectores.
Notación matricial
Una forma equivalente utilizando notación matricial es la siguiente:
dóndeyse supone que son vectores columna de (p+1) por -1 ,es la transpuesta de la matriz de(entonceses un vector fila de 1 por (p+1) ), yindica la multiplicación de matrices entre el vector fila de 1 por (p+1) y el vector columna de (p+1) por 1, produciendo una matriz de 1 por 1 que se toma como un escalar .
Regresión lineal
Un ejemplo del uso de una función predictora lineal se encuentra en la regresión lineal , donde cada punto de datos está asociado con un resultado continuo y i , y la relación se escribe
dóndees un término de perturbación o variable de error : una variable aleatoria no observada que agrega ruido a la relación lineal entre la variable dependiente y la función predictora.
Apilado
En algunos modelos (regresión lineal estándar, en particular), las ecuaciones para cada uno de los puntos de datos i = 1, ..., n se apilan y se escriben en forma vectorial como
dónde
La matriz X se conoce como matriz de diseño y codifica toda la información conocida sobre las variables independientes . Las variablesson variables aleatorias , que en la regresión lineal estándar se distribuyen según una distribución normal estándar ; expresan la influencia de cualquier factor desconocido sobre el resultado.
Esto permite encontrar coeficientes óptimos mediante el método de mínimos cuadrados utilizando operaciones matriciales simples. En particular, los coeficientes óptimosSegún la estimación por mínimos cuadrados, se puede escribir de la siguiente manera:
La matrizSe conoce como la pseudoinversa de Moore-Penrose de X. El uso de la inversa de la matriz en esta fórmula requiere que X sea de rango completo , es decir, que no exista multicolinealidad perfecta entre las diferentes variables explicativas (es decir, que ninguna variable explicativa pueda predecirse perfectamente a partir de las demás). En tales casos, se puede utilizar la descomposición en valores singulares para calcular la pseudoinversa.
Preprocesamiento de variables explicativas
Cuando se utiliza un conjunto fijo de funciones no lineales para transformar el valor o los valores de un punto de datos, estas funciones se conocen como funciones base . Un ejemplo es la regresión polinómica , que utiliza una función predictora lineal para ajustar una relación polinómica de grado arbitrario (hasta un orden dado) entre dos conjuntos de puntos de datos (es decir, una única variable explicativa de valor real y una variable dependiente relacionada de valor real), mediante la adición de múltiples variables explicativas que corresponden a diversas potencias de la variable explicativa existente. Matemáticamente, la forma es la siguiente:
En este caso, para cada punto de datos i , se crea un conjunto de variables explicativas de la siguiente manera:
y luego se ejecuta la regresión lineal estándar . Las funciones base en este ejemplo serían:
Este ejemplo demuestra que una función predictora lineal puede ser mucho más potente de lo que parece a primera vista: solo necesita ser lineal en los coeficientes . El modelo puede ajustar todo tipo de funciones no lineales de las variables explicativas.
No es necesario que las entradas de las funciones base sean univariadas o unidimensionales (ni sus salidas, de hecho, aunque en tal caso, un valor de salida K -dimensional probablemente se trate como K funciones base de salida escalar separadas). Un ejemplo de esto son las funciones de base radial (RBF), que calculan una versión transformada de la distancia a un punto fijo:
- ;\mathbf {c} )=\phi (||\mathbf {x} -\mathbf {c} ||)=\phi ({\sqrt {(x_{1}-c_{1})^{2}+\ldots +(x_{K}-c_{K})^{2}}})}
Un ejemplo es la RBF gaussiana , que tiene la misma forma funcional que la distribución normal :
- ;\mathbf {c} )=e^{-b||\mathbf {x} -\mathbf {c} ||^{2}}}
que disminuye rápidamente a medida que aumenta la distancia desde c .
Un posible uso de las RBF consiste en crear una para cada punto de datos observado. Esto significa que el resultado de una RBF aplicada a un nuevo punto de datos será cercano a 0, a menos que el nuevo punto esté cerca del punto alrededor del cual se aplicó la RBF. Es decir, la aplicación de las funciones de base radial seleccionará el punto más cercano, y su coeficiente de regresión será dominante. El resultado será una forma de interpolación del vecino más cercano , donde las predicciones se realizan simplemente utilizando la predicción del punto de datos observado más cercano, posiblemente interpolando entre múltiples puntos de datos cercanos cuando todos están a distancias similares. Este tipo de método del vecino más cercano para la predicción a menudo se considera diametralmente opuesto al tipo de predicción utilizado en la regresión lineal estándar: pero, de hecho, las transformaciones que se pueden aplicar a las variables explicativas en una función predictora lineal son tan potentes que incluso el método del vecino más cercano puede implementarse como un tipo de regresión lineal.
Incluso es posible ajustar algunas funciones que parecen no lineales en los coeficientes transformando dichos coeficientes en nuevos coeficientes que sí parecen lineales. Por ejemplo, una función de la formapara coeficientespodría transformarse en la función lineal apropiada aplicando las sustitucionesconduciendo aque es lineal. Se podrían aplicar técnicas de regresión lineal y similares, y a menudo encontrarán los coeficientes óptimos, pero sus estimaciones de error y demás serán incorrectas.
Las variables explicativas pueden ser de cualquier tipo : reales , binarias , categóricas , etc. La distinción principal radica entre variables continuas (por ejemplo, ingresos, edad, presión arterial , etc.) y variables discretas (por ejemplo, sexo, raza, partido político, etc.). Las variables discretas que se refieren a más de dos opciones posibles se codifican normalmente mediante variables ficticias (o variables indicadoras ), es decir, se crean variables explicativas separadas que toman el valor 0 o 1 para cada valor posible de la variable discreta, donde un 1 significa "la variable tiene el valor dado" y un 0 significa "la variable no tiene el valor dado". Por ejemplo, una variable discreta de cuatro vías para el grupo sanguíneo con los posibles valores "A, B, AB, O" se convertiría en variables ficticias separadas de dos vías, "es-A, es-B, es-AB, es-O", donde solo una de ellas tiene el valor 1 y todas las demás tienen el valor 0. Esto permite que se asignen coeficientes de regresión separados para cada valor posible de la variable discreta.
Nótese que, para K categorías, no todas las K variables ficticias son independientes entre sí. Por ejemplo, en el ejemplo del grupo sanguíneo anterior, solo tres de las cuatro variables ficticias son independientes, en el sentido de que una vez que se conocen los valores de tres de las variables, la cuarta se determina automáticamente. Por lo tanto, en realidad solo es necesario codificar tres de las cuatro posibilidades como variables ficticias, y de hecho, si se codifican las cuatro posibilidades, el modelo general se vuelve no identificable . Esto causa problemas para varios métodos, como la solución simple de forma cerrada utilizada en la regresión lineal. La solución consiste en evitar estos casos eliminando una de las variables ficticias o introduciendo una restricción de regularización (lo que requiere un método más potente, generalmente iterativo, para encontrar los coeficientes óptimos). [ 7 ]
Véase también
Referencias
- ↑ Makhoul, J. (1975). "Predicción lineal: una revisión tutorial". Actas del IEEE . 63 (4): 561– 580. Bibcode : 1975IEEEP..63..561M . doi : 10.1109/PROC.1975.9792 . ISSN 0018-9219 .
- ↑ David A. Freedman (2009). Modelos estadísticos: teoría y práctica . Cambridge University Press . pág . 26. ISBN 9780521743853Una ecuación de regresión simple tiene en el lado derecho una intersección y una
variable explicativa con un coeficiente de pendiente. Una ecuación de regresión múltiple tiene dos o más variables explicativas en el lado derecho, cada una con su propio coeficiente de pendiente.
- ↑ Rosenblatt, Frank (1957), El perceptrón: un autómata que percibe y reconoce. Informe 85-460-1, Laboratorio Aeronáutico de Cornell.
- ↑ Cortes, Corinna ; Vapnik, Vladimir N. (1995). "Redes de vectores de soporte" (PDF) . Machine Learning . 20 (3): 273– 297. CiteSeerX 10.1.1.15.9362 . doi : 10.1007/BF00994018 . Archivado del original (PDF) el 6 de enero de 2022. Recuperado el 30 de julio de 2019 .
- ↑ McLachlan, GJ (2004). Análisis discriminante y reconocimiento estadístico de patrones . Wiley Interscience. ISBN 978-0-471-69115-0. MR 1190469 .
- ↑ Jolliffe IT Análisis de componentes principales , Serie: Springer Series in Statistics, 2.ª ed., Springer, NY, 2002, XXIX, 487 p. 28 il. ISBN 978-0-387-95442-4
- ↑ Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome H. (2009). Los elementos del aprendizaje estadístico: minería de datos, inferencia y predicción . Springer. ISBN 978-0-387-84884-6.
- Análisis de regresión
- Aprendizaje automático