
En estadística , la transformación de datos consiste en la aplicación de una función matemática determinista a cada punto de un conjunto de datos ; es decir, cada punto de datos z i se reemplaza por el valor transformado y i = f ( z i ), donde f es una función. Las transformaciones se aplican generalmente para que los datos parezcan ajustarse mejor a los supuestos de un procedimiento de inferencia estadística que se va a aplicar, o para mejorar la interpretabilidad o la apariencia de los gráficos .
Casi siempre, la función que se utiliza para transformar los datos es invertible y, por lo general, continua . La transformación se aplica normalmente a un conjunto de mediciones comparables. Por ejemplo, si trabajamos con datos sobre los ingresos de las personas en una determinada unidad monetaria , lo habitual sería transformar el valor de los ingresos de cada persona mediante la función logaritmo .
Motivación
La guía sobre cómo deben transformarse los datos, o si debe aplicarse alguna transformación, debe provenir del análisis estadístico específico que se vaya a realizar. Por ejemplo, una forma sencilla de construir un intervalo de confianza aproximado del 95 % para la media poblacional es tomar la media muestral más o menos dos unidades de error estándar . Sin embargo, el factor constante 2 utilizado aquí es particular de la distribución normal y solo es aplicable si la media muestral varía aproximadamente de forma normal. El teorema del límite central establece que, en muchas situaciones, la media muestral varía normalmente si el tamaño de la muestra es razonablemente grande. Sin embargo, si la población está sustancialmente sesgada y el tamaño de la muestra es, como máximo, moderado, la aproximación proporcionada por el teorema del límite central puede ser deficiente y el intervalo de confianza resultante probablemente tendrá una probabilidad de cobertura incorrecta . Por lo tanto, cuando hay evidencia de asimetría sustancial en los datos, es común transformar los datos a una distribución simétrica [ 1 ] antes de construir un intervalo de confianza. Si se desea, el intervalo de confianza para los cuantiles (como la mediana) se puede transformar de nuevo a la escala original utilizando la inversa de la transformación que se aplicó a los datos. [ 2 ] [ 3 ]
Los datos también pueden transformarse para facilitar su visualización. Por ejemplo, supongamos que tenemos un diagrama de dispersión donde los puntos representan los países del mundo y los valores de datos graficados son la superficie terrestre y la población de cada país. Si el gráfico se crea con datos sin transformar (por ejemplo, kilómetros cuadrados para la superficie y el número de personas para la población), la mayoría de los países se agruparían en puntos muy juntos en la esquina inferior izquierda del gráfico. Los pocos países con superficies y/o poblaciones muy grandes se dispersarían por la mayor parte del área del gráfico. Un simple cambio de escala (por ejemplo, a miles de kilómetros cuadrados o a millones de personas) no modificará esta distribución. Sin embargo, al aplicar transformaciones logarítmicas tanto a la superficie como a la población, los puntos se distribuirán de forma más uniforme en el gráfico.
Otra razón para aplicar la transformación de datos es mejorar la interpretabilidad, incluso si no se va a realizar un análisis estadístico formal ni una visualización. Por ejemplo, supongamos que comparamos coches en función de su consumo de combustible. Estos datos suelen presentarse como "kilómetros por litro" o "millas por galón". Sin embargo, si el objetivo es evaluar cuánto combustible adicional consumiría una persona en un año al conducir un coche en comparación con otro, resulta más natural trabajar con los datos transformados aplicando la función recíproca , obteniendo así litros por kilómetro o galones por milla.
En regresión
La transformación de datos puede utilizarse como medida correctiva para que los datos sean adecuados para el modelado con regresión lineal si los datos originales violan uno o más supuestos de la regresión lineal. [ 4 ] Por ejemplo, los modelos de regresión lineal más simples asumen una relación lineal entre el valor esperado de Y (la variable de respuesta que se va a predecir) y cada variable independiente (cuando las demás variables independientes se mantienen fijas). Si la linealidad no se cumple, ni siquiera de forma aproximada, a veces es posible transformar las variables independientes o dependientes en el modelo de regresión para mejorar la linealidad. [ 5 ] Por ejemplo, la adición de funciones cuadráticas de las variables independientes originales puede conducir a una relación lineal con el valor esperado de Y, lo que resulta en un modelo de regresión polinómica , un caso especial de regresión lineal.
Otro supuesto de la regresión lineal es la homocedasticidad , es decir, que la varianza de los errores debe ser la misma independientemente de los valores de las variables predictoras. Si este supuesto no se cumple (es decir, si los datos son heterocedásticos ), puede ser posible encontrar una transformación de Y sola, o transformaciones tanto de X (las variables predictoras ) como de Y , de tal manera que el supuesto de homocedasticidad (además del supuesto de linealidad) se cumpla en las variables transformadas [ 5 ] y, por lo tanto, se pueda aplicar la regresión lineal a estas.
Otra aplicación de la transformación de datos consiste en abordar el problema de la falta de normalidad en los términos de error. La normalidad univariada no es necesaria para que las estimaciones de mínimos cuadrados de los parámetros de regresión sean significativas (véase el teorema de Gauss-Markov ). Sin embargo, los intervalos de confianza y las pruebas de hipótesis tendrán mejores propiedades estadísticas si las variables presentan normalidad multivariada . Las transformaciones que estabilizan la varianza de los términos de error (es decir, las que abordan la heterocedasticidad) a menudo también ayudan a que los términos de error sean aproximadamente normales. [ 5 ] [ 6 ]
Ejemplos
Ecuación:
- Significado: Un aumento de una unidad en X está asociado con un aumento promedio de b unidades en Y.
Ecuación:
- (Al elevar al exponente ambos lados de la ecuación:)
- Significado: Un aumento de una unidad en X está asociado con un aumento promedio de b unidades en, o equivalentemente, Y aumenta en promedio por un factor multiplicativo de. A modo de ejemplo, si se utilizara el logaritmo en base 10 en lugar del logaritmo natural en la transformación anterior y se usaran los mismos símbolos ( a y b ) para denotar los coeficientes de regresión, entonces un aumento de una unidad en X daría lugar a unveces aumenta Y en promedio. Si b fuera 1, esto implicaría un aumento de 10 veces en Y por cada unidad de aumento en X.
Ecuación:
- Significado: Un aumento de k veces en X está asociado con un promedio deunidades de aumento en Y. A modo de ejemplo, si se utilizara el logaritmo en base 10 en lugar del logaritmo natural en la transformación anterior y se usaran los mismos símbolos ( a y b ) para denotar los coeficientes de regresión, entonces un aumento de diez veces en X daría como resultado un aumento promedio deunidades en Y
Ecuación:
- (Al elevar al exponente ambos lados de la ecuación:)
- Significado: Un aumento de k veces en X está asociado con unaumento multiplicativo en Y en promedio. Por lo tanto, si X se duplica, resultaría en que Y cambie por un factor multiplicativo de. [ 7 ]
Alternativa
Los modelos lineales generalizados (MLG) proporcionan una generalización flexible de la regresión lineal ordinaria que permite utilizar variables de respuesta con modelos de distribución de errores distintos a la distribución normal. Los MLG permiten relacionar el modelo lineal con la variable de respuesta mediante una función de enlace y que la magnitud de la varianza de cada medición sea función de su valor predicho. [ 8 ] [ 9 ]
Casos comunes
La transformación logarítmica y la transformación de raíz cuadrada se utilizan comúnmente para datos positivos, y la transformación inversa multiplicativa ( transformación recíproca ) se puede utilizar para datos distintos de cero. La transformación de potencia es una familia de transformaciones parametrizadas por un valor no negativo λ que incluye las transformaciones logarítmica, de raíz cuadrada e inversa multiplicativa como casos especiales. Para abordar la transformación de datos de forma sistemática, es posible utilizar técnicas de estimación estadística para estimar el parámetro λ en la transformación de potencia, identificando así la transformación que es aproximadamente la más apropiada en un contexto dado. Dado que la familia de transformaciones de potencia también incluye la transformación identidad, este enfoque también puede indicar si sería mejor analizar los datos sin una transformación. En el análisis de regresión, este enfoque se conoce como la transformación de Box-Cox .
La transformación recíproca, algunas transformaciones de potencia como la transformación de Yeo-Johnson y otras transformaciones como la aplicación del seno hiperbólico inverso , pueden aplicarse de manera significativa a datos que incluyen valores tanto positivos como negativos [ 10 ] (la transformación de potencia es invertible sobre todos los números reales si λ es un entero impar). Sin embargo, cuando se observan valores tanto negativos como positivos, a veces es común comenzar sumando una constante a todos los valores, lo que produce un conjunto de datos no negativos a los que se puede aplicar cualquier transformación de potencia. [ 3 ]
Una situación común en la que se aplica una transformación de datos es cuando un valor de interés abarca varios órdenes de magnitud . Muchos fenómenos físicos y sociales presentan este comportamiento : ingresos, poblaciones de especies, tamaños de galaxias y volúmenes de lluvia, por mencionar algunos. Las transformaciones de potencia, y en particular el logaritmo, se pueden usar con frecuencia para inducir simetría en dichos datos. El logaritmo suele ser el preferido porque su resultado es fácil de interpretar en términos de "cambios relativos".
El logaritmo también tiene un efecto útil en las razones. Si comparamos cantidades positivas X e Y usando la razón X / Y , entonces si X < Y , la razón está en el intervalo (0,1), mientras que si X > Y , la razón está en la semirrecta (1,∞), donde la razón de 1 corresponde a la igualdad. En un análisis donde X e Y se tratan simétricamente, la razón logarítmica log( X / Y ) es cero en el caso de igualdad, y tiene la propiedad de que si X es K veces mayor que Y , la razón logarítmica es equidistante de cero como en la situación donde Y es K veces mayor que X (las razones logarítmicas son log( K ) y − log( K ) en estas dos situaciones).
Si los valores están naturalmente restringidos al rango de 0 a 1, sin incluir los puntos extremos, entonces una transformación logit puede ser apropiada: esto produce valores en el rango ( − ∞,∞).
Transformación hacia la normalidad
1. No siempre es necesario ni deseable transformar un conjunto de datos para que se asemeje a una distribución normal. Sin embargo, si se desea simetría o normalidad, a menudo se pueden inducir mediante una de las transformaciones de potencia.
2. Una función de potencia lingüística se distribuye según la ley de Zipf-Mandelbrot . La distribución es extremadamente irregular y leptocúrtica , razón por la cual los investigadores tuvieron que prescindir de la estadística para resolver, por ejemplo, problemas de atribución de autoría . Sin embargo, el uso de la estadística gaussiana es perfectamente posible mediante la aplicación de una transformación de datos. [ 11 ]
3. Para evaluar si se ha alcanzado la normalidad tras la transformación, se puede utilizar cualquiera de las pruebas de normalidad estándar. Un enfoque gráfico suele ser más informativo que una prueba estadística formal, por lo que se suele utilizar un gráfico de cuantiles normales para evaluar el ajuste de un conjunto de datos a una población normal. Como alternativa, también se han propuesto reglas empíricas basadas en la asimetría y la curtosis de la muestra . [ 12 ] [ 13 ]
Transformación en una distribución uniforme o una distribución arbitraria
Si observamos un conjunto de n valores X 1 , ..., X n sin empates (es decir, hay n valores distintos), podemos reemplazar X i con el valor transformado Y i = k , donde k se define de tal manera que X i es el k-ésimo mayor entre todos los valores X. Esto se denomina transformación de rango [ 14 ] y crea datos que se ajustan perfectamente a una distribución uniforme . Este enfoque tiene un análogo poblacional .
Utilizando la transformación integral de probabilidad , si X es cualquier variable aleatoria y F es la función de distribución acumulativa de X , entonces siempre que F sea invertible, la variable aleatoria U = F ( X ) sigue una distribución uniforme en el intervalo unitario [0,1].
A partir de una distribución uniforme, podemos transformarla en cualquier distribución con una función de distribución acumulativa invertible. Si G es una función de distribución acumulativa invertible y U es una variable aleatoria con distribución uniforme, entonces la variable aleatoria G −1 ( U ) tiene a G como su función de distribución acumulativa.
Al juntar ambos, si X es cualquier variable aleatoria, F es la función de distribución acumulativa invertible de X , y G es una función de distribución acumulativa invertible, entonces la variable aleatoria G −1 ( F ( X )) tiene a G como su función de distribución acumulativa.
transformaciones estabilizadoras de la varianza
Muchos tipos de datos estadísticos presentan una relación entre la varianza y la media, lo que significa que la variabilidad difiere para valores con diferentes valores esperados . Por ejemplo, al comparar distintas poblaciones del mundo, la varianza de los ingresos tiende a aumentar con el ingreso medio. Si consideramos varias unidades geográficas pequeñas (por ejemplo, condados en Estados Unidos) y calculamos la media y la varianza de los ingresos dentro de cada condado, es común que los condados con mayor ingreso medio también presenten mayores varianzas.
Una transformación estabilizadora de la varianza tiene como objetivo eliminar la relación varianza-media, de modo que la varianza se vuelva constante con respecto a la media. Ejemplos de transformaciones estabilizadoras de la varianza son la transformación de Fisher para el coeficiente de correlación muestral, la transformación de raíz cuadrada o transformación de Anscombe para datos de Poisson (datos de conteo), la transformación de Box-Cox para el análisis de regresión y la transformación de raíz cuadrada del arcoseno o transformación angular para proporciones ( datos binomiales ). Si bien se usa comúnmente para el análisis estadístico de datos proporcionales, la transformación de raíz cuadrada del arcoseno no se recomienda porque la regresión logística o una transformación logit son más apropiadas para proporciones binomiales o no binomiales, respectivamente, especialmente debido a la disminución del error de tipo II . [ 15 ] [ 3 ]
Transformaciones para datos multivariados
Las funciones univariadas se pueden aplicar punto por punto a datos multivariados para modificar sus distribuciones marginales. También es posible modificar algunos atributos de una distribución multivariada utilizando una transformación construida adecuadamente. Por ejemplo, cuando se trabaja con series temporales y otros tipos de datos secuenciales, es común diferenciar los datos para mejorar la estacionariedad . Si los datos generados por un vector aleatorio X se observan como vectores X i de observaciones con matriz de covarianza Σ, se puede utilizar una transformación lineal para descorrelacionar los datos. Para ello, se utiliza la descomposición de Cholesky para expresar Σ = A A' . Entonces, el vector transformado Y i = A −1 X i tiene la matriz identidad como su matriz de covarianza.
Véase también
Referencias
- ↑ Kuhn, Max; Johnson, Kjell (2013). Modelado predictivo aplicado . Nueva York. doi : 10.1007/978-1-4614-6849-3 . ISBN 9781461468493. LCCN 2013933452 . OCLC 844349710 . S2CID 60246745 .
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace ) - ↑ Altman, Douglas G.; Bland, J. Martin (1996-04-27). "Notas de estadística: transformaciones, medias e intervalos de confianza" . BMJ . 312 ( 7038): 1079. doi : 10.1136/bmj.312.7038.1079 . ISSN 0959-8138 . PMC 2350916. PMID 8616417 .
- 1 2 3 "Transformaciones de datos - Manual de estadística biológica" . www.biostathandbook.com . Consultado el 19 de marzo de 2019 .
- ↑ "Lección 9: Transformaciones de datos | STAT 501" . newonlinecourses.science.psu.edu . Archivado del original el 12 de marzo de 2019. Consultado el 17 de marzo de 2019 .
- 1 2 3 Kutner, Michael H.; Nachtsheim, Christopher J.; Neter, John; Li, William (2005). Modelos estadísticos lineales aplicados (5.ª ed.). Boston: McGraw-Hill Irwin. págs. 129-133 . ISBN 0072386886LCCN 2004052447 . OCLC 55502728 .
- ↑ Altman, Douglas G.; Bland, J. Martin (1996-03-23). "Notas de estadística: Transformación de datos" . BMJ . 312 ( 7033): 770. doi : 10.1136/bmj.312.7033.770 . ISSN 0959-8138 . PMC 2350481. PMID 8605469 .
- ↑ "9.3 - Transformación logarítmica tanto del predictor como de la respuesta | STAT 501" . newonlinecourses.science.psu.edu . Consultado el 17 de marzo de 2019 .
- ↑ Turner, Heather (2008). "Introducción a los modelos lineales generalizados" (PDF) .
- ↑ Lo, Steson; Andrews, Sally (2015-08-07). "Transformar o no transformar: uso de modelos lineales mixtos generalizados para analizar datos de tiempo de reacción" . Frontiers in Psychology . 6 : 1171. doi : 10.3389/fpsyg.2015.01171 . ISSN 1664-1078 . PMC 4528092. PMID 26300841 .
- ↑ "Transformaciones: una introducción" . fmwww.bc.edu . Consultado el 19 de marzo de 2019 .
- ↑ Van Droogenbroeck FJ, 'Una reformulación esencial de la ley de Zipf-Mandelbrot para resolver aplicaciones de atribución de autoría mediante estadística gaussiana' (2019)
- ↑ Kim, Hae-Young (2013-02-01). "Notas estadísticas para investigadores clínicos: evaluación de la distribución normal (2) mediante asimetría y curtosis" . Odontología Restauradora y Endodoncia . 38 (1): 52– 54. doi : 10.5395/rde.2013.38.1.52 . ISSN 2234-7658 . PMC 3591587. PMID 23495371 .
- ↑ "Prueba de normalidad incluyendo asimetría y curtosis" . imaging.mrc-cbu.cam.ac.uk . Consultado el 18 de marzo de 2019 .
- ↑ "Nueva perspectiva de la estadística: modelos no paramétricos: transformación de rangos" . www.sportsci.org . Consultado el 23 de marzo de 2019 .
- ↑ Warton, D.; Hui, F. (2011). "El arcoseno es absurdo: el análisis de proporciones en ecología". Ecology . 92 (1): 3– 10. doi : 10.1890/10-0340.1 . hdl : 1885/152287 . PMID 21560670 .
Enlaces externos
- Transformaciones logarítmicas para distribuciones asimétricas y amplias : se analizan las transformaciones logarítmicas y del "logaritmo con signo" (un capítulo de "Ciencia de datos práctica con R").
- Inferencia estadística
- Transformación de datos estadísticos