Articulo de referencia

Univariado (estadística)

Univariado es un término comúnmente utilizado en estadística para describir un tipo de datos que consiste en observaciones de una sola característica o atributo. Un ejemplo senc...

Univariado es un término comúnmente utilizado en estadística para describir un tipo de datos que consiste en observaciones de una sola característica o atributo. Un ejemplo sencillo de datos univariados serían los salarios de los trabajadores en la industria. [ 1 ] Al igual que otros datos, los datos univariados se pueden visualizar mediante gráficos, imágenes u otras herramientas de análisis después de que se hayan observado/recopilado, analizado e informado con las conclusiones del análisis . [ 2 ]

Tipos de datos

Los datos univariados pueden consistir en observaciones no numéricas (como el color de los ojos, por ejemplo, marrón o azul) o en números (como una altura de 1,65 m o una masa de 70 kg). Generalmente, se utilizan los términos datos univariados categóricos y datos univariados numéricos para distinguirlos.

Datos univariados categóricos

Los datos univariados categóricos consisten en observaciones no numéricas que pueden clasificarse en categorías. Incluyen etiquetas o nombres que se utilizan para identificar un atributo de cada elemento. Los datos univariados categóricos suelen utilizar una escala de medición nominal u ordinal . [ 3 ]

Datos numéricos univariados

Los datos numéricos univariados consisten en observaciones que son números. Se obtienen utilizando una escala de medición de intervalo o de razón . Este tipo de datos univariados se puede clasificar aún más en dos subcategorías: discretos y continuos . [ 2 ] Los datos numéricos univariados son discretos si el conjunto de todos los valores posibles es finito o infinito numerable . Los datos univariados discretos se asocian generalmente con el conteo (como el número de libros leídos por una persona). Los datos numéricos univariados son continuos si el conjunto de todos los valores posibles es un intervalo de números. Los datos univariados continuos se asocian típicamente con la medición (como el peso de las personas).

Análisis de datos y aplicaciones

El análisis univariado es la forma más simple de analizar datos. Uni significa "uno", por lo que los datos tienen solo una variable ( univariado ). [ 4 ] Los datos univariados requieren analizar cada variable por separado. Los datos se recopilan con el propósito de responder una pregunta, o más específicamente, una pregunta de investigación. Los datos univariados no responden preguntas de investigación sobre relaciones entre variables. En cambio, se utilizan para describir una característica o atributo que varía de una observación a otra. [ 5 ] Por lo general, hay dos propósitos que un investigador puede buscar. El primero es responder una pregunta de investigación con un estudio descriptivo y el segundo es obtener conocimiento sobre cómo varía un atributo con el efecto individual de una variable en un análisis de regresión . Hay algunas maneras de describir los patrones encontrados en los datos univariados, que incluyen métodos gráficos, medidas de tendencia central y medidas de variabilidad. [ 6 ]

Al igual que otras formas de estadística, puede ser inferencial o descriptiva . Lo fundamental es que solo interviene una variable.

El análisis univariado puede arrojar resultados engañosos en casos en los que el análisis multivariado es más apropiado.

Medidas de tendencia central

La tendencia central es una de las medidas descriptivas numéricas más comunes. Se utiliza para estimar la ubicación central de los datos univariados mediante el cálculo de la media , la mediana y la moda . [ 7 ] Cada uno de estos cálculos tiene sus propias ventajas y limitaciones. La media tiene la ventaja de que su cálculo incluye cada valor del conjunto de datos, pero es particularmente susceptible a la influencia de los valores atípicos . La mediana es una mejor medida cuando el conjunto de datos contiene valores atípicos. La moda es sencilla de localizar.

No es necesario limitarse a utilizar una sola de estas medidas de tendencia central. Si los datos analizados son categóricos, la única medida de tendencia central que se puede utilizar es la moda. Sin embargo, si los datos son numéricos ( ordinales o de intervalo / razón ), se pueden utilizar la moda, la mediana o la media para describirlos. El uso de más de una de estas medidas proporciona un resumen descriptivo más preciso de la tendencia central para el análisis univariado. [ 8 ]

Medidas de variabilidad

Una medida de variabilidad o dispersión (desviación de la media) de un conjunto de datos univariados puede revelar la forma de una distribución de datos univariados de manera más suficiente. Proporcionará información sobre la variación entre los valores de los datos. Las medidas de variabilidad junto con las medidas de tendencia central ofrecen una mejor comprensión de los datos que las medidas de tendencia central por sí solas. [ 9 ] Las tres medidas de variabilidad más utilizadas son el rango , la varianza y la desviación estándar . [ 10 ] La idoneidad de cada medida dependerá del tipo de datos, la forma de la distribución de los datos y la medida de tendencia central que se utilice. Si los datos son categóricos, no hay ninguna medida de variabilidad que reportar. Para datos numéricos, las tres medidas son posibles. Si la distribución de los datos es simétrica, las medidas de variabilidad suelen ser la varianza y la desviación estándar. Sin embargo, si los datos son asimétricos , la medida de variabilidad apropiada para ese conjunto de datos es el rango. [ 3 ]

Métodos descriptivos

Las estadísticas descriptivas describen una muestra o población. Pueden formar parte del análisis exploratorio de datos . [ 11 ]

La estadística apropiada depende del nivel de medición . Para variables nominales, una tabla de frecuencias y una lista de la (s) moda(s) son suficientes. Para variables ordinales ( datos ordinales ), se puede calcular la mediana como medida de tendencia central y el rango (y sus variaciones) como medida de dispersión. Para variables de nivel de intervalo, se añaden la media aritmética (promedio) y la desviación estándar al conjunto de herramientas y, para variables de nivel de razón, se añaden la media geométrica y la media armónica como medidas de tendencia central, y el coeficiente de variación como medida de dispersión.

Para datos de nivel de intervalo y de razón, otros descriptores incluyen la asimetría y la curtosis de la variable .

Métodos inferenciales

Los métodos inferenciales nos permiten inferir de una muestra a una población. [ 11 ] Para una variable nominal, una prueba chi-cuadrado unidireccional (bondad de ajuste) puede ayudar a determinar si nuestra muestra coincide con la de alguna población. [ 12 ] Para datos de nivel de intervalo y razón, una prueba t de una muestra puede permitirnos inferir si la media en nuestra muestra coincide con algún número propuesto (típicamente 0). Otras pruebas de ubicación disponibles incluyen la prueba de signos de una muestra y la prueba de rangos con signo de Wilcoxon .

Métodos gráficos

Un gráfico de barras
Un histograma
Un gráfico circular

Las ilustraciones gráficas más utilizadas para datos univariados incluyen:

Tablas de distribución de frecuencia

La frecuencia indica cuántas veces aparece un número. En estadística, la frecuencia de una observación indica la cantidad de veces que aparece en los datos. Por ejemplo, en la siguiente lista de números { 1, 2, 3, 4, 6, 9, 9, 8, 5, 1, 1, 9, 9, 0, 6, 9 }, la frecuencia del número 9 es 5 (porque aparece 5 veces en este conjunto de datos).

gráficos de barras

Un gráfico de barras es una representación gráfica compuesta por barras rectangulares . Estas barras representan el número o el porcentaje de observaciones de las categorías existentes en una variable. La longitud o altura de las barras proporciona una representación visual de las diferencias proporcionales entre las categorías.

Histogramas

Los histogramas se utilizan para estimar la distribución de los datos, asignando la frecuencia de los valores a un rango de valores llamado bin . [ 13 ]

Gráficos circulares

Un gráfico circular es un círculo dividido en porciones que representan las frecuencias relativas o los porcentajes de una población o una muestra pertenecientes a diferentes categorías.

Distribuciones

La distribución univariada es un tipo de dispersión para una sola variable aleatoria descrita con una función de masa de probabilidad (pmf) para distribuciones de probabilidad discretas , o con una función de densidad de probabilidad (pdf) para distribuciones de probabilidad continuas . [ 14 ] No debe confundirse con la distribución multivariada .

Distribuciones discretas comunes

Distribuciones continuas comunes

Véase también

Referencias

  1. Kachigan, Sam Kash (1986). Análisis estadístico: una introducción interdisciplinaria a los métodos univariados y multivariados . Nueva York: Radius Press. ISBN 0-942154-99-1.
  2. 1 2 Lacke, Prem S. Mann; con la colaboración de Christopher Jay (2010). Estadística introductoria (7.ª ed.). Hoboken, NJ: John Wiley & Sons. ISBN  978-0-470-44466-5.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  3. 1 2 Anderson, David R.; Sweeney, Dennis J.; Williams, Thomas A. Estadística para negocios y economía (Décima ed.). Cengage Learning. pág. 1018. ISBN   978-0-324-80926-8.
  4. "Análisis univariado" . stathow .
  5. "Datos univariados" . study.com .
  6. Trochim, William. "Estadística descriptiva" . Centro web de métodos de investigación social . Consultado el 15 de febrero de 2017 .
  7. O'Rourke, Norm; Hatcher, Larry; Stepanski, Edward J. (2005). Un enfoque paso a paso para usar SAS en estadística univariada y multivariada (2.ª ed.). Nueva York: Wiley-Interscience. ISBN  1-59047-417-1.
  8. Longnecker, R. Lyman Ott, Michael (2009). Introducción a los métodos estadísticos y al análisis de datos (6.ª ed., edición internacional). Pacific Grove, California: Brooks/Cole. ISBN  978-0-495-10914-3.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  9. Meloun, Milan; Militky, Jirí (2011). Análisis de datos estadísticos: una guía práctica . Nueva Delhi: Woodhead Pub Ltd. ISBN 978-0-85709-109-3.
  10. ^ Purves, David Freedman; Roberto Pisani; Roger (2007). Estadísticas (4. ed.). Nueva York [ua]: Norton. ISBN  978-0-393-92972-0.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  11. 1 2 Everitt, Brian (1998). The Cambridge Dictionary of Statistics . Cambridge, Reino Unido Nueva York: Cambridge University Press. ISBN 0521593468.
  12. "Chi-cuadrado unidireccional" .
  13. ^ Díez, David M.; Barr, Christopher D.; Çetinkaya-Rundel, Mía (2015). Estadísticas de OpenIntro (3ª ed.). OpenIntro, Inc. pág. 30.ISBN   978-1-9434-5003-9.
  14. Samaniego, Francisco J. (2014). Modelado estocástico y estadística matemática : un texto para estadísticos y científicos cuantitativos . Boca Raton: CRC Press. pág. 167. ISBN   978-1-4665-6046-8.