En estadística , la frecuencia o frecuencia absoluta de un eventoes el númerode veces que la observación ha ocurrido o ha sido registrada en un experimento o estudio. [ 1 ] : 12–19 La frecuencia relativa es la razón de la frecuencia absoluta por el tamaño de la muestra . La frecuencia acumulada es la suma de las frecuencias absolutas de todos los eventos en o por debajo de un punto determinado en una lista ordenada de eventos. [ 1 ] : 17–19 Estas frecuencias a menudo se representan gráficamente o en forma tabular. Pueden usarse como estimadores de probabilidades empíricas o funciones de distribución acumulada , por ejemplo.
Formulación
La frecuencia relativa de un evento es la frecuencia absoluta normalizada por el número total de eventos:
Los valores depara todos los eventosSe puede graficar para producir una distribución de frecuencia.
En el caso de quepor ciertoSe pueden añadir pseudoconteos .
Visualización
Una distribución de frecuencias muestra una agrupación resumida de datos divididos en clases mutuamente excluyentes y el número de ocurrencias en cada clase. Es una forma de mostrar datos no organizados, por ejemplo, los resultados de una elección, los ingresos de la población en una región determinada, las ventas de un producto durante un período específico, los montos de los préstamos estudiantiles de los graduados, etc. Algunos de los gráficos que se pueden usar con distribuciones de frecuencias son los histogramas , los gráficos de líneas , los gráficos de barras y los gráficos circulares . Las distribuciones de frecuencias se utilizan tanto para datos cualitativos como cuantitativos.
Construcción
- Decida el número de clases. Un número excesivo o insuficiente de clases podría impedir la comprensión de la estructura básica del conjunto de datos, además de dificultar la interpretación de dicha distribución de frecuencias. El número ideal de clases puede determinarse o estimarse mediante la siguiente fórmula:(logaritmo en base 10), o mediante la fórmula de elección de raíz cuadrada.donde n es el número total de observaciones en los datos. (Este último valor será demasiado grande para conjuntos de datos extensos, como las estadísticas de población). Sin embargo, estas fórmulas no son una regla estricta y el número de clases resultante, determinado por la fórmula, puede no ser siempre el adecuado para los datos que se estén analizando.
- Calcula el rango de los datos (Rango = Máximo – Mínimo) hallando los valores mínimo y máximo. El rango se utilizará para determinar el intervalo de clase o la amplitud de la clase.
- Decida el ancho de las clases, denotado por h y obtenido por(suponiendo que los intervalos de clase son los mismos para todas las clases).
Generalmente, el intervalo de clase o amplitud de clase es el mismo para todas las clases. Todas las clases, consideradas en conjunto, deben cubrir al menos la distancia desde el valor más bajo (mínimo) de los datos hasta el valor más alto (máximo). En la distribución de frecuencias, se prefieren los intervalos de clase iguales, mientras que en ciertas situaciones pueden ser necesarios intervalos de clase desiguales (por ejemplo, intervalos logarítmicos) para lograr una buena dispersión de las observaciones entre las clases y evitar un gran número de clases vacías o casi vacías. [ 2 ]
- Defina los límites de cada clase y seleccione un punto de partida adecuado para la primera clase, que puede ser menor o igual al valor mínimo. Generalmente, se comienza antes del valor mínimo, de manera que el punto medio (el promedio de los límites inferior y superior de la primera clase) quede correctamente ubicado.
- Toma una observación y marca con una barra vertical (|) la clase a la que pertenece. Se mantiene un recuento hasta la última observación.
- Calcula las frecuencias, la frecuencia relativa, la frecuencia acumulada, etc., según sea necesario.
Los siguientes son algunos métodos comúnmente utilizados para representar la frecuencia: [ 3 ]
Histogramas
Un histograma es una representación de frecuencias tabuladas, mostradas como rectángulos o cuadrados adyacentes (en algunos casos), erigidos sobre intervalos discretos (barras), con un área proporcional a la frecuencia de las observaciones en el intervalo. La altura de un rectángulo también es igual a la densidad de frecuencia del intervalo, es decir, la frecuencia dividida por el ancho del intervalo. El área total del histograma es igual al número de datos. Un histograma también puede normalizarse mostrando frecuencias relativas. En ese caso, muestra la proporción de casos que caen en cada una de varias categorías , con un área total igual a 1. Las categorías se especifican generalmente como intervalos consecutivos y no superpuestos de una variable. Las categorías (intervalos) deben ser adyacentes y, a menudo, se eligen del mismo tamaño. [ 4 ] Los rectángulos de un histograma se dibujan de manera que se toquen entre sí para indicar que la variable original es continua. [ 5 ]
Gráficos de barras
Un gráfico de barras es una representación gráfica con barras rectangulares cuyas longitudes son proporcionales a los valores que representan. Las barras pueden trazarse vertical u horizontalmente. Un gráfico de barras vertical a veces se denomina gráfico de barras columna.
Tabla de distribución de frecuencias
Una tabla de distribución de frecuencias es una representación gráfica de los valores que una o más variables pueden tomar en una muestra . Cada entrada de la tabla contiene la frecuencia o el número de veces que aparecen los valores dentro de un grupo o intervalo determinado, y de esta manera, la tabla resume la distribución de los valores en la muestra.
Este es un ejemplo de una tabla de frecuencias univariada (=de una sola variable ). Se muestra la frecuencia de cada respuesta a una pregunta de la encuesta.
Otro esquema de tabulación agrupa los valores en intervalos, de modo que cada intervalo abarca un rango de valores. Por ejemplo, las alturas de los estudiantes de una clase podrían organizarse en la siguiente tabla de frecuencias.
Distribuciones de frecuencia conjuntas
Las distribuciones de frecuencia conjuntas bivariadas se suelen presentar como tablas de contingencia (de dos vías) :
La fila y la columna totales informan las frecuencias marginales o la distribución marginal , mientras que el cuerpo de la tabla informa las frecuencias conjuntas. [ 6 ]
Interpretación
Bajo la interpretación de la probabilidad en términos de frecuencia , se supone que la fuente es ergódica , es decir, a medida que la longitud de una serie de ensayos aumenta sin límite, la fracción de experimentos en los que ocurre un evento dado se aproximará a un valor fijo, conocido como frecuencia relativa límite . [ 7 ] [ 8 ]
Esta interpretación suele contrastarse con la probabilidad bayesiana .
El término frecuentista fue utilizado por primera vez por MG Kendall en 1949, para contrastarlo con los bayesianos , a quienes llamó "no frecuentistas". [ 9 ] [ 10 ] Él observó
- 3. Podemos distinguir, a grandes rasgos, dos actitudes principales. Una considera la probabilidad como «un grado de creencia racional», o alguna idea similar; la segunda define la probabilidad en términos de frecuencias de ocurrencia de eventos, o mediante proporciones relativas en «poblaciones» o «colectivos»; (p. 101)
- ...
- 12. Podría pensarse que las diferencias entre los frecuentistas y los no frecuentistas (si se me permite llamarlos así) se deben en gran medida a las diferencias en los ámbitos que pretenden abarcar. (p. 104)
- ...
- Sostengo que esto no es así ... La distinción esencial entre los frecuentistas y los no frecuentistas es, a mi parecer, que los primeros, en un esfuerzo por evitar cualquier atisbo de opinión, buscan definir la probabilidad en términos de las propiedades objetivas de una población, real o hipotética, mientras que los segundos no. [énfasis en el original]
Aplicaciones
Gestionar y operar con datos tabulados de frecuencia es mucho más sencillo que operar con datos sin procesar. Existen algoritmos simples para calcular la mediana, la media, la desviación estándar, etc., a partir de estas tablas.
La prueba de hipótesis estadística se basa en la evaluación de las diferencias y similitudes entre distribuciones de frecuencia. Esta evaluación implica medidas de tendencia central o promedios , como la media y la mediana , y medidas de variabilidad o dispersión estadística , como la desviación estándar o la varianza .
Se dice que una distribución de frecuencias está sesgada cuando su media y su mediana difieren significativamente, o, de forma más general, cuando es asimétrica . La curtosis de una distribución de frecuencias es una medida de la proporción de valores extremos (valores atípicos), que aparecen en los extremos del histograma . Si la distribución es más propensa a los valores atípicos que la distribución normal, se dice que es leptocúrtica; si es menos propensa a ellos, se dice que es platicúrtica.
Las distribuciones de frecuencia de letras también se utilizan en el análisis de frecuencia para descifrar códigos , y se utilizan para comparar las frecuencias relativas de las letras en diferentes idiomas y otros idiomas que se utilizan a menudo, como el griego, el latín, etc.
Véase también
- Frecuencia aperiódica
- datos de recuento
- tabulación cruzada
- Función de distribución acumulativa
- Análisis de frecuencia acumulada
- Función de distribución empírica
- Ley de los grandes números
- Multiplicidad de multiconjuntos , análoga a la frecuencia en la teoría de multiconjuntos.
- Función de densidad de probabilidad
- Interpretaciones de probabilidad
- Regularidad estadística
- Frecuencia de palabras
Referencias
- 1 2 Kenney, JF; Keeping, ES (1962). Matemáticas de la estadística, parte 1 (3.ª ed.). Princeton, NJ: Van Nostrand Reinhold .
- ↑ Manikandan, S (1 de enero de 2011). " Distribución de frecuencia" . Journal of Pharmacology & Pharmacotherapeutics . 2 (1): 54– 55. doi : 10.4103/0976-500X.77120 . ISSN 0976-500X . PMC 3117575. PMID 21701652 .
- ↑ Carlson, K. y Winquist, J. (2014) Introducción a la estadística . SAGE Publications, Inc. Capítulo 1: Introducción a la estadística y distribuciones de frecuencia.
- ↑ Howitt, D. y Cramer, D. (2008) Estadística en psicología . Prentice Hall
- ↑ Charles Stangor (2011) "Métodos de investigación para las ciencias del comportamiento". Wadsworth, Cengage Learning. ISBN 9780840031976.
- ↑ Stat Trek, Glosario de Estadística y Probabilidad, sv Frecuencia Conjunta
- ↑ von Mises, Richard (1939) Probabilidad, estadística y verdad (en alemán) (traducción al inglés, 1981: Dover Publications; 2.ª edición revisada. ISBN 0486242145) (pág. 14)
- ↑ La teoría de la frecuencia, capítulo 5; en Donald Gilles, Teorías filosóficas de la probabilidad (2000), Psychology Press. ISBN 9780415182751, pág. 88.
- ↑ Primeros usos conocidos de algunos términos de probabilidad y estadística
- ↑ Kendall, Maurice George (1949). "Sobre la reconciliación de las teorías de la probabilidad". Biometrika . 36 (1/2). Biometrika Trust: 101–116 . doi : 10.1093/biomet/36.1-2.101 . JSTOR 2332534 .
- Distribución de frecuencia