
En estadística descriptiva , un diagrama de caja o boxplot es un método para demostrar gráficamente la localidad, la dispersión y la asimetría de los grupos de datos numéricos a través de sus cuartiles . [ 1 ]

Además del recuadro en un diagrama de caja, pueden aparecer líneas (llamadas bigotes ) que se extienden desde el recuadro, indicando la variabilidad fuera de los cuartiles superior e inferior; por lo tanto, el diagrama también se conoce como diagrama de caja y bigotes . Los valores atípicos que difieren significativamente del resto del conjunto de datos [ 2 ] pueden representarse como puntos individuales más allá de los bigotes en el diagrama de caja. Los diagramas de caja son no paramétricos : muestran la variación en muestras de una población estadística sin asumir nada sobre la distribución estadística subyacente [ 3 ] (aunque el diagrama de caja de Tukey asume simetría para los bigotes y normalidad para su longitud).
Los espacios en cada subsección del diagrama de caja indican el grado de dispersión y asimetría de los datos, que generalmente se describen mediante el resumen de cinco números . Además, el diagrama de caja permite estimar visualmente varios estimadores L , en particular el rango intercuartil , el punto medio , el rango , el rango medio y el trimeano . Los diagramas de caja se pueden dibujar tanto horizontal como verticalmente.
Historia
El método de barras de rango fue introducido por primera vez por Mary Eleanor Spear en su libro "Charting Statistics" en 1952 [ 4 ] y nuevamente en su libro "Practical Charting Techniques" en 1969. [ 5 ] El diagrama de caja y bigotes fue introducido por primera vez en 1970 por John Tukey , quien posteriormente publicó sobre el tema en su libro "Exploratory Data Analysis" en 1977. [ 6 ]
Elementos


Un diagrama de caja es una forma estandarizada de mostrar el conjunto de datos basándose en un resumen de cinco números : el mínimo, el máximo, la mediana de la muestra y el primer y tercer cuartil.
- Mínimo ( Q 0 o percentil 0 ) : el punto de datos más bajo en el conjunto de datos, excluyendo cualquier valor atípico.
- Máximo ( Q 4 o percentil 100) : el punto de datos más alto en el conjunto de datos, excluyendo cualquier valor atípico.
- Mediana ( Q2 o percentil 50) : el valor central en el conjunto de datos .
- Primer cuartil ( Q1 o percentil 25) : también conocido como el cuartil inferior qn ( 0,25), es la mediana de la mitad inferior del conjunto de datos .
- Tercer cuartil ( Q 3 o percentil 75) : también conocido como cuartil superior q n (0,75), es la mediana de la mitad superior del conjunto de datos [ 7 ].
Además de los valores mínimo y máximo utilizados para construir un diagrama de caja, otro elemento importante que también se puede emplear para obtener un diagrama de caja es el rango intercuartil (RIC), como se indica a continuación:
- Rango intercuartil (RIC) : la distancia entre el cuartil superior y el inferior.
Caja
El recuadro se dibuja desde Q1 hasta Q3 con una línea horizontal en su interior para indicar la mediana. Algunos diagramas de caja incluyen un carácter adicional para representar la media de los datos. [ 8 ] [ 9 ]
Bigotes
Los bigotes deben terminar en un punto de datos observado, pero pueden definirse de diversas maneras. En el método más sencillo, el límite del bigote inferior corresponde al valor mínimo del conjunto de datos, y el límite del bigote superior, al valor máximo. Debido a esta variabilidad, es conveniente describir la convención utilizada para los bigotes y los valores atípicos en la leyenda del diagrama de caja.
Otra opción popular para los límites de los bigotes se basa en el valor de 1,5 veces el IQR. Desde arriba del cuartil superior ( Q3 ), se mide una distancia de 1,5 veces el IQR y se dibuja un bigote hasta el punto de datos observado más grande del conjunto de datos que se encuentra dentro de esta distancia. De manera similar, se mide una distancia de 1,5 veces el IQR por debajo del cuartil inferior ( Q1 ) y se dibuja un bigote hasta el punto de datos observado más pequeño del conjunto de datos que se encuentra dentro de esta distancia. Debido a que los bigotes deben terminar en un punto de datos observado, las longitudes de los bigotes pueden parecer desiguales, aunque 1,5 veces el IQR sea el mismo para ambos lados. Todos los demás puntos de datos observados fuera del límite de los bigotes se representan como valores atípicos . [ 10 ] Los valores atípicos se pueden representar en el diagrama de caja como un punto, un círculo pequeño, una estrella, etc. (ver ejemplo a continuación).
Hay otras representaciones en las que los bigotes pueden representar varias cosas diferentes, como por ejemplo:
- Una desviación estándar por encima y por debajo de la media del conjunto de datos.
- El percentil 9 y el percentil 91 del conjunto de datos
- El percentil 2 y el percentil 98 del conjunto de datos
En raras ocasiones, se puede trazar un diagrama de caja sin los bigotes. Esto puede ser apropiado para información sensible, a fin de evitar que los bigotes (y los valores atípicos) revelen los valores reales observados. [ 11 ]
Los percentiles inusuales 2%, 9%, 91%, 98% se utilizan a veces para las líneas cruzadas y los extremos de los bigotes para representar el resumen de siete números . Si los datos siguen una distribución normal , las siete marcas en el diagrama de caja estarán igualmente espaciadas. En algunos diagramas de caja, se coloca una línea cruzada antes del final de cada bigote.
Variaciones

Desde que el matemático John W. Tukey popularizó este tipo de representación visual de datos en 1969, se han desarrollado varias variaciones del diagrama de caja clásico, y las dos variaciones más comunes son los diagramas de caja de ancho variable y los diagramas de caja con muescas.
Los diagramas de caja de ancho variable ilustran el tamaño de cada grupo cuyos datos se representan, haciendo que el ancho de la caja sea proporcional al tamaño del grupo. Una convención común es hacer que el ancho de la caja sea proporcional a la raíz cuadrada del tamaño del grupo. [ 12 ]
Los diagramas de caja con muescas aplican una "muesca" o estrechamiento de la caja alrededor de la mediana. Las muescas son útiles para ofrecer una guía aproximada de la significancia de la diferencia de medianas; si las muescas de dos cajas no se superponen, esto proporcionará evidencia de una diferencia estadísticamente significativa entre las medianas. La altura de las muescas es proporcional al rango intercuartil (RIC) de la muestra e inversamente proporcional a la raíz cuadrada del tamaño de la muestra. Sin embargo, existe incertidumbre sobre el multiplicador más apropiado (ya que este puede variar dependiendo de la similitud de las varianzas de las muestras). [ 12 ] El ancho de la muesca se elige arbitrariamente para que sea visualmente agradable y debe ser consistente en todos los diagramas de caja que se muestran en la misma página.
Una convención para obtener los límites de estas muescas es utilizar una distancia dealrededor de la mediana. [ 13 ]
Los diagramas de caja ajustados tienen como objetivo describir distribuciones asimétricas y se basan en la estadística de asimetría de medcouple . [ 14 ] Para un valor de medcouple de MC, las longitudes de los bigotes superior e inferior en el diagrama de caja se definen respectivamente como:
Para una distribución de datos simétrica, el medcouple será cero, y esto reduce el diagrama de caja ajustado al diagrama de caja de Tukey con longitudes de bigotes iguales.para ambos bigotes.
Otros tipos de diagramas de caja , como los diagramas de violín y los diagramas de frijoles, pueden mostrar la diferencia entre distribuciones unimodales y multimodales , que no se puede observar en el diagrama de caja clásico original. [ 6 ]
Ejemplos
Ejemplo sin valores atípicos

Se midió una serie de temperaturas horarias a lo largo del día en grados Fahrenheit. Los valores registrados se enumeran en orden de la siguiente manera (°F): 57, 57, 57, 58, 63, 66, 66, 67, 67, 68, 69, 70, 70, 70, 70, 72, 73, 75, 75, 76, 76, 78, 79, 81.
Se puede generar un diagrama de caja del conjunto de datos calculando primero cinco valores relevantes de este conjunto de datos: mínimo, máximo, mediana ( Q2 ), primer cuartil (Q1 ) y tercer cuartil ( Q3 ).
El mínimo es el número más pequeño del conjunto de datos. En este caso, la temperatura mínima registrada durante el día es de 57°F.
El máximo es el número más grande del conjunto de datos. En este caso, la temperatura máxima registrada durante el día es de 81 °F.
La mediana es el valor central del conjunto de datos ordenado. Esto significa que exactamente el 50 % de los elementos son inferiores a la mediana y el 50 % son superiores. La mediana de este conjunto de datos ordenado es 70 °F.
El primer cuartil ( Q1 o percentil 25) es el valor que representa una cuarta parte del conjunto de datos ordenado. En otras palabras, el 25 % de los elementos son menores que el primer cuartil y el 75 % son mayores. El primer cuartil se puede determinar fácilmente hallando el valor central entre el mínimo y la mediana. Para las temperaturas horarias, el valor central entre 57 °F y 70 °F es 66 °F.
El valor del tercer cuartil ( Q3 o percentil 75) representa las tres cuartas partes del conjunto de datos ordenado. En otras palabras, el 75 % de los elementos son menores que el tercer cuartil y el 25 % son mayores. Este valor se obtiene fácilmente hallando el valor central entre la mediana y el máximo. En el caso de las temperaturas horarias, el valor central entre 70 °F y 81 °F es 75 °F.
El rango intercuartil, o RIC, se puede calcular restando el valor del primer cuartil ( Q1 ) del valor del tercer cuartil ( Q3 ) :
Por eso,
1,5 veces el rango intercuartílico por encima del tercer cuartil es:
1,5 veces el rango intercuartílico por debajo del primer cuartil es:
El límite superior del diagrama de caja corresponde al valor de datos más grande que se encuentra dentro de 1,5 veces el rango intercuartílico (RIC) por encima del tercer cuartil. En este caso, 1,5 veces el RIC por encima del tercer cuartil es 88,5 °F y el valor máximo es 81 °F. Por lo tanto, el límite superior se traza en el valor máximo, que es 81 °F.
De manera similar, el límite inferior del diagrama de caja corresponde al valor de datos más pequeño que se encuentra dentro de 1,5 rangos intercuartílicos (RIC) por debajo del primer cuartil. En este caso, 1,5 RIC por debajo del primer cuartil es 52,5 °F y el mínimo es 57 °F. Por lo tanto, el límite inferior se traza en el valor mínimo, que es 57 °F.
Ejemplo con valores atípicos

Arriba se muestra un ejemplo sin valores atípicos. A continuación, se presenta un ejemplo complementario para generar un diagrama de caja con valores atípicos:
El conjunto ordenado para las temperaturas registradas es (°F): 52, 57, 57, 58, 63, 66, 66, 67, 67, 68, 69, 70, 70, 70, 70, 72, 73, 75, 75, 76, 76, 78, 79, 89.
En este ejemplo, solo se modifican el primer y el último número. La mediana, el tercer cuartil y el primer cuartil permanecen iguales.
En este caso, el valor máximo en este conjunto de datos es 89 °F, y 1,5 veces el rango intercuartílico (RIC) por encima del tercer cuartil es 88,5 °F. El máximo es mayor que 1,5 veces el RIC más el tercer cuartil, por lo que se trata de un valor atípico. Por lo tanto, el bigote superior se traza en el mayor valor menor que 1,5 veces el RIC por encima del tercer cuartil, que es 79 °F.
De forma similar, el valor mínimo en este conjunto de datos es 52 °F, y 1,5 veces el rango intercuartílico (RIC) por debajo del primer cuartil es 52,5 °F. El mínimo es menor que 1,5 veces el RIC menos el primer cuartil, por lo que también se considera un valor atípico. Por lo tanto, el bigote inferior se traza en el valor más pequeño mayor que 1,5 veces el RIC por debajo del primer cuartil, que es 57 °F.
En el caso de grandes conjuntos de datos
Otro ejemplo para obtener un diagrama de caja a partir de un conjunto de datos que contiene un gran número de puntos de datos es:
Ecuación general para calcular cuantiles empíricos
- Aquírepresenta el orden general de los puntos de datos (es decir, si, entonces)
Utilizando el ejemplo anterior que tiene 24 puntos de datos ( n = 24), se puede calcular la mediana, el primer y el tercer cuartil ya sea matemáticamente o visualmente.
Mediana
Primer cuartil
tercer cuartil


Visualización
Aunque los diagramas de caja puedan parecer más primitivos que los histogramas o las estimaciones de densidad de kernel , presentan varias ventajas. En primer lugar, permiten a los estadísticos realizar un análisis gráfico rápido de uno o más conjuntos de datos. Además, ocupan menos espacio, por lo que resultan especialmente útiles para comparar distribuciones entre varios grupos o conjuntos de datos simultáneamente. Por último, la estructura general de los histogramas y las estimaciones de densidad de kernel puede verse fuertemente influenciada por la elección del número y la anchura de los intervalos, así como por la elección del ancho de banda, respectivamente.
Aunque es más común observar una distribución estadística que un diagrama de caja, puede ser útil comparar el diagrama de caja con la función de densidad de probabilidad (histograma teórico) para una distribución normal N(0, σ 2 ) y observar sus características directamente.
Véase también
Referencias
- ↑ C., Dutoit, SH (2012). Análisis gráfico exploratorio de datos . Springer. ISBN 978-1-4612-9371-2OCLC 1019645745
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Grubbs, Frank E. (febrero de 1969). "Procedimientos para detectar observaciones atípicas en muestras" . Technometrics . 11 (1): 1– 21. doi : 10.1080/00401706.1969.10490657 . ISSN 0040-1706 .
- ↑ Richard Boddy (2009). Métodos estadísticos en la práctica : para científicos y tecnólogos . John Wiley & Sons. ISBN 978-0-470-74664-6OCLC 940679163
- ↑ Spear, Mary Eleanor (2024). Charting Statistics . McGraw Hill. pág. 166.
- ↑ Spear, Mary Eleanor. (1969). Técnicas prácticas de elaboración de gráficos . Nueva York: McGraw-Hill. ISBN 0070600104OCLC 924909765
- 1 2 Wickham, Hadley; Stryjewski, Lisa. "40 años de diagramas de caja" (PDF) . Recuperado el 24 de diciembre de 2020 .
- ↑ Holmes, Alexander; Illowsky, Barbara; Dean, Susan (31 de marzo de 2015). "Introducción a la estadística empresarial" . OpenStax . Archivado del original el 27 de julio de 2020. Recuperado el 29 de abril de 2020 .
- ↑ Frigge, Michael; Hoaglin, David C.; Iglewicz, Boris (febrero de 1989). "Algunas implementaciones del diagrama de caja". The American Statistician . 43 (1): 50– 54. doi : 10.2307/2685173 . JSTOR 2685173 .
- ↑ Marmolejo-Ramos, F.; Tian, S. (2010). "El diagrama de caja desplazable. Un diagrama de caja basado en estadísticas descriptivas esenciales alrededor de la media" . Revista Internacional de Investigación Psicológica . 3 (1): 37– 46. doi : 10.21500/20112084.823 . hdl : 10819/6492 .
- ↑ Dekking, FM (2005). Una introducción moderna a la probabilidad y la estadística . Springer. págs. 234-238 . ISBN 1-85233-896-2.
- ↑ Derrick, Ben; Green, Elizabeth; Ritchie, Felix; White, Paul (septiembre de 2022). «El riesgo de divulgación al informar estadísticas univariadas de uso común». Privacidad en bases de datos estadísticas . Notas de clase en informática. Vol. 13463. págs. 119–129 . doi : 10.1007/978-3-031-13945-1_9 . ISBN 978-3-031-13944-4.
- 1 2 McGill, Robert; Tukey, John W. ; Larsen, Wayne A. (febrero de 1978). "Variaciones de diagramas de caja". The American Statistician . 32 (1): 12– 16. doi : 10.2307/2683468 . JSTOR 2683468 .
- ↑ "R: Estadísticas de diagramas de caja" . Manual de R. Consultado el 26 de junio de 2011 .
- ↑ Hubert, M. ; Vandervieren, E. (2008). "Un diagrama de caja ajustado para distribuciones asimétricas". Computational Statistics and Data Analysis . 52 (12): 5186– 5201. CiteSeerX 10.1.1.90.9812 . doi : 10.1016/j.csda.2007.11.008 .
Lecturas adicionales
- Tukey, John W. (1977). Análisis exploratorio de datos . Addison-Wesley . ISBN 9780201076165.
- Benjamini, Y. (1988). "Abriendo la caja de un diagrama de caja". The American Statistician . 42 (4): 257– 262. doi : 10.2307/2685133 . JSTOR 2685133 .
- Rousseeuw, PJ ; Ruts, I.; Tukey, JW (1999). "The Bagplot: A Bivariate Boxplot". The American Statistician . 53 (4): 382– 387. doi : 10.2307/2686061 . JSTOR 2686061 .
Enlaces externos
- Diagrama de caja de enjambre de abejas : superposición de un gráfico de tiras con fluctuación de frecuencia sobre un diagrama de caja.
- Gráficos y diagramas estadísticos
- Valores atípicos estadísticos