La Visualización Compacta de Letras ( CLD , por sus siglas en inglés) es un método estadístico para clarificar los resultados de pruebas de hipótesis múltiples al utilizar el análisis de varianza ( ANOVA) y la prueba de rangos de Tukey . CLD también se puede aplicar después de la nueva prueba de rangos múltiples de Duncan (similar a la prueba de rangos de Tukey). CLD facilita la identificación de variables o factores que presentan medias (o promedios) estadísticamente diferentes frente a aquellos que no las presentan.
La técnica básica de visualización compacta de letras consiste en etiquetar las variables con una o más letras, de modo que sean estadísticamente indistinguibles si y solo si comparten al menos una letra. El problema de lograrlo, utilizando la menor cantidad posible de letras distintas, puede representarse combinatoriamente como el problema de calcular una cobertura de clique de aristas de un grafo que representa pares de variables indistinguibles. [ 1 ]
Además de marcar la distinción de esta manera, CLD también clasifica las variables o factores según su media (o promedio) respectiva en orden descendente. La metodología CLD se puede aplicar a datos tabulares ( hoja de cálculo , marco de datos ) o datos visuales ( diagrama de caja y gráfico de barras ).
Conceptos básicos de CLD
CLD identifica las variables que son estadísticamente diferentes frente a las que no lo son.
Cada variable que comparte una media que no es estadísticamente diferente de otra compartirá la misma letra. [ 2 ] [ 3 ] [ 4 ] Por ejemplo:
“a” “ab” “b”
Lo anterior indica que la primera variable “a” tiene una media (o promedio) estadísticamente diferente de la tercera variable “b”. Sin embargo, la segunda variable “ab” tiene una media que no es estadísticamente diferente ni de la primera ni de la tercera variable. Veamos otro ejemplo:
“a” “ab” “bc” “c”
Lo anterior indica que la primera variable “a” tiene una media (o promedio) estadísticamente diferente de la tercera variable “bc” y de la cuarta “c”. Sin embargo, esta primera variable “a” no es estadísticamente diferente de la segunda “ab”.
Dada la estructura del alfabeto romano, la metodología CLD permite comparar fácilmente hasta 26 variables o factores diferentes. Esta limitación suele ser mucho mayor que la de la gran mayoría de las pruebas de hipótesis múltiples realizadas mediante ANOVA y las pruebas de rango de Tukey.
CLD clasifica las variables en orden descendente según su media (o promedio).
Así, la variable con la media (o promedio) más alta se denominará "a" (si es estadísticamente diferente de todas las demás; de lo contrario, se denominará "ab", etc.). Y la variable con la media (o promedio) más baja tendrá la letra más alta entre las variables analizadas. [ 2 ] [ 3 ] [ 4 ]
Un ejemplo de CLD
Vamos a comprobar si la precipitación media en cinco ciudades de la costa oeste es estadísticamente diferente. Estas ciudades son:
- Eugene (Oregón)
- Portland (Oregón)
- San Francisco (California)
- Seattle (Washington)
- Spokane (WA)
Los datos corresponden a la precipitación anual en pulgadas (1951-2021).
La fuente de datos es la NOAA .
En primer lugar, mejoraremos los datos tabulares utilizando CLD.
A continuación, mejoraremos los datos visuales utilizando CLD.
Mejorar los datos tabulares con CLD
Aquí están los datos de precipitación de cinco ciudades de la costa oeste antes de aplicar la metodología CLD.

Como se muestra arriba, los datos de precipitación de las cinco ciudades de la costa oeste están ordenados alfabéticamente. Este orden no es informativo, ya que dificulta determinar qué promedios o medias de precipitación difieren entre sí.
A continuación, reproducimos la misma tabla, pero ordenamos las ciudades utilizando la metodología CLD después de haber realizado una prueba de rango de Tukey.

La tabla anterior, que utiliza la metodología CLD, es mucho más informativa. Ha clasificado las ciudades según su precipitación media en orden descendente. Además, ha agrupado las ciudades con precipitaciones medias similares (sin diferencias estadísticamente significativas, utilizando un valor alfa de 0,05).
Como se muestra, Seattle y Portland tienen niveles promedio de precipitación que no difieren estadísticamente entre sí. Ambas se clasifican como "b". Asimismo, San Francisco y Spokane tienen niveles promedio de precipitación que no difieren estadísticamente entre sí. Ambas se clasifican como "c". Sin embargo, el nivel promedio de precipitación de Eugene es estadísticamente diferente y superior al de Seattle y Portland, así como al de San Francisco y Spokane. Además, Seattle y Portland tienen niveles promedio de precipitación que son estadísticamente diferentes y superiores a los de San Francisco y Spokane.
Mejorar los datos visuales con CLD
Aquí tenemos un primer diagrama de caja con las ciudades ordenadas alfabéticamente de izquierda a derecha.

El diagrama de caja anterior no es del todo claro. Es difícil distinguir entre las ciudades que son algo similares (la media no es estadísticamente diferente) y las que son disímiles (la media sí es estadísticamente diferente). Ahora, veamos el mismo diagrama de caja utilizando la metodología CLD.

El diagrama de caja anterior, utilizando la metodología CLD, ahora es mucho más informativo. Las ciudades están ordenadas de forma descendente de izquierda a derecha. La densidad del color está escalonada, de modo que las ciudades con mayor precipitación se colorean con tonos más densos u opacos; mientras que las ciudades con menor precipitación tienen tonos menos densos o más transparentes. Además, podemos identificar fácilmente las ciudades que tienen promedios de precipitación similares (sin diferencias estadísticamente significativas), como Seattle y Portland, que se identifican con la letra "b". Asimismo, San Francisco y Spokane también tienen promedios de precipitación similares, ya que ambas se identifican con la letra "c". Por otro lado, Eugene tiene el nivel promedio de precipitación más alto de todas; y es estadísticamente diferente (más alto) que todas las demás ciudades, ya que es la única ciudad identificada con la letra "a".
Los beneficios de CLD
En ausencia de la metodología CLD, el método principal para identificar diferencias estadísticas en las medias entre variables pareadas es la prueba de rango de Tukey. Esta última es una prueba muy informativa dirigida a estadísticos. Fuera de este público especializado, el resultado de la prueba, como se muestra a continuación, resulta bastante difícil de interpretar.

La prueba de rango de Tukey reveló que San Francisco y Spokane no presentaban diferencias estadísticamente significativas en la media de precipitaciones (con un nivel de significancia alfa = 0,05), con un valor p de 0,08. Seattle y Portland tampoco presentaban diferencias estadísticamente significativas en la media de precipitaciones, con una diferencia asociada a un valor p de 0,54.
Como se demostró anteriormente, es mucho más fácil transmitir la diferencia entre las precipitaciones medias de las ciudades utilizando la metodología CLD. Además, la información mejorada con CLD puede ser interpretada fácilmente por un público mucho más amplio que si se comunicaran los resultados sin utilizar la metodología CLD, incluyendo la comunicación directa del resultado de la prueba de rango de Tukey.
Cómo construir un diagrama de caja en R con Compact Letter Display
Referencias
- ↑ Gramm, Jens; Guo, Jiong; Hüffner, Falk; Niedermeier, Rolf; Piepho, Hans-Peter; Schmid, Ramona (2008). "Algoritmos para la visualización compacta de letras: comparación y evaluación". Computational Statistics & Data Analysis . 52 (2): 725– 736. doi : 10.1016/j.csda.2006.09.035 . MR 2418523 .
- 1 2 "Visualización de letras compactas (CLD)" . schmidtpaul.github.io . Consultado el 4 de septiembre de 2022 .
- 1 2 Piepho, Hans-Peter (2004-06-01). "Un algoritmo para una representación basada en letras de todas las comparaciones por pares" . Journal of Computational and Graphical Statistics . 13 (2): 456– 466. doi : 10.1198/1061860043515 . ISSN 1061-8600 . S2CID 122068627 .
- 1 2 Piepho, Hans-Peter (marzo de 2018). "Letras en comparaciones medias: qué significan y qué no significan" . Researchgate.com . Recuperado el 3 de septiembre de 2022 .
- ↑ "Pantallas de letras compactas" . Blog de John Quensen . 15 de enero de 2020. Consultado el 4 de septiembre de 2022 .
- ↑ "cld: Configura una visualización compacta de letras de todas las comparaciones por pares en multcomp: Inferencia simultánea en modelos paramétricos generales" . rdrr.io. Consultado el 4 de septiembre de 2022 .
- ↑ "dsfair_quarto - Visualización compacta de letras (CLD)" . schmidtpaul.github.io . 17 de junio de 2023. Consultado el 11 de septiembre de 2024 .
Lecturas adicionales
- Gramm, Jens; Guo, Jiong; Hüffner, Falk; Niedermeier, Rolf; Piepho, Hans-Peter; Schmid, Ramona (15 de octubre de 2007). "Algoritmos para la visualización compacta de letras: comparación y evaluación" . Computational Statistics & Data Analysis . 52 (2): 725–736 . doi : 10.1016/j.csda.2006.09.035 . ISSN 0167-9473 .
- Greenwood, Mark; Banner, Katharine. "Comparaciones múltiples (por pares) usando el HSD de Tukey y la visualización compacta de letras - Mark Greenwood y Katharine Banner" . Biblioteca de la Universidad Estatal de Montana (MSU) . Consultado el 5 de septiembre de 2022 .
- Pruebas de hipótesis estadísticas
- Visualización de datos e información