Articulo de referencia

Docena de Datasaurus

La docena de Datasaurus comprende trece conjuntos de datos que tienen estadísticas descriptivas simples casi idénticas hasta dos decimales, pero tienen distribuciones muy difere...

La docena de Datasaurus comprende trece conjuntos de datos que tienen estadísticas descriptivas simples casi idénticas hasta dos decimales, pero tienen distribuciones muy diferentes y se ven muy diferentes cuando se grafican . [ 1 ] Se inspiró en el cuarteto más pequeño de Anscombe que se creó en 1973.

Datos

La siguiente tabla contiene estadísticas descriptivas para los trece conjuntos de datos.

trece gráficos de los conjuntos de datos en Datasaurus Dozen, visualizados gráficamente y también resumidos numéricamente para mostrar que sus resúmenes estadísticos son similares, mientras que sus representaciones gráficas no lo son.
Los trece conjuntos de datos de Datasaurus Dozen, visualizados y resumidos.

Los trece conjuntos de datos fueron etiquetados de la siguiente manera:

  • lejos
  • diana
  • círculo
  • dinosaurio
  • puntos
  • líneas h
  • líneas altas
  • inclinación hacia abajo
  • inclinación hacia arriba
  • estrella
  • línea_v
  • líneas anchas
  • forma x

De forma similar al cuarteto de Anscombe , la docena de Datasaurus se diseñó para ilustrar aún más la importancia de observar un conjunto de datos gráficamente antes de comenzar a analizarlos según un tipo particular de relación, y la insuficiencia de las propiedades estadísticas básicas para describir conjuntos de datos realistas. [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 1 ] [ 6 ]

Creación

El conjunto de datos de dinosaurios creado por Alberto Cairo que inspiró la creación de Datasaurus Dozen.

El primer conjunto de datos, con la forma de un Tyrannosaurus , que inspiró el resto del conjunto de datos "datasaurus", fue construido en 2016 por Alberto Cairo . [ 7 ] [ 8 ] Maarten Lambrechts propuso que este conjunto de datos también se llamara "Anscombosaurus". [ 7 ]

Este conjunto de datos fue acompañado por otros doce conjuntos de datos creados por Justin Matejka y George Fitzmaurice en Autodesk . A diferencia del cuarteto de Anscombe, donde se desconoce cómo se generó el conjunto de datos, [ 9 ] los autores utilizaron recocido simulado para crear estos conjuntos de datos. Realizaron cambios pequeños, aleatorios y sesgados en cada punto para lograr la forma deseada. Cada forma requirió 200 000 iteraciones de perturbaciones para completarse. [ 1 ]

El pseudocódigo de este algoritmo es el siguiente:

ds_actual ← ds_inicial Para x iteraciones, haga lo siguiente: test_ds ← perturbar(current_ds, temp) Si similar_enough(test_ds, initial_ds): current_ds ← test_ds función perturb(ds, temp): bucle: prueba ← mover_puntos_aleatorios(ds) Si fit(test) > fit(ds) o temp > random(): prueba de retorno 

dónde

  • initial_dses el conjunto de datos semilla
  • current_dses la última versión del conjunto de datos
  • fit()es una función que se utiliza para comprobar si al mover los puntos se acerca a la forma deseada.
  • tempes la temperatura del algoritmo de recocido simulado
  • similar_enough()es una función que comprueba si las estadísticas de los dos conjuntos de datos dados son lo suficientemente similares.
  • move_random_points()es una función que mueve aleatoriamente los puntos de datos

Véase también

Referencias

  1. 1 2 3 Matejka, Justin; Fitzmaurice, George (2 de mayo de 2017). "Mismas estadísticas, diferentes gráficos: Generación de conjuntos de datos con apariencia variada y estadísticas idénticas mediante recocido simulado" (PDF) . Actas de la Conferencia CHI 2017 sobre Factores Humanos en Sistemas Informáticos . CHI '17. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1290–1294 . doi : 10.1145/3025453.3025912 . ISBN  978-1-4503-4655-9Archivado del original el 2 de mayo de 2017.
  2. Elert, Glenn (2021). "Regresión lineal - Práctica" . El libro hipertextual de física .
  3. Janert, Philipp K. (2010). Análisis de datos con herramientas de código abierto . O'Reilly Media . págs. 65–66 . ISBN  978-0-596-80235-6.
  4. Chatterjee, Samprit; Hadi, Ali S. (2006). Análisis de regresión mediante ejemplos . John Wiley and Sons. pág. 91. ISBN  0-471-74696-7.
  5. Saville, David J.; Wood, Graham R. (1991). Métodos estadísticos: El enfoque geométrico . Springer . pág. 418. ISBN  0-387-97517-9.
  6. Tufte, Edward R. (2001). La representación visual de la información cuantitativa (2.ª ed.). Cheshire, CT: Graphics Press. ISBN  0-9613921-4-2.
  7. 1 2 Cairo, Alberto. "Descarga Datasaurus: Nunca confíes solo en las estadísticas resumidas; visualiza siempre tus datos" . Archivado del original el 20 de junio de 2024. Recuperado el 1 de febrero de 2024 .
  8. Murtagh, Jack (1 de febrero de 2024). "Lo que este gráfico de un dinosaurio puede enseñarnos sobre cómo hacer mejor ciencia" . Scientific American . Recuperado el 8 de marzo de 2024 .
  9. Chatterjee, Sangit; Firat, Aykut (2007). "Generación de datos con estadísticas idénticas pero gráficos diferentes: una continuación del conjunto de datos de Anscombe". The American Statistician . 61 (3): 248– 254. doi : 10.1198/000313007X220057 . JSTOR 27643902. S2CID 121163371 .  
  • Ejemplos animados de Autodesk para los conjuntos de datos Datasaurus Dozen.
  • datasaurus , conjuntos de datos de Datasaurus Dozen en R
  • La colección Datasaurus Dozen en archivos CSV y delimitados por tabulaciones https://www.openintro.org/data/index.php?data=datasaurus
Obtenido de " https://en.wikipedia.org/w/index.php?title=Datasaurus_dozen&oldid=1353914246 "