
El conjunto de datos de flores de iris o conjunto de datos de iris de Fisher es un conjunto de datos multivariados utilizado y popularizado por el estadístico y biólogo británico Ronald Fisher en su artículo de 1936, «El uso de mediciones múltiples en problemas taxonómicos como ejemplo de análisis discriminante lineal» . [ 1 ] A veces se le llama conjunto de datos de iris de Anderson porque Edgar Anderson recopiló los datos para cuantificar la variación morfológica de las flores de iris de tres especies relacionadas. [ 2 ] Dos de las tres especies se recolectaron en la península de Gaspé «todas del mismo pasto, recogidas el mismo día y medidas a la misma hora por la misma persona con el mismo aparato». [ 3 ]
El conjunto de datos consta de 50 muestras de cada una de las tres especies de Iris ( Iris setosa , Iris virginica e Iris versicolor ). Se midieron cuatro características de cada muestra: la longitud y el ancho de los sépalos y pétalos , en centímetros. A partir de la combinación de estas cuatro características, Fisher desarrolló un modelo discriminante lineal para distinguir cada especie. El artículo de Fisher se publicó en los Anales de Eugenesia (actualmente Anales de Genética Humana ). [ 1 ]
Uso del conjunto de datos


Originalmente utilizado como un conjunto de datos de ejemplo sobre el cual se aplicó el análisis discriminante lineal de Fisher, se convirtió en un caso de prueba típico para muchas técnicas de clasificación estadística en aprendizaje automático, como las máquinas de vectores de soporte . [ 5 ]
Sin embargo, el uso de este conjunto de datos en el análisis de clústeres no es común, ya que solo contiene dos clústeres con una separación bastante evidente. Uno de los clústeres contiene Iris setosa , mientras que el otro contiene tanto Iris virginica como Iris versicolor y no es separable sin la información de especies que utilizó Fisher. Esto convierte al conjunto de datos en un buen ejemplo para explicar la diferencia entre las técnicas supervisadas y no supervisadas en la minería de datos : el modelo discriminante lineal de Fisher solo se puede obtener cuando se conocen las especies de los objetos; las etiquetas de clase y los clústeres no son necesariamente lo mismo. [ 6 ]
Sin embargo, las tres especies de Iris son separables en la proyección sobre el componente principal no lineal y ramificado. [ 7 ] El conjunto de datos se aproxima mediante el árbol más cercano con cierta penalización por el número excesivo de nodos, curvatura y estiramiento. Luego se construye el llamado "mapa de metro". [ 4 ] Los puntos de datos se proyectan en el nodo más cercano. Para cada nodo se prepara el diagrama circular de los puntos proyectados. El área del diagrama circular es proporcional al número de puntos proyectados. Es claro en el diagrama (izquierda) que la gran mayoría de las muestras de las diferentes especies de Iris pertenecen a los diferentes nodos. Solo una pequeña fracción de Iris-virginica se mezcla con Iris-versicolor (los nodos azul-verdes mixtos en el diagrama). Por lo tanto, las tres especies de Iris ( Iris setosa , Iris virginica e Iris versicolor ) son separables mediante los procedimientos no supervisados del análisis de componentes principales no lineal . Para discriminarlas, basta con seleccionar los nodos correspondientes en el árbol principal.
Conjunto de datos

El conjunto de datos contiene 150 registros clasificados bajo cinco atributos: longitud del sépalo, ancho del sépalo, longitud del pétalo, ancho del pétalo y especie.



El conjunto de datos iris se utiliza ampliamente como conjunto de datos para principiantes en el aprendizaje automático. Este conjunto de datos está incluido en R base y Python en la biblioteca de aprendizaje automático scikit-learn , de modo que los usuarios pueden acceder a él sin necesidad de buscar una fuente externa.
Se han publicado varias versiones del conjunto de datos. [ 8 ]
Código R que ilustra su uso.
El código R de ejemplo que se muestra a continuación reproduce el diagrama de dispersión que aparece en la parte superior de este artículo:
# Mostrar el conjunto de datos iris # Mostrar la página de ayuda, con información sobre el conjunto de datos iris# Crea diagramas de dispersión de todas las combinaciones por pares de las 4 variables en el conjunto de datos pairs ( iris [ 1 : 4 ], main = "Datos de iris (rojo=setosa,verde=versicolor,azul=virginica)" , pch = 21 , bg = c ( "rojo" , "verde3" , "azul" )[ unclass ( iris $ Species )])# Alternativamente, usando ggplot y ggally. install.packages ( c ( "ggplot2" , "GGally" )) # instala los paquetes si no los tienes.#Cargar bibliotecas. biblioteca ( ggplot2 ) biblioteca ( GGally )# Trazar matriz de diagrama de dispersión para el conjunto de datos iris ggpairs ( data = iris , # tus datos iris columns = 1 : 4 , # columnas para el diagrama de dispersión mapping = aes ( colour = Species , fill = Species ), title = 'Matriz de diagrama de dispersión para el conjunto de datos Iris' , ) + theme ( plot.title = element_text ( hjust = 0.5 , face = 'bold' )) + scale_color_brewer ( palette = 'Set1' )Código Python que ilustra su uso.
from sklearn.datasets import load_irisiris = cargar_iris () imprimir ( iris )Este código produce:
{ 'data' : array ([[ 5.1 , 3.5 , 1.4 , 0.2 ], [ 4.9 , 3. , 1.4 , 0.2 ], [ 4.7 , 3.2 , 1.3 , 0.2 ], [ 4.6 , 3.1 , 1.5 , 0.2 ], ... 'target' : array ([ 0 , 0 , 0 , ... 1 , 1 , 1 , ... 2 , 2 , 2 , ... 'target_names' : array ([ 'setosa' , 'versicolor' , 'virginica' ], dtype = '<U10' ), ... }Véase también
Referencias
- 1 2 R. A. Fisher (1936). "El uso de mediciones múltiples en problemas taxonómicos". Anales de Eugenesia . 7 (2): 179– 188. doi : 10.1111/j.1469-1809.1936.tb02137.x . hdl : 2440/15227 .
- ↑ Edgar Anderson (1936). "El problema de las especies en Iris " . Anales del Jardín Botánico de Missouri . 23 (3): 457– 509. Bibcode : 1936AnMBG..23..457A . doi : 10.2307/2394164 . JSTOR 2394164 .
- ↑ Edgar Anderson (1935). "Los lirios de la península de Gaspé". Boletín de la Sociedad Americana del Iris . 59 : 2–5 .
- 1 2 Gorban, AN ; Zinovyev, A. (2010). "Variedades principales y grafos en la práctica: de la biología molecular a los sistemas dinámicos". International Journal of Neural Systems . 20 (3): 219– 232. arXiv : 1001.1122 . doi : 10.1142/S0129065710002383 . PMID 20556849 .
- ↑ "Repositorio de aprendizaje automático de la UCI: conjunto de datos Iris" . archive.ics.uci.edu . Consultado el 1 de diciembre de 2017 .
- ↑ Ines Färber; Stephan Günnemann; Hans-Peter Kriegel ; Peer Kröger; Emmanuel Müller; Erich Schubert; Thomas Seidl; Arthur Zimek (2010). "Sobre el uso de etiquetas de clase en la evaluación de agrupaciones" (PDF) . En Xiaoli Z. Fern; Ian Davidson; Jennifer Dy (eds.). MultiClust: Descubrimiento, resumen y uso de múltiples agrupaciones . ACM SIGKDD .
- ↑ Gorban, AN; Sumner, NR; Zinovyev, AY (2007). "Gramáticas topológicas para la aproximación de datos". Applied Mathematics Letters . 20 (4): 382– 386. arXiv : cs/0603090 . doi : 10.1016/j.aml.2006.04.022 .
- ↑ Bezdek, JC; Keller, JM; Krishnapuram, R.; Kuncheva, LI ; Pal, NR (1999). "¿Podrían los datos reales del iris ponerse de pie, por favor?". IEEE Transactions on Fuzzy Systems . 7 (3): 368– 369. doi : 10.1109/91.771092 .
Enlaces externos
- "Datos del iris de Fisher" . (Contiene dos errores documentados) . Repositorio de aprendizaje automático de la UCI: Conjunto de datos del iris.
- Conjuntos de datos estadísticos
- Conjuntos de datos en aprendizaje automático
- Ronald Fisher