Articulo de referencia

Naranja (software)

{{Cite web|url=https://github.com/biolab/orange3/blob/master/CHANGELOG.md#01---1996-10-10|title=orange3/CHANGELOG.md at master . biolab/orange3 . GitHub|website=[[GitHub]]}} "},...

Un flujo de trabajo típico en Orange.
Un flujo de trabajo típico en Orange 3

Orange es un conjunto de herramientas de código abierto para visualización de datos , aprendizaje automático y minería de datos . Incluye una interfaz de programación visual para el análisis exploratorio de datos cualitativos y la visualización interactiva de datos .

Widget de árbol de clasificación en naranja 3

Descripción

Orange es un paquete de software de programación visual basado en componentes para la visualización de datos , el aprendizaje automático , la minería de datos y el análisis de datos .

Los componentes naranjas se denominan widgets. Abarcan desde la visualización de datos simple, la selección de subconjuntos y el preprocesamiento hasta la evaluación empírica de algoritmos de aprendizaje y el modelado predictivo .

La programación visual se implementa a través de una interfaz en la que se crean flujos de trabajo mediante la vinculación de widgets predefinidos o diseñados por el usuario , mientras que los usuarios avanzados pueden utilizar Orange como una biblioteca de Python para la manipulación de datos y la modificación de widgets. [ 5 ]

Software

Orange es un paquete de software de código abierto distribuido bajo la licencia GPL y alojado en GitHub . Las versiones hasta la 3.0 incluyen componentes principales en C++ con interfaces en Python . A partir de la versión 3.0, Orange utiliza bibliotecas de código abierto comunes de Python para computación científica, como numpy , scipy y scikit-learn , mientras que su interfaz gráfica de usuario funciona dentro del marco multiplataforma Qt .

La instalación predeterminada incluye varios algoritmos de aprendizaje automático, preprocesamiento y visualización de datos en 6 conjuntos de widgets (datos, transformación, visualización, modelado, evaluación y aprendizaje no supervisado). Se pueden adquirir funcionalidades adicionales como complementos (minería de texto, análisis de imágenes, bioinformática, etc.).

Orange es compatible con macOS , Windows y Linux , y también se puede instalar desde el repositorio Python Package Index ( pip install Orange3 ).

Características

Orange consiste en una interfaz de lienzo donde el usuario coloca widgets y crea un flujo de trabajo de análisis de datos. Los widgets ofrecen funcionalidades básicas como leer datos, mostrar tablas de datos, seleccionar características, entrenar predictores, comparar algoritmos de aprendizaje, visualizar elementos de datos, etc. El usuario puede explorar visualizaciones de forma interactiva o introducir el subconjunto seleccionado en otros widgets.

Un dendrograma decorado en naranja 3
Un dendrograma decorado en naranja 3
  • Canvas : interfaz gráfica para el análisis de datos.
  • Widgets :
    • Datos : widgets para entrada de datos, filtrado de datos, muestreo, imputación, manipulación de características y selección de características.
    • Visualizar : widgets para visualización común (diagrama de caja, histogramas, diagrama de dispersión) y visualización multivariada (mosaico, diagrama de tamiz).
    • Classify : un conjunto de algoritmos de aprendizaje automático supervisado para la clasificación.
    • Regresión : un conjunto de algoritmos de aprendizaje automático supervisado para regresión.
    • Evaluar : validación cruzada, procedimientos basados ​​en muestreo, estimación de la fiabilidad y puntuación de los métodos de predicción.
    • Aprendizaje no supervisado : algoritmos de aprendizaje no supervisado para agrupamiento (k-medias, agrupamiento jerárquico) y técnicas de proyección de datos (escalamiento multidimensional, análisis de componentes principales, análisis de correspondencias).

Complementos

Los usuarios de Orange pueden ampliar su conjunto básico de componentes con componentes de los complementos. Los complementos compatibles incluyen:

  • Asociado : componentes para la minería de conjuntos de elementos frecuentes y el aprendizaje de reglas de asociación .
  • Bioinformática : componentes para el análisis de la expresión génica, el enriquecimiento y el acceso a bases de datos de expresión (por ejemplo, Gene Expression Omnibus ) y bibliotecas de vías metabólicas.
  • Fusión de datos : componentes para fusionar diferentes conjuntos de datos , factorización matricial colectiva y exploración de factores latentes.
  • Educativo : componentes para la enseñanza de conceptos de aprendizaje automático, como agrupamiento k-means , regresión polinómica , descenso de gradiente estocástico , ...
  • Explicación : proporciona una extensión con componentes para la explicación del modelo, incluido el análisis de valores de Shapley.
  • Geo : componentes para trabajar con datos geoespaciales .
  • Análisis de imágenes : componentes para trabajar con imágenes e incrustaciones de ImageNet
  • Red : componentes para el análisis de grafos y redes .
  • Minería de texto : componentes para el procesamiento del lenguaje natural y la minería de texto .
  • Series temporales : componentes de widgets para el análisis y modelado de series temporales .
  • Análisis de células individuales : compatibilidad con el análisis de la expresión génica de células individuales, incluyendo componentes para la carga de datos de células individuales, filtrado y eliminación del efecto de lote , descubrimiento de genes marcadores, puntuación de células y genes, y predicción del tipo de célula.
    El gráfico de Kaplan-Meier a partir de datos de análisis de supervivencia representa las curvas de supervivencia y permite la selección interactiva de casos.
  • Espectroscopia : componentes para el análisis y la visualización de conjuntos de datos (hiper)espectrales . [ 6 ]
  • Análisis de supervivencia : complemento para el análisis de datos de supervivencia. Incluye widgets para técnicas estándar de análisis de supervivencia, como el gráfico de Kaplan-Meier , el modelo de regresión de Cox y varios widgets derivados.
  • Felicidad Mundial : permite descargar datos socioeconómicos de una base de datos, incluidos los Indicadores de Desarrollo Mundial de la OCDE . Proporciona acceso a miles de indicadores de países procedentes de diversas bases de datos económicas.
  • Equidad : complemento para la evaluación y creación de modelos de aprendizaje automático equitativos sin discriminación. Los widgets abarcan desde el cálculo de métricas de equidad como la paridad estadística hasta métodos de posprocesamiento, preprocesamiento e intraprocesamiento para construir modelos equitativos. [ 7 ]

Objetivos

El programa proporciona una plataforma para la selección de experimentos, sistemas de recomendación y modelado predictivo , y se utiliza en biomedicina , bioinformática , investigación genómica y docencia. En ciencia, se utiliza como plataforma para probar nuevos algoritmos de aprendizaje automático e implementar nuevas técnicas en genética y bioinformática. En educación, se ha utilizado para enseñar métodos de aprendizaje automático y minería de datos a estudiantes de biología, biomedicina e informática.

Extensiones

Diversos proyectos se basan en Orange, ya sea ampliando los componentes principales con complementos o utilizando únicamente el Orange Canvas para aprovechar las funciones de programación visual y la interfaz gráfica de usuario (GUI) implementadas.

  • OASYS — Suite de sincrotrón naranja [ 8 ]
  • scOrange — bioestadística de células individuales
  • Quasar: análisis de datos en ciencias naturales

Historia

En 1996, la Universidad de Ljubljana y el Instituto Jožef Stefan iniciaron el desarrollo de ML*, un marco de aprendizaje automático en C++ , y en 1997 se desarrollaron enlaces a Python para este marco, que, junto con los módulos de Python emergentes, conformaron un marco conjunto llamado Orange. Durante los años siguientes, la mayoría de los principales algoritmos contemporáneos para la minería de datos y el aprendizaje automático se implementaron en C++ (el núcleo de Orange) o en módulos de Python.

  • En 2002, se diseñaron los primeros prototipos para crear una interfaz gráfica de usuario flexible utilizando megawidgets de Python de Pmw .
  • En 2003, la interfaz gráfica de usuario fue rediseñada y desarrollada nuevamente para el framework Qt utilizando las bibliotecas PyQt de Python. Se definió el marco de programación visual y se inició el desarrollo de widgets (componentes gráficos del proceso de análisis de datos).
  • En 2005 se crearon extensiones para el análisis de datos en bioinformática .
  • En 2008 se desarrollaron paquetes de instalación de Mac OS X basados ​​en DMG y Fink .
  • En 2009, se crearon y mantuvieron más de 100 widgets.
  • En 2009 se lanzó la versión beta de Orange 2.0, que ofrecía paquetes de instalación en el sitio web basados ​​en el ciclo de compilación diario.
  • En 2012, se impuso una nueva jerarquía de objetos, que sustituyó a la antigua estructura basada en módulos.
  • En 2013, un rediseño significativo de la interfaz gráfica de usuario incluyó una nueva caja de herramientas y una nueva representación de los flujos de trabajo.
  • En 2015 se lanzó Orange 3.0. Orange almacena los datos en matrices NumPy ; los algoritmos de aprendizaje automático utilizan principalmente scikit-learn .
  • En 2015 se lanzó un complemento de análisis de texto para Orange3.
  • En 2016, Orange lanzó la versión 3.3. El equipo de desarrollo programó un ciclo mensual para las versiones estables.
  • En 2016, Orange comenzó el desarrollo y lanzamiento de un complemento de análisis de imágenes, con redes neuronales profundas del lado del servidor para la incrustación de imágenes [ 9 ].
  • En 2017, se introdujo un complemento de espectroscopia para el análisis de datos espectrales. [ 10 ]
  • En 2017, se introdujo Geo, un complemento para manejar datos de geolocalización y visualización de mapas geográficos [ 11 ].
  • En 2018, Orange comenzó el desarrollo y lanzamiento de un complemento para el análisis de datos de células individuales. [ 12 ]
  • En 2019, Orange separó su interfaz gráfica para el desarrollo como un proyecto separado, orange-canvas-core [ 13 ].
  • En 2020, Orange presentó el complemento Explain, con widgets para explicar los modelos de clasificación y de regresión , destacando la fuerza y ​​las contribuciones que aportan las características específicas a la predicción de una clase concreta.
  • En 2022, se presentó World Happiness, un complemento para el paquete de minería de datos Orange3, que proporciona widgets para acceder a datos socioeconómicos de diversas bases de datos, como el Informe Mundial de la Felicidad , los Indicadores de Desarrollo Mundial y la OCDE.
  • En 2022, Orange amplió el complemento Explain con un gráfico de Expectativa Condicional Individual y la técnica de Importancia de Características de Permutación.
  • En 2023, Orange presentó el complemento Fairness, que incluye widgets para calcular métricas de sesgo, así como widgets para métodos de preprocesamiento, postprocesamiento y procesamiento interno, lo que permite la creación de modelos menos susceptibles a errores sistemáticos debido a las variaciones del conjunto de datos.

Véase también

Referencias

  1. "orange3/CHANGELOG.md en master . biolab/orange3 . GitHub" . GitHub .
  2. "Versión 3.40.0" . 20 de diciembre de 2025. Consultado el 3 de abril de 2026 .
  3. "Naranja - Licencia" .
  4. "orange3/LICENSE en master . biolab/orange3 . GitHub" . GitHub .
  5. Janez Demšar; Tomaž Curk; Aleš Erjavec; Črt Grupop; Tomaž Hočevar; Mitar Milutinovič; Martín Možina; Matija Polajnar; Marko Toplak; Anže Starič; Miha Stajdohar; Lan Umek; Lan Žagar; Jure Žbontar; Marinka Žitnik; Blaž Zupan (2013). "Orange: caja de herramientas de minería de datos en Python" (PDF) . Revista de investigación sobre aprendizaje automático . 14 (1): 2349–2353 .
  6. Toplak, M.; Birarda, G.; Read, S.; Sandt, C.; Rosendahl, SM; Vaccari, L.; Demšar, J.; Borondics, F. (2017). "Infrared Orange: Connecting Hyperspectral Data with Machine Learning". Synchrotron Radiation News . 30 (4): 40– 45. Bibcode : 2017SRNew..30...40T . doi : 10.1080/08940886.2017.1338424 . S2CID 125273654 . 
  7. Iomids (30 de mayo de 2024). "Comprobación de la discriminación en la IA mediante la interfaz gráfica de usuario con el complemento Orange Fairness" . IOMIDS.
  8. Sánchez Del Río, Manuel; Rebuffi, Luca (2017). "OASYS (Or Ange SYnchrotron Suite): Un entorno gráfico de código abierto para experimentos virtuales de rayos X". En Chubar, Oleg; Sawhney, Kawal (eds.). Avances en métodos computacionales para óptica de rayos X IV . p. 28. doi : 10.1117/12.2274263 . ISBN  9781510612334. S2CID 117118973 . 
  9. Primož Godec; Matjaž Pančur; Nejc Ilenič; Andrej Čopar; Martín Stražar; Aleš Erjavec; Ajda Pretnar; Janez Demšar; Marko Toplak; Anže Starič; Lan Žagar; Jan Hartman; Hamilton Wang; Ricardo Bellazzi; Uroš Petrovič; Silvia Garaña; Mauricio Zuccotti; Parque Dongsu; Gad Shaulsky; Blaž Zupan (2019). "Análisis de imágenes democratizado mediante programación visual mediante la integración de modelos profundos y aprendizaje automático a pequeña escala" . Comunicaciones de la naturaleza . 10 (1): 4551. Código Bib : 2019NatCo..10.4551G . doi : 10.1038/s41467-019-12397-x . PMC 6779910 . PMID 31591416 . S2CID 203782491 .   
  10. Marko Toplak; Stuart T. Read; Christophe Sandt; Ferenc Borondics (2021). "Quasar: Aprendizaje automático sencillo para bioespectroscopia" . Cells . 10 (9): 2300. doi : 10.3390/cells10092300 . PMC 8466383. PMID 34571947 .  
  11. "Documentación de Orange3-Geo — Documentación de Orange3-Geo" .
  12. Martín Stražar; Lan Žagar; Jaka Kokošar; Vesna Tanko; Aleš Erjavec; Pavlin G. Poličar; Anže Starič; Janez Demšar; Gad Shaulsky; Vilas Menón; Andrés Lemire; Anup Parikh; Blaž Zupan (2021). "scOrange: una herramienta para la formación práctica de conceptos de análisis de datos unicelulares" . Bioinformática . 35 (14): i4- i12. doi : 10.1093/bioinformática/btz348 . PMC 6612816 . PMID 31510695 .  
  13. "Núcleo de Orange Canvas" . GitHub .

Lecturas adicionales

  • Demšar, Janez y Blaž Zupan, Minería de datos fructífera y divertida: una perspectiva histórica , Informatica 37, págs. 55–60, (2013).
  • Mario Capurso, Adquisición, limpieza, análisis y visualización de datos con aplicaciones en el entorno Orange basado en Python, en Ciencia e ingeniería de datos: una ruta de aprendizaje Vol. 1 ISBN 979-8875798641.
  • Mario Capurso, Análisis exploratorio de datos, métricas, modelos con aplicaciones en el entorno Orange basado en Python, en Ciencia de datos e ingeniería: una ruta de aprendizaje Vol. 2 ISBN 979-8874396145.
  • Sitio web oficialEdita esto en Wikidata
  • OASYS
  • scOrange
  • Quásar