Kepler es un sistema de software libre para diseñar, ejecutar, reutilizar, evolucionar, archivar y compartir flujos de trabajo científicos . [ 2 ] [ 3 ] [ 4 ] Las funcionalidades de Kepler proporcionan monitorización de procesos y datos, información de procedencia y movimiento de datos de alta velocidad. Los flujos de trabajo en general, y los flujos de trabajo científicos en particular, son grafos dirigidos donde los nodos representan componentes computacionales discretos y las aristas representan rutas por las que los datos y los resultados pueden fluir entre los componentes. [ 5 ] En Kepler, los nodos se denominan «actores» y las aristas se denominan «canales». Kepler incluye una interfaz gráfica de usuario para componer flujos de trabajo en un entorno de escritorio , un motor de ejecución para ejecutar flujos de trabajo dentro de la GUI e independientemente de una línea de comandos, y una opción de computación distribuida que permite distribuir las tareas del flujo de trabajo entre nodos de computación en un clúster de computadoras o una red de computación . El sistema Kepler apunta principalmente al uso de una metáfora de flujo de trabajo para organizar tareas computacionales dirigidas a objetivos específicos de análisis y modelado científico. De este modo, los flujos de trabajo científicos de Kepler generalmente modelan el flujo de datos de un paso a otro en una serie de cálculos que permiten alcanzar algún objetivo científico.
Flujo de trabajo científico
Un flujo de trabajo científico consiste en combinar datos y procesos en un conjunto de pasos estructurados y configurables que implementan soluciones computacionales semiautomatizadas para un problema científico. Los sistemas de flujo de trabajo científico suelen proporcionar interfaces gráficas de usuario para combinar diferentes tecnologías, junto con métodos eficientes para su uso, lo que aumenta la productividad de los científicos.
Acceso a datos científicos
Kepler proporciona acceso directo a datos científicos archivados en muchos de los repositorios de datos más utilizados. Por ejemplo, Kepler permite acceder a los datos almacenados en el servidor Metacat de la Red de Conocimiento para la Biocomplejidad (KNB) [ 6 ] y descritos mediante el Lenguaje de Metadatos Ecológicos . Otras fuentes de datos compatibles incluyen datos accesibles mediante los protocolos DiGIR, OPeNDAP , GridFTP, JDBC , SRB y otros.
Modelos de computación
Kepler se diferencia de muchos otros sistemas de gestión de flujos de trabajo bioinformáticos en que separa la estructura del modelo de flujo de trabajo de su modelo de computación, de modo que se pueden vincular diferentes modelos de computación a un grafo de flujo de trabajo determinado. Kepler hereda varios modelos de computación comunes del sistema Ptolemy , incluidos el Flujo de Datos Síncrono (SDF), el Tiempo Continuo (CT), la Red de Procesos (PN) y el Flujo de Datos Dinámico (DDF), entre otros.
Flujos de trabajo jerárquicos
Kepler admite jerarquías en los flujos de trabajo, lo que permite componer tareas complejas a partir de componentes más simples. Esta función permite a los autores de flujos de trabajo crear componentes modulares y reutilizables que se pueden guardar para su uso en diversos flujos de trabajo.
Semántica del flujo de trabajo
Kepler proporciona un modelo para la anotación semántica de componentes de flujo de trabajo utilizando términos extraídos de una ontología . Estas anotaciones admiten muchas funciones avanzadas, incluyendo capacidades de búsqueda mejoradas, validación automatizada del flujo de trabajo y edición mejorada del mismo. [ 7 ]
Compartir flujos de trabajo
Los componentes de Kepler se pueden compartir exportando el flujo de trabajo o el componente a un archivo de archivo de Kepler (KAR), que es una extensión del formato de archivo JAR de Java. Una vez creado un archivo KAR, se puede enviar por correo electrónico a compañeros, compartir en sitios web o subir al repositorio de componentes de Kepler. El repositorio de componentes es un sistema centralizado para compartir flujos de trabajo de Kepler, accesible tanto a través de un portal web como de una interfaz de servicio web . Los usuarios pueden buscar y utilizar componentes directamente del repositorio desde la interfaz gráfica de usuario (GUI) de composición de flujos de trabajo de Kepler.
Procedencia
La procedencia es un concepto fundamental en los flujos de trabajo científicos, ya que permite a los científicos comprender el origen de sus resultados, repetir sus experimentos y validar los procesos utilizados para obtener los datos. [ 8 ] Para que un flujo de trabajo pueda reproducirse, se debe registrar información de procedencia que indique el origen de los datos, cómo se modificaron y qué componentes y parámetros se utilizaron. Esto permitirá a otros científicos repetir el experimento y confirmar los resultados. [ 9 ]
Los sistemas actuales ofrecen poco soporte para que los usuarios finales puedan consultar información de procedencia de forma científicamente significativa, en particular cuando los modelos avanzados de ejecución de flujos de trabajo van más allá de los DAG simples (como en las redes de procesos). [ 10 ]
Historia de Kepler
El Proyecto Kepler fue creado en 2002 por miembros del proyecto Science Environment for Ecological Knowledge (SEEK) [ 4 ] y del proyecto Scientific Data Management (SDM). El proyecto fue fundado por investigadores del National Center for Ecological Analysis and Synthesis (NCEAS) de la Universidad de California, Santa Bárbara , y del San Diego Supercomputer Center de la Universidad de California, San Diego . Kepler amplía Ptolemy II, un sistema de software para el modelado, la simulación y el diseño de sistemas embebidos concurrentes y en tiempo real, desarrollado en la UC Berkeley. La colaboración en Kepler creció rápidamente a medida que miembros de diversas disciplinas científicas se percataron de los beneficios de los flujos de trabajo científicos para el análisis y el modelado, y comenzaron a contribuir al sistema. En 2008, los colaboradores de Kepler provenían de numerosas disciplinas científicas, como ecología, biología molecular, genética, física, química, ciencias de la conservación, oceanografía, hidrología, biblioteconomía, informática, entre otras. Kepler es un motor de orquestación de flujos de trabajo que se utiliza para simplificar enormemente los procesos laborales, en forma de actores.
Véase también
- Taberna Apache
- Red de descubrimiento
- Senderos VisTrails
- Oleoducto LONI
- Sistemas de gestión de flujos de trabajo bioinformáticos
- Kit de herramientas para investigadores de DataONE
Referencias
- ↑ "Lanzamiento de Kepler 2.5 — Kepler" . Archivado del original el 20 de noviembre de 2015. Consultado el 19 de noviembre de 2015 .
- ↑ Ludäscher B., Altintas I., Berkley C., Higgins D., Jaeger-Frank E., Jones M., Lee E., Tao J., Zhao Y. 2006. Gestión del flujo de trabajo científico y el sistema Kepler. Número especial: Flujo de trabajo en sistemas de computación en malla. Concurrency and Computation: Practice & Experience 18(10): 1039-1065.
- ↑ Altintas I, Berkley C, Jaeger E, Jones M, Ludäscher B, Mock S. 2004. Kepler: Un sistema extensible para el diseño y la ejecución de flujos de trabajo científicos. Actas del Foro Global Grid sobre el Futuro de los Entornos de Datos en Red 10.
- 1 2 Michener, William K., James H. Beach, Matthew B. Jones, Bertram Ludaescher, Deana D. Pennington, Ricardo S. Pereira, Arcot Rajasekar y Mark Schildhauer. 2007. «Un entorno de conocimiento para la biodiversidad y las ciencias ecológicas», Journal of Intelligent Information Systems, 29(1): 111-126. doi : 10.1007/s10844-006-0034-8
- ↑ Taylor, IJ; Deelman, E .; Gannon, DB; Shields, M. (Eds.), “Workflows for e-Science: Scientific Workflows for Grids”, 530 p., Springer. ISBN 978-1-84628-519-6.
- ↑ Jones, Matthew B., C. Berkley, J. Bojilova, M. Schildhauer. 2001. Managing Scientific Metadata. IEEE Internet Computing 5 (5): 59-68.
- ↑ Berkley, Chad, Shawn Bowers, Matthew B. Jones, Bertram Ludaescher, Mark Schildhauer, Jing Tao. 2005. Incorporación de la semántica en la creación de flujos de trabajo científicos. 17.ª Conferencia Internacional sobre Gestión de Bases de Datos Científicas y Estadísticas. IEEE Computer Society.
- ↑ "WebHome < Challenge < TWiki" . Archivado del original el 6 de julio de 2008. Consultado el 6 de abril de 2009 .
- ↑ Barker, A.; van Hemert, J (2008). «Flujo de trabajo científico: una revisión y direcciones de investigación». Procesamiento paralelo y matemáticas aplicadas . Notas de clase en ciencias de la computación. Vol. 4967. págs. 746–753 . doi : 10.1007/978-3-540-68111-3_78 . ISBN 978-3-540-68105-2.
- ↑ Shawn Bowers, Timothy McPhillips, Bertram Ludascher, Shirley Cohen, Susan B. Davidson 2006. Un modelo para la procedencia de datos orientada al usuario en flujos de trabajo científicos en cascada.
Enlaces externos
- Sitio web del Proyecto Kepler
- Repositorio de componentes de Kepler
- Sitio web del proyecto Ptolomeo II
- Archivo de datos de la Red de Conocimiento para la Biocomplejidad (KNB)
- Lista de herramientas de software relacionadas con los flujos de trabajo en el sitio web de DataONE.
- Aplicaciones de flujo de trabajo
- Software de bioinformática
- Software que utiliza la licencia BSD.
- Software libre programado en Java.