Pipeline Pilot es una aplicación de escritorio desarrollada por Dassault Systèmes , centrada en los procesos de extracción, transformación y carga (ETL) y el análisis de datos. Desde su creación, el software ha evolucionado para ofrecer capacidades más amplias en diversas aplicaciones científicas e industriales.
Pipeline Pilot utiliza una interfaz de programación visual y de flujo de datos, que permite a los usuarios diseñar flujos de trabajo para el procesamiento de datos. La funcionalidad del software abarca varios dominios, incluyendo quimioinformática , QSAR , [ 1 ] [ 2 ] secuenciación de próxima generación , [ 3 ] análisis de imágenes , [ 4 ] y análisis de texto . [ 5 ] Pipeline Pilot fue desarrollado inicialmente por SciTegic , una empresa que fue adquirida por BIOVIA en 2004. En 2014, BIOVIA pasó a formar parte de Dassault Systèmes .
Usos
Pipeline Pilot se utiliza principalmente en industrias que requieren un procesamiento y análisis de datos exhaustivos, como las ciencias biológicas, la ciencia de los materiales y la ingeniería. El software permite a los usuarios crear flujos de trabajo arrastrando y soltando componentes funcionales que automatizan las tareas de análisis de datos, se integran con bases de datos y realizan diversos cálculos científicos. Estos flujos de trabajo se denominan «protocolos» y pueden compartirse y reutilizarse dentro de equipos u organizaciones.
El producto admite múltiples lenguajes de programación, como Python , .NET , MATLAB , Perl , SQL , Java , VBScript y R , lo que brinda a los usuarios flexibilidad para integrar código personalizado en sus flujos de trabajo. Además, Pipeline Pilot ofrece compatibilidad con PilotScript, su propio lenguaje de scripting basado en PL/SQL, que permite a los usuarios realizar manipulaciones de datos personalizadas dentro de sus flujos de trabajo. Otros módulos incluyen funcionalidades para tareas científicas específicas, como el análisis de secuenciación de nueva generación, la quimioinformática y la predicción de propiedades de polímeros.
Descripción general
La interfaz, conocida como Pipeline Pilot Professional Client, permite a los usuarios crear flujos de trabajo seleccionando y organizando unidades de procesamiento de datos individuales llamadas "componentes". Estos componentes realizan diversas funciones, como cargar, filtrar, combinar o modificar datos. Los componentes adicionales pueden llevar a cabo tareas más complejas, como la construcción de modelos de regresión, el entrenamiento de redes neuronales o la generación de informes en formatos como PDF.
Pipeline Pilot sigue una arquitectura basada en componentes, donde estos actúan como nodos en un flujo de trabajo, conectados por "tuberías" que representan el flujo de datos en un grafo dirigido . Este marco permite procesar los datos a medida que se mueven entre los componentes.
Los usuarios tienen la flexibilidad de trabajar con componentes preinstalados o desarrollar componentes personalizados dentro de flujos de trabajo, denominados "protocolos". Los protocolos, que constan de componentes interconectados, se pueden guardar, reutilizar y compartir, lo que permite un procesamiento de datos más eficiente. La interfaz visualiza las conexiones entre los componentes, simplificando flujos de trabajo de datos complejos al presentarlos como secuencias de operaciones.
Colecciones de componentes
Pipeline Pilot ofrece varios complementos llamados "colecciones", que son grupos de funciones especializadas destinadas a dominios específicos, como el procesamiento de información genética o el análisis de polímeros. Estas colecciones están disponibles para los usuarios mediante el pago de una licencia adicional.
Las colecciones se organizan en dos grupos principales: específicas de cada ciencia y genéricas. Las colecciones específicas de cada ciencia se centran en áreas como la química, la biología y el modelado de materiales, mientras que las colecciones genéricas proporcionan herramientas para la elaboración de informes, el análisis de datos y la búsqueda de documentos. A continuación se presenta una descripción general de las colecciones disponibles: [ 6 ]
Scripts personalizados
Pipeline Pilot se utiliza habitualmente para procesar conjuntos de datos grandes y complejos, que a menudo superan 1 TB. En sus inicios, Pipeline Pilot introdujo un lenguaje de scripting llamado "PilotScript", que permite a los usuarios escribir scripts básicos que pueden integrarse en un protocolo. Con el tiempo, se añadió compatibilidad con otros lenguajes de programación, como Python, .NET, Matlab, Perl, SQL, Java, VBScript y R. Estos lenguajes pueden utilizarse mediante API que ejecutan comandos sin necesidad de una interfaz gráfica de usuario. [ 7 ]
PilotScript, un lenguaje basado en PL/SQL , se utiliza en componentes específicos como el "Manipulador personalizado (PilotScript)" o el "Filtro personalizado (PilotScript)". A continuación se muestra un ejemplo de un comando PilotScript sencillo, donde se agrega una propiedad llamada "Hello" a cada registro que pasa por el componente con el valor "Hello World!":
Hola := "¡Hola Mundo!" ;Referencias
- ↑ Hassan, Moises; Brown, Robert D.; Varma-O'Brien, Shikha; Rogers, David (2007). "Análisis y aprendizaje quimioinformático en un entorno de procesamiento de datos". ChemInform . 38 (12). doi : 10.1002/chin.200712278 . ISSN 0931-7597 .
- ↑ Hu, Ye; Lounkine, Eugen; Bajorath, Jürgen (2009). "Mejora del rendimiento de búsqueda de huellas digitales de conectividad extendida mediante filtrado de características orientado a la actividad y aplicación de una función de similitud dependiente de la densidad de bits". ChemMedChem . 4 (4): 540– 548. doi : 10.1002/cmdc.200800408 . ISSN 1860-7179 . PMID 19263458 . S2CID 35868099 .
- ↑ "Accelrys entra en el mercado de secuenciación de próxima generación con la recopilación de NGS para un proyecto piloto" . Business Wire. 23 de febrero de 2011. Consultado el 15 de febrero de 2013 .
- ↑ Rabal, Obdulia; Link, Wolfgang; G. Serelde, Beatriz; Bischoff, James R.; Oyarzabal, Julen (2010). "Un sistema integrado de un solo paso para extraer, analizar y anotar toda la información relevante del cribado celular basado en imágenes de bibliotecas químicas". Molecular BioSystems . 6 (4): 711– 720. doi : 10.1039/b919830j . ISSN 1742-206X . PMID 20237649 .
- ↑ Paveley, Ross A.; Mansour, Nuha R.; Hallyburton, Irene; Bleicher, Leo S.; Benn, Alex E.; Mikic, Ivana; Guidi, Alessandra; Gilbert, Ian H.; Hopkins, Andrew L.; Bickle, Quentin D. (2012). " Detección de alto contenido de organismos completos mediante clasificación bayesiana basada en imágenes y sin etiquetas para enfermedades parasitarias" . PLOS Neglected Tropical Diseases . 6 (7) e1762. doi : 10.1371/journal.pntd.0001762 . ISSN 1935-2735 . PMC 3409125. PMID 22860151 .
- ↑ "Colecciones de componentes piloto de Pipeline" . Accelrys. Archivado del original el 15 de enero de 2013. Consultado el 26 de enero de 2013 .
- ↑ "Hoja de datos de la colección de componentes de integración piloto de tuberías" (PDF) . Accelrys . Consultado el 8 de febrero de 2013 .
- Software científico
- Integración de aplicaciones empresariales
- Herramientas de extracción, transformación y carga
- Software de bioinformática
- Software de química computacional
- software de visión artificial
- Software de análisis de datos
- Software de minería de datos y aprendizaje automático
- Software de visualización de datos e información
- Software de laboratorio
- Software de espectrometría de masas
- Software de procesamiento del lenguaje natural
- Software numérico
- Software de trazado
- Software propietario
- lenguajes de programación visual