
El Entorno Virtual Integrado de Alto Rendimiento (HIVE) es un entorno de computación distribuida utilizado para la investigación biológica y de TI en el sector salud, incluyendo el análisis de datos de secuenciación de próxima generación (NGS), datos preclínicos, clínicos y posteriores a la comercialización, eventos adversos, datos metagenómicos, etc. [ 1 ] Actualmente, cuenta con el apoyo y el desarrollo continuo de la Administración de Alimentos y Medicamentos de EE. UU . (dominio gubernamental), la Universidad George Washington (dominio académico) y DNA-HIVE, WHISE-Global y Embleema (dominio comercial). HIVE opera actualmente de forma totalmente funcional dentro de la FDA de EE. UU., brindando soporte a una amplia variedad (+60) de proyectos de investigación y revisión regulatoria, así como para los registros poscomercialización de dispositivos médicos MDEpiNet. Las implementaciones académicas de HIVE se utilizan para actividades de investigación y publicaciones en análisis de NGS, investigación del cáncer, investigación del microbioma y en programas educativos para estudiantes de la Universidad George Washington. Las empresas comerciales utilizan HIVE para oncología, microbiología, fabricación de vacunas, edición genética, TI en el sector salud, armonización de datos del mundo real, investigación preclínica y estudios clínicos.
Infraestructura
HIVE es un entorno de computación distribuida masivamente paralelo donde la biblioteca de almacenamiento distribuido y el potente centro de computación distribuida están perfectamente vinculados. [ 2 ] El sistema es robusto y flexible gracias a que tanto el almacenamiento como la base de datos de metadatos se mantienen en la misma red. [ 3 ] La capa de software de almacenamiento distribuido es el componente clave para la gestión de archivos y archivos comprimidos, y es la columna vertebral del proceso de depósito de datos. El sistema de depósito de datos permite la carga y descarga automática de conjuntos de datos externos en los repositorios de datos de HIVE. La base de datos de metadatos se puede utilizar para mantener información específica sobre archivos extremadamente grandes ingeridos en el sistema (big data), así como metadatos relacionados con los cálculos ejecutados en el sistema. Estos metadatos permiten recuperar fácilmente los detalles de un proceso de computación en el futuro para validar o replicar experimentos. Dado que los metadatos están asociados con el cálculo, almacenan los parámetros de cualquier cálculo en el sistema, eliminando el registro manual.
Lo que diferencia a HIVE de otras bases de datos orientadas a objetos es que implementa un conjunto de API unificadas para buscar, visualizar y manipular datos de todo tipo. El sistema también facilita un sistema de control de acceso y permisos jerárquico altamente seguro, que permite determinar los privilegios de acceso a los datos de forma muy precisa sin crear una multiplicidad de reglas en el subsistema de seguridad. El modelo de seguridad, diseñado para datos sensibles, proporciona una funcionalidad integral de control y auditoría, en cumplimiento con la designación de HIVE como sistema FISMA Moderado. [ 4 ]
Capacidades tecnológicas de HIVE
- Recuperación de datos : HIVE es capaz de recuperar datos de diversas fuentes, como almacenamiento local, en la nube o en red, instrumentos de secuenciación y repositorios HTTP, FTP y SFTP. Además, HIVE implementa protocolos de comunicación avanzados con plataformas de datos a gran escala existentes, como NIH/NCBI, para descargar grandes cantidades de datos genómicos de referencia o de lectura de secuencias en nombre de los usuarios de forma sencilla y precisa.
- Almacenamiento de datos : El modelo de datos en panal de abeja de HIVE se creó específicamente para gestionar jerarquías complejas de tipos de datos científicos, proporcionando una plataforma para la estandarización y la trazabilidad de los datos dentro del marco de los modelos de datos orientados a objetos. Mediante el uso de un motor de datos integrado, el modelo en panal de abeja, HIVE contribuye a la veracidad de los cálculos biomédicos y ayuda a garantizar la reproducibilidad y la armonización de los procesos biocomputacionales.
- Seguridad : HIVE-honeycomb emplea un sistema de control de seguridad jerárquico que permite determinar los privilegios de acceso con gran precisión, sin sobrecargar el subsistema de seguridad con múltiples reglas. Proporciona cifrado y descifrado instantáneo de información de identificación personal (PII) y cumple con los protocolos de seguridad más exigentes, tal como se requiere para los sistemas autorizados a operar en entornos regulatorios FISMA de nivel moderado.

- Integración : HIVE proporciona una interfaz de programación de aplicaciones (API) unificada para buscar, editar, visualizar, proteger, compartir y manipular datos y cálculos de todo tipo. Como plataforma integradora, HIVE ofrece a los desarrolladores herramientas para desarrollar (C/C++, Python, Perl, JavaScript, R) e integrar prácticamente cualquier herramienta de código abierto o comercial existente mediante un marco de adaptación genérico para integrar herramientas de línea de comandos. Además, la API web con control de sesión permite que HIVE realice el control de calidad de los datos y cálculos complejos en nombre de usuarios remotos. Actualmente, HIVE cuenta con decenas de herramientas de análisis de big data en producción y muchas más en desarrollo; estas incluyen, entre otras, secuenciación de ADN, ARN, transposones, chips e inmunosecuenciación, ensamblaje de novo, secuenciación metagenómica de genómica poblacional, perfilado diferencial, utilidades estadísticas, de clasificación y de agrupamiento para estudiar bacterias, virus, perfiles somáticos y de línea germinal humana, cuasiespecies, infecciones y patógenos.
- Computaciones : A diferencia de muchos entornos de computación virtual, HIVE virtualiza servicios, no procesos: proporciona computaciones como servicio mediante la introducción de una capa de abstracción independiente entre el hardware, el software y las tareas computacionales solicitadas por los usuarios. El novedoso paradigma de reubicar las computaciones más cerca de los datos, en lugar de trasladar los datos a los núcleos de computación, ha demostrado ser clave para un flujo óptimo de tareas y datos a través de la infraestructura de red.
- Visualización : HIVE ofrece diversos componentes de visualización científica mediante tecnologías como HTML5, SVG y D3JS, dentro de su contexto de Documentos Basados en Datos. Los datos nativos, los metadatos y los resultados computacionales, proporcionados en protocolos de comunicación basados en JSON y CSV, permiten generar herramientas interactivas, personalizables y controladas por el usuario, lo que facilita a los bioinformáticos la manipulación de terabytes de datos de gran tamaño utilizando únicamente un navegador web.
HIVE de código abierto
La FDA lanzó HIVE Open Source como una plataforma para satisfacer las necesidades integrales de análisis NGS. https://github.com/FDA/fda-hive
La plataforma de armonización de biocomputación HIVE es el núcleo del proyecto Estándares Computacionales de Secuenciación de Alto Rendimiento para las Ciencias Regulatorias (HTS-CSRS). Su misión es proporcionar a la comunidad científica un marco para armonizar la biocomputación, promover la interoperabilidad y verificar los protocolos bioinformáticos ( https://hive.biochemistry.gwu.edu/htscsrs ). Para obtener más información, consulte la descripción del proyecto en la página de Investigación Extramural de la FDA (
Arquitectura HIVE

- Arquitectura de hardware : En el núcleo de HIVE existe una sólida infraestructura de hardware compuesta por pocos componentes críticos redundantes y unidades de computación y almacenamiento escalables. El diagrama de la derecha muestra la conectividad y la asignación de componentes para dicho clúster HIVE. Los componentes principales que proporcionan las funciones vitales para la nube HIVE incluyen:
- Los servidores web se conectan al exterior a través de un cortafuegos seguro de alta gama para dar soporte a la funcionalidad del portal web;
- Los servidores en la nube son las unidades funcionales principales que orquestan los flujos de trabajo de almacenamiento y computación distribuidos a través de complejos esquemas de colas y priorización;
- El hardware de alta disponibilidad para drones sirve como unidad computacional para la visualización científica y las funcionalidades de soporte de la interfaz de usuario;
- Las unidades de almacenamiento de comunicación entre procesos ultrarrápidas organizan el intercambio de datos para cálculos distribuidos y el espacio de preparación.
- Los conmutadores y el hardware de firewall organizan el entorno de red seguro y de alto rendimiento para la nube HIVE.
- Cada una de las unidades de almacenamiento permanente está diseñada para almacenar cientos de terabytes de datos NGS y genomas de referencia, así como resultados de cálculos y archivos personales de los usuarios.
Los subgrupos de núcleos de computación escalables, de alto rendimiento y alta densidad funcionan como un centro de potencia para cálculos paralelos distribuidos de gran escala en algoritmos de secuenciación de próxima generación (NGS). El sistema es extremadamente escalable y cuenta con instancias de implementación que van desde un único dispositivo HIVE integrado hasta sistemas empresariales masivos con miles de unidades de computación.
- Arquitectura de software : La infraestructura de software de HIVE consta de capas que proporcionan cada vez más funcionalidades de forma incremental.

- La capa base del núcleo proporciona integración con plataformas de hardware y sistemas operativos heterogéneas.
- La infraestructura en la nube de HIVE admite un entorno distribuido de almacenamiento, seguridad y computación.
- La estructura básica de la ciencia representa un conjunto de bibliotecas científicas de bajo nivel para realizar una variedad de cálculos científicos, aparatos matemáticos para conceptos químicos, biológicos, estadísticos y otros conceptos puramente científicos.
- Las capas CGI y Javascript proporcionan capas de compatibilidad para portales web y aplicaciones web.
- Las bibliotecas de bajo nivel proporcionan una interfaz de programación de aplicaciones (API) para el desarrollo de herramientas y utilidades.
- Las aplicaciones integradas proporcionan un amplio arsenal de herramientas NGS.
- Las aplicaciones web y el portal HIVE proporcionan funcionalidad de portal web.
Presentaciones públicas
- El Dr. Vahan Simonyan y el Dr. Raja Mazumder presentaron en NIH Frontiers in Data Science [ 5 ] sobre HIVE actuando como puente entre la investigación y el análisis regulatorio. [ 6 ] [ 7 ] Simonyan también presentó sobre el tema en la Bio-IT World Expo de 2014. [ 8 ]
- HIVE también se trató en FedScoop. [ 9 ]
- Dentro de HIVE, la arquitectura informática multiómica de la FDA, BioIT World. [ 10 ]
Referencias
- ↑ Simonyan, Vahan; Mazumder, Raja (2014). "Herramientas y aplicaciones de entorno virtual integrado de alto rendimiento (HIVE) para el análisis de macrodatos" . Genes . 5 (4): 957–81 . doi : 10.3390/genes5040957 . PMC 4276921. PMID 25271953 .
- ↑ https://hive.biochemistry.gwu.edu/help/HIVEWhitePaper_12_16_2014.pdf
- ↑ https://hive.biochemistry.gwu.edu/help/HIVEInfrastructuresUK.pdf
- ↑ Wilson, CA; Simonyan, V. (2014). "Actividades de la FDA que respaldan la aplicación regulatoria de las tecnologías de secuenciación de 'próxima generación'". PDA Journal of Pharmaceutical Science and Technology . 68 (6): 626– 30. doi : 10.5731/pdajpst.2014.01024 . PMID 25475637. S2CID 37583755 .
- ↑ "Nombre de usuario y contraseña de inicio de sesión de NIH o autenticación con tarjeta PIV" . Archivado del original el 1 de enero de 2016. Consultado el 1 de febrero de 2016 .
- ↑ "NIH VideoCast - Entorno virtual integrado de alto rendimiento (HIVE): una plataforma regulatoria para el análisis de datos NGS" . 29 de enero de 2016.
- ↑ "Nombre de usuario y contraseña de inicio de sesión de NIH o autenticación con tarjeta PIV" . Archivado del original el 1 de enero de 2016. Consultado el 1 de febrero de 2016 .
- ↑ Personal (2014). "Folleto BIT 2014" (PDF) . Exposición Mundial de Bio-TI 2014. Instituto de Tecnología Sanitaria de Cambridge. pág. 6 (col. 2) . Consultado el 15 de junio de 2016.
(título) Infraestructura de entorno virtual integrado de alto rendimiento (HIVE) para el análisis de macrodatos: aplicaciones a la informática de secuenciación de próxima generación
. - ↑ http://fedscoop.com/fdas-examines-nextgen-sequencing-tool
- ↑ "Bio-IT World" .
Enlaces externos
- La versión pública de HIVE se encuentra en https://hive.biochemistry.gwu.edu/dna.cgi?cmd=about
- Algoritmos bioinformáticos
- Software de bioinformática
- Biología molecular
- Biotecnología