HPCC (High-Performance Computing Cluster), también conocido como DAS (Data Analytics Supercomputer), es una plataforma de sistema de computación intensiva en datos de código abierto desarrollada por LexisNexis Risk Solutions . La plataforma HPCC incorpora una arquitectura de software implementada en clústeres de computación estándar para proporcionar procesamiento de datos en paralelo de alto rendimiento para aplicaciones que utilizan big data . [ 1 ] La plataforma HPCC incluye configuraciones de sistema para admitir tanto el procesamiento de datos por lotes en paralelo (Thor) como aplicaciones de consulta en línea de alto rendimiento que utilizan archivos de datos indexados (Roxie). [ 2 ] La plataforma HPCC también incluye un lenguaje de programación declarativo centrado en datos para el procesamiento de datos en paralelo llamado ECL . [ 3 ]
El lanzamiento público de HPCC se anunció en 2011, tras diez años de desarrollo interno (según LexisNexis). Es una alternativa a Hadoop [ 4 ] y otras plataformas de Big Data . [ 5 ]
Arquitectura del sistema

La arquitectura del sistema HPCC incluye dos entornos de procesamiento en clúster distintos, Thor y Roxie , cada uno de los cuales puede optimizarse de forma independiente para su propósito de procesamiento de datos en paralelo.
La primera de estas plataformas se llama Thor , una refinería de datos cuyo propósito general es el procesamiento de grandes volúmenes de datos sin procesar de cualquier tipo y para cualquier fin, pero que se utiliza típicamente para la limpieza y el saneamiento de datos, el procesamiento ETL ( extracción, transformación y carga ) de los datos sin procesar, la vinculación de registros y la resolución de entidades, análisis complejos ad hoc a gran escala y la creación de datos clave e índices para admitir consultas estructuradas de alto rendimiento y aplicaciones de almacenamiento de datos . El nombre de la refinería de datos, Thor, hace referencia al dios mítico nórdico del trueno, cuyo gran martillo simboliza la transformación de grandes cantidades de datos sin procesar en información útil. Un clúster Thor es similar en su función, entorno de ejecución, sistema de archivos y capacidades a las plataformas Google y Hadoop MapReduce .
La figura 2 muestra una representación de un clúster de procesamiento físico Thor, que funciona como un motor de ejecución de trabajos por lotes para aplicaciones de computación intensiva en datos escalables. Además de los nodos maestro y esclavo Thor, se necesitan componentes auxiliares y comunes adicionales para implementar un entorno de procesamiento HPCC completo.

La segunda plataforma de procesamiento de datos en paralelo se llama Roxie y funciona como un motor de entrega rápida de datos . Esta plataforma está diseñada como una plataforma de análisis y consulta estructurada en línea de alto rendimiento, o almacén de datos, que proporciona el acceso a datos en paralelo a las aplicaciones en línea mediante interfaces de servicios web, admitiendo miles de consultas y usuarios simultáneos con tiempos de respuesta inferiores a un segundo. Roxie utiliza un sistema de archivos indexado distribuido para proporcionar procesamiento paralelo de consultas mediante un entorno de ejecución optimizado y un sistema de archivos para un procesamiento en línea de alto rendimiento. Un clúster de Roxie es similar en su función y capacidades a ElasticSearch y Hadoop, con la adición de las capacidades de HBase y Hive , y proporciona latencias de consulta predecibles casi en tiempo real. Tanto los clústeres de Thor como los de Roxie utilizan el lenguaje de programación ECL para la implementación de aplicaciones, lo que aumenta la continuidad y la productividad del programador.
La Figura 3 muestra una representación de un clúster de procesamiento físico Roxie, que funciona como un motor de ejecución de consultas en línea para aplicaciones de almacenamiento de datos y consultas de alto rendimiento. Un clúster Roxie incluye varios nodos con procesos de servidor y de trabajo para procesar consultas; un componente auxiliar adicional llamado servidor ESP, que proporciona interfaces para el acceso de clientes externos al clúster; y otros componentes comunes que se comparten con un clúster Thor en un entorno HPCC. Si bien un clúster de procesamiento Thor puede implementarse y utilizarse sin un clúster Roxie, un entorno HPCC que incluya un clúster Roxie también debería incluir un clúster Thor. El clúster Thor se utiliza para crear los archivos de índice distribuidos que utiliza el clúster Roxie y para desarrollar consultas en línea que se implementarán junto con los archivos de índice en el clúster Roxie.

Arquitectura de software
La arquitectura de software de HPCC incorpora los clústeres Thor y Roxie, así como componentes de middleware comunes , una capa de comunicaciones externas, interfaces de cliente que proporcionan servicios al usuario final y herramientas de administración del sistema, y componentes auxiliares para la monitorización y para facilitar la carga y el almacenamiento de datos del sistema de archivos desde fuentes externas. Normalmente, un entorno HPCC incluye solo clústeres Thor, o bien clústeres Thor y Roxie, aunque ocasionalmente Roxie se utiliza para crear sus propios índices. La arquitectura general del software HPCC se muestra en la Figura 4.
Sistemas HPCC
HPCC Systems (High Performance Computing Cluster) forma parte de LexisNexis Risk Solutions y se creó para promover y vender el software HPCC. En junio de 2011, anunció la oferta del software bajo un modelo de licencia dual de código abierto. [ 6 ] [ 7 ] [ 8 ] [ 9 ]
HPCC Systems ofrece una edición comunitaria y una edición empresarial. La edición comunitaria se puede descargar gratuitamente, incluye el código fuente y se publica bajo la licencia Apache 2.0. La edición empresarial está disponible bajo una licencia comercial de pago e incluye formación, soporte, indemnización y módulos adicionales. En noviembre de 2011, HPCC Systems anunció la disponibilidad de su clúster Thor Data Refinery en Amazon Web Services . [ 10 ] En enero de 2012, HPCC Systems anunció algoritmos de aprendizaje automático distribuidos . [ 11 ]
Véase también
Referencias
- ↑ Manual de Computación en la Nube , "Tecnologías intensivas en datos para la computación en la nube", por AM Middleton. Manual de Computación en la Nube. Springer, 2010.
- ↑ "Sistemas HPCC: Introducción a HPCC (Clúster de Computación de Alto Rendimiento)". 24 de mayo de 2011. CiteSeerX 10.1.1.456.3571 .
- ↑ Manual de computación intensiva en datos , "ECL/HPCC: Un enfoque unificado para el Big Data", por AM Middleton. Manual de computación intensiva en datos. Springer, 2011.
- ↑ "LexisNexis liberará el código fuente de su alternativa a Hadoop para el manejo de macrodatos" . ReadWrite . 15 de junio de 2011. Archivado del original el 4 de abril de 2014. Consultado el 20 de noviembre de 2014 .
- ↑ "9 útiles herramientas de código abierto para Big Data" . EnterpriseAppsToday . 11 de noviembre de 2015. Consultado el 18 de noviembre de 2015 .
- ↑ "LexisNexis libera el código fuente de su competidor de Hadoop" . GigaOM . 15 de junio de 2011. Archivado del original el 21 de enero de 2013. Consultado el 8 de noviembre de 2014 .
- ↑ "LexisNexis liberará el código fuente de su alternativa a Hadoop para el manejo de macrodatos" . ReadWrite . 15 de junio de 2011. Archivado del original el 4 de abril de 2014. Consultado el 20 de noviembre de 2014 .
- ↑ "HPCC, un recién llegado/viejo en la ciudad para enfrentarse a Hadoop" . NetworkWorld . 16 de junio de 2011. Consultado el 2 de diciembre de 2014 .
- ↑ "LexisNexis se une a la Fundación Linux" . La Fundación Linux . 17 de junio de 2011. Archivado del original el 4 de abril de 2014. Consultado el 29 de noviembre de 2014 .
- ↑ "HPCC anuncia la disponibilidad de un clúster ETL en Amazon Web Services" . Cloud Computing Today . 17 de diciembre de 2012. Consultado el 30 de noviembre de 2014 .
- ↑ "HPCC Systems presenta la versión beta de aprendizaje automático" . Datanami . 31 de enero de 2012. Consultado el 29 de noviembre de 2014 .
Enlaces externos
- Sandia observa un aumento vertiginoso de los desafíos en la gestión de datos.
- Los Laboratorios Nacionales Sandia aprovechan la supercomputadora de análisis de datos (DAS) del Grupo de Análisis de Riesgos e Información de LexisNexis, que ofrece una computación de alto rendimiento revolucionaria para abordar los desafíos de la gestión y el análisis de datos.
- Modelos de programación para el clúster de computación de alto rendimiento de LexisNexis.
- Supercomputadora de análisis de datos de LexisNexis
- Sistemas HPCC de LexisNexis
- Referencia al término BORPS (miles de millones de registros por segundo)
- LexisNexis aplica su magia en la gestión de datos a los datos científicos.
- Certificado en clústeres de computación de alto rendimiento (HPCC) y análisis de macrodatos - Certificado independiente
- La Universidad Atlántica de Florida (FAU) recibe una subvención de respuesta rápida de la Fundación Nacional de Ciencias para desarrollar un modelo informático innovador para la propagación del ébola.
- CPL Online ofrece valor añadido a sus clientes a través de su plataforma de Big Data.
- Sistemas HPCC
- Computación paralela
- computación distribuida
- lenguajes de programación declarativos
- Lenguajes de consulta
- Productos de almacenamiento de datos
- Arquitectura de software