Articulo de referencia

SAP IQ

[[Data warehouse]] [[Analytics]]"},"license":{"wt":"[[proprietary software|Proprietary]]"},"website":{"wt":"{{URL|https://www.sap.com/india/products/sybase-iq-big-data-managemen...

SAP IQ (anteriormente conocido como SAP Sybase IQ o Sybase IQ ; IQ por Intelligent Query ) es un sistema de software de base de datos relacional basado en columnas y de escala petabyte, utilizado para inteligencia empresarial , almacenamiento de datos y data marts. Producido por Sybase Inc. , ahora una empresa de SAP , su función principal es analizar grandes cantidades de datos en un entorno de bajo costo y alta disponibilidad. A SAP IQ se le suele atribuir [ 1 ] el mérito de haber sido pionero en la comercialización de la tecnología de almacenamiento en columnas.

La base de SAP IQ reside en una tecnología de almacenamiento columnar que permite la compresión de velocidad y el análisis ad hoc. SAP IQ adopta un enfoque de interfaz abierta hacia su ecosistema. Además, SAP IQ está integrado con el portafolio de productos de Business Intelligence de SAP para conformar una pila de software de análisis empresarial integral, y es un componente esencial de la arquitectura de tejido de datos en memoria y la plataforma de gestión de datos de SAP .

Historia

A principios de la década de 1990, Expressway Technologies, Inc., con sede en Waltham, Massachusetts, desarrolló Expressway 103, un motor basado en columnas , optimizado para análisis, que eventualmente se convertiría en Sybase IQ. Sybase adquirió Expressway y reintrodujo el producto en 1995 como IQ Accelerator, para luego renombrarlo poco después como Sybase IQ, dándole el número de versión 11.0. [ 2 ]

Al ofrecer el producto IQ como parte de una colección de tecnologías relacionadas que se encuentran a menudo en un almacén de datos (incluidos Sybase Adaptive Server Enterprise , Replication Server, PowerDesigner y SQL Anywhere ), Sybase se convirtió en una de las primeras empresas convencionales en reconocer la necesidad de productos especializados para el mercado de almacenes de datos. [ 3 ]

Con la versión 12.0, Sybase reemplazó la interfaz de consulta poco acoplada de Adaptive Server Enterprise por un acoplamiento estrecho con SQL Anywhere.

La versión 16 incorpora un almacenamiento de columnas rediseñado para volúmenes de datos extremos, a escala de petabytes, y una compresión de datos aún más extrema . [ 4 ]

En 2014, SAP HANA , junto con sus socios BMMsoft , HP , Intel , NetApp y Red Hat, anunció el mayor almacén de datos del mundo. Un equipo de ingenieros de SAP, BMMsoft, HP, Intel, NetApp y Red Hat construyó el almacén de datos utilizando SAP HANA y SAP IQ 16, con BMMsoft Federated EDMT ejecutándose en servidores HP DL580 con procesadores Intel Xeon E7-4870 bajo Red Hat Enterprise Linux 6 y almacenamiento NetApp FAS6290 y E5460. El desarrollo y las pruebas del almacén de datos de 12,1 PB fueron realizados por el laboratorio Petascale de SAP/Intel en Santa Clara, California, y auditados por InfoSizing, un auditor independiente certificado por el Transaction Processing Council. [ 5 ]

Historial de versiones

Con el lanzamiento de SP08, los números de versión se modificaron para alinearse con los de SAP HANA y reflejar la integración continua del producto con SAP HANA. El título de la versión, SP03, es una continuación de SP02 y abarca todas las plataformas no afectadas por esta versión.

Tejido de datos en memoria

El nuevo enfoque de SAP optimiza y simplifica el almacenamiento de datos en una estructura de datos en memoria. [ 6 ]

Arquitectura de tejido de datos en memoria de SAP

SAP IQ con SAP HANA

Con la llegada del big data , SAP IQ se ha integrado con SAP HANA para ofrecer una plataforma de análisis distribuida en memoria. Existen tres aplicaciones y casos de uso principales que buscan aprovechar las fortalezas de SAP IQ en cuanto a escalabilidad y rendimiento como EDW y procesador de big data, al tiempo que utilizan la velocidad en memoria de SAP HANA para la generación de informes operativos:

SAP IQ como servicio de acceso casi inmediato (NLS) a SAP HANA

Solución SAP-NLS para SAP BW(/4) todas las versiones

SAP HANA para informes operativos con SAP IQ para el procesamiento de big data (NLS)

En este escenario, los datos de SAP Enterprise Resource Planning (ERP) se transfieren a SAP HANA, que actúa como un almacén de datos operacionales para su análisis inmediato. Una vez analizados, los datos se integran en SAP IQ mediante mecanismos de almacenamiento en línea cercano (como se describió anteriormente). Aquí, SAP IQ actúa como un almacén de datos empresarial que recibe datos de diversas fuentes tradicionales (como bases de datos OLTP y sistemas de archivos) y del Almacén de Datos Operacionales (ODS) de SAP HANA [ 7 ].

Q - el instalador fácil para SAP IQ

SAP IQ como almacén de datos empresarial (EDW) con SAP HANA como data mart ágil.

Cuando se utiliza SAP IQ como EDW, también se puede complementar con la tecnología en memoria de HANA. Entre los usos comunes se incluyen los informes de planificación y análisis que requieren procesamiento OLTP simultáneo. En este caso, los datos fluyen de SAP IQ a SAP HANA. [ 7 ] SAP BusinessObjects BI permite obtener visibilidad en ambas plataformas.

Tecnología

Motor SAP IQ 16

Para el usuario, SAP IQ se ve como cualquier otro sistema de gestión de bases de datos relacionales con una capa de lenguaje basada en SQL accesible mediante controladores ODBC / JDBC . Sin embargo, internamente, Sybase IQ es un sistema de gestión de bases de datos orientado a columnas , que almacena las tablas de datos como secciones de columnas en lugar de como filas de datos, como la mayoría de las bases de datos transaccionales.

Arquitectura de almacenes columnares

La orientación por columnas tiene varias ventajas. [ 8 ] Si se realiza una búsqueda de elementos que coincidan con un valor específico en una columna de datos, solo es necesario acceder a los objetos de almacenamiento correspondientes a esa columna dentro de la tabla. Una base de datos tradicional basada en filas tendría que leer toda la tabla, de arriba abajo. Otra ventaja es que, cuando se indexa correctamente, un valor que tendría que almacenarse una vez en cada fila de datos en una base de datos tradicional se almacena solo una vez, y en SAP IQ, se utiliza un índice de n bits para acceder a los datos. [ 9 ] El uso de índices de n bits y la indexación por niveles permiten una mayor compresión y cargas por lotes incrementales rápidas.

Además, el almacenamiento basado en columnas permite que SAP IQ comprima los datos de manera eficiente sobre la marcha. [ 10 ]

Tecnología de indexación

Antes de SAP IQ 16, cada página de datos se estructuraba como una matriz de celdas de tamaño fijo, por lo que todos los valores tenían el mismo tipo de datos . Si bien este enfoque de almacenamiento es eficiente para datos estructurados y de longitud fija, no se aplica a los datos más no estructurados y de tamaño variable que se observan hoy en día. Para combatir la ineficiencia del almacenamiento y almacenar datos de tamaño variable con un mínimo de espacio desperdiciado, cada página se compone de celdas de tamaño variable que se empaquetan de forma compacta; la arquitectura de almacenamiento en columnas admite un número variable de celdas por página y varios formatos de página dentro de una columna. SAP IQ también aplica algoritmos de compresión Lempel-Ziv-Welch (LZW) [ 11 ] a cada página de datos cuando se escribe en el disco, para reducir significativamente el volumen de datos. [ 12 ]

Los mapas de bits se utilizan para índices secundarios. [ 11 ]

Marco de procesamiento masivamente paralelo

SAP IQ cuenta con un marco de procesamiento masivamente paralelo (MPP) basado en un entorno de recursos compartidos que admite el procesamiento distribuido de consultas. La mayoría de los demás productos compatibles con MPP suelen basarse en entornos sin recursos compartidos . La ventaja de los recursos compartidos radica en su mayor flexibilidad en cuanto a la variedad de consultas que se pueden optimizar, especialmente para equilibrar las necesidades de muchos usuarios concurrentes. La desventaja es que, en casos extremos, la competencia entre procesadores para acceder a un grupo de almacenamiento compartido (generalmente una red de área de almacenamiento) puede generar contención de E/S , lo que afecta al rendimiento de las consultas.[12]

Sin embargo, la arquitectura de almacenamiento de SAP IQ mencionada anteriormente permite que las capas de computación y almacenamiento se escalen de forma independiente entre sí, y también permite que estos recursos se aprovisionen bajo demanda para una mejor utilización sin reestructurar la base de datos subyacente.

Arquitectura multiplex

SAP IQ utiliza una arquitectura de cuadrícula en clúster, compuesta por clústeres de servidores SAP IQ, o Multiplex. Estos clústeres se utilizan para escalar el rendimiento ante un gran número de consultas concurrentes o de alta complejidad. Esta arquitectura se basa en una arquitectura de recursos compartidos, donde todos los nodos de cómputo interactúan con el mismo almacenamiento compartido y las consultas pueden distribuirse entre todos ellos. El Multiplex cuenta con un nodo coordinador que gestiona el catálogo de la base de datos y coordina las escrituras transaccionales en el almacenamiento. Otros nodos pueden ser de solo lectura o de lectura y escritura, como el nodo coordinador. La infraestructura de almacenamiento puede implementarse con diversas tecnologías que permiten compartir recursos entre los nodos del Multiplex.

Esta arquitectura tiene múltiples usos, incluyendo el balanceo de carga y los almacenes de datos virtuales elásticos. El balanceo de carga se logra mediante el motor de consultas SAP IQ, que aumenta o disminuye dinámicamente el paralelismo en respuesta a los cambios en la actividad del servidor. Existe una conmutación por error automática si un nodo deja de participar en una consulta, y otros nodos retoman el trabajo originalmente asignado al nodo fallido para que la consulta pueda completarse. En el lado del cliente, la compatibilidad con balanceadores de carga externos garantiza que las consultas se inicien en servidores físicos de forma equilibrada para eliminar cuellos de botella. Los nodos físicos en el Multiplex se pueden agrupar en "servidores lógicos", lo que permite aislar las cargas de trabajo entre sí (por motivos de seguridad o balanceo de recursos); se pueden agregar máquinas a estos servidores según cambie la demanda. El objetivo de la arquitectura de cuadrícula es permitir la resiliencia incluso durante transacciones globales.

Motor de carga

El motor de carga de SAP IQ se puede utilizar para carga incremental por lotes, carga concurrente de baja latencia y carga masiva (con archivos de datos tanto del cliente como del servidor). El proceso de carga masiva permite que se produzcan varios procesos de carga simultáneamente, si las cargas son de tablas diferentes. Los datos se pueden cargar desde otras bases de datos, así como desde archivos. El versionado de instantáneas a nivel de página permite cargas y consultas concurrentes, con bloqueos únicamente a nivel de tabla. Con SAP Replication Server, ahora mejorado para optimizar las cargas en SAP IQ, las transacciones se compilan en el menor conjunto de operaciones posible, y luego se realizan cargas masivas por micro-lotes en SAP IQ, lo que da la apariencia de cargas continuas en tiempo real.

El cargador masivo ahora realiza todas las operaciones en paralelo para aprovechar al máximo todos los núcleos del servidor, eliminar cuellos de botella y mantener todos los subprocesos productivos, en lugar de serializar el proceso. El proceso de carga sigue siendo de dos fases: primero, se leen los datos sin procesar y se crean índices de punto flotante, y segundo, se crean índices secundarios, pero todo se ejecuta en paralelo. Los índices de grupo alto, en los que se basa el optimizador de consultas para obtener información sobre qué columnas/filas contienen qué valores de datos, ahora están estructurados como un conjunto de niveles, que aumentan a medida que se desciende en la pirámide.

Por último, SAP IQ introduce un almacén Delta de versiones a nivel de fila (RLV) optimizado para escritura, que permite cargas de datos de alta velocidad y una rápida disponibilidad de los datos para los usuarios. Este almacén utiliza índices mínimos y compresión, con bloqueo a nivel de fila para escritura concurrente, su propio registro de transacciones y solo permite la adición de datos. Funciona como complemento del almacén principal, cargando los datos a alta velocidad en el almacén RLV y migrándolos posteriormente al almacén principal, donde se fusionan periódicamente. Para el usuario, no parece que haya dos entidades separadas en funcionamiento, y las consultas operan de forma transparente en ambos almacenes. Para aprovechar esta funcionalidad, los usuarios pueden especificar tablas de base de datos de uso frecuente como tablas RLV.

API de marco de trabajo y de cliente

SAP IQ ofrece API de consulta basadas en estándares ANSI SQL puros (con pocas restricciones), que incluyen soporte para OLAP y búsqueda de texto completo. Los procedimientos almacenados son compatibles con los dialectos ANSI SQL y Transact-SQL, y pueden ejecutarse de forma programada o inmediata. Además, existen controladores de base de datos para diversos lenguajes de programación como Java, C/C++, PHP, Perl, Python, Ruby y ADO.Net.

Manejo de datos no estructurados

SAP IQ es un motor de análisis que puede consultar datos estructurados y no estructurados y combinar los resultados. SAP IQ introdujo un nuevo índice de texto y una cláusula SQL "contains" para facilitar la búsqueda de términos dentro de un bloque de texto no estructurado. Las alianzas de SAP Sybase con proveedores permiten la ingesta de diversos formatos binarios de archivos de texto en SAP IQ y la creación de índices de texto para ellos. Estos índices de texto preparan los datos para que las aplicaciones de análisis de texto de nivel superior realicen búsquedas de texto completo dentro de SAP IQ mediante sentencias SELECT. La sintaxis SELECT puede ser utilizada por aplicaciones que realizan tokenización, categorización y análisis de texto adicionales.

Marco de análisis y extensibilidad en la base de datos

El análisis integrado en la base de datos se basa en el concepto fundamental de mantener los algoritmos analíticos cerca de los datos para un mayor rendimiento. El marco de extensibilidad, denominado "análisis integrado en la base de datos", permite integrar funciones analíticas dentro del motor de base de datos de SAP IQ, trasladando el análisis a la base de datos en lugar de a un entorno especializado externo, un proceso propenso a errores y más lento. Existen funciones predefinidas disponibles de forma nativa y a través de socios de SAP IQ que proporcionan bibliotecas especializadas de estadística y minería de datos que se integran con SAP IQ. Este marco aumenta la capacidad de SAP IQ para realizar procesamiento y análisis avanzados, ya que los datos no tienen que trasladarse fuera de la base de datos a un entorno especializado para su análisis. Todos los datos y resultados obtenidos pueden compartirse a través del sistema de gestión de bases de datos (DBMS) y se pueden adquirir fácilmente mediante una interfaz SQL. Mediante funciones definidas por el usuario (UDFS), los socios pueden ampliar el DBMS con cálculos personalizados, proporcionando bibliotecas especializadas de estadística y minería de datos que se integran directamente con SAP IQ para mejorar su rendimiento en el procesamiento y análisis avanzados.

Seguridad

SAP IQ ofrece varias funcionalidades, tanto incluidas en el producto base como licenciables por separado, para ayudar a proteger la seguridad de los datos del usuario. Una nueva funcionalidad introducida en IQ 16 es el Control de Acceso Basado en Roles (RBAC), que permite la separación de funciones y respeta el principio del mínimo privilegio , al permitir la división de operaciones privilegiadas en conjuntos detallados que se pueden otorgar individualmente a los usuarios. El producto base incluye: usuarios, grupos y permisos, autoridades de administración de bases de datos, políticas de inicio de sesión de usuarios, cifrado de bases de datos, seguridad de la capa de transporte, IPv6, control de acceso basado en roles y auditoría de bases de datos. Las funcionalidades adicionales forman parte de una opción licenciable denominada opción de seguridad avanzada: cifrado FIPS, autenticación Kerberos, autenticación LDAP y cifrado de columnas de la base de datos.

Gestión del ciclo de vida de la información (GVI)

Como parte de ILM, SAP IQ permite a los usuarios crear múltiples DBSpaces (unidades lógicas de almacenamiento/contenedores para objetos de base de datos) para organizar los datos. Esto se puede usar para separar datos estructurados o no estructurados, agruparlos según su antigüedad y valor, o particionar datos de tablas. Los DBSpaces también se pueden marcar como de solo lectura para permitir la comprobación de coherencia y la copia de seguridad puntuales. Otra aplicación de ILM es la capacidad de particionar tablas y ubicar partes móviles a lo largo de la estructura de almacenamiento y las capacidades de copia de seguridad; esto permite un proceso de gestión de almacenamiento donde los datos circulan por niveles de almacenamiento, pasando de un almacenamiento más rápido y costoso a uno más lento y económico a medida que envejecen, particionando los datos según su valor.

Alta disponibilidad y recuperación ante desastres

La configuración multiplex proporciona escalabilidad y alta disponibilidad para los nodos de cómputo, ya que un nodo coordinador multiplex puede conmutar a un nodo coordinador alternativo en caso de fallo.

La copia de seguridad virtual de SAP IQ también permite a los usuarios realizar copias de seguridad de datos rápidamente y, junto con la tecnología de replicación de almacenamiento, los datos se copian continuamente para que las copias de seguridad se realicen rápidamente y en segundo plano. Una vez completadas las copias de seguridad virtuales, se pueden verificar mediante pruebas y restauración; los datos empresariales se pueden copiar para desarrollo y pruebas. Luego, solo queda completar la copia de seguridad en un punto en el tiempo transaccionalmente coherente. SAP afirma que la recuperación ante desastres es más sencilla con un enfoque de MPP de todo compartido. La herramienta de modelado SAP Sybase PowerDesigner permite a los usuarios crear un modelo ILM que se puede implementar con SAP IQ. En un modelo ILM se pueden definir tipos de almacenamiento, DBSpaces y fases del ciclo de vida, y la herramienta se puede utilizar para generar informes y crear scripts de creación y movimiento de particiones.

Integración con Hadoop

SAP IQ ofrece federación con el sistema de archivos distribuidos de Hadoop (HDFS), un marco de trabajo muy popular para big data, lo que permite a los usuarios empresariales seguir almacenando datos en Hadoop y aprovechar sus ventajas. La integración se logra de cuatro maneras diferentes, según las necesidades del usuario: federación del lado del cliente, ETL, datos y consultas. La federación del lado del cliente combina datos de IQ y Hadoop a nivel de aplicación cliente, mientras que la federación ETL permite cargar datos de Hadoop en los esquemas de almacenamiento columnar de IQ. Los datos de HDFS también se pueden combinar con los de IQ en tiempo real mediante consultas SQL desde IQ, y, por último, los resultados de los trabajos MapReduce se pueden combinar con los datos de IQ, también en tiempo real.

Centro de control de SAP

SAP Control Center reemplaza a Sybase Central como herramienta gráfica web para la administración y el monitoreo. SAP Control Center permite monitorear servidores y recursos SAP Sybase (nodos, multiplex) desde cualquier ubicación, así como monitorear el rendimiento e identificar tendencias de uso. La aplicación web cuenta con una arquitectura de complementos de múltiples niveles, compuesta por un servidor y agentes basados ​​en productos que transfieren el rendimiento de SAP Sybase al servidor de Control Center.

Análisis habilitado para la web

SAP IQ incluye controladores de aplicaciones web que facilitan el acceso desde diversos entornos de programación y ejecución Web 2.0 (Python, Perl, PHP, .Net, Ruby). Mediante la federación de consultas con otras bases de datos, los desarrolladores pueden crear aplicaciones que interactúen con múltiples fuentes de datos simultáneamente (así como con plataformas de bases de datos de otros proveedores). Se pueden crear tablas proxy de federación que se asignan a tablas en bases de datos externas; estas se materializan como tablas en memoria, pero se puede interactuar con ellas como si residieran dentro de SAP IQ. De esta forma, las fuentes de datos se pueden combinar en una vista unificada.

Plataformas compatibles

SAP IQ también admite la integración de algoritmos externos escritos en C++ y Java . Las consultas SQL pueden invocar estos algoritmos, lo que permite la ejecución de análisis dentro de la base de datos, lo que proporciona un mejor rendimiento y escalabilidad. Además, Sybase IQ también ofrece controladores para el acceso mediante lenguajes como PHP , Perl , Python y Ruby on Rails .

SAP IQ es compatible con la mayoría de las principales plataformas de sistemas operativos, incluidas:

Clientes

Sybase afirma que Sybase IQ está instalado actualmente en más de 2000 sitios de clientes. Entre los clientes destacados se incluyen comScore Inc. , [ 13 ] CoreLogic , Investment Technology Group (ITG), [ 14 ] y el Servicio de Impuestos Internos de los Estados Unidos (IRS). [ 15 ]

Aunque Sybase IQ se ha utilizado ampliamente para implementaciones específicas de estilo data mart, [ 16 ] también se ha implementado como un almacén de datos empresarial.

Referencias

  1. C-Store: Un SGBD orientado a columnas. Archivado el 19/06/2010 en Wayback Machine , Stonebraker et al., Actas de la 31.ª Conferencia VLDB, Trondheim, Noruega, 2005.
  2. Cole, Barb (7 de noviembre de 1994), Sybase realiza una jugada de almacenamiento de datos mediante una adquisición , Network World
  3. Moore, Trevor (2010), Guía de supervivencia de Sybase IQ , pág. 16, ISBN  978-1-4466-5758-4
  4. "¡SAP Sybase IQ 16 para análisis XLDB ya está disponible! - Blogs de SAP" . scn.sap.com . Abril de 2013.
  5. "SAP y sus socios establecen un nuevo récord para el mayor almacén de datos del mundo" . Comunicado de prensa . SAP. 5 de marzo de 2014. Archivado del original el 6 de agosto de 2016. Consultado el 19 de agosto de 2016 .
  6. "Soluciones de almacenamiento de datos | Tecnología | SAP" . Archivado del original el 27/11/2014 . Consultado el 27/05/2014 .
  7. 1 2 "¿Cómo funciona todo esto en conjunto: BW, BW en HANA, Suite en HANA, HANA Live... Parte 8 - Blogs de SAP?" . scn.sap.com . 27 de noviembre de 2013.
  8. MacNicol, Roger; French, Blaine (agosto de 2004), Sybase IQ Multiplex – Diseñado para análisis (PDF) , Actas de la 31.ª Conferencia VLDB, Trondheim, Noruega
  9. Sybase IQ#cite note-Moore-1
  10. "Lograr análisis rentables y optimizados para el rendimiento" . Archivado del original el 28 de mayo de 2014. Consultado el 27 de mayo de 2014 .
  11. 1 2 "Descripción general de SAP Sybase IQ y novedades de la versión 16" (PDF) . Archivado del original (PDF) el 29/05/2014.
  12. "Dobler Consulting - Sybase - SQL Server - Oracle - MongoDB" (PDF) . www.doblerconsulting.com . Archivado del original (PDF) el 29 de mayo de 2014.
  13. Henschen, Doug (24 de noviembre de 2010), El despliegue de Big Data de ComScore en detalle , Information Week
  14. Clark, Don (18 de noviembre de 2007), Las empresas emergentes exploran el campo de las bases de datos: el software ágil ayuda a dar sentido al flujo de información (PDF) , Wall Street Journal, archivado del original (PDF) el 16 de agosto de 2011.
  15. Lai, Eric (22 de marzo de 2008), ¿ Ha sido auditado últimamente? La culpa es del enorme y ultrarrápido almacén de datos del IRS , ComputerWorld, archivado del original el 22 de octubre de 2013 , recuperado el 13 de marzo de 2012 .
  16. Henschen, Doug (12 de julio de 2011), Sybase IQ mejora sus capacidades de análisis , Information Week
  • Sitio web de SAP IQ
  • Wiki de la comunidad SAP IQ
  • Documentación de SAP IQ
  • Página de soporte de SAP IQ
  • Documentos técnicos en SybaseWiki
Obtenido de " https://en.wikipedia.org/w/index.php?title=SAP_IQ&oldid=1353456415 "