
La gestión jerárquica de almacenamiento ( HSM ), también conocida como almacenamiento por niveles , [ 1 ] es una técnica de almacenamiento y gestión de datos que mueve automáticamente los datos entre medios de almacenamiento de alto y bajo costo . Los sistemas HSM existen porque los dispositivos de almacenamiento de alta velocidad, como las matrices de unidades de estado sólido , son más caros (por byte almacenado) que los dispositivos más lentos, como los discos duros , los discos ópticos y las unidades de cinta magnética . Si bien lo ideal sería tener todos los datos disponibles en dispositivos de alta velocidad en todo momento, esto resulta prohibitivo para muchas organizaciones. En cambio, los sistemas HSM almacenan la mayor parte de los datos de la empresa en dispositivos más lentos y luego copian los datos a unidades de disco más rápidas cuando es necesario. El sistema HSM supervisa el uso de los datos y realiza estimaciones sobre qué datos se pueden mover de forma segura a dispositivos más lentos y cuáles deben permanecer en los dispositivos rápidos.
También se puede utilizar HSM cuando se dispone de un almacenamiento más robusto para el archivado a largo plazo, pero el acceso a este es lento. Esto puede ser tan sencillo como una copia de seguridad externa para la recuperación ante desastres .
HSM es un concepto de larga tradición, que se remonta a los inicios del procesamiento comercial de datos. Sin embargo, las técnicas utilizadas han cambiado significativamente a medida que se dispone de nuevas tecnologías, tanto para el almacenamiento como para la comunicación a larga distancia de grandes conjuntos de datos. La escala de medidas como el "tamaño" y el "tiempo de acceso" ha cambiado drásticamente. A pesar de ello, muchos de los conceptos subyacentes siguen ganando popularidad años después, aunque a escalas mucho mayores o más rápidas. [ 1 ]
Implementación
En un escenario típico de HSM, los datos de uso frecuente se almacenan en un dispositivo de almacenamiento en caliente, como un disco de estado sólido (SSD). Los datos a los que se accede con poca frecuencia se migran , tras un tiempo , a un nivel de almacenamiento en frío de mayor capacidad y menor velocidad. Si un usuario accede a datos que se encuentran en el nivel de almacenamiento en frío, estos se mueven automáticamente de vuelta al almacenamiento en caliente. La ventaja es que la cantidad total de datos almacenados puede ser mucho mayor que la capacidad del dispositivo de almacenamiento en caliente, pero dado que solo los archivos de uso poco frecuente se encuentran en el almacenamiento en frío, la mayoría de los usuarios no suelen notar ninguna ralentización.
Conceptualmente, HSM es análogo a la memoria caché que se encuentra en la mayoría de las CPU de los ordenadores , donde se utilizan pequeñas cantidades de memoria SRAM costosa que funciona a velocidades muy altas para almacenar datos de uso frecuente, pero los datos menos utilizados se transfieren a la memoria DRAM principal, más lenta pero mucho más grande, cuando se deben cargar nuevos datos.
En la práctica, la gestión de seguridad de hardware (HSM) se suele realizar mediante software especializado, como IBM Tivoli Storage Manager o SAM-QFS de Oracle .
La eliminación de archivos de un nivel superior de la jerarquía (por ejemplo, disco magnético) después de haber sido movidos a un nivel inferior (por ejemplo, medio óptico) se denomina a veces limpieza de archivos . [ 2 ]
Historia
El Administrador de Almacenamiento Hieráctico (HSM, luego DFHSM y finalmente DFSMShsm ) fue implementado por primera vez por IBM el 31 de marzo de 1978 para MVS con el fin de reducir el costo del almacenamiento de datos y simplificar la recuperación de datos desde medios más lentos. El usuario no necesitaba saber dónde se almacenaban los datos ni cómo recuperarlos; la computadora los recuperaba automáticamente. La única diferencia para el usuario era la velocidad de recuperación de los datos. Inicialmente, HSM solo podía migrar conjuntos de datos a volúmenes de disco y volúmenes virtuales en una instalación de almacenamiento masivo IBM 3850 , pero una versión posterior admitió volúmenes de cinta magnética para la migración de nivel 2 (ML2).
Posteriormente, IBM adaptó HSM a su sistema operativo AIX , y luego a otros sistemas operativos tipo Unix como Solaris , HP-UX y Linux .
La División de Investigación Informática de CSIRO Australia implementó un HSM en su sistema operativo DAD (Drums and Display) con su Región de Documentos en la década de 1960, donde se grababan copias de los documentos en cinta de 7 pistas y se recuperaban automáticamente al acceder a ellos.
HSM también se implementó en los sistemas DEC VAX/VMS y Alpha/VMS. La fecha de la primera implementación debería poder determinarse fácilmente en los manuales de implementación del sistema VMS o en los folletos de descripción del producto VMS.
Más recientemente, el desarrollo de los discos Serial ATA (SATA) ha creado un mercado importante para la gestión de seguridad de hardware (HSM) en tres etapas: los archivos se migran desde dispositivos de red de área de almacenamiento Fibre Channel de alto rendimiento a matrices de discos SATA algo más lentas pero mucho más económicas que suman varios terabytes o más, y finalmente desde los discos SATA a la cinta magnética.
Casos de uso
El almacenamiento de alta seguridad (HSM) se utiliza a menudo para el archivo profundo de datos que se conservarán a largo plazo a bajo coste. Los robots de cinta automatizados pueden almacenar grandes cantidades de datos de forma eficiente con un bajo consumo energético.
Algunos productos de software HSM permiten al usuario almacenar partes de los archivos de datos en una caché de disco de alta velocidad y el resto en cinta. Esto se utiliza en aplicaciones de transmisión de vídeo por internet: la parte inicial del vídeo se entrega inmediatamente desde el disco, mientras que un robot localiza, monta y transmite el resto del archivo al usuario final. Este sistema reduce considerablemente el coste de almacenamiento en disco para sistemas de distribución de contenido de gran tamaño.
Actualmente, el software HSM también se utiliza para la gestión de niveles de almacenamiento entre discos duros y memoria flash , siendo esta última más de 30 veces más rápida que los discos magnéticos, pero considerablemente más barata.
Algoritmos
El factor clave detrás de HSM es una política de migración de datos que controla las transferencias de archivos en el sistema. Más precisamente, la política decide en qué nivel debe almacenarse un archivo, de modo que todo el sistema de almacenamiento pueda estar bien organizado y tener el menor tiempo de respuesta a las solicitudes. Existen varios algoritmos que implementan este proceso, como el reemplazo de los menos usados recientemente (LRU), [ 3 ] reemplazo de tamaño-temperatura (STP), umbral heurístico (STEP) [ 4 ] , etc. En investigaciones recientes, también están surgiendo algunas políticas inteligentes mediante el uso de tecnologías de aprendizaje automático. [ 5 ]
Nivelación frente a almacenamiento en caché
Aunque las soluciones de estratificación y el almacenamiento en caché puedan parecer iguales en la superficie, las diferencias fundamentales radican en la forma en que se utiliza el almacenamiento más rápido y en los algoritmos empleados para detectar y acelerar los datos a los que se accede con frecuencia. [ 6 ]
El almacenamiento en caché funciona creando una copia de los bloques de datos a los que se accede con frecuencia, almacenándola en el dispositivo de almacenamiento más rápido y utilizando esta copia en lugar de la fuente de datos original en el almacenamiento de backend más lento y de alta capacidad. Cada vez que se realiza una lectura del almacenamiento, el software de caché comprueba si ya existe una copia de estos datos en la caché y la utiliza, si está disponible. De lo contrario, los datos se leen del almacenamiento más lento y de alta capacidad. [ 6 ]
Por otro lado, la estratificación funciona de manera muy diferente. En lugar de hacer una copia de los datos de acceso frecuente en un almacenamiento rápido, la estratificación mueve los datos entre estratos, por ejemplo, reubicando los datos poco utilizados en dispositivos de almacenamiento nearline de bajo costo y alta capacidad. [ 7 ] [ 6 ] La idea básica es que los datos críticos para la misión y de acceso frecuente o "calientes" se almacenan en un medio costoso como un SSD para aprovechar el alto rendimiento de E/S, mientras que los datos nearline o de acceso poco frecuente o "fríos" se almacenan en medios de almacenamiento nearline como discos duros y cintas , que son económicos. [ 8 ] Por lo tanto, la "temperatura de los datos" o los niveles de actividad determinan la jerarquía de almacenamiento principal . [ 9 ]
Implementaciones
- Alluxio
- AMASS/DATAMGR de ADIC (estaba disponible en SGI IRIX, Sun y HP-UX)
- Instalación de almacenamiento masivo IBM 3850
- IBM DFSMS para z/VM [ 10 ]
- IBM DFSMShsm , originalmente Administrador de almacenamiento jerárquico (HSM), 5740-XRB, y posteriormente Administrador de almacenamiento jerárquico de instalaciones de datos versión 2 (DFHSM), 5665-329 [ 11 ]
- IBM Tivoli Storage Manager para la gestión del espacio (HSM disponible en UNIX ( IBM AIX , HP UX , Solaris ) y Linux )
- IBM Tivoli Storage Manager HSM para Windows, anteriormente OpenStore para servidores de archivos (OS4FS) (HSM disponible en Microsoft Windows Server ).
- Colaboración HPSS por HPSS
- Infinite Disk , un sistema de PC antiguo (ya desaparecido).
- EMC DiskXtender , anteriormente Legato DiskXtender, anteriormente OTG DiskXtender
- Moonwalk para Windows, NetApp, OES Linux
- Oracle SAM-QFS (código abierto bajo Opensolaris, [ 12 ] luego propietario)
- Oracle HSM (Propietario, anteriormente SAM-QFS)
- Versity Storage Manager para Linux, licencia de modelo de núcleo abierto .
- Dell Compellent Data Progression
- Zarafa Archiver (componente de ZCP, solución de archivado específica para aplicaciones comercializada como una solución 'HSM')
- Marco de gestión de datos de HPE (DMF, anteriormente SGI Data Migration Facility) para SLES y RHEL
- StorNext de Quantum
- Apple Fusion Drive para macOS
- Espacios de almacenamiento de Microsoft desde la versión incluida con Windows Server 2012 R2 . Un producto anterior de Microsoft era Almacenamiento remoto , incluido con Windows 2000 y Windows 2003. [ 13 ] [ 14 ]
- CloudTier-HSM-SDK : Un controlador de filtro HSM para Windows, un SDK de niveles de almacenamiento para Windows.
Véase también
- Alianza de Archivos Activos
- Archivo
- Respaldo
- Almacenamiento en la nube híbrida
- proliferación de datos
- Almacenamiento en disco
- gestión del ciclo de vida de la información
- Repositorio de información
- Almacenamiento de datos en cinta magnética
- Jerarquía de memoria
- Virtualización del almacenamiento
- puerta de enlace de almacenamiento en la nube
Referencias
- 1 2 Larry Freeman. "Lo viejo vuelve a ser nuevo: estratificación del almacenamiento" (PDF) .
- ↑ Patrick M. Dillon; David C. Leonard (1998). Multimedia y la Web de la A a la Z. ABC-CLIO. pág. 116. ISBN 978-1-57356-132-7.
- ↑ O'Neil, Elizabeth J.; O'Neil, Patrick E.; Weikum, Gerhard (1993-06-01). "El algoritmo de reemplazo de páginas LRU-K para el almacenamiento en búfer de disco de bases de datos" . ACM SIGMOD Record . 22 (2): 297– 306. doi : 10.1145/170036.170081 . ISSN 0163-5808 . S2CID 207177617 .
- ↑ Verma, A.; Pease, D.; Sharma, U.; Kaplan, M.; Rubas, J.; Jain, R.; Devarakonda, M.; Beigi, M. (2005). "Una arquitectura para la gestión del ciclo de vida en sistemas de archivos muy grandes". 22.ª Conferencia IEEE / 13.ª Conferencia NASA Goddard sobre Sistemas y Tecnologías de Almacenamiento Masivo (MSST'05) . Monterey, CA, EE. UU.: IEEE. págs. 160–168 . doi : 10.1109/MSST.2005.4 . ISBN 978-0-7695-2318-7. S2CID 7082285 .
- ↑ Zhang, Tianru; Hellander, Andreas; Toor, Salman (2022). "Gestión eficiente de almacenamiento jerárquico potenciada por aprendizaje por refuerzo". IEEE Transactions on Knowledge and Data Engineering : 1. arXiv : 2201.11668 . doi : 10.1109/TKDE.2022.3176753 . ISSN 1041-4347 .
- 1 2 3 Brand, Aron (20 de junio de 2022). "Almacenamiento en caliente vs. almacenamiento en frío: cómo elegir el nivel adecuado para sus datos" . Medium.com . Recuperado el 20 de junio de 2022 .
- ↑ Posey, Brien (8 de noviembre de 2016). "Diferencias entre las tecnologías de almacenamiento en caché y estratificación SSD" . TechTarget . Consultado el 21 de junio de 2022 .
- ↑ Winnard y Biondo 2016 , pág. 5.
- ↑ Winnard y Biondo 2016 , pág. 6.
- ↑ IBM Corporation. "Resumen de la Guía de planificación de DFSMS/VM" . ibm.com . Consultado el 16 de septiembre de 2021 .
- ↑ Administración de almacenamiento DFSMShsm de z/OS 2.5 (PDF) . IBM. 2022. SC23-6871-50 . Consultado el 24 de febrero de 2022 .
- ↑ [SAM/QFS en OpenSolaris.org]
- ↑ Rand Morimoto; Michael Noel; Omar Droubi; Ross Mistry; Chris Amaris (2008). Windows Server 2008 Unleashed . Sams Publishing. pág. 938. ISBN 978-0-13-271563-8.
- ↑ "ITPro Today: Noticias de TI, tutoriales, tendencias, estudios de caso, consejos profesionales y más" .
- Software empresarial
- Almacenamiento de datos informáticos
- marcos de gestión