Articulo de referencia

Cray XMT

\n8 target per stream (1024 per CPU)"},"version":{"wt":"3rd generation of [[Tera MTA]]"}},"i":0}}]}"> Cray XMT ( Cray eXtreme MultiThreading , [ 1 ] nombre en clave Eldorado [ 2...

Cray XMT ( Cray eXtreme MultiThreading , [ 1 ] nombre en clave Eldorado [ 2 ] ) es una arquitectura de supercomputadora de memoria compartida multihilo escalable de Cray , basada en la tercera generación de la arquitectura Tera MTA , orientada a grandes problemas de grafos (por ejemplo, bases de datos semánticas, big data , coincidencia de patrones ). [ 3 ] [ 4 ] [ 5 ] Presentada en 2005, reemplaza a la anterior Cray MTA-2 , que no tuvo éxito . Utiliza las CPU Threadstorm3 dentro de las blades Cray XT3 . Diseñada para utilizar piezas estándar y subsistemas existentes para otros sistemas comerciales, mitigó las deficiencias del alto costo de fabricación y soporte totalmente personalizados de Cray MTA-2. [ 2 ] Introdujo varias mejoras sustanciales con respecto a Cray MTA-2, sobre todo triplicando prácticamente el rendimiento máximo, e incrementó enormemente el número máximo de CPU a 8192 y la memoria máxima a 128 TB, con una TLB de datos de un máximo de 512 TB. [ 2 ] [ 3 ]

Cray XMT utiliza un modelo de memoria direccionable por contenido [ 6 ] aleatorizada [ 3 ] en módulos DDR1 ECC para equilibrar implícitamente la carga de acceso a la memoria en todo el espacio de direcciones global compartido del sistema. [ 5 ] El uso de 4 bits adicionales de semántica de memoria extendida ( lleno/vacío , reenvío y 2 bits de trampa ) por palabra de memoria de 64 bits permite una sincronización ligera y de grano fino en toda la memoria. [ 7 ] No hay interrupciones de hardware y los subprocesos de hardware son asignados por una instrucción, no por el sistema operativo. [ 5 ] [ 7 ]

El front-end (nodos de inicio de sesión, E/S y otros servicios, que utilizan procesadores AMD Opteron y ejecutan SLES Linux ) y el back-end (nodos de cómputo, que utilizan procesadores Threadstorm3 y ejecutan MTK, un microkernel simple basado en BSD Unix [ 3 ] ) se comunican a través de la interfaz LUC (Lightweight User Communication), una interfaz cliente/servidor bidireccional de estilo RPC . [ 1 ] [ 5 ]

Threadstorm3

Threadstorm3 (conocido como "procesador MT" [ 2 ] y Threadstorm antes de XMT2 [ 8 ] ) es un procesador de barril VLIW de un solo núcleo de 64 bits (compatible con el Socket 940 de 940 pines utilizado por los procesadores AMD Opteron ) con 128 flujos de hardware , en cada uno de los cuales se puede asignar un hilo de software (creando efectivamente 128 hilos de hardware por CPU), que funciona a 500 MHz y utiliza el conjunto de instrucciones MTA o un superconjunto del mismo. [ 7 ] [ 9 ] [ nb 1 ] Tiene un búfer de datos asociativo de 4 vías de 128 KB. Cada Threadstorm3 tiene 128 conjuntos de registros y contadores de programa separados (uno por cada flujo), que son bastante [ 10 ] completamente cambiados de contexto en cada ciclo. [ 5 ] Su rendimiento máximo estimado es de 1,5 GFLOPS . Tiene 3 unidades funcionales (memoria, multiplicación-suma fusionada y control), que reciben operaciones de la misma instrucción MTA y operan dentro del mismo ciclo. [ 7 ] Cada flujo tiene 32 registros de propósito general, 8 registros de destino y una palabra de estado, que contiene el contador de programa. [ 6 ] No es posible el control de alto nivel de la asignación de trabajos entre hilos. [ 5 ] [ nb 2 ] Debido a la longitud de la tubería de la MTA de 21, cada flujo se selecciona para ejecutar instrucciones nuevamente no antes de 21 ciclos después. [ 11 ] El TDP del paquete del procesador es de 30 W. [ 12 ] 

Debido a su cambio de contexto a nivel de hilo en cada ciclo, el rendimiento de las CPU Threadstorm no está limitado por el tiempo de acceso a la memoria. En un modelo simplificado, en cada ciclo de reloj se ejecuta una instrucción de uno de los hilos y se pone en cola otra solicitud de memoria, con la certeza de que para cuando la siguiente ronda de ejecución esté lista, los datos solicitados ya habrán llegado. [ 13 ] Esto es contrario a muchas arquitecturas convencionales que se detienen en el acceso a la memoria. La arquitectura destaca en esquemas de recorrido de datos donde el acceso a la memoria posterior no se puede predecir fácilmente y, por lo tanto, no sería adecuada para un modelo de caché convencional. [ 1 ] El arquitecto principal de Threadstorm fue Burton J. Smith . [ 1 ]

Cray XMT2

Cray XMT2 [ 3 ] (también "XMT de próxima generación" [ 8 ] o simplemente XMT [ 6 ] ) es una supercomputadora de memoria compartida multihilo escalable de Cray , basada en la cuarta generación de la arquitectura Tera MTA . [ 5 ] Presentada en 2011, reemplaza a Cray XMT, que tenía problemas con puntos calientes de memoria. [ 8 ] Utiliza CPU Threadstorm4 dentro de blades Cray XT5 y aumenta la capacidad de memoria ocho veces a 512 TB y el ancho de banda de memoria tres veces (300 MHz en lugar de 200 MHz) en comparación con XMT al usar el doble de módulos de memoria por nodo y DDR2. [ 6 ] [ 8 ] Introduce la conexión entre Threadstorm Node Pair Link, así como nodos solo de memoria, con paquetes Threadstorm4 con sus componentes CPU y HyperTransport 1.x deshabilitados. [ 5 ] El modelo subyacente de memoria direccionable de contenido aleatorio se ha heredado de XMT. XMT2 utiliza 2 bits EMS adicionales ( lleno/vacío y extendido ) en lugar de 4 como en XMT.  

Threadstorm4

Threadstorm4 (también "Threadstorm IV" [ 1 ] y "Threadstorm 4.0" [ nb 3 ] ) es un procesador de barril VLIW de un solo núcleo de 64 bits (compatible con el Socket F de 1207 pines utilizado por los procesadores AMD Opteron ) con 128 flujos de hardware, muy similar a su predecesor, Threadstorm3. Cuenta con un controlador de memoria mejorado, compatible con DDR2 y 8 registros de trampa adicionales por flujo. Cray decidió intencionadamente no utilizar un controlador DDR3, citando la reutilización de la infraestructura existente de Cray XT5 [ nb 4 ] y una longitud de ráfaga más corta que la de DDR3. [ nb 5 ] Aunque la mayor longitud de ráfaga podría compensarse con velocidades más altas de DDR3, también requeriría más energía, algo que los ingenieros de Cray querían evitar. [ 8 ]

Escorpión

Tras el lanzamiento de XMT, Cray investigó una posible variante multinúcleo del Threadstorm3, denominada Scorpio . Se conservarían la mayoría de las características del Threadstorm3, incluyendo la multiplexación de múltiples flujos de hardware en una tubería de ejecución y la implementación de bits de estado adicionales para cada palabra de memoria de 64 bits. Posteriormente, Cray abandonó Scorpio, y el proyecto no llegó a fabricarse ningún chip. [ 3 ]

Futuro

El desarrollo de Threadstorm4, así como de toda la arquitectura MTA, finalizó silenciosamente después de XMT2, probablemente debido a la competencia de procesadores genéricos como el Intel Xeon [ 14 ] y posiblemente el Xeon Phi , aunque Cray nunca descontinuó oficialmente ni XMT ni XMT2. A partir de 2020, Cray eliminó toda la documentación para clientes sobre XMT y XMT2 de su catálogo en línea.

Usuarios

Cray XMT2 fue adquirido por varios laboratorios federales e instalaciones académicas, así como por algunos clientes comerciales de HPC: por ejemplo, CSCS (2 TB de memoria global con 64 CPU Threadstorm4), [ 15 ] Noblis CAHPC. [ 16 ] La mayoría de los sistemas basados ​​en XMT y XMT2 fueron desmantelados para 2020.

Notas

  1. El ISA Tera MTA es de código cerrado y solo debido a una presentación en un taller que afirmaba la retrocompatibilidad con sistemas MTA anteriores, el ISA utilizado en las CPU Threadstorm no puede ser un subconjunto del ISA MTA.
  2. Aunque se desconoce si es posible a nivel de instrucción.
  3. En el paquete físico.
  4. Aunque el Cray XT6 basado en DDR3 se lanzó en 2009, dos años antes que el XMT2.
  5. Dado que Cray XMT opera principalmente con accesos aleatorios de una sola palabra de 8 bytes y tiene un canal de memoria de 128 bits, con una longitud de ráfaga DDR2 de 4, la sobrecarga habitual es de 56 bytes. DDR3, con su longitud de ráfaga de 8, aumentaría la sobrecarga habitual a 120 bytes.

Referencias

  1. 1 2 3 4 5 "¿Por qué uRiKA es tan rápido en consultas orientadas a grafos?" . Blog de YarcData . 14 de noviembre de 2012. Archivado del original el 14 de febrero de 2015.
  2. 1 2 3 4 Feo, John; Harper, David; Kahan, Simon; Konecny, Petr (2005). "Eldorado" . Actas de la 2.ª conferencia sobre fronteras de la computación - CF '05 . Ischia, Italia: ACM Press. p. 28. doi : 10.1145/1062261.1062268 . ISBN  978-1-59593-019-4.
  3. 1 2 3 4 5 6 Padua, David, ed. (2011). Enciclopedia de Computación Paralela . Boston, MA: Springer US. pp. 453–457 , 2033. doi : 10.1007/978-0-387-09766-4 . ISBN  978-0-387-09765-7.
  4. Mizell, David; Maschhoff, Kristyn (2009). «Primeras experiencias con sistemas Cray XMT a gran escala». Simposio Internacional IEEE de Procesamiento Paralelo y Distribuido de 2009. págs. 1–9 . doi : 10.1109/IPDPS.2009.5161108 . ISBN  978-1-4244-3751-1. S2CID 1964042 . 
  5. 1 2 3 4 5 6 7 8 Maltby, James (2012). Modelo de programación multihilo Cray XMT . "Uso de la próxima generación de Cray XMT (uRiKA) para análisis de datos a gran escala". Centro Nacional Suizo de Supercomputación .
  6. 1 2 3 4 Descripción general del sistema Cray XMT™ (S-2466-201) (PDF) . Cray . 2011. Archivado (PDF) del original el 3 de diciembre de 2012. Recuperado el 12 de mayo de 2020 .
  7. 1 2 3 4 Konecny, Petr (2011). Presentación del Cray XMT (PDF) . Cray.
  8. 1 2 3 4 5 Kopser A, Vollrath D (mayo de 2011). Descripción general de la próxima generación de Cray XMT (PDF) . 53.ª reunión del Grupo de Usuarios de Cray, CUG 2011. Fairbanks , Alaska . Recuperado el 14 de febrero de 2015 .
  9. Programación del Cray XMT (PDF) . Cray. 2012. pág. 14. 
  10. Carter, Larry & Feo, John & Snavely, Allan. (2002). Performance and Programming Experience on the Tera MTA .
  11. Snavely, A.; Carter, L.; Boisseau, J.; Majumdar, A.; Kang Su Gatlin; Mitchell, N.; Feo, J.; Koblenz, B. (1998). "Rendimiento de multiprocesadores en el Tera MTA". Actas de la Conferencia IEEE/ACM SC98 . Orlando, FL, EE. UU.: IEEE. pág. 4. doi : 10.1109/SC.1998.10049 . ISBN  978-0-8186-8707-5. S2CID 8258396 . 
  12. Folleto de Cray XMT (PDF) . Cray . 2005. Archivado del original (PDF) el 24 de diciembre de 2016.
  13. Nieplocha J, Marquez A, Petrini F, Chavarria-Miranda D (2007). "Arquitecturas no convencionales para ciencias de alto rendimiento" (PDF) . SciDAC Review (5, otoño de 2007). Laboratorio Nacional del Noroeste del Pacífico : 46–50 . Archivado del original (PDF) el 14 de febrero de 2015. Recuperado el 14 de febrero de 2015 .
  14. "El CTO de Cray conecta los puntos sobre las interconexiones futuras" . The Next Platform . 8 de enero de 2016. Consultado el 2 de mayo de 2016. Steve Scott: Se puede hacer perfectamente con un Xeon. No tenemos previsto lanzar otro procesador ThreadStorm. Pero sí requiere cierta tecnología de software derivada del legado de ThreadStorm.
  15. "CSCS Matterhorn" . Centro Nacional Suizo de Supercomputación .
  16. Sorin, Nita (16 de diciembre de 2011). "Cray presenta la supercomputadora XMT impulsada por sus propias CPU de 128 hilos" . Softpedia News .