Articulo de referencia

Célula (procesador)

{{Cite web |date=November 16, 2005 |title=PowerPC Architecture Book, Version 2.02 |url=https://www.ibm.com/developerworks/systems/library/es-archguide-v2.html |archive-url=https...

El Cell Broadband Engine (Cell/BE) es un procesador multinúcleo y microarquitectura de arquitectura RISC ( computadora con conjunto de instrucciones reducido ) de 64 bits desarrollado por Sony , Toshiba e IBM , una alianza conocida como "STI". Combina varios elementos: un núcleo PowerPC de propósito general , denominado Power Processing Element (PPE); y múltiples coprocesadores especializados , conocidos como Synergistic Processing Elements (SPE), que aceleran tareas como el procesamiento multimedia y vectorial . [ 2 ]

La arquitectura se desarrolló durante cuatro años, comenzando en marzo de 2001, con Sony reportando un presupuesto de desarrollo de aproximadamente US$ 400 millones . [ 3 ] Su primera aplicación comercial importante fue en la consola de videojuegos doméstica PlayStation 3 (PS3) de Sony , lanzada en 2006. En 2008, una versión modificada del procesador Cell impulsó el Roadrunner de IBM , la primera supercomputadora en lograr un rendimiento sostenido de un petaFLOPS . Otras aplicaciones incluyen sistemas de computación de alto rendimiento de Mercury Computer Systems y placas de sistemas de arcade especializados .

Cell enfatiza la coherencia de la memoria , la eficiencia energética y el rendimiento computacional máximo , pero su diseño presentó desafíos significativos para el desarrollo de software. [ 4 ] IBM ofreció un kit de desarrollo de software (SDK) basado en Linux para facilitar la programación en la plataforma. [ 5 ]

Historia

Cell/BE tal como aparece en la placa base de la PlayStation 3 (PS3).
Arquitectos principales del procesador Cell

A mediados de la década de 2000, Sony, Toshiba e IBM formaron la alianza STI para desarrollar un nuevo microprocesador. [ 6 ] El Centro de Diseño de STI abrió sus puertas en marzo de 2001 en Austin, Texas. Durante los siguientes cuatro años, más de 400 ingenieros colaboraron en el proyecto, con IBM aportando trabajo desde once de sus centros de diseño. [ 7 ]

Las patentes iniciales describían una configuración con cuatro elementos de procesamiento de potencia (PPE), cada uno emparejado con ocho elementos de procesamiento sinérgico (SPE), para un rendimiento máximo teórico de 1 teraFLOPS. Sin embargo, finalmente solo se fabricó un diseño a escala reducida: un PPE con ocho SPE. [ 8 ]

La fabricación del chip Cell inicial comenzó en un proceso de silicio sobre aislante (SOI) de 90  nm (es decir, nodo litográfico). [ 8 ] En marzo de 2007, IBM cambió la producción a un proceso de 65 nm , [ 8 ] [ 9 ] seguido de un proceso de 45 nm anunciado en febrero de 2008. [ 10 ] La editora de videojuegos Bandai Namco Entertainment utilizó el procesador Cell en sus placas arcade Namco System 357 y 369.  

En mayo de 2008, IBM presentó el PowerXCell 8i , una variante de doble precisión del procesador Cell, utilizado en sistemas como la supercomputadora Roadrunner de IBM, la primera en alcanzar un petaFLOPS y la más rápida hasta finales de 2009. [ 11 ] [ 12 ]

IBM dejó de desarrollar variantes de Cell con mayor número de núcleos (como una versión de 32 APU) a finales de 2009, [ 13 ] [ 14 ] pero continúa brindando soporte a los productos existentes basados ​​en Cell. [ 15 ]

Comercialización

El 17 de mayo de 2005, Sony confirmó la configuración Cell utilizada en la PlayStation 3 : un PPE y siete SPE. [ 16 ] [ 17 ] [ 18 ] Para mejorar el rendimiento de fabricación , el procesador se fabrica inicialmente con ocho SPE. Después de la producción, cada chip se prueba y, si se encuentra un defecto en un SPE, se desactiva mediante recorte láser . Este enfoque minimiza el desperdicio al utilizar procesadores que de otro modo se desecharían. Incluso en chips sin defectos, un SPE se desactiva intencionalmente para garantizar la consistencia entre unidades. [ 19 ] [ 20 ] De los siete SPE operativos, seis están disponibles para que los desarrolladores los utilicen en juegos y aplicaciones, mientras que el séptimo está reservado para el sistema operativo de la consola. [ 20 ] El chip funciona a una velocidad de reloj de 3,2  GHz. [ 21 ] Sony también utilizó el Cell en su servidor de computación multimedia de alto rendimiento Zego .

El PPE admite multihilo simultáneo (SMT) y puede ejecutar dos hilos; cada SPE activo admite un hilo. En la configuración de PlayStation 3, el procesador Cell admite hasta nueve hilos.

El 28 de junio de 2005, IBM y Mercury Computer Systems anunciaron una asociación para utilizar procesadores Cell en sistemas embebidos para imágenes médicas , aplicaciones aeroespaciales y procesamiento sísmico , entre otras. [ 22 ] Mercury utiliza el procesador Cell completo con ocho SPE activos. Posteriormente, Mercury lanzó servidores blade y tarjetas aceleradoras PCI Express basadas en esta arquitectura. [ 23 ]

En 2006, IBM presentó el servidor blade QS20, que ofrece hasta 410  gigaFLOPS por módulo en rendimiento de precisión simple. El servidor blade QS22 , basado en el procesador PowerXCell 8i, se utilizó en la supercomputadora Roadrunner de IBM. [ 11 ] [ 12 ] El 8 de abril de 2008, Fixstars Corporation lanzó una tarjeta aceleradora PCI Express basada en el PowerXCell 8i. [ 23 ]

Según un exejecutivo de IBM, IBM planeaba que Apple trasladara su línea Mac al Cell antes de la transición a los procesadores Intel . [ 24 ]

Descripción general

El Cell Broadband Engine, o « Cell » como se le conoce más comúnmente, es un microprocesador diseñado como un híbrido entre procesadores de escritorio convencionales (como las familias Athlon 64 y Core 2 ) y procesadores de alto rendimiento más especializados (como las unidades de procesamiento gráfico [GPU] de NVIDIA y ATI ). Su nombre más largo indica su uso previsto: como componente en sistemas de distribución en línea actuales y futuros ; por lo tanto, puede utilizarse en pantallas de alta definición y equipos de grabación, así como en sistemas de HDTV . Además, el procesador puede ser adecuado para sistemas de imágenes digitales (por ejemplo, médicas y científicas) y simulación física (por ejemplo, modelado de ingeniería estructural y científica ). El procesador utilizado en la PlayStation 3 tiene 250 millones de transistores. [ 25 ]

En un análisis sencillo, el procesador Cell se puede dividir en cuatro componentes:

  • estructuras de entrada y salida externas
  • el procesador principal, llamado Power Processing Element (PPE), un núcleo PowerPC 2.02 de dos vías con multihilo simultáneo [ 26 ]
  • ocho coprocesadores totalmente funcionales denominados Elementos de Procesamiento Sinérgico (SPE)
  • un bus de datos circular especializado de alto ancho de banda que conecta el PPE, los elementos de entrada/salida y los SPE; este bus se denomina Bus de Interconexión de Elementos (EIB).

Para lograr el alto rendimiento necesario para tareas matemáticamente intensivas, como la decodificación/codificación de flujos MPEG , la generación o transformación de datos tridimensionales y el análisis de Fourier de datos, el procesador Cell combina los SPE y el PPE mediante un EIB para brindar acceso, a través de DMA (acceso directo a memoria) totalmente coherente con la caché , tanto a la memoria principal como al almacenamiento de datos externo. Para aprovechar al máximo el EIB y superponer el cálculo y la transferencia de datos, cada uno de los nueve elementos de procesamiento (es decir, PPE y SPE) está equipado con un motor DMA . Dado que las instrucciones de carga/almacenamiento del SPE solo pueden acceder a su propia memoria local de acceso rápido , cada SPE depende completamente de DMA para transferir datos desde y hacia la memoria principal y las memorias locales de otros SPE. Una operación DMA puede transferir uno o más bloques: ya sea un solo bloque de hasta 16 KB o una lista de 2 a 2048 bloques de este tipo. Una decisión de diseño importante en la arquitectura de la celda es el uso de DMA como medio central de transferencia de datos dentro del chip, con el objetivo de permitir la máxima asincronía y concurrencia en el procesamiento de datos dentro de un chip. [ 27 ] 

El PPE, capaz de ejecutar un sistema operativo convencional, controla los SPE; puede iniciar, detener, interrumpir y programar procesos que se ejecutan en ellos. Para ello, el PPE dispone de instrucciones adicionales para el control de los SPE. A diferencia de los SPE, el PPE puede leer y escribir en la memoria principal y en las memorias locales de los SPE mediante instrucciones estándar de carga/almacenamiento. Los SPE no son completamente autónomos: requieren la preparación del PPE antes de poder realizar cualquier tarea útil. La mayor parte de la potencia del sistema proviene de los SPE; por lo tanto, el uso de DMA para la transferencia de datos, junto con la limitada memoria local de cada SPE, supone un gran desafío para los desarrolladores de software que desean aprovechar al máximo la potencia del sistema. Esta situación exige una cuidadosa optimización manual de los programas para extraer el máximo rendimiento de esta unidad central de procesamiento (CPU).

La arquitectura PPE-and-bus incluye varios modos de funcionamiento, que proporcionan diferentes niveles de protección de memoria , lo que permite proteger áreas de memoria del acceso de procesos específicos que se ejecutan en los SPE o en el PPE.

Tanto el PPE como el SPE utilizan arquitecturas de procesadores RISC (conjunto de instrucciones reducido) con un formato de instrucción de 32 bits de ancho fijo. El PPE contiene un conjunto de registros de propósito general (GPR) de 64 bits, un conjunto de registros de punto flotante (FPR) de 64 bits y un conjunto de registros AltiVec de 128 bits . El SPE contiene únicamente registros de 128 bits. Estos pueden utilizarse para dos propósitos: tipos de datos escalares de entre 8 y 64 bits; o cálculos SIMD ( instrucción única, datos múltiples ) en diversos formatos de enteros y punto flotante. Las direcciones de memoria del sistema, tanto para el PPE como para el SPE, se expresan como valores de 64 bits. Las direcciones de almacenamiento local internas al procesador SPU (Unidad de Procesamiento Sinérgico) se expresan como una palabra de 32 bits. En la documentación relativa a Cell, una palabra siempre se interpreta como 32 bits, una palabra doble como 64 bits y una palabra cuádruple como 128 bits.

PowerXCell 8i

En 2008, IBM anunció una variante del Cell llamada PowerXCell 8i, [ 28 ] que está disponible en el servidor blade QS22 de IBM. El PowerXCell se fabrica en un proceso de 65 nm ; además, agrega soporte para hasta 32 GB de memoria DDR2 ( Double Data Rate 2 ) ranurada, así como mejora drásticamente el rendimiento de punto flotante de doble precisión en los SPE, de un pico de aproximadamente 12.8 mil millones de operaciones de punto flotante por segundo (GFLOPS) a 102.4 GFLOPS en total para ocho SPE; este es el mismo rendimiento máximo que el del procesador vectorial NEC SX-9 lanzado por la misma época. La supercomputadora IBM Roadrunner , la más rápida del mundo durante 2008-2009, constaba de 12,240 procesadores PowerXCell 8i, junto con 6,562 procesadores AMD Opteron . [ 29 ] Las supercomputadoras con procesador PowerXCell-8i también dominaron los 6 sistemas más "verdes" de la lista Green500 , con las supercomputadoras de mayor relación MFLOPS/vatio del mundo. [ 30 ] Además de su uso en la QS22 y otras supercomputadoras, el procesador PowerXCell también está disponible como acelerador en una tarjeta PCI Express y se utiliza como procesador central en el proyecto de supercomputadora QPACE .   

Dado que el PowerXCell 8i eliminó la interfaz de memoria Rambus, además de agregar interfaces de memoria DDR2 significativamente más grandes y SPE mejorados, fue necesario rediseñar el diseño del chip; esto resultó en un chip más grande y un empaquetado más grande. [ 31 ]

Arquitectura

Arquitectura del chip Cell

Aunque el chip Cell puede tener varias configuraciones diferentes, la configuración básica es un chip multinúcleo compuesto por un elemento de procesamiento de potencia (PPE) (a veces llamado "elemento de procesamiento" o "PE") y varios elementos de procesamiento sinérgico (SPE). [ 32 ] El PPE y los SPE están conectados entre sí por un bus interno de alta velocidad llamado "bus de interconexión de elementos" (EIB).

Elemento de procesamiento de energía (PPE)

Elemento de procesamiento de energía (PPE)

El PPE [ 33 ] [ 34 ] [ 35 ] es el núcleo de CPU basado en PowerPC , de doble emisión, en orden y multihilo simultáneo bidireccional ; tiene una tubería de 23 etapas que actúa como controlador para ocho SPE, que manejan la mayor parte de la carga de trabajo computacional. El PPE tiene capacidades limitadas de ejecución fuera de orden; puede realizar cargas fuera de orden y tiene tuberías de ejecución retardada. El PPE funcionará con sistemas operativos convencionales debido a su similitud con otros procesadores PowerPC de 64 bits, mientras que los SPE están diseñados para la ejecución de código de punto flotante vectorizado. El PPE contiene una caché de instrucciones de nivel 1 de 32 KiB ; una caché de datos de nivel 1 de 32 KiB; y una caché de nivel 2 de 512 KiB. El tamaño de una línea de caché es de 128 bytes en todas las cachés. [ 28 ] : 136–137, 141 Además, IBM ha incluido los siguientes elementos:

El PPE consta de tres unidades principales: una unidad de instrucción (IU), una unidad de ejecución (XU) y una unidad de ejecución vectorial/escalar (VSU). La IU contiene una caché de instrucciones L1, hardware de predicción de bifurcaciones, búferes de instrucciones y lógica de comprobación de dependencias. La XU contiene unidades de ejecución de enteros (FXU) y una unidad de carga-almacenamiento (LSU). La VSU contiene todos los recursos de ejecución para FPU y VMX. Cada PPE puede completar dos operaciones de doble precisión por ciclo de reloj utilizando una instrucción escalar de multiplicación-suma fusionada, lo que se traduce en 6,4 GFLOPS a 3,2 GHz; u ocho operaciones de precisión simple por ciclo de reloj con una instrucción vectorial de multiplicación-suma fusionada, lo que se traduce en 25,6 GFLOPS a 3,2 GHz. [ 37 ]    

Xenon en Xbox 360

El PPE fue diseñado específicamente para el procesador Cell, pero durante su desarrollo, Microsoft se acercó a IBM solicitando un núcleo de procesador de alto rendimiento para la Xbox 360. IBM aceptó y construyó el procesador Xenon de tres núcleos , basado en una versión ligeramente modificada del PPE con extensiones VMX128 añadidas. [ 38 ] [ 39 ]

Elemento de Procesamiento Sinérgico (SPE)

Elemento de Procesamiento Sinérgico (SPE)

Cada SPE es un procesador de doble emisión en orden compuesto por una Unidad de Procesamiento Sinérgico (SPU) [ 40 ] y un Controlador de Flujo de Memoria (MFC) ( DMA , MMU e interfaz de bus ). Los SPE no tienen hardware de predicción de bifurcaciones (por lo tanto, una gran carga recae sobre el compilador). [ 41 ] Cada SPE tiene seis unidades de ejecución divididas entre pipelines pares e impares en cada SPE: La SPU ejecuta una arquitectura de conjunto de instrucciones (ISA) especialmente desarrollada con organización SIMD de 128 bits [ 36 ] [ 2 ] [ 42 ] para instrucciones de precisión simple y doble. Con la generación actual de Cell, cada SPE contiene una memoria de acceso aleatorio estática (SRAM) integrada de 256 KiB para instrucciones y datos, llamada "Almacenamiento Local" (que es diferente de "Memoria Local" en los documentos de Sony que se refieren a la memoria de acceso aleatorio de vídeo [VRAM]); esto es visible para el PPE y puede ser direccionado directamente por software. Cada SPE admite hasta 4 GiB de memoria de almacenamiento local. El almacenamiento local no funciona como una caché de CPU convencional , ya que no es transparente para el software y no contiene estructuras de hardware que predigan qué datos cargar. Los SPE contienen un archivo de registros de 128 bits y 128 entradas , y miden 14,5 mm² en un proceso de 90 nm. Un SPE puede operar con dieciséis enteros de 8 bits, ocho enteros de 16 bits, cuatro enteros de 32 bits o cuatro números de coma flotante de precisión simple en un solo ciclo de reloj, además de una operación de memoria. Es fundamental destacar que la SPU no puede acceder directamente a la memoria del sistema; las direcciones de memoria virtual de 64 bits formadas por la SPU deben pasarse desde la SPU al controlador de flujo de memoria del SPE para configurar una operación DMA dentro del espacio de direcciones del sistema.  

En un escenario de uso típico, el sistema carga los SPE con pequeños programas (similares a hilos ), encadenándolos para gestionar cada paso de una operación compleja. Por ejemplo, un decodificador podría cargar programas para la lectura de DVD, la decodificación de vídeo y audio, y la visualización; luego, los datos se transferirían de un SPE a otro hasta llegar finalmente al televisor. Otra posibilidad es particionar el conjunto de datos de entrada y que varios SPE realicen el mismo tipo de operación en paralelo. A 3,2  GHz, cada SPE ofrece un rendimiento teórico de precisión simple de 25,6 GFLOPS .

En comparación con sus contemporáneos de computadoras personales , el rendimiento general de punto flotante relativamente alto de un procesador Cell aparentemente empequeñece las capacidades de la unidad SIMD en CPUs como el Pentium 4 y el Athlon 64. Sin embargo, comparar solo las capacidades de punto flotante de un sistema es una métrica unidimensional y específica de la aplicación. A diferencia de un procesador Cell, estas CPUs de escritorio son más adecuadas para el software de propósito general que se suele ejecutar en computadoras personales. Además de ejecutar múltiples instrucciones por ciclo de reloj, los procesadores de Intel y AMD cuentan con predictores de bifurcación . El Cell está diseñado para compensar esto mediante la asistencia del compilador, en la que se crean instrucciones de preparación para bifurcación. Para operaciones de punto flotante de doble precisión, como las que se usan a veces en computadoras personales y a menudo en computación científica, el rendimiento del Cell se reduce en un orden de magnitud, pero aún alcanza los 20,8  GFLOPS (1,8  GFLOPS por SPE y 6,4  GFLOPS por PPE). La variante PowerXCell 8i, diseñada específicamente para doble precisión, alcanza 102,4  GFLOPS en cálculos de doble precisión. [ 43 ]

Las pruebas realizadas por IBM muestran que los SPE pueden alcanzar el 98 % de su rendimiento máximo teórico al ejecutar multiplicaciones de matrices paralelas optimizadas. [ 37 ]

Toshiba ha desarrollado un coprocesador alimentado por cuatro SPE pero sin PPE, llamado SpursEngine , que está diseñado para acelerar los efectos 3D y cinematográficos en la electrónica de consumo.

Cada SPE tiene una memoria local de 256  KB. [ 44 ] En total, los SPE tienen 2  MB de memoria local.

Bus de interconexión de elementos (EIB)

El EIB es un bus de comunicación interno del procesador Cell que conecta los distintos elementos del sistema integrados en el chip: el procesador PPE, el controlador de memoria (MIC), los ocho coprocesadores SPE y dos interfaces de E/S externas, para un total de doce participantes en la configuración de PlayStation 3. (El número de SPU puede variar en aplicaciones industriales). El EIB también incluye una unidad de arbitraje, que funciona como un sistema de semáforos. En algunos documentos, IBM se refiere a los participantes del EIB como «unidades».

El EIB se implementa como un anillo circular que consta de cuatro canales unidireccionales de 16 bytes de ancho que giran en sentido contrario en pares. Cuando los patrones de tráfico lo permiten, cada canal puede transmitir hasta tres transacciones concurrentes. Como el EIB funciona a la mitad de la velocidad del reloj del sistema, la velocidad efectiva del canal es de 16 bytes cada dos ciclos de reloj del sistema. En la concurrencia máxima , con tres transacciones activas en cada uno de los cuatro anillos, el ancho de banda instantáneo máximo del EIB es de 96 bytes por ciclo de reloj (12 transacciones concurrentes × 16 bytes de ancho / 2 ciclos de reloj del sistema por transferencia). Si bien esta cifra se cita a menudo en la literatura de IBM, no es realista simplemente escalar este número por la velocidad del reloj del procesador. La unidad de arbitraje impone restricciones adicionales .

David Krolak , ingeniero sénior de IBM y diseñador principal del EIB, explicó el modelo de concurrencia de la siguiente manera:

Un anillo puede iniciar una nueva operación cada tres ciclos. Cada transferencia siempre toma ocho tiempos. Esa fue una de las simplificaciones que hicimos; está optimizado para transmitir grandes cantidades de datos. Si se realizan operaciones pequeñas, no funciona tan bien. Si imaginamos trenes de ocho vagones circulando por esta vía, siempre que no choquen entre sí, pueden coexistir en la vía. [ 45 ]

Cada participante en el EIB tiene un puerto de lectura de 16 bytes y un puerto de escritura de 16 bytes. El límite para un solo participante es leer y escribir a una velocidad de 16 bytes por ciclo de reloj del EIB (para simplificar, a menudo se considera como 8 bytes por ciclo de reloj del sistema). Cada procesador SPU contiene una cola de gestión DMA dedicada que puede programar largas secuencias de transacciones a varios puntos finales sin interferir con los cálculos en curso de la SPU; estas colas DMA se pueden gestionar local o remotamente, lo que proporciona flexibilidad adicional en el modelo de control.

Los datos fluyen por un canal EIB paso a paso alrededor del anillo. Dado que hay doce participantes, el número total de pasos alrededor del canal hasta el punto de origen es doce. Seis pasos es la distancia máxima entre cualquier par de participantes. Un canal EIB no puede transmitir datos que requieran más de seis pasos; dichos datos deben tomar la ruta más corta alrededor del círculo en la dirección opuesta. El número de pasos involucrados en el envío del paquete tiene poco impacto en la latencia de transferencia: la velocidad de reloj que impulsa los pasos es rápida en comparación con otras consideraciones. Sin embargo, las distancias de comunicación más largas son perjudiciales para el rendimiento general del EIB porque reducen la concurrencia disponible.

A pesar del deseo inicial de IBM de implementar la EIB como una matriz de conmutación más potente, la configuración circular que adoptó la compañía para ahorrar recursos rara vez representa un factor limitante en el rendimiento del chip Cell en su conjunto. En el peor de los casos, el programador debe tener especial cuidado al planificar los patrones de comunicación para que la EIB pueda funcionar con altos niveles de concurrencia.

David Krolak explicó esta situación de la siguiente manera:

Bueno, al principio, en las primeras etapas del desarrollo, varias personas abogaban por un conmutador de barra transversal, y la forma en que está diseñado el bus, de hecho, se podría extraer el EIB e instalar un conmutador de barra transversal si se estuviera dispuesto a dedicar más espacio de silicio en el chip al cableado. Tuvimos que encontrar un equilibrio entre conectividad y área, y simplemente no había suficiente espacio para instalar un conmutador de barra transversal completo. Así que ideamos esta estructura de anillo, que creemos que es muy interesante. Se ajusta a las limitaciones de área y aún así tiene un ancho de banda impresionante. [ 45 ]

Evaluación del ancho de banda

A 3,2  GHz, cada canal fluye a una velocidad de 25,6  GB/s. Si se considera el EIB de forma aislada de los elementos del sistema que conecta, lograr doce transacciones concurrentes a esta velocidad de flujo resulta en un ancho de banda abstracto del EIB de 307,2  GB/s. Según esta perspectiva, muchas publicaciones de IBM describen el ancho de banda disponible del EIB como "superior a 300  GB/s". Esta cifra refleja el ancho de banda instantáneo máximo del EIB escalado por la frecuencia del procesador. [ 46 ]

Sin embargo, existen otras restricciones técnicas en el mecanismo de arbitraje para los paquetes aceptados en el bus. El grupo IBM Systems Performance lo explicó de la siguiente manera:

Cada unidad en el EIB puede enviar y recibir simultáneamente 16 bytes de datos por ciclo de bus. El ancho de banda máximo de datos de todo el EIB está limitado por la tasa máxima a la que se rastrean las direcciones en todas las unidades del sistema, que es una por ciclo de bus. Dado que cada solicitud de dirección rastreada puede transferir potencialmente hasta 128 bytes, el ancho de banda de datos máximo teórico en el EIB a 3,2  GHz es 128B x 1,6  GHz = 204,8  GB/s. [ 37 ]

Esta explicación aparentemente representa la totalidad de la divulgación pública de IBM sobre este mecanismo y su impacto. Varios temas —la unidad de arbitraje EIB, el mecanismo de espionaje y la generación de interrupciones por fallos de traducción de segmentos o páginas— no están bien descritos en la documentación que IBM ha hecho pública hasta la fecha.

En la práctica, el ancho de banda efectivo de EIB también puede verse limitado por los participantes del anillo. Si bien cada uno de los nueve núcleos de procesamiento puede soportar 25,6  GB/s de lectura y escritura simultáneamente, el controlador de interfaz de memoria (MIC) está conectado a un par de canales de memoria XDR que permiten un flujo máximo de 25,6  GB/s para lecturas y escrituras combinadas; además, se documenta que los dos controladores de entrada/salida (E/S) admiten una velocidad de entrada combinada máxima de 25,6  GB/s y una velocidad de salida combinada máxima de 35  GB/s.

Para aumentar la confusión, algunas publicaciones antiguas citan el ancho de banda de EIB asumiendo una  frecuencia de reloj del sistema de 4 GHz. Este marco de referencia da como resultado un ancho de banda instantáneo de EIB de 384  GB/s y un ancho de banda limitado por arbitraje de 256  GB/s.

En definitiva, la  cifra teórica de 204,8 GB/s, la más citada, es la que conviene tener en cuenta. El grupo IBM Systems Performance ha demostrado que los flujos de datos centrados en la SPU alcanzan los 197  GB/s en un procesador Cell que funciona a 3,2  GHz, por lo que esta cifra también refleja bastante bien la práctica. [ 37 ]

Controladores de memoria y E/S

La celda contiene una macro Rambus XIO de doble canal que se conecta a la memoria Rambus XDR. El controlador de interfaz de memoria (MIC) es independiente de la macro XIO y fue diseñado por IBM. El enlace XIO-XDR funciona a 3,2  Gbit/s por pin. Dos canales de 32 bits pueden proporcionar un máximo teórico de 25,6  GB/s.

La interfaz de E/S, también diseñada por Rambus, se conoce como FlexIO . Esta interfaz está organizada en doce carriles, cada uno de los cuales es una ruta punto a punto unidireccional de 8 bits de ancho. Cinco de estas rutas son de entrada a Cell, mientras que las siete restantes son de salida. Esta interfaz proporciona un ancho de banda máximo teórico de 62,4  GB/s (36,4  GB/s de salida y 26  GB/s de entrada) a 2,6  GHz. La interfaz FlexIO puede funcionar de forma independiente, normalmente a 3,2  GHz. Cuatro carriles de entrada y cuatro de salida admiten coherencia de memoria.

Aplicaciones

Tarjeta de procesamiento de vídeo

Algunas compañías, como Leadtek , han lanzado tarjetas PCI Express basadas en Cell para permitir la transcodificación "más rápida que en tiempo real" de vídeo H.264 , MPEG-2 y MPEG-4 . [ 47 ]

Servidor blade

El 29 de agosto de 2007, IBM anunció el servidor BladeCenter QS21. Generando 1050 millones de operaciones de coma flotante por segundo (gigaFLOPS) por vatio, con un rendimiento máximo de aproximadamente 460  gigaFLOPS, es una de las plataformas informáticas más eficientes energéticamente hasta la fecha. Un único chasis BladeCenter puede realizar 6,4 billones de operaciones de coma flotante por segundo (teraFLOPS) y más de 25,8  teraFLOPS en un rack estándar de 42U. [ 48 ]

El 13 de mayo de 2008, IBM anunció el servidor BladeCenter QS22. El QS22 incorpora el procesador PowerXCell 8i con un rendimiento de coma flotante de doble precisión cinco veces superior al del QS21, así como capacidad para hasta 32  GB de memoria DDR2 en el blade. [ 49 ]

IBM descontinuó la línea de servidores Blade basados ​​en procesadores Cell a partir del 12 de enero de 2012. [ 50 ]

Placa PCI Express

Varias empresas ofrecen tarjetas PCI Express que utilizan el IBM PowerXCell 8i. Su rendimiento se reporta en 179,2  GFLOPS (SP), 89,6  GFLOPS (DP) a 2,8  GHz. [ 51 ] [ 52 ]

videojuegos de consola

La consola de videojuegos PlayStation 3 de Sony fue la primera aplicación de producción del procesador Cell, con una frecuencia de 3,2 GHz y que contenía siete de los ocho SPE operativos, lo que permitió a Sony aumentar el rendimiento en la fabricación de procesadores. Solo seis de los siete SPE son accesibles para los desarrolladores, ya que uno está reservado por el sistema operativo. [ 53 ] 

Debido a su herencia de PlayStation 3, el hardware arcade Namco System 357 también utilizaba el procesador Cell.

cine en casa

Tarjetas de la compañía B-CAS en un decodificador Toshiba Cell Regza, basado en el procesador Cell Broadband Engine.

Toshiba ha fabricado televisores de alta definición (HDTV) utilizando la tecnología Cell. La compañía presentó un sistema para decodificar simultáneamente 48 transmisiones MPEG-2 de definición estándar en una pantalla de 1920x1080 . [ 54 ] [ 55 ] Esta decodificación permite al espectador elegir un canal a partir de decenas de vídeos en miniatura que se muestran simultáneamente en la pantalla.

Ordenadores portátiles

Toshiba lanzó el portátil Qosmio G55 en 2008, que incorpora tecnología Cell. La CPU del portátil es un chip Intel Core x86 , como es habitual en los ordenadores Toshiba . [ 56 ]

Supercomputación

La supercomputadora de IBM, IBM Roadrunner , era un híbrido de procesadores Opteron x86-64 de propósito general y procesadores Cell. Este sistema ocupó el primer puesto en la lista Top 500 de junio de 2008 como la primera supercomputadora en funcionar a velocidades de petaFLOPS , habiendo alcanzado una velocidad sostenida de 1,026 petaFLOPS utilizando la prueba de rendimiento estándar LINPACK . La IBM Roadrunner utilizaba la versión PowerXCell 8i del procesador Cell; fue fabricada con  tecnología de 65 nm y contenía SPU mejoradas que podían manejar cálculos de doble precisión en los registros de 128 bits, alcanzando 102 GFLOPs de doble precisión  por chip. [ 57 ] [ 58 ]

computación en clúster

Los clústeres de consolas PlayStation 3 (PS3) son una alternativa atractiva a los sistemas de gama alta basados ​​en servidores Cell. El Laboratorio de Computación Innovadora, un grupo dirigido por Jack Dongarra en el Departamento de Ciencias de la Computación de la Universidad de Tennessee, investigó a fondo dicha aplicación. [ 59 ] Terrasoft Solutions vende clústeres de PS3 de 8 y 32 nodos con Yellow Dog Linux preinstalado; estos clústeres son una implementación de la investigación de Dongarra.

Como informó por primera vez la revista Wired el 17 de octubre de 2007, [ 60 ] el astrofísico Gaurav Khanna, del departamento de Física de la Universidad de Massachusetts Dartmouth , implementó una novedosa aplicación del uso de PS3 en una configuración de clúster ; en su lugar, reemplazó el tiempo en supercomputadoras con tiempo en un clúster de ocho PS3. La siguiente generación de esta máquina, llamada PlayStation 3 Gravity Grid , utiliza una red de 16 máquinas y aprovecha el procesador Cell para la aplicación objetivo: la coalescencia de agujeros negros binarios mediante la teoría de perturbaciones . Específicamente, el clúster realiza simulaciones astrofísicas de grandes agujeros negros supermasivos que capturan objetos compactos más pequeños; ha generado datos numéricos que se han publicado varias veces en la literatura de investigación científica. [ 61 ] La versión del procesador Cell utilizada por la PS3 tiene una CPU principal y 6 SPE disponibles para el usuario, lo que le da a la máquina Gravity Grid un total de 16 procesadores de propósito general y 96 procesadores vectoriales. La máquina tiene un costo único de $9,000 para construir, y es adecuada para simulaciones de agujeros negros que de otro modo costarían $6,000 por ejecución en una supercomputadora convencional. Los cálculos de agujeros negros no son intensivos en memoria y son altamente localizables, por lo que son muy adecuados para esta arquitectura. Khanna afirma que el rendimiento del clúster supera al de un clúster Linux tradicional basado en más de 100 núcleos Intel Xeon en sus simulaciones. La PS3 Gravity Grid atrajo una atención mediática significativa en 2007, [ 62 ] 2008, [ 63 ] [ 64 ] 2009, [ 65 ] [ 66 ] [ 67 ] y 2010. [ 68 ] [ 69 ]

En 2007, el laboratorio de bioquímica y biofísica computacional de la Universitat Pompeu Fabra (en Barcelona ) desplegó un sistema Berkeley Open Infrastructure for Network Computing ( BOINC ) llamado PS3GRID [ 70 ] para computación colaborativa basada en el software CellMD, el primero diseñado específicamente para el procesador Cell.

El Laboratorio de Investigación de la Fuerza Aérea de los Estados Unidos ha desplegado un clúster de PlayStation 3 de más de 1700 unidades, apodado "Clúster Cóndor", para analizar imágenes satelitales de alta resolución . La Fuerza Aérea afirma que el Clúster Cóndor sería la 33.ª supercomputadora más grande del mundo en términos de capacidad. [ 71 ] El laboratorio ha puesto la supercomputadora a disposición de las universidades para su uso con fines de investigación. [ 72 ]

computación distribuida

Gracias a la potencia de cálculo de más de medio millón de consolas PlayStation 3, el proyecto de computación distribuida Folding@home ha sido reconocido por el Libro Guinness de los Récords como la red distribuida más potente del mundo. El primer récord se alcanzó el 16 de septiembre de 2007, cuando el proyecto superó un petaFLOPS , una cifra que ninguna otra red de computación distribuida había logrado hasta entonces. Además, el esfuerzo colectivo permitió que las PS3 por sí solas alcanzaran la marca de los petaFLOPS el 23 de septiembre de 2007. En comparación, el segundo superordenador más potente del mundo en aquel momento, el Blue Gene/L de IBM , alcanzaba unos 478,2  teraFLOPS; esto significa que la potencia de cálculo de Folding@home es aproximadamente el doble que la del Blue Gene/L (aunque la interconexión de la CPU en el Blue Gene/L es más de un millón de veces más rápida que la velocidad media de la red en Folding@home). A fecha de 7 de mayo de 2011, Folding@home funciona a unos 9,3 petaFLOPS x86, con 26.000 PS3 activas generando 1,6  petaFLOPS.

Computadoras centrales

IBM anunció el 25 de abril de 2007 que comenzaría a integrar sus microprocesadores basados ​​en la arquitectura Cell Broadband Engine en la línea de mainframes System z de la compañía. [ 73 ] Este trabajo ha dado como resultado un gameframe (un sistema informático híbrido).

descifrado de contraseñas

La arquitectura del procesador Cell lo hace más adecuado para aplicaciones de ataques de fuerza bruta criptográficos asistidos por hardware que los procesadores convencionales. [ 74 ]

Ingeniería de software

Debido a la naturaleza flexible de la celda, existen varias posibilidades para utilizar sus recursos, no limitadas a diferentes paradigmas de computación. [ 75 ]

Cola de trabajos

El PPE mantiene una cola de trabajos, programa los trabajos en los SPE y supervisa el progreso. Cada SPE ejecuta un "mini kernel" cuya función es obtener un trabajo, ejecutarlo y sincronizarse con el PPE.

Multitarea autónoma de los SPE

El mini-núcleo y la planificación se distribuyen entre las SPE. Las tareas se sincronizan mediante exclusión mutua (mutex) o semáforos , como en un sistema operativo convencional . Las tareas listas para ejecutarse esperan en una cola a que una SPE las ejecute. En esta configuración, las SPE utilizan memoria compartida para todas las tareas.

Procesamiento de flujos

Cada SPE ejecuta un programa distinto. Los datos provienen de un flujo de entrada y se envían a los SPE. Cuando un SPE finaliza su procesamiento, los datos de salida se envían a un flujo de salida.

Esta configuración proporciona una arquitectura flexible y potente para el procesamiento de flujos de datos , y permite la planificación explícita de cada SPE por separado. Otros procesadores también pueden realizar tareas de procesamiento de flujos de datos, pero están limitados por el núcleo cargado.

Desarrollo de software de código abierto

En 2005, desarrolladores de IBM enviaron parches para habilitar la compatibilidad con Cell en el kernel de Linux. [ 76 ] Uno de los desarrolladores de parches, Arnd Bergmann, describió la arquitectura Cell basada en Linux en la conferencia LinuxTag 2005. [ 77 ] A partir de la versión 2.6.16 (el 20 de marzo de 2006), el kernel de Linux admite oficialmente el procesador Cell. [ 78 ]

Los PPE y SPE son programables en C y C++ utilizando una API común proporcionada por bibliotecas.

La empresa Fixstars Solutions proporciona Yellow Dog Linux para sistemas basados ​​en IBM y Mercury Cell, así como para PlayStation 3. [ 79 ] Terra Soft se asoció estratégicamente con Mercury para proporcionar un paquete de soporte de placa Linux para Cell, además de soporte y desarrollo de aplicaciones de software en otras plataformas Cell; estas incluían IBM BladeCenter JS21 y Cell QS20, así como soluciones basadas en Mercury Cell. [ 80 ] Terra Soft también mantiene dos conjuntos de herramientas: la suite de construcción y gestión de clústeres Y-HPC (High-Performance Computing) y las herramientas de secuenciación genética Y-Bio. Y-Bio se basa en el estándar RPM Linux para la gestión de paquetes y ofrece herramientas que ayudan a los investigadores de bioinformática a realizar su trabajo de manera más eficiente. [ 81 ] IBM ha desarrollado un pseudo-sistema de archivos para Linux llamado "spufs" (como en "sistema de archivos SPU"; cf. el sistema de archivos de procesos "procfs"); simplifica el acceso y el uso de los recursos SPE. IBM mantiene el kernel de Linux y los puertos de GDB , mientras que Sony mantiene el conjunto de herramientas GNU ( GCC y binutils ). [ 82 ] [ 83 ]

En noviembre de 2005, IBM publicó en su sitio web el "Kit de desarrollo de software Cell Broadband Engine (CBE) versión 1.0", que consta de un simulador y diversas herramientas. Las versiones de desarrollo del kernel y las herramientas más recientes para la distribución Fedora Core 4 Linux se mantienen en el sitio web del Centro de Supercomputación de Barcelona . [ 84 ]

En agosto de 2007, Mercury Computer Systems lanzó un SDK para PlayStation 3 para admitir computación de alto rendimiento. [ 85 ]

En noviembre de 2007, Fixstars Corporation lanzó el nuevo módulo "CVCell", con el objetivo de acelerar varias API importantes de OpenCV  para Cell. En una serie de pruebas de cálculo de software, la compañía registró tiempos de ejecución en un procesador Cell de 3,2 GHz que eran entre 6 y 27 veces más rápidos que el mismo software ejecutándose en un  procesador Intel Core 2 Duo de 2,4 GHz. [ 86 ]

En octubre de 2009, IBM lanzó un controlador OpenCL para el procesador POWER6 y el CBE. Este controlador permite ejecutar fácilmente en Cell PSE programas escritos en la API multiplataforma. [ 87 ]

Ilustraciones de las diferentes generaciones de procesadores Cell/BE y del PowerXCell 8i. Las imágenes no están a escala; todos los encapsulados Cell/BE miden 42,5  ×  42,5  mm, y el PowerXCell 8i mide 47,5  ×  47,5  mm.

Véase también

Notas

Referencias

  1. "PowerPC Architecture Book, Versión 2.02" . IBM . 16 de noviembre de 2005. Archivado del original el 29 de noviembre de 2020.
  2. 1 2 Gschwind, Michael; Hofstee, H. Peter ; Flachs, Brian; Hopkins, Martin; Watanabe, Yukio; Yamazaki, Takeshi (marzo-abril de 2006). "Procesamiento sinérgico en la arquitectura multinúcleo de Cell" (PDF) . IEEE Micro . 26 (2). IEEE: 10–24 . Bibcode : 2006IMicr..26b..10G . doi : 10.1109/MM.2006.41 . S2CID 17834015 . 
  3. "Cell Designer habla sobre PS3 y los procesadores IBM Cell" . Archivado del original el 21 de agosto de 2006. Consultado el 22 de marzo de 2007 .
  4. Shankland, Stephen (22 de febrero de 2006). "Octopiler busca armar a los programadores de Cell" . CNET . Consultado el 22 de marzo de 2007 .
  5. "Kit de desarrollo de software Cell Broadband Engine Versión 1.0" . LWN. 10 de noviembre de 2005. Consultado el 22 de marzo de 2007 .
  6. Krewell, Kevin (14 de febrero de 2005). "Cell entra en el centro de atención". Microprocessor Report .
  7. "Introducción al multiprocesador Cell" . IBM Journal of Research and Development. 7 de agosto de 2005. Archivado del original el 28 de febrero de 2007. Consultado el 22 de marzo de 2007 .
  8. 1 2 3 "IBM produce un procesador celular utilizando una nueva tecnología de fabricación" . X-bit labs. Archivado del original el 15 de marzo de 2007. Recuperado el 12 de marzo de 2007 .
  9. "Comienza la producción del procesador CELL de 65 nm" . PlayStation Universe. 30 de enero de 2007. Archivado del original el 2 de febrero de 2007. Consultado el 18 de mayo de 2007 .
  10. "Sony responde a nuestras preguntas sobre la nueva PlayStation 3" . Ars Technica . 18 de agosto de 2009. Consultado el 19 de agosto de 2009 .
  11. 1 2 Gaudin, Sharon (9 de junio de 2008). "El Roadrunner de IBM rompe el récord de 4 minutos en la milla de supercomputación" . Computerworld . Archivado del original el 24 de diciembre de 2008. Recuperado el 10 de junio de 2008 .
  12. 1 2 Fildes, Jonathan (9 de junio de 2008). "Supercomputadora establece ritmo de petaflop" . BBC News . Recuperado el 9 de junio de 2008 .
  13. "¿Será el Correcaminos el último gran momento de la célula?" . 27 de octubre de 2009. Archivado del original el 31 de octubre de 2009.
  14. ^ "SC09: IBM lässt Cell-Prozessor auslaufen" . Heise en línea . 20 de noviembre de 2009 . Consultado el 21 de noviembre de 2009 .
  15. "IBM no ha detenido el desarrollo del procesador Cell" . DriverHeaven.net. 23 de noviembre de 2009. Archivado del original el 25 de noviembre de 2009. Consultado el 24 de noviembre de 2009 .
  16. "Introducción a las celdas" (PDF) . IBM. Archivado del original (PDF) el 26 de marzo de 2009. Consultado el 14 de enero de 2008 .
  17. Roper, Chris (17 de mayo de 2005). "E3 2005: Demostraciones de tecnología de procesadores celulares" . IGN . Consultado el 22 de marzo de 2007 .
  18. Becker, David (7 de febrero de 2005). "El chip de PlayStation 3 tiene doble personalidad" . CNET . Consultado el 18 de mayo de 2007 .
  19. "Procesador Cell de Sony PlayStation 3" . Universidad Estatal de Carolina del Norte. Archivado del original el 4 de diciembre de 2007. Consultado el 14 de enero de 2008 .
  20. 1 2 Linklater, Martin. "Optimizing Cell Code". Game Developer Magazine, abril de 2007. págs. 15–18 . Para aumentar el rendimiento de fabricación, Sony envía los procesadores Cell de PlayStation 3 con solo siete SPE funcionales. Y de esos siete, un SPE será utilizado por el sistema operativo para diversas tareas. Esto deja seis SPE para que los programadores de juegos los utilicen. 
  21. Thurrott, Paul (17 de mayo de 2005). "Sony sube la apuesta con PlayStation 3" . WindowsITPro. Archivado del original el 30 de septiembre de 2007. Consultado el 22 de marzo de 2007 .
  22. "Mercury gana el premio IBM PartnerWorld Beacon" . Supercomputing Online. 12 de abril de 2007. Consultado el 18 de mayo de 2007 .
  23. 1 2 "Fixstars lanza una placa aceleradora con el PowerXCell 8i" . Fixstars Corporation. 8 de abril de 2008. Archivado del original el 5 de enero de 2009. Consultado el 18 de agosto de 2008 .
  24. Crothers, Brooke (14 de junio de 2009). "Cuatro años después: ¿Por qué Apple abandonó PowerPC?" . CNET . Archivado del original el 1 de abril de 2013. Recuperado el 23 de mayo de 2026 .
  25. "Una mirada al interior del procesador celular" . Gamasutra . 13 de julio de 2006. Consultado el 19 de junio de 2019 .
  26. Koranne, Sandeep (15 de julio de 2009). «Capítulo 2: El elemento de procesamiento de potencia (PPE)» . Computación práctica en el motor de banda ancha celular . Springer Science+Business Media . pág. 17. doi : 10.1007/978-1-4419-0308-2_2 . ISBN  978-1-4419-0307-5.
  27. Gschwind, Michael (2006). "Multiprocesamiento en chip y el motor de banda ancha celular" . Actas de la 3.ª conferencia sobre fronteras de la computación - CF '06 . ACM. págs. 1–8 . doi : 10.1145/1128022.1128023 . ISBN  1595933026. S2CID 14226551 . Consultado el 29 de junio de 2008 . 
  28. 1 2 Manual de programación del motor de banda ancha Cell que incluye el procesador PowerXCell 8i (PDF) . Versión 1.11. IBM . 12 de mayo de 2008. Archivado del original (PDF) el 11 de marzo de 2018. Consultado el 10 de marzo de 2018 .
  29. "IBM anuncia PowerXCell 8i, servidor blade QS22" . Beyond3D. Mayo de 2008. Archivado del original el 16 de junio de 2008. Consultado el 10 de junio de 2008 .
  30. "La lista Green500 - Noviembre de 2009" . Archivado del original el 23 de febrero de 2011.
  31. "Empaquetado del microprocesador Cell Broadband Engine para aplicaciones de supercomputadoras" (PDF) . Archivado del original (PDF) el 4 de enero de 2014. Consultado el 4 de enero de 2014 .
  32. "Informe sobre el microprocesador Cell" . IBM, Sony Computer Entertainment Inc., Toshiba Corp. 7 de febrero de 2005.
  33. 1 2 Kim, Hyesoon (Primavera de 2011). "CS4803DGC Diseño y programación de consola de juegos" (PDF) .
  34. Koranne, Sandeep (2009). Computación práctica en el Cell Broadband Engine . Springer Science+Business Media. pág. 19. ISBN  9781441903082.
  35. Hofstee, H. Peter (2005). "Todo sobre el procesador celular" (PDF) . Archivado del original (PDF) el 6 de septiembre de 2011.
  36. 1 2 "Diseño de procesadores de bajo consumo energético y el procesador Cell" (PDF) . IBM. 16 de febrero de 2005. Archivado del original (PDF) el 26 de abril de 2005. Recuperado el 12 de junio de 2005 .
  37. 1 2 3 4 Chen, Thomas; Raghavan, Ram; Dale, Jason; Iwata, Eiji (29 de noviembre de 2005). "Arquitectura del motor de banda ancha celular y su primera implementación" . IBM developerWorks . Archivado del original el 27 de octubre de 2012. Recuperado el 9 de septiembre de 2012 .
  38. Alexander, Leigh (16 de enero de 2009). "Procesando la verdad: una entrevista con David Shippy" . Gamasutra .
  39. Por último, Jonathan V. (30 de diciembre de 2008). "Haciendo el tonto" . Wall Street Journal .
  40. Especificación de la interfaz binaria de la aplicación SPU (PDF) . 18 de julio de 2008. Archivado del original (PDF) el 18 de noviembre de 2014. Consultado el 24 de enero de 2015 .
  41. "IBM Research - Cell" . IBM . Archivado del original el 14 de junio de 2005. Consultado el 11 de junio de 2005 .
  42. "Una nueva arquitectura SIMD para el chip multiprocesador heterogéneo Cell" (PDF) . Hot Chips 17. 15 de agosto de 2005. Archivado del original (PDF) el 9 de julio de 2008. Consultado el 1 de enero de 2006 .
  43. "Sucesor de celda con modo turbo - PowerXCell 8i" . PPCNux. Noviembre de 2007. Archivado del original el 10 de enero de 2009. Consultado el 10 de junio de 2008 .
  44. "Soporte para OpenMP en Cell" (PDF) . IBM T. J Watson Research . Archivado del original (PDF) el 8 de enero de 2019.
  45. 1 2 "Conozca a los expertos: David Krolak sobre el bus Cell Broadband Engine EIB" . IBM. 6 de diciembre de 2005. Recuperado el 18 de marzo de 2007 .
  46. "Red de comunicación multiprocesador celular: diseñada para la velocidad" (PDF) . IEEE. Archivado del original (PDF) el 7 de enero de 2007. Consultado el 22 de marzo de 2007 .
  47. "Tarjeta de transcodificación Leadtek PxVC1100 MPEG-2/H.264" . 12 de noviembre de 2009.
  48. "IBM redobla su apuesta por Cell Blade" (Comunicado de prensa). Armonk, Nueva York: IBM . 29 de agosto de 2007. Consultado el 19 de julio de 2017 .
  49. "IBM ofrece computación de alto rendimiento fuera del laboratorio" (Comunicado de prensa). Armonk, Nueva York: IBM . 13 de mayo de 2008. Consultado el 19 de julio de 2017 .
  50. Morgan, Timothy Prickett (28 de junio de 2011). "IBM dejará de fabricar el último servidor blade Cell" . The Register . Consultado el 19 de julio de 2017 .
  51. "Comunicado de prensa de Fixstars" . Archivado del original el 5 de enero de 2009. Consultado el 18 de agosto de 2008 .
  52. "Tarjeta coprocesadora basada en celdas ejecuta Linux" . Archivado del original el 2 de mayo de 2009.
  53. Martin Linklater. "Optimizing Cell Core". Game Developer Magazine, abril de 2007 , págs. 15-18 . Para aumentar el rendimiento de fabricación, Sony distribuye los procesadores Cell de PlayStation 3 con solo siete SPE funcionales. De esos siete, un SPE será utilizado por el sistema operativo para diversas tareas. Esto deja seis SPE y un PPE disponibles para los programadores de juegos. 
  54. "Toshiba demuestra la capacidad de un microprocesador Cell para decodificar simultáneamente 48 flujos MPEG-2" . Tech-On!. 25 de abril de 2005.
  55. "Ganador: Monstruo Multimedia" . IEEE Spectrum . 1 de enero de 2006. Archivado del original el 18 de enero de 2006. Consultado el 22 de enero de 2006 .
  56. Eaton, Kit (15 de julio de 2008). "Toshiba Qosmio G55 es el primer portátil con procesador Cell integrado" . Gizmodo . Consultado el 22 de noviembre de 2024 .
  57. "Más allá de una sola célula" (PDF) . Laboratorio Nacional de Los Alamos. Archivado del original (PDF) el 8 de julio de 2009. Consultado el 6 de abril de 2017 .
  58. Williams, Samuel; Shalf, John; Oliker, Leonid; Husbands, Parry; Kamil, Shoaib; Yelick, Katherine (2005). "El potencial del procesador Cell para la computación científica" . ACM Computing Frontiers . Recuperado el 6 de abril de 2017 .
  59. "SCOP3: Una guía básica para la computación científica en PlayStation 3" (PDF) . Departamento de Ciencias de la Computación, Universidad de Tennessee. Archivado del original (PDF) el 15 de octubre de 2008. Consultado el 8 de mayo de 2007 .
  60. Gardiner, Bryan (17 de octubre de 2007). "Astrofísico reemplaza supercomputadora con ocho PlayStation 3" . Wired . Consultado el 17 de octubre de 2007 .
  61. "PS3 Gravity Grid" . Gaurav Khanna, Profesor Asociado, Facultad de Ingeniería, Universidad de Massachusetts Dartmouth.
  62. Gaudin, Sharon (24 de octubre de 2007). "Un clúster de PS3 crea una supercomputadora casera y más barata" . Computerworld . Archivado del original el 5 de agosto de 2011. Recuperado el 22 de noviembre de 2010 .
  63. Highfield, Roger (17 de febrero de 2008). «Por qué a los científicos les encantan las consolas de videojuegos» . The Daily Telegraph . Londres. Archivado del original el 6 de septiembre de 2009.
  64. Peckham, Matt (23 de diciembre de 2008). "Nada escapa al atractivo de una PlayStation 3, ni siquiera un agujero negro" . The Washington Post .
  65. Malik, Tariq (28 de enero de 2009). "Las consolas Playstation 3 abordan las vibraciones de los agujeros negros" . Space.com .
  66. Lyden, Jacki (21 de febrero de 2009). "Playstation 3: ¿Una supercomputadora de descuento?" . NPR .
  67. Wallich, Paul (1 de abril de 2009). "La supercomputadora se vuelve personal" . IEEE Spectrum .
  68. "La supercomputadora con tecnología PlayStation" . BBC News . 4 de septiembre de 2010.
  69. Farrell, John (12 de noviembre de 2010). "Agujeros negros y bucles cuánticos: más que un simple juego" . Forbes .
  70. "PS3GRID.net" .
  71. "El Departamento de Defensa analiza la nueva supercomputadora Sony PlayStation" . 30 de noviembre de 2010.
  72. "Clústeres de PlayStation 3 que proporcionan supercomputación de bajo costo a las universidades" . Archivado del original el 14 de mayo de 2013.
  73. "Los mainframes de IBM se vuelven 3D" . eWeek . 26 de abril de 2007. Consultado el 18 de mayo de 2007 .
  74. "PlayStation acelera la investigación de contraseñas" . BBC News . 30 de noviembre de 2007. Consultado el 17 de enero de 2011 .
  75. "CELL: Una nueva plataforma para el entretenimiento digital" . Sony Computer Entertainment Inc. 9 de marzo de 2005. Archivado del original el 28 de octubre de 2005.
  76. Bergmann, Arnd (21 de junio de 2005). "ppc64: Introducción a la plataforma Cell/BPA, v3" . Recuperado el 22 de marzo de 2007 .
  77. "El modelo de programación del procesador celular" . LinuxTag 2005. Archivado del original el 18 de noviembre de 2005. Consultado el 11 de junio de 2005 .
  78. Shankland, Stephen (21 de marzo de 2006). "Linux obtiene soporte integrado para el procesador Cell" . CNET . Consultado el 22 de marzo de 2007 .
  79. "Terra Soft proporcionará Linux para PLAYSTATION3" . Archivado del original el 30 de marzo de 2009.
  80. "Linux para Cell, PlayStation PS3, QS20, QS21, QS22, IBM System p, Mercury Cell y Apple PowerPC" . Terra Soft . Archivado del original el 23 de febrero de 2007.
  81. "Y-Bio" . 31 de agosto de 2007. Archivado del original el 2 de septiembre de 2007.
  82. "Arnd Bergmann sobre la célula" . IBM developerWorks. 25 de junio de 2005.
  83. Gschwind, Michael; Erb, David; Manning, Sid; Nutter, Mark (junio de 2007). "Un entorno de código abierto para el software del sistema Cell Broadband Engine". IEEE Computer . 40 (6): 37– 47. Bibcode : 2007Compr..40f..37G . doi : 10.1109/MC.2007.192 .
  84. "Linux en sistemas basados ​​en Cell BE" . Centro de Supercomputación de Barcelona. Archivado del original el 8 de marzo de 2007. Consultado el 22 de marzo de 2007 .
  85. «Mercury Computer Systems lanza un kit de desarrollo de software para PLAYSTATION(R)3 para computación de alto rendimiento» (Comunicado de prensa). Mercury Computer Systems. 3 de agosto de 2007. Archivado del original el 18 de agosto de 2007.
  86. ""CVCell" - Módulo desarrollado por Fixstars que acelera la biblioteca OpenCV para el procesador Cell/BE . Fixstars Corporation. 28 de noviembre de 2007. Archivado del original el 17 de julio de 2010. Consultado el 12 de diciembre de 2008 .
  87. "IBM lanza controladores OpenCL para POWER6 y Cell/BE" The Khronos Group . 2 de septiembre de 2023.
  • Centro de recursos de Cell Broadband Engine
  • Página de recursos de Cell de Sony Computer Entertainment Incorporated
  • Kit de desarrollo multiprocesador configurable Cmpware para Cell BE
  • ISSCC 2005: El microprocesador CELL, una descripción general completa de la microarquitectura CELL.
  • ¡Santo Chip!
  • El pequeño motor de banda ancha que podría
  • Presentación del procesador celular IBM/Sony/Toshiba — Parte I: las unidades de procesamiento SIMD
  • Presentación del procesador Cell de IBM/Sony/Toshiba - Parte II: La arquitectura Cell
  • El alma de la célula: una entrevista con el Dr. H. Peter Hofstee