
Una unidad de procesamiento neuronal ( NPU ), también conocida como acelerador de IA o procesador de aprendizaje profundo , es una clase de acelerador de hardware especializado [ 1 ] o sistema informático [ 2 ] [ 3 ] diseñado para acelerar las aplicaciones de inteligencia artificial y aprendizaje automático , incluidas las redes neuronales artificiales y la visión artificial . La NPU puede ser independiente, parte de una CPU o parte de una GPU .
Usar
Su propósito es ejecutar de manera eficiente modelos de IA ya entrenados, como los LLM (inferencia), o entrenar modelos de IA. Las NPU pueden ser más eficientes en términos de velocidad o consumo de energía . [ 4 ]
Las aplicaciones de NPU incluyen algoritmos para robótica , Internet de las cosas y tareas intensivas en datos o basadas en sensores. [ 5 ] A menudo son diseños multinúcleo o espaciales y se centran en aritmética de baja precisión , arquitecturas de flujo de datos novedosas o capacidad de computación en memoria . A partir de 2024, un chip de circuito integrado de IA de grado centro de datos ampliamente utilizado , la GPU Nvidia H100 , contiene decenas de miles de millones de MOSFET . [ 6 ]
Dispositivos de consumo
Los aceleradores de IA se utilizan en los procesadores de teléfonos inteligentes Apple Silicon , Qualcomm , Samsung , Huawei [ 7 ] y Google Tensor [ 8 ] . Cuando se utilizan como parte de una GPU para la renderización de gráficos, pueden reducir significativamente el uso de recursos al permitir que las partes tradicionales de la GPU rendericen una escena a una resolución y velocidad de fotogramas mucho más bajas (por ejemplo, 540p a 30 fps) y luego utilicen un modelo de IA preentrenado en la NPU para convertir esa imagen base en una salida más suave y de mayor resolución (por ejemplo, 2160p a 240 fps) en tiempo real.
Las unidades de procesamiento visual son aceleradores especializados en algoritmos de visión artificial como CNN ( redes neuronales convolucionales ) y SIFT ( transformación de características invariantes a la escala ). Se utilizan en dispositivos que necesitan realizar un seguimiento visual de objetos, como los visores de realidad aumentada y los drones . [ 9 ] [ 10 ] [ 11 ]
Más recientemente (alrededor de 2017) se agregó a los procesadores de Apple [ 12 ] y (alrededor de 2022) a los procesadores de Intel [ 13 ] y AMD . [ 14 ] Todos los modelos de procesadores Intel Meteor Lake tienen una unidad de procesamiento versátil ( VPU ) integrada para acelerar la inferencia para visión artificial y aprendizaje profundo. [ 15 ]
En los dispositivos de consumo, la NPU está diseñada para ser pequeña, de bajo consumo energético , pero razonablemente rápida al ejecutar modelos pequeños. Para ello, está diseñada para admitir operaciones de bajo ancho de bits utilizando tipos de datos como INT4, INT8, FP8 y FP16 . Una métrica común son los billones de operaciones por segundo (TOPS). Aunque TOPS no especifica explícitamente el tipo de operaciones, normalmente se trata de sumas y multiplicaciones de INT8 . [ 16 ]
centros de datos

Los aceleradores se utilizan en servidores de computación en la nube : por ejemplo, unidades de procesamiento tensorial (TPU) para Google Cloud Platform , [ 17 ] y chips Trainium e Inferentia para Amazon Web Services . [ 18 ] Existen muchos términos específicos de proveedores para dispositivos en esta categoría, y es una tecnología emergente sin un diseño dominante .
Desde finales de la década de 2010, las unidades de procesamiento gráfico diseñadas por empresas como Nvidia y AMD suelen incluir hardware específico para IA en forma de unidades funcionales dedicadas a operaciones de multiplicación de matrices de baja precisión . Estas GPU se utilizan comúnmente como aceleradores de IA, tanto para entrenamiento como para inferencia . [ 19 ]
Computación científica
Aunque las NPU están diseñadas para operaciones de multiplicación de matrices de baja precisión (por ejemplo, FP16, INT8) , pueden usarse para emular multiplicaciones de matrices de mayor precisión en computación científica. Como las GPU modernas se centran en hacer que la parte de la NPU sea rápida, usar FP64 emulado (esquema Ozaki) en las NPU puede potencialmente superar a FP64 nativo. Esto se ha demostrado usando FP64 emulado en FP16 en NVIDIA TITAN RTX y usando FP64 emulado en INT8 en GPU de consumo de NVIDIA y la GPU A100. Las GPU de consumo se beneficiaron especialmente ya que tienen una capacidad de hardware FP64 limitada, mostrando una aceleración de 6×. [ 20 ] Desde CUDA Toolkit 13.0 Update 2, cu BLAS usa automáticamente la multiplicación de matrices FP64 emulada en INT8 de precisión equivalente si es más rápida que la nativa. Esto es adicional a la característica FP32 emulada en FP16 introducida en la versión 12.9. [ 21 ]
Programación
Un sistema operativo o una biblioteca de nivel superior pueden proporcionar interfaces de programación de aplicaciones como TensorFlow con LiteRT Next (Android), CoreML (iOS, macOS) o DirectML (Windows). Se utilizan formatos como ONNX para representar redes neuronales entrenadas.
Las NPU integradas en las CPU de consumo son accesibles a través de API específicas del proveedor. AMD ( Ryzen AI ), Intel ( OpenVINO ), Apple Silicon (CoreML) [ a ] y Qualcomm (SNPE) tienen cada uno sus propias API, sobre las cuales se puede construir una biblioteca de nivel superior.
Generalmente, las GPU utilizan arquitecturas GPGPU existentes , como CUDA y OpenCL, adaptadas para menor precisión y operaciones especializadas de multiplicación de matrices. También se utiliza Vulkan . Los sistemas personalizados, como la TPU de Google , utilizan interfaces privadas.
En el campo de la IA se utiliza una gran cantidad de API de aceleración subyacentes y compiladores/entornos de ejecución independientes, lo que provoca un gran aumento en el esfuerzo de desarrollo de software debido a las numerosas combinaciones involucradas. A partir de 2025, la organización de estándares abiertos Khronos Group está trabajando en la estandarización de las interfaces relacionadas con la IA para reducir la cantidad de trabajo necesario. Khronos trabaja en tres frentes distintos: la expansión de los tipos de datos y las operaciones intrínsecas en OpenCL y Vulkan, la inclusión de grafos de cómputo en SPIR-V y un formato de archivo NNEF /SkriptND para describir una red neuronal. [ 22 ]
Notas
- ↑ MLX se basa en las partes de CPU y GPU, no en la parte de Apple Neural Engine (ANE) de los chips Apple Silicon. El rendimiento relativamente bueno se debe al uso de un diseño de memoria unificada grande y rápida .
Véase también
- Computadora de software húmedo : computadora compuesta de material orgánico.
- Hardware de trazado de rayos : tipo de acelerador gráfico 3D
- Circuito integrado de aplicación específica : circuito integrado personalizado para una tarea específica.
Referencias
- ↑ Page, Carly (21 de julio de 2017). "Intel presenta el acelerador de IA USB Movidius Compute Stick" . V3 . Archivado del original el 11 de agosto de 2017. Recuperado el 11 de agosto de 2017 .
- ↑ "Inspur presenta el acelerador de IA GX4" . insideHPC . 21 de junio de 2017. Archivado del original el 21 de junio de 2017.
- ↑ Wiggers, Kyle (6 de noviembre de 2019). «Neural Magic recauda 15 millones de dólares para acelerar la inferencia de IA en procesadores comerciales» . VentureBeat . Archivado del original el 6 de marzo de 2020.
- ↑ "Intel Core vs Ultra: Cómo elegir (Guía completa)" . GEEKOM . 24 de marzo de 2025. Consultado el 5 de julio de 2026 .
- ↑ Merritt, Rick (18 de mayo de 2016). "Google diseña procesadores de IA" . EE Times . Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ Moss, Sebastian (23 de marzo de 2022). "Nvidia revela la nueva GPU Hopper H100, con 80 mil millones de transistores" . Data Center Dynamics . Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ "HUAWEI revela el futuro de la IA móvil en la IFA 2017" . HUAWEI Global . 2 de septiembre de 2017. Archivado del original el 10 de noviembre de 2021. Consultado el 28 de enero de 2024 .
- ↑ "Plataforma móvil Snapdragon 8 Gen 3" (PDF) . Archivado del original (PDF) el 25 de octubre de 2023.
- ↑ Weckler, Adrian (14 de febrero de 2016). «La empresa tecnológica dublinesa Movidius impulsará las nuevas gafas de realidad virtual de Google» . Independent.ie . Archivado del original el 19 de febrero de 2016. Consultado el 15 de marzo de 2016 .
- ↑ "DJI incorpora dos nuevos drones insignia a su catálogo, equipados con las unidades de procesamiento visual (VPU) Myriad 2 - Tecnología de visión artificial - Movidius" . Movidius . 15 de noviembre de 2016. Archivado del original el 26 de noviembre de 2016.
- ↑ O'Connor, Fred (1 de mayo de 2015). "Microsoft profundiza en los detalles de HoloLens: se revela el papel del 'procesador holográfico'" . PCWorld . Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ "El futuro ya está aquí: iPhone X" . Apple . 12 de septiembre de 2017. Consultado el 5 de julio de 2026 .
- ↑ "Los procesadores Lunar Lake de Intel llegarán en el tercer trimestre de 2024" . Intel . 20 de mayo de 2024. Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ "Arquitectura AMD XDNA™" . AMD . Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ Kan, Michael (1 de agosto de 2022). "Intel incorporará una unidad de procesamiento 'VPU' a los chips Meteor Lake de 14.ª generación" . PCMag . Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ Burns, Peter (24 de abril de 2024). "Una guía para las métricas de rendimiento de AI TOPS y NPU" . Qualcomm . Recuperado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ Jouppi, Norman P.; et al. (24 de junio de 2017). "Análisis del rendimiento en un centro de datos de una unidad de procesamiento tensorial" . ACM SIGARCH Computer Architecture News . 45 (2): 1– 12. arXiv : 1704.04760 . doi : 10.1145/3140659.3080246 .
- ↑ "Cómo la innovación en silicio se convirtió en el 'ingrediente secreto' del éxito de AWS" . Amazon Science . 27 de julio de 2022. Consultado el 5 de julio de 2026 .
- ↑ Patel, Dylan; Nishball, Daniel; Xie, Myron (9 de noviembre de 2023). "Los nuevos chips de IA de Nvidia en China eluden las restricciones de EE. UU. | H2O más rápido que H100 | Huawei Ascend 910B" . SemiAnalysis . Consultado el 5 de julio de 2026 .
- ↑ Ootomo, Hiroyuki; Ozaki, Katsuhisa; Yokota, Rio (julio de 2024). "DGEMM en la unidad de multiplicación de matrices enteras". The International Journal of High Performance Computing Applications . 38 (4): 297– 313. arXiv : 2306.11975 . doi : 10.1177/10943420241239588 .
- ↑ Brower, Cole; Gunnels, John; Lopez, Graham (24 de octubre de 2025). "Desbloqueando el rendimiento de Tensor Core con emulación de punto flotante en cuBLAS" . Blog técnico de NVIDIA . Consultado el 5 de julio de 2026 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ Tavenrath, Markus (2025). Estado actual de la estandarización relacionada con la IA en el Grupo Khronos (PDF) . Conferencia Global de Estándares TIC 2025.
Enlaces externos
- Nvidia pisa el acelerador a fondo con Pascal , la próxima plataforma.
- Proyecto Eyeriss , Instituto Tecnológico de Massachusetts
- Circuitos integrados de aplicación específica
- Unidades de procesamiento neuronal
- Coprocesadores
- Optimización informática
- matrices de puertas
- Aprendizaje profundo