Articulo de referencia

TensorRT

{{URL|https://github.com/NVIDIA/TensorRT-LLM}}"},"website":{"wt":"{{URL|https://developer.nvidia.com/tensorrt}}"}},"i":0}}]}"> TensorRT es un kit de desarrollo de software (SDK)...

TensorRT es un kit de desarrollo de software (SDK) y un entorno de ejecución de optimización de inferencia desarrollado por Nvidia para implementar modelos de aprendizaje profundo y aprendizaje automático entrenados en unidades de procesamiento gráfico (GPU). [ 1 ] [ 2 ] Puede importar modelos de marcos como PyTorch , TensorFlow y ONNX , y compilarlos en motores de ejecución optimizados para inferencia de baja latencia y alto rendimiento . [ 1 ] [ 2 ]

En la documentación actual de Nvidia, el nombre TensorRT también se utiliza para una familia de productos más amplia que incluye el SDK principal de TensorRT, TensorRT-LLM y TensorRT-RTX. [ 3 ] El SDK principal es principalmente un producto propietario de Nvidia, aunque Nvidia también mantiene repositorios de código abierto de TensorRT con licencia Apache y proyectos complementarios relacionados. [ 4 ] [ 5 ]

Historia

TensorRT estaba disponible como parte del conjunto de software de aprendizaje profundo de Nvidia en 2017, cuando se describió como un motor de inferencia de alto rendimiento para implementar redes neuronales entrenadas en GPU de Nvidia. [ 6 ] En 2018, Google anunció la integración de Nvidia TensorRT con TensorFlow 1.7, describiendo TensorRT como una biblioteca que optimiza los modelos de aprendizaje profundo para la inferencia y crea un entorno de ejecución para su implementación en GPU en entornos de producción. [ 7 ]

Descripción general

El núcleo de TensorRT es una biblioteca de C++ que toma una red entrenada, compuesta por una definición de red y parámetros entrenados, y produce un motor de ejecución altamente optimizado para la inferencia en GPU de Nvidia. [ 2 ] TensorRT proporciona API tanto para C++ como para Python , y los modelos pueden expresarse directamente a través de su API de definición de red o importarse a través de su analizador ONNX . [ 2 ]

Según la documentación de Nvidia, TensorRT realiza optimizaciones a nivel de grafo y de núcleo , como la fusión de capas y la selección de implementaciones eficientes para las operaciones compatibles. [ 2 ] La documentación actual también describe la compatibilidad con formas dinámicas, modos de ejecución de precisión mixta, incluidos FP32 , FP16 , BF16 , FP8 e INT8 , y optimizaciones especializadas para transformadores y cargas de trabajo de modelos de lenguaje grandes . [ 1 ]

Los motores TensorRT se pueden generar a través de las API de TensorRT o con la utilidad de línea de comandos trtexec . [ 8 ] La documentación de inicio rápido de Nvidia describe flujos de trabajo de implementación basados ​​en la conversión ONNX , las API de tiempo de ejecución y la deserialización directa del motor para aplicaciones C++ y Python. [ 8 ]

Licencias y componentes de código abierto

El modelo de licenciamiento de TensorRT se divide entre un SDK central propietario y un conjunto de repositorios y herramientas de código abierto. [ 4 ] [ 5 ] El software TensorRT empaquetado distribuido por Nvidia se rige por el Acuerdo de Licencia de Software de Nvidia. [ 4 ] Al mismo tiempo, Nvidia mantiene un repositorio público de TensorRT en GitHub bajo la Licencia Apache 2.0 . [ 5 ]

La documentación oficial de TensorRT también dirige a los usuarios al repositorio de software de código abierto de TensorRT para obtener código y ejemplos de inicio rápido. [ 8 ] La documentación de la arquitectura describe herramientas relacionadas, como Polygraphy para la depuración y el plegado de constantes, así como ONNX-GraphSurgeon para modificar gráficos ONNX antes de su implementación con TensorRT. [ 9 ] TensorRT también admite un mecanismo de complementos para capas personalizadas y operaciones no compatibles. [ 8 ]

Familia de productos

La documentación actual de Nvidia agrupa varios productos de inferencia bajo el nombre TensorRT. [ 3 ] En esa documentación, el SDK principal se distingue como TensorRT (Enterprise) , mientras que las ofertas relacionadas incluyen TensorRT-LLM para la inferencia de modelos de lenguaje grandes y TensorRT-RTX para las GPU RTX de consumo . [ 3 ]

TensorRT-LLM

TensorRT-LLM es un conjunto de herramientas de código abierto relacionado para optimizar y servir modelos de lenguaje grandes en GPU de Nvidia. [ 3 ] [ 10 ] Nvidia lo describe como un proveedor de una API de Python para definir LLM y construir motores TensorRT optimizados para cargas de trabajo LLM. [ 3 ] [ 10 ]

Según la documentación de la familia de productos de Nvidia, TensorRT-LLM admite la ejecución en múltiples GPU y nodos, el procesamiento por lotes en curso, el almacenamiento en caché de clave-valor paginado y métodos de cuantización como FP8 , INT8 e INT4 para un mayor rendimiento en la entrega de modelos. [ 3 ] El código fuente de TensorRT-LLM se publica en GitHub bajo la licencia Apache 2.0. [ 11 ]

Debido a que Nvidia documenta TensorRT-LLM como un miembro separado de la familia de productos TensorRT, generalmente se trata como un proyecto de software relacionado pero distinto en lugar de como una característica única del SDK base de TensorRT. [ 3 ]

Véase también

  • Documentación de TensorRT-LLM de Nvidia
  • Documentación para desarrolladores de TensorRT-LLM en GitHub

Referencias

  1. 1 2 3 "Documentación de NVIDIA TensorRT" . Documentación de NVIDIA . Consultado el 23 de abril de 2026 .
  2. 1 2 3 4 5 "Descripción general" . Documentación de NVIDIA . Consultado el 23 de abril de 2026 .
  3. 1 2 3 4 5 6 7 "Familia de productos NVIDIA TensorRT" . Documentación de NVIDIA . Consultado el 23 de abril de 2026 .
  4. 1 2 3 "TensorRT/python/packaging/frontend_sdist/LICENSE.txt en main" . GitHub . Consultado el 23 de abril de 2026 .
  5. 1 2 3 "TensorRT/LICENSE en main" . GitHub . Consultado el 23 de abril de 2026 .
  6. "NVIDIA en HPC e IA" (PDF) . Centro de Supercomputación de Ohio . Consultado el 23 de abril de 2026 .
  7. "Anuncio de la integración de TensorRT con TensorFlow 1.7" . Blog de desarrolladores de Google . 27 de marzo de 2018. Consultado el 23 de abril de 2026 .
  8. 1 2 3 4 "Guía de inicio rápido" . Documentación de NVIDIA . Consultado el 23 de abril de 2026 .
  9. "Descripción general de la arquitectura" . Documentación de NVIDIA . Consultado el 23 de abril de 2026 .
  10. 1 2 "NVIDIA/TensorRT-LLM" . GitHub . Consultado el 23 de abril de 2026 .
  11. "TensorRT-LLM/LICENSE en main" . GitHub . Consultado el 23 de abril de 2026 .