vLLM es un marco de software de código abierto para la inferencia y el servicio de grandes modelos de lenguaje y modelos multimodales relacionados . Desarrollado originalmente en el Sky Computing Lab de la Universidad de California, Berkeley , [ 1 ] el proyecto se centra en PagedAttention , un método de gestión de memoria para cachés de clave-valor de transformadores , y admite características como el procesamiento por lotes continuo, la inferencia distribuida , la cuantización y las API compatibles con OpenAI . [ 2 ] [ 3 ] [ 4 ]
Historia
vLLM fue presentado en 2023 por investigadores afiliados al Sky Computing Lab en UC Berkeley. [ 3 ] [ 2 ] Sus ideas centrales fueron descritas en el artículo de 2023 Efficient Memory Management for Large Language Model Serving with PagedAttention , [ 5 ] que presentó el sistema como un motor de servicio de alto rendimiento y memoria eficiente para modelos de lenguaje grandes . [ 3 ]
Según un responsable del proyecto , la "v" en vLLM originalmente se refería a "virtual", inspirada en la memoria virtual . [ 6 ]
La página del proyecto PyTorch indica que la Universidad de California, Berkeley, contribuyó con vLLM a la Fundación Linux en julio de 2024. [ 7 ] [ 4 ] En 2025, la Fundación PyTorch anunció que vLLM se había convertido en un proyecto alojado por la Fundación.
En enero de 2026, TechCrunch informó que los creadores de vLLM habían lanzado la startup Inferact para comercializar el proyecto, recaudando 150 millones de dólares en financiación inicial. [ 8 ]
Arquitectura
Según su artículo de 2023, vLLM fue diseñado para mejorar la eficiencia del servicio de modelos de lenguaje grandes al reducir el desperdicio de memoria en la caché clave-valor utilizada durante la inferencia del transformador . [ 3 ] El artículo presentó PagedAttention , un algoritmo inspirado en la memoria virtual y las técnicas de paginación en los sistemas operativos , y describió vLLM como un método que utiliza la administración de memoria a nivel de bloque y la programación de solicitudes para aumentar el rendimiento manteniendo una latencia similar . [ 3 ]
La documentación y el repositorio del proyecto describen la compatibilidad con el procesamiento por lotes continuo, el prellenado por fragmentos, la decodificación especulativa , el almacenamiento en caché de prefijos, la cuantización y múltiples formas de inferencia distribuida . [ 2 ] [ 4 ] PyTorch ha descrito vLLM como un motor de inferencia y servicio de alto rendimiento y eficiente en memoria que admite una variedad de backends de hardware, incluidas GPU NVIDIA y AMD , TPU de Google , AWS Trainium y procesadores Intel . [ 7 ] [ 4 ]
Véase también
- Escasez mundial de suministro de memorias desde 2025 hasta la actualidad
- SGLang
- TensorRT-LLM
- llama.cpp
- OpenVINO
- Intercambio abierto de redes neuronales
- Comparación de software de aprendizaje profundo
- Comparación de software de aprendizaje automático
- Lista de software desarrollado en universidades
- Listados de software de inteligencia artificial de código abierto
Referencias
- ↑ "vLLM: un motor de inferencia y servicio de alto rendimiento y memoria eficiente para LLM" . UC Berkeley, Sky Computing Lab.
- 1 2 3 "GitHub - vllm-project/vllm: Un motor de inferencia y servicio de alto rendimiento y memoria eficiente para LLM" . GitHub . GitHub, Inc. Recuperado el 22 de abril de 2026 .
- 1 2 3 4 5 Kwon, Woosuk; Li, Zhuohan; Zhuang, Siyuan; Sheng, Ying; Zheng, Lianmin; Yu, Cody Hao; Gonzalez, Joseph E.; Zhang, Hao; Stoica, Ion (2023). Gestión eficiente de memoria para el servicio de modelos de lenguaje grandes con PagedAttention . Actas del 29.º Simposio ACM SIGOPS sobre Principios de Sistemas Operativos . Recuperado el 22 de abril de 2026 .
- 1 2 3 4 "vLLM" . PyTorch . Fundación PyTorch . Consultado el 22 de abril de 2026 .
- ↑ Kwon, Woosuk; Li, Zhuohan; Zhuang, Siyuan; Sheng, Ying; Zheng, Lianmin; Yu, Cody Hao; Gonzalez, Joseph E.; Zhang, Hao; Stoica, Ion (12 de septiembre de 2023). "Gestión eficiente de la memoria para el servicio de modelos de lenguaje grandes con PagedAttention". arXiv : 2309.06180 [ cs.LG ].
- ↑ "vLLM nombre completo" . GitHub . GitHub, Inc. 23 de agosto de 2023. Consultado el 22 de abril de 2026 .
- 1 2 "La Fundación PyTorch da la bienvenida a vLLM como proyecto alojado" . PyTorch . Fundación PyTorch. 7 de mayo de 2025. Recuperado el 22 de abril de 2026 .
- ↑ Temkin, Marina (22 de enero de 2026). "La startup de inferencia Inferact consigue 150 millones de dólares para comercializar vLLM" . TechCrunch . Consultado el 22 de abril de 2026 .
Enlaces externos
- vLLM en NVIDIA NGC
- Página del proyecto vLLM en PyTorch
- Modelos de lenguaje a gran escala
- Software de procesamiento del lenguaje natural
- Software libre programado en Python
- Software de la década de 2020