SGLang (abreviatura de Structured Generation Language ) es un marco de código abierto para programar y servir modelos de lenguaje grandes y modelos multimodales . Fue introducido por investigadores afiliados a LMSYS [ 1 ] y otras instituciones como un sistema que combina un lenguaje integrado en Python para la generación estructurada con un entorno de ejecución para inferencia de alto rendimiento. [ 2 ] [ 3 ] [ 4 ]
El proyecto está diseñado para cargas de trabajo de inferencia de baja latencia y alto rendimiento, y su documentación describe la compatibilidad con características como salidas estructuradas, decodificación especulativa , procesamiento por lotes continuo, cuantización y compatibilidad con API de estilo OpenAI . [ 5 ]
Historia
SGLang fue presentado públicamente en enero de 2024 por investigadores afiliados a Stanford , UC Berkeley , Texas A&M y la Universidad Jiao Tong de Shanghái . [ 2 ] Su descripción académica apareció posteriormente en las actas de NeurIPS 2024. [ 3 ] En enero de 2026, TechCrunch informó que los colaboradores asociados al proyecto habían formado la startup RadixArk para comercializar servicios relacionados con SGLang mientras continuaban su desarrollo de código abierto. [ 6 ] [ 7 ]
Arquitectura
Según el artículo de NeurIPS , SGLang consta de dos componentes principales: un lenguaje de interfaz integrado en Python y un entorno de ejecución de back-end para ejecutar programas de modelos de lenguaje de manera eficiente. [ 3 ] La interfaz proporciona primitivas para la generación, selección y control de flujo paralelo, mientras que el entorno de ejecución utiliza un conjunto de optimizaciones destinadas a reducir los cálculos repetitivos y mejorar el rendimiento. [ 3 ]
Entre las técnicas descritas por el proyecto se encuentran RadixAttention para reutilizar el estado de caché clave-valor en múltiples llamadas de generación, máquinas de estados finitos comprimidas para una decodificación restringida más rápida y ejecución especulativa para modelos basados en API. [ 3 ] La documentación actual también describe la compatibilidad para servir modelos de lenguaje y modelos multimodales en una variedad de backends de hardware. [ 5 ]
Véase también
Referencias
- ↑ "LMSYS" . GitHub . GitHub, Inc. Consultado el 22 de abril de 2026 .
- 1 2 "Inferencia LLM rápida y expresiva con RadixAttention y SGLang" . LMSYS Org . 17 de enero de 2024. Recuperado el 19 de abril de 2026 .
- 1 2 3 4 5 Zheng, Lianmin; Yin, Liangsheng; Xie, Zhiqiang; Sol, Chuyue; Huang, Jeff; Yu, Cody Hao; Cao, Shiyi; Kozyrakis, Christos; Estoica, Ion; González, José E.; Barrett, Clark; Sheng, Ying (2024). SGLang: Ejecución eficiente de programas modelo de lenguaje estructurado (PDF) . Avances en los sistemas de procesamiento de información neuronal 37 . Consultado el 19 de abril de 2026 .
- ↑ "SGLang" . UC Berkeley Sky Computing Lab . 25 de abril de 2024. Consultado el 22 de abril de 2026 .
- 1 2 "Documentación de SGLang" . SGLang . Consultado el 19 de abril de 2026 .
- ↑ Hu, Krystal (21 de enero de 2026). "Fuentes: El proyecto SGLang se independiza como RadixArk con una valoración de 400 millones de dólares mientras el mercado de inferencia explota" . TechCrunch . Recuperado el 19 de abril de 2026 .
- ↑ R, Vignesh (23 de enero de 2026). "Del laboratorio de Berkeley a la startup de 400 millones de dólares: SGLang se convierte en RadixArk" . TFN . Consultado el 22 de abril de 2026 .
Enlaces externos
- Descripción general de SGLang en la documentación de NVIDIA.
- Repositorio de código fuente de la documentación de SGLang en GitHub
- Software 2024
- Software de aprendizaje profundo
- Software de procesamiento del lenguaje natural
- Software libre programado en Python
- Software libre programado en Rust.
- Software que utiliza la licencia Apache.