LoRA ( Low-Rank Adaptation ) es una técnica de ajuste fino eficiente en parámetros para grandes modelos de lenguaje y otras redes neuronales profundas . Introducida en 2021 por investigadores de Microsoft , LoRA permite la adaptación de modelos preentrenados a tareas específicas, requiriendo significativamente menos recursos computacionales y parámetros entrenables que el ajuste fino tradicional de modelos completos. [ 1 ]
Fondo
El desarrollo de modelos de lenguaje cada vez más grandes a finales de la década de 2010 y principios de la de 2020 generó importantes desafíos computacionales. GPT-1 , lanzado en 2018 con 117 millones de parámetros, costó menos de 50 000 dólares entrenarlo. [ 2 ] GPT-2 , lanzado en 2019 con 1500 millones de parámetros, requirió 40 000 dólares para entrenarlo. [ 2 ]
Para 2020, GPT-3 escaló a 175 mil millones de parámetros, con costos de entrenamiento estimados entre $500,000 y $4.6 millones. [ 3 ] El entrenamiento consumió aproximadamente 1,287 megavatios-hora de electricidad. [ 4 ] GPT-4 , lanzado en 2023, requirió más de $100 millones para entrenar y consumió aproximadamente 50 gigavatios-hora de energía utilizando 25,000 GPU Nvidia A100 funcionando durante 90 a 100 días. [ 5 ] GPT-5 , lanzado en agosto de 2025, requirió ejecuciones de entrenamiento individuales que costaron más de $500 millones cada una, con costos de entrenamiento totales estimados entre $1.25 mil millones y $2.5 mil millones. [ 6 ] [ 7 ] Esto creó una barrera donde adaptar tales modelos a tareas específicas a través del ajuste fino tradicional se volvió prohibitivamente caro para la mayoría de los investigadores y organizaciones.
Objetivo
LoRA funciona descomponiendo las matrices de actualización de pesos en representaciones de menor rango. En lugar de actualizar todos los parámetros de una red neuronal durante el ajuste fino, LoRA congela los pesos del modelo preentrenado e inyecta matrices de descomposición de rango entrenables en cada capa de la arquitectura Transformer . [ 1 ] Este enfoque se basa en el álgebra lineal y aprovecha la hipótesis de que las actualizaciones de pesos durante el ajuste fino tienen un "rango intrínseco" bajo, lo que significa que los cambios pueden representarse eficazmente con menos parámetros que la matriz de pesos completa. [ 1 ]
Cuando se aplicó a GPT-3 , LoRA redujo los parámetros entrenables aproximadamente 10 000 veces (de 175 000 millones a unos 18 000 millones) y los requisitos de memoria de la GPU durante el entrenamiento en 3 veces (de 1,2 terabytes a 350 gigabytes). [ 1 ] [ 8 ] La técnica se aplica ampliamente a cualquier capa densa en modelos de aprendizaje profundo, aunque se ha estudiado más extensamente en el contexto de grandes modelos de lenguaje. [ 1 ] Después del entrenamiento, los pesos del adaptador LoRA se pueden fusionar con los pesos del modelo base, lo que resulta en que no haya latencia de inferencia adicional durante la implementación. [ 1 ]
LoRA se ha adoptado ampliamente en flujos de trabajo posteriores al entrenamiento, incluyendo la integración con métodos de optimización de preferencias como la optimización directa de preferencias (DPO). Sus variantes eficientes en parámetros, como QLoRA, permiten el ajuste fino de modelos de 30 mil millones de parámetros en una sola GPU de consumo de 24 GB. [ 9 ]
Usos
Una de las principales aplicaciones de LoRA es la creación de versiones personalizadas de modelos complejos a un costo drásticamente reducido. Los pesos del adaptador entrenados mediante LoRA pueden reincorporarse al modelo base original, generando un nuevo modelo especializado a gran escala a un costo mucho menor que el de reentrenar el modelo completo. [ 1 ] Esto permite a las organizaciones crear versiones específicas de modelos como GPT-3 (175 mil millones de parámetros) para dominios concretos, asumiendo únicamente el costo computacional de entrenar un adaptador pequeño (18 millones de parámetros), en lugar del costo prohibitivo de reentrenar el modelo completo. Una vez integrado, el modelo resultante puede alcanzar un rendimiento comparable al del ajuste fino tradicional, requiriendo una fracción de los recursos necesarios para su creación.
Como alternativa, las organizaciones pueden mantener un único modelo base junto con varios adaptadores LoRa pequeños, cada uno especializado para diferentes tareas o dominios. Por ejemplo, un modelo base de 175 mil millones de parámetros podría combinarse con adaptadores separados de 18 millones de parámetros para servicio al cliente, análisis legal y aplicaciones médicas. Este enfoque reduce drásticamente los requisitos de almacenamiento en comparación con el mantenimiento de múltiples modelos completos y optimizados, ya que cada adaptador requiere menos del uno por ciento del espacio de almacenamiento de un modelo completo. [ 1 ]
LoRA también permite el intercambio dinámico de adaptadores, donde se pueden cargar y aplicar diferentes adaptadores al mismo modelo base sin recargar todo el modelo en la memoria. Esto permite que los sistemas cambien entre tareas especializadas de manera eficiente. También se pueden combinar varios adaptadores fusionando sus actualizaciones de peso, ya sea entre sí o con el modelo base, para crear modelos con capacidades combinadas. [ 8 ]
LoRA también se ha aplicado a la reparación de programas, y RepairLLaMA demuestra que el ajuste fino eficiente de parámetros con representaciones de código específicas para la reparación supera tanto al ajuste fino de parámetros completos como a los modelos de propósito general como GPT-4. [ 10 ]
Referencias
- 1 2 3 4 5 6 7 8 Hu, Edward J.; Shen, Yelong; Wallis, Phillip; Allen-Zhu, Zeyuan; Li, Yuanzhi; Wang, Shean; Wang, Lu; Chen, Weizhu (2022). LoRA: Adaptación de bajo rango de grandes modelos de lenguaje . Conferencia internacional sobre representaciones de aprendizaje.
- 1 2 "Hoja de trucos de IA: Costos de entrenamiento de modelos de la Fundación de Lenguaje Grande" . PYMNTS. 10 de febrero de 2025. Recuperado el 22 de enero de 2026 .
- ↑ "¿Cuál es el costo de entrenar modelos de lenguaje grandes?" . CUDO Compute. 12 de mayo de 2025 . Consultado el 22 de enero de 2026 .
- ↑ "La optimización podría reducir la huella de carbono del entrenamiento de IA hasta en un 75 %" . Universidad de Michigan. 19 de abril de 2023. Consultado el 22 de enero de 2026 .
- ↑ "El costo de la IA: desglose de las inversiones en capacitación, infraestructura y más" . Forward Future. 5 de mayo de 2025. Consultado el 22 de enero de 2026 .
- ↑ "OpenAI GPT-5 cuesta 500 millones de dólares por cada entrenamiento y sigue fallando" . Fanatical Futurist. 30 de mayo de 2025. Consultado el 22 de enero de 2026 .
- ↑ "Todo lo que necesitas saber sobre GPT-5 y la hoja de ruta de OpenAI para 2025" . Fello AI. 13 de febrero de 2025. Consultado el 22 de enero de 2026 .
- 1 2 "¿Qué es LoRA (Adaptación de bajo rango)?" . IBM. 17-11-2024 . Recuperado el 22-01-2026 .
- ↑ von Csefalvay, Chris (2026). Post-Training: A Practical Guide for AI Engineers and Developers . No Starch Press. pp. 23, 149–152 . ISBN 978-1-7185-0520-9.
- ↑ Silva, André; Fang, Sen; Monperrus, Martin (2025). "RepairLLaMA: Representaciones eficientes y adaptadores ajustados para la reparación de programas" . IEEE Transactions on Software Engineering . 51 (8): 2366– 2380. doi : 10.1109/TSE.2025.3581062 . ISSN 2326-3881 . Consultado el 17 de junio de 2026 .
- Aprendizaje profundo
- Aprendizaje automático
- Redes neuronales artificiales
- algoritmos de aprendizaje automático
- Optimización matemática
- Álgebra lineal
- Lingüística computacional