La ingeniería de indicaciones consiste en estructurar entradas en lenguaje natural (conocidas como indicaciones ) para generar salidas específicas a partir de un modelo de inteligencia artificial generativa (GenAI). La ingeniería de contexto es el área relacionada de la ingeniería de software que se centra en la gestión de contextos, tanto de indicaciones como de no indicaciones, proporcionados al modelo GenAI, como instrucciones del sistema, metadatos , herramientas API y tokens.
También puede definirse como la práctica de diseñar y refinar las instrucciones de entrada proporcionadas a un modelo de IA generativa para producir resultados más precisos, relevantes o útiles. La ingeniería de indicaciones eficaz implica comprender cómo un modelo interpreta el lenguaje y puede incluir técnicas como la introducción de pocas indicaciones, la introducción de cadenas de pensamiento y la asignación de roles. Cada vez se considera más una habilidad para trabajar con grandes modelos de lenguaje (MLL) tanto en contextos de investigación como profesionales.
Durante el auge de la IA en la década de 2020 , la ingeniería de indicaciones se consolidó como una capacidad empresarial en diversas corporaciones e industrias. Se contrataba a empleados con el título de ingeniero de indicaciones para crear indicaciones que aumentaran la productividad y la eficacia, aunque este título ha perdido relevancia con el paso del tiempo, debido a que los modelos de IA generan indicaciones más eficaces que los humanos y a la capacitación corporativa en este ámbito para el personal en general.
Las técnicas de inducción comunes incluyen la inducción de múltiples disparos, la inducción de cadena de pensamiento y la inducción de árbol de pensamiento, así como la asignación de roles al modelo. Los métodos automatizados de generación de inducciones, como la generación aumentada por recuperación (RAG), proporcionan mayor precisión y un mayor abanico de funciones para los ingenieros de inducciones. La inyección de inducciones es un tipo de ataque de ciberseguridad que ataca a los modelos de aprendizaje automático mediante inducciones maliciosas.
Terminología
El Diccionario Oxford de la Lengua Inglesa define la ingeniería de indicaciones como «La acción o el proceso de formular y refinar indicaciones para un programa de inteligencia artificial , algoritmo, etc., con el fin de optimizar su resultado o lograr un resultado deseado; la disciplina o profesión relacionada con esto». [ 1 ] En 2023, «indicación» («una instrucción dada a un programa de inteligencia artificial, algoritmo, etc., que determina o influye en el contenido que genera») quedó en segundo lugar como palabra del año según Oxford . [ 2 ]
Inmediato
Una indicación es un texto en lenguaje natural que describe y prescribe la tarea que una inteligencia artificial (IA) debe realizar. [ 3 ] Una indicación para un modelo de lenguaje de texto a texto puede ser una consulta, un comando o una declaración más larga que haga referencia al contexto, las instrucciones y el historial de la conversación. El proceso de ingeniería de indicaciones puede implicar el diseño de consultas claras, el refinamiento de la redacción, la provisión de contexto relevante, la especificación del estilo de salida y la asignación de un carácter para que la IA lo imite con el fin de guiar al modelo hacia respuestas más precisas, útiles y consistentes. [ 4 ] [ 5 ]
Al comunicarse con un modelo de texto a imagen o de texto a audio, una solicitud típica contiene una descripción del resultado deseado, como "una foto de alta calidad de un astronauta montando a caballo" [ 6 ] o "electro chill lo-fi de ritmo lento con samples orgánicos" [ 7 ] . La ingeniería de solicitudes puede aplicarse a los modelos de texto a imagen para lograr el tema, el estilo, el diseño, la iluminación y la estética deseados [ 8 ] .
Técnicas
Los términos comunes utilizados para describir diversas técnicas específicas de ingeniería de indicaciones incluyen cadena de pensamiento , [ 9 ] árbol de pensamiento , [ 10 ] y generación aumentada por recuperación (RAG). [ 11 ] Un estudio de 2024 sobre el campo identificó más de 50 técnicas distintas de indicaciones basadas en texto, 40 variantes multimodales y un vocabulario de 33 términos utilizados en la investigación sobre indicaciones, lo que pone de manifiesto la actual falta de terminología estandarizada para la ingeniería de indicaciones. [ 12 ]
La codificación Vibe es un método de desarrollo de software asistido por IA en el que un usuario le indica a un LLM (Lenguaje de Lenguaje de Señas) una descripción de lo que desea y le permite generar o editar el código. En 2025, "codificación Vibe" fue la palabra del año del Diccionario Collins . [ 13 ]
Ingeniería de contexto
La ingeniería de contexto es un proceso relacionado que se centra en los elementos de contexto que acompañan a las indicaciones del usuario, que incluyen instrucciones del sistema, conocimiento recuperado, definiciones de herramientas, resúmenes de conversaciones y metadatos de tareas. La ingeniería de contexto se realiza para mejorar la fiabilidad, la procedencia y la eficiencia de los tokens en los sistemas LLM de producción . [ 14 ] [ 15 ] El concepto enfatiza prácticas operativas como la presupuestación de tokens, las etiquetas de procedencia, el versionado de artefactos de contexto, la observabilidad (registro del contexto proporcionado) y las pruebas de regresión de contexto para garantizar que los cambios en el contexto proporcionado no alteren silenciosamente el comportamiento del sistema. [ 16 ]
Razón fundamental
Las investigaciones han demostrado que el rendimiento de los modelos de lenguaje grandes (LLM) es muy sensible a decisiones como el orden de los ejemplos, la calidad de las etiquetas de demostración e incluso pequeñas variaciones en la redacción. En algunos casos, reordenar los ejemplos en una consigna produjo cambios en la precisión de más del 40 por ciento. [ 12 ]
Aprendizaje en contexto
La capacidad de un modelo para aprender temporalmente a partir de indicaciones se conoce como aprendizaje en contexto . El aprendizaje en contexto es una capacidad emergente [ 17 ] de los modelos de lenguaje grandes. Es una propiedad emergente de la escala del modelo, lo que significa que se producen rupturas en las leyes de escala , lo que lleva a que su eficacia aumente a un ritmo diferente en modelos más grandes que en modelos más pequeños. [ 17 ] [ 18 ] A diferencia del entrenamiento y el ajuste fino , que producen cambios duraderos, el aprendizaje en contexto es temporal. [ 19 ] Entrenar modelos para realizar aprendizaje en contexto puede considerarse una forma de metaaprendizaje , o "aprender a aprender". [ 20 ]
Solicitud para estimar la sensibilidad del modelo
La investigación demuestra consistentemente que los LLM son altamente sensibles a variaciones sutiles en el formato, la estructura y las propiedades lingüísticas de las indicaciones. Algunos estudios han mostrado hasta 76 puntos de precisión en cambios de formato en entornos con pocos ejemplos. [ 21 ] Las características lingüísticas influyen significativamente en la efectividad de las indicaciones, como la morfología, la sintaxis y los cambios léxico-semánticos, que mejoran significativamente el rendimiento en una variedad de tareas. [ 5 ] [ 22 ] La sintaxis de las cláusulas, por ejemplo, mejora la consistencia y reduce la incertidumbre en la recuperación del conocimiento. [ 23 ] Esta sensibilidad persiste incluso con tamaños de modelo más grandes, ejemplos adicionales con pocos ejemplos o ajuste de las instrucciones.
Para abordar la sensibilidad de los modelos y hacerlos más robustos, se han propuesto varios métodos de evaluación. FormatSpread facilita el análisis sistemático al evaluar una gama de formatos de indicaciones plausibles, ofreciendo un intervalo de rendimiento más completo. [ 21 ] De manera similar, PromptEval estima las distribuciones de rendimiento en diversas indicaciones, lo que permite métricas robustas como cuantiles de rendimiento y evaluaciones precisas con presupuestos limitados. [ 24 ]
Técnicas de inducción
Disparo múltiple
Una indicación puede incluir algunos ejemplos para que un modelo aprenda en contexto, una implementación de aprendizaje con pocos ejemplos para LLM. [ 9 ] [ 25 ] [ 26 ] Por ejemplo, la indicación puede pedirle al modelo que complete " maison → house, chat → cat, chien → ", siendo la respuesta esperada dog. [ 27 ]
Cadena de pensamiento
La inducción de cadena de pensamiento (CoT) es una técnica que permite a los grandes modelos de lenguaje (LLM) resolver un problema mediante una serie de pasos intermedios antes de dar una respuesta final. En 2022, Google Brain informó que la inducción de cadena de pensamiento mejora la capacidad de razonamiento al inducir al modelo a responder un problema de varios pasos con pasos de razonamiento que imitan un tren de pensamiento . [ 9 ] [ 28 ] Las técnicas de cadena de pensamiento se desarrollaron para ayudar a los LLM a manejar tareas de razonamiento de varios pasos, como preguntas de razonamiento aritmético o de sentido común . [ 29 ] [ 30 ]
Cuando se aplicó a PaLM , un modelo de lenguaje con 540 mil millones de parámetros , según Google, la incitación CoT ayudó significativamente al modelo, permitiéndole desempeñarse de manera comparable con modelos ajustados específicos para tareas en varias tareas, logrando resultados de vanguardia en ese momento en el conjunto de datos de razonamiento matemático GSM8K . [ 9 ] Es posible ajustar modelos en conjuntos de datos de razonamiento CoT para mejorar aún más esta capacidad y estimular una mejor interpretabilidad . [ 31 ] [ 32 ]
Como propuso originalmente Google, [ 9 ] cada indicación de CoT va acompañada de un conjunto de ejemplos de entrada/salida —llamados ejemplares— para demostrar el resultado deseado del modelo, lo que la convierte en una técnica de indicaciones con pocos ejemplos . Sin embargo, según un artículo posterior de investigadores de Google y la Universidad de Tokio , simplemente añadir las palabras "Pensemos paso a paso" [ 33 ] también resultó eficaz, lo que permitió emplear CoT como una técnica de cero ejemplos .
Autoconsistencia
La autoconsistencia realiza varios despliegues de cadena de pensamiento y luego selecciona la conclusión alcanzada con mayor frecuencia de entre todos los despliegues. [ 34 ] [ 35 ]
Árbol del pensamiento
La generación de árboles de pensamiento generaliza la cadena de pensamiento al generar múltiples líneas de razonamiento en paralelo, con la capacidad de retroceder o explorar otros caminos. Puede utilizar algoritmos de búsqueda en árbol como búsqueda en amplitud , búsqueda en profundidad o búsqueda en haz . [ 10 ]
Indicación de texto a imagen
En 2022, se lanzaron al público modelos de conversión de texto a imagen como DALL-E 2 , Stable Diffusion y Midjourney . Estos modelos toman indicaciones de texto como entrada y las usan para generar imágenes. [ 36 ] [ 8 ] Los primeros modelos de conversión de texto a imagen generalmente no entienden la negación, la gramática y la estructura de las oraciones de la misma manera que los grandes modelos de lenguaje , y por lo tanto pueden requerir un conjunto diferente de técnicas de indicación. La indicación "una fiesta sin pastel" puede producir una imagen que incluya un pastel. [ 37 ]
Una solicitud de conversión de texto a imagen suele incluir una descripción del tema de la obra de arte, el medio deseado (como pintura digital o fotografía ), el estilo (como hiperrealista o pop art ), la iluminación (como iluminación de contorno o rayos crepusculares ), el color y la textura. [ 38 ] El orden de las palabras también afecta el resultado de una solicitud de conversión de texto a imagen. Las palabras más cercanas al inicio de la solicitud pueden tener mayor énfasis. [ 39 ]
Estilos de artistas
Algunos modelos de conversión de texto a imagen son capaces de imitar el estilo de artistas específicos por su nombre. Por ejemplo, la frase « al estilo de Greg Rutkowski» se ha utilizado en las indicaciones de Stable Diffusion y Midjourney para generar imágenes con el estilo característico del artista digital polaco Greg Rutkowski . [ 40 ] Artistas famosos como Vincent van Gogh y Salvador Dalí también se han utilizado para el estilismo y las pruebas. [ 41 ]
Inversión textual e incrustaciones
Para los modelos de conversión de texto a imagen, la inversión textual realiza un proceso de optimización para crear una nueva incrustación de palabras basada en un conjunto de imágenes de ejemplo. Este vector de incrustación actúa como una "pseudopalabra" que puede incluirse en una consigna para expresar el contenido o el estilo de los ejemplos. [ 42 ]
Indicaciones de imágenes
En 2023, la investigación en IA de Meta lanzó Segment Anything, un modelo de visión artificial que puede realizar la segmentación de imágenes mediante indicaciones. Como alternativa a las indicaciones de texto, Segment Anything puede aceptar cuadros delimitadores, máscaras de segmentación y puntos de primer plano/fondo. [ 43 ]
Limitaciones
El proceso de escribir y refinar una indicación para un modelo de lenguaje natural (LLM) o una IA generativa comparte algunos paralelismos con un proceso de diseño de ingeniería iterativo, como el descubrimiento de mejores prácticas reutilizables mediante experimentación reproducible. Sin embargo, varias limitaciones fundamentales restringen su fiabilidad como disciplina. Las estrategias de indicación efectivas son altamente específicas del modelo; una técnica que mejora el rendimiento en un modelo puede degradarlo en otro, lo que dificulta la generalización. Las indicaciones también son frágiles: pequeños cambios superficiales en la redacción, la puntuación o el orden de las palabras pueden producir resultados drásticamente diferentes, incluso cuando la intención semántica permanece idéntica. [ 44 ] Esta inestabilidad dificulta el establecimiento de patrones de indicación duraderos y transferibles en diferentes contextos de implementación. [ 45 ] Además, a medida que los modelos de IA continúan mejorando su capacidad para interpretar directamente la intención del usuario, muchas técnicas manuales de indicación se están volviendo obsoletas. Los avances en el seguimiento de instrucciones y el razonamiento de modelos han reducido el valor marginal de la construcción elaborada de indicaciones para las tareas cotidianas, lo que plantea dudas sobre la viabilidad a largo plazo de la ingeniería de indicaciones como disciplina independiente. [ 46 ]
Generación automática de avisos
Investigaciones recientes han explorado la ingeniería automatizada de indicaciones, utilizando algoritmos de optimización para generar o refinar indicaciones sin intervención humana. Estos enfoques automatizados buscan identificar patrones de indicaciones eficaces mediante el análisis de gradientes de modelos, retroalimentación de refuerzo o procesos evolutivos, reduciendo la necesidad de experimentación manual. [ 47 ]
Generación aumentada por recuperación (RAG)
La generación aumentada por recuperación es una técnica que permite a los modelos GenAI recuperar e incorporar nueva información. Modifica las interacciones con un LLM para que el modelo responda a las consultas del usuario con referencia a un conjunto específico de documentos, utilizando esta información para complementar la información de sus datos de entrenamiento preexistentes . Esto permite a los LLM utilizar información específica del dominio y/o actualizada. [ 11 ]
RAG mejora los modelos de lenguaje a gran escala al incorporar la recuperación de información antes de generar respuestas. A diferencia de los modelos de lenguaje tradicionales que dependen de datos de entrenamiento estáticos, RAG extrae texto relevante de bases de datos, documentos cargados o fuentes web. Al recuperar información dinámicamente, RAG permite que la IA genere respuestas más precisas y menos errores de interpretación sin necesidad de reentrenamiento frecuente. [ 48 ]
Generación aumentada mediante recuperación de grafos (GraphRAG)

GraphRAG (término acuñado por Microsoft Research ) es una técnica que extiende RAG mediante el uso de un grafo de conocimiento para permitir que el modelo conecte información dispar, sintetice ideas y comprenda conceptos semánticos resumidos en grandes conjuntos de datos. Se ha demostrado su eficacia en conjuntos de datos como la información sobre incidentes violentos de artículos de noticias. [ 49 ] [ 50 ] [ 51 ]
Utilizar modelos de lenguaje para generar indicaciones
Los propios LLM se pueden utilizar para componer indicaciones para LLM. [ 52 ] El algoritmo de ingeniero de indicaciones automáticas utiliza un LLM para realizar una búsqueda en haz sobre indicaciones para otro LLM: [ 53 ] [ 54 ]
- Hay dos LLM. Uno es el LLM objetivo y el otro es el LLM de referencia.
- A la herramienta LLM se le presentan ejemplos de pares de entrada-salida y se le pide que genere instrucciones que, dadas las entradas, podrían haber provocado que un modelo, al seguir dichas instrucciones, generara las salidas.
- Cada una de las instrucciones generadas se utiliza para activar el LLM objetivo, seguido de cada una de las entradas. Se calculan y suman las probabilidades logarítmicas de las salidas. Este es el resultado de la instrucción.
- Las instrucciones con la puntuación más alta se entregan al LLM que las solicita para que realice variaciones adicionales.
- Repita el proceso hasta que se cumpla algún criterio de parada y, a continuación, muestre las instrucciones con la puntuación más alta.
Los ejemplos de CoT pueden ser generados por los propios LLM. En "auto-CoT", una biblioteca de preguntas se convierte en vectores mediante un modelo como BERT . Los vectores de preguntas se agrupan . Se seleccionan las preguntas cercanas al centroide de cada grupo para obtener un subconjunto de preguntas diversas. Un LLM realiza un CoT de cero disparos en cada pregunta seleccionada. La pregunta y la respuesta CoT correspondiente se añaden a un conjunto de datos de demostraciones. Estas demostraciones diversas pueden luego añadirse a las indicaciones para el aprendizaje con pocos disparos. [ 55 ]
Optimización automática de mensajes
Las técnicas de optimización automática de indicaciones refinan las indicaciones para modelos de lenguaje grandes mediante la búsqueda automática de cadenas de indicaciones alternativas utilizando conjuntos de datos de evaluación y métricas específicas de la tarea:
- MIPRO (Optimizador de Propuestas de Instrucciones Multi-prompt) optimiza las instrucciones y las demostraciones de pocos ejemplos de programas de modelos de lenguaje de múltiples etapas, proponiendo pequeños cambios en las indicaciones de los módulos y conservando aquellos que mejoran una métrica de rendimiento posterior sin acceso a etiquetas o gradientes a nivel de módulo. [ 56 ]
- GEPA (Genetic-Pareto) es un optimizador de indicaciones reflexivo para sistemas de IA compuestos que combina el análisis basado en modelos de lenguaje de trazas de ejecución y retroalimentación textual con una búsqueda evolutiva basada en Pareto sobre una población de sistemas candidatos; en cuatro tareas, GEPA reporta ganancias promedio de alrededor del 10% sobre la Optimización de Política Relativa de Grupo (GRPO) basada en aprendizaje por refuerzo y más del 10% sobre el optimizador de indicaciones MIPROv2, mientras que utiliza hasta 35 veces menos despliegues que GRPO. [ 57 ]
- Los marcos de código abierto como DSPy y Opik exponen estos y otros optimizadores relacionados, lo que permite que la búsqueda rápida se exprese como parte de una canalización programática en lugar de mediante prueba y error manual. [ 58 ] [ 59 ]
Utilizando el descenso de gradiente para buscar indicaciones
En "prefix-tuning" [ 60 ] , "prompt tuning" o "soft prompting" [ 61 ] , los vectores de punto flotante se buscan directamente mediante descenso de gradiente para maximizar la log-verosimilitud en las salidas. Un resultado anterior utiliza la misma idea de búsqueda de descenso de gradiente, pero está diseñado para modelos de lenguaje enmascarados como BERT, y busca solo sobre secuencias de tokens, en lugar de vectores numéricos. Formalmente, buscadóndeabarca secuencias de tokens de una longitud específica. [ 62 ]
Historia
Los primeros precedentes de interacción estructurada del usuario con sistemas de IA basados en reglas se pueden encontrar en el software de automatización empresarial de la década de 1990. Por ejemplo, The Intelligent Filling Manager (1999), desarrollado por Krishna C. Mukherjee, utilizaba una interfaz dinámica de preguntas y respuestas impulsada por un sistema experto basado en reglas para recopilar entradas del usuario para generar automáticamente presentaciones regulatorias en diferentes jurisdicciones. [ 63 ] Si bien no involucraban redes neuronales, dichos sistemas presentaban flujos de trabajo similares a indicaciones que influyeron en diseños posteriores de IA con intervención humana. En 2018, los investigadores propusieron por primera vez que todas las tareas previamente separadas en el procesamiento del lenguaje natural (PLN) podrían plantearse como problemas de preguntas y respuestas en un contexto. Además, entrenaron un primer modelo único, conjunto y multitarea que respondería cualquier pregunta relacionada con la tarea, como "¿Cuál es el sentimiento?", "Traduzca esta oración al alemán" o "¿Quién es el presidente?". [ 64 ]
El auge de la IA generó un mayor interés en la literatura académica y la práctica profesional en la aplicación de técnicas de inducción para lograr que el modelo produjera el resultado deseado y evitar resultados sin sentido , un proceso caracterizado por el método de ensayo y error . [ 65 ] Tras el lanzamiento de ChatGPT en noviembre de 2022, la ingeniería de inducción pronto se consideró una habilidad empresarial importante; las empresas comenzaron a contratar ingenieros de inducción especializados, aunque, dados los avances en la capacidad de la IA para generar inducciones mejor que los humanos, el mercado laboral para los ingenieros de inducción se ha enfrentado a la incertidumbre. [ 4 ] Según The Wall Street Journal en 2025, el puesto de ingeniero de inducción fue uno de los más demandados en 2023, pero se ha vuelto obsoleto debido a modelos que intuyen mejor la intención del usuario y a la formación de las empresas. [ 66 ]
Un repositorio de indicaciones informó que más de 2000 indicaciones públicas para alrededor de 170 conjuntos de datos estaban disponibles en febrero de 2022. [ 67 ] En 2022, investigadores de Google propusieron la técnica de indicaciones de cadena de pensamiento . [ 9 ] [ 68 ] En 2023, varias bases de datos de indicaciones de texto a texto y de texto a imagen se pusieron a disposición del público. [ 69 ] [ 70 ] El conjunto de datos Personalized Image-Prompt (PIP), un conjunto de datos de imagen-texto generado que ha sido categorizado por 3115 usuarios, también se ha puesto a disposición del público en 2024. [ 71 ]
Inyección inmediata
La inyección de indicaciones es una vulnerabilidad de ciberseguridad en la que los atacantes crean entradas que parecen legítimas, pero que están diseñadas para provocar un comportamiento no deseado en los modelos de aprendizaje automático , especialmente en los modelos de lenguaje de gran tamaño. Este ataque aprovecha la incapacidad del modelo para distinguir entre las indicaciones definidas por el desarrollador y las entradas del usuario, lo que permite a los atacantes eludir las medidas de seguridad e influir en el comportamiento del modelo. Si bien los modelos de lenguaje están diseñados para seguir instrucciones de confianza, pueden ser manipulados para que realicen respuestas no deseadas mediante entradas cuidadosamente elaboradas. [ 72 ] [ 73 ]
Referencias
- ↑ "ingeniería rápida". Oxford English Dictionary . Oxford University Press . 2025.
- ↑ "Oxford Palabra del Año 2023" . Oxford Languages . Oxford University Press . Archivado del original el 31 de enero de 2024. Consultado el 6 de febrero de 2026 .
- ↑ Radford, Alec; Wu, Jeffrey; Child, Rewon; Luan, David; Amodei, Dario ; Sutskever, Ilya (2019). "Los modelos de lenguaje son aprendices multitarea no supervisados" (PDF) . OpenAI. Archivado (PDF) del original el 6 de febrero de 2021. Recuperado el 19 de junio de 2023. Demostramos
que los modelos de lenguaje pueden realizar tareas posteriores en un entorno de cero disparos, sin ninguna modificación de parámetros o arquitectura.
- 1 2 Genkina, Dina (6 de marzo de 2024). "La ingeniería de indicaciones de IA ha muerto: ¡Viva la ingeniería de indicaciones de IA!" . IEEE Spectrum . Archivado del original el 17 de enero de 2025. Recuperado el 18 de enero de 2025 .
- 1 2 Wahle, Jan Philip; Ruas, Terry; Xu, Yang; Gipp, Bela (2024). "Los tipos de paráfrasis generan capacidades de ingeniería de indicaciones" . En Al-Onaizan, Yaser; Bansal, Mohit; Chen, Yun-Nung (eds.). Actas de la Conferencia de 2024 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . Miami, Florida, EE. UU.: Asociación para la Lingüística Computacional. pp. 11004–11033 . arXiv : 2406.19898 . doi : 10.18653/v1/2024.emnlp-main.617 .
- ↑ Heaven, Will Douglas (6 de abril de 2022). "Este astronauta a caballo es un hito en el largo camino de la IA hacia la comprensión" . MIT Technology Review . Consultado el 14 de agosto de 2023 .
- ↑ Wiggers, Kyle (12 de junio de 2023). "Meta publica como código abierto un generador de música impulsado por IA" . TechCrunch . Recuperado el 15 de agosto de 2023. A
continuación, di una instrucción más compleja para intentar desconcertar a MusicGen: "Electro chill lo-fi de BPM lento con samples orgánicos".
- 1 2 Mittal, Aayush (27 de julio de 2023). "Dominando el arte de la IA: una guía concisa para la ingeniería intermedia y rápida" . Unite.AI . Archivado del original el 9 de mayo de 2025. Recuperado el 9 de mayo de 2025 .
- 1 2 3 4 5 6 Wei, Jason; Wang, Xuezhi; Schuurmans, Dale; Bosma, Maarten; Ichter, Brian; Xia, Fei; Chi, Ed H.; Le, Quoc V.; Zhou, Denny (31 de octubre de 2022). La inducción de cadena de pensamiento genera razonamiento en modelos de lenguaje grandes . Avances en sistemas de procesamiento de información neuronal (NeurIPS 2022). Vol. 35. arXiv : 2201.11903 .
- 1 2 Árbol de pensamientos: Resolución deliberada de problemas con modelos de lenguaje grandes . NeurIPS. 2023. arXiv : 2305.10601 .
- 1 2 "Por qué las reseñas de IA de Google se equivocan" . MIT Technology Review . 31 de mayo de 2024. Archivado del original el 3 de mayo de 2025. Recuperado el 7 de marzo de 2025 .
- 1 2 Schulhoff, Sander; et al. (2024). "The Prompt Report: A Systematic Survey of Prompt Engineering Techniques". arXiv : 2406.06608 [ cs.CL ].
- ^ Kolirin, Lianne (6 de noviembre de 2025). "El término "codificación de vibraciones" fue elegido como la palabra del año por el diccionario Collins . CNN . Archivado del original el 14 de noviembre de 2025. Consultado el 7 de febrero de 2026 .
- ↑ Casey, Matt M. (5 de noviembre de 2025). "Ingeniería de contexto: la disciplina detrás de las aplicaciones y agentes LLM confiables" . Comet. Archivado del original el 11 de noviembre de 2025. Recuperado el 10 de noviembre de 2025 .
- ↑ "Ingeniería de contexto" . LangChain. 2 de julio de 2025. Archivado del original el 11 de noviembre de 2025. Consultado el 10 de noviembre de 2025 .
- ↑ Mei, Lingrui (17 de julio de 2025). "Un estudio sobre la ingeniería de contexto para modelos de lenguaje grandes". arXiv : 2507.13334 [ cs.CL ].
- 1 2 Wei, Jason; Tay, Yi; Bommasani, Rishi; Raffel, Colin; Zoph, Barret; Borgeaud, Sebastian; Yogatama, Dani; Bosma, Maarten; Zhou, Denny; Metzler, Donald; Chi, Ed H.; Hashimoto, Tatsunori; Vinyals, Oriol; Liang, Percy; Dean, Jeff; Fedus, William (octubre de 2022). "Habilidades emergentes de grandes modelos de lenguaje". Transactions on Machine Learning Research . arXiv : 2206.07682 .
En el proceso de indicación, a un modelo de lenguaje preentrenado se le da una indicación (por ejemplo, una instrucción en lenguaje natural) de una tarea y completa la respuesta sin ningún entrenamiento adicional ni actualizaciones de gradiente a sus parámetros... La capacidad de realizar una tarea mediante indicaciones con pocos ejemplos es emergente cuando un modelo tiene un rendimiento aleatorio hasta cierta escala, después de la cual el rendimiento aumenta a muy por encima del aleatorio.
- ↑ Caballero, Ethan; Gupta, Kshitij; Rish, Irina; Krueger, David (2023). "Leyes de escala neuronal infringidas". ICLR . arXiv : 2210.14891 .
- ↑ Musser, George . "Cómo la IA sabe cosas que nadie le ha dicho" . Scientific American . Archivado del original el 3 de julio de 2023. Recuperado el 17 de mayo de 2023. Para
cuando escribes una consulta en ChatGPT, la red debería estar fija; a diferencia de los humanos, no debería seguir aprendiendo. Por eso fue una sorpresa que los LLM, de hecho, aprendan de las indicaciones de sus usuarios, una capacidad conocida como aprendizaje en contexto.
- ↑ Garg, Shivam; Tsipras, Dimitris; Liang, Percy; Valiant, Gregory (2022). "¿Qué pueden aprender los Transformers en contexto? Un estudio de caso de clases de funciones simples". NeurIPS . arXiv : 2208.01066 .
Entrenar un modelo para realizar aprendizaje en contexto puede considerarse un ejemplo del paradigma más general de aprendizaje para aprender o metaaprendizaje.
- 1 2 Cuantificación de la sensibilidad de los modelos de lenguaje a las características espurias en el diseño de indicaciones o: Cómo aprendí a empezar a preocuparme por el formato de las indicaciones . ICLR. 2024. arXiv : 2310.11324 .
- ↑ Leidinger, Alina; van Rooij, Robert; Shutova, Ekaterina (2023). Bouamor, Houda; Pino, Juan; Bali, Kalika (eds.). "El lenguaje de la incitación: ¿Qué propiedades lingüísticas hacen que una incitación sea exitosa?" . Hallazgos de la Asociación para la Lingüística Computacional: EMNLP 2023 . Singapur: Asociación para la Lingüística Computacional: 9210– 9232. arXiv : 2311.01967 . doi : 10.18653/v1/2023.findings-emnlp.618 . Archivado del original el 13 de diciembre de 2024 . Recuperado el 18 de noviembre de 2024 .
- ↑ Linzbach, Stephan; Dimitrov, Dimitar; Kallmeyer, Laura; Evang, Kilian; Jabeen, Hajira; Dietze, Stefan (junio de 2024). "Disecando paráfrasis: el impacto de la sintaxis de las indicaciones y la información suplementaria en la recuperación del conocimiento a partir de modelos de lenguaje preentrenados" . En Duh, Kevin; Gomez, Helena; Bethard, Steven (eds.). Actas de la Conferencia de 2024 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del lenguaje humano (Volumen 1: Artículos largos) . Ciudad de México, México: Asociación de Lingüística Computacional. pp. 3645–3655 . arXiv : 2404.01992 . doi : 10.18653/v1/2024.naacl-long.201 . Archivado del original el 3 de noviembre de 2024. Consultado el 18 de noviembre de 2024 .
- ↑ Evaluación eficiente de LLM mediante múltiples indicaciones . NeurIPS. 2024. arXiv : 2405.17202 .
- ↑ Brown, Tom; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared D.; Dhariwal, Prafulla; Neelakantan, Arvind (2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". Advances in Neural Information Processing Systems . 33 : 1877–1901 . arXiv : 2005.14165 .
- ↑ Wang, Yaqing; Yao, Quanming; Kwok, James T.; Ni, Lionel M. (12 de junio de 2020). "Generalizando a partir de unos pocos ejemplos: una revisión sobre el aprendizaje con pocos ejemplos" . ACM Comput. Surv . 53 (3): 63:1–63:34. doi : 10.1145/3386252 . ISSN 0360-0300 .
- ↑ Garg, Shivam; Tsipras, Dimitris; Liang, Percy ; Valiant, Gregory (2022). "¿Qué pueden aprender los Transformers en contexto? Un estudio de caso de clases de funciones simples". NeurIPS . arXiv : 2208.01066 .
- ↑ Narang, Sharan; Chowdhery, Aakanksha (4 de abril de 2022). "Pathways Language Model (PaLM): Escalando a 540 mil millones de parámetros para un rendimiento revolucionario" . ai.googleblog.com . Archivado del original el 4 de abril de 2022. Recuperado el 14 de agosto de 2023 .
- ↑ Dang, Ekta (8 de febrero de 2023). "Aprovechando el poder de GPT-3 en la investigación científica" . VentureBeat . Archivado del original el 18 de marzo de 2023. Recuperado el 10 de marzo de 2023 .
- ↑ Montti, Roger (13 de mayo de 2022). "La función de Google de sugerir ideas puede mejorar los mejores algoritmos actuales" . Search Engine Journal . Archivado del original el 26 de marzo de 2023. Consultado el 10 de marzo de 2023 .
- ↑ "Escalado de modelos de lenguaje ajustados a instrucciones" (PDF) . Revista de Investigación en Aprendizaje Automático . 2024. Archivado (PDF) del original el 8 de mayo de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ Wei, Jason; Tay, Yi (29 de noviembre de 2022). "Mejores modelos de lenguaje sin computación masiva" . ai.googleblog.com . Archivado del original el 10 de marzo de 2023. Recuperado el 10 de marzo de 2023 .
- ↑ Kojima, Takeshi; Shixiang Shane Gu; Reid, Machel; Matsuo, Yutaka; Iwasawa, Yusuke (2022). "Los modelos de lenguaje grandes son razonadores de tiro cero". NeurIPS . arXiv : 2205.11916 .
- ↑ La autoconsistencia mejora el razonamiento de cadena de pensamiento en los modelos de lenguaje . ICLR. 2023. arXiv : 2203.11171 .
- ↑ Mittal, Aayush (27 de mayo de 2024). "Últimos avances modernos en ingeniería de precisión: una guía completa" . Unite.AI . Archivado del original el 19 de agosto de 2025. Recuperado el 8 de mayo de 2025 .
- ↑ Goldman, Sharon (5 de enero de 2023). "Dos años después del debut de DALL-E, su inventor se muestra "sorprendido" por el impacto" . VentureBeat . Archivado del original el 18 de enero de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ "Indicaciones" . docs.midjourney.com . Archivado del original el 23 de agosto de 2023. Consultado el 14 de agosto de 2023 .
- ↑ "Indicador de difusión estable: una guía definitiva" . 14 de mayo de 2023. Archivado del original el 14 de agosto de 2023. Consultado el 14 de agosto de 2023 .
- ↑ Diab, Mohamad; Herrera, Julian; Chernow, Bob (28 de octubre de 2022). "Stable Diffusion Prompt Book" (PDF) . Archivado (PDF) del original el 30 de marzo de 2023. Recuperado el 7 de agosto de 2023. La
ingeniería de indicaciones es el proceso de estructurar palabras que pueden ser interpretadas y comprendidas por un modelo
de texto a imagen
. Piénselo como el lenguaje que necesita hablar para decirle a un modelo de IA qué dibujar.
- ↑ Heikkilä, Melissa (16 de septiembre de 2022). "Este artista está dominando el arte generado por IA y no está contento con ello" . MIT Technology Review . Archivado del original el 14 de enero de 2023. Recuperado el 14 de agosto de 2023 .
- ↑ Solomon, Tessa (28 de agosto de 2024). «Las instalaciones Ask Dalí y Hello Vincent, impulsadas por IA, plantean preguntas incómodas sobre la ventriloquia de los muertos» . ARTnews.com . Archivado del original el 24 de enero de 2025. Recuperado el 10 de enero de 2025 .
- ↑ Gal, Rinon; Alaluf, Yuval; Atzmon, Yuval; Patashnik, Or; Bermano, Amit H.; Chechik, Gal; Cohen-Or, Daniel (2023). "Una imagen vale más que una palabra: Personalización de la generación de texto a imagen mediante inversión textual". ICLR . arXiv : 2208.01618 .
Utilizando solo 3-5 imágenes de un concepto proporcionado por el usuario, como un objeto o un estilo, aprendemos a representarlo a través de nuevas "palabras" en el espacio de incrustación de un modelo de texto a imagen congelado.
- ↑ Segmentar cualquier cosa (PDF) . ICCV. 2023. Archivado (PDF) del original el 28 de abril de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ Berry, David M. (2 de junio de 2026). "Ansiedad inmediata y la política algorítmica de la incertidumbre" . AI & Society . doi : 10.1007/s00146-026-03093-8 . ISSN 1435-5655 .
- ↑ Meincke, Lennart; Mollick, Ethan R.; Mollick, Lilach; Shapiro, Dan (4 de marzo de 2025). Informe de Prompting Science 1: Prompt Engineering is Complicated and Contingent (Informe). SSRN 5165270 .
- ↑ Bousquette, Isabelle (25 de abril de 2025). "El trabajo más codiciado en IA de 2023 ya está obsoleto" . The Wall Street Journal . ISSN 0099-9660 . Archivado del original el 7 de mayo de 2025. Consultado el 24 de mayo de 2026 .
- ^ Li, Wenwu; Wang, Xiangfeng; Li, Wenhao; Jin, Bo (2025). "Un estudio sobre ingeniería rápida automática: una perspectiva de optimización". arXiv : 2502.11560 [ cs.AI ].
- ↑ "¿Puede una tecnología llamada RAG evitar que los modelos de IA inventen cosas?" . Ars Technica . 6 de junio de 2024. Archivado del original el 6 de junio de 2024. Consultado el 7 de marzo de 2025 .
- ↑ Larson, Jonathan; Truitt, Steven (13 de febrero de 2024), GraphRAG: Desbloqueando el descubrimiento de LLM en datos privados narrativos , Microsoft, archivado del original el 7 de mayo de 2024 , recuperado el 7 de mayo de 2024
- ↑ "Una introducción a Graph RAG" . KDnuggets . Archivado del original el 20 de agosto de 2025. Consultado el 9 de mayo de 2025 .
- ↑ Sequeda, Juan; Allemang, Dean; Jacob, Bryon (2023). "Un punto de referencia para comprender el papel de los grafos de conocimiento en la precisión de los modelos de lenguaje a gran escala para la respuesta a preguntas en bases de datos SQL empresariales". Grades-Nda . arXiv : 2311.07509 .
- ↑ Explicación de patrones en datos con modelos de lenguaje mediante autoinstrucciones interpretables (PDF) . Taller BlackboxNLP. 2023. arXiv : 2210.01848 . Archivado (PDF) del original el 9 de mayo de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ Los grandes modelos de lenguaje son ingenieros de indicaciones a nivel humano . ICLR. 2023. arXiv : 2211.01910 .
- ↑ Pryzant, Reid; Iter, Dan; Li, Jerry; Lee, Yin Tat; Zhu, Chenguang; Zeng, Michael (2023). "Optimización automática de indicaciones con "descenso de gradiente" y búsqueda en haz" . Conferencia sobre métodos empíricos en procesamiento del lenguaje natural : 7957–7968 . arXiv : 2305.03495 . doi : 10.18653/v1/2023.emnlp-main.494 . Archivado del original el 27 de abril de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ Indicación automática de la cadena de pensamiento en modelos de lenguaje grandes . ICLR. 2023. arXiv : 2210.03493 .
- ↑ Opsahl-Ong, Krista; Ryan, Michael J.; Purtell, Josh; Broman, David; Potts, Christopher; Zaharia, Matei; Khattab, Omar (2024). Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs . Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP). Miami, Florida: Association for Computational Linguistics. arXiv : 2406.11695 . doi : 10.18653/v1/2024.emnlp-main.525 .
- ↑ Agrawal, Lakshya A. (2025). "GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning". arXiv : 2507.19457 [ cs.CL ].
- ↑ Khattab, Omar (2023). "DSPy: Compilación de llamadas a modelos de lenguaje declarativos en pipelines de auto-mejora". arXiv : 2310.03714 [ cs.CL ].
- ↑ "Optimización de agentes" . comet.com . Archivado del original el 22 de enero de 2026. Consultado el 29 de noviembre de 2025 .
- ↑ Li, Xiang Lisa; Liang, Percy (2021). "Prefix-Tuning: Optimizing Continuous Prompts for Generation". Actas de la 59.ª Reunión Anual de la Asociación de Lingüística Computacional y la 11.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (Volumen 1: Artículos extensos) . págs. 4582–4597 . doi : 10.18653/V1/2021.ACL-LONG.353 . S2CID 230433941.
En este artículo, proponemos prefix-tuning, una alternativa ligera al fine-tuning... Prefix-tuning se inspira en prompting
- ↑ Lester, Brian; Al-Rfou, Rami; Constant, Noah (2021). "El poder de la escala para la optimización de indicaciones con parámetros eficientes". Actas de la Conferencia de 2021 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . págs. 3045–3059 . arXiv : 2104.08691 . doi : 10.18653/V1/2021.EMNLP-MAIN.243 . S2CID 233296808. En este trabajo, exploramos la "optimización de indicaciones "
, un mecanismo simple pero efectivo para aprender "indicaciones suaves"... A diferencia de las indicaciones de texto discretas utilizadas por GPT-3, las indicaciones suaves se aprenden mediante retropropagación.
- ↑ Shin, Taylor; Razeghi, Yasaman; Logan IV, Robert L.; Wallace, Eric; Singh, Sameer (noviembre de 2020). "AutoPrompt: Obtención de conocimiento a partir de modelos de lenguaje con indicaciones generadas automáticamente" . Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . En línea: Asociación para la Lingüística Computacional. págs. 4222–4235 . doi : 10.18653/v1/2020.emnlp-main.346 . S2CID 226222232. Archivado del original el 11 de junio de 2023. Recuperado el 11 de junio de 2023 .
- ↑ Mukherjee, Krishna C. (1999). Automatización de la publicación de formularios con el gestor de archivos inteligente . Conferencia internacional IEEE sobre sistemas, hombre y cibernética. págs. 378–383 . doi : 10.1109/ICSMC.1999.814108 .
- ↑ McCann, Bryan; Keskar, Nitish; Xiong, Caiming; Socher, Richard (20 de junio de 2018). El Decatlón del Lenguaje Natural: Aprendizaje Multitarea como Respuesta a Preguntas . ICLR. arXiv : 1806.08730 .
- ↑ Knoth, Nils; Tolzin, Antonia; Janson, Andreas; Leimeister, Jan Marco (1 de junio de 2024). "Alfabetización en IA y sus implicaciones para estrategias de ingeniería rápidas" . Computers and Education: Artificial Intelligence . 6 100225. doi : 10.1016/j.caeai.2024.100225 . ISSN 2666-920X .
- ↑ Bousquette, Isabelle (25 de abril de 2025). "El trabajo más codiciado en IA de 2023 ya está obsoleto" . Wall Street Journal . ISSN 0099-9660 . Archivado del original el 7 de mayo de 2025. Consultado el 7 de mayo de 2025 .
- ↑ PromptSource: Un entorno de desarrollo integrado y repositorio para indicaciones en lenguaje natural . Asociación de Lingüística Computacional. 2022. Archivado del original el 19 de mayo de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ Brubaker, Ben (21 de marzo de 2024). "Cómo el razonamiento en cadena ayuda a las redes neuronales a calcular" . Quanta Magazine . Archivado del original el 9 de mayo de 2025. Recuperado el 9 de mayo de 2025 .
- ↑ Chen, Brian X. (23 de junio de 2023). "Cómo convertir tu chatbot en un entrenador personal" . The New York Times . Archivado del original el 14 de agosto de 2023. Consultado el 14 de agosto de 2023 .
- ↑ Chen, Brian X. (25 de mayo de 2023). "Sácale el máximo partido a ChatGPT con estas sugerencias infalibles" . The New York Times . ISSN 0362-4331 . Archivado del original el 14 de agosto de 2023. Consultado el 16 de agosto de 2023 .
- ↑ Chen, Zijie; Zhang, Lichao; Weng, Fangsheng; Pan, Lili; Lan, Zhenzhong (16 de junio de 2024). "Visiones personalizadas: Mejora de la generación de texto a imagen con reescritura personalizada de indicaciones" . Conferencia IEEE/CVF 2024 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 7727–7736 . arXiv : 2310.08129 . doi : 10.1109/cvpr52733.2024.00738 . ISBN 979-8-3503-5300-6.
- ↑ Vigliarolo, Brandon (19 de septiembre de 2022). "El ataque de 'inyección de mensajes' de GPT-3 provoca malos modales en los bots" . The Register . Archivado del original el 29 de marzo de 2023. Consultado el 9 de febrero de 2023 .
- ↑ "¿Qué es un ataque de inyección de mensajes?" . IBM . 26 de marzo de 2024. Archivado del original el 3 de marzo de 2025 . Consultado el 7 de marzo de 2025 .
- Aprendizaje profundo
- Aprendizaje automático
- Procesamiento del lenguaje natural
- Aprendizaje no supervisado
- Neologismos de 2022
- Lingüística
- IA generativa