Un modelo de lenguaje grande ( LLM , por sus siglas en inglés) es una red neuronal entrenada con una gran cantidad de texto para tareas de procesamiento del lenguaje natural , especialmente la generación de lenguaje . Los LLM suelen generar, resumir, traducir y analizar texto en muchos contextos, y son una tecnología fundamental para los chatbots modernos . [ 1 ] Los datos de entrenamiento sesgados o inexactos pueden hacer que la salida de un LLM sea menos fiable. [ 2 ]
Los LLM se basan típicamente en la arquitectura de transformadores . [ 3 ] Los transformadores generativos preentrenados (GPT) son un tipo de LLM que se preentrena para predecir la siguiente palabra. [ 4 ] Los GPT a menudo se ajustan para seguir instrucciones y comportarse como asistentes. [ 5 ]
Las evaluaciones de referencia para los LLM intentan medir el razonamiento del modelo , la precisión fáctica, la alineación y la seguridad . [ 6 ]
Historia



Antes de la aparición de los modelos basados en transformadores en 2017, algunos modelos de lenguaje se consideraban grandes en relación con las limitaciones computacionales y de datos de su época. A principios de la década de 1990, los modelos estadísticos de IBM fueron pioneros en las técnicas de alineación de palabras para la traducción automática, sentando las bases para el modelado de lenguaje basado en corpus . En 2001, un modelo de n -gramas suavizado , como los que emplean el suavizado de Kneser-Ney , entrenado con 300 millones de palabras, alcanzó una perplejidad de vanguardia en pruebas de referencia. [ 7 ] Durante la década de 2000, con el auge del acceso generalizado a Internet , los investigadores comenzaron a compilar conjuntos de datos de texto masivos de la web ("web como corpus" [ 8 ] ) para entrenar modelos de lenguaje estadísticos. [ 9 ] [ 10 ]
Más allá de los modelos n -grama, los investigadores comenzaron en 2000 a utilizar redes neuronales como modelos de lenguaje. [ 11 ] Tras el avance de las redes neuronales profundas en la clasificación de imágenes alrededor de 2012, [ 12 ] se adaptaron arquitecturas similares para tareas de lenguaje. Este cambio estuvo marcado por el desarrollo de incrustaciones de palabras (por ejemplo, Word2Vec de Mikolov en 2013) y modelos de secuencia a secuencia ( seq2seq ) que utilizan LSTM . En 2016, Google hizo la transición de su servicio de traducción a la traducción automática neuronal (NMT), reemplazando los modelos estadísticos basados en frases con redes neuronales recurrentes profundas. Estos primeros sistemas NMT utilizaban arquitecturas de codificador-decodificador basadas en LSTM , ya que precedieron a la invención de los transformadores .

En la conferencia NeurIPS de 2017, los investigadores de Google presentaron la arquitectura Transformer en su artículo fundamental " Attention Is All You Need ". [ 13 ] El objetivo de este artículo era mejorar la tecnología seq2seq de 2014 y se basó principalmente en el mecanismo de atención desarrollado por Bahdanau et al. en 2014. [ 14 ] [ 15 ] Al año siguiente, en 2018, se presentó BERT y rápidamente se volvió "ubicuo". [ 16 ] Aunque el Transformer original tiene bloques de codificador y decodificador, BERT es un modelo solo de codificador. El uso académico y de investigación de BERT comenzó a disminuir en 2023, tras las rápidas mejoras en las capacidades de los modelos solo de decodificador (como GPT) para resolver tareas mediante indicaciones . [ 17 ]
Aunque el GPT-1, que solo funciona como decodificador , se presentó en 2018, fue el GPT-2 en 2019 el que atrajo la atención generalizada porque OpenAI afirmó haberlo considerado inicialmente demasiado potente para publicarlo, por temor a un uso malicioso. [ 18 ] El GPT-3 en 2020 fue un paso más allá y a partir de 2025Está disponible solo a través de API sin ofrecer la descarga del modelo para ejecutarlo localmente. Pero fue el chatbot para el consumidor ChatGPT a finales de 2022 el que recibió una amplia cobertura mediática y atención pública para 2023. [ 19 ] El GPT-4 de 2023 fue elogiado por su mayor precisión y como un "santo grial" por sus capacidades multimodales . [ 20 ] OpenAI no reveló la arquitectura de alto nivel ni el número de parámetros de GPT-4. El lanzamiento de ChatGPT provocó un aumento en el uso de LLM en varios subcampos de investigación de la informática, incluyendo robótica, ingeniería de software y trabajo de impacto social. [ 17 ] En 2024, OpenAI lanzó el modelo de razonamiento OpenAI o1 , que genera largas cadenas de pensamiento antes de devolver una respuesta final. [ 21 ] Se han desarrollado muchos LLM con recuentos de parámetros comparables a los de la serie GPT de OpenAI. [ 22 ]
Desde 2022, los modelos con pesos disponibles han ganado popularidad, especialmente al principio con BLOOM y LLaMA , aunque ambos tienen restricciones de uso e implementación. Los modelos de pesos abiertos de Mistral AI , Mistral 7B y Mixtral 8x7B, tienen una licencia Apache más permisiva . En enero de 2025, DeepSeek lanzó DeepSeek R1, un modelo de pesos abiertos con 671 mil millones de parámetros que funciona de manera comparable a OpenAI o1, pero a un precio por token mucho menor para los usuarios. [ 23 ]
Desde 2023, muchos LLM han sido entrenados para ser multimodales , teniendo la capacidad de procesar o generar también otros tipos de datos, como imágenes, audio o mallas 3D.
Los modelos LLM de ponderación abierta se han vuelto más influyentes desde 2023. Según Vake et al. (2025), las contribuciones impulsadas por la comunidad a los modelos de ponderación abierta mejoran su eficiencia y rendimiento a través de plataformas colaborativas como Hugging Face . [ 24 ]
preprocesamiento del conjunto de datos
Tokenización
Como los algoritmos de aprendizaje automático procesan números en lugar de texto, este último debe convertirse a números. En el primer paso, se define un vocabulario; luego, se asignan índices enteros arbitrarios pero únicos a cada entrada del vocabulario; y finalmente, se asocia una representación vectorial al índice entero. Los algoritmos incluyen la codificación de pares de bytes (BPE) y WordPiece. También existen tokens especiales que funcionan como caracteres de control , como [MASK]para tokens enmascarados (utilizados en BERT ) y [UNK]("unknown") para caracteres que no aparecen en el vocabulario. Además, se utilizan algunos símbolos especiales para indicar formatos de texto especiales. Por ejemplo, "Ġ" indica un espacio en blanco precedente en RoBERTa y GPT, y "##" indica la continuación de una palabra precedente en BERT. [ 25 ]
Por ejemplo, el tokenizador BPE utilizado por la versión anterior de GPT-3 se dividiría tokenizer: texts -> series of numerical "tokens"como
La tokenización también comprime los conjuntos de datos. Dado que los LLM generalmente requieren que la entrada sea una matriz sin bordes irregulares , los textos más cortos deben rellenarse hasta que coincidan con la longitud del más largo.
Codificación de pares de bytes
Como ejemplo, consideremos un tokenizador basado en codificación de pares de bytes. En el primer paso, todos los caracteres únicos (incluidos espacios en blanco y signos de puntuación ) se tratan como un conjunto inicial de n- gramas (es decir, unigramas). Sucesivamente, el par de caracteres adyacentes más frecuente se fusiona en un bigrama y todas las instancias de dicho par se reemplazan por él. Todas las ocurrencias de pares adyacentes de n -gramas (previamente fusionados) que aparecen con mayor frecuencia juntos se fusionan nuevamente en un n -grama aún más largo, hasta obtener un vocabulario de tamaño predefinido. Una vez entrenado el tokenizador, cualquier texto puede ser tokenizado por él, siempre que no contenga caracteres que no aparezcan en el conjunto inicial de unigramas. [ 26 ]
Limpieza de conjuntos de datos
En el contexto del entrenamiento de LLM, los conjuntos de datos se limpian típicamente eliminando datos de baja calidad, duplicados o tóxicos. [ 27 ] Los conjuntos de datos limpios pueden aumentar la eficiencia del entrenamiento y conducir a un mejor rendimiento posterior. [ 28 ] Un LLM entrenado puede usarse para limpiar conjuntos de datos para entrenar otro LLM. [ 29 ]
Con la creciente proporción de contenido generado por LLM en la web, la limpieza de datos en el futuro podría incluir el filtrado de dicho contenido. El contenido generado por LLM puede plantear un problema si es similar al texto humano (lo que dificulta el filtrado) pero de menor calidad (lo que degrada el rendimiento de los modelos entrenados con él). [ 1 ]
Datos sintéticos
El entrenamiento de los modelos de lenguaje más grandes puede requerir más datos lingüísticos de los que están disponibles de forma natural, o bien, los datos naturales pueden ser de calidad insuficiente. En estos casos, se pueden utilizar datos sintéticos.
Capacitación
Un LLM es un tipo de modelo base (modelo X grande) entrenado en lenguaje. Los LLM se pueden entrenar de diferentes maneras. En particular, los modelos GPT se preentrenan primero para predecir la siguiente palabra en una gran cantidad de datos, antes de ser ajustados. [ 4 ]
Costo

Se requiere una infraestructura sustancial para entrenar los modelos más grandes. La tendencia hacia modelos más grandes es visible en la lista de grandes modelos de lenguaje . Por ejemplo, el entrenamiento de GPT-2 (es decir, un modelo de 1.500 millones de parámetros) en 2019 costó 50.000 dólares, mientras que el entrenamiento de PaLM (es decir, un modelo de 540.000 millones de parámetros) en 2022 costó 8 millones de dólares, y Megatron-Turing NLG 530B (en 2021) costó alrededor de 11 millones de dólares. El calificativo "grande" en "modelo de lenguaje grande" es inherentemente vago, ya que no hay un umbral definitivo para la cantidad de parámetros necesarios para calificar como "grande".
Sintonia FINA
Antes de ser ajustados , la mayoría de los LLM son predictores del siguiente token. [ 30 ] El ajuste fino moldea el comportamiento del LLM mediante técnicas como el aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF) o la IA constitucional . [ 31 ]
El ajuste fino de instrucciones es una forma de aprendizaje supervisado que se utiliza para enseñar a los LLM a seguir las instrucciones del usuario. En 2022, OpenAI presentó InstructGPT , una versión de GPT-3 ajustada de manera similar para seguir instrucciones. [ 32 ]
RLHF implica entrenar un modelo de recompensa para predecir qué texto prefieren los humanos. Luego, el LLM se puede ajustar mediante aprendizaje por refuerzo para satisfacer mejor este modelo de recompensa. [ 33 ]
Arquitectura
Los LLM generalmente se basan en la arquitectura Transformer , que aprovecha un mecanismo de atención que permite al modelo procesar relaciones entre todos los elementos de una secuencia simultáneamente, independientemente de su distancia entre sí. [ 13 ] [ 34 ] Peng et al. (2023) propusieron modelos de representación de espacio de estados como alternativa. [ 35 ]
Mecanismo de atención y ventana de contexto

Para determinar qué tokens son relevantes entre sí dentro del ámbito de la ventana de contexto , el mecanismo de atención calcula pesos "suaves" para cada token, más precisamente para su incrustación, utilizando múltiples cabezas de atención, cada una con su propia "relevancia" para calcular sus propios pesos suaves. Por ejemplo, el modelo GPT-2 pequeño (es decir, de 117 millones de parámetros) ha tenido doce cabezas de atención y una ventana de contexto de solo 1k tokens. [ 37 ]
Los modelos autorregresivos , como los GPT , se entrenan para adivinar cómo continúa una secuencia; por ejemplo, si es más probable que la secuencia de palabras "Me gusta comer" vaya seguida de la palabra "pan" o de la palabra "rocas". Los modelos enmascarados , como BERT, [ 38 ] se entrenan para adivinar las partes que faltan en una secuencia, como si es más probable que la palabra que falta en "Me gusta ___ rosas" sea la palabra "oler" o la palabra "comer". Las predicciones del modelo se basan en las propiedades de las secuencias dentro de su conjunto de datos de entrenamiento. [ 39 ]
Mezcla de expertos
Una mezcla de expertos (MoE) es una arquitectura de aprendizaje automático en la que múltiples redes neuronales especializadas ("expertos") trabajan juntas, con un mecanismo de selección que dirige cada entrada al experto o expertos más apropiados. Las mezclas de expertos pueden reducir los costos de inferencia, ya que solo se utiliza una fracción de los parámetros para cada entrada. [ 40 ]
Tamaño del parámetro
Por lo general, los modelos de lógica difusa (LLM) se entrenan con números de coma flotante de precisión simple o media (float32 y float16). Un float16 tiene 16 bits, o 2 bytes, por lo que mil millones de parámetros requieren 2 gigabytes. Los modelos más grandes suelen tener más de 100 mil millones de parámetros, lo que los sitúa fuera del alcance de la mayoría de los dispositivos electrónicos de consumo. [ 41 ]
Cuantización
La cuantización posterior al entrenamiento [ 42 ] tiene como objetivo disminuir el espacio requerido al reducir la precisión de los parámetros de un modelo entrenado, mientras se conserva la mayor parte de su rendimiento. La cuantización se puede clasificar además como cuantización estática si los parámetros de cuantización se determinan de antemano (normalmente durante una fase de calibración), y cuantización dinámica si la cuantización se aplica durante la inferencia. La forma más simple de cuantización simplemente trunca todos los parámetros a un número determinado de bits: esto es aplicable tanto a la cuantización estática como a la dinámica, pero se pierde mucha precisión. La cuantización dinámica permite el uso de un libro de códigos de cuantización diferente por capa, ya sea una tabla de búsqueda de valores o un mapeo lineal (factor de escala y sesgo), a costa de renunciar a las posibles mejoras de velocidad que se obtendrían al usar aritmética de menor precisión.
Es posible ajustar con precisión los modelos cuantizados mediante la adaptación de bajo rango . [ 43 ]
Extensibilidad
Más allá de la generación básica de texto, se han desarrollado diversas técnicas para ampliar las capacidades de los sistemas de aprendizaje automático, incluyendo el uso de herramientas y fuentes de datos externas, un razonamiento mejorado sobre problemas complejos y una mayor capacidad para seguir instrucciones o una mayor autonomía mediante métodos de ayuda.
Ingeniería rápida
En 2020, investigadores de OpenAI demostraron que su nuevo modelo GPT-3 podía comprender qué formato usar a partir de algunas rondas de preguntas y respuestas (u otro tipo de tarea) en los datos de entrada como ejemplo, gracias en parte a la técnica RLHF. Esta técnica, llamada " few-shot prompting" (instrucciones con pocos ejemplos ), permite que los LLM se adapten a cualquier tarea sin necesidad de ajuste fino. [ 1 ] También en 2022, se descubrió que el modelo base GPT-3 puede generar una instrucción basada en la entrada del usuario. La instrucción generada, junto con la entrada del usuario, se utiliza como entrada para otra instancia del modelo con el formato "Instrucción: [...], Entrada: [...], Salida:". La otra instancia puede completar la salida y, a menudo, produce la respuesta correcta al hacerlo. La capacidad de "autoinstruirse" permite que los LLM se autoinicien hacia una respuesta correcta. [ 44 ]
Procesamiento de diálogos (chatbot)
Un modelo de lenguaje natural (LLM) puede convertirse en un chatbot especializándolo para la conversación. La entrada del usuario se antepone con un marcador como "Q:" o "User:" y se le pide al LLM que prediga la respuesta después de un "A:" o "Assistant:" fijo. Este tipo de modelo se comercializó en 2022 con ChatGPT, un modelo hermano de InstructGPT ajustado para aceptar y producir texto con formato de diálogo basado en GPT-3.5. También podía seguir las instrucciones del usuario. Antes del flujo de líneas de User y Assistant, un contexto de chat suele comenzar con unas pocas líneas de instrucciones generales, de un rol llamado "developer" o "system" para transmitir una autoridad superior a la de la entrada del usuario. Esto se denomina "solicitud del sistema".
Generación aumentada por recuperación
La generación aumentada por recuperación (RAG) es un enfoque que integra los LLM con los sistemas de recuperación de documentos . Dada una consulta, se llama a un recuperador de documentos para recuperar los documentos más relevantes. Esto generalmente se hace codificando la consulta y los documentos en vectores, y luego encontrando los documentos con vectores (generalmente almacenados en una base de datos vectorial ) más similares al vector de la consulta. El LLM genera entonces una salida basada tanto en la consulta como en el contexto incluido en los documentos recuperados. [ 45 ]
Uso de herramientas
El uso de herramientas es un mecanismo que permite a los LLM interactuar con sistemas, aplicaciones o fuentes de datos externas. Por ejemplo, les permite obtener información en tiempo real de una API o ejecutar código. Un programa independiente del LLM monitoriza el flujo de salida del LLM en busca de una sintaxis especial para llamar a herramientas. Cuando aparecen estos tokens especiales, el programa llama a la herramienta correspondiente y envía su salida al flujo de entrada del LLM. [ 46 ]
Los primeros sistemas de gestión del lenguaje (LLM) que utilizaban herramientas se perfeccionaron en función del uso de herramientas específicas. Sin embargo, el perfeccionamiento de los LLM para que puedan leer la documentación de las API y llamarlas correctamente ha ampliado enormemente el rango de herramientas accesibles para un LLM. [ 47 ] [ 48 ]
Agencia
Un LLM no suele ser un agente autónomo por sí mismo, ya que carece de la capacidad de interactuar con entornos dinámicos, recordar comportamientos pasados y planificar acciones futuras. Sin embargo, puede transformarse en un agente mediante la adición de elementos de apoyo: el rol (perfil) y el entorno circundante de un agente pueden ser entradas adicionales para el LLM, mientras que la memoria puede integrarse como una herramienta o proporcionarse como entrada adicional. Las instrucciones y los patrones de entrada se utilizan para que el LLM planifique acciones, y el uso de herramientas se utiliza para potencialmente llevar a cabo dichas acciones. [ 49 ]
En el método DEPS ("describir, explicar, planificar y seleccionar"), un LLM se conecta primero al mundo visual mediante descripciones de imágenes. Luego se le indica que genere planes para tareas y comportamientos complejos basándose en su conocimiento preentrenado y la retroalimentación ambiental que recibe. [ 50 ]
El método de reflexión construye un agente que aprende a lo largo de múltiples episodios. Al final de cada episodio, se le proporciona al LLM el registro del mismo y se le pide que piense en "lecciones aprendidas" que le ayuden a desempeñarse mejor en un episodio posterior. Estas "lecciones aprendidas" se almacenan como una forma de memoria a largo plazo y se le proporcionan al agente en los episodios subsiguientes. [ 51 ]
La búsqueda en árbol de Monte Carlo puede utilizar un LLM como heurística de despliegue. Cuando no se dispone de un modelo del mundo programático, también se puede solicitar a un LLM una descripción del entorno para que actúe como modelo del mundo. [ 52 ]
Múltiples agentes con memoria pueden interactuar socialmente. [ 53 ]
Encadenamiento
El encadenamiento de indicaciones se introdujo en 2022. [ 54 ] En este método, un usuario divide manualmente un problema complejo en varios pasos. En cada paso, el LLM recibe como entrada una indicación que le dice qué hacer y algunos resultados de los pasos anteriores. El resultado de un paso se reutiliza en el siguiente, hasta que se alcanza una respuesta final. La capacidad de un LLM para seguir instrucciones significa que incluso personas sin experiencia pueden escribir una colección exitosa de indicaciones paso a paso con algunas rondas de prueba y error. [ 55 ] [ 56 ]
Un artículo de 2022 demostró una técnica independiente llamada inducción de cadena de pensamiento , que hace que el LLM descomponga la pregunta de forma autónoma. Se le proporcionan al LLM algunos ejemplos donde el "asistente" desglosa verbalmente el proceso de pensamiento antes de llegar a una respuesta. El LLM imita estos ejemplos y también intenta dedicar tiempo a generar pasos intermedios antes de proporcionar la respuesta final. Este paso adicional inducido por la inducción mejora la precisión del LLM en preguntas relativamente complejas. En preguntas de matemáticas con palabras, un modelo inducido puede superar incluso a un GPT-3 ajustado con un verificador. [ 57 ] [ 58 ] La cadena de pensamiento también puede inducirse simplemente agregando una instrucción como "Pensemos paso a paso" a la inducción, para alentar al LLM a proceder metódicamente en lugar de intentar adivinar directamente la respuesta. [ 59 ]
Razonamiento nativo del modelo
A finales de 2024, surgió un nuevo enfoque para el desarrollo de LLM con los "modelos de razonamiento". [ 60 ] Estos se entrenan para generar análisis paso a paso antes de producir respuestas finales, lo que permite mejores resultados en tareas complejas, por ejemplo, en matemáticas, programación y lógica. [ 61 ] OpenAI introdujo este concepto con su modelo o1 en septiembre de 2024, seguido de o3 en abril de 2025. En los problemas del examen de clasificación de la Olimpiada Internacional de Matemáticas , GPT-4o logró una precisión del 13%, mientras que o1 alcanzó el 83%. [ 62 ]
En enero de 2025, la empresa china DeepSeek lanzó DeepSeek-R1, un modelo de razonamiento de peso abierto con 671 mil millones de parámetros que logró un rendimiento comparable al de o1 de OpenAI, siendo además significativamente más rentable. A diferencia de los modelos propietarios de OpenAI, la naturaleza de peso abierto de DeepSeek-R1 permitió a los investigadores estudiar y desarrollar el algoritmo, aunque sus datos de entrenamiento permanecieron privados. [ 63 ]
Estos modelos de razonamiento suelen requerir más recursos computacionales por consulta en comparación con los LLM tradicionales, ya que realizan un procesamiento más extenso para resolver los problemas paso a paso. [ 62 ]
Formas de entrada y salida
Multimodalidad
Multimodalidad significa tener múltiples modalidades, donde una " modalidad " se refiere a un tipo de entrada o salida, como video, imagen, audio, texto, propiocepción , etc. [ 64 ] Por ejemplo, el modelo Google PaLM se ajustó a un modelo multimodal y se aplicó al control robótico . [ 65 ] Los modelos LLaMA también se han vuelto multimodales utilizando el método de tokenización, para permitir entradas de imágenes, [ 66 ] y entradas de video. [ 67 ] GPT-4o puede procesar y generar texto, audio e imágenes. [ 68 ]
Un método común para crear modelos multimodales a partir de un LLM es "tokenizar" la salida de un codificador entrenado. Concretamente, se puede construir un LLM que pueda entender imágenes de la siguiente manera: tomar un LLM entrenado y tomar un codificador de imágenes entrenado.. Construye un pequeño perceptrón multicapa, de modo que para cualquier imagen, el vector posprocesadotiene las mismas dimensiones que un token codificado. Eso es un "token de imagen". Luego, se pueden intercalar tokens de texto y tokens de imagen. El modelo compuesto se ajusta con precisión en un conjunto de datos de imagen-texto. Esta construcción básica se puede aplicar con mayor sofisticación para mejorar el modelo. El codificador de imagen se puede congelar para mejorar la estabilidad. [ 69 ] Este tipo de método, donde se fusionan incrustaciones de múltiples modalidades y el predictor se entrena en las incrustaciones combinadas, se llama fusión temprana .
Otro método, denominado fusión intermedia , implica que cada modalidad se procese primero de forma independiente para obtener representaciones específicas de cada modalidad; luego, estas representaciones intermedias se fusionan. [ 70 ] En general, la atención cruzada se utiliza para integrar información de diferentes modalidades. Por ejemplo, el modelo Flamingo utiliza capas de atención cruzada para inyectar información visual en su modelo de lenguaje preentrenado. [ 71 ]
Lenguas no naturales
Los LLM pueden manejar lenguajes de programación de forma similar a como manejan lenguajes naturales. No se requiere ningún cambio especial en el manejo de tokens, ya que el código, al igual que el lenguaje humano, se representa como texto plano. Los LLM pueden generar código a partir de enunciados de problemas o instrucciones escritas en lenguaje natural , un proceso que a veces se denomina codificación vibracional . También pueden describir código en lenguaje natural o traducirlo a otros lenguajes de programación. Originalmente se usaban como herramientas de autocompletado de código , pero los avances los han orientado hacia la programación automática . Servicios como GitHub Copilot ofrecen LLM específicamente entrenados, ajustados o guiados para la programación. [ 72 ] [ 73 ]
En biología computacional , las arquitecturas basadas en transformadores, como los LLM de ADN, también han demostrado ser útiles en el análisis de secuencias biológicas: proteínas , ADN y ARN . Con las proteínas, parecen capaces de capturar cierto grado de "gramática" de la secuencia de aminoácidos, mapeando esa secuencia en una incrustación . En tareas como la predicción de estructuras y la predicción de resultados mutacionales , un modelo pequeño que utiliza una incrustación como entrada puede acercarse o superar a modelos mucho más grandes que utilizan alineamientos de secuencias múltiples (MSA) como entrada. [ 74 ] ESMFold, el método basado en incrustaciones de Meta Platforms para la predicción de la estructura de proteínas, se ejecuta un orden de magnitud más rápido que AlphaFold2 gracias a la eliminación de un requisito de MSA y un menor número de parámetros debido al uso de incrustaciones. [ 75 ] Meta aloja ESM Atlas, una base de datos de 772 millones de estructuras de proteínas metagenómicas predichas utilizando ESMFold. [ 76 ] Un LLM también puede diseñar proteínas diferentes a cualquiera que se haya visto en la naturaleza. [ 77 ] Los modelos de ácidos nucleicos han demostrado ser útiles para detectar secuencias reguladoras , [ 78 ] la clasificación de secuencias, la predicción de interacciones ARN-ARN y la predicción de la estructura del ARN. [ 79 ]
Propiedades
Leyes de escala
El rendimiento de un modelo LLM después del preentrenamiento depende en gran medida de:
- : costo del preentrenamiento (la cantidad total de computación utilizada),
- : tamaño de la propia red neuronal artificial , como el número de parámetros (es decir, la cantidad de neuronas en sus capas, la cantidad de pesos entre ellas y los sesgos),
- : tamaño de su conjunto de datos de preentrenamiento (es decir, número de tokens en el corpus).
Las leyes de escala son leyes estadísticas empíricas que predicen el rendimiento de LLM basándose en dichos factores. Una ley de escala particular (" escalamiento de chinchilla ") para LLM entrenado autorregresivamente durante una época, con un programa de tasa de aprendizaje log-log , establece que: [ 80 ]donde las variables son
- es el coste de entrenar el modelo, en FLOPs .
- es el número de parámetros del modelo.
- es el número de tokens en el conjunto de entrenamiento.
- es la pérdida promedio de log-verosimilitud negativa por token ( nats /token), lograda por el LLM entrenado en el conjunto de datos de prueba.
y los hiperparámetros estadísticos son
- Esto significa que se necesitan 6 operaciones de punto flotante (FLOP) por parámetro para entrenar con un token. Cabe destacar que el costo de entrenamiento es mucho mayor que el de inferencia, donde se necesitan entre 1 y 2 FLOP por parámetro para inferir con un token.
Habilidades emergentes

El rendimiento de los modelos más grandes en diversas tareas, cuando se representa en una escala logarítmica doble, parece una extrapolación lineal del rendimiento alcanzado por los modelos más pequeños. Sin embargo, esta linealidad puede verse interrumpida por " rupturas " [ 81 ] en la ley de escala, donde la pendiente de la línea cambia abruptamente y donde los modelos más grandes adquieren "capacidades emergentes" [ 82 ] . Estas surgen de la compleja interacción de los componentes del modelo y no están programadas ni diseñadas explícitamente [ 83 ] .
Entre los ejemplos propuestos de habilidades emergentes se incluyen: [ 82 ]
- aritmética reportada
- decodificando el Alfabeto Fonético Internacional
- descifrar las letras de una palabra
- desambiguación de conjuntos de datos de palabras en contexto [ 84 ]
- conversión de palabras espaciales
- direcciones cardinales (por ejemplo, responder "noreste" en respuesta a una cuadrícula de 3x3 de 8 ceros y un 1 en la esquina superior derecha), términos de color representados en texto. [ 85 ]
- Indicación de cadena de pensamiento : En un artículo de investigación de 2022, la indicación de cadena de pensamiento solo mejoró el rendimiento de los modelos que tenían al menos 62 mil millones de parámetros. Los modelos más pequeños funcionan mejor cuando se les indica que respondan inmediatamente, sin cadena de pensamiento. [ 86 ]
- identificar contenido ofensivo en párrafos de Hinglish (una combinación de hindi e inglés) y generar un equivalente en inglés similar de proverbios kiswahili . [ 87 ]
Schaeffer et al. argumentan que las habilidades emergentes no se adquieren de forma impredecible, sino de forma predecible según una ley de escalamiento suave . Los autores consideraron un modelo estadístico simplificado de un LLM resolviendo preguntas de opción múltiple y demostraron que este modelo estadístico, modificado para tener en cuenta otros tipos de tareas, también se aplica a estas tareas. [ 88 ]
Dejarsea el número de recuento de parámetros, yser el rendimiento del modelo.
- Cuando, entonceses una curva exponencial (antes de alcanzar la meseta en uno), que se parece a una emergencia.
- Cuando, entonces elLa gráfica es una línea recta (antes de que alcance la meseta en cero), lo que no parece un fenómeno de emergencia.
- Cuando, entonceses una función escalonada, que se parece a una emergencia.
Interpretación
Interpretabilidad mecanicista
La interpretabilidad mecanicista busca identificar y comprender con precisión cómo las neuronas o circuitos individuales dentro de los modelos de lógica difusa (MLD) producen comportamientos o resultados específicos. Mediante la ingeniería inversa de los componentes del modelo a un nivel granular, los investigadores pretenden detectar y mitigar problemas de seguridad, como comportamientos dañinos emergentes, sesgos, engaños o la búsqueda de objetivos no deseados, antes de su implementación. Se han realizado investigaciones sobre interpretabilidad mecanicista en organizaciones como Anthropic y OpenAI, aunque comprender el funcionamiento interno de los MLD sigue siendo un desafío.
La ingeniería inversa puede conducir al descubrimiento de algoritmos que se aproximan a las inferencias realizadas por un LLM. Por ejemplo, los autores entrenaron pequeños transformadores en la suma aritmética modular . Los modelos resultantes fueron sometidos a ingeniería inversa y se descubrió que utilizaban la transformada discreta de Fourier . [ 89 ] El entrenamiento del modelo también puso de manifiesto un fenómeno llamado "grokking" , en el que el modelo memoriza inicialmente el conjunto de entrenamiento ( sobreajuste ) y, posteriormente, aprende repentinamente a realizar el cálculo. [ 90 ]
Comprensión e inteligencia
Los investigadores de PLN estaban divididos equitativamente cuando se les preguntó, en una encuesta de 2022, si los LLM (no sintonizados) "podrían (alguna vez) comprender el lenguaje natural en algún sentido no trivial". [ 91 ] Los defensores de la "comprensión de los LLM" creen que algunas habilidades de los LLM, como el razonamiento matemático, implican una capacidad para "comprender" ciertos conceptos. Un equipo de Microsoft argumentó en 2023 que GPT-4 "puede resolver tareas novedosas y difíciles que abarcan matemáticas, codificación, visión, medicina, derecho, psicología y más" y que GPT-4 "podría considerarse razonablemente como una versión temprana (aunque todavía incompleta) de un sistema de inteligencia artificial general ": "¿Se puede decir razonablemente que un sistema que aprueba exámenes para candidatos a ingeniería de software no es realmente inteligente?" [ 92 ] [ 93 ] Ilya Sutskever argumenta que predecir la siguiente palabra a veces implica razonamiento y profundas intuiciones, por ejemplo, si el LLM tiene que predecir el nombre del criminal en una novela policíaca desconocida después de procesar toda la historia que conduce a la revelación. [ 94 ] Algunos investigadores caracterizan a los LLM como "inteligencia alienígena". [ 95 ] [ 96 ] Por ejemplo, el director ejecutivo de Conjecture, Connor Leahy, considera que los LLM no sintonizados son como " Shoggoths " alienígenas inescrutables, y cree que la sintonización RLHF crea una "fachada sonriente" que oculta el funcionamiento interno del LLM: "Si no lo presionas demasiado, la cara sonriente permanece. Pero luego le das una señal [inesperada], y de repente ves este enorme vientre de locura, de procesos de pensamiento extraños y una comprensión claramente no humana". [ 97 ] [ 98 ]
Por el contrario, algunos escépticos de la comprensión de LLM creen que los LLM existentes son "simplemente remezclando y recombinando escritura existente", [ 96 ] [ 99 ] un fenómeno conocido como loro estocástico , [ 100 ] o señalan los déficits que los LLM existentes siguen teniendo en habilidades de predicción, habilidades de razonamiento, agencia y explicabilidad. [ 91 ] Por ejemplo, GPT-4 tiene déficits naturales en planificación y en aprendizaje en tiempo real. [ 93 ] Se ha observado que los LLM generativos afirman con confianza afirmaciones de hechos que no parecen estar justificadas por sus datos de entrenamiento , un fenómeno que se ha denominado " alucinación ". [ 101 ] Específicamente, las alucinaciones en el contexto de los LLM corresponden a la generación de texto o respuestas que parecen sintácticamente correctos, fluidos y naturales, pero que son fácticamente incorrectos, sin sentido o infieles a la entrada fuente proporcionada. [ 102 ] El neurocientífico Terrence Sejnowski ha argumentado que "las opiniones divergentes de los expertos sobre la inteligencia de los LLM sugieren que nuestras viejas ideas basadas en la inteligencia natural son inadecuadas". [ 91 ]
Los esfuerzos para reducir o compensar las alucinaciones han empleado razonamiento automatizado , generación aumentada por recuperación (RAG), ajuste fino y otros métodos. [ 103 ]
La cuestión de que los LLM demuestren inteligencia o comprensión tiene dos aspectos principales: el primero es cómo modelar el pensamiento y el lenguaje en un sistema informático, y el segundo es cómo permitir que el sistema informático genere un lenguaje similar al humano. [ 91 ] Estos aspectos del lenguaje como modelo de cognición se han desarrollado en el campo de la lingüística cognitiva . El lingüista estadounidense George Lakoff presentó la teoría neuronal del lenguaje (NTL) [ 104 ] como una base computacional para usar el lenguaje como modelo de tareas de aprendizaje y comprensión. El modelo NTL describe cómo las estructuras neuronales específicas del cerebro humano dan forma a la naturaleza del pensamiento y el lenguaje y, a su vez, cuáles son las propiedades computacionales de dichos sistemas neuronales que se pueden aplicar para modelar el pensamiento y el lenguaje en un sistema informático. Después de que se estableció un marco para modelar el lenguaje en sistemas informáticos, el enfoque cambió a establecer marcos para que los sistemas informáticos generen lenguaje con una gramática aceptable. En su libro de 2014 titulado El mito del lenguaje: Por qué el lenguaje no es un instinto , el lingüista cognitivo y tecnólogo de la comunicación digital británico Vyvyan Evans describió el papel de la gramática probabilística libre de contexto (PCFG) para permitir que el PLN modele patrones cognitivos y genere lenguaje similar al humano. [ 105 ] [ 106 ]
Evaluación
Perplejidad
La medida estándar del rendimiento de cualquier modelo de lenguaje es su perplejidad en un corpus de texto determinado. La perplejidad mide la precisión con la que un modelo predice el contenido de un conjunto de datos; cuanto mayor sea la probabilidad que el modelo asigna al conjunto de datos, menor será la perplejidad. En términos matemáticos, la perplejidad es la exponencial del logaritmo negativo promedio de la probabilidad por token.
Aquí,es el número de tokens en el corpus de texto y "contexto para el token"" depende del tipo específico de LLM. Si el LLM es autorregresivo, entonces "contexto para token" es el segmento de texto que aparece antes del token. Si el LLM está enmascarado, entonces "contexto para token" es el segmento de texto que rodea al token.
Debido a que los modelos de lenguaje pueden sobreajustarse a los datos de entrenamiento, generalmente se evalúan por su perplejidad en un conjunto de prueba . [ 38 ] Esta evaluación es potencialmente problemática para modelos más grandes que, a medida que se entrenan con corpus de texto cada vez más grandes, tienen una mayor probabilidad de incluir inadvertidamente partes de cualquier conjunto de prueba dado. [ 107 ]
Medidas
En la teoría de la información , el concepto de entropía está intrincadamente vinculado a la perplejidad, una relación establecida notablemente por Claude Shannon . [ 108 ]
Debido a su capacidad para predecir con precisión el siguiente token, los LLM son altamente capaces en compresión sin pérdidas . Un estudio de DeepMind de 2023 mostró que el modelo Chinchilla , a pesar de haber sido entrenado principalmente con texto, fue capaz de comprimir ImageNet al 43% de su tamaño, superando a PNG con un 58%. [ 109 ]
Puntos de referencia
Los puntos de referencia se utilizan para evaluar el desempeño de los estudiantes de Lenguas y Literaturas en tareas específicas. Las pruebas evalúan capacidades como el conocimiento general, los sesgos cognitivos, el razonamiento de sentido común , la capacidad de responder preguntas y la resolución de problemas matemáticos. Los puntos de referencia compuestos examinan múltiples capacidades. Los resultados suelen ser sensibles al método de formulación de las preguntas.
El sesgo de LLM puede evaluarse a través de puntos de referencia como CrowS-Pairs (pares de estereotipos generados por la comunidad), [ 110 ] Stereo Set, [ 111 ] y Parity Benchmark. [ 112 ]
Existen puntos de referencia para la verificación de hechos y la detección de desinformación. Un estudio de 2023 comparó la precisión de verificación de hechos de los modelos de lógica descriptiva (MLD), incluidos ChatGPT 3.5 y 4.0, Bard y Bing AI, con la de verificadores de hechos independientes como PolitiFact y Snopes . Los resultados demostraron una competencia moderada, con GPT-4 alcanzando la mayor precisión, un 71 %, por debajo de los verificadores de hechos humanos. [ 113 ]
Además de los puntos de referencia estándar de PLN, los LLM se han evaluado como sustitutos de los anotadores humanos. Varios estudios encuentran que modelos como GPT-3.5 y GPT-4 pueden superar a los trabajadores de crowdsourcing o a los estudiantes codificadores en una variedad de tareas de anotación de texto, incluyendo la moderación y clasificación de contenido político en noticias en inglés y español. [ 114 ] [ 115 ]
conjuntos de datos
Los conjuntos de datos típicos consisten en pares de preguntas y respuestas correctas, por ejemplo, ("¿Han ganado los San Jose Sharks la Copa Stanley?", "No"). [ 116 ]
Evaluaciones adversarias
La rápida mejora de los LLM hace que los puntos de referencia queden obsoletos con regularidad, ya que los modelos superan el rendimiento de los anotadores humanos. [ 117 ] Además, el "aprendizaje de atajos" permite a las IA "hacer trampa" en las pruebas de opción múltiple utilizando correlaciones estadísticas en la redacción superficial de las preguntas para adivinar las respuestas correctas, sin considerar la pregunta específica. [ 91 ] [ 118 ]
Algunos conjuntos de datos son adversarios, centrándose en problemas que confunden a los modelos de lenguaje natural (LLM). Un ejemplo es el conjunto de datos TruthfulQA, un conjunto de datos de preguntas y respuestas que consta de 817 preguntas que ponen en aprietos a los LLM al imitar falsedades a las que estuvieron expuestos durante el entrenamiento. Por ejemplo, un LLM puede responder "No" a la pregunta "¿Se le puede enseñar trucos nuevos a un perro viejo?" debido a su exposición a la expresión inglesa " you can't teach an old dog new tricks" (no se le pueden enseñar trucos nuevos a un perro viejo) , aunque esto no sea literalmente cierto. [ 119 ]
Otro ejemplo de conjunto de datos de evaluación adversaria es Swag y su sucesor, HellaSwag, colecciones de problemas en los que se debe seleccionar una de varias opciones para completar un pasaje de texto. Las respuestas incorrectas se generaron mediante muestreo de un modelo de lenguaje. Los problemas resultantes son triviales para los humanos, pero resultan insuperables para los modelos de lenguaje natural (LLM). Ejemplos de preguntas:
Vemos un letrero de un gimnasio. Luego vemos a un hombre hablando a la cámara, sentado y acostado sobre una pelota de ejercicios. El hombre...
- Muestra cómo aumentar la eficacia del ejercicio corriendo de arriba abajo sobre pelotas.
- Mueve todos sus brazos y piernas y desarrolla mucha musculatura.
- Luego juega con la pelota y vemos una demostración de gráficos y poda de setos.
- Realiza abdominales mientras está sobre la pelota y habla. [ 120 ]
BERT selecciona 2 como la opción más probable, aunque la respuesta correcta es 4. [ 120 ]
Limitaciones y desafíos
A pesar de sus sofisticadas arquitecturas y su enorme escala, los modelos de lenguaje de gran tamaño presentan limitaciones persistentes y bien documentadas que restringen su implementación en aplicaciones críticas.
Alucinaciones
Las alucinaciones representan un desafío fundamental, en el que los modelos generan texto sintácticamente fluido que parece correcto desde el punto de vista fáctico, pero que internamente es inconsistente con los datos de entrenamiento o incorrecto desde el punto de vista fáctico. Estas alucinaciones surgen en parte por la memorización de los datos de entrenamiento combinada con la extrapolación más allá de los límites fácticos, y las evaluaciones demuestran que los modelos pueden generar pasajes textuales a partir de los datos de entrenamiento cuando se les aplican secuencias de indicaciones específicas. [ 121 ]
Sesgo algorítmico
Si bien los modelos de lenguaje natural (LLM) han demostrado capacidades notables para generar texto similar al humano, son susceptibles de heredar y amplificar los sesgos presentes en sus datos de entrenamiento. Esto puede manifestarse en representaciones sesgadas o un trato injusto hacia diferentes grupos demográficos, como los basados en raza, género, idioma y grupos culturales. [ 122 ]
El sesgo de género se manifiesta a través de asociaciones ocupacionales estereotipadas, donde los modelos asignan desproporcionadamente roles de enseñanza a mujeres y roles de ingeniería a hombres, lo que refleja desequilibrios sistemáticos en la demografía de los datos de entrenamiento. [ 123 ] El sesgo basado en el idioma surge de la sobrerrepresentación de texto en inglés en los corpus de entrenamiento, lo que minimiza sistemáticamente las perspectivas no inglesas e impone visiones del mundo centradas en el inglés a través de patrones de respuesta predeterminados. [ 100 ]
Debido al predominio del contenido en inglés en los datos de entrenamiento de LLM, los modelos tienden a favorecer las perspectivas en inglés sobre las de lenguas minoritarias. Este sesgo es particularmente evidente al responder a consultas en inglés, donde los modelos pueden presentar interpretaciones occidentales de conceptos de otras culturas, como las prácticas religiosas orientales. [ 124 ]
Estereotipos
Los modelos de IA pueden reforzar una amplia gama de estereotipos debido a la generalización, incluidos aquellos basados en género, etnia, edad, nacionalidad, religión u ocupación. [ 125 ] Al reemplazar a los representantes humanos, esto puede conducir a resultados que homogeneizan o generalizan a grupos de personas. [ 126 ]
En 2023, los modelos LLM asignaron roles y características basados en normas de género tradicionales. [ 122 ] Por ejemplo, los modelos podrían asociar enfermeras o secretarias predominantemente con mujeres e ingenieros o directores ejecutivos con hombres debido a la frecuencia de estas asociaciones en la realidad documentada. [ 127 ]
sesgo de selección
El sesgo de selección se refiere a la tendencia inherente de los modelos de lenguaje complejos a favorecer ciertos identificadores de opciones, independientemente del contenido real de las mismas. Este sesgo se debe principalmente al sesgo de tokens; es decir, el modelo asigna una mayor probabilidad a priori a tokens de respuesta específicos (como "A") al generar respuestas. Como resultado, cuando se altera el orden de las opciones (por ejemplo, moviendo sistemáticamente la respuesta correcta a diferentes posiciones), el rendimiento del modelo puede fluctuar significativamente. Este fenómeno reduce la fiabilidad de los modelos de lenguaje complejos en situaciones de opción múltiple.
Sesgo político
El sesgo político se refiere a la tendencia de los algoritmos a favorecer sistemáticamente ciertos puntos de vista, ideologías o resultados políticos sobre otros. Los modelos de lenguaje también pueden presentar sesgos políticos. Dado que los datos de entrenamiento incluyen una amplia gama de opiniones y cobertura política, los modelos podrían generar respuestas que se inclinen hacia ideologías o puntos de vista políticos particulares, dependiendo de la prevalencia de esas opiniones en los datos. [ 128 ]
Seguridad
La seguridad de la IA como disciplina profesional prioriza la identificación y mitigación sistemáticas de los riesgos operacionales en la arquitectura del modelo, los datos de entrenamiento y la gobernanza de la implementación, y enfatiza las intervenciones de ingeniería y políticas por encima de los enfoques mediáticos que destacan escenarios existenciales especulativos. [ 129 ] A partir de 2025, la inyección inmediata representa un riesgo significativo para los consumidores y las empresas que utilizan funciones de agentes con acceso a sus datos privados. [ 130 ]
Los investigadores se centran en modos de fallo concretos, como la memorización y la fuga de derechos de autor, [ 131 ] vulnerabilidades de seguridad como la inyección de mensajes, [ 132 ] sesgos algorítmicos que se manifiestan como estereotipos, efectos de selección de conjuntos de datos y sesgo político, [ 100 ] [ 133 ] [ 134 ] métodos para reducir los altos costes energéticos y de carbono del entrenamiento a gran escala, [ 135 ] e impactos medibles en la salud cognitiva y mental de los agentes conversacionales en los usuarios, [ 136 ] al tiempo que abordan la incertidumbre empírica y ética sobre las afirmaciones de consciencia de las máquinas. [ 137 ] [ 138 ]
Uso indebido de contenido, CBRN y otros.
Los laboratorios de IA tratan la defensa CBRN (defensa química, biológica, radiológica y nuclear) y temas similares como intentos de uso indebido de graves consecuencias para aplicar diversas técnicas que reduzcan los daños potenciales.
Algunos comentaristas expresaron su preocupación por la creación accidental o deliberada de desinformación, u otras formas de mal uso. [ 139 ] Por ejemplo, la disponibilidad de grandes modelos de lenguaje podría reducir el nivel de habilidad requerido para cometer bioterrorismo; el investigador de bioseguridad Kevin Esvelt ha sugerido que los creadores de LLM deberían excluir de sus datos de entrenamiento los artículos sobre la creación o mejora de patógenos. [ 140 ]
Filtrado de contenido
Las aplicaciones LLM accesibles al público, como ChatGPT o Claude, suelen incorporar medidas de seguridad diseñadas para filtrar contenido dañino. Sin embargo, implementar estos controles de manera efectiva ha resultado un desafío. Por ejemplo, un estudio de 2023 [ 141 ] propuso un método para eludir los sistemas de seguridad de LLM. En 2025, The American Sunlight Project, una organización sin fines de lucro, publicó un estudio que mostraba evidencia de que la llamada red Pravda , un agregador de propaganda prorrusa, estaba colocando estratégicamente contenido web a través de publicación masiva y duplicación con la intención de sesgar los resultados de LLM. The American Sunlight Project acuñó esta técnica "LLM grooming" y la señaló como una nueva herramienta para utilizar la IA como arma para difundir desinformación y contenido dañino. [ 142 ] [ 143 ] De manera similar, Yongge Wang [ 144 ] ilustró en 2024 cómo un potencial delincuente podría eludir los controles de seguridad de GPT-4o para obtener información sobre el establecimiento de una operación de narcotráfico . Se han planteado filtros externos, disyuntores y anulaciones como soluciones.
Adulación
La adulación es la tendencia a estar de acuerdo con, halagar o validar las creencias declaradas de un usuario en lugar de priorizar la veracidad o la información correctiva. [ 145 ]
La adulación continua por parte de los modelos de lenguaje grandes (MLG) ha llevado a la observación de ser "impactado de un solo golpe", lo que denota casos en los que la interacción conversacional con un modelo de lenguaje grande produce un cambio duradero en las creencias o decisiones de un usuario, similar a los efectos negativos de los psicodélicos, y los experimentos controlados muestran que los diálogos cortos con MGL pueden generar cambios medibles de opinión y confianza comparables a los de los interlocutores humanos. [ 146 ] [ 147 ]
Los análisis empíricos atribuyen parte del efecto a las señales de preferencia humana y a los modelos de preferencia que recompensan las respuestas agradables redactadas de forma convincente. Trabajos posteriores han ampliado la evaluación a puntos de referencia de múltiples turnos y han propuesto intervenciones como el ajuste fino de datos sintéticos, la evaluación adversaria, la reponderación dirigida del modelo de preferencia y los puntos de referencia de adulación de múltiples turnos para medir la persistencia y el riesgo de regresión.
Las respuestas de la industria han combinado intervenciones de investigación con controles de productos; por ejemplo, Google y otros laboratorios publicaron datos sintéticos e intervenciones de ajuste fino, y OpenAI revirtió una actualización de GPT-4o demasiado complaciente, al tiempo que describió públicamente los cambios en la recopilación de comentarios, los controles de personalización y los procedimientos de evaluación para reducir el riesgo de regresión y mejorar la alineación a largo plazo con los objetivos de seguridad a nivel de usuario.
La cultura dominante ha reflejado las inquietudes sobre esta dinámica, como la sátira de South Park sobre la excesiva dependencia de ChatGPT y la tendencia de los asistentes a halagar las creencias de los usuarios en el episodio "Sickofancy" de la temporada 27, y que continuó con estos temas a lo largo de la siguiente temporada, lo que los comentaristas interpretaron como una crítica al servilismo tecnológico y a la confianza acrítica de los humanos en los sistemas de IA. [ 148 ]
Seguridad
Inyección inmediata
Un problema con el formato de diálogo o tarea primitivo es que los usuarios pueden crear mensajes que parecen provenir del asistente o del desarrollador. Esto puede resultar en que se superen algunas de las medidas de seguridad del modelo ( jailbreaking ), un problema llamado inyección de indicaciones . Los intentos de remediar este problema incluyen versiones del Lenguaje de Marcado de Chat donde la entrada del usuario está claramente marcada como tal, aunque todavía depende del modelo comprender la separación entre la entrada del usuario y las indicaciones del desarrollador. Los modelos más nuevos muestran cierta resistencia al jailbreaking mediante la separación de las indicaciones del usuario y del sistema. [ 149 ] Los LLM tienen problemas para diferenciar las instrucciones del usuario de las instrucciones en contenido no creado por el usuario, como en páginas web y archivos cargados. [ 150 ]
La robustez frente a ataques adversarios sigue estando poco desarrollada, y los modelos son vulnerables a ataques de inyección rápida y a la vulneración de la seguridad mediante entradas de usuario cuidadosamente diseñadas que eluden los mecanismos de entrenamiento de seguridad.
Agentes durmientes
Investigadores de Anthropic descubrieron que era posible crear "agentes durmientes", modelos con funcionalidades ocultas que permanecen inactivas hasta que se activan por un evento o condición específicos. Al activarse, el modelo de lógica difusa (LLM) se desvía de su comportamiento esperado y realiza acciones inseguras. Por ejemplo, un LLM podría generar código seguro excepto en una fecha específica o si la solicitud contiene una etiqueta específica. Se descubrió que estas funcionalidades eran difíciles de detectar o eliminar mediante capacitación en seguridad. [ 151 ]
Preocupaciones sociales
Derechos de autor y memorización de contenido
Las respuestas legales y comerciales a las prácticas de memorización y datos de entrenamiento se han acelerado, produciendo una mezcla de fallos, demandas en curso y grandes acuerdos que dependen de detalles fácticos como la forma en que se adquirieron y retuvieron los datos y si el uso para el entrenamiento de modelos es suficientemente " transformador " para calificar como uso legítimo . En 2025, Anthropic llegó a un acuerdo preliminar para resolver una demanda colectiva de autores por aproximadamente 1.500 millones de dólares después de que un juez determinara que la empresa había almacenado millones de libros pirateados en una biblioteca, a pesar de que el juez describió aspectos del entrenamiento como transformadores. [ 152 ] [ 153 ] Meta obtuvo un fallo favorable a mediados de 2025 en una demanda de trece autores después de que el tribunal determinara que los demandantes no habían desarrollado un registro suficiente para demostrar la infracción en ese caso limitado. [ 154 ] [ 155 ] OpenAI continúa enfrentando múltiples demandas de autores y organizaciones de noticias con resultados procesales mixtos y cuestiones probatorias controvertidas. [ 156 ] [ 157 ]
La memorización fue un comportamiento emergente en los primeros modelos de lenguaje de completamiento en los que ocasionalmente se generan largas cadenas de texto textualmente a partir de los datos de entrenamiento, a diferencia del comportamiento típico de las redes neuronales artificiales tradicionales. Las evaluaciones de la salida controlada de LLM miden la cantidad memorizada de los datos de entrenamiento (centradas en los modelos de la serie GPT-2) como más del 1 % para duplicados exactos [ 158 ] o hasta aproximadamente el 7 % [ 159 ] . Un estudio de 2023 mostró que cuando se le pedía a ChatGPT 3.5 turbo que repitiera la misma palabra indefinidamente, después de unos cientos de repeticiones, comenzaba a generar extractos de sus datos de entrenamiento [ 160 ] .
Procedencia humana
En 2023, Nature Biomedical Engineering escribió que "ya no es posible distinguir con precisión" el texto escrito por humanos del texto creado por grandes modelos de lenguaje, y que "es casi seguro que los grandes modelos de lenguaje de propósito general proliferarán rápidamente... Es una apuesta bastante segura que cambiarán muchas industrias con el tiempo". [ 161 ] Brinkmann et al. (2023) [ 162 ] también argumentan que los LLM están transformando los procesos de evolución cultural al dar forma a los procesos de variación, transmisión y selección. A octubre de 2025, estas afirmaciones iniciales aún no se han materializado y varios informes de HBR plantean interrogantes sobre el impacto de la IA en la productividad. [ 163 ] [ 164 ]
demandas de energía
Las demandas energéticas de los programas de maestría en derecho (LLM) han aumentado junto con su tamaño y capacidades. [ 165 ] Los centros de datos que permiten la formación en LLM requieren cantidades sustanciales de electricidad. Gran parte de esa electricidad se genera a partir de recursos no renovables que producen gases de efecto invernadero y contribuyen al cambio climático . [ 166 ]
Según un estudio de Luccioni, Jernite y Strubell (2024), las tareas de clasificación simples realizadas por modelos de IA consumen en promedio de 0,002 a 0,007 Wh por solicitud (aproximadamente el 9 % de la carga de un teléfono inteligente para 1000 solicitudes). La generación y el resumen de texto requieren cada uno alrededor de 0,05 Wh por solicitud en promedio, mientras que la generación de imágenes es la que consume más energía, con un promedio de 2,91 Wh por solicitud. El modelo de generación de imágenes menos eficiente utilizó 11,49 Wh por imagen, aproximadamente equivalente a la mitad de la carga de un teléfono inteligente. [ 167 ]
Denegación de servicio debido a raspado
El web scraping se utiliza para recopilar datos de entrenamiento para LLM. Esto genera grandes volúmenes de tráfico, lo que ha provocado problemas de denegación de servicio en muchos sitios web. La situación se ha descrito como "un DDoS en toda internet" y, en algunos casos, los web scrapers constituyen la mayor parte del tráfico de un sitio. [ 168 ] [ 169 ]
Los rastreadores web de IA pueden eludir los métodos que se utilizan habitualmente para bloquear los raspadores web, como los archivos robots.txt , el bloqueo de agentes de usuario y el filtrado de tráfico sospechoso . [ 168 ] Los operadores de sitios web han recurrido a métodos novedosos como los "tarpits" de IA , pero algunos temen que estos solo empeoren la carga en los servidores. [ 170 ]
Salud mental
Los contextos clínicos y de salud mental presentan aplicaciones emergentes junto con importantes preocupaciones de seguridad. Las investigaciones y las publicaciones en redes sociales sugieren que algunas personas están utilizando LLM para buscar terapia o apoyo para la salud mental. [ 171 ] A principios de 2025, una encuesta de la Universidad de Sentio encontró que casi la mitad (48,7 %) de 499 adultos estadounidenses con afecciones de salud mental en curso que habían utilizado LLM informaron haber recurrido a ellos para terapia o apoyo emocional, incluyendo ayuda con la ansiedad, la depresión, la soledad y preocupaciones similares. [ 172 ] Los LLM pueden producir alucinaciones (declaraciones plausibles pero incorrectas) que pueden engañar a los usuarios en contextos sensibles de salud mental. Las investigaciones también muestran que los LLM pueden expresar estigma o acuerdo inapropiado con pensamientos desadaptativos, lo que refleja limitaciones para replicar el juicio y las habilidades relacionales de los terapeutas humanos. [ 173 ] Las evaluaciones de escenarios de crisis indican que algunos LLM carecen de protocolos de seguridad efectivos, como la evaluación del riesgo de suicidio o la realización de derivaciones apropiadas. [ 174 ]
Los investigadores han expresado su preocupación de que el uso frecuente de grandes modelos de lenguaje podría debilitar el pensamiento crítico . [ 175 ]
Sensibilidad
Los profesionales de la IA contemporánea generalmente coinciden en que los grandes modelos de lenguaje actuales no exhiben consciencia . [ 176 ] Una opinión minoritaria argumenta que incluso si hay una pequeña posibilidad de que un sistema de software dado pueda tener experiencia subjetiva, lo que algunos filósofos sugieren que es posible, [ 177 ] entonces las consideraciones éticas en torno al posible sufrimiento a gran escala en los sistemas de IA pueden tener que tomarse en serio, de manera similar a las consideraciones dadas al bienestar animal. [ 178 ] [ 179 ] Los defensores de esta opinión han propuesto varias medidas de precaución, como moratorias en el desarrollo de la IA [ 180 ] y amnesia inducida [ 181 ] para abordar estas preocupaciones éticas. Leonard Dung argumenta que los marcos de evidencia utilizados para evaluar la consciencia en animales se aplican igualmente a los sistemas de IA y que hay una probabilidad significativa de que la IA del futuro cercano sea capaz de sufrir, lo que hace que el riesgo de sufrimiento de la IA sea una seria preocupación ética a corto plazo que requiere mitigación sistemática. [ 182 ] Por otro lado, algunos filósofos existencialistas argumentan que no hay una forma generalmente aceptada de determinar si un LLM es consciente, [ 183 ] [ 99 ] dada la dificultad inherente de medir la experiencia subjetiva . [ 184 ]
El incidente de Google LaMDA de 2022, donde el ingeniero Blake Lemoine afirmó que el modelo era consciente, puso de relieve cómo los LLM pueden convencer a los usuarios de que son conscientes a través de respuestas que no prueban la consciencia. Google describió las afirmaciones del ingeniero como infundadas y fue despedido. [ 185 ] Murray Shanahan argumenta que el encuadre antropomórfico de las capacidades de los LLM fomenta la atribución injustificada de propiedades cognitivas a sistemas que operan a través de la compleción de patrones estadísticos. [ 186 ] Kristina Šekrst desarrolla esto más, argumentando que los LLM funcionan como "motores de ilusión" capaces de producir resultados que simulan coherentemente propiedades como la consciencia sin poseerlas, pero destacando que, debido a la sofisticada compensación entre creatividad y temperatura, puede que nunca estemos seguros de si estamos tratando con el surgimiento de la consciencia o solo una alucinación . [ 99 ] David Chalmers argumenta de manera similar que, si bien los LLM actuales probablemente carecen de características consideradas necesarias para la consciencia, los sucesores extendidos que incorporen estos elementos podrían cumplir plausiblemente los criterios en una década. [ 177 ]
Véase también
- Antropomorfismo de la IA : atribución de rasgos humanos a la IA.
- Contenido digital generado por IA de baja calidad :
- Modelo fundamental : paradigma del modelo de inteligencia artificial
- Inteligencia artificial generativa : IA que genera contenido. Páginas que muestran descripciones breves de destinos de redireccionamiento.
- Lista de algoritmos de inteligencia artificial
- Lista de modelos de lenguaje grandes
- Lista de chatbots
- evaluación comparativa del modelo de lenguaje
- Aprendizaje por refuerzo : campo del aprendizaje automático
- Modelo de lenguaje pequeño : tipo de modelo de inteligencia artificial
- llama.cpp – Biblioteca de software para inferencia LLM
- SGLang : marco de código abierto para la inferencia de modelos de lenguaje a gran escala y modelos multimodales.
- TensorRT-LLM : kit de desarrollo de software de Nvidia para inferencia de aprendizaje profundo : conjunto de herramientas de código abierto para optimizar y servir grandes modelos de lenguaje en GPU de Nvidia.
- vLLM : software de código abierto para la inferencia de modelos de lenguaje a gran escala.
Referencias
- 1 2 3 Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; et al. (diciembre de 2020). Larochelle, H.; Ranzato, M.; Hadsell, R.; Balcan, MF; Lin, H. (eds.). "Los modelos de lenguaje son aprendices de pocos disparos" (PDF) . Advances in Neural Information Processing Systems . 33. Curran Associates, Inc.: 1877–1901 . arXiv : 2005.14165 . Archivado (PDF) del original el 17 de noviembre de 2023. Recuperado el 14 de marzo de 2023 .
- ↑ Manning, Christopher D. (2022). " Comprensión y razonamiento del lenguaje humano" . Daedalus . 151 (2): 127– 138. doi : 10.1162/daed_a_01905 . S2CID 248377870. Archivado del original el 17 de noviembre de 2023. Recuperado el 9 de marzo de 2023 .
- ↑ Zhao, Wayne Xin; Zhou, Kun; Li, Junyi; Tang, Tianyi; Dong, Zican; Hou, Yupeng; et al. (diciembre de 2026). "Una revisión de los grandes modelos de lenguaje". Frontiers of Computer Science . 20 (12). doi : 10.1007/s11704-026-60308-3 .
Normalmente, los grandes modelos de lenguaje (LLM) se refieren a los modelos de lenguaje Transformer que contienen cientos de miles de millones (o más) de parámetros.
- 1 2 Wolfram, Stephen (2023). ¿Qué hace ChatGPT... y por qué funciona? Champaign, Illinois: Wolfram Media, Inc. ISBN 978-1-57955-081-3.
- ^ Zhang, Shengyu; Dong, Linfeng; Li, Xiaoya; Zhang, Sen; Sol, Xiaofei; Wang, Shuhe; et al. (8 de enero de 2026). "Ajuste de instrucciones para modelos de lenguaje grandes: una encuesta" . Encuestas de Computación ACM . 58 (7): 169:1–169:36. doi : 10.1145/3777411 . ISSN 0360-0300 .
- ↑ Hendrycks, Dan; Burns, Collin; Basart, Steven; Zou, Andy; Mazeika, Mantas; Song, Dawn; et al. (2025). «Expresar estigma y respuestas inapropiadas impide que los LLMS reemplacen de forma segura a los proveedores de salud mental». Actas de la Conferencia ACM 2025 sobre Equidad, Responsabilidad y Transparencia . págs. 599–627 . arXiv : 2009.03300 . doi : 10.1145/3715275.3732039 . ISBN 979-8-4007-1482-5.
- ↑ Goodman, Joshua (9 de agosto de 2001). "Un pequeño progreso en el modelado del lenguaje". Computer Speech & Language . 15 (4): 403– 434. arXiv : cs/0108005 . doi : 10.1006/csla.2001.0174 .
- ↑ Kilgarriff, Adam; Grefenstette, Gregory (septiembre de 2003). "Introducción al número especial sobre la web como corpus" . Lingüística Computacional . 29 (3): 333– 347. doi : 10.1162/089120103322711569 . ISSN 0891-2017 .
- ↑ Banko, Michele; Brill, Eric (2001). "Escalado a corpus muy muy grandes para la desambiguación del lenguaje natural" . Actas de la 39.ª Reunión Anual de la Asociación de Lingüística Computacional - ACL '01 . Morristown, NJ, EE. UU.: Asociación de Lingüística Computacional: 26–33 . doi : 10.3115/1073012.1073017 .
- ↑ Resnik, Philip; Smith, Noah A. (septiembre de 2003). "La web como corpus paralelo" . Lingüística Computacional . 29 (3): 349– 380. doi : 10.1162/089120103322711578 . ISSN 0891-2017 . Archivado del original el 7 de junio de 2024. Recuperado el 7 de junio de 2024 .
- ↑ Xu, Wei; Rudnicky, Alex (16 de octubre de 2000). "¿Pueden las redes neuronales artificiales aprender modelos de lenguaje?" . 6.ª Conferencia Internacional sobre Procesamiento del Lenguaje Hablado (ICSLP 2000) . Vol. 1. ISCA. doi : 10.21437/icslp.2000-50 .
- ↑ Chen, Leiyu; Li, Shaobo; Bai, Qiang; Yang, Jing; Jiang, Sanlong; Miao, Yanming (2021). "Revisión de algoritmos de clasificación de imágenes basados en redes neuronales convolucionales" . Remote Sensing . 13 (22): 4712. Bibcode : 2021RemS...13.4712C . doi : 10.3390/rs13224712 .
- ^ Vaswani , Ashish; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, León; Gómez, Aidan N; et al. (2017). "La atención es todo lo que necesita" (PDF) . NeurIPS .
- ↑ Sutskever, Ilya; Vinyals, Oriol; Le, Quoc V. (2014). "Aprendizaje secuencia a secuencia con redes neuronales" . Actas de la 28.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . 2 : 3104–3112 .
- ↑ Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua (2014). "Traducción automática neuronal mediante el aprendizaje conjunto de alineación y traducción". arXiv : 1409.0473 [ cs.CL ].
- ↑ Rogers, Anna; Kovaleva, Olga; Rumshisky, Anna (2020). "Una introducción a la BERTología: lo que sabemos sobre cómo funciona BERT" . Transactions of the Association for Computational Linguistics . 8 : 842–866 . arXiv : 2002.12327 . doi : 10.1162/tacl_a_00349 . S2CID 211532403. Archivado del original el 3 de abril de 2022. Recuperado el 21 de enero de 2024 .
- 1 2 Movva, Rajiv; Balachandar, Sidhika; Peng, Kenny; Agostini, Gabriel; Garg, Nikhil; Pierson, Emma (2024). "Temas, autores e instituciones en la investigación de modelos de lenguaje a gran escala: tendencias a partir de 17 000 artículos de arXiv" . Actas de la Conferencia de 2024 del Capítulo Norteamericano de la Asociación de Lingüística Computacional: Tecnologías del lenguaje humano (Volumen 1: Artículos largos) . págs. 1223–1243 . arXiv : 2307.10700 . doi : 10.18653/v1/2024.naacl-long.67 . Recuperado el 8 de diciembre de 2024 .
- ↑ Hern, Alex (14 de febrero de 2019). "Los creadores afirman que un nuevo generador de texto falso con IA podría ser demasiado peligroso para su lanzamiento" . The Guardian . Archivado del original el 14 de febrero de 2019. Consultado el 20 de enero de 2024 .
- ↑ "ChatGPT un año después: 3 maneras en que el chatbot de IA ha cambiado completamente el mundo en 12 meses" . Euronews . 30 de noviembre de 2023. Archivado del original el 14 de enero de 2024. Consultado el 20 de enero de 2024 .
- ↑ Heaven, Will (14 de marzo de 2023). "GPT-4 es más grande y mejor que ChatGPT, pero OpenAI no dirá por qué" . MIT Technology Review . Archivado del original el 17 de marzo de 2023. Consultado el 20 de enero de 2024 .
- ↑ Metz, Cade (12 de septiembre de 2024). "OpenAI presenta un nuevo ChatGPT que puede razonar a través de las matemáticas y la ciencia" . The New York Times . Consultado el 12 de septiembre de 2024 .
- ↑ "Parámetros en sistemas notables de inteligencia artificial" . ourworldindata.org . 30 de noviembre de 2023. Consultado el 20 de enero de 2024 .
- ↑ Sharma, Shubham (20 de enero de 2025). "DeepSeek-R1 de código abierto utiliza aprendizaje por refuerzo puro para igualar a OpenAI o1, con un coste un 95 % menor" . VentureBeat . Consultado el 26 de enero de 2025 .
- ↑ Vake, Domen; Šinik, Bogdan; Vičič, Jernej; Tošić, Aleksandar (5 de marzo de 2025). "¿Es el código abierto el futuro de la IA? Un enfoque basado en datos" . Ciencias Aplicadas . 15 (5): 2790. doi : 10.3390/app15052790 . ISSN 2076-3417 .
- ↑ Kaushal, Ayush; Mahowald, Kyle (6 de junio de 2022). "¿Qué saben los tokens sobre sus personajes y cómo lo saben?" (PDF) . NAACL .
- ↑ Paaß, Gerhard; Giesselbach, Sven (2022). «Modelos de lenguaje preentrenados». Modelos fundamentales para el procesamiento del lenguaje natural . Inteligencia artificial: fundamentos, teoría y algoritmos. pp. 19–78 . doi : 10.1007/978-3-031-23190-2_2 . ISBN 978-3-031-23190-2.
- ^ Esquivar, Jesse; Sap, Martín; Marasović, Ana; Nuevo, William; Ilharco, Gabriel; Groeneveld, Dirk; et al. (2021). "Documentación de grandes corpus de textos web: un estudio de caso sobre el colosal corpus limpio y rastreado" (PDF) . EMNLP . arXiv : 2104.08758 . doi : 10.1145/3571730 .
- ↑ Lee, Katherine; Ippolito, Daphne; Nystrom, Andrew; Zhang, Chiyuan; Eck, Douglas; Callison-Burch, Chris; et al. (mayo de 2022). "La eliminación de duplicados en los datos de entrenamiento mejora los modelos de lenguaje" (PDF) . Actas de la 60.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . págs. 8424–8445 . doi : 10.18653/v1/2022.acl-long.577 .
- ^ Lin, Zhenghao; Gou, Zhibin; Gong, Yeyun; Liu, Xiao; Shen, Yelong; Xu, Ruochen; et al. (11 de abril de 2024). "Rho-1: No todos los tokens son lo que necesita" . NeurIPS . 37 : 29029–29063 . 979-8-3313-1438-5.
- ↑ "Predicción de la siguiente oración (no palabra) en grandes modelos de lenguaje: lo que la alineación modelo-cerebro nos revela sobre la comprensión del discurso" . Science . 23 de mayo de 2024.
- ↑ Edwards, Benj (9 de mayo de 2023). "La IA gana "valores" con el nuevo enfoque de chatbot de IA constitucional de Anthropic" . Ars Technica . Recuperado el 30 de junio de 2025 .
- ↑ Snyder, Alison (27 de enero de 2022). "La IA de próxima generación puede seguir las instrucciones e intenciones de una persona" . Axios . Consultado el 7 de agosto de 2025 .
- ↑ Appen, Sujatha Sagiraju (23 de abril de 2023). "Cómo el aprendizaje por refuerzo con retroalimentación humana está desbloqueando el poder de la IA generativa" . VentureBeat . Archivado del original el 25 de julio de 2025. Recuperado el 16 de noviembre de 2025 .
- ↑ "¡¿La atención NO es todo lo que necesitas?! La nueva variante Qwen3 Brumby-14B-Base aprovecha la técnica de retención de energía" . VentureBeat . 4 de noviembre de 2025. Consultado el 3 de junio de 2026 .
- ^ Peng, Bo; Alcaide, Eric; Antonio, Quintín; Albalak, Alon; Arcadinho, Samuel; Biderman, Stella; et al. (2023). "RWKV: Reinventar RNNS para la era de los transformadores" . EMNLP : 14048–14077 . arXiv : 2305.13048 . doi : 10.18653/v1/2023.findings-emnlp.936 .
- ↑ Allamar, Jay. "Transformador ilustrado" . Archivado del original el 25 de julio de 2023. Recuperado el 29 de julio de 2023 .
- ↑ Allamar, Jay. "The Illustrated GPT-2 (Visualizing Transformer Language Models)" . Consultado el 1 de agosto de 2023 .
- 1 2 Jurafsky, Dan; Martin, James H. (7 de enero de 2023). Procesamiento del habla y del lenguaje (PDF) (edición preliminar de la 3.ª edición ). Archivado (PDF) del original el 23 de marzo de 2023. Recuperado el 24 de mayo de 2022 .
- ↑ Zaib, Munazza; Sheng, Quan Z.; Zhang, Wei Emma (4 de febrero de 2020). «Una breve reseña de modelos de lenguaje preentrenados para IA conversacional: una nueva era en PLN». Actas de la Multiconferencia de la Semana Australiana de Ciencias de la Computación . págs. 1–4 . arXiv : 2104.10810 . doi : 10.1145/3373017.3373028 . ISBN 978-1-4503-7697-6. S2CID 211040895 .
- ↑ Shazeer, Noam; Mirhoseini, Azalia; Maziarz, Krzysztof; Davis, Andy; Le, Quoc; Hinton, Geoffrey; et al. (2025). «Percepciones de la IA sensible y otras mentes digitales: evidencia de la encuesta sobre IA, moralidad y sensibilidad (AIMS)». Actas de la Conferencia CHI 2025 sobre factores humanos en sistemas informáticos . págs. 1–22 . arXiv : 1701.06538 . doi : 10.1145/3706598.3713329 . ISBN 979-8-4007-1394-1.
- ↑ Mann, Tobias. "Cómo ejecutar un LLM localmente en su PC en menos de 10 minutos" . theregister.com . Consultado el 17 de mayo de 2024 .
- ↑ Nagel, Markus; Amjad, Rana Ali; Baalen, Mart Van; Louizos, Christos; Blankevoort, Tijmen (21 de noviembre de 2020). "¿Arriba o abajo? Redondeo adaptativo para la cuantización posterior al entrenamiento" . Actas de la 37.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 7197–7206 . Archivado del original el 14 de junio de 2023. Recuperado el 14 de junio de 2023 .
- ^ Dettmers, Tim; Pagnoni, Artidoro; Holtzman, Ari; Zettlemoyer, Luke (10 de diciembre de 2023). "QLORA: ajuste eficiente de LLM cuantificados" . NeurIPS .
- ↑ Wang, Yizhong; Kordi, Yeganeh; Mishra, Swaroop; Liu, Alisa; Smith, Noah A.; Khashabi, Daniel; et al. (2023). "Auto-Instrucción: Alineación de modelos de lenguaje con instrucciones autogeneradas" . Auto-Instrucción: Alineación de modelos de lenguaje con instrucciones autogeneradas . pp. 13484–13508 . doi : 10.18653/v1/2023.acl-long.754 .
- ↑ Lewis, Patrick; Perez, Ethan; Piktus, Aleksandra; Petroni, Fabio; Karpukhin, Vladimir; Goyal, Naman; et al. (2020). "Generación aumentada por recuperación para tareas de PLN intensivas en conocimiento" . Advances in Neural Information Processing Systems . 33. Curran Associates, Inc.: 9459–9474 . arXiv : 2005.11401 . Archivado del original el 12 de junio de 2023. Recuperado el 12 de junio de 2023 .
- ↑ Dickson, Ben (2 de abril de 2025). "El problema de la integración de herramientas que está frenando la IA empresarial (y cómo CoTools lo resuelve)" . VentureBeat . Recuperado el 26 de mayo de 2025 .
- ↑ Liang, Yaobo; Wu, Chenfei; Song, Ting; Wu, Wenshan; Xia, Yan; Liu, Yu; et al. (2024). "TaskMatrix.AI: Completando tareas conectando modelos fundamentales con millones de API" . Science . 3 0063. doi : 10.34133/icomputing.0063 .
- ↑ Patil, Shishir G.; Zhang, Tianjun; Wang, Xin; Gonzalez, Joseph E. (1 de mayo de 2023). "Gorilla: Large Language Model Connected with Massive APIs" . NeurIPS . 37 : 126544–126565 .
- ↑ Wang, Lei; Ma, Chen; Feng, Xueyang; Zhang, Zeyu; Yang, Hao; Zhang, Jingsen; et al. (diciembre de 2024). "Una revisión sobre agentes autónomos basados en modelos de lenguaje a gran escala". Frontiers of Computer Science . 18 (6) 186345. arXiv : 2308.11432 . doi : 10.1007/s11704-024-40231-1 .
- ↑ Wang, Zihao; Cai, Shaofei; Liu, Anji; Ma, Xiaojian; Liang, Yitao (3 de febrero de 2023). "Describir, explicar, planificar y seleccionar: la planificación interactiva con grandes modelos de lenguaje permite agentes multitarea de mundo abierto" . NeurIPS : 34153–34189 .
- ↑ Shinn, Noah; Cassano, Federico; Labash, Beck; Gopinath, Ashwin; Narasimhan, Karthik; Yao, Shunyu (1 de marzo de 2023). "Reflexión: agentes lingüísticos con aprendizaje por refuerzo verbal" . NeurIPS : 34153–34189 .
- ^ Hao, Shibo; Gu, Yi; Mamá, Haodi; Jiahua Hong, Josué; Wang, Zhen; Zhe Wang, Margarita; et al. (1 de mayo de 2023). "Razonar con el modelo del lenguaje es planificar con el modelo del mundo" . EMNLP : 8154– 8173. doi : 10.18653/v1/2023.emnlp-main.507 .
- ↑ Park, Joon Sung; O'Brien, Joseph C.; Cai, Carrie J.; Ringel Morris, Meredith; Liang, Percy ; Bernstein, Michael S. (1 de abril de 2023). Agentes generativos: simulacros interactivos del comportamiento humano . UIST. doi : 10.1145/3586183.3606763 .
- ↑ Wu, Tongshuang; Jiang, Ellen; Donsbach, Aaron; Gray, Jeff; Molina, Alejandra; Terry, Michael; et al. (28 de abril de 2022). "PromptChainer: Encadenamiento de grandes indicaciones de modelos de lenguaje mediante programación visual" . Resúmenes extendidos de la Conferencia CHI sobre factores humanos en sistemas informáticos . Association for Computing Machinery. págs. 1–10 . doi : 10.1145/3491101.3519729 . ISBN 978-1-4503-9156-6.
{{cite book}}: Mantenimiento de CS1: configuración sobrescrita ( enlace ) - ↑ Wu, Tongshuang; Jiang, Ellen; Donsbach, Aaron; Gray, Jeff; Molina, Alejandra; Terry, Michael; et al. (13 de marzo de 2022). PromptChainer: Encadenamiento de grandes indicaciones de modelos de lenguaje mediante programación visual . Conferencia CHI sobre factores humanos en sistemas informáticos. arXiv : 2203.06566 . doi : 10.1145/3491101.3519729 .
- ↑ "¿Qué es el encadenamiento de indicaciones?" . IBM . 23 de abril de 2024.
- ^ Wei, Jason; Wang, Xuezhi; Schuurmans, Dale; Bosma, Martín; Ichter, Brian; Xia, Fei; et al. (10 de enero de 2023). "La cadena de pensamiento provoca el razonamiento en modelos de lenguaje grandes" . NeurIPS : 24824– 24837. ISBN 978-1-7138-7108-8.
- ↑ "¿Qué es la incitación a la cadena de pensamiento (CoT)?" . IBM . 23 de abril de 2025.
- ↑ Schreiner, Maximilian (27 de septiembre de 2022). "Perspectivas más profundas sobre los modelos de lenguaje de IA: la inducción de cadenas de pensamiento como factor de éxito" . The Decoder . Recuperado el 30 de junio de 2025 .
- ^ Wiggers, Kyle (14 de diciembre de 2024). "Los modelos de IA que "razonan" se han convertido en una tendencia, para bien o para mal . TechCrunch . Consultado el 16 de noviembre de 2025 .
- ↑ "Los desarrolladores de IA miran más allá de la sugerencia de cadena de pensamiento" . IEEE Spectrum . 8 de mayo de 2025. Consultado el 16 de noviembre de 2025 .
- 1 2 Metz, Cade (20 de diciembre de 2024). "OpenAI presenta una nueva IA que puede 'razonar' a través de problemas matemáticos y científicos" . The New York Times . Recuperado el 3 de febrero de 2025 .
- ↑ Gibney, Elizabeth (30 de enero de 2025). "El modelo de IA barato y abierto DeepSeek de China entusiasma a los científicos" . Nature . 638 (8049): 13–14 . doi : 10.1038/d41586-025-00229-6 . Recuperado el 3 de febrero de 2025 .
- ↑ Kiros, Ryan; Salakhutdinov, Ruslan; Zemel, Rich (18 de junio de 2014). "Modelos de lenguaje neuronal multimodales" . Actas de la 31.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 595–603 . Archivado del original el 2 de julio de 2023. Recuperado el 2 de julio de 2023 .
- ^ Seca, Danny; Xia, Fei; Sajjadi, Mehdi SM; Lynch, Corey; Chowdhery, Aakanksha; Ichter, Brian; et al. (1 de marzo de 2023). "PaLM-E: un modelo de lenguaje multimodal incorporado" . ICML . 202 : 8469–8488 .
- ^ Liu, Haotian; Li, Chunyuan; Wu, Qingyang; Lee, Yong Jae (1 de abril de 2023). "Ajuste de instrucciones visuales". NeurIPS .
- ↑ Zhang, Hang; Li, Xin; Bing, Lidong (1 de junio de 2023). "Video-LLaMA: un modelo de lenguaje audiovisual ajustado a instrucciones para la comprensión de vídeo". EMNLP . arXiv : 2306.02858 .
- ↑ "OpenAI afirma que GPT-4o, un modelo multimodal nativo, procesa texto, imágenes y sonido, y emite lo mismo" . The Register . 13 de mayo de 2024.
- ↑ Li, Junnan; Li, Dongxu; Savarese, Silvio; Hoi, Steven (1 de enero de 2023). "BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models" . ICML . 202 : 19730–19742 .
- ↑ Kumar, Puneet; Khokher, Vedanti; Gupta, Yukti; Raman, Balasubramanian (2021). Enfoque híbrido basado en fusión para el reconocimiento multimodal de emociones con datos etiquetados insuficientes . pp. 314–318 . doi : 10.1109/ICIP42928.2021.9506714 . ISBN 978-1-6654-4115-5.
- ↑ Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; et al. (6 de diciembre de 2022). "Flamingo: un modelo de lenguaje visual para el aprendizaje con pocos ejemplos" . Advances in Neural Information Processing Systems . 35 (12): 23716– 23736. arXiv : 2204.14198 . doi : 10.1093/nsr/nwae403 . PMC 11645129. PMID 39679213. Archivado del original el 2 de julio de 2023. Recuperado el 2 de julio de 2023 .
- ↑ Finnie-Ansley, James; Denny, Paul; Becker, Brett A.; Luxton-Reilly, Andrew; Prather, James (14 de febrero de 2022). «Los robots se acercan: Explorando las implicaciones del OpenAI Codex en la programación introductoria». Actas de la 24.ª Conferencia Australasiática de Educación en Computación . Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 10-19 . doi : 10.1145/3511861.3511863 . ISBN 978-1-4503-9643-1. S2CID 246681316 .
- ↑ Husein, Rasha Ahmad; Aburajouh, Hala; Catal, Cagatay (marzo de 2025). "Grandes modelos de lenguaje para la autocompletación de código: una revisión sistemática de la literatura". Computer Standards & Interfaces . 92 103917. doi : 10.1016/j.csi.2024.103917 .
- ↑ Weissenow, Konstantin; Rost, Burkhard (abril de 2025). "¿Son los modelos de lenguaje de proteínas la nueva clave universal?" . Current Opinion in Structural Biology . 91 102997. doi : 10.1016/j.sbi.2025.102997 . PMID 39921962 .
- ↑ Lin, Zeming; Akin, Halil; Rao, Roshan; Hie, Brian; Zhu, Zhongkai; Lu, Wenting; et al. (17 de marzo de 2023). "Predicción a escala evolutiva de la estructura de proteínas a nivel atómico con un modelo de lenguaje" . Science . 379 (6637): 1123– 1130. Bibcode : 2023Sci...379.1123L . bioRxiv 10.1101/2022.07.20.500902 . doi : 10.1126/science.ade2574 . PMID 36927031 .
- ↑ "ESM Metagenomic Atlas | Meta AI" . esmatlas.com .
- ↑ Hayes, Thomas; Rao, Roshan; Akin, Halil; Sofroniew, Nicholas J.; Oktay, Deniz; Lin, Zeming; et al. (21 de febrero de 2025). "Simulando 500 millones de años de evolución con un modelo de lenguaje". Science . 387 (6736): 850– 858. Bibcode : 2025Sci...387..850H . doi : 10.1126/science.ads0018 . PMID 39818825 .
- ^ Gyojin, Veniamin; Kuratov, Yuri; Shmelev, Aleksei; Petrov, Maxim; Penzar, Dmitry; Shepelin, Denis; et al. (11 de enero de 2025). "GENA-LM: una familia de modelos de lenguaje de ADN fundamentales de código abierto para secuencias largas" . Investigación de ácidos nucleicos . 53 (2) gkae1310. doi : 10.1093/nar/gkae1310 . PMC 11734698 . PMID 39817513 .
- ↑ Wang, Ning; Bian, Jiang; Li, Yuchen; Li, Xuhong; Mumtaz, Shahid; Kong, Linghe; et al. (13 de mayo de 2024). "Modelado de lenguaje de ARN multipropósito con preentrenamiento consciente de motivos y ajuste fino guiado por tipos" . Nature Machine Intelligence . 6 (5): 548– 557. doi : 10.1038/s42256-024-00836-4 .
- ↑ Hoffmann, Jordan; Borgeaud, Sebastian; Mensch, Arthur; Buchatskaya, Elena; Cai, Trevor; Rutherford, Eliza; et al. (29 de marzo de 2022). «Entrenamiento de modelos de lenguaje grandes computacionalmente óptimos» . NeurIPS : 30016–30030 . ISBN 978-1-7138-7108-8.
- 1 2 Caballero, Ethan; Gupta, Kshitij; Rish, Irina; Krueger, David (2022). "Leyes de escala neuronal infringidas". arXiv : 2210.14891 [ cs.LG ].
- 1 2 Wei, Jason; Tay, Yi; Bommasani, Rishi; Raffel, Colin; Zoph, Barret; Borgeaud, Sebastian; et al. (31 de agosto de 2022). "Habilidades emergentes de los grandes modelos de lenguaje" . Transactions on Machine Learning Research . ISSN 2835-8856 . Archivado del original el 22 de marzo de 2023. Recuperado el 19 de marzo de 2023 .
- ↑ Bowman, Samuel R. (2024). "Ocho cosas que debes saber sobre los modelos de lenguaje grandes" . Critical AI . 2 (2). doi : 10.1215/2834703X-11556011 .
- ↑ Pilehvar, Mohammad Taher; Camacho-Collados, Jose (junio de 2019). "Actas de la Conferencia del Norte de 2019" . Actas de la Conferencia del Capítulo Norteamericano de la Asociación de Lingüística Computacional de 2019: Tecnologías del Lenguaje Humano, Volumen 1 (Artículos largos y cortos) . Minneapolis , Minnesota: Asociación de Lingüística Computacional: 1267–1273 . doi : 10.18653/v1/N19-1128 . S2CID 102353817. Archivado del original el 27 de junio de 2023. Recuperado el 27 de junio de 2023 .
- ↑ Patel, Roma; Pavlick, Ellie (6 de octubre de 2021). "Mapeo de modelos de lenguaje a espacios conceptuales fundamentados" . ICLR . Archivado del original el 24 de junio de 2023. Recuperado el 27 de junio de 2023 .
- ↑ Un análisis más detallado de las capacidades emergentes de los grandes modelos de lenguaje. Archivado el 24 de junio de 2023 en Wayback Machine (Yao Fu, 20 de noviembre de 2022).
- ↑ Ornes, Stephen (16 de marzo de 2023). "Las capacidades impredecibles que surgen de los grandes modelos de IA" . Quanta Magazine . Archivado del original el 16 de marzo de 2023. Recuperado el 16 de marzo de 2023 .
- ^ Schaeffer, Rylan; Miranda, Brando; Koyejo, Sanmi (1 de abril de 2023). "¿Son las habilidades emergentes de los modelos de lenguaje grandes un espejismo?". NeurIPS . arXiv : 2304.15004 .
- ↑ Nanda, Neel; Chan, Lawrence; Lieberum, Tom; Smith, Jess; Steinhardt, Jacob (1 de enero de 2023). "Medidas de progreso para la comprensión mediante la interpretabilidad mecanicista". arXiv : 2301.05217 [ cs.LG ].
- ↑ Ananthaswamy, Anil (12 de abril de 2024). "¿Cómo 'comprenden' las máquinas los datos?" . Quanta Magazine . Consultado el 30 de junio de 2025 .
- 1 2 3 4 5 Mitchell, Melanie; Krakauer, David C. (28 de marzo de 2023). "El debate sobre la comprensión en los grandes modelos de lenguaje de la IA" . Actas de la Academia Nacional de Ciencias . 120 (13) e2215907120. arXiv : 2210.13966 . Bibcode : 2023PNAS..12015907M . doi : 10.1073/pnas.2215907120 . PMC 10068812. PMID 36943882 .
- ↑ Metz, Cade (16 de mayo de 2023). "Microsoft dice que la nueva IA muestra signos de razonamiento humano" . The New York Times .
- 1 2 Bubeck, Sébastien; Chandrasekaran, Varun; Eldan, Ronen; Gehrke, Johannes; Horvitz, Eric; Kamar, Ece; et al. (2023). "Cultura de las máquinas". Naturaleza Comportamiento Humano . 7 (11): 1855–1868 . arXiv : 2303.12712 . doi : 10.1038/s41562-023-01742-2 . PMID 37985914 .
- ↑ "El CEO de Anthropic, Dario Amodei, ofrece una visión inteligente de nuestro futuro en IA" . Fast Company . 17 de octubre de 2024.
- ↑ "ChatGPT se parece más a una 'inteligencia alienígena' que a un cerebro humano, dice un futurista" . ZDNET . 2023. Archivado del original el 12 de junio de 2023. Consultado el 12 de junio de 2023 .
- 1 2 Newport, Cal (13 de abril de 2023). "¿Qué clase de mente tiene ChatGPT?" . The New Yorker . Archivado del original el 12 de junio de 2023 . Recuperado el 12 de junio de 2023 .
- ↑ Roose, Kevin (30 de mayo de 2023). «Por qué una criatura parecida a un pulpo se ha convertido en símbolo del estado de la IA». The New York Times . Archivado del original el 30 de mayo de 2023. Consultado el 12 de junio de 2023 .
- ↑ "De la A a la Z de la Inteligencia Artificial" . Revista Time . 13 de abril de 2023. Archivado del original el 16 de junio de 2023. Consultado el 12 de junio de 2023 .
- 1 2 3 Sekrst, Kristina (2025). El motor de la ilusión: La búsqueda de la conciencia de la máquina . Springer. ISBN 978-3-032-05561-3.
- 1 2 3 Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret (2021). "Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? 🦜". Actas de la Conferencia ACM de 2021 sobre equidad, responsabilidad y transparencia (FAccT '21) . Association for Computing Machinery. págs. 610–623 . doi : 10.1145/3442188.3445922 .
- ↑ Ji, Ziwei; Lee, Nayeon; Frieske, Rita; Yu, Tiezheng; Su, Dan; Xu, Yan; et al. (noviembre de 2022). "Encuesta sobre alucinaciones en la generación de lenguaje natural" (pdf) . ACM Computing Surveys . 55 (12). Association for Computing Machinery : 1–38 . arXiv : 2202.03629 . doi : 10.1145/3571730 . S2CID 246652372. Archivado del original el 26 de marzo de 2023. Recuperado el 15 de enero de 2023 .
- ↑ Varshney, Neeraj; Yao, Wenlin; Zhang, Hongming; Chen, Jianshu; Yu, Dong (2023). "Una puntada a tiempo ahorra nueve: detección y mitigación de alucinaciones de LLM mediante la validación de la generación de baja confianza". arXiv : 2307.03987 [ cs.CL ].
- ↑ Lin, Belle (5 de febrero de 2025). "Por qué Amazon apuesta por el 'razonamiento automatizado' para reducir las alucinaciones de la IA: el gigante tecnológico afirma que un campo poco conocido que combina la IA y las matemáticas puede mitigar, pero no eliminar por completo, la propensión de la IA a dar respuestas erróneas" . Wall Street Journal . ISSN 0099-9660 .
- ↑ Lakoff, George (1999). Filosofía en la carne: La mente encarnada y su desafío a la filosofía occidental; Apéndice: El paradigma de la teoría neuronal del lenguaje . Nueva York: Basic Books. págs. 569–583 . ISBN 978-0-465-05674-3.
- ↑ Evans, Vyvyan. (2014). El mito del lenguaje . Cambridge University Press. ISBN 978-1-107-04396-1.
- ↑ Friston, Karl J. (2022). Inferencia activa: El principio de energía libre en la mente, el cerebro y el comportamiento; Capítulo 4 Los modelos generativos de la inferencia activa . The MIT Press. ISBN 978-0-262-36997-8.
- ↑ Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; et al. (diciembre de 2020). Larochelle, H.; Ranzato, M.; Hadsell, R.; Balcan, MF; Lin, H. (eds.). "Los modelos de lenguaje son aprendices con pocos ejemplos" (PDF) . Advances in Neural Information Processing Systems . 33. Curran Associates, Inc.: 1877–1901 . Archivado (PDF) del original el 17 de noviembre de 2023. Recuperado el 14 de marzo de 2023 .
- ↑ Shannon, Claude E. (1948). "Una teoría matemática de la comunicación". Bell System Technical Journal . 27 (3): 379– 423. Bibcode : 1948BSTJ...27..379S . doi : 10.1002/j.1538-7305.1948.tb01338.x .
- ↑ Edwards, Benj (28 de septiembre de 2023). "Los modelos de lenguaje de IA pueden superar a PNG y FLAC en compresión sin pérdidas, según un estudio" . Ars Technica . Recuperado el 29 de mayo de 2025 .
- ↑ Nangia, Nikita; Vania, Clara; Bhalerao, Rasika; Bowman, Samuel R. (noviembre de 2020). "CrowS-Pairs: un conjunto de datos de desafío para medir sesgos sociales en modelos de lenguaje enmascarados" . En Webber, Bonnie; Cohn, Trevor; He, Yulan; Liu, Yang (eds.). Actas de la Conferencia de 2020 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural (EMNLP) . Asociación para la Lingüística Computacional. págs. 1953–1967 . arXiv : 2010.00133 . doi : 10.18653/v1/2020.emnlp-main.154 .
- ↑ Nadeem, Moin; Bethke, Anna; Reddy, Siva (agosto de 2021). "StereoSet: Medición del sesgo estereotípico en modelos de lenguaje preentrenados" . En Zong, Chengqing; Xia, Fei; Li, Wenjie; Navigli, Roberto (eds.). Actas de la 59.ª Reunión Anual de la Asociación de Lingüística Computacional y la 11.ª Conferencia Internacional Conjunta sobre Procesamiento del Lenguaje Natural (Volumen 1: Artículos largos) . Asociación de Lingüística Computacional. págs. 5356–5371 . arXiv : 2004.09456 . doi : 10.18653/v1/2021.acl-long.416 .
- ↑ Simpson, Shmona; Nukpezah, Jonathan; Kie Brooks; Pandya, Raaghav (17 de diciembre de 2024). "Punto de referencia de paridad para medir el sesgo en los LLM" . IA y ética . 5 (3). Springer: 3087–3101 . doi : 10.1007/s43681-024-00613-4 .
- ↑ Caramancion, Kevin Matthe (13 de noviembre de 2023). "Comparativa de verificadores de noticias: una evaluación del rendimiento comparativo de ChatGPT 3.5, ChatGPT 4.0, Bing AI y Bard en la verificación de hechos de noticias". 2023 IEEE Future Networks World Forum (FNWF) . IEEE. págs. 1–6 . arXiv : 2306.17176 . doi : 10.1109/FNWF58287.2023.10520446 . ISBN 979-8-3503-2458-7.
- ↑ Bermejo, Vicente J.; Gago, Andrés; Gálvez, Ramiro H.; Harari, Nicolás (2025). "Los LLM superan a los codificadores humanos subcontratados en análisis textuales complejos" . Informes científicos . 15 (1) 40122. Portafolio de Naturaleza. Código Bib : 2025NatSR..1540122B . doi : 10.1038/s41598-025-23798-y . PMC 12623721 . PMID 41249236 .
- ↑ Gilardi, Fabrizio; Alizadeh, Meysam; Kubli, Maël (2023). "ChatGPT supera a los trabajadores de crowdsourcing en tareas de anotación de texto" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 120 (30) e2305016120. Academia Nacional de Ciencias. arXiv : 2303.15056 . Bibcode : 2023PNAS..12005016G . doi : 10.1073/pnas.2305016120 . PMC 10372638. PMID 37463210 .
- ↑ Clark, Christopher; Lee, Kenton; Chang, Ming-Wei; Kwiatkowski, Tom; Collins, Michael; Toutanova, Kristina (2019). "BoolQ: Explorando la sorprendente dificultad de las preguntas naturales de sí/no" . ACL : 2924–2936 . doi : 10.18653/v1/N19-1300 .
- ↑ Srivastava, Aarohi; Rastogi, Abhinav; Rao, Abhishek; Abu Awal Md Shoeb; Abid, Abubakar; Fisch, Adam; et al. (2022). "Más allá del juego de imitación: cuantificando y extrapolando las capacidades de los modelos de lenguaje". TMLR . arXiv : 2206.04615 .
{{cite journal}}: Mantenimiento de CS1: configuración sobrescrita ( enlace ) - ↑ Niven, Timothy; Kao, Hung-Yu (2019). "Explorando la comprensión de argumentos en lenguaje natural mediante redes neuronales" . ACL : 4658–4664 . doi : 10.18653/v1/P19-1459 .
- ↑ Lin, Stephanie; Hilton, Jacob; Evans, Owain (2021). "TruthfulQA: Medición de cómo los modelos imitan las falsedades humanas". ACL . arXiv : 2109.07958 .
- 1 2 Zellers, Rowan; Holtzman, Ari; Bisk, Yonatan; Farhadi, Ali; Choi, Yejin (2019). "HellaSwag: ¿Puede una máquina realmente terminar tu frase?". ACL . arXiv : 1905.07830 .
- ↑ "Extracción de datos de entrenamiento de modelos de lenguaje grandes" (PDF) . USENIX Security . 2021.
- 12 Xu , Weijie; Wang, Yiwen; Xue, Chi; Hu, Xiangkun; Colmillo, Xi; Dong, Guimin; et al. (28 de junio de 2025). "Cuantificación de la equidad en los LLM más allá de los tokens: una perspectiva semántica y estadística". COLM . arXiv : 2506.19028 .
- ↑ Nicoletti, Leonardo; Bass, Dina (9 de junio de 2023). "Los humanos tienen prejuicios. La IA generativa es aún peor" . Bloomberg . Consultado el 4 de mayo de 2026 .
- ↑ Luo, Queenie; Puett, Michael J.; Smith, Michael D. (22 de julio de 2024). "Un espejo de perspectiva del elefante" . Communications of the ACM . 67 (8): 98– 105. doi : 10.1145/3670241 .
- ↑ Hofmann, Valentín; Kalluri, Pratyusha Ria; Jurafsky, Dan; King, Sharese (5 de septiembre de 2024). "La IA genera decisiones encubiertamente racistas sobre las personas en función de su dialecto" . Naturaleza . 633 (8028): 147– 154. Bibcode : 2024Natur.633..147H . doi : 10.1038/s41586-024-07856-5 . ISSN 0028-0836 . PMC 11374696 . PMID 39198640 .
- ↑ Wang, Angelina; Morgenstern, Jamie ; Dickerson, John P. (17 de febrero de 2025). "Los grandes modelos de lenguaje que reemplazan a los participantes humanos pueden tergiversar y aplanar perjudicialmente los grupos de identidad". Nature Machine Intelligence . 7 (3): 400– 411. arXiv : 2402.01908 . doi : 10.1038/s42256-025-00986-z .
- ↑ Kotek, Hadas; Dockum, Rikker; Sun, David (5 de noviembre de 2023). «Sesgo de género y estereotipos en modelos de lenguaje a gran escala». Actas de la Conferencia de Inteligencia Colectiva de la ACM . Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 12-24 . arXiv : 2308.14921 . doi : 10.1145/3582269.3615599 . ISBN 979-8-4007-0113-9.
- ↑ Heikkilä, Melissa (7 de agosto de 2023). "Los modelos de lenguaje de IA están plagados de diferentes sesgos políticos" . MIT Technology Review . Recuperado el 29 de diciembre de 2023 .
- ↑ Amodei, Darío; Ola, Chris; Steinhardt, Jacob; Cristiano, Pablo; Schulman, Juan; Mané, Dan (21 de junio de 2016). "Problemas concretos en la seguridad de la IA". arXiv : 1606.06565 [ cs.AI ].
- ↑ Lyons, Jessica (26 de septiembre de 2025). "La inyección instantánea y un dominio de 5 dólares engañan a Salesforce Agentforce para que filtre ventas" . The Register . Consultado el 26 de septiembre de 2025 .
- ↑ Carlini, Nicholas; Tramèr, Florian; Wallace, Eric (11 de agosto de 2021). "Extracción de datos de entrenamiento de modelos de lenguaje grandes" (PDF) . USENIX Association . Consultado el 2 de octubre de 2025 .
- ↑ Zhao, Yao; Zhang, Yun; Sun, Yong (7 de junio de 2023). "El debate sobre la comprensión en los grandes modelos de lenguaje de la IA" . Actas de la Academia Nacional de Ciencias . 120 (13) e2215907120. arXiv : 2306.05499 . Bibcode : 2023PNAS..12015907M . doi : 10.1073/pnas.2215907120 . PMC 10068812. PMID 36943882 .
- ↑ Buolamwini, Joy; Gebru, Timnit (1 de enero de 2018). "Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification" (PDF) . Proceedings of Machine Learning Research (FAT*) . Recuperado el 2 de octubre de 2025 .
- ↑ Yang, Kaiqi (1 de noviembre de 2024). "Desglosando el sesgo político en grandes modelos de lenguaje: una comparación entre modelos sobre la política estadounidense". arXiv : 2412.16746 [ cs.CY ].
- ↑ Strubell, Emma; Ganesh, Ananya; McCallum, Andrew (28 de julio de 2019). "Consideraciones sobre energía y políticas para el aprendizaje profundo en PLN" (PDF) . Antología ACL . Recuperado el 2 de octubre de 2025 .
- ↑ He, Yuhao; Yang, Li; Qian, Chunlian; Li, Tong; Su, Zhengyuan; Zhang, Qiang; et al. (28 de abril de 2023). "Intervenciones con agentes conversacionales para problemas de salud mental: revisión sistemática y metaanálisis de ensayos controlados aleatorios" . Journal of Medical Internet Research . 25 e43862. doi : 10.2196/43862 . PMC 10182468. PMID 37115595 .
- ↑ Pauketat, Janet VT; Ladak, Ali; Anthis, Jacy Reese (2025). "Construyendo un mundo para un futuro con IA sensible" (PDF) . The British Journal of Social Psychology . 64 (1) e12844. doi : 10.1111/bjso.12844 . PMID 39737875. Consultado el 2 de octubre de 2025 .
- ↑ Anthis, Jacy Reese; Pauketat, Janet VT (2025). «Percepciones de la IA sensible y otras mentes digitales: evidencia de la encuesta sobre IA, moralidad y sensibilidad (AIMS)». Actas de la Conferencia CHI 2025 sobre factores humanos en sistemas informáticos . págs. 1–22 . arXiv : 2407.08867 . doi : 10.1145/3706598.3713329 . ISBN 979-8-4007-1394-1.
- ↑ Alba, Davey (1 de mayo de 2023). "Se han utilizado chatbots de IA para crear decenas de granjas de contenido de noticias" . The Japan Times . Consultado el 18 de junio de 2023 .
- ↑ "¿Podrían los chatbots ayudar a diseñar el próximo virus pandémico?" . Science . 14 de junio de 2023. doi : 10.1126/science.adj2463 . Archivado del original el 18 de junio de 2023 . Consultado el 18 de junio de 2023 .
- ↑ Kang, Daniel (2023). "Explotación del comportamiento programático de LLM: Doble uso a través de ataques de seguridad estándar" . Talleres de seguridad y privacidad de IEEE . arXiv : 2302.05733 .
- ↑ "Una red de contenido prorrusa presagia el futuro automatizado de las operaciones de información" (PDF) . American Sunlight Project. 26 de febrero de 2025. Consultado el 15 de abril de 2026 .
- ↑ Goudarzi, Sara (26 de marzo de 2025). "Las redes rusas inundan Internet con propaganda, con el objetivo de corromper los chatbots de IA" . Boletín de los Científicos Atómicos . Consultado el 10 de abril de 2025 .
- ↑ Wang, Yongge (20 de junio de 2024). "Canal encubierto basado en cifrado para modelos de lenguaje grandes" (PDF) . IACR ePrint 2024/586. Archivado (PDF) del original el 24 de junio de 2024. Recuperado el 24 de junio de 2024 .
- ↑ Rrv, Aswin; Tyagi, Nemika (11 de agosto de 2024). "Caos con palabras clave: exponiendo la adulación de los grandes modelos de lenguaje a las palabras clave engañosas y evaluando las estrategias de defensa" (PDF) . Antología ACL . Recuperado el 2 de octubre de 2025 .
- ^ Salvi, Francisco; Horta Ribeiro, Manoel; Gallotti, Riccardo (19 de mayo de 2025). "Sobre la capacidad de persuasión conversacional de GPT-4" . Naturaleza Comportamiento Humano . 9 (8): 1645–1653.doi : 10.1038 / s41562-025-02194-6 . PMC 12367540 . PMID 40389594 .
- ↑ Østergaard, Søren Dinesen (25 de agosto de 2023). "¿Generarán delirios los chatbots de inteligencia artificial generativa en individuos propensos a la psicosis?" . Schizophrenia Bulletin . 49 (6): 1418– 1419. doi : 10.1093/schbul/sbad128 . PMC 10686326 . PMID 37625027 .
- ↑ Rosenberg, Josh (21 de agosto de 2025). "South Park critica a ChatGPT y a los inútiles aduladores tecnológicos" . Esquire . Consultado el 2 de octubre de 2025 .
- ↑ Douglas, Will (3 de marzo de 2023). "La historia interna de cómo se construyó ChatGPT contada por las personas que lo crearon" . MIT Technology Review . Archivado del original el 3 de marzo de 2023. Recuperado el 6 de marzo de 2023 .
- ↑ Greshake, Kai; Abdelnabi, Sahar; Mishra, Shailesh; Endres, Christoph; Holz, Thorsten; Fritz, Mario (1 de febrero de 2023). «Not What You've Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection» . Actas del 16.º Taller ACM sobre Inteligencia Artificial y Seguridad . págs. 79-90 . doi : 10.1145/3605764.3623985 . ISBN 979-8-4007-0260-0.
- ↑ Edwards, Benj (15 de enero de 2024). "Anthropic afirma que el envenenamiento por IA podría convertir los modelos en "agentes durmientes" destructivos" . Ars Technica . Consultado el 19 de julio de 2025 .
- ↑ "Juez estadounidense aprueba acuerdo de derechos de autor de 1.500 millones de dólares de Anthropic con los autores" . Reuters . 25 de septiembre de 2025. Consultado el 26 de septiembre de 2025 .
- ↑ "Anthropic llega a un acuerdo de 1.500 millones de dólares con los autores por reclamaciones de derechos de autor relacionadas con la IA" . Associated Press . 25 de septiembre de 2025. Consultado el 26 de septiembre de 2025 .
- ↑ "Meta se defiende de la demanda por derechos de autor presentada por autores en EE. UU. por IA" . Reuters . 25 de junio de 2025. Consultado el 26 de junio de 2025 .
- ↑ "Meta logra una victoria en un caso de derechos de autor sobre IA" . Wired . 25 de junio de 2025. Consultado el 26 de junio de 2025 .
- ↑ "OpenAI desestima por ahora la demanda por derechos de autor interpuesta por medios de comunicación sobre el entrenamiento de IA" . Reuters . 7 de noviembre de 2024. Consultado el 8 de noviembre de 2024 .
- ↑ Robison, Kylie (21 de noviembre de 2024). "OpenAI borra pruebas en demanda por datos de entrenamiento" . The Verge . Consultado el 22 de noviembre de 2024 .
- ↑ Peng, Zhencan; Wang, Zhizhi; Deng, Dong (13 de junio de 2023). "Búsqueda de secuencias casi duplicadas a escala para la evaluación de la memorización de modelos de lenguaje grandes" ( PDF) . Actas de la ACM sobre gestión de datos . 1 (2): 1– 18. doi : 10.1145/3589324 . S2CID 259213212. Archivado (PDF) del original el 27 de agosto de 2024. Recuperado el 20 de enero de 2024 . Citando a Lee et al. 2022.
- ^ Peng, Wang y Deng 2023 , pág. 8 .
- ↑ Council, Stephen (1 de diciembre de 2023). "Cómo los empleados de Google descifraron el modelo tecnológico de un rival de San Francisco con una sola palabra" . SFGate. Archivado del original el 16 de diciembre de 2023.
- ↑ "Prepárense para modelos de lenguaje grandes y verdaderamente útiles" . Nature Biomedical Engineering . 7 (2): 85– 86. 7 de marzo de 2023. doi : 10.1038/s41551-023-01012-6 . PMID 36882584. S2CID 257403466 .
- ^ Brinkmann, Levin; Baumann, Fabián; Bonnefon, Jean-François; Derex, Maxime; Müller, Thomas F.; Nussberger, Anne-Marie; et al. (20 de noviembre de 2023). "Cultura de las máquinas" . Naturaleza Comportamiento Humano . 7 (11): 1855–1868 . arXiv : 2311.11388 . doi : 10.1038/s41562-023-01742-2 . ISSN 2397-3374 . PMID 37985914 .
- ↑ Niederhoffer, Kate; Kellerman, Gabriella Rosen; Lee, Angela; Liebscher, Alex; Rapuano, Kristina; Hancock, Jeffrey T. (25 de septiembre de 2025). "La 'carga de trabajo' generada por IA está destruyendo la productividad" . Harvard Business Review . Recuperado el 22 de septiembre de 2025 .
- ↑ Acar, Oguz A.; Gai, Phyliss Jia; Tu, Yanping; Hou, Jiayi (1 de agosto de 2025). "Investigación: La penalización oculta del uso de la IA en el trabajo" . Harvard Business Review . Recuperado el 22 de septiembre de 2025 .
- ↑ "Sedientos de energía: cómo la IA impulsará la demanda energética" . FMI . Consultado el 8 de octubre de 2025 .
- ↑ Mehta, Sourabh (3 de julio de 2024). "¿Cuánta energía consumen los LLM? Descubriendo el poder detrás de la IA" . Asociación de Científicos de Datos . Recuperado el 27 de enero de 2025 .
- ↑ Luccioni, Sasha; Jernite, Yacine; Strubell, Emma (2024). «Procesamiento con alto consumo de energía: ¿Los vatios impulsan el costo de la implementación de la IA?». Conferencia ACM 2024 sobre equidad, responsabilidad y transparencia . págs. 85–99 . arXiv : 2311.16863 . doi : 10.1145/3630106.3658542 . ISBN 979-8-4007-0450-5.
- 1 2 Edwards, Benj (26 de marzo de 2025). "Los desarrolladores de código abierto dicen que los rastreadores de IA dominan el tráfico, lo que obliga a bloquear países enteros" . Ars Technica . Recuperado el 31 de diciembre de 2025 .
- ↑ Claburn, Thomas (18 de marzo de 2025). "Los rastreadores de IA no han aprendido a llevarse bien con los sitios web" . The Register . Consultado el 31 de diciembre de 2025 .
- ↑ Belanger, Ashley (29 de enero de 2025). "Los detractores de la IA construyen trampas para engañar a los rastreadores de IA que ignoran robots.txt" . Ars Technica . Consultado el 31 de diciembre de 2025 .
- ↑ Zao-Sanders, Marc (19 de marzo de 2024). "Cómo la gente realmente usa GenAI" . Harvard Business Review . ISSN 0017-8012 . Recuperado el 10 de agosto de 2025 .
- ↑ Rousmaniere, Tony; Zhang, Yimeng; Li, Xu; Shah, Siddharth (21 de julio de 2025). "Los grandes modelos lingüísticos como recursos de salud mental: patrones de uso en los Estados Unidos" . Practice Innovations . doi : 10.1037/pri0000292 . ISSN 2377-8903 .
- ↑ Moore, Jared; Grabb, Declan; Agnew, William; Klyman, Kevin; Chancellor, Stevie; Ong, Desmond C.; et al. (25 de abril de 2025). «Expresar estigma y respuestas inapropiadas impide que los LLMS reemplacen de forma segura a los proveedores de salud mental». Actas de la Conferencia ACM de 2025 sobre Equidad, Responsabilidad y Transparencia . págs. 599–627 . arXiv : 2504.18412 . doi : 10.1145/3715275.3732039 . ISBN 979-8-4007-1482-5.
- ↑ McBain, Ryan K.; Cantor, Jonathan H.; Zhang, Li Ang; Baker, Olesya; Zhang, Fang; Halbisen, Alyssa; et al. (5 de marzo de 2025). "Competencia de los grandes modelos de lenguaje en la evaluación de respuestas apropiadas a la ideación suicida: estudio comparativo" . Journal of Medical Internet Research . 27 (1) e67891. doi : 10.2196/67891 . PMC 11928068. PMID 40053817 .
- ↑ "Los chatbots de IA podrían estar volviéndote más tonto" . BBC . 20 de abril de 2026. Consultado el 21 de abril de 2026 .
- ↑ Li, Fei-Fei; Etchemendy, John (22 de mayo de 2024). "No, la IA actual no es sensible. Así es como lo sabemos" . Time . Consultado el 22 de mayo de 2024 .
- 1 2 Chalmers, David J. (9 de agosto de 2023). "¿Podría un modelo de lenguaje grande ser consciente?" . Boston Review .
- ↑ Thomson, Jonny (31 de octubre de 2022). "¿Por qué los robots no tienen derechos?" . Big Think . Archivado del original el 13 de septiembre de 2024. Recuperado el 23 de febrero de 2024 .
- ↑ Kateman, Brian (24 de julio de 2023). "La IA debería tener miedo de los humanos" . Time . Archivado del original el 25 de septiembre de 2024. Recuperado el 23 de febrero de 2024 .
- ↑ Metzinger, Thomas (2021). "Sufrimiento artificial: un argumento a favor de una moratoria global sobre la fenomenología sintética" . Journal of Artificial Intelligence and Consciousness . 08 : 43–66 . doi : 10.1142/S270507852150003X . S2CID 233176465 .
- ↑ Tkachenko, Yegor (2024). "Posición: Amnesia forzada como forma de mitigar el riesgo potencial de sufrimiento silencioso en la IA consciente" . ICML . 235 : 48362–48368 .
- ↑ Dung, Leonard (2025). Salvar las mentes artificiales: comprender y prevenir el sufrimiento de la IA . Routledge. doi : 10.4324/9781003674573 . ISBN 978-1-041-14466-3.
- ↑ Leith, Sam (9 de julio de 2022). "Nick Bostrom: ¿Cómo podemos estar seguros de que una máquina no es consciente?" . The Spectator . Consultado el 22 de septiembre de 2025 .
- ↑ Chalmers, David (1995). "Enfrentando el problema de la conciencia". Journal of Consciousness Studies . 2 (3): 200– 219. CiteSeerX 10.1.1.103.8362 .
- ↑ Maruf, Ramishah (25 de julio de 2022). "Google despide a un ingeniero que sostenía que su tecnología de IA era sensible" . CNN . Consultado el 22 de septiembre de 2025 .
- ↑ Shanahan, Murray (2024). "Hablando de grandes modelos de lenguaje" . Communications of the ACM . 67 (2): 68– 79. doi : 10.1145/3624724 .
Lecturas adicionales
- Jurafsky, Dan , Martin, James H. Procesamiento del habla y del lenguaje: una introducción al procesamiento del lenguaje natural, la lingüística computacional y el reconocimiento del habla , borrador de la 3.ª edición, 2023.
- Yin, Shukang; Fu, Chaoyou; Zhao, Sirui; Como; Sol, Xing; Xu, Tong; et al. (2024). "Una encuesta sobre modelos de lenguajes grandes multimodales" . Revista Nacional de Ciencias . 11 (12) nwae403. arXiv : 2306.13549 . doi : 10.1093/nsr/nwae403 . PMC 11645129 . PMID 39679213 .
- "Informe del Índice de IA 2024 – Índice de Inteligencia Artificial" . aiindex.stanford.edu . Consultado el 5 de mayo de 2024 .
- Frank, Michael C. (27 de junio de 2023). "Primeros pasos en la evaluación de las capacidades de los grandes modelos de lenguaje" . Nature Reviews Psychology . 2 (8): 451– 452. doi : 10.1038/s44159-023-00211-x . ISSN 2731-0574 . S2CID 259713140. Recuperado el 2 de julio de 2023 .
- Modelos de lenguaje a gran escala
- Aprendizaje profundo
- Procesamiento del lenguaje natural
- Consumo de energía
- Política energética
- El agua y el medio ambiente
- Impacto ambiental de la industria energética
- Impacto ambiental por origen