Generative Pre-trained Transformer 3 ( GPT-3 ) es un modelo de lenguaje de gran tamaño lanzado por OpenAI en 2020.
Al igual que su predecesor, GPT-2 , es un modelo transformador de red neuronal profunda que solo utiliza decodificadores [ 2 ] , el cual reemplaza las arquitecturas basadas en recurrencia y convolución con una técnica conocida como " atención " [ 3 ] . Este mecanismo de atención permite que el modelo se enfoque selectivamente en los segmentos del texto de entrada que predice que son más relevantes [ 4 ] . GPT-3 tiene 175 mil millones de parámetros [ 1 ] , cada uno con una precisión de 16 bits, lo que requiere 350 GB de almacenamiento ya que cada parámetro ocupa 2 bytes. Tiene un tamaño de ventana de contexto de 2048 tokens [ 1 ] : 43 y ha demostrado fuertes capacidades de aprendizaje " de cero disparos " y " de pocos disparos " en muchas tareas [ 2 ] .
El 22 de septiembre de 2020, Microsoft anunció que había obtenido la licencia exclusiva de GPT-3. Otros aún pueden recibir resultados de su API pública, pero solo Microsoft tiene acceso al modelo subyacente. [ 5 ]
Fondo
Según The Economist , la mejora de los algoritmos, la mayor potencia de los ordenadores y el reciente aumento de la cantidad de material digitalizado han impulsado una revolución en el aprendizaje automático . Las nuevas técnicas de la década de 2010 dieron lugar a "rápidas mejoras en las tareas", incluida la manipulación del lenguaje. [ 6 ]
Los modelos de software se entrenan para aprender utilizando miles o millones de ejemplos en una "estructura ... vagamente basada en la arquitectura neuronal del cerebro". [ 6 ] Una arquitectura utilizada en el procesamiento del lenguaje natural (PLN) es una red neuronal basada en un modelo de aprendizaje profundo que se introdujo en 2017: la arquitectura Transformer . [ 7 ] Existen varios sistemas de PLN capaces de procesar, extraer, organizar, conectar y contrastar entradas textuales, así como de responder correctamente a preguntas. [ 8 ]
El 11 de junio de 2018, investigadores e ingenieros de OpenAI publicaron un artículo que presentaba el primer transformador generativo preentrenado (GPT) , un tipo de modelo de lenguaje generativo a gran escala que se preentrena con un corpus de texto enorme y diverso en conjuntos de datos , seguido de un ajuste fino discriminativo para centrarse en una tarea específica. Los modelos GPT son arquitecturas de redes neuronales de aprendizaje profundo basadas en transformadores. Anteriormente, los modelos de PLN neuronales de mejor rendimiento solían emplear el aprendizaje supervisado a partir de grandes cantidades de datos etiquetados manualmente, lo que hacía que entrenar modelos de lenguaje extremadamente grandes fuera prohibitivamente caro y lento. [ 2 ] El primer modelo GPT se conoció como GPT-1 , y le siguió GPT-2 en febrero de 2019. Creado como una ampliación directa de su predecesor, GPT-2 vio incrementados tanto su número de parámetros como el tamaño del conjunto de datos en un factor de 10. Tenía 1.500 millones de parámetros y se entrenó con un conjunto de datos de 8 millones de páginas web. [ 9 ]
En febrero de 2020, Microsoft presentó su Turing Natural Language Generation (T-NLG), que según afirmaron era "el modelo de lenguaje más grande jamás publicado, con 17 mil millones de parámetros". [ 10 ] Tuvo un mejor desempeño que cualquier otro modelo de lenguaje en una variedad de tareas, incluyendo resumir textos y responder preguntas .
Formación y capacidades
El concepto de "estilos de aprendizaje" resulta problemático porque no tiene en cuenta los procesos mediante los cuales se forman. Algunos estudiantes pueden desarrollar un estilo de aprendizaje particular debido a experiencias específicas. Otros, en cambio, pueden desarrollarlo al intentar adaptarse a un entorno de aprendizaje que no se ajustaba a sus necesidades. En definitiva, necesitamos comprender la interacción entre los estilos de aprendizaje y los factores ambientales y personales, y cómo estos influyen en nuestra forma de aprender y en los tipos de aprendizaje que experimentamos.
El 28 de mayo de 2020, un preimpreso de arXiv de un grupo de 31 ingenieros e investigadores de OpenAI describió el logro y desarrollo de GPT-3, un "modelo de lenguaje de última generación" de tercera generación. [ 1 ] [ 12 ] El equipo aumentó la capacidad de GPT-3 en más de dos órdenes de magnitud con respecto a la de su predecesor, GPT-2, [ 13 ] convirtiendo a GPT-3 en el modelo de lenguaje no disperso más grande en ese momento. [ 1 ] : 14 [ 14 ] Debido a que GPT-3 es estructuralmente similar a sus predecesores, [ 1 ] su mayor precisión se atribuye a su mayor capacidad y mayor número de parámetros. [ 15 ] La capacidad de GPT-3 es diez veces mayor que la del Turing NLG de Microsoft, el siguiente modelo de PLN más grande conocido en ese momento. [ 12 ]
Lambdalabs estimó un costo hipotético de alrededor de 4,6 millones de dólares estadounidenses y 355 años para entrenar GPT-3 en una sola GPU en 2020, [ 16 ] con un tiempo de entrenamiento real menor al usar más GPU en paralelo.
El sesenta por ciento del conjunto de datos de preentrenamiento ponderado para GPT-3 proviene de una versión filtrada de Common Crawl que consta de 410 mil millones de tokens codificados en pares de bytes . La deduplicación difusa utilizó MinHash LSH de Apache Spark . [ 1 ] : 9 Otras fuentes son 19 mil millones de tokens de WebText2 que representan el 22% del total ponderado, 12 mil millones de tokens de Books1 que representan el 8%, 55 mil millones de tokens de Books2 que representan el 8%, y 3 mil millones de tokens de Wikipedia que representan el 3%. [ 1 ] : 9 GPT-3 fue entrenado con cientos de miles de millones de palabras y también es capaz de codificar en CSS , JSX y Python , entre otros.
Dado que los datos de entrenamiento de GPT-3 eran exhaustivos, no requiere entrenamiento adicional para tareas lingüísticas específicas. Los datos de entrenamiento contienen lenguaje tóxico ocasionalmente, y GPT-3 genera ocasionalmente lenguaje tóxico como resultado de imitar sus datos de entrenamiento. Un estudio de la Universidad de Washington descubrió que GPT-3 producía lenguaje tóxico con un nivel de toxicidad comparable al de modelos de procesamiento del lenguaje natural similares, como GPT-2 y CTRL. OpenAI ha implementado varias estrategias para limitar la cantidad de lenguaje tóxico generado por GPT-3. Como resultado, GPT-3 produjo menos lenguaje tóxico en comparación con su modelo predecesor, GPT-1, aunque produjo más generaciones y una mayor toxicidad de lenguaje tóxico en comparación con CTRL Wiki, un modelo de lenguaje entrenado completamente con datos de Wikipedia. [ 17 ]
El 11 de junio de 2020, OpenAI anunció que los usuarios podían solicitar acceso a su API GPT-3, fácil de usar (un "conjunto de herramientas de aprendizaje automático"), para ayudar a OpenAI a "explorar las fortalezas y limitaciones" de esta nueva tecnología. [ 18 ] [ 19 ] La invitación describía cómo esta API tenía una interfaz de propósito general "texto de entrada, texto de salida" que puede completar casi "cualquier tarea en inglés", en lugar del caso de uso único habitual. [ 18 ] Según un usuario, que tuvo acceso a una versión temprana privada de la API GPT-3 de OpenAI, GPT-3 era "sorprendentemente bueno" para escribir "texto increíblemente coherente" con solo unas pocas indicaciones simples. [ 20 ] En un experimento inicial, se pidió a 80 sujetos estadounidenses que juzgaran si artículos cortos de ~200 palabras habían sido escritos por humanos o por GPT-3. Los participantes juzgaron correctamente el 52% de las veces, lo que fue solo un poco mejor que adivinar al azar. [ 1 ]
El 18 de noviembre de 2021, OpenAI anunció que se habían implementado suficientes medidas de seguridad para que el acceso a su API fuera irrestricto. [ 21 ] OpenAI proporcionó a los desarrolladores una herramienta de moderación de contenido que les ayuda a cumplir con la política de contenido de OpenAI. [ 22 ] El 27 de enero de 2022, OpenAI anunció que sus modelos de lenguaje GPT-3 más recientes (conocidos colectivamente como InstructGPT) eran ahora el modelo de lenguaje predeterminado utilizado en su API . Según OpenAI, InstructGPT producía contenido que se ajustaba mejor a las intenciones del usuario al seguir mejor las instrucciones, generar menos datos inventados y producir contenido algo menos tóxico. [ 23 ]
Debido a que GPT-3 puede "generar artículos de noticias que los evaluadores humanos tienen dificultades para distinguir de los artículos escritos por humanos", [ 12 ] GPT-3 tiene el "potencial de impulsar tanto las aplicaciones beneficiosas como las perjudiciales de los modelos de lenguaje". [ 1 ] : 34 En su artículo del 28 de mayo de 2020, los investigadores describieron en detalle los posibles "efectos perjudiciales de GPT-3" [ 12 ] que incluyen "desinformación, spam , phishing , abuso de procesos legales y gubernamentales , redacción fraudulenta de ensayos académicos y pretextos de ingeniería social ". [ 1 ] Los autores llaman la atención sobre estos peligros para solicitar investigaciones sobre la mitigación de riesgos . [ 1 ] : 34
GPT-3 es capaz de realizar aprendizaje de cero disparos y de pocos disparos (incluido un solo disparo). [ 1 ]
En junio de 2022, Almira Osmanovic Thunström escribió que GPT-3 era el autor principal de un artículo sobre sí mismo, que lo habían enviado para su publicación, [ 24 ] y que había sido prepublicado mientras esperaba la finalización de su revisión. [ 25 ]
Modelos GPT-3
Existen muchos modelos en la familia GPT-3, algunos con propósitos diferentes a otros. En el artículo de investigación inicial publicado por OpenAI, mencionaron 8 tamaños diferentes del modelo principal GPT-3 (Tabla 2.1):
La mitad de los modelos son accesibles a través de la API, concretamente GPT-3-medium, GPT-3-xl, GPT-3-6.7B y GPT-3-175b, denominados respectivamente ada, babbage, curie y davinci. Aunque OpenAI no reveló inicialmente el tamaño de los modelos de la API, EleutherAI anunció la correspondencia entre los tamaños de los modelos y los nombres de la API en mayo de 2021. [ 26 ] Posteriormente, OpenAI confirmó estos tamaños de modelos, [ 27 ] pero no se han revelado los tamaños de los modelos subsiguientes.
GPT-3.5
El Transformer Preentrenado Generativo 3.5 ( GPT-3.5 ) es una subclase de los modelos GPT-3 creada por OpenAI en 2022.
El 15 de marzo de 2022, OpenAI puso a disposición nuevas versiones de GPT-3 y Codex en su API con capacidades de edición e inserción bajo los nombres "text-davinci-002" y "code-davinci-002". [ 28 ] Estos modelos fueron descritos como más capaces que las versiones anteriores y fueron entrenados con datos hasta junio de 2021. [ 29 ] El 28 de noviembre de 2022, OpenAI presentó text-davinci-003. [ 30 ] El 30 de noviembre de 2022, OpenAI comenzó a referirse a estos modelos como pertenecientes a la serie "GPT-3.5", [ 29 ] y lanzó ChatGPT , que fue ajustado a partir de un modelo de la serie GPT-3.5. [ 31 ] OpenAI no incluye GPT-3.5 en GPT-3. [ 32 ]
Modelos
Hay tres modelos: [ 33 ]
- Charlar
- gpt-3.5-turbo
- Completar texto
- texto-davinci-003
- texto-davinci-002
GPT-3.5 con navegación
El 10 de abril de 2023, OpenAI presentó una nueva variante de su modelo GPT-3.5, conocida como GPT-3.5 con Navegación (ALPHA). Se describió que este modelo actualizado se basaba en las capacidades de sus predecesores "text-davinci-002" y "code-davinci-002". [ 34 ] El modelo GPT-3.5 con Navegación (ALPHA) incorporó la capacidad de acceder y navegar por información en línea. Esto ha dado como resultado respuestas más precisas y actualizadas a las consultas de los usuarios.
El modelo GPT-3.5 con navegación (ALPHA) se entrenó con datos hasta septiembre de 2021, lo que le proporciona más información que los modelos GPT-3.5 anteriores, que se entrenaron con datos hasta junio de 2021. El modelo buscaba ofrecer a desarrolladores y usuarios una herramienta avanzada de procesamiento del lenguaje natural capaz de recuperar y sintetizar información en línea de manera eficaz.
Para habilitar las capacidades de navegación, OpenAI implementó una nueva API que permite al modelo GPT-3.5 con Navegación (ALPHA) acceder a recursos en línea seleccionados durante su funcionamiento. [ 35 ] Esta función permite a los usuarios formular preguntas o solicitar información con la expectativa de que el modelo proporcione respuestas actualizadas, precisas y relevantes basadas en las fuentes en línea más recientes disponibles.
El 27 de abril de 2023, OpenAI puso a disposición del público el modelo GPT-3.5 con navegación (ALPHA) para los usuarios de GPT Plus. Esto permitió que más personas tuvieran acceso a sus nuevas funciones. [ 35 ]
InstructGPT
InstructGPT es una versión ajustada de GPT-3.5 entrenada en un conjunto de datos de instrucciones escritas por humanos. [ 36 ]
Recepción
Aplicaciones
- GPT-3, específicamente el modelo Codex , fue la base de GitHub Copilot , un software de generación y autocompletado de código que se puede utilizar en varios editores de código e IDE. [ 37 ] [ 38 ]
- GPT-3 se utiliza en ciertos productos de Microsoft para traducir lenguaje convencional a código informático formal. [ 39 ] [ 40 ]
- GPT-3 se ha utilizado en CodexDB [ 41 ] para generar código específico de consulta para el procesamiento de SQL .
- Jason Rohrer ha utilizado GPT-3 en un proyecto de chatbot de temática retro llamado "Project December", que es accesible en línea y permite a los usuarios conversar con varias IA que utilizan la tecnología GPT-3. [ 42 ]
- El periódico The Guardian utilizó GPT-3 para escribir un artículo sobre la inocuidad de la IA para los seres humanos. Se le introdujeron algunas ideas y produjo ocho ensayos diferentes, que finalmente se fusionaron en un solo artículo. [ 43 ]
- GPT-3 se utilizó en AI Dungeon , que genera juegos de aventuras basados en texto. Posteriormente fue reemplazado por un modelo de la competencia después de que OpenAI cambiara su política con respecto al contenido generado. [ 44 ] [ 45 ]
- GPT-3 se utiliza para ayudar en la redacción de textos y otros materiales de marketing. [ 46 ]
- Un estudio de 2022 de la Universidad de Drexel sugirió que los sistemas basados en GPT-3 podrían usarse para detectar signos tempranos de la enfermedad de Alzheimer . [ 47 ] [ 48 ]
Reseñas
- En una reseña de julio de 2020 en The New York Times , Farhad Manjoo dijo que la capacidad de GPT-3 para generar código informático, poesía y prosa no es solo "asombrosa", "escalofriante" e "inquietante", sino también "un poco aterradora". [ 49 ]
- Daily Nous presentó una serie de artículos de nueve filósofos sobre GPT-3. [ 50 ] El filósofo australiano David Chalmers describió GPT-3 como "uno de los sistemas de IA más interesantes e importantes jamás producidos". [ 51 ]
- Una reseña en Wired decía que GPT-3 estaba "provocando escalofríos en todo Silicon Valley ". [ 52 ]
- La National Law Review afirmó que GPT-3 es un "paso impresionante en el proceso más amplio", y que OpenAI y otros están encontrando "aplicaciones útiles para todo este poder" mientras continúan "trabajando hacia una inteligencia más general ". [ 53 ]
- Un artículo en la MIT Technology Review , escrito en colaboración con el crítico de aprendizaje profundo Gary Marcus , [ 54 ] afirmó que la "comprensión del mundo de GPT-3 a menudo es muy errónea, lo que significa que nunca se puede confiar realmente en lo que dice". [ 55 ] Según los autores, GPT-3 modela relaciones entre palabras sin tener una comprensión del significado detrás de cada palabra.
- Jerome Pesenti, director del laboratorio de IA de Facebook, afirmó que GPT-3 es "inseguro", señalando el lenguaje sexista , racista y otros lenguajes sesgados y negativos generados por el sistema cuando se le pidió que hablara sobre judíos, mujeres, personas negras y el Holocausto . [ 56 ]
- Nabla, una empresa emergente francesa especializada en tecnología sanitaria, probó GPT-3 como chatbot médico , aunque la propia OpenAI advirtió sobre los riesgos de dicho uso. Como era de esperar, GPT-3 mostró varias limitaciones. Por ejemplo, durante las pruebas de sus respuestas sobre problemas de salud mental, la IA aconsejó a un paciente simulado que se suicidara. [ 57 ]
- Noam Chomsky expresó su escepticismo sobre el valor científico de GPT-3: «No es un modelo de lenguaje. Funciona igual de bien para lenguajes imposibles que para lenguajes reales. Por lo tanto, si se pretende que sea un modelo de lenguaje, queda refutado por los criterios científicos habituales. [...] Quizás sea útil para algún propósito, pero parece no decirnos nada sobre el lenguaje o la cognición en general». [ 58 ]
- Luciano Floridi y Massimo Chiriatti destacaron el riesgo de la "producción barata de buenos artefactos semánticos". [ 59 ]
- El propio Sam Altman de OpenAI criticó lo que llamó "exageración en torno a GPT-3", reconociendo que GPT-3 "tiene serias debilidades y a veces comete errores muy tontos... La IA va a cambiar el mundo, pero GPT-3 es solo un primer vistazo". [ 60 ]
Crítica
El creador de GPT-3, OpenAI , se fundó inicialmente como una organización sin ánimo de lucro en 2015. [ 61 ] En 2019, OpenAI se apartó de sus estándares habituales de código abierto al no publicar GPT-2 , el modelo predecesor de GPT-3, alegando que el modelo podría facilitar la propagación de noticias falsas. OpenAI finalmente publicó una versión que representaba el 8% del tamaño del modelo original. [ 62 ] Ese mismo año, OpenAI se reestructuró para convertirse en una empresa con fines de lucro. [ 63 ] En 2020, Microsoft anunció que la empresa tenía la licencia exclusiva de GPT-3 para sus productos y servicios tras una inversión multimillonaria en OpenAI. El acuerdo permite a OpenAI ofrecer una API pública para que los usuarios puedan enviar texto a GPT-3 y recibir la salida del modelo, pero solo Microsoft tendrá acceso al código fuente de GPT-3. [ 5 ]
Los grandes modelos de lenguaje, como GPT-3, han sido objeto de críticas por parte de algunos investigadores de ética de IA de Google debido al impacto ambiental del entrenamiento y almacenamiento de los modelos, detallado en un artículo escrito en coautoría por Timnit Gebru y Emily M. Bender en 2021. [ 64 ]
El creciente uso de tecnologías de escritura automatizada basadas en GPT-3 y otros generadores de lenguaje ha generado inquietudes con respecto a la integridad académica [ 65 ] y ha aumentado la importancia de cómo las universidades y las escuelas evaluarán qué constituye una mala conducta académica, como el plagio. [ 66 ]
La serie GPT de OpenAI se construyó con datos del conjunto de datos Common Crawl , un conglomerado de artículos, publicaciones de internet, páginas web y libros con derechos de autor recopilados de 60 millones de dominios durante un período de 12 años. TechCrunch informa que estos datos de entrenamiento incluyen material con derechos de autor de la BBC, The New York Times , Reddit , el texto completo de libros en línea y más. [ 67 ] En su respuesta a una Solicitud de Comentarios de 2019 sobre la Protección de la Propiedad Intelectual para la Innovación en Inteligencia Artificial de la Oficina de Patentes y Marcas de los Estados Unidos (USPTO), OpenAI argumentó que "Según la ley actual, entrenar sistemas de IA [como sus modelos GPT] constituye un uso legítimo ", pero que "dada la falta de jurisprudencia al respecto, OpenAI y otros desarrolladores de IA como nosotros enfrentamos una considerable incertidumbre legal y costos de cumplimiento". [ 68 ]
Véase también
Referencias
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 Brown, Tom B .; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; Sutskever, Ilya; Amodei, Dario (28 de mayo de 2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". arXiv : 2005.14165 [ cs.CL ].
- 1 2 3 Radford, Alec; Narasimhan, Karthik; Salimans, Tim; Sutskever, Ilya (11 de junio de 2018). "Mejora de la comprensión del lenguaje mediante el preentrenamiento generativo" (PDF) . pág. 12. Archivado (PDF) del original el 26 de enero de 2021. Recuperado el 31 de julio de 2020 .
- ^ Vaswani, Ashish ; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, León; Gómez, Aidan N ; Káiser, Łukasz; Polosukhin, Illia (2017). "La atención es todo lo que necesita" (PDF) . Avances en los sistemas de procesamiento de información neuronal . 30 . Curran asociados, Inc.
- ↑ Bahdanau, Dzmitry; Cho, Kyunghyun; Bengio, Yoshua (1 de septiembre de 2014). "Traducción automática neuronal mediante el aprendizaje conjunto de alineación y traducción". arXiv : 1409.0473 [ cs.CL ].
- 1 2 Hao, Karen (23 de septiembre de 2020). "OpenAI le está dando a Microsoft acceso exclusivo a su modelo de lenguaje GPT-3" . MIT Technology Review . Archivado del original el 5 de febrero de 2021. Recuperado el 25 de septiembre de 2020. Las empresas dicen que OpenAI continuará ofreciendo su
API
pública
, que permite a los usuarios seleccionados enviar texto a GPT-3 u otros modelos de OpenAI y recibir su resultado. Sin embargo, solo Microsoft tendrá acceso al código subyacente de GPT-3, lo que le permitirá incorporar, reutilizar y modificar el modelo a su antojo.
- 1 2 "Se empieza a comprender mejor la limitación de la IA" . The Economist . 11 de junio de 2020. ISSN 0013-0613 . Archivado del original el 31 de julio de 2020. Consultado el 31 de julio de 2020 .
- ↑ Polosukhin, Illia; Káiser, Lukasz; Gómez, Aidán N.; Jones, León; Uszkoreit, Jakob; Parmar, Niki; Shazeer, Noam; Vaswani, Ashish (12 de junio de 2017). " Atención es todo lo que necesitas ". arXiv : 1706.03762 [ cs.CL ].
- ↑ "Procesamiento del lenguaje natural" . Archivado del original el 22 de agosto de 2020. Consultado el 31 de julio de 2020 .
- ↑ "Copia archivada" (PDF) . Archivado (PDF) del original el 6 de febrero de 2021. Recuperado el 28 de abril de 2023 .
{{cite web}}: CS1 mantenimiento: copia archivada como título ( enlace ) - ↑ Sterling, Bruce (13 de febrero de 2020). "Web Semantics: Microsoft Project Turing introduce Turing Natural Language Generation (T-NLG)" . Wired . ISSN 1059-1028 . Archivado del original el 4 de noviembre de 2020. Consultado el 31 de julio de 2020 .
- ↑ Marche, Stephen (6 de diciembre de 2022). "El ensayo universitario ha muerto" . The Atlantic . Archivado del original el 24 de enero de 2023. Consultado el 8 de diciembre de 2022 .
- 1 2 3 4 Sagar, Ram (3 de junio de 2020). "OpenAI lanza GPT-3, el modelo más grande hasta la fecha" . Analytics India Magazine . Archivado del original el 4 de agosto de 2020. Recuperado el 31 de julio de 2020 .
- ↑ "Los modelos de lenguaje son aprendices multitarea no supervisados" (PDF) . openai.com . Archivado (PDF) del original el 12 de diciembre de 2019. Recuperado el 4 de diciembre de 2019.
GPT-2 es un Transformer de 1.5 mil millones de parámetros
. - ↑ Shead, Sam (23 de julio de 2020). «Por qué todo el mundo habla del generador de texto con IA lanzado por un laboratorio respaldado por Elon Musk» . CNBC . Archivado del original el 30 de julio de 2020. Consultado el 31 de julio de 2020 .Entre el 28 de mayo y el 22 de julio de 2020 se publicaron cuatro preimpresiones.
- ↑ Ray, Tiernan (1 de junio de 2020). "El gigantesco GPT-3 de OpenAI insinúa los límites de los modelos de lenguaje para la IA" . ZDNet . Archivado del original el 1 de junio de 2020. Recuperado el 31 de julio de 2020 .
- ↑ Li, Chuan (3 de junio de 2020), Modelo de lenguaje GPT-3 de OpenAI: una descripción técnica general , archivado del original el 27 de marzo de 2023 , consultado el 27 de marzo de 2023.
- ↑ Gehman, Samuel; Gururangan, Suchin; Sap, Maarten; Choi, Yejin; Smith, Noah A. (16-20 de noviembre de 2020), REALTOXICITYPROMPTS: Evaluación de la degeneración tóxica neuronal en modelos de lenguaje , Asociación de Lingüística Computacional, págs. 3356-3369 , arXiv : 2009.11462
- 1 2 "API de OpenAI" . OpenAI . 11 de junio de 2020. Archivado del original el 11 de junio de 2020. Recuperado el 31 de julio de 2020 .
- ↑ Coldewey, Devin (11 de junio de 2020). "OpenAI crea una API de propósito general para sus capacidades de IA basadas en texto" . TechCrunch . Archivado del original el 27 de octubre de 2021. Recuperado el 31 de julio de 2020. Si
alguna vez quisiste probar el aclamado conjunto de herramientas de aprendizaje automático de OpenAI, ahora es mucho más fácil. La compañía ha lanzado una API que permite a los desarrolladores usar sus herramientas de IA en "prácticamente cualquier tarea en inglés".
- ↑ Arram (9 de julio de 2020). "GPT-3: Una IA sorprendentemente buena escribiendo casi cualquier cosa" . Arram Sabeti . Archivado del original el 20 de julio de 2020. Consultado el 31 de julio de 2020 .
- ↑ "La API de OpenAI ya está disponible sin lista de espera" . OpenAI . 18 de noviembre de 2021. Archivado del original el 5 de noviembre de 2022. Consultado el 5 de noviembre de 2022 .
- ↑ "API de OpenAI" . beta.openai.com . Archivado del original el 23 de diciembre de 2022. Consultado el 5 de noviembre de 2022 .
- ↑ "Alineación de modelos de lenguaje para seguir instrucciones" . OpenAI . 27 de enero de 2022. Archivado del original el 5 de noviembre de 2022. Consultado el 5 de noviembre de 2022 .
- ↑ Thunström, Almira Osmanovic (30 de junio de 2022). "Le pedimos a GPT-3 que escribiera un artículo académico sobre sí mismo, y luego intentamos publicarlo" . Scientific American . Archivado del original el 30 de junio de 2022. Recuperado el 30 de junio de 2022 .
- ↑ Transformer, Gpt Generative Pretrained; Thunström, Almira Osmanovic; Steingrimsson, Steinn (21 de junio de 2022). "¿Puede GPT-3 escribir un artículo académico sobre sí mismo, con una mínima intervención humana?" . Archivo abierto HAL (en francés). Archivado del original el 30 de junio de 2022. Recuperado el 30 de junio de 2022 .
- ↑ Gao, Leo (24 de mayo de 2021). "Sobre los tamaños de los modelos de la API de OpenAI" . Blog de EleutherAI . EleutherAI . Recuperado el 23 de noviembre de 2023 .
- ↑ "Índice de modelos para investigadores" . OpenAI . Consultado el 23 de noviembre de 2023 .
{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace ) - ↑ "Nuevas capacidades de GPT-3: edición e inserción" . OpenAI . 15 de marzo de 2022. Archivado del original el 13 de enero de 2023. Consultado el 13 de enero de 2023 .
- 1 2 "API de OpenAI" . platform.openai.com . Archivado del original el 20 de marzo de 2023. Recuperado el 15 de marzo de 2023 .
- ↑ "¡Echa un vistazo al nuevo text-davinci-003 de OpenAI! Mismo modelo subyacente que text-davinci-002, pero más alineado. ¡Nos encantaría recibir comentarios al respecto! / Twitter" . Archivado del original el 15 de marzo de 2023. Recuperado el 6 de mayo de 2023 .
- ↑ "ChatGPT: Optimización de modelos de lenguaje para el diálogo" . OpenAI . 30 de noviembre de 2022. Archivado del original el 30 de noviembre de 2022. Consultado el 13 de enero de 2023 .
- ↑ "API de OpenAI" . Archivado del original el 17 de marzo de 2023. Consultado el 6 de mayo de 2023 .
- ↑ "API de OpenAI" . Archivado del original el 6 de mayo de 2023. Consultado el 6 de mayo de 2023 .
- ↑ "Presentación de la serie GPT-3.5: modelos text-davinci-002 y code-davinci-002" . OPEN AI . 15 de marzo de 2022. Archivado del original el 20 de marzo de 2023. Consultado el 27 de abril de 2023 .
- 1 2 "GPT-3.5 con navegación (ALPHA) ya está disponible para usuarios de GPT Plus" . OPEN AI . 27 de abril de 2023. Archivado del original el 20 de marzo de 2023. Recuperado el 27 de abril de 2023 .
- ↑ Gilson A, Safranek CW, Huang T, Socrates V, Chi L, Taylor RA, Chartash D (febrero de 2023). "¿Cómo se desempeña ChatGPT en el Examen de Licencia Médica de los Estados Unidos (USMLE)? Las implicaciones de los modelos de lenguaje grandes para la educación médica y la evaluación del conocimiento" . JMIR Med Educ . 9 e45312. doi : 10.2196/45312 . PMC 9947764. PMID 36753318 .
- ↑ "OpenAI Codex" . OpenAI . 10 de agosto de 2021. Archivado del original el 3 de febrero de 2023. Consultado el 23 de diciembre de 2022 .
- ↑ Thompson, Clive (15 de marzo de 2022). "Cómo una IA se convirtió en mi genio de la programación" . Wired . Archivado del original el 23 de diciembre de 2022. Consultado el 23 de diciembre de 2022 .
- ↑ "Microsoft anunció las primeras características de sus productos para clientes impulsadas por GPT-3 y @Azure" . El blog de IA . 25 de mayo de 2021. Archivado del original el 26 de mayo de 2021. Consultado el 26 de mayo de 2021 .
- ↑ Vincent, James (25 de mayo de 2021). "Microsoft ha creado un autocompletado de código impulsado por IA usando GPT-3" . The Verge . Archivado del original el 23 de diciembre de 2022. Recuperado el 23 de diciembre de 2022 .
- ↑ "CodexDB - Procesamiento SQL con tecnología GPT-3" . CodexDB - Procesamiento SQL con tecnología GPT-3 . Archivado del original el 7 de diciembre de 2022. Consultado el 7 de diciembre de 2022 .
- ↑ Fagone, Jason (23 de julio de 2021). "La simulación de Jessica: amor y pérdida en la era de la IA" San Francisco Chronicle . Archivado del original el 28 de julio de 2021. Recuperado el 29 de julio de 2021 .
- ↑ GPT-3 (8 de septiembre de 2020). «Un robot escribió todo este artículo. ¿Ya tienes miedo, humano? | GPT-3» . The Guardian . ISSN 0261-3077 . Archivado del original el 8 de septiembre de 2020. Consultado el 15 de septiembre de 2020 .
{{cite news}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ "Actualización: Modelos de lenguaje y Dragon" . Blog de Latitude . 8 de diciembre de 2021. Archivado del original el 25 de abril de 2022. Consultado el 22 de marzo de 2022 .
- ↑ "Este libro místico fue coescrito por una IA inquietantemente realista" . Vice.com . 2022. Archivado del original el 23 de diciembre de 2022. Consultado el 23 de diciembre de 2022 .
- ↑ GPT-3 (24 de febrero de 2023). "38 ejemplos de indicaciones en 10 categorías diferentes | GPT-3" . GiPiTi Chat . Archivado del original el 8 de abril de 2023. Recuperado el 24 de febrero de 2023 .
{{cite news}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ "¿Puede el chatbot de IA ChatGPT detectar las primeras etapas del Alzheimer? - estudio" . The Jerusalem Post . 2022. Archivado del original el 10 de febrero de 2023. Consultado el 10 de febrero de 2023 .
- ↑ Agbavor, Felix; Liang, Hualou (22 de diciembre de 2022). " Predicción de la demencia a partir del habla espontánea utilizando grandes modelos de lenguaje" . PLOS Digital Health . 1 (12) e0000168. doi : 10.1371/journal.pdig.0000168 . PMC 9931366. PMID 36812634. S2CID 255029590 .
- ↑ Manjoo, Farhad (29 de julio de 2020). "¿Cómo sabes que esto lo escribió un humano?" . The New York Times . ISSN 0362-4331 . Archivado del original el 29 de octubre de 2020. Consultado el 4 de agosto de 2020 .
- ↑ Weinberg, Justin, ed. (30 de julio de 2020). "Filósofos sobre GPT-3 (actualizado con respuestas de GPT-3)" . Daily Nous . Archivado del original el 30 de octubre de 2020. Consultado el 31 de julio de 2020 .
- ↑ Chalmers, David (30 de julio de 2020). Weinberg, Justin (ed.). "GPT-3 y la inteligencia general" . Daily Nous . Filósofos sobre GPT-3 (actualizado con respuestas de GPT-3). Archivado del original el 4 de agosto de 2020. Recuperado el 4 de agosto de 2020 .
- ↑ Simonite, Tom (22 de julio de 2020). "¿Escribió este titular una persona o una máquina?" . Wired . ISSN 1059-1028 . Archivado del original el 1 de noviembre de 2020. Consultado el 31 de julio de 2020 .
- ↑ Claypoole, Theodore (30 de julio de 2020). «La nueva herramienta de IA GPT-3 alcanza nuevas cotas, pero demuestra lo mucho que aún nos queda por avanzar» . The National Law Review . Archivado del original el 30 de octubre de 2020. Consultado el 4 de agosto de 2020 .
- ↑ Marcus, Gary (1 de diciembre de 2018). "El problema más profundo del aprendizaje profundo" . Medium . Archivado del original el 1 de agosto de 2019. Recuperado el 29 de septiembre de 2020 .
- ↑ Marcus, Gary; Davis, Ernest (22 de agosto de 2020). "GPT-3, Bloviator: el generador de lenguaje de OpenAI no tiene ni idea de lo que está hablando" . MIT Technology Review . Archivado del original el 23 de agosto de 2020. Recuperado el 23 de agosto de 2020 .
- ↑ Metz, Cade (24 de noviembre de 2020). "Conoce a GPT-3. Ha aprendido a programar (y a bloguear y a debatir)" . The New York Times . ISSN 0362-4331 . Archivado del original el 6 de diciembre de 2020. Consultado el 24 de noviembre de 2020 .
- ↑ "Un chatbot médico que utiliza GPT-3 de OpenAI le dijo a un paciente ficticio que se suicidara" . Noticias de IA . 28 de octubre de 2020. Archivado del original el 10 de enero de 2021. Consultado el 8 de enero de 2021 .
- ↑ Chomsky sobre Terence McKenna, Sam Harris, GPT3, criptomonedas, Kierkegaard, Neuralink y Hofstadter . 24 de marzo de 2021. El evento ocurrió a las 1:11:44. Archivado del original el 29 de abril de 2021. Recuperado el 29 de abril de 2021 .
- ↑ Floridi, Luciano; Chiriatti, Massimo (1 de noviembre de 2020). "GPT-3: su naturaleza, alcance, límites y consecuencias" . Minds and Machines . 30 (4): 681– 694. doi : 10.1007/s11023-020-09548-1 . S2CID 228954221 .
- ↑ Vincent, James (30 de julio de 2020). "El último avance de OpenAI es asombrosamente potente, pero aún lucha contra sus fallos" . The Verge . Archivado del original el 30 de julio de 2020. Consultado el 9 de noviembre de 2022 .
- ↑ Olanoff, Drew (11 de diciembre de 2015). "La organización sin fines de lucro de inteligencia artificial OpenAI se lanza con el respaldo de Elon Musk y Sam Altman" . Tech Crunch. Archivado del original el 20 de octubre de 2022. Recuperado el 31 de mayo de 2021 .
- ↑ Hao, Karen (29 de agosto de 2019). "OpenAI ha lanzado la versión más grande hasta la fecha de su IA generadora de noticias falsas" . MIT Technology Review. Archivado del original el 9 de mayo de 2021. Recuperado el 31 de mayo de 2021 .
- ↑ Coldewey, Devin (11 de marzo de 2019). "OpenAI pasa de ser una organización sin fines de lucro a una empresa con 'limitación de ganancias' para atraer capital" . Tech Crunch. Archivado del original el 4 de enero de 2023. Recuperado el 31 de mayo de 2021 .
- ↑ Bender, Emily M.; Gebru, Timnit; McMillan-Major, Angelina; Shmitchell, Shmargaret (3 de marzo de 2021). Sobre los peligros de los loros estocásticos: ¿Pueden los modelos de lenguaje ser demasiado grandes? . FAccT '21: Actas de la Conferencia ACM de 2021 sobre equidad, rendición de cuentas y transparencia. págs. 610–623 . doi : 10.1145/3442188.3445922 .
- ↑ Mindzak, Michael; Eaton, Sarah Elaine. «La inteligencia artificial está mejorando en la escritura, y las universidades deberían preocuparse por el plagio» . The Conversation . Archivado del original el 7 de noviembre de 2021. Consultado el 6 de noviembre de 2021 .
- ↑ Rogerson, Ann M.; McCarthy, Grace (diciembre de 2017). "Uso de herramientas de parafraseo basadas en Internet: ¿trabajo original, reescritura o plagio facilitado?" . Revista Internacional para la Integridad Educativa . 13 (1) 2: 1– 15. doi : 10.1007/s40979-016-0013-y . ISSN 1833-2595 . S2CID 9473217 .
- ↑ Aquí hay algunas maneras en que GPT-3 puede fallar . TechCrunch . Archivado del original el 26 de noviembre de 2021. Recuperado el 26 de noviembre de 2021 .
- ↑ Comentario sobre la solicitud de comentarios sobre la protección de la propiedad intelectual para la innovación en inteligencia artificial (PDF) . USPTO. Archivado (PDF) del original el 16 de octubre de 2021. Consultado el 30 de noviembre de 2021 .
- Modelos de lenguaje a gran escala
- transformadores generativos preentrenados
- OpenAI
- Software 2020
- 2020 en inteligencia artificial