Articulo de referencia

Chinchilla (modelo de lenguaje)

Chinchilla es una familia de grandes modelos de lenguaje (LLM) desarrollada por el equipo de investigación de Google DeepMind , presentada en marzo de 2022. [ 1 ] Modelos Se den...

Chinchilla es una familia de grandes modelos de lenguaje (LLM) desarrollada por el equipo de investigación de Google DeepMind , presentada en marzo de 2022. [ 1 ]

Modelos

Se denomina " chinchilla " porque es un desarrollo posterior de una familia de modelos anterior llamada Gopher. Ambas familias de modelos fueron entrenadas para investigar las leyes de escala de los modelos de lenguaje grandes . [ 2 ]

Afirmaba superar a GPT-3 . Simplifica considerablemente la utilización posterior porque requiere mucha menos potencia de cálculo para la inferencia y el ajuste fino. Basándose en el entrenamiento de modelos de lenguaje empleados previamente, se ha determinado que si se duplica el tamaño del modelo, también se debe tener el doble de tokens de entrenamiento. Esta hipótesis ha sido utilizada para entrenar a Chinchilla por DeepMind. Similar a Gopher en términos de coste, Chinchilla tiene 70 mil millones de parámetros y cuatro veces más datos (1,4 billones de tokens frente a 300 mil millones). [ 3 ]

Chinchilla tiene una precisión promedio del 67,5 % en la prueba de referencia MMLU ( Measuring Massive Multitask Language Understanding ), que es un 7 % superior al rendimiento de Gopher. Chinchilla aún se encontraba en fase de pruebas al 12 de enero de 2023. [ 4 ]

Chinchilla contribuye al desarrollo de un paradigma de entrenamiento eficaz para grandes modelos de lenguaje autorregresivos con recursos computacionales limitados. El equipo de Chinchilla recomienda duplicar el número de tokens de entrenamiento por cada duplicación del tamaño del modelo, lo que significa que el uso de conjuntos de datos de entrenamiento más grandes y de mayor calidad puede conducir a mejores resultados en tareas posteriores. [ 5 ] [ 6 ]

Se ha utilizado para el modelo de lenguaje-visión Flamingo . [ 7 ]

Arquitectura

Tanto la familia Gopher como la familia Chinchilla son familias de modelos transformables .

En concreto, son esencialmente iguales a GPT-2 , con diferentes tamaños y pequeñas modificaciones. La familia Gopher utiliza RMSNorm en lugar de LayerNorm ; codificación posicional relativa en vez de codificación posicional absoluta. La familia Chinchilla es igual que la familia Gopher, pero entrenada con AdamW en lugar del optimizador Adam .

La familia Gopher incluye seis modelos de tamaño creciente, desde 44 millones de parámetros hasta 280 mil millones. Por defecto, se refieren al modelo más grande como "Gopher". Se aplican convenciones de nomenclatura similares para la familia Chinchilla.

La tabla 1 de [ 2 ] muestra toda la familia Gopher:

La tabla 4 de [ 1 ] compara el Chinchilla de 70 mil millones de parámetros con Gopher 280B.

Véase también

Referencias

  1. ^ Hoffmann , Jordania; Borgeaud, Sebastián; Mensch, Arturo; Buchatskaya, Elena; Cai, Trevor; Rutherford, Eliza; Casas, Diego de Las; Hendricks, Lisa Anne; Welbl, Johannes; Clark, Aidan; Hennigan, Tom; Noland, Eric; Millican, Katie; Driessche, George van den; Damoc, Bogdan (29 de marzo de 2022). "Entrenamiento de modelos de lenguajes grandes óptimos para la computación". arXiv : 2203.15556 [ cs.CL ].
  2. 1 2 Rae, Jack W.; Borgeaud, Sebastian; Cai, Trevor; Millican, Katie; Hoffmann, Jordan; Song, Francis; Aslanides, John; Henderson, Sarah; Ring, Roman; Young, Susannah; Rutherford, Eliza; Hennigan, Tom; Menick, Jacob; Cassirer, Albin; Powell, Richard (2022-01-21). "Escalado de modelos de lenguaje: métodos, análisis y perspectivas del entrenamiento de Gopher". arXiv : 2112.11446 [ cs.CL ].
  3. Eliaçık, Eray (12 de enero de 2023). "La IA chinchilla viene a por el trono de GPT-3" . Dataconomy . Archivado del original el 26 de marzo de 2023.
  4. Hendrycks, Dan (14 de marzo de 2023), Medición de la comprensión masiva del lenguaje en tareas múltiples , archivado del original el 15 de marzo de 2023 , consultado el 15 de marzo de 2023.
  5. Chaithali, G. (9 de abril de 2022). "Descubre el nuevo modelo de lenguaje de DeepMind, Chinchilla (70 mil millones de parámetros), que supera significativamente a Gopher (280 mil millones) y GPT-3 (175 mil millones) en una amplia gama de tareas de evaluación posteriores" . Archivado del original el 27 de marzo de 2023. Consultado el 15 de enero de 2023 .
  6. Wali, Kartik (12 de abril de 2022). "DeepMind lanza Chinchilla, rival de GPT-3" . Analytics India Magazine . Archivado del original el 26 de marzo de 2023. Consultado el 15 de enero de 2023 .
  7. Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katherine; Reynolds, Malcolm; Ring, Roman; Rutherford, Eliza; Cabi, Serkan; Han, Tengda; Gong, Zhitao (2022-12-06). "Flamingo: un modelo de lenguaje visual para el aprendizaje con pocos ejemplos" . Advances in Neural Information Processing Systems . 35 : 23716–23736 . arXiv : 2204.14198 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Chinchilla_(language_model)&oldid=1360908667 "