Un modelo de lenguaje extenso (LLM, por sus siglas en inglés) es un tipo de modelo de aprendizaje automático diseñado para tareas de procesamiento del lenguaje natural , como la generación de lenguaje . Los LLM son modelos de lenguaje con muchos parámetros y se entrenan mediante aprendizaje autosupervisado con una gran cantidad de texto.
Lista
Para la columna de costo de entrenamiento, 1 petaFLOP-día equivale a 1 petaFLOP/seg × 1 día, o8,64 × 10¹⁹ FLOP ( operaciones de punto flotante ) . Solo se muestra el costo del modelo más grande. El número de parámetros se mide en miles de millones, [ a ] y el costo de entrenamiento se mide en petaFLOP-días.
2018
2019
2020
2021
2022
2023
2024
2025
2026
Véase también
Notas
- ↑ En muchos casos, los investigadores publican o informan sobre varias versiones de un modelo con diferentes tamaños. En estos casos, aquí se indica el tamaño del modelo más grande.
- 1 2 3 4 5 6 7 8 9 Esta es la fecha en que se publicó por primera vez la documentación que describe la arquitectura del modelo.
- 1 2 3 4 5 6 7 8 9 Esta es la licencia de los pesos del modelo preentrenado. En casi todos los casos, el código de entrenamiento es de código abierto o se puede replicar fácilmente. Los LLM pueden tener licencias diferentes a las de los chatbots que los utilizan; para conocer las licencias de los chatbots, consulte la Lista de chatbots .
- ↑ Los modelos más pequeños, incluido el 66B, están disponibles públicamente, mientras que el modelo 175B está disponible bajo pedido.
- ↑ El sistema de licencias y distribución de Facebook restringía el acceso a los investigadores autorizados, pero los pesos del modelo se filtraron y estuvieron ampliamente disponibles.
- ↑ Como se indica en el informe técnico: "Dadas las condiciones competitivas y las implicaciones de seguridad de los modelos a gran escala como GPT-4, este informe no contiene más detalles sobre la arquitectura (incluido el tamaño del modelo), el hardware, el cálculo de entrenamiento, la construcción del conjunto de datos, el método de entrenamiento..." [ 61 ]
- ↑ "centrado en el panorama lingüístico de la India"
- ↑ El tamaño del corpus se calculó combinando la mezcla de preentrenamiento de 15 billones de tokens y la de 7 billones de tokens.
- ↑ En enero se publicó un punto de control inicial del modelo. [ 184 ]
- ↑ 196B + 1.8B (ViT)
Referencias
- ↑ "Mejora de la comprensión del lenguaje con aprendizaje no supervisado" . openai.com . 11 de junio de 2018. Archivado del original el 18 de marzo de 2023. Consultado el 18 de marzo de 2023 .
- ↑ "finetune-transformer-lm" . GitHub . Archivado del original el 19 de mayo de 2023. Consultado el 2 de enero de 2024 .
- ↑ Radford, Alec (11 de junio de 2018). "Mejora de la comprensión del lenguaje con aprendizaje no supervisado" . OpenAI . Recuperado el 18 de noviembre de 2025 .
- 1 2 3 Devlin, Jacob; Chang, Ming-Wei; Lee, Kenton; Toutanova, Kristina (11 de octubre de 2018). "BERT: Pre-entrenamiento de transformadores bidireccionales profundos para la comprensión del lenguaje". arXiv : 1810.04805v2 [ cs.CL ].
- ↑ Prickett, Nicole Hemsoth (24 de agosto de 2021). "Cerebras cambia su arquitectura para adaptarse a modelos masivos de IA/ML" . The Next Platform . Archivado del original el 20 de junio de 2023. Consultado el 20 de junio de 2023 .
- ↑ "BERT" . 13 de marzo de 2023. Archivado del original el 13 de enero de 2021. Recuperado el 13 de marzo de 2023 a través de GitHub.
- ↑ Manning, Christopher D. (2022). " Comprensión y razonamiento del lenguaje humano" . Daedalus . 151 (2): 127– 138. doi : 10.1162/daed_a_01905 . S2CID 248377870. Archivado del original el 17 de noviembre de 2023. Recuperado el 9 de marzo de 2023 .
- ↑ Patel, Ajay; Li, Bryan; Rasooli, Mohammad Sadegh; Constant, Noah; Raffel, Colin; Callison-Burch, Chris (2022). "Los modelos de lenguaje bidireccionales también son aprendices con pocos ejemplos". arXiv : 2209.14500 [ cs.LG ].
- 1 2 Raffel, Colin; Shazeer, Noam; Roberts, Adam; Lee, Katherine; Narang, Sharan; Matena, Michael; Zhou, Yanqi; Li, Wei; Liu, Peter J. (2020). "Explorando los límites del aprendizaje por transferencia con un transformador unificado de texto a texto" . Journal of Machine Learning Research . 21 (140): 1– 67. arXiv : 1910.10683 . ISSN 1533-7928 .
- ↑ google-research/text-to-text-transfer-transformer , Google Research, 2 de abril de 2024, archivado del original el 29 de marzo de 2024 , consultado el 4 de abril de 2024
- ↑ "Imagen: Modelos de difusión de texto a imagen" . imagen.research.google . Archivado del original el 27 de marzo de 2024. Consultado el 4 de abril de 2024 .
- ↑ "Modelos preentrenados — documentación de transformers 2.0.0" . huggingface.co . Archivado del original el 5 de agosto de 2024. Consultado el 5 de agosto de 2024 .
- ↑ "xlnet" . GitHub . Archivado del original el 2 de enero de 2024. Consultado el 2 de enero de 2024 .
- ^ Yang, Zhilin; Dai, Zihang; Yang, Yiming; Carbonell, Jaime; Salakhutdinov, Ruslan; Le, Quoc V. (2 de enero de 2020). "XLNet: preentrenamiento autorregresivo generalizado para la comprensión del lenguaje". arXiv : 1906.08237 [ cs.CL ].
- ↑ "GPT-2: Versión 1.5B" . OpenAI . 5 de noviembre de 2019. Archivado del original el 14 de noviembre de 2019. Consultado el 14 de noviembre de 2019 .
- ↑ "Mejores modelos de lenguaje y sus implicaciones" . openai.com . Archivado del original el 16 de marzo de 2023. Consultado el 13 de marzo de 2023 .
- 1 2 "Modelo de lenguaje GPT-3 de OpenAI: una descripción técnica" . lambdalabs.com . 3 de junio de 2020. Archivado del original el 27 de marzo de 2023. Recuperado el 13 de marzo de 2023 .
- 1 2 "openai-community/gpt2-xl · Hugging Face" . huggingface.co . Archivado del original el 24/07/2024 . Consultado el 24/07/2024 .
- ↑ "gpt-2" . GitHub . Archivado del original el 11 de marzo de 2023. Consultado el 13 de marzo de 2023 .
- ↑ Wiggers, Kyle (28 de abril de 2022). "Los tipos emergentes de modelos de lenguaje y por qué importan" . TechCrunch . Archivado del original el 16 de marzo de 2023. Recuperado el 9 de marzo de 2023 .
- ↑ Tabla D.1 en Brown, Tom B.; Mann, Benjamin; Ryder, Nick; Subbiah, Melanie; Kaplan, Jared; Dhariwal, Prafulla; Neelakantan, Arvind; Shyam, Pranav; Sastry, Girish; Askell, Amanda; Agarwal, Sandhini; Herbert-Voss, Ariel; Krueger, Gretchen; Henighan, Tom; Child, Rewon; Ramesh, Aditya; Ziegler, Daniel M.; Wu, Jeffrey; Winter, Clemens; Hesse, Christopher; Chen, Mark; Sigler, Eric; Litwin, Mateusz; Gray, Scott; Chess, Benjamin; Clark, Jack; Berner, Christopher; McCandlish, Sam; Radford, Alec; Sutskever, Ilya; Amodei, Dario (28 de mayo de 2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". arXiv : 2005.14165v4 [ cs.CL ].
- ↑ "ChatGPT: Optimización de modelos de lenguaje para el diálogo" . OpenAI . 30 de noviembre de 2022. Archivado del original el 30 de noviembre de 2022. Consultado el 13 de enero de 2023 .
- ↑ "GPT Neo" . 15 de marzo de 2023. Archivado del original el 12 de marzo de 2023. Recuperado el 12 de marzo de 2023 a través de GitHub.
- 1 2 3 Gao, Leo; Biderman, Stella; Black, Sid; Golding, Laurence; Hoppe, Travis; Foster, Charles; Phang, Jason; He, Horace; Thite, Anish; Nabeshima, Noa; Presser, Shawn; Leahy, Connor (31 de diciembre de 2020). "The Pile: An 800GB Dataset of Diverse Text for Language Modeling". arXiv : 2101.00027 [ cs.CL ].
- 1 2 Iyer, Abhishek (15 de mayo de 2021). "La alternativa gratuita de GPT-3, GPT-Neo, es algo que genera entusiasmo" . VentureBeat . Archivado del original el 9 de marzo de 2023. Recuperado el 13 de marzo de 2023 .
- ↑ Kim, Han-joo (25 de mayo de 2021). "Naver presenta la plataforma de IA de gran tamaño HyperCLOVA" . Agencia de noticias Yonhap . Consultado el 15 de junio de 2026 .
- 1 2 Wiggers, Kyle (1 de junio de 2021). "Naver entrenó un modelo de lenguaje coreano 'similar a GPT-3'" . VentureBeat | Cobertura tecnológica transformadora que importa . Archivado del original el 20 de septiembre de 2022. Recuperado el 15 de junio de 2026 .
- ^ Kim , Boseop; Kim, HyoungSeok; Lee, Sang Woo; Lee, Gichang; Kwak, Donghyun; Dong Hyeon, Jeon; Parque, Sunghyun; Kim, Sungju; Kim, Seonhoon; Seo, Dongpil; Lee, Heungsub; Jeong, Minyoung; Lee, Sungjae; Kim, Minsub; Ko, Suk Hyun; Kim, Seokhun; Parque, Taeyong; Kim, Jinuk; Kang, Soyoung; Ryu, Na-Hyeon; Yoo, Kang Min; Chang, Minsuk; Suh, Soobin; En, Sookyo; Parque, Jinseong; Kim, Kyungduk; Kim, Hiun; Jeong, Jisu; Yeo, Yong Goo; Jamón, Donghoon; Parque, Dongju; Lee, Min Young; Kang, Jaewook; Kang, Inho; Ja, Jung Woo; Parque, Woomyoung; Sung, Nako (noviembre de 2021). "¿Qué cambios pueden aportar los modelos de lenguaje a gran escala? Estudio intensivo sobre HyperCLOVA: transformadores generativos preentrenados coreanos a escala de miles de millones" . En Moens, Marie-Francine; Huang, Xuanjing; Specia, Lucia; Yih, Scott Wen-tau (eds.). Actas de la Conferencia de 2021 sobre Métodos Empíricos en Procesamiento del Lenguaje Natural . En línea y Punta Cana, República Dominicana: Asociación de Lingüística Computacional. pp. 3405–3424 . arXiv : 2109.04650 . doi : 10.18653/v1/2021.emnlp-main.274 .
- ↑ "GPT-J-6B: Introducción al modelo GPT de código abierto más grande | Forefront" . www.forefront.ai . Archivado del original el 9 de marzo de 2023. Consultado el 28 de febrero de 2023 .
- ^ Dey , Nolan ; Gosal, Gurpreet; Zhiming; Chen; Khachane, Hemant; Marshall, Guillermo; Patria, Ribhu; Tom, Marvin; Hestness, Joel (1 de abril de 2023). "Cerebras-GPT: modelos de lenguaje de computación abierta óptimos entrenados en el clúster de escala de oblea Cerebras". arXiv : 2304.03208 [ cs.LG ].
- ↑ Alvi, Ali; Kharya, Paresh (11 de octubre de 2021). "Uso de DeepSpeed y Megatron para entrenar el modelo de lenguaje generativo Megatron-Turing NLG 530B, el modelo de lenguaje generativo más grande y potente del mundo" . Microsoft Research . Archivado del original el 13 de marzo de 2023. Recuperado el 13 de marzo de 2023 .
- ^ Smith , Shaden; Patwary, Mostofa; Norick, Brandon; LeGresley, Patricio; Rajbhandari, Samyam; Casper, Jared; Liu, Zhun; Prabhumoye, Srimai; Zerveas, George; Korthikanti, Vijay; Zhang, Elton; Niño, Rewon; Aminabadi, Reza Yazdani; Bernauer, Julie; Canción, Xia (4 de febrero de 2022). "Uso de DeepSpeed y Megatron para entrenar Megatron-Turing NLG 530B, un modelo de lenguaje generativo a gran escala". arXiv : 2201.11990 [ cs.CL ].
- ^ Rajbhandari , Samyam; Li, Conglong; Yao, Zhewei; Zhang, Minjia; Aminabadi, Reza Yazdani; Awan, Ammar Ahmad; Rasley, Jeff; Él, Yuxiong (21 de julio de 2022), DeepSpeed-MoE: avance de la inferencia y el entrenamiento de una combinación de expertos para impulsar la escala de IA de próxima generación , arXiv : 2201.05596
- ^ Wang, Shuohuan; Sol, Yu; Xiang, Yang; Wu, Zhihua; Ding, Siyu; Gong, Weibao; Feng, Shikun; Shang, Junyuan; Zhao, Yanbin; Pang, Chao; Liu, Jiaxiang; Chen, Xuyi; Lu, Yuxiang; Liu, Weixin; Wang, Xi; Bai, Yangfan; Chen, Qiuliang; Zhao, Li; Li, Shiyong; Sol, Peng; Yu, Dianhai; Mamá, Yanjun; Tian, Hao; Wu, Hua; Wu, Tian; Zeng, Wei; Li, Ge; Gao, Wen; Wang, Haifeng (23 de diciembre de 2021). "ERNIE 3.0 Titan: exploración de la formación previa mejorada del conocimiento a mayor escala para la comprensión y generación del lenguaje". arXiv : 2112.12731 [ cs.CL ].
- ↑ "Producto" . Antrópico . Archivado del original el 16 de marzo de 2023. Recuperado el 14 de marzo de 2023 .
- ^ Askell , Amanda; Bai, Yuntao; Chen, Anna; et al. (9 de diciembre de 2021). "Un Auxiliar de Lenguaje General como Laboratorio de Alineamiento". arXiv : 2112.00861 [ cs.CL ].
- ^ Bai, Yuntao; Kadavath, Saurav; Kundu, Sandipan; et al. (15 de diciembre de 2022). "IA constitucional: inocuidad de los comentarios de la IA". arXiv : 2212.08073 [ cs.CL ].
- 1 2 3 Dai, Andrew M; Du, Nan (9 de diciembre de 2021). "Aprendizaje contextual más eficiente con GLaM" . ai.googleblog.com . Archivado del original el 12 de marzo de 2023. Recuperado el 9 de marzo de 2023 .
- ↑ "Modelado del lenguaje a gran escala: Gopher, consideraciones éticas y recuperación" . www.deepmind.com . 8 de diciembre de 2021. Archivado del original el 20 de marzo de 2023. Consultado el 20 de marzo de 2023 .
- 1 2 3 Hoffmann, Jordan; Borgeaud, Sebastian; Mensch, Arthur; et al. (29 de marzo de 2022). "Entrenamiento de modelos de lenguaje grandes computacionalmente óptimos". arXiv : 2203.15556 [ cs.CL ].
- 1 2 3 4 Tabla 20 y página 66 de PaLM: Scaling Language Modeling with Pathways Archivado el 10/06/2023 en Wayback Machine
- 1 2 Cheng, Heng-Tze; Thoppilan, Romal (21 de enero de 2022). "LaMDA: Hacia modelos de diálogo seguros, fundamentados y de alta calidad para todo" . ai.googleblog.com . Archivado del original el 25 de marzo de 2022. Recuperado el 9 de marzo de 2023 .
- ^ Thoppilan, Romal; De Freitas, Daniel; Salón, Jamie; Shazeer, Noam; Kulshreshtha, Apoorv; Cheng, Heng-Tze; Jin, Alicia; Bos, Taylor; Panadero, Leslie; Du, Yu; Li, YaGuang; Lee, Hongrae; Zheng, Huaixiu Steven; Ghafouri, Amin; Menegali, Marcelo (01/01/2022). "LaMDA: modelos de lenguaje para aplicaciones de diálogo". arXiv : 2201.08239 [ cs.CL ].
- ↑ Black, Sidney; Biderman, Stella; Hallahan, Eric; et al. (2022-05-01). GPT-NeoX-20B: Un modelo de lenguaje autorregresivo de código abierto . Actas del episodio n.° 5 de BigScience: Taller sobre desafíos y perspectivas en la creación de grandes modelos de lenguaje. Vol. Actas del episodio n.° 5 de BigScience: Taller sobre desafíos y perspectivas en la creación de grandes modelos de lenguaje. págs. 95–136 . Archivado del original el 10 de diciembre de 2022. Recuperado el 19 de diciembre de 2022 .
- 1 2 3 Hoffmann, Jordan; Borgeaud, Sebastian; Mensch, Arthur; Sifre, Laurent (12 de abril de 2022). "Análisis empírico del entrenamiento de modelos de lenguaje grandes con optimización computacional" . Blog de Deepmind . Archivado del original el 13 de abril de 2022. Recuperado el 9 de marzo de 2023 .
- ↑ Narang, Sharan; Chowdhery, Aakanksha (4 de abril de 2022). "Pathways Language Model (PaLM): Escalando a 540 mil millones de parámetros para un rendimiento revolucionario" . ai.googleblog.com . Archivado del original el 4 de abril de 2022. Consultado el 9 de marzo de 2023 .
- ↑ Susan Zhang; Mona Diab; Luke Zettlemoyer. "Democratizando el acceso a modelos de lenguaje a gran escala con OPT-175B" . ai.facebook.com . Archivado del original el 12 de marzo de 2023. Consultado el 12 de marzo de 2023 .
- ↑ Zhang, Susan; Roller, Stephen; Goyal, Naman; Artetxe, Mikel; Chen, Moya; Chen, Shuohui; Dewan, Christopher; Diab, Mona; Li, Xian; Lin, Xi Victoria; Mihaylov, Todor; Ott, Myle; Shleifer, Sam; Shuster, Kurt; Simig, Daniel; Koura, Punit Singh; Sridhar, Anjali; Wang, Tianlu; Zettlemoyer, Luke (21 de junio de 2022). "OPT: Open Pre-trained Transformer Language Models". arXiv : 2205.01068 [ cs.CL ].
- ↑ "metaseq/projects/OPT/chronicles at main · facebookresearch/metaseq" . GitHub . Consultado el 18-10-2024 .
- 1 2 Jruschov, Mikhail; Vasilev, Ruslán; Petrov, Alexéi; Zinov, Nikolay (22 de junio de 2022), YaLM 100B , archivado desde el original el 16 de junio de 2023 , consultado el 18 de marzo de 2023
- 1 2 Lewkowycz, Aitor; Andreassen, Anders; Dohan, David; Dyer, Ethan; Michalewski, Henryk; Ramasesh, Vinay; Slone, Ambrose; Anil, Cem; Schlag, Imanol; Gutman-Solo, Theo; Wu, Yuhuai; Neyshabur, Behnam; Gur-Ari, Guy; Misra, Vedant (30 de junio de 2022). "Resolución de problemas de razonamiento cuantitativo con modelos de lenguaje". arXiv : 2206.14858 [ cs.CL ].
- ↑ "Minerva: Resolución de problemas de razonamiento cuantitativo con modelos de lenguaje" . ai.googleblog.com . 30 de junio de 2022. Consultado el 20 de marzo de 2023 .
- ↑ Ananthaswamy, Anil (8 de marzo de 2023). "¿En IA, lo más grande siempre es mejor?" . Nature . 615 (7951): 202– 205. Bibcode : 2023Natur.615..202A . doi : 10.1038/d41586-023-00641-w . PMID 36890378 . S2CID 257380916 . Archivado del original el 16 de marzo de 2023 . Recuperado el 9 de marzo de 2023 .
- ↑ "bigscience/bloom · Hugging Face" . huggingface.co . Archivado del original el 12 de abril de 2023. Consultado el 13 de marzo de 2023 .
- ^ Taylor, Ross; Kardas, Marcin; Cucurull, Guillem; Scialom, Thomas; Hartshorn, Antonio; Saravia, Elvis; Poulton, Andrés; Kerkez, Viktor; Stojnic, Robert (16 de noviembre de 2022). "Galáctica: un gran modelo de lenguaje para la ciencia". arXiv : 2211.09085 [ cs.CL ].
- ↑ "El modelo Alexa de 20 mil millones de parámetros establece nuevos récords en el aprendizaje con pocos ejemplos" . Amazon Science . 2 de agosto de 2022. Archivado del original el 15 de marzo de 2023. Consultado el 12 de marzo de 2023 .
- ↑ Soltan, Saleh; Ananthakrishnan, Shankar; FitzGerald, Jack; et al. (3 de agosto de 2022). "AlexaTM 20B: Aprendizaje con pocos ejemplos utilizando un modelo Seq2Seq multilingüe a gran escala". arXiv : 2208.01448 [ cs.CL ].
- ↑ "Alexa™ 20B ya está disponible en Amazon SageMaker JumpStart | Blog de AWS Machine Learning" . aws.amazon.com . 17 de noviembre de 2022. Archivado del original el 13 de marzo de 2023. Consultado el 13 de marzo de 2023 .
- 1 2 "Presentamos LLaMA: un modelo de lenguaje fundamental de 65 mil millones de parámetros" . Meta AI . 24 de febrero de 2023. Archivado del original el 3 de marzo de 2023. Recuperado el 9 de marzo de 2023 .
- 1 2 3 "El Halcón ha aterrizado en el ecosistema de Hugging Face" . huggingface.co . Archivado del original el 20 de junio de 2023. Consultado el 20 de junio de 2023 .
- ↑ "Informe técnico de GPT-4" (PDF) . OpenAI . 2023. Archivado (PDF) del original el 14 de marzo de 2023. Recuperado el 14 de marzo de 2023 .
- ↑ Dey, Nolan (28 de marzo de 2023). "Cerebras-GPT: una familia de modelos de lenguaje grandes, abiertos y computacionalmente eficientes" . Cerebras . Archivado del original el 28 de marzo de 2023. Recuperado el 28 de marzo de 2023 .
- ↑ "TII, con sede en Abu Dabi , lanza su propia versión de ChatGPT" . tii.ae. Archivado del original el 3 de abril de 2023. Consultado el 3 de abril de 2023 .
- ↑ Penedo, Guilherme; Malartic, Quentin; Hesslow, Daniel; Cojocaru, Ruxandra; Cappelli, Alessandro; Alobeidli, Hamza; Pannier, Bautista; Almazrouei, Ebtesam; Launay, Julien (1 de junio de 2023). "El conjunto de datos RefinedWeb para Falcon LLM: superando a los corporaciones seleccionados con datos web y solo con datos web". arXiv : 2306.01116 [ cs.CL ].
- ↑ "tiiuae/falcon-40b · Hugging Face" . huggingface.co . 9 de junio de 2023. Consultado el 20 de junio de 2023 .
- ↑ El Falcon 40B de los EAU, el modelo de IA mejor clasificado del mundo del Instituto de Innovación Tecnológica, ahora es de uso libre. Archivado el 8 de febrero de 2024 en Wayback Machine , 31 de mayo de 2023.
- ^ Wu , Shijie; Irsoy, Ozan; Lu, Steven; Dabravolski, Vadim; Dredze, Mark; Gehrmann, Sebastián; Kambadur, Prabhanjan; Rosenberg, David; Mann, Gideon (30 de marzo de 2023). "BloombergGPT: un modelo de lenguaje amplio para las finanzas". arXiv : 2303.17564 [ cs.LG ].
- ^ Ren, Xiaozhe; Zhou, Pingyi; Meng, Xinfan; Huang, Xinjing; Wang, Yadao; Wang, Weichao; Li, Pengfei; Zhang, Xiaoda; Podolskiy, Alejandro; Arshinov, Grigory; Combate, Andrey; Piontkóvskaya, Irina; Wei, Jiansheng; Jiang, Xin; Su, Teng; Liu, Qun; Yao, junio (19 de marzo de 2023). "PanGu-Σ: hacia un modelo de lenguaje de billones de parámetros con computación heterogénea dispersa". arXiv : 2303.10845 [ cs.CL ].
- ↑ Köpf, Andreas; Kilcher, Yannic; von Rütte, Dimitri; Anagnostidis, Sotiris; Tam, Zhi-Rui; Stevens, Keith; Barhoum, Abdullah; Duc, Nguyen Minh; Stanley, Oliver; Nagyfi, Richard; ES, Shahul; Suri, Sameer; Glushkov, David; Dantuluri, Arnav; Maguire, Andrés (14 de abril de 2023). "Conversaciones OpenAssistant: democratización de la alineación del modelo de lenguaje grande". arXiv : 2304.07327 [ cs.CL ].
- ↑ Wrobel, Sharon. «Una startup de Tel Aviv lanza un nuevo modelo de lenguaje de IA avanzado para competir con OpenAI» . The Times of Israel . ISSN 0040-7909 . Archivado del original el 24 de julio de 2023. Consultado el 24 de julio de 2023 .
- ↑ Wiggers, Kyle (13 de abril de 2023). "Con Bedrock, Amazon entra en la carrera de la IA generativa" . TechCrunch . Archivado del original el 24 de julio de 2023. Consultado el 24 de julio de 2023 .
- 1 2 Elias, Jennifer (16 de mayo de 2023). "El modelo de IA más reciente de Google utiliza casi cinco veces más datos de texto para el entrenamiento que su predecesor" . CNBC . Archivado del original el 16 de mayo de 2023. Recuperado el 18 de mayo de 2023 .
- ↑ "Presentación de PaLM 2" . Google . 10 de mayo de 2023. Archivado del original el 18 de mayo de 2023. Consultado el 18 de mayo de 2023 .
- 1 2 3 Gunasekar, Suriya; Zhang, Yi; Aneja, Jyoti; Caio César Teodoro Mendes; Allie Del Giorno; Gopi, Sivakanth; Javaheripi, Moján; Kauffmann, Piero; Gustavo de Rosa; Saarikivi, Olli; Salim, Adil; Shah, Shital; Harkirat Singh Behl; Wang, Xin; Bubeck, Sébastien; Eldan, Ronen; Adam Tauman Kalai; Yin Tat Lee; Li, Yuanzhi (2023). "Los libros de texto son todo lo que necesita". arXiv : 2306.11644 [ cs.CL ].
- 1 2 "Presentamos Llama 2: La próxima generación de nuestro modelo de lenguaje grande de código abierto" . Meta AI . 2023. Archivado del original el 5 de enero de 2024. Recuperado el 19 de julio de 2023 .
- ↑ "llama/MODEL_CARD.md en main · meta-llama/llama" . GitHub . Archivado del original el 28 de mayo de 2024. Consultado el 28 de mayo de 2024 .
- ↑ "Claude 2" . anthropic.com . Archivado del original el 15 de diciembre de 2023. Consultado el 12 de diciembre de 2023 .
- ↑ Nirmal, Dinesh (07/09/2023). "Construyendo IA para los negocios: modelos de la base Granite de IBM" . Blog de IBM . Archivado del original el 22/07/2024 . Recuperado el 11/08/2024 .
- ↑ "Anuncio de Mistral 7B" . Mistral . 2023. Archivado del original el 6 de enero de 2024. Consultado el 6 de octubre de 2023 .
- ↑ "Presentando a Claude 2.1" . anthropic.com . Archivado del original el 15 de diciembre de 2023. Consultado el 12 de diciembre de 2023 .
- ↑ xai-org/grok-1 , xai-org, 19-03-2024, archivado del original el 28-05-2024 , recuperado el 19-03-2024
- ↑ "Tarjeta modelo Grok-1" . x.ai. Consultado el 12 de diciembre de 2023 .
- ↑ "Gemini – Google DeepMind" . deepmind.google . Archivado del original el 8 de diciembre de 2023. Consultado el 12 de diciembre de 2023 .
- ↑ Franzen, Carl (11 de diciembre de 2023). "Mistral sorprende a la comunidad de IA: su último modelo de código abierto supera el rendimiento de GPT-3.5" . VentureBeat . Archivado del original el 11 de diciembre de 2023. Consultado el 12 de diciembre de 2023 .
- ↑ "Mixtral de expertos" . mistral.ai . 11 de diciembre de 2023. Archivado del original el 13 de febrero de 2024. Consultado el 12 de diciembre de 2023 .
- ^ DeepSeek -AI; Bi, Xiao; Chen, Deli; Chen, Guanting; Chen, Shanhuang; Dai, Damai; Deng, Chengqi; Ding, Honghui; Dong, Kai (5 de enero de 2024), DeepSeek LLM: escalamiento de modelos de lenguaje de código abierto con longtermismo , arXiv : 2401.02954
- 1 2 Hughes, Alyssa (12 de diciembre de 2023). "Phi-2: El sorprendente poder de los modelos de lenguaje pequeños" . Microsoft Research . Archivado del original el 12 de diciembre de 2023. Recuperado el 13 de diciembre de 2023 .
- ↑ "Nuestro modelo de próxima generación: Gemini 1.5" . Google . 15 de febrero de 2024. Archivado del original el 16 de febrero de 2024. Recuperado el 16 de febrero de 2024.
Esto significa que 1.5 Pro puede procesar grandes cantidades de información de una sola vez, incluyendo 1 hora de video, 11 horas de audio, bases de código con más de 30 000 líneas de código o más de 700 000 palabras. En nuestra investigación, también hemos probado con éxito hasta 10 millones de tokens.
- ↑ "Gemma" – vía GitHub.
- ↑ "OLMo: Open Language Model | Ai2" . allenai.org . Consultado el 17 de marzo de 2026 .
- ↑ Groeneveld, Dirk; Beltagy, Iz; Walsh, Pete; Bhagia, Akshita; Kinney, Rodney; Tafjord, Oyvind; Jha, Ananya Harsh; Ivison, Hamish; Magnusson, Ian (2024-06-07), OLMo: Acelerando la ciencia de los modelos de lenguaje , arXiv, doi : 10.48550/arXiv.2402.00838 , arXiv:2402.00838 , consultado el 17 de marzo de 2026
- ↑ "Presentando a la próxima generación de Claude" . Antropórico . Archivado del original el 4 de marzo de 2024. Consultado el 4 de marzo de 2024 .
- ↑ «Licencia de modelo abierto de Databricks» . Ladrillos de datos . 27 de marzo de 2024 . Consultado el 6 de agosto de 2025 .
- ↑ "Política de uso aceptable del modelo abierto de Databricks" . Databricks . 27 de marzo de 2024. Consultado el 6 de agosto de 2025 .
- 1 2 "Lanzamiento de "Fugaku-LLM": un gran modelo de lenguaje entrenado en la supercomputadora "Fugaku"Fujitsu . 10 de mayo de 2024. Consultado el 20 de abril de 2026 .
- ↑ "Términos de uso de Fugaku-LLM" . 23 de abril de 2024. Consultado el 6 de agosto de 2025 a través de Hugging Face .
- ↑ "Fugaku-LLM/Fugaku-LLM-13B · Hugging Face" . huggingface.co . Archivado del original el 17 de mayo de 2024. Consultado el 17 de mayo de 2024 .
- ↑ Dickson, Ben (22 de mayo de 2024). "Meta presenta Chameleon, un modelo multimodal de última generación" . VentureBeat .
- ↑ "chameleon/LICENSE en e3b711ef63b0bb3a129cf0cf0918e36a32f26e2c · facebookresearch/chameleon" . Meta Research . Recuperado el 6 de agosto de 2025 – vía GitHub .
- ↑ IA, Mistral (17-04-2024). "Más barato, mejor, más rápido, más fuerte" . mistral.ai . Archivado del original el 05-05-2024 . Consultado el 05-05-2024 .
- 1 2 Bilenko, Misha (23 de abril de 2024). "Presentamos Phi-3: redefiniendo lo que es posible con SLM" . azure.microsoft.com . Archivado del original el 8 de mayo de 2026. Recuperado el 8 de mayo de 2026 .
- ↑ Abdin, Marah; et al. (2024). "Informe técnico de Phi-3: un modelo de lenguaje altamente capaz localmente en su teléfono". arXiv : 2404.14219 [ cs.CL ].
- ↑ "Qwen2" . GitHub . Archivado del original el 17 de junio de 2024. Consultado el 17 de junio de 2024 .
- ^ DeepSeek-AI; Liu, Aixin; Feng, Bei; Wang, Bin; Wang, Bingxuan; Liu, Bo; Zhao, Chenggang; Dengr, Chengqi; Ruan, Chong (19 de junio de 2024), DeepSeek-V2: un modelo de lenguaje de combinación de expertos sólido, económico y eficiente , arXiv : 2405.04434
- ↑ "Licencia de modelos abiertos de NVIDIA" . Nvidia . 16 de junio de 2025. Consultado el 6 de agosto de 2025 .
- ↑ "IA confiable" . Nvidia . 27 de junio de 2024. Consultado el 6 de agosto de 2025 .
- ↑ "nvidia/Nemotron-4-340B-Base · Hugging Face" . huggingface.co . 14 de junio de 2024. Archivado del original el 15 de junio de 2024. Consultado el 15 de junio de 2024 .
- ↑ "Nemotron-4 340B | Investigación" . research.nvidia.com . Archivado del original el 15 de junio de 2024. Consultado el 15 de junio de 2024 .
- ↑ "Presentación del soneto 3.5 de Claude" . Antropológico . Consultado el 8 de agosto de 2025 .
- ↑ "Introducción al uso de la computadora, un nuevo soneto de Claude 3.5 y un haiku de Claude 3.5" . Anthropic . Consultado el 8 de agosto de 2025 .
- ↑ "El rebaño de modelos de Llama 3" (23 de julio de 2024) Equipo Llama, IA @ Meta
- ↑ "llama-models/models/llama3_1/MODEL_CARD.md en main · meta-llama/llama-models" . GitHub . Archivado del original el 23 de julio de 2024. Consultado el 23 de julio de 2024 .
- ↑ "LICENCIA · xai-org/grok-2 en main" . 5 de noviembre de 2025. Recuperado el 18 de noviembre de 2025 – vía Hugging Face .
- ↑ "Política de uso aceptable de xAI" . xAI . 2 de enero de 2025. Consultado el 18 de noviembre de 2025 .
- ↑ Weatherbed, Jess (14 de agosto de 2024). "Los nuevos chatbots Grok-2 de xAI llevan la generación de imágenes por IA a X" . The Verge . Consultado el 18 de noviembre de 2025 .
- ↑ Ha, Anthony (24 de agosto de 2025). "Elon Musk dice que xAI ha liberado el código fuente de Grok 2.5" . TechCrunch . Consultado el 18 de noviembre de 2025 .
- ↑ "Presentación de OpenAI o1" . openai.com . Consultado el 8 de agosto de 2025 .
- ↑ Paul, Katie; Tong, Anna (13 de septiembre de 2024). "OpenAI lanza una nueva serie de modelos de IA con capacidades de 'razonamiento'" . Reuters .
- ^ Jindal, Siddharth (24 de octubre de 2024). "Sarvam AI lanza Sarvam-1, supera a Gemma-2 y Llama-3.2" . Revista Analytics India . Archivado desde el original el 25 de julio de 2025 . Consultado el 20 de abril de 2026 .
- ↑ «LICENCIA.md·sarvamai/sarvam-1» . 23 de octubre de 2024 . Consultado el 20 de abril de 2026 a través de Hugging Face .
- 1 2 "Descripción general de los modelos" . mistral.ai . Consultado el 3 de marzo de 2025 .
- ↑ "OLMo 2: El mejor modelo de lenguaje totalmente abierto hasta la fecha | Ai2" . allenai.org . Consultado el 17 de marzo de 2026 .
- 1 2 3 OLMo, Equipo; Walsh, Pete; Soldaini, Luca; Groeneveld, Dirk; Mira, Kyle; Arora, Shane; Bhagia, Akshita; Gu, Yuling; Huang, Shengyi (8 de octubre de 2025), 2 OLMo 2 Furious , arXiv, doi : 10.48550/arXiv.2501.00656 , arXiv:2501.00656 , consultado el 17 de marzo de 2026
- ↑ "Tarjeta modelo Phi-4" . huggingface.co . Consultado el 11 de noviembre de 2025 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ "Presentamos Phi-4: el nuevo modelo de lenguaje pequeño de Microsoft especializado en razonamiento complejo" . techcommunity.microsoft.com . Consultado el 11 de noviembre de 2025 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace ) - ↑ deepseek-ai/DeepSeek-V3 , DeepSeek, 26-12-2024 , consultado el 26-12-2024
- ↑ Feng, Coco (25 de marzo de 2025). "DeepSeek sorprende a los programadores con un modelo V3 de código abierto más potente" . South China Morning Post . Consultado el 6 de abril de 2025 .
- ↑ Amazon Nova Micro, Lite y Pro - Tarjetas de servicio de IA de AWS3 , Amazon, 27/12/2024 , consultado el 27/12/2024
- ↑ deepseek-ai/DeepSeek-R1 , DeepSeek, 21-01-2025 , consultado el 21-01-2025
- ^ DeepSeek-AI; Guo, Daya; Yang, Dejian; Zhang, Haowei; Canción, Junxiao; Zhang, Ruoyu; Xu, Runxin; Zhu, Qihao; Ma, Shirong (22 de enero de 2025), DeepSeek-R1: incentivar la capacidad de razonamiento en LLM mediante el aprendizaje por refuerzo , arXiv : 2501.12948
- ^ Qwen; Yang, An; Yang, Baosong; Zhang, Beichen; Hui, Binyuan; Zheng, Bo; Yu, Bowen; Li, Chengyuan; Liu, Dayiheng (3 de enero de 2025), Informe técnico de Qwen2.5 , arXiv : 2412.15115
- 1 2 MiniMax; Li, Aonian; Gong, Bangwei; Yang, Bo; Shan, Boji; Liu, Chang; Zhu, Cheng; Zhang, Chunhao; Guo, Congchao (14 de enero de 2025), MiniMax-01: escalamiento de modelos básicos con atención relámpago , arXiv : 2501.08313
- ↑ MiniMax-AI/MiniMax-01 , MiniMax, 26/01/2025 , consultado el 26/01/2025
- ↑ Kavukcuoglu, Koray (5 de febrero de 2025). "Gemini 2.0 ya está disponible para todos" . Google . Consultado el 6 de febrero de 2025 .
- ↑ "Gemini 2.0: Flash, Flash-Lite y Pro" . Google para desarrolladores . Consultado el 6 de febrero de 2025 .
- ↑ Franzen, Carl (5 de febrero de 2025). "Google lanza Gemini 2.0 Pro, Flash-Lite y conecta el modelo de razonamiento Flash Thinking con YouTube, Maps y Search" . VentureBeat . Consultado el 6 de febrero de 2025 .
- ↑ "Grok 3 Beta — La era de los agentes de razonamiento" . x.ai. Consultado el 22 de febrero de 2025 .
- ↑ "Claude 3.7 Soneto y Código de Claude" . Antropológico . Consultado el 8 de agosto de 2025 .
- ↑ "Presentación de GPT-4.5" . openai.com . Consultado el 8 de agosto de 2025 .
- ↑ Kavukcuoglu, Koray (25 de marzo de 2025). "Gemini 2.5: Nuestro modelo de IA más inteligente" . Google . Consultado el 23 de septiembre de 2025 .
- ↑ "meta-llama/Llama-4-Maverick-17B-128E · Hugging Face" . huggingface.co . 5 de abril de 2025. Consultado el 6 de abril de 2025 .
- ↑ "El rebaño de Llama 4: El comienzo de una nueva era de innovación en IA multimodal nativa" . ai.meta.com . Archivado del original el 5 de abril de 2025. Consultado el 5 de abril de 2025 .
- ↑ "Presentación de OpenAI o3 y o4-mini" . openai.com . Consultado el 8 de agosto de 2025 .
- ↑ Equipo, Qwen (29-04-2025). "Qwen3: Piensa más profundamente, actúa más rápido" . Qwen . Consultado el 29-04-2025 .
- ↑ "Presentando a Claude 4" . Antropológico . Consultado el 8 de agosto de 2025 .
- ↑ Yadav, Nandini (26 de mayo de 2025). "Una startup india de IA lanza el modelo Sarvam-M: ¿Qué es y por qué todo el mundo habla de él?" . India Today . Consultado el 18 de marzo de 2026 .
- ^ "Sarvam-M: LLM índico híbrido de código abierto | Sarvam AI" . Sarvam AI . 2025-05-23 . Consultado el 18 de marzo de 2026 .
- ↑ "Grok 4" . x.ai. 9 de julio de 2025. Archivado del original el 9 de mayo de 2026. Recuperado el 9 de mayo de 2026 .
- ^ Pundalik , Kundeshwar; Sawarkar, Piyush; Sahoo, Nihar; Shinde, Abhishek; Chanda, Prateek; Goswami, vedante; Nagpal, Ajay; Singh, Atul; Thakur, Viraj (16 de julio de 2025), Modelo PARAM-1 BharatGen 2.9B , arXiv, doi : 10.48550/arXiv.2507.13390 , arXiv:2507.13390 , consultado el 18 de marzo de 2026
- ↑ "README.md · bharatgenai/Param-1" . 24 de febrero de 2026. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "GLM-4.5: Razonamiento, codificación y habilidades de agencia" . z.ai. Consultado el 6 de agosto de 2025 .
- ↑ "zai-org/GLM-4.5 · Hugging Face" . huggingface.co . 4 de agosto de 2025. Consultado el 6 de agosto de 2025 .
- ↑ Whitwam, Ryan (5 de agosto de 2025). "OpenAI anuncia dos modelos de IA abierta "gpt-oss", que puedes descargar hoy mismo" . Ars Technica . Consultado el 6 de agosto de 2025 .
- ↑ "Claude Opus 4.1" . Antropológico . Consultado el 8 de agosto de 2025 .
- ↑ "Presentando GPT-5" . openai.com . 7 de agosto de 2025. Consultado el 8 de agosto de 2025 .
- ↑ "Plataforma OpenAI: Documentación del modelo GPT-5" . openai.com . Consultado el 18 de agosto de 2025 .
- ↑ "deepseek-ai/DeepSeek-V3.1 · Hugging Face" . huggingface.co . 21-08-2025 . Consultado el 25-08-2025 .
- ↑ "Lanzamiento de DeepSeek-V3.1 | Documentación de la API de DeepSeek" . api-docs.deepseek.com . Consultado el 25 de agosto de 2025 .
- ^ "Apertus: Ein vollständig offenes, transparentes und mehrsprachiges Sprachmodell" (en alemán). Zúrich: ETH Zúrich. 2025-09-02 . Consultado el 7 de noviembre de 2025 .
- ↑ Kirchner, Malta (2 de septiembre de 2025). "Apertus: Schweiz stellt erstes offenes und mehrsprachiges KI-Modell vor" . heise en línea (en alemán) . Consultado el 7 de noviembre de 2025 .
- ↑ "Presentando el Soneto 4.5 de Claude" . Antropológico . Consultado el 29 de septiembre de 2025 .
- ↑ "GLM-4.6: Capacidades avanzadas de agencia, razonamiento y codificación" . z.ai. Consultado el 1 de octubre de 2025 .
- ↑ "zai-org/GLM-4.6 · Hugging Face" . huggingface.co . 30-09-2025 . Consultado el 01-10-2025 .
- ↑ "GLM-4.6" . modelscope.cn . Consultado el 1 de octubre de 2025 .
- ↑ "Una nueva era de inteligencia con Gemini 3" . Google . 18 de noviembre de 2025. Consultado el 5 de enero de 2026 .
- ↑ "Olmo 3: Trazando un camino a través del flujo del modelo para liderar la IA de código abierto" . Ai2 . 20 de noviembre de 2025.
- 1 2 Olmo, Equipo; Ettinger, Allyson; Bertsch, Amanda; Kuehl, Bailey; Graham, David; Heineman, David; Groeneveld, Dirk; Brahmán, Faeze; Timbers, Finbarr (15 de diciembre de 2025), Olmo 3 , arXiv, doi : 10.48550/arXiv.2512.13961 , arXiv:2512.13961 , consultado el 17 de marzo de 2026
- ↑ "Presentando a Claude Opus 4.5" . Antropológico . Consultado el 8 de enero de 2026 .
- ↑ Binder, Matt (3 de diciembre de 2025). "DeepSeek v3.2: Qué es, cómo se compara con ChatGPT, cómo probarlo" . Mashable . Recuperado el 12 de abril de 2026 .
- ↑ "Lanzamiento de DeepSeek-V3.2" . Documentación de la API de DeepSeek . 1 de diciembre de 2025. Consultado el 12 de abril de 2026 .
- ↑ "DeepSeek-V3.2: Razonamiento eficiente e IA con agentes" . Hugging Face . 1 de diciembre de 2025. Consultado el 12 de abril de 2026 .
- ↑ "Impulsando la ciencia y las matemáticas con GPT-5.2" . openai.com . Consultado el 4 de enero de 2026 .
- ↑ "Llevando Qwen3-Max-Thinking más allá de sus límites" . Qwen . 25 de enero de 2026. Archivado del original el 6 de febrero de 2026. Recuperado el 6 de febrero de 2026.
Mejoramos aún más Qwen3-Max-Thinking con dos innovaciones clave: (1) capacidades adaptativas de uso de herramientas [...]; y (2) técnicas avanzadas de escalado del tiempo de prueba [...]. [...] Limitamos [trayectorias paralelas] y redirigimos el cálculo ahorrado a la autorreflexión iterativa guiada por un mecanismo de "aprendizaje de la experiencia".
- ^ Equipo, Kimi; Bai, Yifan; Bao, Yiping; Carlos, Y.; Chen, Cheng; Chen, Guanduo; Chen, Haiting; Chen, Huarong; Chen, Jiahao (3 de febrero de 2026), Kimi K2: Inteligencia agente abierta , arXiv, doi : 10.48550/arXiv.2507.20534 , arXiv:2507.20534 , consultado el 18 de marzo de 2026
- ↑ Equipo, Kimi; Bai, Tongtong; Bai, Yifan; Bao, Yiping; Cai, SH; Cao, Yuan; Charles, Y.; Che, HS; Chen, Cheng (2026-02-02), Kimi K2.5: Inteligencia visual con agentes , arXiv, doi : 10.48550/arXiv.2602.02276 , arXiv:2602.02276 , consultado el 18 de marzo de 2026
- ↑ "Kimi K2.5: Chatea con Kimi K2.5 gratis" . Kimi K2.5 . Consultado el 18 de marzo de 2026 .
- ↑ Jiang, Ben (3 de febrero de 2026). "El modelo de IA compacto de StepFun de China supera a sus rivales de DeepSeek y Moonshot" . South China Morning Post . Archivado del original el 4 de febrero de 2026. Recuperado el 14 de abril de 2026 .
- ↑ "Paso 3.5 Flash: Lo suficientemente rápido para pensar. Lo suficientemente fiable para actuar" . StepFun . 12 de febrero de 2026. Consultado el 20 de abril de 2026 .
- ↑ "stepfun-ai/Step-3.5-Flash" . 14 de marzo de 2026. Recuperado el 14 de abril de 2026 – vía Hugging Face .
- ^ Mo, Liam; Vaya, Brenda; Chen, Laurie (11 de febrero de 2026). D'Silva, Anil (ed.). "La startup china de IA Zhipu lanza un nuevo modelo insignia GLM-5" . Reuters . Consultado el 17 de febrero de 2026 .
- 1 2 "GLM-5 / README.md" . 16 de junio de 2026. Recuperado el 17 de junio de 2026 a través de GitHub .
- ↑ "LICENCIA · bharatgenai/Param2-17B-A2.4B-Pensamiento" . 16 de febrero de 2026. Recuperado el 12 de abril de 2026 – vía Hugging Face .
- ↑ "bharatgenai/Param2-17B-A2.4B-Thinking" . Recuperado el 8 de marzo de 2026 – vía Hugging Face .
- ↑ «sarvamai/sarvam-1-v0.5 · Cara de abrazo» . abrazandoface.co . Consultado el 8 de marzo de 2026 .
- 1 2 3 4 "Liberación de código abierto de Sarvam 30B y 105B" . Sarvam AI . 6 de marzo de 2026. Archivado del original el 8 de mayo de 2026. Recuperado el 8 de mayo de 2026 .
- ↑ «sarvamai/sarvam-105b · Cara de abrazo» . abrazandoface.co . Consultado el 8 de marzo de 2026 .
- ↑ Kumar, Abhijeet (19 de febrero de 2026). "Por qué el nuevo modelo 105B de Sarvam marca un cambio en las ambiciones de la India en materia de IA soberana" . Business Standard .
- ↑ Singh, Jagmeet (18 de febrero de 2026). "Los nuevos modelos del laboratorio indio de IA Sarvam representan una importante apuesta por la viabilidad de la IA de código abierto" . TechCrunch . Consultado el 18 de marzo de 2026 .
- ↑ Márquez, Javier (17 de marzo de 2026). " Una IA para reunir todas las funciones posibles: la apuesta de Mistral con Small 4 es hacer más con menos cosas " Xataka (en español) . Consultado el 20 de abril de 2026 .
- ↑ "Presentando Mistral Small 4" . Mistral AI . Consultado el 20 de abril de 2026 .
- ↑ "Xiaomi lanza el potente modelo de IA MiMo-V2 Pro con 1 billón de parámetros y una ventana de contexto de 1 millón de tokens" . NDTV Profit . 19 de marzo de 2026.
- ↑ "Se revela que el misterioso modelo de IA es de Xiaomi tras las sospechas de que era de DeepSeek" . Reuters . 18 de marzo de 2026. Consultado el 3 de abril de 2026 .
- ↑ Whitwam, Ryan (2 de abril de 2026). "Google anuncia los modelos de IA abiertos Gemma 4 y cambia a la licencia Apache 2.0" . Ars Technica . Recuperado el 3 de abril de 2026 .
- ↑ Mann, Tobias (2 de abril de 2026). "Google lucha contra los modelos chinos de pesos abiertos con Gemma 4" . Recuperado el 3 de abril de 2026 .
- ↑ Franzen, Carl (7 de abril de 2026). "La IA se une a la jornada laboral de 8 horas: GLM lanza la versión 5.1 de código abierto LLM, superando a Opus 4.6 y GPT-5.4 en SWE-Bench Pro" . VentureBeat . Consultado el 12 de abril de 2026 .
- ↑ "GLM-5.1: Hacia tareas de largo plazo" . Z.ai. Consultado el 12 de abril de 2026 .
- ↑ "Presentamos Muse Spark: Escalando hacia la superinteligencia personal" . ai.meta.com . 8 de abril de 2026. Archivado del original el 9 de mayo de 2026. Consultado el 9 de mayo de 2026 .
- ↑ "Una IA china llamada 'Qwen3.6-35B-A3B', que es más potente que Gemma4, ha sido lanzada como modelo abierto" . Gigazine . 17 de abril de 2026. Consultado el 17 de abril de 2026 .
- ↑ "README.md · Qwen/Qwen3.6-35B-A3B" . 15 de abril de 2026. Recuperado el 17 de abril de 2026 – vía Hugging Face .
- ↑ Gewirtz, David (21 de abril de 2026). "El nuevo Kimi K2.6 de Moonshot AI aborda tus tareas complejas con 1000 agentes colaboradores" . ZDNET . Consultado el 17 de junio de 2026 .
- ^ Li, Yutong (22 de abril de 2026). Du, Yu (ed.).13小时编码、5天自主运行!Kimi K2.6开源“硬刚”闭源巨头,长程战力能否撕开AGI工业化新赛道?[¡ 13 horas de programación, 5 días de funcionamiento autónomo! Kimi K2.6, de código abierto, se enfrenta a los gigantes del código cerrado. ¿Podrán sus capacidades a largo plazo abrir un nuevo camino para la industrialización de la IA general? ] . National Business Daily (en chino) . Consultado el 17 de junio de 2026 .
- ↑ "README.md · moonshotai/Kimi-K2.6" . 23 de abril de 2026. Recuperado el 17 de junio de 2026 – vía Hugging Face .
- ↑ Butts, Dylan (24 de abril de 2026). "DeepSeek de China publica una vista previa del tan esperado modelo V4 mientras se intensifica la carrera por la IA" . CNBC .
- ↑ "MiMo-V2.5-Pro | Xiaomi" . mimo.xiaomi.com . Consultado el 3 de mayo de 2026 .
- ↑ Thomas, Prasanth Aby (28 de abril de 2026). "Xiaomi lanza modelos MiMo con licencia del MIT para agentes de IA de larga duración" . Computerworld . Consultado el 6 de mayo de 2026 .
- ↑ "XiaomiMiMo/MiMo-V2.5" . Hugging Face . XiaomiMiMo . Consultado el 3 de mayo de 2026 .
- ↑ "Mistral Medium 3.5 - Mistral AI" . docs.mistral.ai .
- ↑ "Gemini 3.5: inteligencia de vanguardia con acción" . Google . 19 de mayo de 2026.
- ↑ "Presentando a Claude Opus 4.8" . Anthropic . 28 de mayo de 2026. Archivado del original el 30 de mayo de 2026. Recuperado el 30 de mayo de 2026 .
- ↑ "Paso 3.7 Flash" . StepFun . 29 de mayo de 2026. Archivado del original el 30 de mayo de 2026. Consultado el 30 de mayo de 2026 .
- ↑ "NVIDIA anuncia su modelo de código abierto más potente en EE. UU., el 'Nemotron 3 Ultra', e informa del inicio de la producción en masa de su servidor de IA, 'Vera Rubin'."" . Gigazine . 1 de junio de 2026 . Consultado el 16 de julio de 2026 .
- ↑ "README.md · nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4 en 183968f87ae4cedce3039313cac1fd43d112c578" . 24 de junio de 2026. Recuperado el 16 de julio de 2026 – vía Hugging Face .
- ↑ "Claude Fable 5 y Claude Mythos 5" . Anthropic . 9 de junio de 2026. Archivado del original el 10 de junio de 2026. Consultado el 11 de junio de 2026 .
- ↑ "El modelo de IA de fabricación china 'Kimi K2.7 Code' se ha lanzado como un modelo abierto, que presume del mejor rendimiento de codificación de la serie Kimi y un bajo consumo de tokens" . Gigazine . 15 de junio de 2026. Consultado el 17 de junio de 2026 .
- ↑ "README.md · moonshotai/Kimi-K2.7-Code" . 12 de junio de 2026. Recuperado el 17 de junio de 2026 – vía Hugging Face .
- ↑ Chang, Minxiao (15 de junio de 2026). "Las acciones de Zhipu AI se disparan tras el lanzamiento del modelo GLM-5.2 por parte de una empresa china" . South China Morning Post . Consultado el 17 de junio de 2026 .
- ↑ "El modelo chino Z.ai GLM-5.2 supera al modelo GPT 5.5 de OpenAI en los principales benchmarks" . The Economic Times . 17 de junio de 2026. Consultado el 17 de junio de 2026 .
- ↑ "GLM-5.2: Diseñado para tareas a largo plazo" . Z.ai. Consultado el 16 de junio de 2026 .
- ↑ Franzen, Carl (29 de junio de 2026). "Meituan publica como código abierto LongCat-2.0, el modelo de codificación de agentes de 1,6 T, casi de vanguardia, que ha liderado OpenRouter, entrenado completamente con chips chinos" . VentureBeat . Consultado el 16 de julio de 2026 .
- ↑ "Presentando LongCat-2.0" . LongCat . 30 de junio de 2026. Consultado el 16 de julio de 2026 .
- ↑ Witteveen, Sam (6 de julio de 2026). "Hy3 de Tencent, con licencia Apache, se enfrenta a GLM-5.2 con la mitad de tamaño y gana en todo excepto en la codificación" . VentureBeat . Consultado el 15 de julio de 2026 .
- ↑ Varghese, Harshita (9 de julio de 2026). "Meta presenta el modelo Muse Spark 1.1 con una vista previa abierta a desarrolladores" . Reuters . Consultado el 9 de julio de 2026 .
- ↑ Loizos, Connie (15 de julio de 2026). "Thinking Machines refuerza su apuesta contra la IA universal con su primer modelo abierto, Inkling" . TechCrunch . Consultado el 15 de julio de 2026 .
- ↑ Franzen, Carl (15 de julio de 2026). "Thinking Machines publica el primer modelo de lenguaje multimodal de código abierto, Inkling, centrado en el bajo coste y la 'resistencia a la censura'"." . VentureBeat . Consultado el 15 de julio de 2026 .
- ↑ Yildirim, Ece (16 de julio de 2026). "China acaba de lanzar otra bomba sobre las empresas estadounidenses de IA de vanguardia" . Gizmodo . Consultado el 16 de julio de 2026 .
- Comparación de software
- Modelos de lenguaje a gran escala