Articulo de referencia

Kaggle

([[Chief executive officer|CEO]]) |Julia Elliott ([[Chief operating officer|COO]]) |Jeff Moser ([[Software architect|Chief Architect]]) }}"},"industry":{"wt":"[[Data science]]"}...

Kaggle es una plataforma de competición de ciencia de datos y una comunidad en línea para científicos de datos y profesionales del aprendizaje automático, perteneciente a Google LLC . Kaggle permite a los usuarios encontrar y publicar conjuntos de datos, explorar y crear modelos en un entorno web de ciencia de datos, colaborar con otros científicos de datos e ingenieros de aprendizaje automático y participar en competiciones para resolver desafíos de ciencia de datos. [ 1 ] Kaggle también ha facilitado el uso de datos poco éticos y poco fiables en la investigación médica.

Historia

Kaggle fue fundada por Anthony Goldbloom en abril de 2010. [ 2 ] Jeremy Howard , uno de los primeros usuarios de Kaggle, se unió en noviembre de 2010 y se desempeñó como Presidente y Científico Jefe. [ 3 ] También formó parte del equipo Nicholas Gruen, quien fue el presidente fundador. [ 4 ] En 2011, la empresa recaudó 12,5 millones de dólares y Max Levchin se convirtió en presidente. [ 5 ] El 8 de marzo de 2017, Fei-Fei Li , Científica Jefa de Google, anunció que Google estaba adquiriendo Kaggle. [ 6 ]

En junio de 2017, Kaggle superó el millón de usuarios registrados y, a octubre de 2023, cuenta con más de 15 millones de usuarios en 194 países. [ 7 ] [ 8 ] [ 9 ]

En 2022, los fundadores Goldbloom y Hamner renunciaron a sus cargos y D. Sculley se convirtió en el director ejecutivo . [ 10 ]

En febrero de 2023, Kaggle introdujo Models, que permite a los usuarios descubrir y utilizar modelos preentrenados mediante integraciones profundas con el resto de la plataforma de Kaggle. [ 11 ]

En abril de 2025, Kaggle se asoció con la Fundación Wikimedia . [ 12 ]

Descripción general del sitio

competiciones

Desde su fundación, Kaggle ha organizado numerosas competiciones de aprendizaje automático . Entre las más destacadas se encuentran el reconocimiento de gestos para Microsoft Kinect , [ 13 ] la creación de una IA de fútbol para el Manchester City , la codificación de un algoritmo de negociación para Two Sigma Investments , [ 14 ] y la mejora de la búsqueda del bosón de Higgs en el CERN . [ 15 ]

El organizador de la competición prepara los datos y una descripción del problema; puede elegir si se otorgará una recompensa económica o no. Los participantes experimentan con diferentes técnicas y compiten entre sí para producir los mejores modelos. El trabajo se comparte públicamente a través de Kaggle Kernels para lograr un mejor punto de referencia e inspirar nuevas ideas. Las propuestas se pueden enviar a través de Kaggle Kernels, mediante carga manual o utilizando la API de Kaggle . En la mayoría de las competiciones, las propuestas se puntúan inmediatamente (en función de su precisión predictiva en relación con un archivo de solución oculto) y se resumen en una tabla de clasificación en tiempo real. Una vez transcurrido el plazo, el organizador de la competición paga el premio en metálico a cambio de "una licencia mundial, perpetua, irrevocable y libre de regalías [...] para usar la propuesta ganadora", es decir, el algoritmo, el software y la propiedad intelectual relacionada desarrollada, que es "no exclusiva a menos que se especifique lo contrario". [ 16 ]

Además de sus competiciones públicas, Kaggle también ofrece competiciones privadas, limitadas a los mejores participantes de Kaggle. Kaggle ofrece una herramienta gratuita para que los profesores de ciencia de datos organicen competiciones académicas de aprendizaje automático. [ 17 ] Kaggle también organiza competiciones de reclutamiento en las que los científicos de datos compiten por la oportunidad de ser entrevistados en empresas líderes en ciencia de datos como Facebook , Winton Capital y Walmart .

Las competiciones de Kaggle han dado lugar a proyectos exitosos como el avance de la investigación sobre el VIH , [ 18 ] clasificaciones de ajedrez [ 19 ] y pronóstico de tráfico . [ 20 ] Geoffrey Hinton y George Dahl utilizaron redes neuronales profundas para ganar una competición organizada por Merck . Vlad Mnih (uno de los estudiantes de Hinton) utilizó redes neuronales profundas para ganar una competición organizada por Adzuna . Esto dio lugar a que la técnica fuera adoptada por otros en la comunidad de Kaggle. Tianqi Chen de la Universidad de Washington también utilizó Kaggle para demostrar el poder de XGBoost , que desde entonces ha reemplazado a Random Forest como uno de los principales métodos utilizados para ganar competiciones de Kaggle.

Se han publicado varios artículos académicos basados ​​en los resultados de las competiciones de Kaggle. [ 21 ] Un factor que contribuye a esto es la clasificación en tiempo real, que anima a los participantes a seguir innovando más allá de las mejores prácticas existentes. [ 22 ] Los métodos ganadores se suelen publicar en el blog de ganadores de Kaggle.

Sistema de progresión

Kaggle ha implementado un sistema de progresión para reconocer y recompensar a los usuarios en función de sus contribuciones y logros dentro de la plataforma. Este sistema consta de cinco niveles: Novato, Colaborador, Experto, Maestro y Gran Maestro. Cada nivel se alcanza cumpliendo criterios específicos en competiciones, conjuntos de datos, kernels (compartición de código) y debates. [ 23 ]

El nivel más alto, Kaggle Grandmaster, se otorga a los usuarios que han alcanzado los primeros puestos en múltiples competiciones, incluyendo un alto puesto en un equipo individual. Al 2 de abril de 2025, de 23,29 millones de cuentas de Kaggle, 2973 habían alcanzado el estatus de Kaggle Master y 612 el de Kaggle Grandmaster. [ 24 ]

Cuadernos de Kaggle

Captura de pantalla de Kaggle Notebooks

Kaggle incluye un entorno de desarrollo integrado en línea gratuito, basado en navegador , llamado Kaggle Notebooks, diseñado para la ciencia de datos y el aprendizaje automático . Los usuarios pueden escribir y ejecutar código en Python o R , importar conjuntos de datos, usar bibliotecas populares y entrenar modelos en CPU , GPU o TPU directamente en la nube. Este entorno se usa frecuentemente para presentaciones a competiciones, tutoriales, educación y análisis exploratorio de datos . [ 25 ] [ 26 ]

Problemas de la investigación médica

En diciembre de 2025, se publicó un artículo en The Transmitter titulado "Exclusiva: Springer Nature se retracta y elimina casi 40 publicaciones que entrenaron redes neuronales con un conjunto de datos 'descabellado'". [ 27 ] El conjunto de datos en cuestión se subió a Kaggle y contenía fotografías de rostros de niños autistas y no autistas. Este conjunto de datos contenía más de 2900 imágenes y es improbable que estos niños o sus familias dieran su consentimiento para que las fotos se utilizaran en investigación médica o que las imágenes fueran aprobadas éticamente para la investigación. Los artículos que utilizaban el conjunto de datos en Springer Nature fueron retirados de la literatura científica. Al menos otras 90 publicaciones citan una versión del conjunto de datos.

En abril de 2026, se identificaron otros dos conjuntos de datos en Kaggle sin procedencia de datos, publicados en Nature con el título: «Docenas de modelos de predicción de enfermedades basados ​​en IA fueron entrenados con datos dudosos». [ 28 ] [ 29 ] Estos conjuntos de datos se utilizaron en 125 modelos de predicción clínica, al menos dos de los cuales se han utilizado en hospitales de Indonesia y España , mientras que un artículo que utilizó el conjunto de datos fue referenciado en una patente de dispositivo médico. A fecha de 5 de junio de 2026, cinco de los artículos que utilizaron estos conjuntos de datos han sido retirados de la literatura científica.

En mayo de 2026, una publicación de investigación adicional que utiliza dos conjuntos de datos de imágenes de Kaggle está siendo investigada en Scientific Reports . Un artículo en Retraction Watch "Conjuntos de datos 'cómicamente malos' utilizados para entrenar modelos clínicos para accidente cerebrovascular y diabetes" [ 30 ] destacó que las imágenes incluían actores famosos como Sylvester Stallone como Rambo, George Clooney, Angelina Jolie y Daniel Craig, así como niños. Sería poco ético utilizar estas imágenes de niños en la investigación médica sin consentimiento. Una búsqueda inversa de imágenes mostró que algunas de las imágenes no eran para accidente cerebrovascular , sino para parálisis de Bell . Uno de los conjuntos de datos ya no está disponible en Kaggle, mientras que el otro aún permanece y menciona que las imágenes pueden estar sujetas a derechos de autor.

Kaggle se basa en los metadatos y la procedencia de los informes de la comunidad [ 30 ] y menciona que el uso del conjunto de datos de accidentes cerebrovasculares y diabetes identificado en "Evidencia de datos poco fiables y procedencia de datos deficiente en la investigación de modelos de predicción clínica y la práctica clínica" es totalmente legítimo y no viola sus términos de servicio. [ 30 ] [ 29 ]

Véase también

Referencias

  1. "Guía para principiantes de Kaggle para la ciencia de datos" . MUO . 17 de abril de 2023. Consultado el 10 de junio de 2023 .
  2. Lardinois, Frederic; Mannes, John; Lynley, Matthew (8 de marzo de 2017). "Google adquiere la comunidad de ciencia de datos Kaggle" . Techcrunch . Consultado el 9 de marzo de 2017 .{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  3. "La revolución del exabyte: cómo Kaggle está convirtiendo a los científicos de datos en estrellas del rock" . Wired UK . ISSN 1357-0978 . Consultado el 30 de septiembre de 2023 . {{cite magazine}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  4. Mulcaster, Glenn (4 de noviembre de 2011). "Un pequeño pez local, la sensación de Silicon Valley" . The Sydney Morning Herald .{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  5. Lichaa, Zachary. "Max Levchin se convierte en presidente de Kaggle, una empresa emergente que ayuda a la NASA a resolver problemas imposibles" . Business Insider .{{cite web}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  6. "Bienvenido Kaggle a Google Cloud" . Blog de Google Cloud Platform . Consultado el 19 de agosto de 2018 .{{cite news}}: CS1 maint: servicio de archivado obsoleto ( enlace )
  7. "Usuarios únicos de Kaggle" .
  8. Markoff, John (24 de noviembre de 2012). "Los científicos ven avances en el aprendizaje profundo, una parte de la inteligencia artificial" . The New York Times . Recuperado el 19 de agosto de 2018 .
  9. "Hemos superado el millón de miembros" . Blog del ganador de Kaggle . 6 de junio de 2017. Consultado el 19 de agosto de 2018 .
  10. Wali, Kartik (8 de junio de 2022). "Kaggle tiene un nuevo director ejecutivo, los fundadores renuncian después de una década" . Analytics India Magazine . Recuperado el 10 de junio de 2023 .
  11. " [ Lanzamiento de producto ] Presentación de los modelos de Kaggle | Ciencia de datos y aprendizaje automático" .
  12. "Kaggle y la Fundación Wikimedia se asocian en materia de datos abiertos" . The Keyword . 16 de abril de 2025. Archivado del original el 16 de abril de 2025. Consultado el 16 de abril de 2025 .
  13. Byrne, Ciara (12 de diciembre de 2011). "Kaggle lanza una competencia para ayudar a Microsoft Kinect a aprender nuevos gestos" . VentureBeat . Consultado el 13 de diciembre de 2011 .
  14. Wigglesworth, Robin (8 de marzo de 2017). "Los fondos de cobertura adoptan métodos novedosos para encontrar nuevos talentos tecnológicos" . The Financial Times . Reino Unido . Consultado el 29 de octubre de 2017 .
  15. "La comunidad de aprendizaje automático se enfrenta al bosón de Higgs" . Symmetry Magazine . 15 de julio de 2014. Consultado el 14 de enero de 2015 .
  16. Kaggle. "Términos y condiciones - Kaggle" .
  17. Kaggle. "Kaggle en clase" . Archivado del original el 16 de junio de 2011. Consultado el 12 de agosto de 2011 .
  18. Carpenter, Jennifer (febrero de 2011). "Que gane el mejor analista" . Revista Science . Vol. 331, n.º 6018. págs. 698–699 . doi : 10.1126/science.331.6018.698 . Consultado el 1 de abril de 2011 .   
  19. Sonas, Jeff (20 de febrero de 2011). "El desafío de clasificación de ajedrez Deloitte/FIDE" . Chessbase . Consultado el 3 de mayo de 2011 .
  20. Foo, Fran (6 de abril de 2011). "¿Los teléfonos inteligentes pueden predecir los tiempos de viaje en Nueva Gales del Sur?" . The Australian . Consultado el 3 de mayo de 2011 .
  21. "Taller NIPS 2014 sobre física de altas energías y aprendizaje automático" . JMLR W&CP . Vol. 42. Archivado del original el 14 de mayo de 2016. Consultado el 1 de septiembre de 2015 . 
  22. Athanasopoulos, George; Hyndman, Rob (2011). "El valor de la retroalimentación en las competencias de pronóstico" (PDF) . Revista Internacional de Pronóstico . Vol. 27. págs. 845–849 . Archivado del original (PDF) el 16 de febrero de 2019. Recuperado el 4 de marzo de 2022 .  
  23. "Sistema de progresión de Kaggle" . Kaggle . Consultado el 3 de abril de 2023 .
  24. Carl McBride Ellis (2 de abril de 2025). "Kaggle en números" . Kaggle.
  25. "CSE 40657/60657: Procesamiento del lenguaje natural" .
  26. "Cuadernos de Kaggle infravalorados que todo entusiasta de la ciencia de datos debe conocer | AIM" . 25 de febrero de 2022.
  27. "Springer Nature se retracta y retira casi 40 publicaciones" . The Transmitter: Neuroscience News and Perspectives . 8 de diciembre de 2025. Consultado el 17 de abril de 2026 .
  28. Basu, Mohana (15 de abril de 2026). "Docenas de modelos de predicción de enfermedades basados ​​en IA fueron entrenados con datos dudosos" . Nature . doi : 10.1038/d41586-026-00697-4 . ISSN 1476-4687 . PMID 41986680 .  
  29. 1 2 Gibson, Alexander D; White, Nicole M; Collins, Gary S; Barnett, Adrian G (2026). "Evidencia de datos poco fiables y procedencia deficiente de los datos en la investigación de modelos de predicción clínica y la práctica clínica" . BMC Medicine . doi : 10.1186/s12916-026-04981-y . medRxiv 10.64898/2026.02.24.26347028 . PMID 42243840 .  
  30. 1 2 3 Youmshajekian, Lori (18-05-2026) .Conjuntos de datos "cómicamente malos" utilizados para entrenar modelos clínicos para accidentes cerebrovasculares y diabetes . Retraction Watch . Consultado el 18 de mayo de 2026 .

Lecturas adicionales

  • "La competencia arroja luz sobre la materia oscura", Oficina de Política Científica y Tecnológica, sitio web de la Casa Blanca, junio de 2011.
  • "Que gane el mejor algoritmo...", The Wall Street Journal , marzo de 2011
  • "Concurso de Kaggle busca impulsar a los editores de Wikipedia", New Scientist , julio de 2011. Archivado el 22 de marzo de 2016 en Wayback Machine.
  • "Verificación de la investigación en biología de sistemas en la era de la competencia colaborativa", Nature Nanotechnology , septiembre de 2011