Articulo de referencia

experimentos de Cranfield

Los experimentos de Cranfield fueron una serie de estudios experimentales sobre recuperación de información realizados por Cyril W. Cleverdon en la década de 1960 en el Colegio ...

Los experimentos de Cranfield fueron una serie de estudios experimentales sobre recuperación de información realizados por Cyril W. Cleverdon en la década de 1960 en el Colegio de Aeronáutica, hoy conocido como Universidad de Cranfield , para evaluar la eficiencia de los sistemas de indexación . [ 1 ] [ 2 ] [ 3 ] Los experimentos se dividieron en dos fases principales, ninguna de las cuales fue informatizada. La colección completa de resúmenes, índices resultantes y resultados se distribuyó posteriormente en formato electrónico y se utilizó ampliamente durante décadas.

En la primera serie de experimentos, se compararon varios métodos de indexación existentes para evaluar su eficiencia. Las consultas fueron generadas por los autores de los artículos de la colección y posteriormente traducidas a búsquedas en el índice por expertos en dichos sistemas. En esta serie, un método pasó de ser el menos eficiente al más eficiente tras realizar pequeños cambios en la organización del registro de datos en las fichas . La conclusión fue que la metodología subyacente parecía menos importante que los detalles específicos de la implementación. Esto generó un considerable debate sobre la metodología de los experimentos.

Estas críticas también dieron lugar a la segunda serie de experimentos, ahora conocida como Cranfield 2. Cranfield 2 intentó obtener información adicional invirtiendo la metodología; Cranfield 1 probó la capacidad de los expertos para encontrar un recurso específico siguiendo el sistema de indexación, mientras que Cranfield 2 estudió los resultados de formular preguntas en lenguaje humano y comprobar si el sistema de indexación proporcionaba una respuesta relevante, independientemente de si se trataba del documento original. Este experimento también fue objeto de un considerable debate.

Los experimentos de Cranfield fueron sumamente influyentes en el campo de la recuperación de información, un tema de gran interés en la posguerra, cuando la cantidad de investigación científica se disparó. Fue objeto de debate constante durante años y dio lugar a varios proyectos informáticos para poner a prueba sus resultados. Su influencia fue considerable durante cuarenta años, antes de que los índices de lenguaje natural, como los de los motores de búsqueda web modernos, se generalizaran.

Fondo

El ahora famoso artículo de julio de 1945, « Como podríamos pensar », de Vannevar Bush, suele citarse como la primera descripción completa del campo que se convertiría en la recuperación de información . El artículo describe una máquina hipotética conocida como « memex » que almacenaría todo el conocimiento de la humanidad en un formato indexado que permitiría a cualquier persona recuperarlo. [ 4 ]

En 1948, la Royal Society celebró la Conferencia de Información Científica, donde se exploraron formalmente algunos de estos conceptos. Esto dio lugar a un pequeño número de experimentos de campo en el Reino Unido, Estados Unidos y los Países Bajos. El único esfuerzo importante para comparar diferentes sistemas fue liderado por Gull, quien utilizó la colección de trabajos de la Agencia de Información Técnica de las Fuerzas Armadas , que había comenzado como una colección de informes aeronáuticos capturados en Alemania al final de la Segunda Guerra Mundial . La evaluación de los resultados fue realizada por expertos en ambos sistemas, quienes nunca se pusieron de acuerdo sobre la relevancia de los diversos documentos recuperados para la búsqueda, rechazando cada grupo más del 30 % de los resultados por considerarlos erróneos. Se cancelaron las pruebas posteriores al no existir consenso. [ 5 ]

En 1958 se celebró en Washington, D.C. , una segunda conferencia sobre el tema, la Conferencia Internacional sobre Información Científica, momento en el que el desarrollo informático ya permitía la recuperación automática de índices. Fue en esta reunión donde Cyril W. Cleverdon se decidió y logró obtener financiación de la Fundación Nacional de Ciencias de Estados Unidos para iniciar lo que más tarde se conocería como Cranfield 1. [ 6 ]

Cranfield 1

La primera serie de experimentos comparó directamente cuatro sistemas de indexación que representaban fundamentos conceptuales significativamente diferentes. Los cuatro sistemas fueron:

  1. la Clasificación Decimal Universal , un sistema jerárquico que se está introduciendo ampliamente en las bibliotecas,
  2. el Catálogo Alfabético de Materias que ordenaba alfabéticamente los encabezados de materia en las colecciones clásicas de fichas de índice de las bibliotecas ,
  3. el esquema de clasificación facetada que permite combinaciones de temas para producir nuevos temas,
  4. y el sistema Uniterm de indexación de coordenadas de Mortimer Taube, donde una referencia puede encontrarse en cualquier número de fichas de índice separadas. [ 6 ]

En una serie inicial de experimentos, se pidió a los participantes que crearan índices para una colección de documentos relacionados con la industria aeroespacial . Cada índice fue elaborado por un experto en dicha metodología. Posteriormente, se solicitó a los autores de los documentos originales que prepararan un conjunto de términos de búsqueda que permitieran encontrar el documento en cuestión. A continuación, se pidió a los expertos en indexación que generaran consultas en su índice basándose en los términos de búsqueda del autor. Finalmente, se utilizaron estas consultas para examinar el índice y comprobar si devolvía el documento buscado. [ 6 ]

En estas pruebas, todos los sistemas, excepto el sistema facetado, produjeron un número aproximadamente igual de resultados "correctos", mientras que el concepto facetado se quedó rezagado. Tras analizar estos resultados, se volvió a indexar el sistema facetado utilizando un formato diferente en las tarjetas y se repitieron las pruebas. En esta serie de pruebas, el sistema facetado resultó ser el claro ganador. Esto sugiere que la teoría subyacente al sistema era menos importante que los detalles de la implementación. [ 6 ]

El resultado de estos experimentos, publicado en 1962, generó un enorme debate, tanto entre los defensores de los distintos sistemas como entre los investigadores que criticaban los experimentos en su conjunto. [ 7 ] Sin embargo, parecía que una conclusión se confirmaba claramente: los sistemas sencillos basados ​​en palabras clave funcionaban igual de bien que los esquemas de clasificación complejos. Esto es importante, ya que los primeros son mucho más fáciles de implementar. [ 8 ]

Cranfield 2

En la primera serie de experimentos, expertos en el uso de las diversas técnicas se encargaron tanto de la creación del índice como de su aplicación a las consultas de muestra. Cada sistema tenía su propio concepto sobre cómo debía estructurarse una consulta, lo que hoy se conocería como lenguaje de consulta . Gran parte de las críticas a los primeros experimentos se centraron en si estos realmente ponían a prueba los sistemas o la capacidad del usuario para traducir la consulta al lenguaje de consulta. [ 6 ]

Esto dio lugar a la segunda serie de experimentos, Cranfield 2, que abordó la cuestión de convertir la consulta al lenguaje. Para ello, en lugar de considerar la generación de la consulta como una caja negra , se desglosó cada paso. El resultado de este enfoque fue revolucionario en su momento; sugirió que los términos de búsqueda se mantuvieran en su formato original, lo que hoy se conoce como consulta en lenguaje natural . [ 6 ]

Otro cambio importante fue la forma en que se evaluaban los resultados. En las pruebas originales, el éxito se producía solo si el índice devolvía el documento exacto que se había utilizado para generar la búsqueda. Sin embargo, esto no era típico de una consulta real; un usuario que buscara información sobre trenes de aterrizaje de aeronaves podría estar satisfecho con cualquiera de los numerosos artículos de la colección sobre el tema, pero Cranfield 1 consideraría tal resultado un fracaso a pesar de devolver material relevante. En la segunda serie, los resultados fueron evaluados por terceros que proporcionaron una respuesta cualitativa sobre si la consulta generaba un conjunto de artículos relevantes, en lugar de devolver un documento original específico. [ 7 ]

Continúa el debate

Los resultados de las dos series de pruebas siguieron siendo objeto de un considerable debate durante años. En particular, dieron lugar a una acalorada discusión entre Cleverdon y Jason Farradane , uno de los fundadores del Instituto de Científicos de la Información en 1958. Ambos solían aparecer en las reuniones donde el otro presentaba y, durante el turno de preguntas y respuestas , explicaban por qué todo lo que hacían era erróneo. El debate se ha caracterizado como «...feroz e implacable, a veces sobrepasando los límites de la civilidad». [ 7 ] A este coro se unió Don R. Swanson en Estados Unidos, quien publicó una crítica sobre los experimentos de Cranfield unos años después. [ 7 ]

A pesar de estas críticas, Cranfield 2 estableció el estándar con el que se juzgaron muchos experimentos posteriores. En particular, la metodología de Cranfield 2, que partía de términos en lenguaje natural y evaluaba los resultados por relevancia, no por coincidencias exactas, se volvió casi universal en experimentos posteriores a pesar de las numerosas objeciones. [ 7 ]

Influencia

Con la conclusión de Cranfield 2 en 1967, todo el corpus se publicó en un formato legible por máquina. [ 9 ] Hoy en día, se le conoce como Cranfield 1400, o cualquier variación de ese tema. El nombre hace referencia al número de documentos en la colección, que consta de 1398 resúmenes. La colección también incluye 225 consultas y los juicios de relevancia de todos los pares consulta:documento que resultaron de las ejecuciones experimentales. [ 10 ] La base de datos principal de resúmenes es de aproximadamente 1,6  MB. [ 11 ]

Los experimentos se llevaron a cabo en una época en la que las computadoras tenían unos pocos kilobytes de memoria principal y acceso a la red de quizás unos pocos megabytes . Por ejemplo, el IBM System/360 Modelo 50 de gama media se vendía con entre 64 y 512  kB de memoria principal [ 12 ] (tendiendo hacia el extremo inferior) y su disco duro típico almacenaba poco más de 80  MB. [ 13 ] A medida que las capacidades de los sistemas crecieron durante las décadas de 1960 y 1970, la colección de documentos de Cranfield se convirtió en un importante corpus de prueba que se utilizó repetidamente durante muchos años. [ 14 ]

Actualmente, la colección es demasiado pequeña para utilizarla en pruebas prácticas más allá de experimentos piloto. Su lugar lo ha ocupado en gran medida la colección TREC, que contiene 1,89 millones de documentos sobre una gama más amplia de temas, o la colección GOV2, aún más reciente, con 25 millones de páginas web. [ 10 ]

Véase también

Referencias

Citas

  1. Cleverdon, CW (1960). "El proyecto de investigación Aslib Cranfield sobre la eficiencia comparativa de los sistemas de indexación". Actas de ASLIB . 12 (12). Emerald: 421– 431. doi : 10.1108/eb049778 . ISSN 0001-253X . 
  2. Cleverdon, Cyril (1967). "Las pruebas de Cranfield sobre dispositivos de lenguaje de índice". Actas de ASLIB . 19 (6). Emerald: 173– 194. doi : 10.1108/eb050097 . ISSN 0001-253X . 
  3. Cleverdon, CW; Keen, EM (1966). Factores que determinan el rendimiento de los sistemas de indexación. Vol. 1: Diseño, Vol. 2: Resultados . Cranfield, Reino Unido: Aslib Cranfield Research Project.
  4. Buckland, Michael K. (mayo de 1992). "Emanuel Goldberg, recuperación electrónica de documentos y Memex de Vannevar Bush" . Journal of the American Society for Information Science . 43 (4): 284– 94. doi : 10.1002/(SICI)1097-4571(199205)43:4 < 284::AID-ASI3 > 3.0.CO ; 2-0 .
  5. Gull, Cloyd (1 de octubre de 1956). "Siete años de trabajo en la organización de materiales en la biblioteca especial" . American Documentation . 7 (4): 320– 329. doi : 10.1002/asi.5090070408 .
  6. 1 2 3 4 5 6 Robertson 2008 , pág. 3.
  7. 1 2 3 4 5 Robertson 2008 , pág. 4.
  8. Saracevic, Tefko (2016). La noción de relevancia en la ciencia de la información . Morgan & Claypool. pág. 13. ISBN  9781598297690.
  9. Robertson 2008 , pág. 7.
  10. ^ Manning , Raghavan y Schütze 2008 .
  11. CRANFIELD .
  12. Características funcionales del modelo 50 del IBM System/360 (PDF) . IBM. 1967. A22-6898-1.
  13. "Archivos de IBM: Unidad de almacenamiento en disco IBM 1302" . IBM. 23 de enero de 2003. Consultado el 20 de julio de 2011 .
  14. Robertson 2008 , págs. 5, 7.

Bibliografía

  • Richmond, Phyllis A. (1963). "Revisión del proyecto Cranfield". American Documentation . 14 (4): 307– 311. doi : 10.1002/asi.5090140408 . ISSN 0096-946X . 
  • Lancaster, FW (1965). Un estudio de caso sobre la aplicación de las técnicas de evaluación del sistema Cranfield. Journal of Chemical Documentation , 5(2), 92–96.
  • Robertson, Stephen (2008). "Sobre la historia de la evaluación en IR". Journal of Information Science . 34 (4): 439– 456. doi : 10.1177/0165551507086989 . S2CID 8032578 . 
  • "Corpus de Cranfield de 1400" .
  • Manning, Cristóbal; Raghavan, Prabhakar; Schütze, Hinrich (2008). "Colecciones de pruebas estándar" . Introducción a la recuperación de información . Prensa de la Universidad de Cambridge.
  • Documentos de Cranfield en el Museo ACM SIGIR
Obtenido de " https://en.wikipedia.org/w/index.php?title=Cranfield_experiments&oldid=1329061769 "