La generación automática de ítems ( GAI ), o generación automatizada de ítems , es un proceso que vincula la psicometría con la programación informática . Utiliza un algoritmo informático para crear automáticamente ítems de prueba que son los componentes básicos de una prueba psicológica . El método fue descrito por primera vez por John R. Bormuth [ 1 ] en la década de 1960, pero no se desarrolló hasta hace poco. La GAI utiliza un proceso de dos pasos: primero, un especialista en pruebas crea una plantilla llamada modelo de ítem; luego, se desarrolla un algoritmo informático para generar los ítems de prueba. [ 2 ] Así, en lugar de que un especialista en pruebas escriba cada ítem individualmente, los algoritmos informáticos generan familias de ítems a partir de un conjunto más pequeño de modelos de ítems padres. [ 3 ] [ 4 ] [ 5 ] Más recientemente, las redes neuronales , incluidos los modelos de lenguaje grandes , como la familia GPT , se han utilizado con éxito para generar ítems automáticamente. [ 6 ] [ 7 ]
Contexto
En las pruebas psicológicas , las respuestas del examinado a los ítems de la prueba proporcionan datos de medición objetivos para una variedad de características humanas. [ 8 ] Algunas características medidas por las pruebas psicológicas y educativas incluyen habilidades académicas, rendimiento escolar, inteligencia , motivación , etc., y estas pruebas se utilizan con frecuencia para tomar decisiones que tienen consecuencias significativas en individuos o grupos de individuos. Lograr estándares de calidad de medición, como la validez de la prueba , es uno de los objetivos más importantes para psicólogos y educadores. [ 9 ] AIG es un enfoque para el desarrollo de pruebas que puede utilizarse para mantener y mejorar la calidad de las pruebas de manera económica en el entorno contemporáneo donde las pruebas computarizadas han aumentado la necesidad de un gran número de ítems de prueba. [ 5 ]
Beneficios
AIG reduce el costo de producir pruebas estandarizadas , [ 10 ] ya que los algoritmos pueden generar muchos más ítems en un tiempo determinado que un especialista humano en pruebas. Puede crear de forma rápida y sencilla formas de prueba paralelas, lo que permite que diferentes examinados estén expuestos a diferentes grupos de ítems de prueba con el mismo nivel de complejidad o dificultad, mejorando así la seguridad de la prueba. [ 3 ] Cuando se combina con pruebas adaptativas computarizadas , AIG puede generar nuevos ítems o seleccionar qué ítems ya generados deben administrarse a continuación según la capacidad del examinado durante la administración de la prueba. También se espera que AIG produzca ítems con un amplio rango de dificultad, menos errores en la construcción y permita una mayor comparabilidad de los ítems debido a una definición más sistemática del modelo de ítem prototípico. [ 3 ] [ 11 ] [ 12 ]
Radicales, incidentales e isomorfos
El desarrollo de pruebas (incluidas las AIG) puede enriquecerse si se basa en alguna teoría cognitiva. Los procesos cognitivos derivados de una teoría determinada suelen relacionarse con las características de los ítems durante su construcción. El objetivo es predeterminar un parámetro psicométrico específico, como la dificultad del ítem (en adelante: β ). Consideremos radicales [ 11 ] aquellos elementos estructurales que afectan significativamente los parámetros del ítem y le confieren ciertos requisitos cognitivos. Uno o más radicales del modelo del ítem pueden manipularse para generar modelos de ítems padres con diferentes niveles de parámetros (p. ej., β ). Cada padre puede entonces crear su propia familia manipulando otros elementos que Irvine [ 11 ] denominó incidentales . Los incidentales son características superficiales que sufren variaciones aleatorias entre ítems dentro de la misma familia. Los ítems que tienen la misma estructura de radicales y solo difieren en los incidentales suelen denominarse isomorfos [ 13 ] o clones . [ 14 ] [ 15 ]
There can be two kinds of item cloning: On the one hand, the item model may consist of an item with one or more open places, and cloning is done by filling each place with an element selected from a list of possibilities. On the other hand, the item model could be an intact item which is cloned by introducing transformations, for example changing the angle of an object of spatial ability tests.[16] The variation of these items' surface characteristics should not significantly influence the testee's responses. This is the reason why it is believed that incidentals produce only slight differences among the item parameters of the isomorphs.[3]
Current developments
A number of item generators have been subjected to objective validation testing.
MathGen is a program that generates items to test mathematical achievement. In a 2018 article for the Journal of Educational Measurement, authors Embretson and Kingston conducted an extensive qualitative review and empirical try-outs to evaluate the qualitative and psychometric properties of generated items, concluding that the items were successful and that items generated from the same item structure had predictable psychometric properties.[17][18]
A test of melodic discrimination developed with the aid of the computational model Rachman-Jun 2015[19] was administered to participants in a 2017 trial. According to the data collected by P.M. Harrison et al., results demonstrate strong validity and reliability.[20]
Ferreyra and Backhoff-Escudero[21] generated two parallel versions of the Basic Competences Exam (Excoba), a general test of educational skills, using a program they developed called GenerEx. They then studied the internal structure as well as the psychometric equivalence of the created tests. Empirical results of psychometric quality are favorable overall, and the tests and items are consistent as measured by multiple psychometric indices.
Gierl and his colleagues[22][23][24][25] used an AIG program called the Item Generator (IGOR[26]) to create multiple-choice items that test medical knowledge. IGOR-generated items, even when compared to manually-designed items, showed good psychometric properties.
Arendasy, Sommer y Mayr [ 27 ] utilizaron AIG para crear ítems verbales que evaluaran la fluidez verbal en alemán e inglés, administrándolos a participantes germanohablantes e angloparlantes, respectivamente. Los ítems generados por computadora mostraron propiedades psicométricas aceptables. Los conjuntos de ítems administrados a estos dos grupos se basaron en un conjunto común de ítems de referencia interlingüísticos, lo que facilitó las comparaciones translingüísticas del desempeño.
Holling, Bertling y Zeuch [ 28 ] utilizaron la teoría de la probabilidad para generar automáticamente problemas matemáticos verbales con dificultades esperadas. Lograron un ajuste del modelo Rasch [ 29 ] y las dificultades de los ítems pudieron explicarse mediante el modelo de prueba logística lineal (LLTM [ 30 ] ), así como mediante el LLTM de efectos aleatorios. Holling, Blank, Kuchenbäcker y Kuhn [ 31 ] realizaron un estudio similar con problemas verbales estadísticos pero sin utilizar AIG. Arendasy y sus colegas [ 32 ] [ 33 ] presentaron estudios sobre problemas verbales de álgebra generados automáticamente y examinaron cómo un marco de control de calidad de AIG puede afectar la calidad de medición de los ítems.
Generación automática de elementos figurativos

El Item Maker (IMak) es un programa escrito en el lenguaje de programación R para la representación gráfica de ítems de analogía figurativa. Se encontró que las propiedades psicométricas de 23 ítems generados por IMak eran satisfactorias, y la dificultad de los ítems basada en la generación de reglas pudo predecirse mediante el modelo de prueba logística lineal (LLTM). [ 3 ] [ 34 ] Investigaciones posteriores confirmaron la alta consistencia interna de los ítems generados. [ 35 ] [ 36 ] [ 37 ]
MazeGen es otro programa codificado en R que genera laberintos automáticamente. Se encontró que las propiedades psicométricas de 18 de estos laberintos eran óptimas, incluyendo el ajuste del modelo Rasch y la predicción de la dificultad del laberinto mediante LLTM. [ 38 ]
GeomGen es un programa que genera matrices figurativas. [ 39 ] Un estudio que identificó fuentes de sesgo de medición relacionadas con estrategias de eliminación de respuestas para ítems de matriz figurativa concluyó que la prominencia del distractor favorece la búsqueda de estrategias de eliminación de respuestas y que este conocimiento podría incorporarse a AIG para mejorar la validez de constructo de dichos ítems. [ 40 ] El mismo grupo utilizó AIG para estudiar el funcionamiento diferencial de los ítems (DIF) y las diferencias de género asociadas con la rotación mental . Manipularon características de diseño de ítems que han exhibido DIF de género en estudios previos, y mostraron que las estimaciones del tamaño del efecto de las diferencias de género se vieron comprometidas por la presencia de diferentes tipos de DIF de género que podrían estar relacionados con características específicas de diseño de ítems. [ 41 ] [ 42 ]
Arendasy también estudió posibles violaciones de la calidad psicométrica identificadas mediante la teoría de respuesta al ítem (TRI) de ítems de razonamiento visuoespacial generados automáticamente. Para ello, presentó dos programas: GeomGen [ 39 ] y Endless Loop Generator (EsGen), ya mencionados. Concluyó que GeomGen era más adecuado para AIG porque los principios de la TRI se pueden incorporar durante la generación de ítems [ 43 ] . En un proyecto de investigación paralelo que utilizó GeomGen, Arendasy y Sommer [ 44 ] encontraron que la variación de la organización perceptiva de los ítems podía influir en el rendimiento de los encuestados según sus niveles de habilidad y que tenía un efecto en varios índices de calidad psicométrica. Con estos resultados, cuestionaron el supuesto de unidimensionalidad de los ítems de matriz figurativa en general.
MatrixDeveloper [ 45 ] se utilizó para generar automáticamente veinticinco ítems de matriz cuadrada de 4x4 . Estos ítems se administraron a 169 individuos. Según los resultados de la investigación, los ítems muestran un buen ajuste al modelo de Rasch , y la generación basada en reglas puede explicar la dificultad de los ítems. [ 46 ]
El primer generador de matrices de ítems conocido fue diseñado por Embretson, [ 47 ] [ 14 ] y sus ítems generados automáticamente demostraron buenas propiedades psicométricas, como lo muestran Embretson y Reise. [ 48 ] También propuso un modelo para la generación adecuada de ítems en línea.
Referencias
- ↑ Bormuth, J. (1969). Sobre una teoría de los ítems de las pruebas de rendimiento . Chicago, IL: University of Chicago Press. ISBN 9780226066301.
- ↑ Gierl, MJ; Haladyna, TM (2012). Generación automática de ítems: teoría y práctica . Nueva York, NY: Routledge Chapman & Hall. ISBN 9780415897518.
- 1 2 3 4 5 Blum, Diego; Holling, Heinz (6 de agosto de 2018). " Generación automática de analogías figurativas con el paquete IMak" . Frontiers in Psychology . 9 1286. doi : 10.3389/fpsyg.2018.01286 . PMC 6087760. PMID 30127757 .
El material fue copiado de esta fuente, que está disponible bajo una licencia Creative Commons Attribution 4.0 International . - ↑ Glas, CAW; van der Linden, WJ; Geerlings, H. (2010). "Estimación de los parámetros en un modelo de clonación de ítems para pruebas adaptativas". En van der Linden, WJ; Glas, CAW (eds.). Elementos de las pruebas adaptativas (PDF) . pp. 289–314 . doi : 10.1007/978-0-387-85461-8_15 . ISBN 978-0-387-85459-5Archivado (PDF) del original el 15 de septiembre de 2024 .
- 1 2 Gierl, MJ; Lai, H. (2012). "El papel de los modelos de ítems en la generación automática de ítems" . International Journal of Testing . 12 (3): 273– 298. doi : 10.1080/15305058.2011.635830 .
- ↑ von Davier, M. (2018). "Generación automatizada de ítems con redes neuronales recurrentes". Psychometrika . 83 (4): 847– 857. doi : 10.1007/s11336-018-9608-y . PMID 29532403 .
- ↑ Yaneva, V.; von Davier, M., eds. (2023). Avances en el procesamiento del lenguaje natural en la evaluación educativa (1.ª ed.). Routledge. doi : 10.4324/9781003278658 . ISBN 9781003278658.
- ↑ Van der Linden, WJ; Hambleton, RK (1997). «Teoría de respuesta al ítem: una breve historia, modelos comunes y extensiones». En Hambleton, RK; van der Linden, WJ (eds.). Manual de la teoría moderna de respuesta al ítem . Nueva York: Springer. pp. 1–31 . ISBN 0-387-94661-6.
- ↑ Embretson, SE (1999). «Cuestiones en la medición de las habilidades cognitivas». En Embretson, SE; Hershberger, SL (eds.). Las nuevas reglas de la medición . Mahwah: Lawrence Erlbaum Associates. pp. 1–15 . doi : 10.4324/9781410603593 . ISBN 9781410603593.
- ↑ Rudner, L. (2010). "Implementación de la prueba adaptativa computarizada del Graduate Management Admission Test". En van der Linden, WJ; Glas, CAW (eds.). Elementos de las pruebas adaptativas . págs. 151–165 . doi : 10.1007/978-0-387-85461-8_15 .
- 1 2 3 Irvine, S. (2002). "Los fundamentos de la generación de ítems para pruebas masivas" . En Irvine, SH; Kyllonen, PC (eds.). Generación de ítems para el desarrollo de pruebas . Mahwah: Lawrence Erlbaum Associates. pp. 3–34 . ISBN 9781138973473.
- ↑ Lai, H.; Alves, C.; Gierl, MJ (2009). Weiss, DJ (ed.). Uso de la generación automática de ítems para abordar las demandas de ítems para CAT (PDF) . Actas de la Conferencia GMAC de 2009 sobre Pruebas Adaptativas Computarizadas. Archivado del original (PDF) el 28 de abril de 2024.
- ↑ Bejar, II (2002). «Pruebas generativas: de la concepción a la implementación». En Irvine, SH; Kyllonen, PC (eds.). Generación de ítems para el desarrollo de pruebas . Mahwah, NJ: Lawrence Erlbaum Associates. pp. 199–217 . ISBN 9781138973473.
- 1 2 Embretson, SE (1999). "Generación de ítems durante las pruebas: problemas psicométricos y modelos" . Psychometrika . 64 (4): 407– 433. doi : 10.1007/BF02294564 .
- ↑ Arendasy, ME; Sommer, M. (2012). "Uso de la generación automática de ítems para satisfacer las crecientes demandas de ítems de la evaluación educativa y ocupacional de alto impacto". Aprendizaje y diferencias individuales . 22 : 112–117 . doi : 10.1016/j.lindif.2011.11.005 .
- ↑ Glas, CAW; van der Linden, WJ (2003). "Pruebas adaptativas computarizadas con clonación de ítems" . Medición psicológica aplicada . 27 (4): 247– 261. doi : 10.1177/0146621603027004001 .
- ↑ Embretson, SE; Kingston, NM (2018). "Generación automática de ítems: ¿un proceso más eficiente para desarrollar ítems de rendimiento matemático?". Journal of Educational Measurement . 55 (1): 112– 131. doi : 10.1111/jedm.12166 .
- ↑ Willson, J.; Morrison, K.; Embretson, SE (2014). Generador automático de ítems para pruebas de rendimiento matemático: MathGen3.0. Informe técnico IES1005A-2014 para la subvención R305A100234 del Instituto de Ciencias de la Educación (Informe). Atlanta, GA: Laboratorio de Medición Cognitiva, Instituto Tecnológico de Georgia.
- ↑ Collins, T.; Laney, R.; Willis, A.; Garthwaite, PH (2016). "Desarrollo y evaluación de modelos computacionales de estilo musical". Inteligencia artificial para el diseño, análisis y fabricación en ingeniería . 30 : 16–43 . doi : 10.1017/S0890060414000687 .
- ↑ Harrison, PM; Collins, T.; Müllensiefen, D. (2017). "Aplicación de técnicas psicométricas modernas a las pruebas de discriminación melódica: teoría de respuesta al ítem, pruebas adaptativas computarizadas y generación automática de ítems" . Scientific Reports . 7 (3618): 1– 18. Bibcode : 2017NatSR...7.3618H . doi : 10.1038/s41598-017-03586-z . PMC 5472621. PMID 28620165 .
- ^ Ferreyra, MF; Backhoff-Escudero, E. (2016). «Validez del Generador Automático de Ítems del Examen de Competencias Básicas (Excoba)» . Relevar (en español e inglés). 22 (1): art. 2, 1– 16. doi : 10.7203/relieve.22.1.8048 .
- ↑ Gierl, MJ; Lai, H.; Pugh, D.; Touchie, C.; Boulais, AP; De Champlain, A. (2016). "Evaluación de las características psicométricas de los ítems de prueba de opción múltiple generados". Applied Measurement in Education . 29 (3): 196– 210. doi : 10.1080/08957347.2016.1171768 .
- ↑ Lai, H.; Gierl, MJ; Byrne, BE; Spielman, AI; Waldschmidt, DM (2016). "Tres aplicaciones de modelado para promover la generación automática de ítems para exámenes en odontología". Journal of Dental Education . 80 (3): 339– 347. doi : 10.1002/j.0022-0337.2016.80.3.tb06090.x . PMID 26933110 .
- ↑ Gierl, MJ; Lai, H. (2013). "Evaluación de la calidad de los ítems médicos de opción múltiple creados con procesos automatizados". Educación Médica . 47 (7): 726– 733. doi : 10.1111/medu.12202 . PMID 23746162 .
- ↑ Gierl, MJ; Lai, H.; Turner, SR (2012). "Uso de la generación automática de ítems para crear ítems de prueba de opción múltiple" . Educación Médica . 46 (8): 757– 765. doi : 10.1111/j.1365-2923.2012.04289.x . PMID 22803753 .
- ↑ Gierl, MJ; Zhou, J.; Alves, C. (2008). "Desarrollo de una taxonomía de tipos de modos de ítems para promover la ingeniería de evaluación" . J Technol Learn Assess . 7 (2): 1– 51. Archivado del original el 1 de febrero de 2025.
- ↑ Arendasy, ME; Sommer, M.; Mayr, F. (2011). "Uso de la generación automática de ítems para construir simultáneamente versiones en alemán e inglés de una prueba de fluidez verbal". Journal of Cross-Cultural Psychology . 43 (3): 464– 479. doi : 10.1177/0022022110397360 .
- ↑ Holling, H.; Bertling, JP; Zeuch, N. (2009). "Generación automática de ítems de problemas verbales de probabilidad". Estudios en Evaluación Educativa . 35 ( 2– 3): 71– 76. doi : 10.1016/j.stueduc.2009.10.004 .
- ↑ Rasch, G. (1980) [1960]. Modelos probabilísticos para algunas pruebas de inteligencia y rendimiento . Chicago: University of Chicago Press.
- ↑ Fischer, GH (1973). "El modelo de prueba logística lineal como instrumento de investigación educativa" . Acta Psychologica . 37 (6): 359– 374. doi : 10.1016/0001-6918(73)90003-6 .
- ↑ Holling, H.; Blank, H.; Kuchenbäcker, K.; Kuhn, JT (2008). "Diseño de ítems basado en reglas para problemas estadísticos verbales: una revisión y primera implementación" (PDF) . Psychology Science Quarterly . 50 (3): 363–378 . Archivado (PDF) del original el 12 de diciembre de 2024.
- ↑ Arendasy, ME; Sommer, M.; Gittler, G.; Hergovich, A. (2006). "Generación automática de ítems de razonamiento cuantitativo. Un estudio piloto" . Journal of Individual Differences . 27 (1): 2– 14. doi : 10.1027/1614-0001.27.1.2 .
- ↑ Arendasy, ME; Sommer, M. (2007). "Uso de tecnología psicométrica en la evaluación educativa: el caso de un enfoque isomórfico basado en esquemas para la generación automática de ítems de razonamiento cuantitativo". Aprendizaje y diferencias individuales . 17 (4): 366– 383. doi : 10.1016/j.lindif.2007.03.005 .
- ↑ Yang, Yuan; Kunda, Mathilee (8 de febrero de 2023). "Modelos computacionales para resolver matrices progresivas de Raven: una introducción completa". arXiv : 2302.04238v1 [ cs.AI ].
- ↑ Fu, Jingcheng; Zhang, Xing; Zhong, Songfa (29 de septiembre de 2023). "Reglas de puntuación basadas en cobertura para preguntas de opción múltiple". SSRN 4009983 .
- ↑ Myszkowski, N.; Storme, M.; Kubiak, E.; Baron, S. (2022). "Explorando las asociaciones entre la personalidad y las trayectorias de velocidad de respuesta en pruebas de inteligencia de bajo riesgo". Personality and Individual Differences . 191 (111580): 1– 9. doi : 10.1016/j.paid.2022.111580 .
- ↑ von Gugelberg, HM; Schweizer, K.; Troche, SJ (2025). "Evidencia experimental del aprendizaje de reglas como la fuente subyacente del efecto de la posición del ítem en las medidas de capacidad de razonamiento" . Aprendizaje y diferencias individuales . 118 (102622) 102622: 1– 11. doi : 10.1016/j.lindif.2024.102622 .
- ↑ Loe, BS; Rust, J. (2017). "Revisión de la prueba del laberinto perceptivo: evaluación de la dificultad de los laberintos generados automáticamente". Assessment . 26 (8): 1– 16. doi : 10.1177/1073191117746501 . PMID 29239208 .
- ^ Arendasy , M. (2002). Geom-Gen-Ein Itemgenerator für Matrizentestaufgaben (en alemán). Viena: Eigenverlag.
- ↑ Arendasy, ME; Sommer, M. (2013). "Reducir las estrategias de eliminación de respuestas mejora la validez de constructo de las matrices figurativas". Intelligence . 41 (4): 234– 243. doi : 10.1016/j.intell.2013.03.006 .
- ↑ Arendasy, ME; Sommer, M. (2010). "Evaluación de la contribución de diferentes características de los ítems al tamaño del efecto de la diferencia de género en la rotación mental tridimensional mediante la generación automática de ítems". Intelligence . 38 (6): 574– 581. doi : 10.1016/j.intell.2010.06.004 .
- ↑ Arendasy, ME; Sommer, M.; Gittler, G. (2010). "Combinación de generación automática de ítems y diseños experimentales para investigar la contribución de los componentes cognitivos a la diferencia de género en la rotación mental". Intelligence . 38 (5): 506– 512. doi : 10.1016/j.intell.2010.06.006 .
- ↑ Arendasy, M. (2005). "Generación automática de ítems calibrados con Rasch: prueba de matrices figurativas GEOM y prueba de bucles infinitos EC". International Journal of Testing . 5 (3): 197– 224. doi : 10.1207/s15327574ijt0503_2 .
- ↑ Arendasy, ME; Sommer, M. (2005). "El efecto de diferentes tipos de manipulaciones perceptivas en la dimensionalidad de matrices figurativas generadas automáticamente". Intelligence . 33 (3): 307– 324. doi : 10.1016/j.intell.2005.02.002 .
- ^ Hofer, S. (2004). Desarrollador Matrix . Münster, Alemania: Instituto Psicológico IV. Westfälische Wilhelms-Universität.
- ↑ Freund, PA; Hofer, S.; Holling, H. (2008). "Explicación y control de las propiedades psicométricas de los ítems de matriz figurativa generados por computadora". Medición psicológica aplicada . 32 (3): 195– 210. doi : 10.1177/0146621607306972 .
- ↑ Embretson, SE (1998). "Un enfoque de sistema de diseño cognitivo para generar pruebas válidas: aplicación al razonamiento abstracto". Métodos Psicológicos . 3 (3): 380– 396. doi : 10.1037/1082-989X.3.3.380 .
- ↑ Embretson, SE; Reise, SP (2000). Teoría de respuesta al ítem para psicólogos . Mahwah: Lawrence Erlbaum Associates. doi : 10.4324/9781410605269 . ISBN 978-0805828191.
- Psicometría