Articulo de referencia

Estudio de establecimiento de estándares

Un estudio de estandarización es una investigación oficial realizada por una organización que patrocina pruebas para determinar un puntaje de corte. Para que sea legalmente váli...

Un estudio de estandarización es una investigación oficial realizada por una organización que patrocina pruebas para determinar un puntaje de corte. Para que sea legalmente válido en los EE. UU., especialmente en evaluaciones de alto impacto , y cumpla con los Estándares para Pruebas Educativas y Psicológicas , un puntaje de corte no puede determinarse arbitrariamente; debe estar justificado empíricamente. Por ejemplo, la organización no puede simplemente decidir que el puntaje de corte será del 70 % de respuestas correctas. En cambio, se realiza un estudio para determinar qué puntaje diferencia mejor las clasificaciones de los examinados, como competentes e incompetentes. Estos estudios requieren una cantidad considerable de recursos e involucran a varios profesionales, en particular con experiencia en psicometría. Por esta razón, los estudios de estandarización no son prácticos en situaciones de aula regulares; sin embargo, en todos los niveles educativos, se realiza la estandarización y existen múltiples métodos.

Los estudios de estandarización suelen realizarse con grupos focales de entre 5 y 15 expertos en la materia que representan a las partes interesadas clave para la prueba. Por ejemplo, al establecer puntuaciones de corte para las pruebas educativas, los expertos podrían ser profesores familiarizados con las capacidades del alumnado que se somete a la prueba.

Tipos de estudios de establecimiento de estándares

Los estudios de estandarización se dividen en dos categorías: centrados en ítems y centrados en personas. Ejemplos de métodos centrados en ítems incluyen los métodos de Angoff, Ebel, Nedelsky, [ 1 ] Bookmark e ID Matching, mientras que ejemplos de métodos centrados en personas incluyen los enfoques de Borderline Survey y Contrasting Groups. Estos se clasifican según el enfoque del análisis; en los estudios centrados en ítems, la organización evalúa los ítems con respecto a una población determinada de personas, y viceversa para los estudios centrados en personas.

Los estudios centrados en ítems están relacionados con las pruebas referenciadas a criterios y con las pruebas referenciadas a normas .

Estudios centrados en ítems

  • Método Angoff [ 2 ] (centrado en el ítem): Este método requiere la formación de un grupo de expertos en la materia (SME), a quienes se les pide que evalúen cada ítem y estimen la proporción de examinados mínimamente competentes que responderían correctamente al ítem. Las calificaciones se promedian entre los evaluadores para cada ítem y luego se suman para obtener una puntuación de corte bruta recomendada por el panel. Esta puntuación de corte representa la puntuación que el panel estima que obtendría un candidato mínimamente competente. Esto, por supuesto, está sujeto a sesgos de decisión, como el sesgo de exceso de confianza . Es preferible la calibración con otras fuentes de datos más objetivas. Existen varias variantes del método.
  • Método Angoff modificado (centrado en el ítem): Los expertos en la materia generalmente reciben instrucciones sobre el método Angoff y se les permite realizar la prueba teniendo en cuenta los niveles de rendimiento. Luego se les pide a los expertos que proporcionen estimaciones para cada pregunta de la proporción de participantes límite o "mínimamente aceptables" que esperarían que respondieran correctamente la pregunta. Las estimaciones generalmente se presentan en forma de valor p (por ejemplo, 0,6 para el ítem 1: el 60 % de los participantes que aprueban límite responderían correctamente esta pregunta). Generalmente se realizan varias rondas en las que se permite a los expertos modificar sus estimaciones en función de diferentes tipos de información (por ejemplo, información sobre el rendimiento real de los participantes en cada pregunta, estimaciones de otros expertos, etc.). Luego se realiza la determinación final del puntaje de corte (por ejemplo, promediando las estimaciones o tomando la mediana), que a menudo se documenta en un informe junto con resultados secundarios como la confiabilidad entre evaluadores o el compromiso de Beuk. Normalmente se utilizan programas de software para calcular estos. [ 3 ] Este método generalmente se utiliza con preguntas de opción múltiple.
  • Método Angoff modificado dicotómico (centrado en el ítem): En el enfoque Angoff modificado dicotómico, en lugar de utilizar estadísticas de nivel de dificultad (normalmente valores p), se pide a los expertos en la materia que simplemente proporcionen un 0/1 para cada pregunta ("0" si un participante aceptable en el límite respondería mal la pregunta y "1" si un participante aceptable en el límite respondería correctamente el ítem).
  • Método de Nedelsky (centrado en el ítem): Los expertos toman decisiones pregunta por pregunta sobre cuáles de las opciones de respuesta incorrectas consideran que los participantes con un nivel de respuesta límite podrían descartar. Este método se utiliza generalmente solo con preguntas de opción múltiple.
  • Método de marcadores (centrado en el ítem): Los ítems de una prueba (o un subconjunto representativo de ítems) se ordenan por dificultad (por ejemplo, valor de probabilidad de respuesta de la TRI) del más fácil al más difícil. Los expertos colocan un "marcador" en el "cuadernillo de ítems ordenados" de manera que se espera que un estudiante en el umbral de un nivel de desempeño responda correctamente a los ítems anteriores al marcador con una probabilidad igual o superior al valor de probabilidad de respuesta especificado (y con una probabilidad inferior a ese valor para los ítems posteriores al marcador). Por ejemplo, para una probabilidad de respuesta de 0,67 (RP67), los expertos en la materia colocarían un marcador de tal manera que un examinado en el umbral del nivel de rendimiento tendría al menos una probabilidad de éxito de 2/3 en los ítems anteriores al marcador y menos de una probabilidad de éxito de 2/3 en los ítems posteriores al marcador. Este método se considera eficiente con respecto al establecimiento de múltiples puntuaciones de corte en una sola prueba y puede utilizarse con pruebas compuestas por varios tipos de ítems (p. ej., opción múltiple, respuesta constructiva, etc.). [ 4 ] [ 5 ] [ 6 ]
  • Coincidencia de descriptores de ítems (ID) [ 7 ] (centrada en el ítem): La coincidencia de ID (a) combina las ventajas del método Bookmark; es decir, el libro de ítems ordenados y la información sobre la dificultad empírica del ítem transmitida en ese ordenamiento; y (b) hipotetiza una menor complejidad cognitiva y carga cognitiva de otros métodos; es decir, no se requieren juicios de probabilidad propensos a errores; [ 8 ] hacer coincidir las características de los ítems con las características de las descripciones del nivel de logro, lo cual es muy adecuado para las personas en general, [ 9 ] y particularmente para el conocimiento y la experiencia de los educadores; y no es necesario tener en mente a un examinado límite al hacer el juicio de la puntuación de corte.

Estudios centrados en la persona

En lugar de centrarse en los elementos que distinguen a los candidatos competentes, los estudios centrados en la persona evalúan a los propios examinados. Si bien esto podría parecer más apropiado, suele ser más difícil, ya que los examinados no constituyen una población cautiva, como sí lo es una lista de ítems. Por ejemplo, si se lanza una nueva prueba sobre un contenido novedoso (como suele ocurrir en las pruebas de tecnología de la información ), esta podría administrarse a una muestra inicial, denominada muestra beta, junto con una encuesta sobre características profesionales. La organización encargada de la prueba podría entonces analizar y evaluar la relación entre las puntuaciones obtenidas y estadísticas importantes, como habilidades, formación y experiencia. El puntaje de corte podría establecerse como el que mejor diferencie entre los examinados considerados "aprobadores" y los considerados "suspensos".

  • Método de grupos límite (centrado en la persona): Se prepara una descripción para cada categoría de desempeño. Se solicita a las PYME que presenten una lista de participantes cuyo desempeño en la prueba debería ser cercano al estándar (límite). La prueba se administra a estos grupos límite y la mediana de las puntuaciones se utiliza como punto de corte. Este método puede utilizarse con prácticamente cualquier tipo de pregunta (p. ej., opción múltiple , respuesta múltiple, ensayo , etc.).
  • Método de grupos contrastantes (centrado en la persona): Se solicita a los expertos en la materia que clasifiquen a los participantes de sus clases según las descripciones de las categorías de desempeño. Se administra la prueba a todos los participantes clasificados y se comparan las distribuciones de las puntuaciones de cada grupo. El punto de corte se ubica en la intersección de las distribuciones de los grupos contrastantes. Este método puede utilizarse con prácticamente cualquier tipo de pregunta (por ejemplo, de opción múltiple, de respuesta múltiple, de ensayo, etc.).

Referencias

  1. Nedelsky, L. (1954). Estándares de calificación absolutos para pruebas objetivas. Educational and Psychological Measurement, 14, 3–19.
  2. Zieky, MJ (2001). Mucho ha cambiado: cómo ha evolucionado la fijación de puntuaciones de corte desde la década de 1980. En Cizek, GJ (Ed.), Setting Performance Standards , págs. 19-52. Mahwah, NJ: Lawrence Erlbaum Associates.
  3. Assessment Systems Corporation: Herramienta de análisis Angoff (software gratuito). https://assess.com/angoff-analysis-tool/
  4. Lewis, DM, Mitzel, HC, Green, DR (junio de 1996). Establecimiento de estándares: un enfoque de marcadores. En DR Green (presidente), Procedimientos de establecimiento de estándares basados ​​en la IRT que utilizan anclaje conductual. Ponencia presentada en la Conferencia Nacional de Evaluación a Gran Escala del Consejo de Directores de Educación Estatales de 1996, Phoenix, AZ.
  5. Mitzel, HC, Lewis, DM, Patz, RJ y Green, DR (2000). El procedimiento de marcadores: perspectivas cognitivas sobre el establecimiento de estándares. Capítulo en Establecimiento de estándares de desempeño: conceptos, métodos y perspectivas (GJ Cizek, ed.). Mahwah, NJ: Lawrence Erlbaum Associates.
  6. Lewis, DM, Mitzel, HC, Mercado, RL y Schulz, EM (2012). El procedimiento de establecimiento de estándares Bookmark. Capítulo en Establecimiento de estándares de desempeño: fundamentos, métodos e innovaciones, segunda edición (GJ Cizek, ed.). Mahwah, NJ: Lawrence Erlbaum Associates.
  7. Ferrara, S., & Lewis, D. (2012). El método de correspondencia ítem-descriptor (ID). En GJ Cizek (Ed.), Establecimiento de estándares de desempeño: Fundamentos, métodos e innovaciones (2.ª ed., pp. 255-282).
  8. Nickerson, RS (2005). Cognición y azar: La psicología del razonamiento probabilístico. Mahwah, NJ: Lawrence Erlbaum Associates.
  9. Murphy, GL (2002). El gran libro de conceptos. Cambridge, MA: The MIT Press