El funcionamiento diferencial de los ítems ( DIF , por sus siglas en inglés) es una propiedad estadística de un ítem de prueba que indica la probabilidad de que individuos de distintos grupos, con habilidades similares, respondan de manera diferente al ítem. Se manifiesta cuando individuos de diferentes grupos, con niveles de habilidad comparables, no tienen la misma probabilidad de responder correctamente a una pregunta. Existen dos tipos principales de DIF: DIF uniforme , donde un grupo tiene consistentemente una ventaja sobre el otro, y DIF no uniforme , donde la ventaja varía según el nivel de habilidad del individuo. [ 1 ]
La presencia de DIF requiere revisión y juicio, pero no siempre significa sesgo. El análisis de DIF proporciona una indicación del comportamiento inesperado de los ítems en una prueba. La característica DIF de un ítem no está determinada únicamente por las probabilidades variables de seleccionar una respuesta específica entre individuos de diferentes grupos. Más bien, el DIF se hace pronunciado cuando individuos de diferentes grupos, que poseen la misma habilidad subyacente real , exhiben diferentes probabilidades de dar una respuesta determinada. Incluso cuando hay un sesgo uniforme, los desarrolladores de pruebas a veces recurren a suposiciones como que los sesgos de DIF pueden compensarse entre sí debido al extenso trabajo requerido para abordarlo, lo que compromete la ética de las pruebas y perpetúa los sesgos sistémicos. [ 2 ]
Los procedimientos comunes para evaluar el DIF son el procedimiento de Mantel-Haenszel , la regresión logística , los métodos basados en la teoría de respuesta al ítem (TRI) y los métodos basados en el análisis factorial confirmatorio (AFC). [ 3 ]
Descripción
El DIF se refiere a las diferencias en el funcionamiento de los ítems entre grupos, a menudo demográficos, que coinciden en el rasgo latente o, más generalmente, en el atributo que miden los ítems o la prueba. [ 4 ] [ 5 ] Es importante tener en cuenta que, al examinar los ítems para detectar DIF, los grupos deben coincidir en el atributo medido; de lo contrario, esto podría resultar en una detección inexacta del DIF.
Para crear una comprensión general del DIF o sesgo de medición, considere el siguiente ejemplo ofrecido por Osterlind y Everson (2009). [ 6 ] En este caso,se refiere a una respuesta a un ítem de prueba particular que está determinada por el constructo latente que se está midiendo. El constructo latente de interés se denomina theta () dóndees un indicador deque se pueden organizar en términos de la distribución de probabilidad deenpor la expresiónPor lo tanto, respuestaes condicional al rasgo latente ().
Debido a que DIF examina las diferencias en las probabilidades condicionales deentre grupos, etiquetemos los grupos como grupos de " referencia " y "focales". Aunque la designación no importa, una práctica típica en la literatura es designar al grupo de referencia como el grupo que se sospecha que tiene una ventaja, mientras que el grupo focal se refiere al grupo que se prevé que se verá perjudicado por la prueba. [ 4 ] Por lo tanto, dada la relación funcionaly bajo el supuesto de que existen distribuciones de error de medición idénticas para los grupos de referencia y focales, se puede concluir que bajo la hipótesis nula : concorrespondiente a la variable de agrupación,el grupo de referencia yel grupo focal.
Esta ecuación representa un caso en el que no hay DIF. En este caso, la ausencia de DIF está determinada por el hecho de que la distribución de probabilidad condicional deno depende de la pertenencia a un grupo. Para ilustrarlo, consideremos un elemento con opciones de respuesta.y, dóndeindica una respuesta incorrecta yIndica una respuesta correcta. La probabilidad de responder correctamente a un ítem es la misma para los miembros de ambos grupos. Esto indica que no existe DIF ni sesgo en los ítems, ya que los miembros del grupo de referencia y del grupo focal con la misma habilidad o atributo subyacente tienen la misma probabilidad de responder correctamente. Por lo tanto, no existe sesgo ni desventaja para un grupo sobre el otro.
Consideremos el caso en el que la probabilidad condicional deno es lo mismo para los grupos de referencia y focales. En otras palabras, los miembros de diferentes grupos con el mismo rasgo o nivel de habilidad tienen distribuciones de probabilidad desiguales en. Una vez controlando por, existe una clara dependencia entre la pertenencia al grupo y el rendimiento en un ítem. Para los ítems dicotómicos , esto sugiere que cuando los grupos focal y de referencia están en la misma ubicación enExiste una probabilidad diferente de obtener una respuesta correcta o de respaldar un ítem. Por lo tanto, el grupo con la mayor probabilidad condicional de responder correctamente a un ítem es el que se ve beneficiado por dicho ítem. Esto sugiere que el ítem está sesgado y funciona de manera diferente para cada grupo, lo que indica un DIF (funcionamiento diferencial del ítem).
Es importante establecer la distinción entre DIF o sesgo de medición y diferencias grupales ordinarias. Mientras que las diferencias grupales indican diferentes distribuciones de puntuación en, DIF implica explícitamente el condicionamiento enPor ejemplo, consideremos la siguiente ecuación: Esto indica que la puntuación de un examinado está condicionada a la agrupación, de modo que tener información sobre la pertenencia a un grupo cambia la probabilidad de una respuesta correcta. Por lo tanto, si los grupos difieren eny el rendimiento depende de, entonces la ecuación anterior sugeriría sesgo de ítem incluso en ausencia de DIF. Por esta razón, en la literatura sobre medición se acepta generalmente que las diferencias enCondicionar la pertenencia al grupo únicamente es inadecuado para establecer el sesgo. [ 7 ] [ 8 ] [ 9 ]
De hecho, las diferencias eno la capacidad son comunes entre los grupos y establecen la base para mucha investigación. Recuerde que para establecer el sesgo o DIF, los grupos deben estar emparejados eny luego demostrar probabilidades diferenciales enen función de la pertenencia al grupo.
Formularios
El DIF uniforme es el tipo más simple de DIF donde la magnitud de la dependencia condicional es relativamente invariante a lo largo del continuo de rasgos latentes (El elemento en cuestión proporciona sistemáticamente una ventaja a un grupo en todos los niveles de habilidad.. [ 10 ] Dentro de un marco de teoría de respuesta al ítem (TRI), esto se evidenciaría cuando ambas curvas características del ítem (CCI) son igualmente discriminatorias pero exhiben diferencias en los parámetros de dificultad (es decir,y) como se muestra en la Figura 1. [ 11 ]
Sin embargo, el DIF no uniforme presenta un caso interesante. En lugar de que se le otorgue una ventaja consistente al grupo de referencia a lo largo del continuo de habilidades, la dependencia condicional se mueve y cambia de dirección en diferentes ubicaciones en elcontinuo. [ 12 ] Por ejemplo, un ítem puede dar al grupo de referencia una ventaja menor en el extremo inferior del continuo, mientras que una ventaja mayor en el extremo superior. Además, a diferencia del DIF uniforme, un ítem puede variar simultáneamente en discriminación para los dos grupos y también variar en dificultad (es decir,y).
Aún más complejo es el "cruce" del DIF no uniforme . Como se muestra en la Figura 2, esto ocurre cuando un ítem otorga una ventaja a un grupo de referencia en un extremo delcontinuo mientras favorece al grupo focal en el otro extremo. Las diferencias en los CCI indican que los examinados de los dos grupos con niveles de habilidad idénticos tienen probabilidades desiguales de responder correctamente a un ítem. Cuando las curvas son diferentes pero no se cruzan, esto es evidencia de DIF uniforme. Sin embargo, si los CCI se cruzan en algún punto a lo largo delEn esta escala, hay evidencia de DIF no uniforme.
Figura 1. ICC para DIF uniforme
Figura 2. Coeficiente de correlación intraclase (CCI) para DIF no uniforme
Procedimientos para la detección de DIF
Mantel-Haenszel
Un procedimiento común para detectar DIF es el enfoque de Mantel-Haenszel (MH). [ 13 ] El procedimiento MH es un enfoque basado en tablas de contingencia chi-cuadrado que examina las diferencias entre los grupos de referencia y focal en todos los ítems de la prueba, uno por uno. [ 14 ] El continuo de habilidad, definido por las puntuaciones totales de la prueba, se divide enintervalos que luego sirven como base para emparejar a los miembros de ambos grupos. [ 15 ] Se utiliza una tabla de contingencia de 2 × 2 en cada intervalo deComparando ambos grupos en un ítem individual. Las filas de la tabla de contingencia corresponden a la pertenencia al grupo (de referencia o focal), mientras que las columnas corresponden a las respuestas correctas o incorrectas. La siguiente tabla presenta la forma general para un solo ítem en elintervalo de habilidad.
Nota.,,ycorresponden a las frecuencias celulares observadas. Subíndicecorresponde al intervalo de habilidad.
Razón de probabilidades
El siguiente paso en el cálculo del estadístico MH es utilizar datos de la tabla de contingencia para obtener una razón de probabilidades para los dos grupos en el elemento de interés en un momento determinado.intervalo. Esto se expresa en términos deydónderepresenta la proporción correcta yla proporción incorrecta para ambas referencias () y focal () grupos. Para el procedimiento MH, la razón de probabilidades obtenida se representa porcon un posible valor que va desdea. AUn valor de 1,0 indica ausencia de DIF y, por lo tanto, un rendimiento similar por parte de ambos grupos. Valores mayores quesugiere que el grupo de referencia tuvo un mejor desempeño o encontró el elemento menos difícil que el grupo focal. Por otro lado, si el valor obtenido es menor que, esto indica que el ítem fue menos difícil para el grupo focal. [ 9 ]
Utilizando las variables de la tabla de contingencia anterior, el cálculo es el siguiente: El cálculo anterior se refiere a un elemento individual en un único intervalo de habilidad. La estimación de la poblaciónpuede extenderse para reflejar una razón de probabilidades común en todos los intervalos de habilidad.para un elemento específico. El estimador común de la razón de probabilidades se denotay se puede calcular mediante la siguiente ecuación: para todos los valores dey dónderepresenta el tamaño total de la muestra en elintervalo.
El obtenidoa menudo se estandariza mediante una transformación logarítmica, centrando el valor alrededor de 0. [ 16 ] El nuevo estimador transformadose calcula de la siguiente manera: Por lo tanto, un valor de 0 indicaría la ausencia de DIF. Al examinar la ecuación, es importante tener en cuenta que el signo menos modifica la interpretación de los valores menores o mayores que 0. Los valores menores que 0 indican una ventaja para el grupo de referencia, mientras que los valores mayores que 0 indican una ventaja para el grupo focal.
teoría de respuesta al ítem
La teoría de respuesta al ítem (TRI) es otro método ampliamente utilizado para evaluar el DIF (funcionamiento diferencial del ítem). La TRI permite un examen crítico de las respuestas a ítems específicos de una prueba o medida. Como se mencionó anteriormente, el DIF examina la probabilidad de responder correctamente o respaldar un ítem condicionado al rasgo o habilidad latente. Debido a que la TRI examina la relación monótona entre las respuestas y el rasgo o habilidad latente, es un enfoque apropiado para examinar el DIF. [ 17 ]
Tres ventajas principales del uso de IRT en la detección de DIF son: [ 18 ]
- En comparación con la teoría clásica de los tests , las estimaciones de los parámetros de la TRI no se ven tan afectadas por las características de la muestra.
- Las propiedades estadísticas de los ítems pueden expresarse con mayor precisión, lo que aumenta la exactitud de la interpretación del DIF entre dos grupos.
- Estas propiedades estadísticas de los elementos pueden expresarse gráficamente, lo que mejora la interpretabilidad y la comprensión de cómo los elementos funcionan de manera diferente entre los grupos.
En relación con el DIF (funcionamiento diferencial del ítem), las estimaciones de los parámetros de los ítems se calculan y se analizan gráficamente mediante curvas características de los ítems (CCI), también conocidas como líneas de traza o funciones de respuesta de los ítems (FRI). Tras el análisis de las CCI y la consiguiente sospecha de DIF, se implementan procedimientos estadísticos para comprobar las diferencias entre las estimaciones de los parámetros.
Los CCI representan funciones matemáticas de la relación entre la posición en el continuo del rasgo latente y la probabilidad de dar una respuesta particular. [ 19 ] La Figura 3 ilustra esta relación como una función logística . Los individuos con menor puntuación en el rasgo latente o con menor habilidad tienen menor probabilidad de obtener una respuesta correcta o de respaldar un ítem, especialmente a medida que aumenta la dificultad. Por lo tanto, aquellos con mayor puntuación en el rasgo latente o en habilidad tienen mayor probabilidad de dar una respuesta correcta o de respaldar un ítem. Por ejemplo, en un inventario de depresión, los individuos con alta depresión tendrían mayor probabilidad de respaldar un ítem que los individuos con menor depresión. De manera similar, los individuos con mayor habilidad matemática tienen mayor probabilidad de obtener correctamente un ítem matemático que aquellos con menor habilidad.
Otro aspecto crítico de los CCI se refiere al punto de inflexión . Este es el punto en la curva donde la probabilidad de una respuesta particular es 0,5 y también representa el valor máximo para la pendiente . [ 20 ] Este punto de inflexión indica dónde la probabilidad de una respuesta correcta o de respaldar un elemento se vuelve mayor que el 50%, excepto cuando unEl parámetro es mayor que 0, lo que sitúa el punto de inflexión en(A continuación se presenta una descripción). El punto de inflexión está determinado por la dificultad del ítem, que corresponde a valores en el continuo de habilidad o rasgo latente. [ 21 ] Por lo tanto, para un ítem fácil, este punto de inflexión puede estar más bajo en el continuo de habilidad, mientras que para un ítem difícil puede estar más alto en la misma escala.
Figura 3. Coeficiente de correlación intraclase (CCI) con punto de inflexión y línea de pendiente.
Antes de presentar los procedimientos estadísticos para probar las diferencias de los parámetros de los ítems, es importante primero proporcionar una comprensión general de los diferentes modelos de estimación de parámetros y sus parámetros asociados. Estos incluyen los modelos logísticos (PL) de uno, dos y tres parámetros. Todos estos modelos asumen un único rasgo latente subyacente o habilidad. Los tres modelos tienen un parámetro de dificultad del ítem denotado b . Para los modelos 1PL y 2PL, el parámetro b corresponde al punto de inflexión en la escala de habilidad, como se mencionó anteriormente. En el caso del modelo 3PL, el punto de inflexión corresponde adóndees una asíntota inferior (que se analiza más adelante). Los valores de dificultad, en teoría, pueden variar de -∞ a +∞; sin embargo, en la práctica rara vez superan ±3. Los valores más altos indican ítems de prueba más difíciles. Los ítems que presentan valores bajosLos parámetros son elementos de prueba fáciles. [ 22 ]
Otro parámetro que se estima es un parámetro de discriminación designadoEste parámetro se refiere a la capacidad de un elemento para discriminar entre individuos.El parámetro se estima en los modelos 2PL y 3PL. En el caso del modelo 1PL, este parámetro está restringido a ser igual entre grupos. En relación con los ICC, elEl parámetro es la pendiente del punto de inflexión. Como se mencionó anteriormente, la pendiente es máxima en el punto de inflexión.parámetro, similar alEl parámetro puede variar de -∞ a +∞; sin embargo, los valores típicos son menores que 2. En este caso, un valor más alto indica una mayor discriminación entre individuos. [ 23 ]
El modelo 3PL tiene un parámetro adicional denominado parámetro de adivinación o pseudoazar y se denota porEsto corresponde a una asíntota inferior que esencialmente permite la posibilidad de que un individuo obtenga correctamente un ítem moderado o difícil incluso si tiene poca habilidad. Valores paravarían entre 0 y 1, sin embargo, normalmente caen por debajo de 0,3. [ 24 ]
Al aplicar procedimientos estadísticos para evaluar el DIF,yLos parámetros (discriminación y dificultad) son de particular interés. Sin embargo, supongamos que se utilizó un modelo 1PL, donde elLos parámetros están restringidos a ser iguales para ambos grupos, dejando solo la estimación de laparámetros. Después de examinar los ICC, hay una diferencia aparente enparámetros para ambos grupos. Utilizando un método similar a una prueba t de Student , el siguiente paso es determinar si la diferencia en la dificultad es estadísticamente significativa . Bajo la hipótesis nula Lord (1980) proporciona un estadístico de prueba fácilmente calculable y con distribución normal . El error estándar de la diferencia entre los parámetros b se calcula mediante
Estadístico de Wald
Sin embargo, en la mayoría de los casos, un modelo 2PL o 3PL es más apropiado que ajustar un modelo 1PL a los datos y, por lo tanto, ambosyLos parámetros deben ser probados para DIF. Lord (1980) propuso otro método para probar las diferencias en ambosyparámetros, dondeLos parámetros están restringidos a ser iguales entre los grupos. Esta prueba produce un estadístico de Wald que sigue una distribución chi-cuadrado. En este caso, la hipótesis nula que se está probando es .
Primero, se calcula una matriz de covarianza de 2 × 2 de las estimaciones de los parámetros para cada grupo que están representados porypara los grupos de referencia y focales. Estas matrices de covarianza se calculan invirtiendo las matrices de información obtenidas . A continuación, las diferencias entre los parámetros estimados se colocan en un vector de 2 × 1 y se denota por A continuación, la matriz de covarianza.se estima sumandoyUtilizando esta información, el estadístico de Wald se calcula de la siguiente manera: que se evalúa con 2 grados de libertad .
Prueba de razón de verosimilitud
La prueba de razón de verosimilitud es otro método basado en la TRI para evaluar el DIF. Este procedimiento implica comparar la razón de dos modelos. Bajo el modeloLos parámetros de los ítems están restringidos a ser iguales o invariables entre los grupos de referencia y focales. Bajo el modeloLos parámetros de los ítems pueden variar libremente. [ 25 ] La función de verosimilitud bajose denotamientras que la función de probabilidad bajose designaLos elementos que deben ser iguales sirven como elementos de referencia para este procedimiento, mientras que a los elementos sospechosos de DIF se les permite variar libremente.
Al utilizar elementos de referencia y permitir que varíen los parámetros de los elementos restantes, se pueden evaluar simultáneamente varios elementos para detectar DIF. [ 26 ] Sin embargo, si la razón de verosimilitud indica un posible DIF, sería apropiado realizar un análisis elemento por elemento para determinar qué elementos, si no todos, contienen DIF.
La razón de verosimilitud de los dos modelos se calcula mediante Alternativamente, la relación puede expresarse mediante dóndeyestán invertidos y su logaritmo es negado.
aproximadamente sigue una distribución chi cuadrado, especialmente con muestras más grandes. Por lo tanto, se evalúa mediante los grados de libertad que corresponden al número de restricciones necesarias para derivar el modelo restringido del modelo libremente variable. [ 27 ] Por ejemplo, si se utiliza un modelo 2PL y ambosyLos parámetros pueden variar libremente.y estos mismos dos parámetros están restringidos en, entonces la razón se evalúa con 2 grados de libertad.
Regresión logística
Los enfoques de regresión logística para la detección de DIF implican realizar un análisis separado para cada ítem. Las variables independientes incluidas en el análisis son la pertenencia a un grupo, una variable de correspondencia de habilidad (generalmente una puntuación total) y un término de interacción entre ambas. La variable dependiente de interés es la probabilidad de obtener una respuesta correcta o de respaldar un ítem. Dado que el resultado de interés se expresa en términos de probabilidades, la estimación de máxima verosimilitud es el procedimiento apropiado. [ 28 ] Este conjunto de variables se puede expresar mediante la siguiente ecuación de regresión: dóndecorresponde a la intersección o la probabilidad de una respuesta cuandoyson iguales a 0 con los restantescorrespondientes a los coeficientes de ponderación para cada variable independiente . La primera variable independiente,, es la variable de emparejamiento utilizada para vincular individuos en función de su capacidad, en este caso una puntuación total en una prueba, similar a la empleada por el procedimiento de Mantel-Haenszel. La variable de pertenencia al grupo se denotay en el caso de la regresión se representa mediante variables codificadas ficticias . El término finalcorresponde a la interacción entre las dos variables mencionadas anteriormente.
Para este procedimiento, las variables se introducen jerárquicamente. Siguiendo la estructura de la ecuación de regresión proporcionada anteriormente, las variables se introducen en la siguiente secuencia: variable coincidente, variable de agrupacióny la variable de interacciónLa determinación del DIF se realiza evaluando el estadístico chi-cuadrado obtenido con 2 grados de libertad. Adicionalmente, se comprueba la significancia de la estimación del parámetro.
Según los resultados de la regresión logística, se indicaría DIF si los individuos con habilidades similares tienen probabilidades significativamente diferentes de responder a un ítem y, por lo tanto, curvas de regresión logística diferentes. Por el contrario, si las curvas para ambos grupos son iguales, entonces el ítem no está sesgado y, por lo tanto, no hay DIF. En términos de DIF uniforme y no uniforme, si las intersecciones y los parámetros de la variable de emparejamiento para ambos grupos no son iguales, entonces hay evidencia de DIF uniforme. Sin embargo, si hay un parámetro de interacción distinto de cero, esto es un indicio de DIF no uniforme. [ 29 ]
Consideraciones
Tamaño de la muestra
La primera consideración se refiere al tamaño de la muestra, específicamente en lo que respecta a los grupos de referencia y focales. Antes de cualquier análisis, generalmente se conoce información sobre el número de personas en cada grupo, como el número de hombres/mujeres o miembros de grupos étnicos/raciales. Sin embargo, la cuestión radica más bien en si el número de personas por grupo es suficiente para tener la potencia estadística necesaria para identificar el DIF (funcionamiento diferencial del ítem). En algunos casos, como en el de la etnia, puede haber evidencia de tamaños de grupo desiguales, de modo que los blancos representen una muestra mucho mayor que cada grupo étnico individual representado. Por lo tanto, en tales casos, puede ser apropiado modificar o ajustar los datos para que los grupos que se comparan para detectar el DIF sean, de hecho, iguales o de tamaño similar.
La codificación ficticia o la recodificación es una práctica común para ajustar las disparidades en el tamaño del grupo de referencia y el grupo focal. En este caso, todos los grupos étnicos no blancos pueden agruparse para obtener un tamaño de muestra relativamente igual para ambos grupos. Esto permitiría una comparación del funcionamiento de los ítems entre grupos mayoritarios y minoritarios. Si no se realizan modificaciones y no se llevan a cabo procedimientos de DIF (funcionamiento diferencial de los ítems), es posible que no haya suficiente potencia estadística para identificar el DIF, incluso si existe entre los grupos.
Otro aspecto relacionado con el tamaño de la muestra se vincula directamente con el procedimiento estadístico utilizado para detectar el DIF (funcionamiento diferencial del ítem). Además de las consideraciones sobre el tamaño de la muestra de los grupos de referencia y focales, se deben cumplir ciertas características de la muestra misma para satisfacer los supuestos de cada prueba estadística utilizada en la detección del DIF.
Por ejemplo, el uso de enfoques de la Teoría de Respuesta al Ítem (TRI) puede requerir muestras más grandes que las necesarias para el procedimiento de Mantel-Haenszel. Esto es importante, ya que el análisis del tamaño del grupo puede orientar la elección entre un procedimiento u otro. En el enfoque de regresión logística, los valores apalancados y los valores atípicos son motivo de especial preocupación y deben examinarse antes de la detección de DIF (funcionamiento diferencial del ítem). Además, como en todos los análisis, deben cumplirse los supuestos de las pruebas estadísticas. Algunos procedimientos son más robustos ante violaciones menores, mientras que otros no tanto. Por lo tanto, se debe investigar la naturaleza de la distribución de las respuestas de la muestra antes de implementar cualquier procedimiento de DIF.
Elementos
Es fundamental determinar el número de ítems que se utilizarán para la detección de DIF. No existe un estándar sobre cuántos ítems deben usarse para la detección de DIF, ya que esto varía de un estudio a otro. En algunos casos, puede ser apropiado analizar todos los ítems para detectar DIF, mientras que en otros no es necesario. Si solo se sospecha de DIF en ciertos ítems con una justificación adecuada, entonces puede ser más apropiado analizar esos ítems y no el conjunto completo. Sin embargo, a menudo es difícil simplemente asumir qué ítems pueden ser problemáticos. Por esta razón, se suele recomendar examinar simultáneamente todos los ítems de la prueba para detectar DIF. Esto proporcionará información sobre todos los ítems, lo que permitirá identificar tanto los ítems problemáticos como aquellos que funcionan de manera similar para los grupos de referencia y focal.
En lo que respecta a las pruebas estadísticas, algunos procedimientos, como la prueba de razón de verosimilitud IRT, requieren el uso de ítems de referencia. Algunos ítems se restringen para que sean iguales entre los grupos, mientras que los ítems sospechosos de DIF pueden variar libremente. En este caso, solo un subconjunto se identificaría como ítems DIF, mientras que el resto serviría como grupo de comparación para la detección de DIF. Una vez identificados los ítems DIF, los ítems de referencia también pueden analizarse restringiendo los ítems DIF originales y permitiendo que los ítems de referencia originales varíen libremente.
Por lo tanto, parece que evaluar todos los ítems simultáneamente podría ser un procedimiento más eficiente. Sin embargo, como se mencionó, según el procedimiento implementado, se utilizan diferentes métodos para seleccionar los ítems con DIF (funcionamiento diferencial del ítem).
Además de identificar el número de ítems que se utilizan en la detección de DIF, es de importancia adicional determinar el número de ítems en toda la prueba o medida en sí. La recomendación típica, como señala Zumbo (1999) [ 30 ] , es tener un mínimo de 20 ítems. El razonamiento para un mínimo de 20 ítems se relaciona directamente con la formación de criterios de emparejamiento. Como se señaló en secciones anteriores, una puntuación total de la prueba se utiliza normalmente como método para emparejar individuos en función de su capacidad. La puntuación total de la prueba se divide normalmente en 3 a 5 niveles de capacidad () que luego se utiliza para emparejar a los individuos según su habilidad antes de los procedimientos de análisis DIF. El uso de un mínimo de 20 ítems permite una mayor varianza en la distribución de las puntuaciones, lo que da como resultado grupos de nivel de habilidad más significativos.
Aunque las propiedades psicométricas del instrumento deberían haberse evaluado antes de su uso, es importante que la validez y la fiabilidad del mismo sean adecuadas. Los ítems de la prueba deben medir con precisión el constructo de interés para derivar grupos de nivel de habilidad significativos. Por supuesto, no se desea inflar los coeficientes de fiabilidad simplemente añadiendo ítems redundantes. La clave es tener una medida válida y fiable con suficientes ítems para desarrollar grupos de emparejamiento significativos. Gadermann et al. (2012), [ 31 ] Revelle y Zinbarg (2009), [ 32 ] y John y Soto (2007) [ 33 ] ofrecen más información sobre enfoques modernos para la validación estructural y métodos más precisos y apropiados para evaluar la fiabilidad.
Equilibrar la estadística y el razonamiento
Como en toda investigación psicológica y evaluación psicométrica, la estadística desempeña un papel fundamental, pero de ninguna manera debe ser la única base para las decisiones y conclusiones alcanzadas. El juicio razonado es de vital importancia al evaluar ítems para detectar DIF. Por ejemplo, dependiendo del procedimiento estadístico utilizado para la detección de DIF, pueden obtenerse resultados diferentes. Algunos procedimientos son más precisos, mientras que otros no tanto. Por ejemplo, el procedimiento de Mantel-Haenszel requiere que el investigador construya niveles de habilidad basados en las puntuaciones totales de la prueba, mientras que la TRI ubica de manera más efectiva a los individuos a lo largo del continuo de rasgos latentes o habilidades. Por lo tanto, un procedimiento puede indicar DIF para ciertos ítems, mientras que otros no.
Otro problema es que a veces se puede observar DIF, pero no hay una razón clara para su existencia. Aquí es donde entra en juego el juicio razonado, especialmente al comprender por qué se produce el DIF uniforme y el no uniforme. [ 15 ] El investigador debe usar el sentido común para interpretar los análisis de DIF. No basta con informar que los ítems funcionan de manera diferente para los grupos; se requiere un razonamiento cualitativo que explique por qué ocurre.
El DIF uniforme se produce cuando existe una ventaja constante para un grupo en comparación con otro en todos los niveles de habilidad. Este tipo de sesgo suele corregirse utilizando normas de evaluación independientes para cada grupo, garantizando así la equidad en la evaluación. Por otro lado, el DIF no uniforme es más complejo, ya que la ventaja varía según el nivel de habilidad de cada individuo. Factores como el estatus socioeconómico, las diferencias culturales, las barreras lingüísticas y las disparidades en el acceso al conocimiento pueden contribuir al DIF no uniforme. Identificar y abordar el DIF no uniforme requiere una comprensión más profunda de los procesos cognitivos subyacentes y puede requerir intervenciones personalizadas para garantizar prácticas de evaluación justas.
En los estudios de DIF (funcionamiento diferencial de ítems), es común encontrar ítems que presentan este problema, lo que indica posibles dificultades que requieren análisis. Sin embargo, la evidencia de DIF no implica automáticamente que toda la prueba sea injusta. En cambio, señala que algunos ítems específicos pueden estar sesgados, lo que exige atención para mantener la integridad y la equidad de la prueba para todos los examinados. Identificar ítems con DIF brinda la oportunidad de revisar y, potencialmente, modificar o eliminar los ítems problemáticos, garantizando así prácticas de evaluación equitativas. Por lo tanto, el análisis de DIF constituye una herramienta valiosa para el análisis de ítems , especialmente cuando se complementa con una exploración cualitativa de los factores causales.
Software estadístico
A continuación se muestran programas estadísticos comunes capaces de realizar los procedimientos aquí descritos. Al hacer clic en «Lista de paquetes estadísticos» , accederá a una lista completa de software estadístico de código abierto, dominio público, gratuito y propietario.
Procedimiento de Mantel-Haenszel
Procedimientos basados en la TRI
- BILOG-MG
- MULTILOG
- PARSCALE
- DATO DE PRUEBA
- EQSIRT
- R (por ejemplo, paquete 'difR' [ 34 ] o 'mirt' [ 35 ] )
- IRTPRO
Regresión logística
Véase también
Referencias
- ↑ "Consejo Nacional de Medición en Educación" . Archivado del original el 22 de julio de 2017.
- ↑ De Leo, Joseph A.; Van Dam, Nicholas T.; Hobkirk, Andréa L.; Earleywine, Mitch (2011-04-01). "Examen del sesgo en la Escala de búsqueda de sensaciones impulsivas (ImpSS) mediante el funcionamiento diferencial de los ítems (DIF): un análisis de respuesta a los ítems" (PDF) . Personality and Individual Differences . 50 (5): 570– 576. doi : 10.1016/j.paid.2010.11.030 . ISSN 0191-8869 .
- ↑ Zumbo, BD (2007). "Tres generaciones de análisis de funcionamiento diferencial de ítems (DIF): Considerando dónde ha estado, dónde está ahora y hacia dónde va". Language Assessment Quarterly . 4 : 223–233 . doi : 10.1080/15434300701375832 .
- 1 2 Camilli, G. (2006). "Justicia en las pruebas" (PDF) . En Brennan, RL (ed.). Medición educativa (4.ª ed.). Westport, CT: American Council on Education. pp. 220–256 . ISBN 978-0-275-98125-9.
- ↑ Holland, PW; Wainer, H. (1993). Funcionamiento diferencial de los ítems . Hillsdale, NJ: Lawrence Erlbaum. doi : 10.4324/9780203357811 . ISBN 0805809724.
- ↑ Osterlind, SJ; Everson, HT (2009). Funcionamiento diferencial de los ítems . Thousand Oaks, CA: Sage Publishing. ISBN 9781412954945.
- ↑ Ackerman, T. (1992). "Una explicación didáctica del sesgo del ítem, el impacto del ítem y la validez del ítem desde una perspectiva multidimensional" (PDF) . Journal of Educational Measurement . 29 : 674–691 . doi : 10.1111/j.1745-3984.1992.tb00368.x .
- ↑ Lord, FM (1980). Aplicaciones de la teoría de respuesta al ítem a problemas prácticos de evaluación . Hillsdale, NJ: Lawrence Erlbaum. doi : 10.4324/9780203056615 . ISBN 0-89859-006-X.
- 1 2 Millsap, RE; Everson, HT (1993). "Revisión metodológica: Enfoques estadísticos para evaluar el sesgo de medición" (PDF) . Medición psicológica aplicada . 17 (4): 297– 334. Archivado del original (PDF) el 24 de abril de 2024.
- ↑ Walker, C. (2011). "¿Qué es el DIF? Por qué los análisis de funcionamiento diferencial de los ítems son una parte importante del desarrollo y la validación de instrumentos". Journal of Psychoeducational Assessment . 29 : 364–376 . doi : 10.1177/0734282911406666 .
- ↑ Mellenbergh, GJ (1982). "Modelos de tablas de contingencia para evaluar el sesgo de los ítems". Journal of Educational Statistics . 7 : 105–118 . doi : 10.3102/10769986007002105 .
- ↑ Walker, CM; Beretvas, SN; Ackerman, TA (2001). "Un examen de las variables de condicionamiento utilizadas en las pruebas adaptativas por computadora para DIF" . Medición Aplicada en Educación . 14 : 3–16 . doi : 10.1207/S15324818AME1401_02 .
- ↑ Mantel, N.; Haenszel, W. (1959). "Aspectos estadísticos del análisis de datos de estudios retrospectivos de enfermedades" (PDF) . Journal of the National Cancer Institute . 22 : 719–748 .
- ↑ Marascuilo, LA; Slaughter, RE (1981). "Procedimientos estadísticos para identificar posibles fuentes de sesgo de ítems basados en estadísticas de 2 x 2". Journal of Educational Measurement . 18 (4): 229– 248. doi : 10.1177/014662169301700401 .
- 1 2 Holland, PW; Thayer, DT (1988). "Rendimiento diferencial de los ítems y el procedimiento de Mantel-Haenszel" (PDF) . En Wainer, H.; Braun, HI (eds.). Validez de las pruebas . Hillsdale, NJ: Erlbaum. pp. 129–145 . ISBN 9780203056905.
- ↑ Dorans, NJ; Holland, PW (1993). "Detección y descripción de DIF: Mantel-Haenszel y estandarización" (PDF) . En Holland, PW; Wainer, H. (eds.). Funcionamiento diferencial de los ítems . Hillsdale, NJ: Erlbaum. pp. 35–66 . ISBN 0805809724.
- ↑ Steinberg, L.; Thissen, D. (2006). "Uso de tamaños del efecto para la presentación de informes de investigación: ejemplos que utilizan la teoría de respuesta al ítem para analizar el funcionamiento diferencial de los ítems". Métodos Psicológicos . 11 (4): 402– 415. doi : 10.1037/1082-989X.11.4.402 .
- ↑ Camilli, G.; Shepard, L. (1994). Métodos para identificar ítems de prueba sesgados . Thousand Oaks, CA: Sage. ISBN 978-0-8039-4415-2.
- ↑ Reise, SP; Ainsworth, AT; Haviland, MG (2005). "Teoría de respuesta al ítem: Fundamentos, aplicaciones y promesas en la investigación psicológica" . Current Directions in Psychological Science . 14 : 95–101 . doi : 10.1111/j.0963-7214.2005.00342.x .
- ↑ Edelen, MO; Reeve, BB (2007). "Aplicación del modelado de la teoría de respuesta al ítem (TRI) al desarrollo, evaluación y perfeccionamiento de cuestionarios" (PDF) . Quality of Life Research . 16 : 5–18 . doi : 10.1007/s11136-007-9198-0 .
- ↑ DeMars, C. (2010). Teoría de respuesta al ítem . Nueva York: Oxford Press. ISBN 978-0-19-537703-3.
- ↑ Harris, D. (1989). "Comparación de modelos IRT de 1, 2 y 3 parámetros" (PDF) . Educational Measurement: Issues and Practice . 8 : 35–41 . doi : 10.1111/j.1745-3992.1989.tb00313.x . Archivado del original (PDF) el 16 de marzo de 2025.
- ↑ Baker, FB (2001). Los fundamentos de la teoría de respuesta al ítem (PDF) . ERIC Clearinghouse on Assessment and Evaluation. ISBN 1-886047-03-0.
- ↑ Birnbaum, A. (1968). «Algunos modelos de rasgos latentes y su uso para inferir la capacidad de un examinado». En Lord, FM; Novick, MR (eds.). Teorías estadísticas de las puntuaciones de las pruebas mentales . Reading, MA: Addison-Wesley. pp. 395–479 . ISBN 9780394347714.
- ↑ Thissen, D.; Steinberg, L.; Gerrard, M. (1986). "Más allá de las diferencias grupales: El concepto de sesgo" . Psychological Bulletin . 99 : 118–128 . doi : 10.1037/0033-2909.99.1.118 .
- ↑ IRTPRO: Guía del usuario (PDF) . Lincolnwood, IL: Scientific Software International, Inc. 2011.
- ↑ Thissen, D.; Steinberg, L.; Wainer, H. (1993). "Detección del funcionamiento diferencial de los ítems mediante los parámetros de los modelos de respuesta a los ítems" . En Holland, PW; Wainer, H. (eds.). Funcionamiento diferencial de los ítems . Hillsdale, NJ: Lawrence Erlbaum. pp. 67–113 . ISBN 0805809724.
- ↑ Bock, RD (1975). Métodos estadísticos multivariados . Nueva York: McGraw-Hill. ISBN 978-0-07-006305-1.
- ↑ Swaminathan, H.; Rogers, HJ (1990). "Detección de funcionamiento diferencial de ítems mediante procedimientos de regresión logística". Journal of Educational Measurement . 27 : 361–370 . doi : 10.1111/j.1745-3984.1990.tb00754.x .
- ↑ Zumbo, BD (1999). Un manual sobre la teoría y los métodos del funcionamiento diferencial de los ítems (DIF) . Ottawa, Canadá: Dirección de Investigación y Evaluación de Recursos Humanos, NDHQ .
- ↑ Gadermann, AM; Guhn, M.; Zumbo, BD (2012). "Estimación de la fiabilidad ordinal para datos de respuesta a ítems de tipo Likert y ordinales: una guía conceptual, empírica y práctica" (PDF) . Practical Assessment, Research & Evaluation . 17 (3): 1– 13. doi : 10.7275/n560-j767 .
- ^ Revelle, W.; Zinbarg, RE (2009). "Coeficientes alfa, beta, omega y GLB: comentarios sobre Sijtsma" (PDF) . Psicometrika . 74 (1): 145– 154. doi : 10.1007/s11336-008-9102-z .
- ↑ John, OP; Soto, CJ (2007). «La importancia de la validez: fiabilidad y el proceso de validación de constructos» . En Robins, RW; Fraley, RC; Krueger, RF (eds.). Manual de métodos de investigación en psicología de la personalidad (PDF) . Nueva York, NY: Cambridge University Press. pp. 461–494 . ISBN 978-1-59385-111-8.
- 1 2 3 Magis, David; Béland, Sébastien; Tuerlinckx, Francisco; De Boeck, Paul (2010). "Un marco general y un paquete R para la detección del funcionamiento diferencial dicotómico de elementos" . Métodos de investigación del comportamiento . 42 (3): 847–862.doi : 10.3758 / BRM.42.3.847 . PMID 20805607 .
- ↑ Chalmers, RP (2012). "mirt: Un paquete de teoría de respuesta al ítem multidimensional para el entorno R" . Journal of Statistical Software . 48 (6): 1– 29. doi : 10.18637/jss.v048.i06 .
- Psicometría
- evaluación y valoración educativa
- Investigación educativa