Articulo de referencia

Funcionamiento diferencial de los elementos

El funcionamiento diferencial de los ítems ( DIF , por sus siglas en inglés) es una propiedad estadística de un ítem de prueba que indica la probabilidad de que individuos de di...

El funcionamiento diferencial de los ítems ( DIF , por sus siglas en inglés) es una propiedad estadística de un ítem de prueba que indica la probabilidad de que individuos de distintos grupos, con habilidades similares, respondan de manera diferente al ítem. Se manifiesta cuando individuos de diferentes grupos, con niveles de habilidad comparables, no tienen la misma probabilidad de responder correctamente a una pregunta. Existen dos tipos principales de DIF: DIF uniforme , donde un grupo tiene consistentemente una ventaja sobre el otro, y DIF no uniforme , donde la ventaja varía según el nivel de habilidad del individuo. [ 1 ]

La presencia de DIF requiere revisión y juicio, pero no siempre significa sesgo. El análisis de DIF proporciona una indicación del comportamiento inesperado de los ítems en una prueba. La característica DIF de un ítem no está determinada únicamente por las probabilidades variables de seleccionar una respuesta específica entre individuos de diferentes grupos. Más bien, el DIF se hace pronunciado cuando individuos de diferentes grupos, que poseen la misma habilidad subyacente real , exhiben diferentes probabilidades de dar una respuesta determinada. Incluso cuando hay un sesgo uniforme, los desarrolladores de pruebas a veces recurren a suposiciones como que los sesgos de DIF pueden compensarse entre sí debido al extenso trabajo requerido para abordarlo, lo que compromete la ética de las pruebas y perpetúa los sesgos sistémicos. [ 2 ]

Los procedimientos comunes para evaluar el DIF son el procedimiento de Mantel-Haenszel , la regresión logística , los métodos basados ​​en la teoría de respuesta al ítem (TRI) y los métodos basados ​​en el análisis factorial confirmatorio (AFC). [ 3 ]

Descripción

El DIF se refiere a las diferencias en el funcionamiento de los ítems entre grupos, a menudo demográficos, que coinciden en el rasgo latente o, más generalmente, en el atributo que miden los ítems o la prueba. [ 4 ] [ 5 ] Es importante tener en cuenta que, al examinar los ítems para detectar DIF, los grupos deben coincidir en el atributo medido; de lo contrario, esto podría resultar en una detección inexacta del DIF.

Para crear una comprensión general del DIF o sesgo de medición, considere el siguiente ejemplo ofrecido por Osterlind y Everson (2009). [ 6 ] En este caso,Y{\textstyle Y}se refiere a una respuesta a un ítem de prueba particular que está determinada por el constructo latente que se está midiendo. El constructo latente de interés se denomina theta (θ{\textstyle \theta }) dóndeY{\textstyle Y}es un indicador deθ{\textstyle \theta }que se pueden organizar en términos de la distribución de probabilidad deY{\textstyle Y}enθ{\textstyle \theta }por la expresiónF(Y)|θ{\textstyle f(Y)|\theta }Por lo tanto, respuestaY{\textstyle Y}es condicional al rasgo latente (θ{\textstyle \theta }).

Debido a que DIF examina las diferencias en las probabilidades condicionales deY{\textstyle Y}entre grupos, etiquetemos los grupos como grupos de " referencia " y "focales". Aunque la designación no importa, una práctica típica en la literatura es designar al grupo de referencia como el grupo que se sospecha que tiene una ventaja, mientras que el grupo focal se refiere al grupo que se prevé que se verá perjudicado por la prueba. [ 4 ] Por lo tanto, dada la relación funcionalF(Y)|θ{\textstyle f(Y)|\theta }y bajo el supuesto de que existen distribuciones de error de medición idénticas para los grupos de referencia y focales, se puede concluir que bajo la hipótesis nula : F(Y=1|θ,GRAMO=r)=F(Y=1|θ,GRAMO=F){\displaystyle f(Y=1|\theta ,G=r)=f(Y=1|\theta ,G=f)} conGRAMO{\textstyle G}correspondiente a la variable de agrupación,r{\textstyle r}el grupo de referencia yF{\textstyle f}el grupo focal.

Esta ecuación representa un caso en el que no hay DIF. En este caso, la ausencia de DIF está determinada por el hecho de que la distribución de probabilidad condicional deY{\textstyle Y}no depende de la pertenencia a un grupo. Para ilustrarlo, consideremos un elemento con opciones de respuesta.0{\textstyle 0}y1{\textstyle 1}, dóndeY=0{\textstyle Y=0}indica una respuesta incorrecta yY=1{\textstyle Y=1}Indica una respuesta correcta. La probabilidad de responder correctamente a un ítem es la misma para los miembros de ambos grupos. Esto indica que no existe DIF ni sesgo en los ítems, ya que los miembros del grupo de referencia y del grupo focal con la misma habilidad o atributo subyacente tienen la misma probabilidad de responder correctamente. Por lo tanto, no existe sesgo ni desventaja para un grupo sobre el otro.

Consideremos el caso en el que la probabilidad condicional deY{\textstyle Y}no es lo mismo para los grupos de referencia y focales. En otras palabras, los miembros de diferentes grupos con el mismo rasgo o nivel de habilidad tienen distribuciones de probabilidad desiguales enY{\textstyle Y}. Una vez controlando porθ{\textstyle \theta }, existe una clara dependencia entre la pertenencia al grupo y el rendimiento en un ítem. Para los ítems dicotómicos , esto sugiere que cuando los grupos focal y de referencia están en la misma ubicación enθ{\textstyle \theta }Existe una probabilidad diferente de obtener una respuesta correcta o de respaldar un ítem. Por lo tanto, el grupo con la mayor probabilidad condicional de responder correctamente a un ítem es el que se ve beneficiado por dicho ítem. Esto sugiere que el ítem está sesgado y funciona de manera diferente para cada grupo, lo que indica un DIF (funcionamiento diferencial del ítem).

Es importante establecer la distinción entre DIF o sesgo de medición y diferencias grupales ordinarias. Mientras que las diferencias grupales indican diferentes distribuciones de puntuación enY{\textstyle Y}, DIF implica explícitamente el condicionamiento enθ{\textstyle \theta }Por ejemplo, consideremos la siguiente ecuación: pag(Y=1|GRAMO=gramo)pag(Y=1){\displaystyle p(Y=1|G=g)\neq p(Y=1)} Esto indica que la puntuación de un examinado está condicionada a la agrupación, de modo que tener información sobre la pertenencia a un grupo cambia la probabilidad de una respuesta correcta. Por lo tanto, si los grupos difieren enθ{\textstyle \theta }y el rendimiento depende deθ{\textstyle \theta }, entonces la ecuación anterior sugeriría sesgo de ítem incluso en ausencia de DIF. Por esta razón, en la literatura sobre medición se acepta generalmente que las diferencias enY{\textstyle Y}Condicionar la pertenencia al grupo únicamente es inadecuado para establecer el sesgo. [ 7 ] [ 8 ] [ 9 ]

De hecho, las diferencias enθ{\textstyle \theta }o la capacidad son comunes entre los grupos y establecen la base para mucha investigación. Recuerde que para establecer el sesgo o DIF, los grupos deben estar emparejados enθ{\textstyle \theta }y luego demostrar probabilidades diferenciales enY{\textstyle Y}en función de la pertenencia al grupo.

Formularios

El DIF uniforme es el tipo más simple de DIF donde la magnitud de la dependencia condicional es relativamente invariante a lo largo del continuo de rasgos latentes (θ{\textstyle \theta }El elemento en cuestión proporciona sistemáticamente una ventaja a un grupo en todos los niveles de habilidad.θ{\textstyle \theta }. [ 10 ] Dentro de un marco de teoría de respuesta al ítem (TRI), esto se evidenciaría cuando ambas curvas características del ítem (CCI) son igualmente discriminatorias pero exhiben diferencias en los parámetros de dificultad (es decir,ar=aF{\textstyle a_{r}=a_{f}}ybr<bF{\textstyle b_{r}<b_{f}}) como se muestra en la Figura 1. [ 11 ]

Sin embargo, el DIF no uniforme presenta un caso interesante. En lugar de que se le otorgue una ventaja consistente al grupo de referencia a lo largo del continuo de habilidades, la dependencia condicional se mueve y cambia de dirección en diferentes ubicaciones en elθ{\textstyle \theta }continuo. [ 12 ] Por ejemplo, un ítem puede dar al grupo de referencia una ventaja menor en el extremo inferior del continuo, mientras que una ventaja mayor en el extremo superior. Además, a diferencia del DIF uniforme, un ítem puede variar simultáneamente en discriminación para los dos grupos y también variar en dificultad (es decir,araF{\textstyle a_{r}\neq a_{f}}ybr<bF{\textstyle b_{r}<b_{f}}).

Aún más complejo es el "cruce" del DIF no uniforme . Como se muestra en la Figura 2, esto ocurre cuando un ítem otorga una ventaja a un grupo de referencia en un extremo delθ{\textstyle \theta }continuo mientras favorece al grupo focal en el otro extremo. Las diferencias en los CCI indican que los examinados de los dos grupos con niveles de habilidad idénticos tienen probabilidades desiguales de responder correctamente a un ítem. Cuando las curvas son diferentes pero no se cruzan, esto es evidencia de DIF uniforme. Sin embargo, si los CCI se cruzan en algún punto a lo largo delθ{\textstyle \theta }En esta escala, hay evidencia de DIF no uniforme.

Procedimientos para la detección de DIF

Mantel-Haenszel

Un procedimiento común para detectar DIF es el enfoque de Mantel-Haenszel (MH). [ 13 ] El procedimiento MH es un enfoque basado en tablas de contingencia chi-cuadrado que examina las diferencias entre los grupos de referencia y focal en todos los ítems de la prueba, uno por uno. [ 14 ] El continuo de habilidad, definido por las puntuaciones totales de la prueba, se divide enk{\textstyle k}intervalos que luego sirven como base para emparejar a los miembros de ambos grupos. [ 15 ] Se utiliza una tabla de contingencia de 2  ×  2 en cada intervalo dek{\textstyle k}Comparando ambos grupos en un ítem individual. Las filas de la tabla de contingencia corresponden a la pertenencia al grupo (de referencia o focal), mientras que las columnas corresponden a las respuestas correctas o incorrectas. La siguiente tabla presenta la forma general para un solo ítem en elk{\textstyle k}intervalo de habilidad.

Nota.A{\textstyle A},B{\textstyle B},do{\textstyle C}yD{\textstyle D}corresponden a las frecuencias celulares observadas. Subíndicek{\textstyle k}corresponde al intervalo de habilidad.

Razón de probabilidades

El siguiente paso en el cálculo del estadístico MH es utilizar datos de la tabla de contingencia para obtener una razón de probabilidades para los dos grupos en el elemento de interés en un momento determinado.k{\textstyle k}intervalo. Esto se expresa en términos depag{\textstyle p}yq{\textstyle q}dóndepag{\textstyle p}representa la proporción correcta yq{\textstyle q}la proporción incorrecta para ambas referencias (R{\textstyle R}) y focal (F{\textstyle F}) grupos. Para el procedimiento MH, la razón de probabilidades obtenida se representa porα{\textstyle \alpha }con un posible valor que va desde0{\textstyle 0}a{\textstyle \infty }. Aα{\textstyle \alpha }Un valor de 1,0 indica ausencia de DIF y, por lo tanto, un rendimiento similar por parte de ambos grupos. Valores mayores que1.0{\textstyle 1.0}sugiere que el grupo de referencia tuvo un mejor desempeño o encontró el elemento menos difícil que el grupo focal. Por otro lado, si el valor obtenido es menor que1.0{\textstyle 1.0}, esto indica que el ítem fue menos difícil para el grupo focal. [ 9 ]

Utilizando las variables de la tabla de contingencia anterior, el cálculo es el siguiente: α=pagRk/qRkpagFk/qFk=(Ak/(Ak+Bk))/(Bk/(Ak+Bk))(dok/(dok+Dk))/(Dk/(dok+Dk))=Ak/Bkdok/Dk=AkDkBkdok{\displaystyle \alpha ={\frac {p_{R_{k}}/q_{R_{k}}}{p_{F_{k}}/q_{F_{k}}}}={\frac {(A_{k}/(A_{k}+B_{k}))/(B_{k}/(A_{k}+B_{k}))}{(C_{k}/(C_{k}+D_{k}))/(D_{k}/(C_{k}+D_{k}))}}={\frac {A_{k}/B_{k}}{C_{k}/D_{k}}}={\frac {A_{k}D_{k}}{B_{k}C_{k}}}} El cálculo anterior se refiere a un elemento individual en un único intervalo de habilidad. La estimación de la poblaciónα{\textstyle \alpha }puede extenderse para reflejar una razón de probabilidades común en todos los intervalos de habilidad.k{\textstyle k}para un elemento específico. El estimador común de la razón de probabilidades se denotaαMETROH{\textstyle \alpha _{MH}}y se puede calcular mediante la siguiente ecuación: αMETROH=(AkDk/nortek)(Bkdok/nortek){\displaystyle \alpha _{MH}={\frac {\sum (A_{k}D_{k}/N_{k})}{\sum (B_{k}C_{k}/N_{k})}}} para todos los valores dek{\textstyle k}y dóndenortek{\textstyle N_{k}}representa el tamaño total de la muestra en elk{\textstyle k}intervalo.

El obtenidoαMETROH{\textstyle \alpha _{MH}}a menudo se estandariza mediante una transformación logarítmica, centrando el valor alrededor de 0. [ 16 ] El nuevo estimador transformadoMETROHDDIF{\textstyle {MH}_{D-DIF}}se calcula de la siguiente manera: METROHDDIF=2.35lnαMETROH{\displaystyle {MH}_{D-DIF}=-2.35\ln \alpha _{MH}} Por lo tanto, un valor de 0 indicaría la ausencia de DIF. Al examinar la ecuación, es importante tener en cuenta que el signo menos modifica la interpretación de los valores menores o mayores que 0. Los valores menores que 0 indican una ventaja para el grupo de referencia, mientras que los valores mayores que 0 indican una ventaja para el grupo focal.

teoría de respuesta al ítem

La teoría de respuesta al ítem (TRI) es otro método ampliamente utilizado para evaluar el DIF (funcionamiento diferencial del ítem). La TRI permite un examen crítico de las respuestas a ítems específicos de una prueba o medida. Como se mencionó anteriormente, el DIF examina la probabilidad de responder correctamente o respaldar un ítem condicionado al rasgo o habilidad latente. Debido a que la TRI examina la relación monótona entre las respuestas y el rasgo o habilidad latente, es un enfoque apropiado para examinar el DIF. [ 17 ]

Tres ventajas principales del uso de IRT en la detección de DIF son: [ 18 ]

  • En comparación con la teoría clásica de los tests , las estimaciones de los parámetros de la TRI no se ven tan afectadas por las características de la muestra.
  • Las propiedades estadísticas de los ítems pueden expresarse con mayor precisión, lo que aumenta la exactitud de la interpretación del DIF entre dos grupos.
  • Estas propiedades estadísticas de los elementos pueden expresarse gráficamente, lo que mejora la interpretabilidad y la comprensión de cómo los elementos funcionan de manera diferente entre los grupos.

En relación con el DIF (funcionamiento diferencial del ítem), las estimaciones de los parámetros de los ítems se calculan y se analizan gráficamente mediante curvas características de los ítems (CCI), también conocidas como líneas de traza o funciones de respuesta de los ítems (FRI). Tras el análisis de las CCI y la consiguiente sospecha de DIF, se implementan procedimientos estadísticos para comprobar las diferencias entre las estimaciones de los parámetros.

Los CCI representan funciones matemáticas de la relación entre la posición en el continuo del rasgo latente y la probabilidad de dar una respuesta particular. [ 19 ] La Figura 3 ilustra esta relación como una función logística . Los individuos con menor puntuación en el rasgo latente o con menor habilidad tienen menor probabilidad de obtener una respuesta correcta o de respaldar un ítem, especialmente a medida que aumenta la dificultad. Por lo tanto, aquellos con mayor puntuación en el rasgo latente o en habilidad tienen mayor probabilidad de dar una respuesta correcta o de respaldar un ítem. Por ejemplo, en un inventario de depresión, los individuos con alta depresión tendrían mayor probabilidad de respaldar un ítem que los individuos con menor depresión. De manera similar, los individuos con mayor habilidad matemática tienen mayor probabilidad de obtener correctamente un ítem matemático que aquellos con menor habilidad.

Otro aspecto crítico de los CCI se refiere al punto de inflexión . Este es el punto en la curva donde la probabilidad de una respuesta particular es 0,5 y también representa el valor máximo para la pendiente . [ 20 ] Este punto de inflexión indica dónde la probabilidad de una respuesta correcta o de respaldar un elemento se vuelve mayor que el 50%, excepto cuando undo{\textstyle c}El parámetro es mayor que 0, lo que sitúa el punto de inflexión en1+do/2{\textstyle 1+c/2}(A continuación se presenta una descripción). El punto de inflexión está determinado por la dificultad del ítem, que corresponde a valores en el continuo de habilidad o rasgo latente. [ 21 ] Por lo tanto, para un ítem fácil, este punto de inflexión puede estar más bajo en el continuo de habilidad, mientras que para un ítem difícil puede estar más alto en la misma escala.

Antes de presentar los procedimientos estadísticos para probar las diferencias de los parámetros de los ítems, es importante primero proporcionar una comprensión general de los diferentes modelos de estimación de parámetros y sus parámetros asociados. Estos incluyen los modelos logísticos (PL) de uno, dos y tres parámetros. Todos estos modelos asumen un único rasgo latente subyacente o habilidad. Los tres modelos tienen un parámetro de dificultad del ítem denotado b . Para los modelos 1PL y 2PL, el parámetro b corresponde al punto de inflexión en la escala de habilidad, como se mencionó anteriormente. En el caso del modelo 3PL, el punto de inflexión corresponde a1+do/2{\textstyle 1+c/2}dóndedo{\textstyle c}es una asíntota inferior (que se analiza más adelante). Los valores de dificultad, en teoría, pueden variar de -∞ a +∞; sin embargo, en la práctica rara vez superan ±3. Los valores más altos indican ítems de prueba más difíciles. Los ítems que presentan valores bajosb{\textstyle b}Los parámetros son elementos de prueba fáciles. [ 22 ]

Otro parámetro que se estima es un parámetro de discriminación designadoa{\textstyle a}Este parámetro se refiere a la capacidad de un elemento para discriminar entre individuos.a{\textstyle a}El parámetro se estima en los modelos 2PL y 3PL. En el caso del modelo 1PL, este parámetro está restringido a ser igual entre grupos. En relación con los ICC, ela{\textstyle a}El parámetro es la pendiente del punto de inflexión. Como se mencionó anteriormente, la pendiente es máxima en el punto de inflexión.a{\textstyle a}parámetro, similar alb{\textstyle b}El parámetro puede variar de -∞ a +∞; sin embargo, los valores típicos son menores que 2. En este caso, un valor más alto indica una mayor discriminación entre individuos. [ 23 ]

El modelo 3PL tiene un parámetro adicional denominado parámetro de adivinación o pseudoazar y se denota pordo{\textstyle c}Esto corresponde a una asíntota inferior que esencialmente permite la posibilidad de que un individuo obtenga correctamente un ítem moderado o difícil incluso si tiene poca habilidad. Valores parado{\textstyle c}varían entre 0 y 1, sin embargo, normalmente caen por debajo de 0,3. [ 24 ]

Al aplicar procedimientos estadísticos para evaluar el DIF,a{\textstyle a}yb{\textstyle b}Los parámetros (discriminación y dificultad) son de particular interés. Sin embargo, supongamos que se utilizó un modelo 1PL, donde ela{\textstyle a}Los parámetros están restringidos a ser iguales para ambos grupos, dejando solo la estimación de lab{\textstyle b}parámetros. Después de examinar los ICC, hay una diferencia aparente enb{\textstyle b}parámetros para ambos grupos. Utilizando un método similar a una prueba t de Student , el siguiente paso es determinar si la diferencia en la dificultad es estadísticamente significativa . Bajo la hipótesis nula H0:br=bF{\textstyle H_{0}:b_{r}=b_{f}}Lord (1980) proporciona un estadístico de prueba fácilmente calculable y con distribución normal . d=brbFSE(brbF){\displaystyle d={\frac {b_{r}-b_{f}}{{\text{SE}}(b_{r}-b_{f})}}} El error estándar de la diferencia entre los parámetros b se calcula mediante [SE(br)]2+[SE(bF)]2{\textstyle {\sqrt {\left[{\text{SE}}(b_{r})\right]^{2}+\left[{\text{SE}}(b_{f})\right]^{2}}}}

Estadístico de Wald

Sin embargo, en la mayoría de los casos, un modelo 2PL o 3PL es más apropiado que ajustar un modelo 1PL a los datos y, por lo tanto, ambosa{\textstyle a}yb{\textstyle b}Los parámetros deben ser probados para DIF. Lord (1980) propuso otro método para probar las diferencias en ambosa{\textstyle a}yb{\textstyle b}parámetros, dondedo{\textstyle c}Los parámetros están restringidos a ser iguales entre los grupos. Esta prueba produce un estadístico de Wald que sigue una distribución chi-cuadrado. En este caso, la hipótesis nula que se está probando es H0:ar=aFybr=bF{\textstyle H_{0}:a_{r}=a_{f}\operatorname {y} b_{r}=b_{f}}.

Primero, se calcula una matriz de covarianza  de 2 ×  2 de las estimaciones de los parámetros para cada grupo que están representados porSr{\textstyle S_{r}}ySF{\textstyle S_{f}}para los grupos de referencia y focales. Estas matrices de covarianza se calculan invirtiendo las matrices de información obtenidas . A continuación, las diferencias entre los parámetros estimados se colocan en un vector de 2  ×  1 y se denota por V=(araF,brbF){\textstyle V'=(a_{r}-a_{f},b_{r}-b_{f})}A continuación, la matriz de covarianza.S{\textstyle S}se estima sumandoSr{\textstyle S_{r}}ySF{\textstyle S_{f}}Utilizando esta información, el estadístico de Wald se calcula de la siguiente manera: χ2=VS1V{\displaystyle \chi ^{2}={V'}S^{-1}V} que se evalúa con 2 grados de libertad .

Prueba de razón de verosimilitud

La prueba de razón de verosimilitud es otro método basado en la TRI para evaluar el DIF. Este procedimiento implica comparar la razón de dos modelos. Bajo el modeloMETROdo{\textstyle M_{c}}Los parámetros de los ítems están restringidos a ser iguales o invariables entre los grupos de referencia y focales. Bajo el modeloMETROv{\textstyle M_{v}}Los parámetros de los ítems pueden variar libremente. [ 25 ] La función de verosimilitud bajoMETROdo{\textstyle M_{c}}se denotaLdo{\textstyle L_{c}}mientras que la función de probabilidad bajoMETROv{\textstyle M_{v}}se designaLv{\textstyle L_{v}}Los elementos que deben ser iguales sirven como elementos de referencia para este procedimiento, mientras que a los elementos sospechosos de DIF se les permite variar libremente.

Al utilizar elementos de referencia y permitir que varíen los parámetros de los elementos restantes, se pueden evaluar simultáneamente varios elementos para detectar DIF. [ 26 ] Sin embargo, si la razón de verosimilitud indica un posible DIF, sería apropiado realizar un análisis elemento por elemento para determinar qué elementos, si no todos, contienen DIF.

La razón de verosimilitud de los dos modelos se calcula mediante GRAMO2=2ln[Lv/Ldo]{\displaystyle G^{2}=2\ln \left[L_{v}/L_{c}\right]} Alternativamente, la relación puede expresarse mediante GRAMO2=2ln[Ldo/Lv]{\displaystyle G^{2}=-2\ln \left[L_{c}/L_{v}\right]} dóndeLv{\textstyle L_{v}}yLdo{\textstyle L_{c}}están invertidos y su logaritmo es negado.

GRAMO2{\textstyle G^{2}}aproximadamente sigue una distribución chi cuadrado, especialmente con muestras más grandes. Por lo tanto, se evalúa mediante los grados de libertad que corresponden al número de restricciones necesarias para derivar el modelo restringido del modelo libremente variable. [ 27 ] Por ejemplo, si se utiliza un modelo 2PL y ambosa{\textstyle a}yb{\textstyle b}Los parámetros pueden variar libremente.METROv{\textstyle M_{v}}y estos mismos dos parámetros están restringidos enMETROdo{\textstyle M_{c}}, entonces la razón se evalúa con 2 grados de libertad.

Regresión logística

Los enfoques de regresión logística para la detección de DIF implican realizar un análisis separado para cada ítem. Las variables independientes incluidas en el análisis son la pertenencia a un grupo, una variable de correspondencia de habilidad (generalmente una puntuación total) y un término de interacción entre ambas. La variable dependiente de interés es la probabilidad de obtener una respuesta correcta o de respaldar un ítem. Dado que el resultado de interés se expresa en términos de probabilidades, la estimación de máxima verosimilitud es el procedimiento apropiado. [ 28 ] Este conjunto de variables se puede expresar mediante la siguiente ecuación de regresión: Y=β0+β1METRO+β2GRAMO+β3METROGRAMO{\displaystyle Y=\beta _{0}+\beta _{1}M+\beta _{2}G+\beta _{3}MG} dóndeβ0{\textstyle \beta _{0}}corresponde a la intersección o la probabilidad de una respuesta cuandoMETRO{\textstyle M}yGRAMO{\textstyle G}son iguales a 0 con los restantesβs{\textstyle \beta _{s}}correspondientes a los coeficientes de ponderación para cada variable independiente . La primera variable independiente,METRO{\textstyle M}, es la variable de emparejamiento utilizada para vincular individuos en función de su capacidad, en este caso una puntuación total en una prueba, similar a la empleada por el procedimiento de Mantel-Haenszel. La variable de pertenencia al grupo se denotaGRAMO{\textstyle G}y en el caso de la regresión se representa mediante variables codificadas ficticias . El término finalMETROGRAMO{\textstyle MG}corresponde a la interacción entre las dos variables mencionadas anteriormente.

Para este procedimiento, las variables se introducen jerárquicamente. Siguiendo la estructura de la ecuación de regresión proporcionada anteriormente, las variables se introducen en la siguiente secuencia: variable coincidenteMETRO{\textstyle M}, variable de agrupaciónGRAMO{\textstyle G}y la variable de interacciónMETROGRAMO{\textstyle MG}La determinación del DIF se realiza evaluando el estadístico chi-cuadrado obtenido con 2 grados de libertad. Adicionalmente, se comprueba la significancia de la estimación del parámetro.

Según los resultados de la regresión logística, se indicaría DIF si los individuos con habilidades similares tienen probabilidades significativamente diferentes de responder a un ítem y, por lo tanto, curvas de regresión logística diferentes. Por el contrario, si las curvas para ambos grupos son iguales, entonces el ítem no está sesgado y, por lo tanto, no hay DIF. En términos de DIF uniforme y no uniforme, si las intersecciones y los parámetros de la variable de emparejamiento para ambos grupos no son iguales, entonces hay evidencia de DIF uniforme. Sin embargo, si hay un parámetro de interacción distinto de cero, esto es un indicio de DIF no uniforme. [ 29 ]

Consideraciones

Tamaño de la muestra

La primera consideración se refiere al tamaño de la muestra, específicamente en lo que respecta a los grupos de referencia y focales. Antes de cualquier análisis, generalmente se conoce información sobre el número de personas en cada grupo, como el número de hombres/mujeres o miembros de grupos étnicos/raciales. Sin embargo, la cuestión radica más bien en si el número de personas por grupo es suficiente para tener la potencia estadística necesaria para identificar el DIF (funcionamiento diferencial del ítem). En algunos casos, como en el de la etnia, puede haber evidencia de tamaños de grupo desiguales, de modo que los blancos representen una muestra mucho mayor que cada grupo étnico individual representado. Por lo tanto, en tales casos, puede ser apropiado modificar o ajustar los datos para que los grupos que se comparan para detectar el DIF sean, de hecho, iguales o de tamaño similar.

La codificación ficticia o la recodificación es una práctica común para ajustar las disparidades en el tamaño del grupo de referencia y el grupo focal. En este caso, todos los grupos étnicos no blancos pueden agruparse para obtener un tamaño de muestra relativamente igual para ambos grupos. Esto permitiría una comparación del funcionamiento de los ítems entre grupos mayoritarios y minoritarios. Si no se realizan modificaciones y no se llevan a cabo procedimientos de DIF (funcionamiento diferencial de los ítems), es posible que no haya suficiente potencia estadística para identificar el DIF, incluso si existe entre los grupos.

Otro aspecto relacionado con el tamaño de la muestra se vincula directamente con el procedimiento estadístico utilizado para detectar el DIF (funcionamiento diferencial del ítem). Además de las consideraciones sobre el tamaño de la muestra de los grupos de referencia y focales, se deben cumplir ciertas características de la muestra misma para satisfacer los supuestos de cada prueba estadística utilizada en la detección del DIF.

Por ejemplo, el uso de enfoques de la Teoría de Respuesta al Ítem (TRI) puede requerir muestras más grandes que las necesarias para el procedimiento de Mantel-Haenszel. Esto es importante, ya que el análisis del tamaño del grupo puede orientar la elección entre un procedimiento u otro. En el enfoque de regresión logística, los valores apalancados y los valores atípicos son motivo de especial preocupación y deben examinarse antes de la detección de DIF (funcionamiento diferencial del ítem). Además, como en todos los análisis, deben cumplirse los supuestos de las pruebas estadísticas. Algunos procedimientos son más robustos ante violaciones menores, mientras que otros no tanto. Por lo tanto, se debe investigar la naturaleza de la distribución de las respuestas de la muestra antes de implementar cualquier procedimiento de DIF.

Elementos

Es fundamental determinar el número de ítems que se utilizarán para la detección de DIF. No existe un estándar sobre cuántos ítems deben usarse para la detección de DIF, ya que esto varía de un estudio a otro. En algunos casos, puede ser apropiado analizar todos los ítems para detectar DIF, mientras que en otros no es necesario. Si solo se sospecha de DIF en ciertos ítems con una justificación adecuada, entonces puede ser más apropiado analizar esos ítems y no el conjunto completo. Sin embargo, a menudo es difícil simplemente asumir qué ítems pueden ser problemáticos. Por esta razón, se suele recomendar examinar simultáneamente todos los ítems de la prueba para detectar DIF. Esto proporcionará información sobre todos los ítems, lo que permitirá identificar tanto los ítems problemáticos como aquellos que funcionan de manera similar para los grupos de referencia y focal.

En lo que respecta a las pruebas estadísticas, algunos procedimientos, como la prueba de razón de verosimilitud IRT, requieren el uso de ítems de referencia. Algunos ítems se restringen para que sean iguales entre los grupos, mientras que los ítems sospechosos de DIF pueden variar libremente. En este caso, solo un subconjunto se identificaría como ítems DIF, mientras que el resto serviría como grupo de comparación para la detección de DIF. Una vez identificados los ítems DIF, los ítems de referencia también pueden analizarse restringiendo los ítems DIF originales y permitiendo que los ítems de referencia originales varíen libremente.

Por lo tanto, parece que evaluar todos los ítems simultáneamente podría ser un procedimiento más eficiente. Sin embargo, como se mencionó, según el procedimiento implementado, se utilizan diferentes métodos para seleccionar los ítems con DIF (funcionamiento diferencial del ítem).

Además de identificar el número de ítems que se utilizan en la detección de DIF, es de importancia adicional determinar el número de ítems en toda la prueba o medida en sí. La recomendación típica, como señala Zumbo (1999) [ 30 ] , es tener un mínimo de 20 ítems. El razonamiento para un mínimo de 20 ítems se relaciona directamente con la formación de criterios de emparejamiento. Como se señaló en secciones anteriores, una puntuación total de la prueba se utiliza normalmente como método para emparejar individuos en función de su capacidad. La puntuación total de la prueba se divide normalmente en 3 a 5 niveles de capacidad (k{\textstyle k}) que luego se utiliza para emparejar a los individuos según su habilidad antes de los procedimientos de análisis DIF. El uso de un mínimo de 20 ítems permite una mayor varianza en la distribución de las puntuaciones, lo que da como resultado grupos de nivel de habilidad más significativos.

Aunque las propiedades psicométricas del instrumento deberían haberse evaluado antes de su uso, es importante que la validez y la fiabilidad del mismo sean adecuadas. Los ítems de la prueba deben medir con precisión el constructo de interés para derivar grupos de nivel de habilidad significativos. Por supuesto, no se desea inflar los coeficientes de fiabilidad simplemente añadiendo ítems redundantes. La clave es tener una medida válida y fiable con suficientes ítems para desarrollar grupos de emparejamiento significativos. Gadermann et al. (2012), [ 31 ] Revelle y Zinbarg (2009), [ 32 ] y John y Soto (2007) [ 33 ] ofrecen más información sobre enfoques modernos para la validación estructural y métodos más precisos y apropiados para evaluar la fiabilidad.

Equilibrar la estadística y el razonamiento

Como en toda investigación psicológica y evaluación psicométrica, la estadística desempeña un papel fundamental, pero de ninguna manera debe ser la única base para las decisiones y conclusiones alcanzadas. El juicio razonado es de vital importancia al evaluar ítems para detectar DIF. Por ejemplo, dependiendo del procedimiento estadístico utilizado para la detección de DIF, pueden obtenerse resultados diferentes. Algunos procedimientos son más precisos, mientras que otros no tanto. Por ejemplo, el procedimiento de Mantel-Haenszel requiere que el investigador construya niveles de habilidad basados ​​en las puntuaciones totales de la prueba, mientras que la TRI ubica de manera más efectiva a los individuos a lo largo del continuo de rasgos latentes o habilidades. Por lo tanto, un procedimiento puede indicar DIF para ciertos ítems, mientras que otros no.

Otro problema es que a veces se puede observar DIF, pero no hay una razón clara para su existencia. Aquí es donde entra en juego el juicio razonado, especialmente al comprender por qué se produce el DIF uniforme y el no uniforme. [ 15 ] El investigador debe usar el sentido común para interpretar los análisis de DIF. No basta con informar que los ítems funcionan de manera diferente para los grupos; se requiere un razonamiento cualitativo que explique por qué ocurre.

El DIF uniforme se produce cuando existe una ventaja constante para un grupo en comparación con otro en todos los niveles de habilidad. Este tipo de sesgo suele corregirse utilizando normas de evaluación independientes para cada grupo, garantizando así la equidad en la evaluación. Por otro lado, el DIF no uniforme es más complejo, ya que la ventaja varía según el nivel de habilidad de cada individuo. Factores como el estatus socioeconómico, las diferencias culturales, las barreras lingüísticas y las disparidades en el acceso al conocimiento pueden contribuir al DIF no uniforme. Identificar y abordar el DIF no uniforme requiere una comprensión más profunda de los procesos cognitivos subyacentes y puede requerir intervenciones personalizadas para garantizar prácticas de evaluación justas.

En los estudios de DIF (funcionamiento diferencial de ítems), es común encontrar ítems que presentan este problema, lo que indica posibles dificultades que requieren análisis. Sin embargo, la evidencia de DIF no implica automáticamente que toda la prueba sea injusta. En cambio, señala que algunos ítems específicos pueden estar sesgados, lo que exige atención para mantener la integridad y la equidad de la prueba para todos los examinados. Identificar ítems con DIF brinda la oportunidad de revisar y, potencialmente, modificar o eliminar los ítems problemáticos, garantizando así prácticas de evaluación equitativas. Por lo tanto, el análisis de DIF constituye una herramienta valiosa para el análisis de ítems , especialmente cuando se complementa con una exploración cualitativa de los factores causales.

Software estadístico

A continuación se muestran programas estadísticos comunes capaces de realizar los procedimientos aquí descritos. Al hacer clic en «Lista de paquetes estadísticos» , accederá a una lista completa de software estadístico de código abierto, dominio público, gratuito y propietario.

Procedimiento de Mantel-Haenszel

Procedimientos basados ​​en la TRI

Regresión logística

Véase también

Referencias

  1. "Consejo Nacional de Medición en Educación" . Archivado del original el 22 de julio de 2017.
  2. De Leo, Joseph A.; Van Dam, Nicholas T.; Hobkirk, Andréa L.; Earleywine, Mitch (2011-04-01). "Examen del sesgo en la Escala de búsqueda de sensaciones impulsivas (ImpSS) mediante el funcionamiento diferencial de los ítems (DIF): un análisis de respuesta a los ítems" (PDF) . Personality and Individual Differences . 50 (5): 570– 576. doi : 10.1016/j.paid.2010.11.030 . ISSN 0191-8869 . 
  3. Zumbo, BD (2007). "Tres generaciones de análisis de funcionamiento diferencial de ítems (DIF): Considerando dónde ha estado, dónde está ahora y hacia dónde va". Language Assessment Quarterly . 4 : 223–233 . doi : 10.1080/15434300701375832 .
  4. 1 2 Camilli, G. (2006). "Justicia en las pruebas" (PDF) . En Brennan, RL (ed.). Medición educativa (4.ª ed.). Westport, CT: American Council on Education. pp. 220–256 . ISBN   978-0-275-98125-9.
  5. Holland, PW; Wainer, H. (1993). Funcionamiento diferencial de los ítems . Hillsdale, NJ: Lawrence Erlbaum. doi : 10.4324/9780203357811 . ISBN 0805809724.
  6. Osterlind, SJ; Everson, HT (2009). Funcionamiento diferencial de los ítems . Thousand Oaks, CA: Sage Publishing. ISBN 9781412954945.
  7. Ackerman, T. (1992). "Una explicación didáctica del sesgo del ítem, el impacto del ítem y la validez del ítem desde una perspectiva multidimensional" (PDF) . Journal of Educational Measurement . 29 : 674–691 . doi : 10.1111/j.1745-3984.1992.tb00368.x .
  8. Lord, FM (1980). Aplicaciones de la teoría de respuesta al ítem a problemas prácticos de evaluación . Hillsdale, NJ: Lawrence Erlbaum. doi : 10.4324/9780203056615 . ISBN 0-89859-006-X.
  9. 1 2 Millsap, RE; Everson, HT (1993). "Revisión metodológica: Enfoques estadísticos para evaluar el sesgo de medición" (PDF) . Medición psicológica aplicada . 17 (4): 297– 334. Archivado del original (PDF) el 24 de abril de 2024.
  10. Walker, C. (2011). "¿Qué es el DIF? Por qué los análisis de funcionamiento diferencial de los ítems son una parte importante del desarrollo y la validación de instrumentos". Journal of Psychoeducational Assessment . 29 : 364–376 . doi : 10.1177/0734282911406666 .
  11. Mellenbergh, GJ (1982). "Modelos de tablas de contingencia para evaluar el sesgo de los ítems". Journal of Educational Statistics . 7 : 105–118 . doi : 10.3102/10769986007002105 .
  12. Walker, CM; Beretvas, SN; Ackerman, TA (2001). "Un examen de las variables de condicionamiento utilizadas en las pruebas adaptativas por computadora para DIF" . Medición Aplicada en Educación . 14 : 3–16 . doi : 10.1207/S15324818AME1401_02 .
  13. Mantel, N.; Haenszel, W. (1959). "Aspectos estadísticos del análisis de datos de estudios retrospectivos de enfermedades" (PDF) . Journal of the National Cancer Institute . 22 : 719–748 .
  14. Marascuilo, LA; Slaughter, RE (1981). "Procedimientos estadísticos para identificar posibles fuentes de sesgo de ítems basados ​​en estadísticas de 2 x 2". Journal of Educational Measurement . 18 (4): 229– 248. doi : 10.1177/014662169301700401 .
  15. 1 2 Holland, PW; Thayer, DT (1988). "Rendimiento diferencial de los ítems y el procedimiento de Mantel-Haenszel" (PDF) . En Wainer, H.; Braun, HI (eds.). Validez de las pruebas . Hillsdale, NJ: Erlbaum. pp. 129–145 . ISBN  9780203056905.
  16. Dorans, NJ; Holland, PW (1993). "Detección y descripción de DIF: Mantel-Haenszel y estandarización" (PDF) . En Holland, PW; Wainer, H. (eds.). Funcionamiento diferencial de los ítems . Hillsdale, NJ: Erlbaum. pp. 35–66 . ISBN  0805809724.
  17. Steinberg, L.; Thissen, D. (2006). "Uso de tamaños del efecto para la presentación de informes de investigación: ejemplos que utilizan la teoría de respuesta al ítem para analizar el funcionamiento diferencial de los ítems". Métodos Psicológicos . 11 (4): 402– 415. doi : 10.1037/1082-989X.11.4.402 .
  18. Camilli, G.; Shepard, L. (1994). Métodos para identificar ítems de prueba sesgados . Thousand Oaks, CA: Sage. ISBN 978-0-8039-4415-2.
  19. Reise, SP; Ainsworth, AT; Haviland, MG (2005). "Teoría de respuesta al ítem: Fundamentos, aplicaciones y promesas en la investigación psicológica" . Current Directions in Psychological Science . 14 : 95–101 . doi : 10.1111/j.0963-7214.2005.00342.x .
  20. Edelen, MO; Reeve, BB (2007). "Aplicación del modelado de la teoría de respuesta al ítem (TRI) al desarrollo, evaluación y perfeccionamiento de cuestionarios" (PDF) . Quality of Life Research . 16 : 5–18 . doi : 10.1007/s11136-007-9198-0 .
  21. DeMars, C. (2010). Teoría de respuesta al ítem . Nueva York: Oxford Press. ISBN 978-0-19-537703-3.
  22. Harris, D. (1989). "Comparación de modelos IRT de 1, 2 y 3 parámetros" (PDF) . Educational Measurement: Issues and Practice . 8 : 35–41 . doi : 10.1111/j.1745-3992.1989.tb00313.x . Archivado del original (PDF) el 16 de marzo de 2025.
  23. Baker, FB (2001). Los fundamentos de la teoría de respuesta al ítem (PDF) . ERIC Clearinghouse on Assessment and Evaluation. ISBN 1-886047-03-0.
  24. Birnbaum, A. (1968). «Algunos modelos de rasgos latentes y su uso para inferir la capacidad de un examinado». En Lord, FM; Novick, MR (eds.). Teorías estadísticas de las puntuaciones de las pruebas mentales . Reading, MA: Addison-Wesley. pp. 395–479 . ISBN  9780394347714.
  25. Thissen, D.; Steinberg, L.; Gerrard, M. (1986). "Más allá de las diferencias grupales: El concepto de sesgo" . Psychological Bulletin . 99 : 118–128 . doi : 10.1037/0033-2909.99.1.118 .
  26. IRTPRO: Guía del usuario (PDF) . Lincolnwood, IL: Scientific Software International, Inc. 2011.
  27. Thissen, D.; Steinberg, L.; Wainer, H. (1993). "Detección del funcionamiento diferencial de los ítems mediante los parámetros de los modelos de respuesta a los ítems" . En Holland, PW; Wainer, H. (eds.). Funcionamiento diferencial de los ítems . Hillsdale, NJ: Lawrence Erlbaum. pp. 67–113 . ISBN  0805809724.
  28. Bock, RD (1975). Métodos estadísticos multivariados . Nueva York: McGraw-Hill. ISBN 978-0-07-006305-1.
  29. Swaminathan, H.; Rogers, HJ (1990). "Detección de funcionamiento diferencial de ítems mediante procedimientos de regresión logística". Journal of Educational Measurement . 27 : 361–370 . doi : 10.1111/j.1745-3984.1990.tb00754.x .
  30. Zumbo, BD (1999). Un manual sobre la teoría y los métodos del funcionamiento diferencial de los ítems (DIF) . Ottawa, Canadá: Dirección de Investigación y Evaluación de Recursos Humanos, NDHQ .
  31. Gadermann, AM; Guhn, M.; Zumbo, BD (2012). "Estimación de la fiabilidad ordinal para datos de respuesta a ítems de tipo Likert y ordinales: una guía conceptual, empírica y práctica" (PDF) . Practical Assessment, Research & Evaluation . 17 (3): 1– 13. doi : 10.7275/n560-j767 .
  32. ^ Revelle, W.; Zinbarg, RE (2009). "Coeficientes alfa, beta, omega y GLB: comentarios sobre Sijtsma" (PDF) . Psicometrika . 74 (1): 145– 154. doi : 10.1007/s11336-008-9102-z .
  33. John, OP; Soto, CJ (2007). «La importancia de la validez: fiabilidad y el proceso de validación de constructos» . En Robins, RW; Fraley, RC; Krueger, RF (eds.). Manual de métodos de investigación en psicología de la personalidad (PDF) . Nueva York, NY: Cambridge University Press. pp. 461–494 . ISBN  978-1-59385-111-8.
  34. 1 2 3 Magis, David; Béland, Sébastien; Tuerlinckx, Francisco; De Boeck, Paul (2010). "Un marco general y un paquete R para la detección del funcionamiento diferencial dicotómico de elementos" . Métodos de investigación del comportamiento . 42 (3): 847–862.doi : 10.3758 / BRM.42.3.847 . PMID 20805607 . 
  35. Chalmers, RP (2012). "mirt: Un paquete de teoría de respuesta al ítem multidimensional para el entorno R" . Journal of Statistical Software . 48 (6): 1– 29. doi : 10.18637/jss.v048.i06 .