En estadística y psicometría , la fiabilidad es la ausencia de error de medición en una medida. [ 1 ] En la Teoría Clásica de los Tests , la fiabilidad es la proporción de la variación observada en la puntuación de la prueba debida a la variación "verdadera" de la puntuación. Una medida con alta fiabilidad tiende a producir mediciones similares en condiciones consistentes:
Es una característica de un conjunto de puntuaciones de prueba que se relaciona con la cantidad de error aleatorio del proceso de medición que podría estar presente en las puntuaciones. Las puntuaciones altamente fiables son precisas, reproducibles y consistentes de una ocasión de prueba a otra. Es decir, si el proceso de prueba se repitiera con un grupo de examinados, se obtendrían esencialmente los mismos resultados. Se suelen utilizar diversos tipos de coeficientes de fiabilidad, con valores que oscilan entre 0,00 (error elevado) y 1,00 (sin error), para indicar la cantidad de error en las puntuaciones. [ 2 ]
Por ejemplo, las mediciones de altura y peso de las personas suelen ser extremadamente fiables. [ 3 ] [ 4 ]
Tipos
Existen varias clases generales de estimaciones de fiabilidad:
- La fiabilidad entre evaluadores evalúa el grado de acuerdo entre dos o más evaluadores en sus valoraciones. Por ejemplo, una persona tiene dolor de estómago y diferentes médicos dan el mismo diagnóstico. [ 5 ] : 71
- La fiabilidad test-retest evalúa el grado en que las puntuaciones de una prueba son consistentes entre administraciones sucesivas. Las mediciones se obtienen de un único evaluador que utiliza los mismos métodos o instrumentos y las mismas condiciones de prueba. [ 4 ] Esto incluye la fiabilidad intraevaluador .
- La fiabilidad intermétodo evalúa el grado de consistencia de las puntuaciones de las pruebas cuando existe una variación en los métodos o instrumentos utilizados. Esto permite descartar la fiabilidad interevaluador. Cuando se trata de formularios , puede denominarse fiabilidad de formas paralelas . [ 6 ]
- La fiabilidad de consistencia interna evalúa la consistencia de los resultados entre los ítems de una prueba. [ 6 ]
Diferencia con la validez
La fiabilidad no implica validez . Es decir, una medida fiable que mide algo de forma consistente no necesariamente mide lo que se supone que debe medirse. Por ejemplo, si bien existen muchas pruebas fiables de habilidades específicas, no todas serían válidas para predecir, por ejemplo, el desempeño laboral .
Si bien la fiabilidad no implica validez , sí limita la validez general de una prueba. Una prueba que no es perfectamente fiable no puede ser perfectamente válida, ni como medio para medir atributos de una persona ni como medio para predecir puntuaciones en un criterio. Si bien una prueba fiable puede proporcionar información válida y útil, una prueba que no es fiable no puede ser válida. [ 7 ]
Por ejemplo, si una báscula midiera sistemáticamente el peso de un objeto con 500 gramos más de su peso real, sería muy fiable, pero no válida (ya que el peso que devuelve no es el peso real). Para que la báscula sea válida, debe devolver el peso real del objeto. Este ejemplo demuestra que una medición perfectamente fiable no es necesariamente válida, pero que una medición válida debe ser necesariamente fiable.
Modelo general
En la práctica, las medidas de prueba nunca son perfectamente consistentes. Se han desarrollado teorías de fiabilidad de las pruebas para estimar los efectos de la inconsistencia en la precisión de la medición. El punto de partida básico para casi todas las teorías de fiabilidad de las pruebas es la idea de que las puntuaciones de las pruebas reflejan la influencia de dos tipos de factores: [ 7 ]
- Factores de consistencia: características estables del individuo o del atributo que se intenta medir.
- Factores de inconsistencia: características del individuo o de la situación que pueden afectar las puntuaciones de las pruebas, pero que no tienen nada que ver con el atributo que se está midiendo.
Estos factores incluyen: [ 7 ]
- Características temporales pero generales del individuo: salud, fatiga, motivación, tensión emocional.
- Características temporales y específicas del individuo: comprensión de la tarea específica de la prueba, trucos o técnicas específicas para abordar los materiales particulares de la prueba, fluctuaciones de la memoria, la atención o la precisión.
- Aspectos de la situación de la prueba: ausencia de distracciones, claridad de las instrucciones, interacción de personalidades, etc.
- Factores aleatorios: suerte en la selección de respuestas por mera adivinación, distracciones momentáneas.
El objetivo de estimar la fiabilidad es determinar qué parte de la variabilidad en las puntuaciones de las pruebas se debe a errores de medición y qué parte se debe a la variabilidad en las puntuaciones verdaderas ( valor verdadero ). [ 7 ]
Una puntuación verdadera es la característica reproducible del concepto que se está midiendo. Es la parte de la puntuación observada que se repetiría en diferentes ocasiones de medición en ausencia de error.
Los errores de medición se componen tanto de error aleatorio como de error sistemático . Representan las discrepancias entre las puntuaciones obtenidas en las pruebas y las puntuaciones verdaderas correspondientes.
Esta descomposición conceptual se representa típicamente mediante la siguiente ecuación simple:
donde X es la puntuación observada en la prueba, T es la puntuación verdadera y E es el error de medición.
Teoría clásica de los tests
El objetivo de la teoría de la fiabilidad es estimar los errores de medición y sugerir formas de mejorar las pruebas para minimizar dichos errores.
La premisa central de la teoría de la fiabilidad es que los errores de medición son esencialmente aleatorios. Esto no significa que los errores se originen a partir de procesos aleatorios. Para cualquier individuo, un error de medición no es un evento completamente aleatorio. Sin embargo, en un gran número de individuos, se supone que las causas del error de medición son tan variadas que los errores de medición actúan como variables aleatorias. [ 7 ]
Si los errores poseen las características esenciales de las variables aleatorias, entonces es razonable suponer que tienen la misma probabilidad de ser positivos o negativos, y que no están correlacionados con las puntuaciones reales ni con los errores en otras pruebas.
Se supone que: [ 8 ]
- Error medio de medición = 0
- Las puntuaciones verdaderas y los errores no están correlacionados.
- Los errores en diferentes medidas no están correlacionados.
La teoría de la fiabilidad muestra que la varianza de las puntuaciones obtenidas es simplemente la suma de la varianza de las puntuaciones verdaderas más la varianza de los errores de medición . [ 7 ]
Esta ecuación sugiere que las puntuaciones de las pruebas varían como resultado de dos factores:
- Variabilidad en las puntuaciones verdaderas
- Variabilidad debida a errores de medición.
El coeficiente de fiabilidad proporciona un índice de la influencia relativa de las puntuaciones verdaderas y erróneas en las puntuaciones obtenidas en las pruebas. En su forma general, el coeficiente de fiabilidad se define como la razón entre la varianza de la puntuación verdadera y la varianza total de las puntuaciones de las pruebas. O, equivalentemente, uno menos la razón entre la variación de la puntuación errónea y la variación de la puntuación observada .
Lamentablemente, no existe forma de observar o calcular directamente la puntuación real, por lo que se utilizan diversos métodos para estimar la fiabilidad de una prueba.
Algunos ejemplos de métodos para estimar la fiabilidad incluyen la fiabilidad test-retest , la fiabilidad de consistencia interna y la fiabilidad de pruebas paralelas . Cada método aborda el problema de determinar la fuente de error en la prueba de una manera ligeramente diferente.
teoría de respuesta al ítem
Era bien sabido por los teóricos clásicos de las pruebas que la precisión de la medición no es uniforme en toda la escala de medición. [ 9 ] Las pruebas tienden a distinguir mejor entre los examinados con niveles moderados de rasgos y peor entre los examinados con puntuaciones altas y bajas. La teoría de respuesta al ítem extiende el concepto de fiabilidad de un índice único a una función llamada función de información . La función de información de la TRI es la inversa del error estándar de la puntuación observada condicional en cualquier puntuación dada de la prueba.
Estimación
El objetivo de estimar la fiabilidad es determinar qué parte de la variabilidad en las puntuaciones de las pruebas se debe a errores de medición y qué parte se debe a la variabilidad en las puntuaciones reales.
Se han desarrollado cuatro estrategias prácticas que proporcionan métodos viables para estimar la fiabilidad de las pruebas: [ 7 ]
fiabilidad test-retest
El método de fiabilidad test-retest evalúa directamente el grado de consistencia de las puntuaciones de una prueba en otra. Incluye:
- Administrar una prueba a un grupo de personas
- Volver a administrar la misma prueba al mismo grupo en algún momento posterior.
- Correlacionar el primer conjunto de puntuaciones con el segundo
La correlación entre las puntuaciones de la primera prueba y las puntuaciones de la segunda prueba se utiliza para estimar la fiabilidad de la prueba mediante el coeficiente de correlación producto-momento de Pearson : véase también correlación ítem-total .
Método de formas paralelas
La clave de este método reside en el desarrollo de versiones alternativas de las pruebas que sean equivalentes en cuanto a contenido, procesos de respuesta y características estadísticas. Por ejemplo, existen versiones alternativas para varias pruebas de inteligencia general, y estas pruebas se consideran generalmente equivalentes. [ 7 ]
Con el modelo de prueba paralela es posible desarrollar dos formas de una prueba que sean equivalentes en el sentido de que la puntuación real de una persona en la forma A sería idéntica a su puntuación real en la forma B. Si ambas formas de la prueba se administraran a varias personas, las diferencias entre las puntuaciones de la forma A y la forma B podrían deberse únicamente a errores de medición. [ 7 ] Implica:
- Administrar una forma de la prueba a un grupo de individuos.
- En algún momento posterior, se administró una forma alternativa de la misma prueba al mismo grupo de personas.
- Correlación de las puntuaciones del formulario A con las puntuaciones del formulario B.
La correlación entre las puntuaciones obtenidas en las dos formas alternativas se utiliza para estimar la fiabilidad de la prueba.
Este método ofrece una solución parcial a muchos de los problemas inherentes al método de fiabilidad test-retest . Por ejemplo, dado que las dos versiones de la prueba son diferentes, el efecto de arrastre es menos problemático. Los efectos de reactividad también se controlan parcialmente; si bien realizar la primera prueba puede modificar las respuestas a la segunda. Sin embargo, es razonable suponer que el efecto no será tan fuerte con versiones alternativas de la prueba como con dos administraciones de la misma prueba. [ 7 ]
Sin embargo, esta técnica tiene sus desventajas:
- Puede resultar muy difícil crear varias formas alternativas de una prueba.
- También puede resultar difícil, si no imposible, garantizar que dos formas alternativas de una prueba sean medidas paralelas.
Método de división por la mitad
Este método trata las dos mitades de una medida como formas alternativas. Proporciona una solución sencilla al problema que enfrenta el método de formas paralelas: la dificultad para desarrollar formas alternativas. [ 7 ] Implica:
- Administrar una prueba a un grupo de personas
- Dividir la prueba por la mitad
- Correlacionar las puntuaciones de una mitad de la prueba con las puntuaciones de la otra mitad de la prueba.
La correlación entre estas dos mitades divididas se utiliza para estimar la fiabilidad de la prueba. Esta estimación de fiabilidad de las mitades se extrapola a la longitud total de la prueba utilizando la fórmula de predicción de Spearman-Brown .
Existen varias formas de dividir una prueba para estimar su fiabilidad. Por ejemplo, una prueba de vocabulario de 40 ítems podría dividirse en dos subpruebas: la primera compuesta por los ítems del 1 al 20 y la segunda por los ítems del 21 al 40. Sin embargo, las respuestas de la primera mitad pueden diferir sistemáticamente de las de la segunda debido al aumento de la dificultad de los ítems y a la fatiga. [ 7 ]
Al dividir una prueba, las dos mitades deben ser lo más similares posible, tanto en su contenido como en el estado probable del encuestado. El método más sencillo consiste en adoptar una división par-impar, en la que los ítems impares forman una mitad de la prueba y los pares la otra. Esta disposición garantiza que cada mitad contenga un número igual de ítems del principio, del medio y del final de la prueba original. [ 7 ]
Coherencia interna
La consistencia interna evalúa la consistencia de los resultados entre los ítems de una prueba. La medida de consistencia interna más común es el alfa de Cronbach , que generalmente se interpreta como la media de todos los coeficientes de división por mitades posibles. [ 10 ] El alfa de Cronbach es una generalización de una forma anterior de estimar la consistencia interna, la fórmula de Kuder-Richardson 20. [ 10 ] Aunque es la más utilizada, existen algunas ideas erróneas sobre el alfa de Cronbach. [ 11 ] [ 12 ]
Estas medidas de fiabilidad difieren en su sensibilidad a distintas fuentes de error, por lo que no tienen por qué ser iguales. Además, la fiabilidad es una propiedad de las puntuaciones de una medida, no de la medida en sí, y por ello se dice que depende de la muestra . Las estimaciones de fiabilidad de una muestra pueden diferir de las de una segunda muestra (más allá de lo que cabría esperar debido a las variaciones del muestreo) si la segunda muestra se extrae de una población diferente, ya que la variabilidad real es distinta en esta segunda población. (Esto se aplica a medidas de todo tipo: las reglas de medir pueden ser precisas para medir casas, pero tener poca fiabilidad cuando se utilizan para medir la longitud de los insectos).
La fiabilidad puede mejorarse mediante la claridad de expresión (para evaluaciones escritas), la extensión de la medida [ 10 ] y otros medios informales. Sin embargo, el análisis psicométrico formal, denominado análisis de ítems , se considera la forma más eficaz de aumentar la fiabilidad. Este análisis consiste en el cálculo de los índices de dificultad y discriminación de los ítems , este último mediante el cálculo de las correlaciones entre los ítems y la suma de las puntuaciones de los ítems de toda la prueba. Si los ítems demasiado difíciles, demasiado fáciles o con una discriminación cercana a cero o negativa se sustituyen por ítems mejores, la fiabilidad de la medida aumentará.
- ¿Dónde está la tasa de fallos ?
Nivel de fiabilidad ideal y cómo aumentar la fiabilidad
Esta sección analiza las recomendaciones para la fiabilidad de las puntuaciones de las escalas, la relación entre fiabilidad y validez, y las estrategias para aumentar la fiabilidad de dichas puntuaciones.
Estándares para el nivel de fiabilidad
Una heurística ampliamente citada para la fiabilidad mínima es 0,70, y el libro de texto de Nunnally (1978) [ 13 ] se menciona a menudo como la fuente principal de este estándar. Sin embargo, Nunnally afirmó algo bastante diferente. Estableció una distinción entre las primeras etapas de la investigación básica (donde consideraba suficiente una fiabilidad de 0,70 o superior) y la situación en la que se tomaban decisiones importantes sobre los candidatos (donde «una fiabilidad de 0,90 es la mínima... y una fiabilidad de 0,95 debería considerarse el estándar deseable (p. 246)»).
La recomendación de Nunnally para la toma de decisiones importantes se basaba en la preocupación de que el costo de los errores de falso negativo recae desproporcionadamente sobre los candidatos. Si hay suficientes solicitantes, la organización simplemente contrata a otro candidato o admite a otro estudiante, pero el candidato pierde una oportunidad. Por lo tanto, las recomendaciones de Nunnally pueden interpretarse como una recomendación para la toma de decisiones éticas mediante la evaluación.
Pero no abordó explícitamente ningún "costo" asociado con lograr una alta fiabilidad. Por ejemplo, si una prueba de 50 ítems tiene una fiabilidad de , entonces la longitud de la prueba requerida para una fiabilidad de es de aproximadamente 238 ítems (y los ítems adicionales deben ser comparables a los existentes). Nunnally no explicó cómo una organización financiaría un examen de 238 ítems ni cómo se sentirían los examinados al realizar una prueba de 238 ítems. No discutió si los efectos de la fatiga podrían afectar negativamente las puntuaciones de los candidatos, ni si los períodos de administración de la prueba extremadamente largos podrían perjudicar a ciertas clases de candidatos.
Compromiso con la validez
Un alto valor de fiabilidad puede entrar en conflicto con la validez de contenido si un psicometrista elimina ítems para maximizar una estimación como el coeficiente alfa sin tener en cuenta el contenido de los ítems restantes. Medir repetidamente la misma pregunta de diferentes maneras se utiliza a menudo únicamente para aumentar la fiabilidad, perjudicando la validez de contenido. [ 14 ] [ 15 ]
Compromiso con la eficiencia
Cuando las demás condiciones son iguales, la fiabilidad aumenta a medida que aumenta el número de elementos. Sin embargo, el aumento del número de elementos dificulta la eficacia de las mediciones.
Métodos para aumentar la fiabilidad
Se pueden considerar los siguientes métodos para aumentar la fiabilidad.
Antes de la recopilación de datos :
- Eliminar la ambigüedad del elemento de medición.
- No midas lo que los encuestados no saben. [ 16 ]
- Aumentar el número de artículos.
- Utilice una escala que sea conocida por su alta fiabilidad. [ 17 ]
Después de la recopilación de datos:
- Utilice el análisis de ítems para identificar y eliminar los ítems problemáticos (evitando cuidadosamente dañar la validez del contenido).
Véase también
Referencias
- ↑ Trochim, William MK "Fiabilidad" .
- ↑ «Glosario de evaluación y medición importantes» . Consejo Nacional de Medición en Educación . Archivado del original el 4 de julio de 2015.
- ↑ Carlson, Neil R.; et al. (2009). Psicología : la ciencia del comportamiento (4.ª ed. canadiense). Toronto: Pearson. ISBN 978-0-205-64524-4.
- 1 2 El Consejo de Normas de Responsabilidad de Marketing (MASB) respalda esta definición como parte de su proyecto continuo de Lenguaje Común: Actividades y Métricas de Marketing. Archivado el 12 de febrero de 2013 en Wayback Machine .
- ↑ Durand, V. Mark. (2015). Fundamentos de psicología anormal . [Lugar de publicación no identificado]: Cengage Learning. ISBN 978-1305633681OCLC 884617637
- 1 2 3 4 5 6 7 8 9 10 11 12 13 Davidshofer, Kevin R. Murphy, Charles O. (2005). Pruebas psicológicas : principios y aplicaciones (6.ª ed.). Upper Saddle River, NJ: Pearson/Prentice Hall. ISBN 0-13-189172-3.
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ^ Gulliksen, Harold (1987). Teoría de las pruebas mentales . Hillsdale, Nueva Jersey: L. Erlbaum Associates. ISBN 978-0-8058-0024-1.
- ↑ McNeish, Daniel; Dumas, Denis (10 de febrero de 2025). "Representatividad de la fiabilidad: ¿Qué tan bien resume el coeficiente alfa la fiabilidad en toda la distribución de puntuaciones?" . Behavior Research Methods . 57 (3) 93. doi : 10.3758/s13428-025-02611-8 . ISSN 1554-3528 . PMID 39930303 .
- 1 2 3 Cortina, JM (1993). "¿Qué es el coeficiente alfa? Un examen de la teoría y las aplicaciones" (PDF) . Journal of Applied Psychology . 78 (1): 98– 104. doi : 10.1037/0021-9010.78.1.98 . Archivado (PDF) del original el 5 de agosto de 2023.
- ↑ Ritter, N. (2010). Entendiendo una estadística ampliamente malinterpretada: el alfa de Cronbach . Conferencia de la Asociación de Investigación Educativa del Suroeste (SERA) 2010. Vol. ED526237. Nueva Orleans, LA.
- ↑ Eisinga, R.; Te Grotenhuis, M.; Pelzer, B. (2012). "La fiabilidad de una escala de dos ítems: ¿Pearson, Cronbach o Spearman-Brown?" ( PDF) . Revista Internacional de Salud Pública . 58 (4): 637– 642. doi : 10.1007/s00038-012-0416-3 . hdl : 2066/116735 . PMID 23089674. S2CID 215730043 .
- ↑ Nunnally, JC (1978). Teoría psicométrica (2.ª ed.). McGraw-Hill. ISBN 0-07-047465-6OCLC 926852171
- ↑ Boyle, GJ (1991). "¿La homogeneidad de los ítems indica consistencia interna o redundancia de ítems en las escalas psicométricas?". Personality and Individual Differences . 12 (3): 291– 4. doi : 10.1016/0191-8869(91)90115-R .
- ↑ Streiner, DL (2003). "Empezando por el principio: Una introducción al coeficiente alfa y la consistencia interna". Journal of Personality Assessment . 80 (1): 99– 103. doi : 10.1207/S15327752JPA8001_18 . PMID 12584072. S2CID 3679277 .
- ↑ Beatty, P.; Herrmann, D.; Puskar, C.; Kerwin, J. (julio de 1998).Respuestas "No lo sé" en encuestas: ¿lo que sé es lo que usted quiere saber y quiero que usted lo sepa? Memory (Hove, Inglaterra) . 6 (4): 407–426 . doi : 10.1080/741942605 . ISSN 0965-8211 . PMID 9829099 .
- ↑ Lee, H. (2017). Metodología de la investigación (2.ª ed.), Hakhyunsa.
Enlaces externos
- "Explicación de la fiabilidad y validez internas y externas" . 24 de marzo de 2022.
- "Modelos de incertidumbre, cuantificación de la incertidumbre y procesamiento de la incertidumbre en ingeniería" . Archivado del original el 30 de marzo de 2014.
- "Las relaciones entre los conceptos de correlación y consistencia interna de la fiabilidad de las pruebas" . Archivado del original el 27 de septiembre de 2011. Consultado el 26 de enero de 2006 .
- "El problema de la fiabilidad negativa" . Archivado del original el 27 de septiembre de 2011.
- Comparación de evaluaciones
- Fiabilidad estadística
- Investigación de mercado
- Psicometría
- Análisis de supervivencia