Articulo de referencia

Validez (estadística)

La validez es el grado en que un concepto , conclusión o medición está bien fundamentado y probablemente se corresponde con precisión con el mundo real. [ 1 ] [ 2 ] La palabra «...

La validez es el grado en que un concepto , conclusión o medición está bien fundamentado y probablemente se corresponde con precisión con el mundo real. [ 1 ] [ 2 ] La palabra «válido» deriva del latín validus , que significa fuerte. La validez de un instrumento de medición (por ejemplo, una prueba en educación) es el grado en que el instrumento mide lo que afirma medir. [ 3 ] La validez se basa en la solidez de un conjunto de diferentes tipos de evidencia (por ejemplo, validez aparente, validez de constructo, etc.) que se describen con mayor detalle a continuación.

En psicometría , la validez tiene una aplicación particular conocida como validez de la prueba : "el grado en que la evidencia y la teoría respaldan las interpretaciones de las puntuaciones de las pruebas" ("tal como se deduce de los usos propuestos de las pruebas"). [ 4 ]

Generalmente se acepta que el concepto de validez científica aborda la naturaleza de la realidad en términos de medidas estadísticas y, como tal, constituye una cuestión epistemológica y filosófica , además de una cuestión de medición . El uso del término en lógica es más restringido, ya que se refiere a la relación entre las premisas y la conclusión de un argumento. En lógica, la validez alude a la propiedad de un argumento según la cual, si las premisas son verdaderas, la verdad de la conclusión se deduce necesariamente. La conclusión de un argumento es verdadera si el argumento es sólido, es decir, si el argumento es válido y sus premisas son verdaderas.

Por el contrario, la «validez científica o estadística» no es una afirmación deductiva que necesariamente preserve la verdad, sino una afirmación inductiva que permanece verdadera o falsa de manera indefinida. Por ello, la «validez científica o estadística» es una afirmación que se califica como fuerte o débil en su naturaleza; nunca es necesaria ni absolutamente verdadera. Esto hace que las afirmaciones de «validez científica o estadística» estén sujetas a interpretación en cuanto a lo que, en realidad, significan los hechos.

La validez es importante porque puede ayudar a determinar qué tipos de pruebas utilizar y a garantizar que los investigadores utilicen métodos que no solo sean éticos y rentables, sino también que midan realmente las ideas o constructos en cuestión.

Validez de la prueba

Validez (exactitud)

Validity[5] of an assessment is the degree to which it measures what it is supposed to measure. This is not the same as reliability, which is the extent to which a measurement gives results that are very consistent. Within validity, the measurement does not always have to be similar, as it does in reliability. However, just because a measure is reliable, it is not necessarily valid. E.g. a scale that is 5 pounds off is reliable but not valid. A test cannot be valid unless it is reliable. Validity is also dependent on the measurement measuring what it was designed to measure, and not something else instead.[6] Validity (similar to reliability) is a relative concept; validity is not an all-or-nothing idea. There are many different types of validity.

Construct validity

Construct validity refers to the extent to which operationalizations of a construct (e.g., practical tests developed from a theory) measure a construct as defined by a theory. It subsumes all other types of validity. For example, the extent to which a test measures intelligence is a question of construct validity. A measure of intelligence presumes, among other things, that the measure is associated with things it should be associated with (convergent validity), not associated with things it should not be associated with (discriminant validity).[7]

Construct validity evidence involves the empirical and theoretical support for the interpretation of the construct. Such lines of evidence include statistical analyses of the internal structure of the test including the relationships between responses to different test items. They also include relationships between the test and measures of other constructs. As currently understood, construct validity is not distinct from the support for the substantive theory of the construct that the test is designed to measure. As such, experiments designed to reveal aspects of the causal role of the construct also contribute to constructing validity evidence.[7]

Content validity

Content validity is a non-statistical type of validity that involves "the systematic examination of the test content to determine whether it covers a representative sample of the behavior domain to be measured" (Anastasi & Urbina, 1997 p. 114). For example, does an IQ questionnaire have items covering all areas of intelligence discussed in the scientific literature?

La evidencia de validez de contenido implica el grado en que el contenido de la prueba coincide con un dominio de contenido asociado con el constructo. Por ejemplo, una prueba de la capacidad de sumar dos números debe incluir una gama de combinaciones de dígitos. Una prueba con solo números de un dígito, o solo números pares, no tendría una buena cobertura del dominio de contenido. La evidencia relacionada con el contenido generalmente implica que un experto en la materia (SME) evalúe los ítems de la prueba con respecto a las especificaciones de la prueba. Los expertos deben prestar atención a cualquier diferencia cultural. Por ejemplo, cuando un cuestionario de evaluación de conducción se adapta de Inglaterra (p. ej., DBQ), los expertos deben considerar la conducción por la derecha en Gran Bretaña. Algunos estudios han encontrado que esto será fundamental para obtener un cuestionario válido. [ 8 ] Antes de proceder a la administración final de los cuestionarios, el investigador debe consultar la validez de los ítems con respecto a cada uno de los constructos o variables y, en consecuencia, modificar los instrumentos de medición basándose en la opinión del SME.

Una prueba posee validez de contenido gracias a la cuidadosa selección de los ítems que se incluyen (Anastasi y Urbina, 1997). Los ítems se eligen de manera que cumplan con las especificaciones de la prueba, las cuales se elaboran mediante un examen exhaustivo del dominio del tema. Foxcroft, Paterson, le Roux y Herbst (2004, p.  49) [ 9 ] señalan que, al utilizar un panel de expertos para revisar las especificaciones de la prueba y la selección de ítems, se puede mejorar la validez de contenido de una prueba. Los expertos podrán revisar los ítems y comentar si estos abarcan una muestra representativa del dominio del comportamiento.

Validez aparente

La validez aparente es una estimación de si una prueba parece medir un criterio determinado; no garantiza que la prueba mida realmente fenómenos en ese ámbito. Las medidas pueden tener una alta validez, pero cuando la prueba no parece medir lo que dice medir, tiene una baja validez aparente. De hecho, cuando una prueba es susceptible de simulación , una baja validez aparente podría hacerla más válida. Dado que se pueden obtener respuestas más honestas con una menor validez aparente, a veces es importante aparentar que existe una baja validez aparente al administrar las medidas.

La validez aparente está estrechamente relacionada con la validez de contenido. Mientras que la validez de contenido depende de una base teórica para determinar si una prueba evalúa todos los dominios de un criterio determinado (por ejemplo, ¿evaluar las habilidades de suma proporciona una buena medida de las habilidades matemáticas? Para responder a esto, es necesario saber qué tipos de habilidades aritméticas abarcan las habilidades matemáticas), la validez aparente se refiere a si una prueba parece ser una buena medida o no. Este juicio se basa en la apariencia de la prueba, por lo que incluso una persona sin experiencia puede juzgarla.

La validez aparente es un punto de partida, pero nunca debe asumirse como probablemente válida para ningún propósito dado, ya que los "expertos" se han equivocado antes: el Malleus Malificarum (Martillo de las Brujas) no tenía ningún respaldo para sus conclusiones más allá de la autoproclamada competencia de dos "expertos" en "detección de brujería", sin embargo, se utilizó como "prueba" para condenar y quemar en la hoguera a decenas de miles de hombres y mujeres como "brujos". [ 10 ]

Validez de criterio

La evidencia de validez de criterio implica la correlación entre la prueba y una o varias variables de criterio consideradas representativas del constructo. En otras palabras, compara la prueba con otras medidas o resultados (los criterios) que ya se consideran válidos. Por ejemplo, las pruebas de selección de personal suelen validarse comparándolas con medidas de desempeño laboral (el criterio), y las pruebas de CI suelen validarse comparándolas con medidas de rendimiento académico (el criterio).

Si los datos de la prueba y los datos del criterio se recopilan simultáneamente, se habla de validez concurrente. Si los datos de la prueba se recopilan primero para predecir los datos del criterio que se recopilarán posteriormente, se habla de validez predictiva.

Validez concurrente

La validez concurrente se refiere al grado en que la operacionalización se correlaciona con otras medidas del mismo constructo que se miden simultáneamente. Cuando una medida se compara con otra del mismo tipo, estarán relacionadas (o correlacionadas). Volviendo al ejemplo de la prueba de selección, esto significaría que las pruebas se administran a los empleados actuales y luego se correlacionan con sus puntuaciones en las evaluaciones de desempeño.

Validez predictiva

La validez predictiva se refiere al grado en que la operacionalización puede predecir (o correlacionarse con) otras medidas del mismo constructo que se midan en algún momento futuro. Siguiendo con el ejemplo de la prueba de selección, esto significaría que las pruebas se administran a los solicitantes, todos los solicitantes son contratados, su desempeño se evalúa posteriormente y luego se correlacionan sus puntuaciones en ambas medidas.

Esto también ocurre cuando la medición predice una relación entre lo medido y otra cosa, prediciendo si la otra cosa sucederá o no en el futuro. Una alta correlación entre los resultados predichos ex ante y los resultados reales ex post es la prueba más sólida de validez.

Validez experimental

La validez del diseño de los estudios de investigación experimental es una parte fundamental del método científico [ 2 ] y una preocupación de la ética de la investigación . Sin un diseño válido, no se pueden extraer conclusiones científicas válidas.

Validez de la conclusión estadística

La validez de las conclusiones estadísticas se refiere al grado en que las conclusiones sobre la relación entre variables, basadas en los datos, son correctas o razonables. Inicialmente, esto se centraba únicamente en si la conclusión estadística sobre la relación entre las variables era correcta, pero ahora existe una tendencia hacia conclusiones razonables que utilizan datos cuantitativos, estadísticos y cualitativos. [ 11 ]

La validez de las conclusiones estadísticas implica garantizar el uso de procedimientos de muestreo adecuados, pruebas estadísticas apropiadas y procedimientos de medición fiables. [ 12 ] Dado que este tipo de validez se centra únicamente en la relación que se encuentra entre las variables, dicha relación puede ser simplemente una correlación.

Validez interna

La validez interna es una estimación inductiva del grado en que se pueden extraer conclusiones sobre relaciones causales (por ejemplo, causa y efecto), basándose en las medidas utilizadas, el contexto de la investigación y el diseño general de la misma . Las buenas técnicas experimentales, en las que se estudia el efecto de una variable independiente sobre una variable dependiente en condiciones altamente controladas, suelen permitir mayores grados de validez interna que, por ejemplo, los diseños de caso único.

Existen ocho tipos de variables de confusión que pueden interferir con la validez interna (es decir, con el intento de aislar relaciones causales):

  1. Historial , los eventos específicos que ocurren entre la primera y la segunda medición, además de las variables experimentales.
  2. La maduración son procesos que se producen dentro de los participantes en función del paso del tiempo (no específicos de eventos particulares), por ejemplo, envejecer, tener más hambre, cansarse más, etc.
  3. Pruebas , los efectos de realizar una prueba sobre los resultados de una segunda prueba.
  4. La instrumentación , los cambios en la calibración de un instrumento de medición o los cambios en los observadores o evaluadores pueden producir cambios en las mediciones obtenidas.
  5. Regresión estadística , que se aplica cuando se han seleccionado grupos en función de sus puntuaciones extremas.
  6. Selección , sesgos resultantes de la selección diferencial de encuestados para los grupos de comparación.
  7. Mortalidad experimental , o pérdida diferencial de participantes respecto a los grupos de comparación.
  8. interacción selección-maduración , etc., por ejemplo, en diseños cuasiexperimentales de grupos múltiples.

Validez externa

La validez externa se refiere al grado en que los resultados (internamente válidos) de un estudio pueden considerarse válidos para otros casos, por ejemplo, para diferentes personas, lugares o momentos. En otras palabras, se trata de si los hallazgos pueden generalizarse válidamente. Si se realizara el mismo estudio de investigación en esos otros casos, ¿se obtendrían los mismos resultados?

Un factor importante en esto es si la muestra del estudio (por ejemplo, los participantes de la investigación) es representativa de la población general en las dimensiones relevantes. Otros factores que comprometen la validez externa son:

  1. Efecto reactivo o de interacción de las pruebas : una prueba previa podría aumentar las puntuaciones en una prueba posterior.
  2. Efectos de interacción de los sesgos de selección y la variable experimental .
  3. Efectos reactivos de los arreglos experimentales , que impedirían generalizar sobre el efecto de la variable experimental en personas expuestas a ella en entornos no experimentales.
  4. Interferencia de tratamientos múltiples , donde los efectos de tratamientos anteriores no se pueden borrar.

Validez ecológica

La validez ecológica se refiere al grado en que los resultados de una investigación pueden aplicarse a situaciones de la vida real fuera del ámbito de la investigación. Este tema está estrechamente relacionado con la validez externa, pero abarca la cuestión de hasta qué punto los hallazgos experimentales reflejan lo que se observa en el mundo real (ecología = la ciencia de la interacción entre los organismos y su entorno). Para que un estudio sea ecológicamente válido, sus métodos, materiales y contexto deben aproximarse a la situación real que se investiga.

La validez ecológica está relacionada, en parte, con la dicotomía entre experimentación y observación. En ciencia, generalmente existen dos ámbitos de investigación: la observacional (pasiva) y la experimental (activa). El objetivo de los diseños experimentales es comprobar la causalidad, de modo que se pueda inferir que A causa B o B causa A. Sin embargo, en ocasiones, las restricciones éticas o metodológicas impiden realizar un experimento (por ejemplo, ¿cómo influye el aislamiento en el funcionamiento cognitivo de un niño?). En esos casos, la investigación aún puede llevarse a cabo, pero no es causal, sino correlacional. Solo se puede concluir que A ocurre junto con B. Ambas técnicas tienen sus ventajas y desventajas.

Relación con la validez interna

A primera vista, la validez interna y externa parecen contradecirse: para obtener un diseño experimental, es necesario controlar todas las variables interferentes. Por eso, a menudo se realizan experimentos en un laboratorio. Si bien se gana validez interna (al excluir las variables interferentes manteniéndolas constantes), se pierde validez ecológica o externa, ya que se establece un entorno de laboratorio artificial. Por otro lado, con la investigación observacional no se pueden controlar las variables interferentes (baja validez interna), pero se puede medir en el entorno natural (ecológico), en el lugar donde el comportamiento ocurre normalmente. Sin embargo, al hacerlo, se sacrifica la validez interna.

La aparente contradicción entre validez interna y validez externa es, sin embargo, solo superficial. La cuestión de si los resultados de un estudio particular se generalizan a otras personas, lugares o momentos surge únicamente cuando se sigue una estrategia de investigación inductiva . Si el objetivo de un estudio es probar deductivamente una teoría, solo se consideran los factores que podrían menoscabar el rigor del estudio, es decir, las amenazas a la validez interna. En otras palabras, la relevancia de la validez externa e interna para un estudio de investigación depende de los objetivos del estudio. Además, confundir los objetivos de la investigación con las preocupaciones sobre la validez puede conducir al problema de la validez interna mutua, donde las teorías solo pueden explicar fenómenos en entornos de laboratorio artificiales, pero no en el mundo real. [ 13 ] [ 14 ]

Validez diagnóstica

En psiquiatría existe un problema particular con la evaluación de la validez de las categorías diagnósticas en sí mismas. En este contexto: [ 15 ]

  • La validez del contenido puede referirse a los síntomas y a los criterios de diagnóstico;
  • La validez concurrente puede definirse mediante diversos correlatos o marcadores, y quizás también mediante la respuesta al tratamiento;
  • La validez predictiva puede referirse principalmente a la estabilidad diagnóstica a lo largo del tiempo;
  • La validez discriminante puede implicar la delimitación respecto de otros trastornos.

Robins y Guze propusieron en 1970 lo que se convertirían en influyentes criterios formales para establecer la validez de los diagnósticos psiquiátricos. Enumeraron cinco criterios: [ 15 ]

  • Descripción clínica específica (que incluye perfiles de síntomas, características demográficas y factores desencadenantes típicos).
  • estudios de laboratorio (incluidas pruebas psicológicas, radiología y hallazgos post mortem)
  • delimitación de otros trastornos (mediante criterios de exclusión)
  • Estudios de seguimiento que muestran una evolución característica (incluida evidencia de estabilidad diagnóstica).
  • estudios familiares que muestran agrupamiento familiar

Estos criterios se incorporaron a los Criterios de Feighner y a los Criterios Diagnósticos de Investigación, que desde entonces han constituido la base de los sistemas de clasificación DSM e ICD.

En 1980, Kendler distinguió entre: [ 15 ]

  • Validadores antecedentes (agregación familiar, personalidad premórbida y factores precipitantes)
  • validadores concurrentes (incluidas pruebas psicológicas)
  • Validadores predictivos (consistencia diagnóstica a lo largo del tiempo, tasas de recaída y recuperación, y respuesta al tratamiento)

Nancy Andreasen (1995) enumeró varios validadores adicionales: genética molecular y biología molecular , neuroquímica , neuroanatomía , neurofisiología y neurociencia cognitiva , que son potencialmente capaces de vincular síntomas y diagnósticos con sus sustratos neuronales . [ 15 ]

Kendell y Jablinsky (2003) enfatizaron la importancia de distinguir entre validez y utilidad , y argumentaron que las categorías diagnósticas definidas por sus síndromes deben considerarse válidas solo si se ha demostrado que son entidades discretas con límites naturales que las separan de otros trastornos. [ 15 ]

Kendler (2006) enfatizó que, para ser útil, un criterio de validación debe ser lo suficientemente sensible como para validar la mayoría de los síndromes que son trastornos verdaderos, a la vez que lo suficientemente específico como para invalidar la mayoría de los síndromes que no lo son. Sobre esta base, argumenta que el criterio de Robins y Guze de "es hereditario" es insuficientemente específico porque la mayoría de los rasgos psicológicos y físicos humanos cumplirían con los requisitos; por ejemplo, se encontrará que un síndrome arbitrario que comprende una mezcla de "estatura superior a 1,83 m, cabello rojo y nariz grande" es " hereditario ", pero esto no debería considerarse evidencia de que se trate de un trastorno. Kendler ha sugerido además que los modelos genéticos " esencialistas " de los trastornos psiquiátricos, y la esperanza de que podamos validar diagnósticos psiquiátricos categóricos "desentrañando la naturaleza" únicamente como resultado del descubrimiento de genes, son inverosímiles. [ 16 ]

En el sistema judicial federal de los Estados Unidos, la validez y confiabilidad de las pruebas se evalúan utilizando el estándar Daubert : véase Daubert v. Merrell Dow Pharmaceuticals . Perri y Lichtenwald (2010) ofrecen un punto de partida para un análisis de una amplia gama de temas relacionados con la confiabilidad y la validez en su análisis de una condena errónea por asesinato. [ 17 ]

Véase también

Referencias

  1. Brains, Willnat, Manheim, Rich 2011. Análisis político empírico, 8.ª edición. Boston: Longman, pág. 105
  2. 1 2 Campbell, Donald T. (1957). "Factores relevantes para la validez de los experimentos en entornos sociales" . Psychological Bulletin . 54 (4): 297– 312. doi : 10.1037/h0040950 . ISSN 1939-1455 . PMID 13465924 .  
  3. Kelley, Truman Lee (1927). Interpretación de las mediciones educativas . Yonkers-on-Hudson, NY: World Book Company. pág. 14. El problema de la validez consiste en determinar si una prueba realmente mide lo que pretende medir... 
  4. Asociación Estadounidense de Investigación Educativa, Asociación Psicológica y Consejo Nacional de Medición en Educación. (1999). Estándares para la evaluación educativa y psicológica . Washington, DC: Asociación Estadounidense de Investigación Educativa.
  5. Consejo Nacional de Medición en Educación. https://web.archive.org/web/20160924135257/http://www.ncme.org/ncme/NCME/Resource_Center/Glossary/NCME/Resource_Center/Glossary1.aspx?hkey=4bb87415-44dc-4088-9ed9-e8515326a061
  6. Kramer, Geoffrey P., Douglas A. Bernstein y Vicky Phares. Introducción a la psicología clínica. 7.ª ed. Upper Saddle River, NJ: Pearson Prentice Hall, 2009. Impreso.
  7. 1 2 Cronbach, Lee J.; Meehl, Paul E. (1955). "Validez de constructo en pruebas psicológicas". Psychological Bulletin . 52 (4): 281– 302. doi : 10.1037/h0040957 . hdl : 11299/184279 . ISSN 0033-2909 . PMID 13245896 . S2CID 5312179 .   
  8. Arghami, Shirazeh; Sadeghi, Gholamreza; Abbasi Chenari, Mohsen (2020). "Reevaluación de las propiedades psicométricas de la versión persa del cuestionario de comportamiento de conducción de Manchester". Iran Occupational Health . 17 (8): 1– 19.
  9. Foxcroft, C., Paterson, H., le Roux, N., & Herbst, D. Consejo de Investigación en Ciencias Humanas, (2004). Evaluación psicológica en Sudáfrica: Un análisis de necesidades: Patrones de uso de pruebas y necesidades de los profesionales de la evaluación psicológica: Informe final: julio . Recuperado del sitio web: http://www.hsrc.ac.za/research/output/outputDocuments/1716_Foxcroft_Psychologicalassessmentin%20SA.pdf Archivado el 19 de noviembre de 2012 en Wayback Machine
  10. Las estimaciones más comunes se sitúan entre 40 000 y 60 000 muertes. Brian Levack ( La caza de brujas en la Europa moderna temprana ) multiplicó el número de juicios por brujería conocidos en Europa por la tasa media de condenas y ejecuciones, para llegar a una cifra de alrededor de 60 000 muertes. Anne Lewellyn Barstow ( Cruz de brujas ) ajustó la estimación de Levack para tener en cuenta los registros perdidos, estimando 100 000 muertes. Ronald Hutton ( El triunfo de la luna ) argumenta que la estimación de Levack ya había sido ajustada para estos registros y revisa la cifra a aproximadamente 40 000.
  11. Cozby, Paul C. Métodos en la investigación del comportamiento. 10.ª ed. Boston: McGraw-Hill Higher Education, 2009. Impreso.
  12. Jonathan Javid (6 de noviembre de 2015). "Validez y fiabilidad de la medición" . slideshare.net . Consultado el 23 de marzo de 2018 .
  13. Lin, Hause; Werner, Kaitlyn M.; Inzlicht, Michael (16 de febrero de 2021). "Promesas y peligros de la experimentación: el problema de la validez interna mutua" . Perspectives on Psychological Science . 16 (4): 854– 863. doi : 10.1177/1745691620974773 . ISSN 1745-6916 . PMID 33593177. S2CID 231877717 .   
  14. Schram, Arthur (1 de junio de 2005). "Artificialidad: La tensión entre la validez interna y externa en los experimentos económicos" . Journal of Economic Methodology . 12 (2): 225– 237. doi : 10.1080/13501780500086081 . ISSN 1350-178X . S2CID 145588503 .  
  15. 1 2 3 4 5 Kendell, R; Jablensky, A (2003). "Distinguir entre la validez y la utilidad de los diagnósticos psiquiátricos". The American Journal of Psychiatry . 160 (1): 4– 12. doi : 10.1176/appi.ajp.160.1.4 . PMID 12505793 . 
  16. Kendler, KS (2006). "Reflexiones sobre la relación entre la genética psiquiátrica y la nosología psiquiátrica". The American Journal of Psychiatry . 163 (7): 1138– 46. doi : 10.1176/appi.ajp.163.7.1138 . PMID 16816216 . 
  17. Perri, FS; Lichtenwald, TG (2010). "El uso precario de la psicología forense como prueba: el caso de Timothy Masters" (PDF) . Revista Champion (julio): 34–45 .

Lecturas adicionales

  • Cronbach, LJ; Meehl, PE (1955), "Validez de constructo en pruebas psicológicas" , Psychological Bulletin , 52 (4): 281–302 , doi : 10.1037/h0040957 , hdl : 11299/184279 , PMID 13245896 , S2CID 5312179  
  • Rupp, AA; Pant, HA (2007), "Teoría de la validez", en Salkind, Neil J. (ed.), Enciclopedia de medición y estadística , SAGE Publishing