Articulo de referencia

Validez externa

La validez externa es la validez de aplicar las conclusiones de un estudio científico fuera del contexto de dicho estudio. [ 1 ] En otras palabras, es el grado en que los result...

La validez externa es la validez de aplicar las conclusiones de un estudio científico fuera del contexto de dicho estudio. [ 1 ] En otras palabras, es el grado en que los resultados de un estudio pueden generalizarse o transferirse a otras situaciones, personas, estímulos y momentos. [ 2 ] [ 3 ] La generalizabilidad se refiere a la aplicabilidad de una muestra predefinida a una población más amplia, mientras que la transferibilidad se refiere a la aplicabilidad de una muestra a otra población objetivo. [ 2 ] Por el contrario, la validez interna es la validez de las conclusiones extraídas dentro del contexto de un estudio particular.

El análisis matemático de la validez externa se refiere a la determinación de si la generalización entre poblaciones heterogéneas es factible y al diseño de métodos estadísticos y computacionales que produzcan generalizaciones válidas. [ 4 ]

Al establecer la validez externa, los investigadores tienden a identificar el "alcance" del estudio, que se refiere a la aplicabilidad o limitaciones de la teoría o argumento del estudio. [ 2 ] Esto implica definir la muestra del estudio y la población más amplia que representa dicha muestra. [ 2 ]

Amenazas

"Una amenaza a la validez externa es una explicación de cómo podrías equivocarte al generalizar a partir de los hallazgos de un estudio en particular." [ 5 ] En la mayoría de los casos, la generalización es limitada cuando el efecto de un factor (es decir, la variable independiente ) depende de otros factores. Por lo tanto, todas las amenazas a la validez externa pueden describirse como interacciones estadísticas . [ 6 ] Algunos ejemplos incluyen:

  • Interacción entre aptitud y tratamiento: La muestra puede presentar ciertas características que interactúan con la variable independiente, lo que limita la generalización de los resultados. Por ejemplo, los estudios comparativos de psicoterapia suelen emplear muestras específicas (p. ej., voluntarios, personas con depresión grave, sin comorbilidad ). Si la psicoterapia resulta eficaz para estos pacientes, ¿lo será también para quienes no participan como voluntarios, para personas con depresión leve o para pacientes con otros trastornos concurrentes? De no ser así, la validez externa del estudio se vería limitada.
  • Interacciones entre la situación y el tratamiento: Todas las particularidades situacionales (por ejemplo, condiciones del tratamiento, tiempo, lugar, iluminación, ruido, administración del tratamiento, investigador, cronograma, alcance y extensión de la medición, etc.) de un estudio pueden limitar la generalización de los resultados.
  • Interacciones entre la prueba previa y el tratamiento: Si las relaciones de causa y efecto solo se pueden encontrar al realizar pruebas previas, esto también limita la generalidad de los hallazgos. A esto a veces se le denomina "sensibilización", porque la prueba previa hace que las personas sean más sensibles a la manipulación del tratamiento.

Cabe señalar que la validez externa de un estudio está limitada por su validez interna . Si una inferencia causal realizada dentro de un estudio no es válida, entonces las generalizaciones de esa inferencia a otros contextos tampoco lo serán.

Cook y Campbell [ 7 ] establecieron la distinción crucial entre generalizar a una población y generalizar a través de subpoblaciones definidas por diferentes niveles de algún factor de fondo. Lynch ha argumentado que casi nunca es posible generalizar a poblaciones significativas, excepto como una instantánea de la historia, pero sí es posible probar el grado en que el efecto de alguna causa sobre alguna variable dependiente se generaliza a través de subpoblaciones que varían en algún factor de fondo. Esto requiere una prueba para determinar si el efecto del tratamiento que se investiga está moderado por interacciones con uno o más factores de fondo. [ 6 ] [ 8 ]

Amenazas de desarme

Si bien enumerar las amenazas a la validez puede ayudar a los investigadores a evitar generalizaciones injustificadas, muchas de esas amenazas pueden ser desarmadas o neutralizadas de manera sistemática, para permitir una generalización válida. Específicamente, los hallazgos experimentales de una población pueden ser "reprocesados" o "recalibrados" para sortear las diferencias poblacionales y producir generalizaciones válidas en una segunda población, donde no se pueden realizar experimentos. Pearl y Bareinboim [ 4 ] clasificaron los problemas de generalización en dos categorías: (1) aquellos que se prestan a una recalibración válida, y (2) aquellos donde la validez externa es teóricamente imposible. Utilizando el cálculo de inferencia causal basado en grafos , [ 9 ] derivaron una condición necesaria y suficiente para que una instancia del problema permita una generalización válida, y diseñaron algoritmos que producen automáticamente la recalibración necesaria, siempre que exista. [ 10 ] Esto reduce el problema de la validez externa a un ejercicio de teoría de grafos , y ha llevado a algunos filósofos a concluir que el problema está ahora resuelto. [ 11 ]

Una variante importante del problema de validez externa se refiere al sesgo de selección , también conocido como sesgo de muestreo , es decir, el sesgo que se produce cuando los estudios se realizan con muestras no representativas de la población objetivo. Por ejemplo, si se lleva a cabo un ensayo clínico con estudiantes universitarios, un investigador podría querer saber si los resultados se generalizan a toda la población, donde atributos como la edad, la educación y los ingresos difieren sustancialmente de los de un estudiante típico. El método basado en gráficos de Bareinboim y Pearl identifica las condiciones bajo las cuales se puede evitar el sesgo de selección de la muestra y, cuando se cumplen estas condiciones, el método construye un estimador insesgado del efecto causal promedio en toda la población. La principal diferencia entre la generalización a partir de estudios con muestras inadecuadas y la generalización entre poblaciones dispares radica en que las disparidades entre poblaciones suelen deberse a factores preexistentes, como la edad o la etnia, mientras que el sesgo de selección a menudo se debe a condiciones posteriores al tratamiento, por ejemplo, pacientes que abandonan el estudio o pacientes seleccionados según la gravedad de la lesión. Cuando la selección está regida por factores posteriores al tratamiento, se requieren métodos de recalibración no convencionales para garantizar una estimación sin sesgos, y estos métodos se obtienen fácilmente a partir del gráfico del problema. [ 12 ] [ 13 ]

Ejemplos

Si se considera que la edad es un factor importante que causa que el efecto del tratamiento varíe de un individuo a otro, entonces las diferencias de edad entre los estudiantes de la muestra y la población general llevarían a una estimación sesgada del efecto promedio del tratamiento en esa población. Sin embargo, este sesgo puede corregirse mediante un procedimiento de reponderación simple: tomamos el efecto específico de la edad en la subpoblación de estudiantes y calculamos su promedio utilizando la distribución de edad en la población general. Esto nos daría una estimación insesgada del efecto promedio del tratamiento en la población. Si, por otro lado, el factor relevante que distingue la muestra de estudio de la población general está afectado en sí mismo por el tratamiento, entonces se debe invocar un esquema de reponderación diferente. Llamando a este factor Z , nuevamente promediamos el efecto específico z de X sobre Y en la muestra experimental, pero ahora lo ponderamos por el "efecto causal" de X sobre Z. En otras palabras, el nuevo peso es la proporción de unidades que alcanzan el nivel Z=z si el tratamiento X=x se hubiera administrado a toda la población. Esta probabilidad de intervención, a menudo escrita usando Do-calculus [ 14 ]PAG(Z=z|do(incógnita=incógnita)){\displaystyle P(Z=z|do(X=x))}, a veces se puede estimar a partir de estudios observacionales en la población general.

Un ejemplo típico de esta naturaleza ocurre cuando Z es un mediador entre el tratamiento y el resultado. Por ejemplo, el tratamiento puede ser un fármaco reductor del colesterol, Z puede ser el nivel de colesterol e Y la esperanza de vida. Aquí, Z se ve afectado por el tratamiento y es un factor importante para determinar el resultado, Y. Supongamos que los sujetos seleccionados para el estudio experimental tienden a tener niveles de colesterol más altos que los típicos en la población general. Para estimar el efecto promedio del fármaco sobre la supervivencia en toda la población, primero calculamos el efecto del tratamiento específico de z en el estudio experimental y luego lo promediamos utilizandoPAG(Z=z|do(incógnita=incógnita)){\displaystyle P(Z=z|do(X=x))}como función de ponderación. La estimación obtenida estará libre de sesgos incluso cuando Z e Y estén confundidas, es decir, cuando exista un factor común no medido que afecte tanto a Z como a Y. [ 15 ]

Las condiciones precisas que garantizan la validez de este y otros esquemas de ponderación se formulan en Bareinboim y Pearl, 2016 [ 15 ] y Bareinboim et al., 2014. [ 13 ]

Validez externa, interna y ecológica

En muchos estudios y diseños de investigación, puede existir una compensación entre la validez interna y la validez externa: [ 16 ] [ 17 ] [ 18 ] Los intentos por aumentar la validez interna también pueden limitar la generalización de los hallazgos, y viceversa. Esta situación ha llevado a muchos investigadores a exigir experimentos "ecológicamente válidos". Con esto se refieren a que los procedimientos experimentales deben asemejarse a las condiciones del "mundo real". Critican la falta de validez ecológica en muchos estudios de laboratorio centrados en entornos controlados y restringidos artificialmente. Algunos investigadores piensan que la validez externa y la validez ecológica están estrechamente relacionadas, en el sentido de que las inferencias causales basadas en diseños de investigación ecológicamente válidos a menudo permiten mayores grados de generalización que las obtenidas en un entorno de laboratorio artificialmente producido. Sin embargo, esto se relaciona nuevamente con la distinción entre generalizar a una población (estrechamente relacionado con las preocupaciones sobre la validez ecológica) y generalizar a través de subpoblaciones que difieren en algún factor de fondo. Algunos hallazgos producidos en entornos de investigación ecológicamente válidos pueden ser difícilmente generalizables, y algunos hallazgos producidos en entornos altamente controlados pueden reclamar una validez externa casi universal. Por lo tanto, la validez externa y la validez ecológica son independientes: un estudio puede poseer validez externa pero no validez ecológica, y viceversa.

Investigación cualitativa

Dentro del paradigma de la investigación cualitativa , la validez externa se reemplaza por el concepto de transferibilidad. La transferibilidad es la capacidad de los resultados de la investigación para transferirse a situaciones con parámetros, poblaciones y características similares. [ 19 ]

En experimentos

Es común que los investigadores afirmen que los experimentos, por su naturaleza, tienen una baja validez externa. Algunos sostienen que pueden surgir numerosos inconvenientes al seguir el método experimental. Al intentar controlar la situación lo suficiente como para asignar aleatoriamente a las personas a las diferentes condiciones y descartar los efectos de variables extrañas, la situación puede volverse artificial y alejada de la realidad.

Hay dos tipos de generalización en juego:

  1. El grado en que podemos generalizar desde la situación construida por un experimentador a situaciones de la vida real ( generalización entre situaciones ), [ 3 ] y
  2. El grado en que podemos generalizar a partir de las personas que participaron en el experimento a las personas en general ( generalización entre personas ) [ 3 ]

Sin embargo, ambas consideraciones se refieren al concepto de Cook y Campbell de generalizar a una población objetivo, en lugar de la tarea posiblemente más central de evaluar la generalización de los hallazgos de un experimento a través de subpoblaciones que difieren de la situación específica estudiada y personas que difieren de los encuestados estudiados de alguna manera significativa. [ 7 ]

Los críticos de los experimentos sugieren que la validez externa podría mejorarse mediante el uso de entornos de campo (o, como mínimo, entornos de laboratorio realistas) y mediante el uso de muestras probabilísticas reales de los participantes. Sin embargo, si el objetivo es comprender la generalización entre subpoblaciones que difieren en factores situacionales o personales, estas soluciones no tienen la eficacia para aumentar la validez externa que se les suele atribuir. Si existen interacciones entre factores de fondo y tratamiento de las que el investigador no es consciente (como parece probable), estas prácticas de investigación pueden enmascarar una importante falta de validez externa. Dipboye y Flanagan, al escribir sobre psicología industrial y organizacional , señalan que la evidencia indica que los hallazgos de un entorno de campo y de un entorno de laboratorio tienen la misma probabilidad de generalizarse a un segundo entorno de campo. [ 20 ] Por lo tanto, los estudios de campo no son, por naturaleza, de alta validez externa, ni los estudios de laboratorio son, por naturaleza, de baja validez externa. En ambos casos, depende de si el efecto del tratamiento estudiado cambiaría con cambios en los factores de fondo que se mantienen constantes en ese estudio. Si un estudio es "poco realista" en cuanto a algún factor de fondo que no interactúa con los tratamientos, esto no afecta la validez externa. Solo si un experimento mantiene constante algún factor de fondo a un nivel poco realista y si la variación de dicho factor hubiera revelado una fuerte interacción entre el tratamiento y el factor de fondo, entonces la validez externa se ve amenazada. [ 6 ]

Generalización en diferentes situaciones

Las investigaciones en psicología realizadas en universidades suelen ser criticadas por llevarse a cabo en situaciones artificiales y por no poder generalizarse a la vida real. [ 21 ] [ 22 ] Para solucionar este problema, los psicólogos sociales intentan aumentar la generalización de sus resultados haciendo que sus estudios sean lo más realistas posible. Como se mencionó anteriormente, esto se hace con la esperanza de generalizar a una población específica. El realismo en sí mismo no ayuda a afirmar si los resultados cambiarían si el entorno fuera de alguna manera más realista, o si los participantes del estudio se colocaran en un entorno realista diferente. Si solo se prueba un entorno, no es posible hacer afirmaciones sobre la generalización entre entornos. [ 6 ] [ 8 ]

Sin embargo, muchos autores confunden validez externa con realismo. Hay más de una forma en que un experimento puede ser realista:

  1. La similitud de una situación experimental con eventos que ocurren con frecuencia en la vida cotidiana deja claro que muchos experimentos son decididamente irreales.
  2. En muchos experimentos, se coloca a las personas en situaciones que rara vez encontrarían en la vida cotidiana.

Esto se refiere al grado en que un experimento es similar a situaciones de la vida real como el realismo mundano del experimento . [ 21 ]

Es más importante asegurar que un estudio tenga un alto grado de realismo psicológico : cuán similares son los procesos psicológicos desencadenados en un experimento a los procesos psicológicos que ocurren en la vida cotidiana. [ 23 ]

El realismo psicológico se acentúa si las personas se ven inmersas en un evento real. Para lograrlo, los investigadores a veces les cuentan a los participantes una historia ficticia : una descripción falsa del propósito del estudio. Sin embargo, si los experimentadores les revelaran el propósito del experimento, dicho procedimiento tendría un bajo nivel de realismo psicológico. En la vida cotidiana, nadie sabe cuándo ocurrirán las emergencias y las personas no tienen tiempo para planificar respuestas. Esto significa que los procesos psicológicos desencadenados diferirían ampliamente de los de una emergencia real, lo que reduciría el realismo psicológico del estudio. [ 3 ]

Las personas no siempre saben por qué hacen lo que hacen, ni qué hacen hasta que sucede. Por lo tanto, describir una situación experimental a los participantes y luego pedirles que respondan con normalidad producirá respuestas que podrían no coincidir con el comportamiento de quienes se encuentran realmente en la misma situación. No podemos confiar en las predicciones de las personas sobre lo que harían en una situación hipotética; solo podemos descubrir lo que realmente harán cuando construimos una situación que desencadene los mismos procesos psicológicos que ocurren en el mundo real.

Generalización entre personas

Los psicólogos sociales estudian la forma en que las personas, en general, son susceptibles a la influencia social. Diversos experimentos han documentado un ejemplo interesante e inesperado de influencia social, en el que el mero hecho de saber que había otras personas presentes redujo la probabilidad de que estas prestaran ayuda.

La única forma de asegurar que los resultados de un experimento representen el comportamiento de una población específica es garantizar que los participantes sean seleccionados aleatoriamente de dicha población. Las muestras en los experimentos no pueden seleccionarse aleatoriamente como en las encuestas, ya que resulta poco práctico y costoso seleccionar muestras aleatorias para experimentos de psicología social . Ya es bastante difícil convencer a una muestra aleatoria de personas para que acepten responder algunas preguntas por teléfono como parte de una encuesta política, y dichas encuestas pueden costar miles de dólares. Además, incluso si de alguna manera se lograra reclutar una muestra verdaderamente aleatoria, podría existir heterogeneidad no observada en los efectos de los tratamientos experimentales. Un tratamiento puede tener un efecto positivo en algunos subgrupos, pero un efecto negativo en otros. Los efectos mostrados en los promedios de los tratamientos pueden no ser generalizables a ningún subgrupo. [ 6 ] [ 24 ]

Muchos investigadores abordan este problema estudiando los procesos psicológicos básicos que hacen que las personas sean susceptibles a la influencia social, asumiendo que estos procesos son tan fundamentales que son universalmente compartidos. Algunos procesos de la psicología social varían en diferentes culturas y, en esos casos, es necesario estudiar muestras diversas de personas. [ 25 ]

Réplicas

La prueba definitiva de la validez externa de un experimento es la replicación : repetir el estudio, generalmente con poblaciones de sujetos diferentes o en entornos distintos. Los investigadores suelen utilizar métodos diferentes para comprobar si obtienen los mismos resultados.

Cuando se realizan muchos estudios sobre un mismo problema, los resultados pueden variar. Algunos estudios podrían encontrar un efecto del número de observadores en la conducta de ayuda, mientras que otros no. Para comprender esto, existe una técnica estadística llamada metaanálisis que promedia los resultados de dos o más estudios para determinar si el efecto de una variable independiente es fiable. Un metaanálisis nos indica la probabilidad de que los hallazgos en los resultados de muchos estudios se deban al azar o a la variable independiente. Si se encuentra que una variable independiente tiene efecto en solo uno de 20 estudios, el metaanálisis nos dirá que ese estudio fue una excepción y que, en promedio, la variable independiente no influye en la variable dependiente. Si una variable independiente tiene efecto en la mayoría de los estudios, es probable que el metaanálisis nos diga que, en promedio, sí influye en la variable dependiente.

Puede haber fenómenos fiables que no se limitan al laboratorio. Por ejemplo, se ha descubierto que aumentar el número de espectadores inhibe el comportamiento de ayuda con muchos tipos de personas, incluidos niños, estudiantes universitarios y futuros ministros; [ 25 ] en Israel; [ 26 ] en pueblos pequeños y grandes ciudades de EE. UU.; [ 27 ] en una variedad de entornos, como laboratorios de psicología, calles de la ciudad y trenes del metro; [ 28 ] y con una variedad de tipos de emergencias, como convulsiones, posibles incendios, peleas y accidentes, [ 29 ] así como con eventos menos graves, como tener una llanta pinchada. [ 30 ] Muchas de estas replicaciones se han llevado a cabo en entornos de la vida real donde las personas no podían saber que se estaba llevando a cabo un experimento.

Dilema fundamental del psicólogo social

Al realizar experimentos en psicología, algunos creen que siempre existe una compensación entre la validez interna y la externa.

  1. tener suficiente control sobre la situación para asegurar que ninguna variable extraña influya en los resultados y para asignar aleatoriamente a las personas a las condiciones, y
  2. garantizar que los resultados puedan generalizarse a la vida cotidiana.

Algunos investigadores creen que una buena manera de aumentar la validez externa es mediante la realización de experimentos de campo . En un experimento de campo, se estudia el comportamiento de las personas fuera del laboratorio, en su entorno natural. Un experimento de campo tiene el mismo diseño que un experimento de laboratorio, excepto que se lleva a cabo en un entorno de la vida real. Los participantes en un experimento de campo desconocen que los eventos que experimentan son, de hecho, un experimento. Algunos afirman que la validez externa de dicho experimento es alta porque se realiza en el mundo real, con personas reales que son más diversas que una muestra típica de estudiantes universitarios. Sin embargo, dado que los entornos del mundo real difieren drásticamente, los hallazgos en un entorno del mundo real pueden o no generalizarse a otro entorno del mundo real. [ 20 ]

Ni la validez interna ni la externa se capturan en un solo experimento. Los psicólogos sociales optan primero por la validez interna, realizando experimentos de laboratorio en los que las personas son asignadas aleatoriamente a diferentes condiciones y se controlan todas las variables extrañas. Otros psicólogos sociales prefieren la validez externa al control, realizando la mayor parte de su investigación en estudios de campo, y muchos hacen ambas. En conjunto, ambos tipos de estudios cumplen los requisitos del experimento perfecto. Mediante la replicación, los investigadores pueden estudiar una pregunta de investigación determinada con la máxima validez interna y externa. [ 31 ]

Véase también

Notas

  1. Mitchell, M. y Jolley, J. (2001). Diseño de investigación explicado (4.ª ed.) Nueva York: Harcourt.
  2. 1 2 3 4 Findley, Michael G.; Kikuta, Kyosuke; Denly, Michael (2021). "Validez externa" . Annual Review of Political Science . 24 (1): 365– 393. doi : 10.1146/annurev-polisci-041719-102556 . ISSN 1094-2939 . 
  3. 1 2 3 4 Aronson, E., Wilson, TD, Akert, RM, & Fehr, B. (2007). Psicología social. (4.ª ed.). Toronto, ON: Pearson Education.
  4. 1 2 Pearl, Judea; Bareinboim, Elias (2014). "Validez externa: Del cálculo do a la transportabilidad entre poblaciones". Statistical Science . 29 (4): 579– 595. arXiv : 1503.01603 . doi : 10.1214/14-sts486 . S2CID 5586184 . 
  5. Trochim, William M. La base de conocimientos de métodos de investigación, 2.ª edición.
  6. 1 2 3 4 5 Lynch, John (1982). "Sobre la validez externa de los experimentos en la investigación del consumidor". Journal of Consumer Research . 9 (3): 225– 239. doi : 10.1086/208919 . JSTOR 2488619 . 
  7. 1 2 Cook, Thomas D.; Campbell, Donald T. (1979). Cuasiexperimentación: Problemas de diseño y análisis para entornos de campo . Chicago: Rand McNally College Publishing Company. ISBN 978-0395307908.
  8. 1 2 Lynch, John (1999). "Teoría y validez externa". Journal of the Academy of Marketing Science . 27 (3): 367– 76. CiteSeerX 10.1.1.417.8073 . doi : 10.1177/0092070399273007 . S2CID 145357923 .  
  9. Pearl, Judea (1995). "Diagramas causales para la investigación empírica" . Biometrika . 82 (4): 669– 710. doi : 10.1093/biomet/82.4.669 .
  10. Bareinboim, Elias; Pearl, Judea (2013). "Un algoritmo general para decidir la transportabilidad de resultados experimentales". Journal of Causal Inference . 1 (1): 107– 134. arXiv : 1312.7485 . doi : 10.1515/jci-2012-0004 . S2CID 13325846 . 
  11. Marcellesi, Alexandre (diciembre de 2015). "Validez externa: ¿sigue existiendo un problema?". Filosofía de la Ciencia . 82 (5): 1308– 1317. doi : 10.1086/684084 . S2CID 125072255 . 
  12. Pearl, Judea (2015). Generalización de hallazgos experimentales . Journal of Causal Inference . Vol. 3, núm. 2, págs. 259–266 .   
  13. 1 2 Bareinboim, Elias; Tian, ​​Jin; Pearl, Judea (2014). Brodley, Carla E. ; Stone, Peter (eds.). "Recuperación del sesgo de selección en la inferencia causal y estadística". Actas de la Vigésimo Octava Conferencia AAAI sobre Inteligencia Artificial : 2410–2416 .
  14. Pearl, Judea; Glymour, Madelyn; Jewell, Nicholas P. (2016). Inferencia causal en estadística: una introducción . Nueva York: Wiley.
  15. 1 2 Bareinboim, Elias; Pearl, Judea (2016). "Inferencia causal y el problema de la fusión de datos" . Actas de la Academia Nacional de Ciencias . 113 ( 27): 7345– 7352. doi : 10.1073/pnas.1510507113 . PMC 4941504. PMID 27382148 .  
  16. Campbell, Donald T. (1957). "Factores relevantes para la validez de los experimentos en entornos sociales" . Psychological Bulletin . 54 (4): 297– 312. doi : 10.1037/h0040950 . ISSN 1939-1455 . PMID 13465924 .  
  17. Lin, Hause; Werner, Kaitlyn M.; Inzlicht, Michael (16 de febrero de 2021). "Promesas y peligros de la experimentación: el problema de la validez interna mutua" . Perspectives on Psychological Science . 16 (4): 854– 863. doi : 10.1177/1745691620974773 . ISSN 1745-6916 . PMID 33593177. S2CID 231877717 .   
  18. Schram, Arthur (1 de junio de 2005). "Artificialidad: La tensión entre la validez interna y externa en los experimentos económicos" . Journal of Economic Methodology . 12 (2): 225– 237. doi : 10.1080/13501780500086081 . ISSN 1350-178X . S2CID 145588503 .  
  19. Lincoln, YS; Guba, EG (1986). "¿Pero es riguroso? Confiabilidad y autenticidad en la evaluación naturalista". En Williams, DD (ed.). Evaluación naturalista . Nuevas direcciones para la evaluación de programas. Vol. 30. San Francisco: Jossey-Bass. pp. 73–84 . ISBN   0-87589-728-2.
  20. 1 2 Dipboye, Robert L.; Flanagan, Michael F. (1979). "Entornos de investigación en psicología industrial y organizacional: ¿Son los hallazgos de campo más generalizables que los del laboratorio?". American Psychologist . 34 (2): 141– 150. doi : 10.1037/0003-066x.34.2.141 .
  21. 1 2 Aronson, E., & Carlsmith, JM (1968). Experimentación en psicología social. En G. Lindzey & E. Aronson (Eds.), Manual de psicología social. (Vol. 2, pp. 1–79.) Reading, MA: Addison-Wesley.
  22. Yarkoni, Tal (2020-12-21). "La crisis de generalizabilidad" . Behavioral and Brain Sciences . 45 : e1. doi : 10.1017/S0140525X20001685 . ISSN 0140-525X . PMC 10681374. PMID 33342451 .   
  23. Aronson, E., Wilson, TD y Brewer, M. (1998). Métodos experimentales. En D. Gilbert, S. Fiske y G. Lindzey (Eds.), Manual de psicología social. (4.ª ed., vol. 1, págs. 99-142). Nueva York: Random House.
  24. Hutchinson, J. Wesley; Kamakura, Wagner A.; Lynch, John G. (2000). "Heterogeneidad no observada como explicación alternativa de los efectos de "reversión" en la investigación del comportamiento". Journal of Consumer Research . 27 (3): 324– 344. doi : 10.1086/317588 . JSTOR 10.1086/317588 . S2CID 16353123 .  
  25. 1 2 Darley, JM; Batson, CD (1973). "De Jerusalén a Jericó: Un estudio de variables situacionales y disposicionales en el comportamiento de ayuda". Journal of Personality and Social Psychology . 27 : 100–108 . doi : 10.1037/h0034449 .
  26. Schwartz, SH; Gottlieb, A. (1976). "Reacciones de los transeúntes ante un robo violento: El crimen en Jerusalén". Journal of Personality and Social Psychology . 34 (6): 1188– 1199. doi : 10.1037/0022-3514.34.6.1188 . PMID 1003323 . 
  27. Latane, B.; Dabbs, JM (1975). "Sexo, tamaño del grupo y ayuda en tres ciudades". Sociometry . 38 (2): 108– 194. doi : 10.2307/2786599 . JSTOR 2786599 . 
  28. Harrison, JA; Wells, RB (1991). "Efectos del espectador en el comportamiento de ayuda masculina: comparación social y difusión de la responsabilidad". Representative Research in Social Psychology . 96 : 187–192 .
  29. Latane, B.; Darley, JM (1968). "Inhibición grupal de la intervención de los espectadores". Journal of Personality and Social Psychology . 10 (3): 215– 221. doi : 10.1037/h0026570 . PMID 5704479. S2CID 28550502 .  
  30. Hurley, D.; Allen, BP (1974). "El efecto del número de personas presentes en una situación que no es de emergencia". Journal of Social Psychology . 92 : 27–29 . doi : 10.1080/00224545.1974.9923068 .
  31. Latane, B., & Darley, JM (1970). El espectador impasible: ¿Por qué no ayuda? Englewood Cliffs, NJ: Prentice Hall