En estadística , las hipótesis sugeridas por un conjunto de datos dado, al ser contrastadas con el mismo conjunto de datos que las sugirió, tienden a aceptarse incluso cuando no son ciertas. Esto se debe a que se produce un razonamiento circular (doble validación): algo parece ser cierto en el conjunto de datos limitado; por lo tanto, planteamos la hipótesis de que es cierto en general; en consecuencia, lo contrastamos erróneamente con el mismo conjunto de datos limitado, lo que parece confirmar su veracidad. Generar hipótesis basadas en datos ya observados, sin contrastarlas con nuevos datos, se denomina teorización post hoc (del latín post hoc , «después de esto»).
El procedimiento correcto consiste en probar cualquier hipótesis con un conjunto de datos que no se haya utilizado para generar dicha hipótesis.
El problema general
Poner a prueba una hipótesis sugerida por los datos puede fácilmente generar falsos positivos ( errores de tipo I ). Si se busca durante el tiempo suficiente y en diferentes lugares, eventualmente se pueden encontrar datos que respalden cualquier hipótesis. Sin embargo, estos datos positivos por sí solos no constituyen evidencia de que la hipótesis sea correcta. Los datos negativos descartados son igualmente importantes, ya que permiten hacerse una idea de la frecuencia de los resultados positivos en comparación con el azar. Realizar un experimento, observar un patrón en los datos, proponer una hipótesis a partir de ese patrón y luego usar los mismos datos experimentales como evidencia para la nueva hipótesis es extremadamente sospechoso, porque los datos de todos los demás experimentos, realizados o potenciales, se han descartado esencialmente al optar por considerar solo los experimentos que sugirieron la nueva hipótesis en primer lugar.
Un conjunto amplio de pruebas, como el descrito anteriormente, aumenta considerablemente la probabilidad de error de tipo I, ya que se descartan todos los datos excepto los más favorables a la hipótesis . Esto representa un riesgo, no solo en las pruebas de hipótesis , sino en toda la inferencia estadística , puesto que a menudo resulta problemático describir con precisión el proceso seguido para la búsqueda y el descarte de datos . En otras palabras, se busca conservar todos los datos (independientemente de si apoyan o refutan la hipótesis) de las "buenas pruebas", pero a veces es difícil determinar qué constituye una "buena prueba". Este es un problema particular en el modelado estadístico , donde se rechazan muchos modelos diferentes mediante ensayo y error antes de publicar un resultado (véase también sobreajuste y sesgo de publicación ).
Este error es particularmente frecuente en la minería de datos y el aprendizaje automático . También suele ocurrir en las publicaciones académicas, donde solo se aceptan los informes de resultados positivos, en lugar de los negativos, lo que da lugar al fenómeno conocido como sesgo de publicación .
Procedimientos correctos
Todas las estrategias para una comprobación rigurosa de las hipótesis sugeridas por los datos implican la inclusión de una gama más amplia de pruebas en un intento de validar o refutar la nueva hipótesis. Estas incluyen:
- Recopilación de muestras de confirmación
- Validación cruzada
- Métodos de compensación para comparaciones múltiples
- Estudios de simulación que incluyan una representación adecuada de las pruebas múltiples realmente involucradas.
La prueba simultánea de todos los contrastes de Henry Scheffé en problemas de comparaciones múltiples es el remedio más conocido en el caso del análisis de varianza . [ 1 ] Es un método diseñado para probar hipótesis sugeridas por los datos evitando la falacia descrita anteriormente.
Véase también
Notas y referencias
- ↑ Henry Scheffé , «Un método para juzgar todos los contrastes en el análisis de varianza», Biometrika , 40, páginas 87-104 (1953). doi : 10.1093/biomet/40.1-2.87
- Mal uso de las estadísticas
- Pruebas de hipótesis estadísticas