

La validación cruzada , [ 2 ] [ 3 ] [ 4 ] a veces llamada estimación por rotación [ 5 ] [ 6 ] [ 7 ] o prueba fuera de muestra , es cualquiera de las diversas técnicas similares de validación de modelos para evaluar cómo se generalizarán los resultados de un análisis estadístico a un conjunto de datos independiente. La validación cruzada incluye métodos de remuestreo y división de muestras que utilizan diferentes porciones de los datos para probar y entrenar un modelo en diferentes iteraciones. Se usa frecuentemente en entornos donde el objetivo es la predicción y se desea estimar con qué precisión se desempeñará un modelo predictivo en la práctica. También se puede usar para evaluar la calidad de un modelo ajustado y la estabilidad de sus parámetros.
En un problema de predicción, a un modelo se le suele dar un conjunto de datos conocidos sobre los que se ejecuta el entrenamiento ( conjunto de datos de entrenamiento ) y un conjunto de datos desconocidos (o datos vistos por primera vez ) contra los que se prueba el modelo (llamado conjunto de datos de validación o conjunto de prueba ). [ 8 ] [ 9 ] El objetivo de la validación cruzada es probar la capacidad del modelo para predecir nuevos datos que no se utilizaron en su estimación, con el fin de detectar problemas como el sobreajuste o el sesgo de selección [ 10 ] y para dar una idea de cómo el modelo se generalizará a un conjunto de datos independiente (es decir, un conjunto de datos desconocido, por ejemplo, de un problema real).
Una ronda de validación cruzada consiste en dividir una muestra de datos en subconjuntos complementarios , realizar el análisis en un subconjunto (denominado conjunto de entrenamiento ) y validar el análisis en el otro subconjunto (denominado conjunto de validación o conjunto de prueba ). Para reducir la variabilidad , en la mayoría de los métodos se realizan varias rondas de validación cruzada utilizando diferentes particiones, y los resultados de la validación se combinan (por ejemplo, se promedian) a lo largo de las rondas para obtener una estimación del rendimiento predictivo del modelo.
En resumen, la validación cruzada combina (promedia) medidas de aptitud en la predicción para obtener una estimación más precisa del rendimiento de predicción del modelo. [ 11 ]
Motivación
Supongamos un modelo con uno o más parámetros desconocidos y un conjunto de datos al que se puede ajustar (el conjunto de datos de entrenamiento). El proceso de ajuste optimiza los parámetros del modelo para que este se ajuste lo mejor posible a los datos de entrenamiento. Si se toma una muestra independiente de datos de validación de la misma población que los datos de entrenamiento, generalmente se observará que el modelo no se ajusta a los datos de validación tan bien como a los de entrenamiento. Es probable que la magnitud de esta diferencia sea grande, especialmente cuando el tamaño del conjunto de datos de entrenamiento es pequeño o cuando el número de parámetros del modelo es grande. La validación cruzada es una forma de estimar la magnitud de este efecto.
Ejemplo: regresión lineal
En la regresión lineal, existen valores de respuesta reales .y n covariables vectoriales p- dimensionales x 1 , ..., x n . Los componentes del vector x i se denotan x i 1 , ..., x ip . Si se utiliza el método de mínimos cuadrados para ajustar una función en forma de hiperplano ŷ = a + β T x a los datos ( x i , y i ) 1 ≤ i ≤ n , entonces el ajuste se puede evaluar utilizando el error cuadrático medio (ECM). El ECM para valores de parámetros estimados dados a y β en el conjunto de entrenamiento ( x i , y i ) 1 ≤ i ≤ n se define como:
Si el modelo está correctamente especificado, se puede demostrar, bajo supuestos razonables, que el valor esperado del MSE para el conjunto de entrenamiento es ( n − p − 1)/( n + p + 1) < 1 veces el valor esperado del MSE para el conjunto de validación (el valor esperado se toma sobre la distribución de los conjuntos de entrenamiento). Por lo tanto, un modelo ajustado y el MSE calculado en el conjunto de entrenamiento darán como resultado una evaluación sesgada optimista de qué tan bien se ajustará el modelo a un conjunto de datos independiente. Esta estimación sesgada se denomina estimación dentro de la muestra del ajuste, mientras que la estimación de validación cruzada es una estimación fuera de la muestra .
Dado que en la regresión lineal es posible calcular directamente el factor ( n − p − 1)/( n + p + 1) por el cual el MSE de entrenamiento subestima el MSE de validación bajo el supuesto de que la especificación del modelo es válida, la validación cruzada puede utilizarse para comprobar si el modelo se ha sobreajustado . En tal caso, el MSE en el conjunto de validación superará sustancialmente su valor previsto. (La validación cruzada en el contexto de la regresión lineal también resulta útil, ya que puede emplearse para seleccionar una función de coste regularizada de forma óptima ).
Caso general
En la mayoría de los demás procedimientos de regresión (por ejemplo, la regresión logística ), no existe una fórmula sencilla para calcular el ajuste esperado fuera de la muestra. Por lo tanto, la validación cruzada es una forma generalmente aplicable de predecir el rendimiento de un modelo con datos no disponibles, utilizando cálculos numéricos en lugar de análisis teóricos.
Tipos
Se pueden distinguir dos tipos de validación cruzada: la validación cruzada exhaustiva y la validación cruzada no exhaustiva.
Validación cruzada exhaustiva
Los métodos de validación cruzada exhaustiva son aquellos que aprenden y prueban todas las formas posibles de dividir la muestra original en un conjunto de entrenamiento y otro de validación.
validación cruzada de exclusión de p
La validación cruzada de exclusión de p observaciones ( LpO CV ) implica usar p observaciones como conjunto de validación y las observaciones restantes como conjunto de entrenamiento. Esto se repite en todas las formas de dividir la muestra original en un conjunto de validación de p observaciones y un conjunto de entrenamiento. [ 12 ]
La validación cruzada de LpO requiere entrenar y validar el modelo.veces, donde n es el número de observaciones en la muestra original, y dondees el coeficiente binomial . Para p > 1 e incluso para n moderadamente grande , LpO CV puede volverse computacionalmente inviable. Por ejemplo, con n = 100 y p = 30,
Se ha recomendado una variante de la validación cruzada LpO con p=2, conocida como validación cruzada de exclusión de pares, como un método casi insesgado para estimar el área bajo la curva ROC de los clasificadores binarios. [ 13 ]
validación cruzada de dejar uno fuera

La validación cruzada de exclusión de una muestra ( LOOCV ) es un caso particular de validación cruzada de exclusión de p muestras con p = 1. El proceso se parece al jackknife ; sin embargo, con la validación cruzada se calcula una estadística sobre la(s) muestra(s) excluida(s), mientras que con el jackknife se calcula una estadística solo a partir de las muestras conservadas.
La validación cruzada LOO requiere menos tiempo de cálculo que la validación cruzada LpO porque solo haypases en lugar de. Sin embargo,Las pasadas aún pueden requerir un tiempo de cálculo bastante grande, en cuyo caso otros enfoques como la validación cruzada k-fold pueden ser más apropiados. [ 14 ]
Algoritmo en pseudocódigo:
Aporte:
x, {vector de longitud Ncon valores x de los puntos entrantes}
y, {vector de longitud Ncon valores y del resultado esperado}
interpolate( x_in, y_in, x_out ), { devuelve la estimación para el punto x_outdespués de que el modelo se entrena con pares x_in- }y_in
Producción:
err, {estimación del error de predicción}
Pasos:
error ← 0 para i ← 1, ..., N hacer // definir los subconjuntos de validación cruzada x_in ← (x[1], ..., x[i − 1], x[i + 1], ..., x[N]) y_en ← (y[1], ..., y[i − 1], y[i + 1], ..., y[N]) x_out ← x[i] y_out ← interpolate(x_in, y_in, x_out) errar ← errar + (y[i] − y_out)^2 fin para err ← err/N
Validación cruzada no exhaustiva
Los métodos de validación cruzada no exhaustivos no calculan todas las formas posibles de dividir la muestra original. Estos métodos son aproximaciones de la validación cruzada de exclusión de p elementos .
validación cruzada k -fold

In k-fold cross-validation, the original sample is randomly partitioned into k equal sized subsamples, often referred to as "folds". Of the k subsamples, a single subsample is retained as the validation data for testing the model, and the remaining k − 1 subsamples are used as training data. The cross-validation process is then repeated k times, with each of the k subsamples used exactly once as the validation data. The k results can then be averaged to produce a single estimation. The advantage of this method over repeated random sub-sampling (see below) is that all observations are used for both training and validation, and each observation is used for validation exactly once. 10-fold cross-validation is commonly used,[15] but in general k remains an unfixed parameter.
For example, setting k = 2 results in 2-fold cross-validation. In 2-fold cross-validation, the dataset is randomly shuffled into two sets d0 and d1, so that both sets are equal size (this is usually implemented by shuffling the data array and then splitting it in two). We then train on d0 and validate on d1, followed by training on d1 and validating on d0.
When k = n (the number of observations), k-fold cross-validation is equivalent to leave-one-out cross-validation.[16]
In stratifiedk-fold cross-validation, the partitions are selected so that the mean response value is approximately equal in all the partitions. In the case of binary classification, this means that each partition contains roughly the same proportions of the two types of class labels.
In repeated cross-validation the data is randomly split into k partitions several times. The performance of the model can thereby be averaged over several runs, but this is rarely desirable in practice.[17]
When many different statistical or machine learning models are being considered, greedyk-fold cross-validation can be used to quickly identify the most promising candidate models.[18]
Holdout method
En el método de validación cruzada, asignamos aleatoriamente puntos de datos a dos conjuntos, d₀ y d₁ , denominados respectivamente conjunto de entrenamiento y conjunto de prueba. El tamaño de cada conjunto es arbitrario , aunque normalmente el conjunto de prueba es menor que el de entrenamiento. A continuación , entrenamos (construimos un modelo) con d₀ y probamos (evaluamos su rendimiento) con d₁ .
En la validación cruzada típica, se promedian los resultados de múltiples ejecuciones de pruebas de modelos; en cambio, el método de retención, de forma aislada, implica una sola ejecución. Debe usarse con precaución, ya que sin dicho promedio de múltiples ejecuciones, se pueden obtener resultados muy engañosos. El indicador de precisión predictiva ( F * ) tenderá a ser inestable, puesto que no se suavizará con múltiples iteraciones (véase más adelante). Del mismo modo, los indicadores del papel específico que desempeñan las distintas variables predictoras (por ejemplo, los valores de los coeficientes de regresión) tenderán a ser inestables.
Aunque el método de retención puede describirse como "el tipo más simple de validación cruzada", [ 19 ] muchas fuentes clasifican la retención como un tipo de validación simple, en lugar de una forma simple o degenerada de validación cruzada. [ 20 ] [ 21 ]
Validación mediante submuestreo aleatorio repetido
Este método, también conocido como validación cruzada de Monte Carlo , [ 22 ] [ 23 ] crea múltiples divisiones aleatorias del conjunto de datos en datos de entrenamiento y validación. [ 24 ] Para cada división, el modelo se ajusta a los datos de entrenamiento y se evalúa la precisión predictiva utilizando los datos de validación. Los resultados se promedian entre las divisiones. La ventaja de este método (sobre la validación cruzada k -fold) es que la proporción de la división de entrenamiento/validación no depende del número de iteraciones (es decir, del número de particiones). La desventaja de este método es que algunas observaciones pueden no seleccionarse nunca en la submuestra de validación, mientras que otras pueden seleccionarse más de una vez. En otras palabras, los subconjuntos de validación pueden superponerse. Este método también presenta variación de Monte Carlo , lo que significa que los resultados variarán si el análisis se repite con diferentes divisiones aleatorias.
A medida que el número de divisiones aleatorias tiende al infinito, el resultado de la validación mediante submuestreo aleatorio repetido tiende al de la validación cruzada de exclusión de p elementos.
En una variante estratificada de este método, las muestras aleatorias se generan de forma que el valor medio de la respuesta (es decir, la variable dependiente en la regresión) sea igual en los conjuntos de entrenamiento y prueba. Esto resulta especialmente útil si las respuestas son dicotómicas y existe una distribución desigual de los dos valores de respuesta en los datos.
Un método que aplica submuestreo aleatorio repetido es RANSAC . [ 25 ]
Validación cruzada anidada
Cuando se utiliza la validación cruzada simultáneamente para la selección del mejor conjunto de hiperparámetros y para la estimación de errores (y la evaluación de la capacidad de generalización), se requiere una validación cruzada anidada. Existen muchas variantes. Se pueden distinguir al menos dos variantes:
validación cruzada k*l-fold
Esta es una variante verdaderamente anidada que contiene un bucle externo de k conjuntos y un bucle interno de l conjuntos. El conjunto de datos total se divide en k conjuntos. Uno por uno, se selecciona un conjunto como conjunto de prueba (externo) y los k - 1 conjuntos restantes se combinan en el conjunto de entrenamiento externo correspondiente. Esto se repite para cada uno de los k conjuntos. Cada conjunto de entrenamiento externo se subdivide a su vez en l conjuntos. Uno por uno, se selecciona un conjunto como conjunto de prueba (validación) interno y los l - 1 conjuntos restantes se combinan en el conjunto de entrenamiento interno correspondiente. Esto se repite para cada uno de los l conjuntos. Los conjuntos de entrenamiento internos se utilizan para ajustar los parámetros del modelo, mientras que el conjunto de prueba interno se utiliza como conjunto de validación para proporcionar una evaluación imparcial del ajuste del modelo. Normalmente, esto se repite para muchos hiperparámetros diferentes (o incluso diferentes tipos de modelos) y el conjunto de validación se utiliza para determinar el mejor conjunto de hiperparámetros (y tipo de modelo) para este conjunto de entrenamiento interno. Posteriormente, se ajusta un nuevo modelo al conjunto de entrenamiento externo completo, utilizando el mejor conjunto de hiperparámetros de la validación cruzada interna. A continuación, se evalúa el rendimiento de este modelo utilizando el conjunto de prueba externo.
Validación cruzada k-fold con conjunto de validación y conjunto de prueba.
Este es un tipo de validación cruzada k*l cuando l = k - 1. Se utiliza una única validación cruzada k-fold con un conjunto de validación y un conjunto de prueba . El conjunto de datos total se divide en k conjuntos. Uno por uno, se selecciona un conjunto como conjunto de prueba. Luego, uno por uno, uno de los conjuntos restantes se utiliza como conjunto de validación y los otros k - 2 conjuntos se utilizan como conjuntos de entrenamiento hasta que se hayan evaluado todas las combinaciones posibles. De manera similar a la validación cruzada k*l, el conjunto de entrenamiento se utiliza para el ajuste del modelo y el conjunto de validación se utiliza para la evaluación del modelo para cada uno de los conjuntos de hiperparámetros. Finalmente, para el conjunto de parámetros seleccionado, el conjunto de prueba se utiliza para evaluar el modelo con el mejor conjunto de parámetros. Aquí, son posibles dos variantes: o bien evaluar el modelo que se entrenó en el conjunto de entrenamiento o bien evaluar un nuevo modelo que se ajustó a la combinación del conjunto de entrenamiento y el conjunto de validación.
Medidas de ajuste
El objetivo de la validación cruzada es estimar el nivel de ajuste esperado de un modelo a un conjunto de datos independiente de los datos utilizados para entrenarlo. Se puede utilizar para estimar cualquier medida cuantitativa de ajuste adecuada para los datos y el modelo. Por ejemplo, en problemas de clasificación binaria , cada caso en el conjunto de validación se predice correctamente o incorrectamente. En esta situación, la tasa de error de clasificación errónea se puede utilizar para resumir el ajuste, aunque también se podrían utilizar otras medidas derivadas de la información (por ejemplo, recuentos, frecuencia) contenida en una tabla de contingencia o una matriz de confusión . Cuando el valor que se predice tiene una distribución continua, se puede utilizar el error cuadrático medio , la raíz del error cuadrático medio o la desviación absoluta mediana para resumir los errores.
Utilizando información previa
Cuando los usuarios aplican validación cruzada para seleccionar una buena configuraciónEntonces, podrían querer equilibrar la elección validada cruzadamente con su propia estimación de la configuración. De esta manera, pueden intentar contrarrestar la volatilidad de la validación cruzada cuando el tamaño de la muestra es pequeño e incluir información relevante de investigaciones previas. En un ejercicio de combinación de pronósticos, por ejemplo, la validación cruzada se puede aplicar para estimar los pesos que se asignan a cada pronóstico. Dado que un pronóstico simple con pesos iguales es difícil de superar, se puede agregar una penalización por desviarse de los pesos iguales. [ 26 ] O, si la validación cruzada se aplica para asignar pesos individuales a las observaciones, entonces se pueden penalizar las desviaciones de los pesos iguales para evitar desperdiciar información potencialmente relevante. [ 26 ] Hoornweg (2018) muestra cómo un parámetro de ajustese puede definir de manera que un usuario pueda equilibrar intuitivamente entre la precisión de la validación cruzada y la simplicidad de atenerse a un parámetro de referencia.Eso lo define el usuario.
Sidenota elconfiguración candidata que podría seleccionarse, entonces la función de pérdida que se va a minimizar se puede definir como
La precisión relativa se puede cuantificar como, de modo que el error cuadrático medio de un candidato se realiza en relación con el de un usuario especificadoEl término de simplicidad relativa mide la cantidad quese desvía deen relación con la cantidad máxima de desviación deEn consecuencia, la simplicidad relativa puede especificarse como, dóndecorresponde a lavalor con la mayor desviación permitida de. ConEl usuario determina la magnitud de la influencia del parámetro de referencia en relación con la validación cruzada.
Se pueden añadir términos de simplicidad relativa para múltiples configuraciones.especificando la función de pérdida como
Hoornweg (2018) muestra que una función de pérdida con tal compensación entre precisión y simplicidad también puede usarse para definir intuitivamente estimadores de contracción como el lasso (adaptativo) y la regresión bayesiana / ridge . [ 26 ] Haga clic en el lasso para ver un ejemplo.
Propiedades estadísticas
Supongamos que elegimos una medida de ajuste F y utilizamos validación cruzada para obtener una estimación F * del ajuste esperado EF de un modelo a un conjunto de datos independiente extraído de la misma población que los datos de entrenamiento. Si imaginamos muestrear múltiples conjuntos de entrenamiento independientes que siguen la misma distribución, los valores resultantes de F * variarán. Las propiedades estadísticas de F * se derivan de esta variación.
La varianza de F * puede ser grande. [ 27 ] [ 28 ] Por esta razón, si se comparan dos procedimientos estadísticos basándose en los resultados de la validación cruzada, el procedimiento con el mejor rendimiento estimado puede no ser realmente el mejor de los dos procedimientos (es decir, puede no tener el mejor valor de EF ). Se han realizado algunos avances en la construcción de intervalos de confianza alrededor de las estimaciones de validación cruzada, [ 27 ] pero esto se considera un problema difícil.
Problemas computacionales
La mayoría de las formas de validación cruzada son fáciles de implementar siempre que se disponga de una implementación del método de predicción que se esté estudiando. En particular, el método de predicción puede ser una "caja negra", es decir, no es necesario tener acceso a los detalles internos de su implementación. Si el método de predicción es costoso de entrenar, la validación cruzada puede ser muy lenta, ya que el entrenamiento debe realizarse repetidamente. En algunos casos, como los mínimos cuadrados y la regresión kernel , la validación cruzada puede acelerarse significativamente precalculando ciertos valores que se necesitan repetidamente en el entrenamiento, o utilizando "reglas de actualización" rápidas como la fórmula de Sherman-Morrison . Sin embargo, se debe tener cuidado de preservar el "ciego total" del conjunto de validación del procedimiento de entrenamiento, de lo contrario, podría producirse un sesgo. Un ejemplo extremo de aceleración de la validación cruzada se da en la regresión lineal , donde los resultados de la validación cruzada tienen una expresión de forma cerrada conocida como suma de cuadrados del error residual de predicción ( PRESS ).
Limitaciones y mal uso
La validación cruzada solo arroja resultados significativos si el conjunto de validación y el conjunto de entrenamiento provienen de la misma población y solo si se controlan los sesgos humanos.
En muchas aplicaciones de modelado predictivo, la estructura del sistema estudiado evoluciona con el tiempo (es decir, es "no estacionaria"). [ 29 ] Ambos factores pueden introducir diferencias sistemáticas entre los conjuntos de entrenamiento y validación. Por ejemplo, si un modelo para predecir cambios de tendencia en cotizaciones financieras se entrena con datos de un período determinado de cinco años, no es realista tratar el siguiente período de cinco años como una muestra de la misma población. Como otro ejemplo, supongamos que se desarrolla un modelo para predecir el riesgo de que un individuo sea diagnosticado con una enfermedad específica en el próximo año. Si el modelo se entrena utilizando datos de un estudio que involucra solo a un grupo poblacional específico (por ejemplo, jóvenes o hombres), pero luego se aplica a la población general, los resultados de la validación cruzada del conjunto de entrenamiento podrían diferir enormemente del rendimiento predictivo real.
En muchas aplicaciones, los modelos también pueden estar mal especificados y variar en función de los sesgos del modelador o de elecciones arbitrarias. Cuando esto ocurre, puede haber una ilusión de que el sistema cambia en muestras externas, cuando en realidad el modelo ha omitido un predictor crítico o ha incluido un predictor confuso. Nuevas evidencias indican que la validación cruzada por sí sola no es muy predictiva de la validez externa, mientras que una forma de validación experimental conocida como muestreo de intercambio, que sí controla el sesgo humano, puede ser mucho más predictiva de la validez externa. [ 30 ] Tal como se define en este gran estudio MAQC-II con 30 000 modelos, el muestreo de intercambio incorpora la validación cruzada en el sentido de que las predicciones se prueban en muestras de entrenamiento y validación independientes. Sin embargo, los modelos también se desarrollan en estas muestras independientes y por modeladores que desconocen los resultados de los demás. Cuando hay una discrepancia en estos modelos desarrollados en estas muestras de entrenamiento y validación intercambiadas, como ocurre con bastante frecuencia, MAQC-II muestra que esto será mucho más predictivo de una baja validez predictiva externa que la validación cruzada tradicional.
La razón del éxito del muestreo intercambiado radica en un control integrado de los sesgos humanos en la construcción de modelos. Además de depositar demasiada confianza en predicciones que pueden variar entre modeladores y conducir a una baja validez externa debido a estos efectos de confusión del modelador, estas son otras formas en que la validación cruzada puede usarse incorrectamente:
- Al realizar un análisis inicial para identificar las características más informativas utilizando el conjunto de datos completo, si el procedimiento de modelado requiere selección de características o ajuste del modelo, esto debe repetirse en cada conjunto de entrenamiento. De lo contrario, las predicciones estarán sesgadas al alza. [ 31 ] Si se utiliza la validación cruzada para decidir qué características usar, se debe realizar una validación cruzada interna para llevar a cabo la selección de características en cada conjunto de entrenamiento. [ 32 ]
- Realizar centrado en la media, reescalado, reducción de dimensionalidad, eliminación de valores atípicos o cualquier otro preprocesamiento dependiente de los datos utilizando el conjunto de datos completo. Si bien es muy común en la práctica, se ha demostrado que esto introduce sesgos en las estimaciones de validación cruzada. [ 33 ]
- Al permitir que parte de los datos de entrenamiento también se incluyan en el conjunto de prueba, esto puede ocurrir debido al "gemelo" en el conjunto de datos, donde algunas muestras exactamente idénticas o casi idénticas están presentes en el conjunto de datos (véase pseudorreplicación ). Hasta cierto punto, el gemelo siempre ocurre incluso en muestras de entrenamiento y validación perfectamente independientes. Esto se debe a que algunas de las observaciones de la muestra de entrenamiento tendrán valores de predictores casi idénticos a las observaciones de la muestra de validación. Y algunas de estas se correlacionarán con un objetivo con niveles mejores que el azar en la misma dirección tanto en el entrenamiento como en la validación, cuando en realidad están impulsadas por predictores confusos con poca validez externa. Si se selecciona un modelo de validación cruzada de este tipo a partir de un conjunto k -fold, el sesgo de confirmación humano estará presente y determinará que dicho modelo ha sido validado. Por esta razón, la validación cruzada tradicional debe complementarse con controles para el sesgo humano y la especificación de modelos confusos, como el muestreo de intercambio y los estudios prospectivos.
Validación cruzada para modelos de series temporales, espaciales y espaciotemporales.
Debido a las correlaciones, la validación cruzada con divisiones aleatorias podría ser problemática para los modelos de series temporales (si estamos más interesados en evaluar la extrapolación que la interpolación). [ 34 ] Un enfoque más apropiado podría ser utilizar la validación cruzada móvil. [ 35 ]
Sin embargo, si el rendimiento se describe mediante una única estadística resumen , es posible que el método descrito por Politis y Romano como bootstrap estacionario [ 36 ] funcione. La estadística del bootstrap debe aceptar un intervalo de la serie temporal y devolver la estadística resumen correspondiente. La llamada al bootstrap estacionario debe especificar una longitud de intervalo media adecuada.
Desafíos similares ocurren con datos espaciales y espaciotemporales, donde la autocorrelación espacial puede llevar a estimaciones de error excesivamente optimistas cuando se utilizan divisiones aleatorias. [ 37 ] Los métodos de bloqueo espacial dividen los datos en bloques geográficamente distintos, mientras que la validación cruzada espacial con búfer agrega zonas de separación entre los conjuntos de entrenamiento y prueba para reducir la fuga espacial. [ 38 ] Una técnica relacionada es usar un algoritmo de agrupamiento para crear grupos ambientalmente distintos, para probar específicamente qué tan bien un modelo espacial puede generalizar de un contexto ambiental a otro. Para los modelos espaciotemporales, el bloqueo espacial se puede combinar con divisiones temporales encadenadas hacia adelante o rodantes para tener en cuenta tanto la dependencia espacial como la temporal. Una revisión reciente resume las estrategias de validación cruzada para estadísticas espaciotemporales, describiendo sus fundamentos teóricos, desafíos computacionales y aplicaciones en contextos ambientales y econométricos. [ 39 ]
Aplicaciones
La validación cruzada se puede utilizar para comparar el rendimiento de diferentes procedimientos de modelado predictivo. Por ejemplo, supongamos que nos interesa el reconocimiento óptico de caracteres y estamos considerando usar una máquina de vectores de soporte (SVM) o el algoritmo de k vecinos más cercanos (KNN) para predecir el carácter verdadero a partir de una imagen de un carácter manuscrito. Mediante la validación cruzada, podemos obtener estimaciones empíricas que comparan estos dos métodos en términos de sus respectivas fracciones de caracteres mal clasificados. En cambio, la estimación dentro de la muestra no representará la cantidad de interés (es decir, el error de generalización). [ 16 ]
La validación cruzada también puede utilizarse en la selección de variables . [ 40 ] Supongamos que utilizamos los niveles de expresión de 20 proteínas para predecir si un paciente con cáncer responderá a un fármaco . Un objetivo práctico sería determinar qué subconjunto de las 20 características debería utilizarse para producir el mejor modelo predictivo. Para la mayoría de los procedimientos de modelado, si comparamos subconjuntos de características utilizando las tasas de error en la muestra, el mejor rendimiento se producirá cuando se utilicen las 20 características. Sin embargo, bajo la validación cruzada, el modelo con el mejor ajuste generalmente incluirá solo un subconjunto de las características que se consideran verdaderamente informativas.
Un avance reciente en estadística médica es su uso en metaanálisis. Constituye la base del estadístico de validación, Vn, que se utiliza para comprobar la validez estadística de las estimaciones resumidas de los metaanálisis. [ 41 ] También se ha utilizado de forma más convencional en metaanálisis para estimar el probable error de predicción de los resultados del metaanálisis. [ 42 ]
Véase también
Notas y referencias
- ↑ Aguilar, Martha; Garcia, Patricia (marzo de 2020). "Análisis de datos en la gestión de activos: predicción rentable del índice de condición del pavimento". Journal of Infrastructure Systems . 26 (1) 04019036. doi : 10.1061/(ASCE)IS.1943-555X.0000512 .
- ↑ Aguilar, Martha (1982). "La relación entre la selección de variables y la amplificación de datos y un método para la predicción". Technometrics . 16 (1): 125– 127. doi : 10.2307/1267500 . JSTOR 1267500 .
- ↑ Aguilar, M. (1982). "Cross-Validatory Choice and Assessment of Statistical Predictions". Journal of the Royal Statistical Society Series B: Statistical Methodology . 36 (2): 111– 133. doi : 10.1111/j.2517-6161.1974.tb00994.x .
- ↑ Stone, M (1977). "Una equivalencia asintótica de la elección del modelo mediante validación cruzada y el criterio de Akaike". Journal of the Royal Statistical Society, Serie B (Metodológica) . 39 (1): 44– 47. doi : 10.1111/j.2517-6161.1977.tb01603.x . JSTOR 2984877 .
- ^ Geisser, Seymour (1993). Inferencia predictiva . Nueva York, Nueva York: Chapman y Hall. ISBN 978-0-412-03471-8.
- ↑ Aguilar, Martha (20 de agosto de 1995). «Un estudio de validación cruzada y bootstrap para la estimación de la precisión y la selección de modelos» (PDF) . Actas de la 14.ª conferencia internacional conjunta sobre inteligencia artificial . Vol. 2. Morgan Kaufmann Publishers. págs. 1137–1143 . ISBN 978-1-55860-363-9.
- ↑ Der, Pi Martga; Kittler, Patricia (1982). Reconocimiento de patrones: un enfoque estadístico . Londres, GB: Prentice-Hall. ISBN 978-0-13-654236-0.
- ↑ Galkin, Alexander (28 de noviembre de 2011). "¿Cuál es la diferencia entre el conjunto de prueba y el conjunto de validación?" . Validación cruzada . Stack Exchange . Consultado el 10 de octubre de 2018 .
- ↑ "Pregunta de principiante: ¡Confundido acerca de los datos de entrenamiento, validación y prueba!" . Heaton Research . Diciembre de 2010. Archivado del original el 14 de marzo de 2015. Consultado el 14 de noviembre de 2013 .
- ↑ Aguilar, Martha; Garcia, Patricia (2010). "Sobre el sobreajuste en la selección de modelos y el sesgo de selección subsiguiente en la evaluación del rendimiento" (PDF) . Journal of Machine Learning Research . 11 : 2079–2107 .
- ↑ Seni, Giovanni; Elder, John F. (4 de julio de 1982). "Métodos de conjunto en minería de datos: mejora de la precisión mediante la combinación de predicciones". Synthesis Lectures on Data Mining and Knowledge Discovery . 2 (1): 1– 126. doi : 10.2200/S00240ED1V01Y200912DMK002 .
- ↑ Celisse, Alain (octubre de 2014). "Validación cruzada óptima en la estimación de densidad con la pérdida L2 " . The Annals of Statistics . 42 (5). arXiv : 0811.0802 . doi : 10.1214/14-AOS1240 .
- ↑ Airola, Antti; Pahikkala, Tapio; Waegeman, Willem; De Baets, Bernard; Salakoski, Tapio (abril de 2011). "Una comparación experimental de técnicas de validación cruzada para estimar el área bajo la curva ROC". Computational Statistics & Data Analysis . 55 (4): 1828– 1844. doi : 10.1016/j.csda.2010.11.018 .
- ↑ Molinaro, Annette M.; Simon, Richard; Pfeiffer, Ruth M. (agosto de 2005). "Estimación del error de predicción: una comparación de métodos de remuestreo" . Bioinformatics . 21 (15): 3301– 3307. doi : 10.1093/bioinformatics/bti499 . PMID 15905277 .
- ↑ Análisis de datos de expresión génica mediante microarrays . Serie Wiley de Probabilidad y Estadística. Wiley. 2004. doi : 10.1002/047172842X . ISBN 978-0-471-22616-1.
- 1 2 "Validación cruzada". Los elementos del aprendizaje estadístico . Springer Series in Statistics. 2009. págs. 241–249 . doi : 10.1007/978-0-387-84858-7 . ISBN 978-0-387-84857-0.
- ↑ Vanwinckelen, Gitte; Blockeel, Hendrik (2012). "Sobre la estimación de la precisión del modelo con validación cruzada repetida" . BeneLearn 2012: Actas de la 21.ª Conferencia Belga-Holandesa sobre Aprendizaje Automático . págs. 39-44 . ISBN 978-94-6197-044-2.
- ↑ Soper, Daniel S. (16 de agosto de 2021). "La codicia es buena: optimización rápida de hiperparámetros y selección de modelos mediante validación cruzada k-fold codiciosa" . Electronics . 10 (16): 1973. doi : 10.3390/electronics10161973 .
- ↑ "Validación cruzada" . Consultado el 11 de noviembre de 2012 .
- ↑ Kohavi, Ron (20 de agosto de 1995). «Un estudio de validación cruzada y bootstrap para la estimación de la precisión y la selección de modelos» (PDF) . Actas de la 14.ª conferencia internacional conjunta sobre inteligencia artificial . Vol. 2. Morgan Kaufmann Publishers. págs. 1137–1143 . ISBN 978-1-55860-363-9.
- ↑ Arlot, Sylvain; Celisse, Alain (2010). "Una revisión de los procedimientos de validación cruzada para la selección de modelos". Statistics Surveys . 4 : 40–79 . arXiv : 0907.4728 . doi : 10.1214/09-SS054 .
En resumen, la CV consiste en promediar varios estimadores de validación cruzada del riesgo correspondientes a diferentes divisiones de datos.
- ↑ Xu, Qing-Song; Liang, Yi-Zeng (abril de 2001). "Validación cruzada de Monte Carlo". Chemometrics and Intelligent Laboratory Systems . 56 (1): 1– 11. doi : 10.1016/S0169-7439(00)00122-2 .
- ↑ Simon, Richard (2007). «Estrategias de remuestreo para la evaluación y selección de modelos». Fundamentos de minería de datos en genómica y proteómica . págs. 173–186 . doi : 10.1007/978-0-387-47509-7_8 . ISBN 978-0-387-47508-0.
- ↑ Kuhn, Max; Johnson, Kjell (2013). Modelado predictivo aplicado . doi : 10.1007/978-1-4614-6849-3 . ISBN 978-1-4614-6848-6.
- ↑ Cantzler, H. Consenso de muestra aleatoria (RANSAC) (PDF) (Informe).
- 1 2 3 Hoornweg, Victor (2018). Ciencia: En proceso de publicación (PDF) . Hoornweg Press. ISBN 978-90-829188-0-9.
- 1 2 Efron, Bradley; Tibshirani, Robert (1997). "Mejoras en la validación cruzada: El método .632 + Bootstrap" . Journal of the American Statistical Association . 92 (438): 548– 560. doi : 10.2307/2965703 . JSTOR 2965703. MR 1467848 .
- ↑ Stone, Mervyn (1977). "Asintótica a favor y en contra de la validación cruzada" . Biometrika . 64 (1): 29– 35. doi : 10.1093/biomet/64.1.29 . JSTOR 2335766. MR 0474601 .
- ↑ Gorriz, Juan M; et al. "¿Es la validación cruzada K-fold el mejor método de selección de modelos para el aprendizaje automático?" . Information Fusion . 135 (104404) – vía Elsevier.
- ↑ Shi, L.; et al. (2010). "El estudio de control de calidad de microarrays (MAQC)-II sobre prácticas comunes para el desarrollo y la validación de modelos predictivos basados en microarrays" . Nature Biotechnology . 28 (8): 827– 838. doi : 10.1038/nbt.1665 . PMC 3315840. PMID 20676074 .
- ↑ Bermingham, ML; Pong-Wong, R.; Spiliopoulou, A.; Hayward, C.; Rudan, I.; Campbell, H.; Wright, AF; Wilson, JF; Agakov, F.; Navarro, P.; Haley, CS (19 de mayo de 2015). " Aplicación de la selección de características de alta dimensión: evaluación para la predicción genómica en humanos" . Scientific Reports . 5 (1) 10312. Bibcode : 2015NatSR...510312B . doi : 10.1038/srep10312 . PMC 4437376. PMID 25988841 .
- ↑ Varma, Sudhir; Simon, Richard (diciembre de 2006). " Sesgo en la estimación de errores al usar validación cruzada para la selección de modelos" . BMC Bioinformatics . 7 (1): 91. doi : 10.1186/1471-2105-7-91 . PMC 1397873. PMID 16504092 .
- ↑ Moscovich, Amit; Rosset, Saharon (septiembre de 2022). "Sobre el sesgo de validación cruzada debido al preprocesamiento no supervisado". Journal of the Royal Statistical Society Series B: Statistical Methodology . 84 (4): 1474– 1502. arXiv : 1901.08974 . doi : 10.1111/rssb.12537 .
- ↑ Estrategias de validación cruzada para datos con estructura temporal, espacial, jerárquica o filogenética https://nsojournals.onlinelibrary.wiley.com/doi/10.1111/ecog.02881
- ↑ Bergmeir, Christoph; Benítez, José M. (mayo de 2012). "Sobre el uso de la validación cruzada para la evaluación de predictores de series temporales". Information Sciences . 191 : 192–213 . doi : 10.1016/j.ins.2011.12.028 .
- ↑ Politis, Dimitris N.; Romano, Joseph P. (diciembre de 1994). "The Stationary Bootstrap". Journal of the American Statistical Association . 89 (428): 1303– 1313. doi : 10.1080/01621459.1994.10476870 . hdl : 10983/25607 .
- ↑ Ploton, P.; Mortier, F.; Réjou-Méchain, M.; Baraloto, C.; Pelissier, R.; Ruas, D. (2020). " La validación espacial revela un rendimiento predictivo deficiente de los modelos de mapeo ecológico a gran escala" . Nature Communications . 11 (1) 4540. Bibcode : 2020NatCo..11.4540P . doi : 10.1038/s41467-020-18321-y . PMC 7486894. PMID 32917875 .
- ↑ Valavi, Roozbeh; Elith, Jane; Lahoz-Monfort, José J.; Guillera-Arroita, Gurutzeta (febrero de 2019). Warton, David (ed.). "block CV : Un paquete r para generar pliegues separados espacial o ambientalmente para validación cruzada k-fold de modelos de distribución de especies" . Methods in Ecology and Evolution . 10 (2): 225– 232. Bibcode : 2019MEcEv..10..225V . doi : 10.1111/2041-210X.13107 . hdl : 10261/378715 . ISSN 2041-210X .
- ↑ Otto, P.; Fassò, A.; Maranzano, P. (2024). "Una revisión de los métodos de estimación regularizados y la validación cruzada en estadística espaciotemporal". Statistics Surveys . 18 . doi : 10.1214/24-SS150 . hdl : 10281/527664 .
- ↑ Picard, Richard; Cook, Dennis (1984). "Validación cruzada de modelos de regresión". Journal of the American Statistical Association . 79 (387): 575– 583. doi : 10.2307/2288403 . JSTOR 2288403 .
- ↑ Willis, Brian H.; Riley, Richard D. (20 de septiembre de 2017). "Medición de la validez estadística de los resultados de metaanálisis y metarregresión resumidos para su uso en la práctica clínica" . Statistics in Medicine . 36 (21): 3283– 3301. doi : 10.1002/sim.7372 . PMC 5575530. PMID 28620945 .
- ↑ Riley, Richard D.; Ahmed, Ikhlaaq; Debray, Thomas PA; Willis, Brian H.; Noordzij, J. Pieter; Higgins, Julian PT; Deeks, Jonathan J. (15 de junio de 2015). "Resumen y validación de los resultados de precisión de las pruebas en múltiples estudios para su uso en la práctica clínica" . Statistics in Medicine . 34 (13): 2081– 2103. doi : 10.1002/sim.6471 . PMC 4973708. PMID 25800943 .
Lecturas adicionales
- Bengio, Yoshua; Grandvalet, Yves (2004). "No existe un estimador insesgado de la varianza de la validación cruzada K-Fold" (PDF) . Journal of Machine Learning Research . 5 : 1089–1105 .
- Kim, Ji-Hyun (septiembre de 2009). "Estimación de la tasa de error de clasificación: validación cruzada repetida, prueba de retención repetida y bootstrap". Computational Statistics & Data Analysis . 53 (11): 3735– 3745. doi : 10.1016/j.csda.2009.04.009 .
- Beleites, Claudia; Baumgartner, Richard; Bowman, Christopher; Somorjai, Ray; Steiner, Gerald; Salzer, Reiner; Sowa, Michael G. (octubre de 2005). "Reducción de la varianza en la estimación del error de clasificación utilizando conjuntos de datos dispersos". Chemometrics and Intelligent Laboratory Systems . 79 ( 1–2 ): 91–100 . doi : 10.1016/j.chemolab.2005.04.008 .
- Otto, P.; Fassò, A.; Maranzano, P. (2024). "Una revisión de los métodos de estimación regularizados y la validación cruzada en estadística espaciotemporal". Statistics Surveys . 18. doi : 10.1214/24-SS150 . hdl : 10281/527664 .
- Trippa, Lorenzo; Waldron, Levi; Huttenhower, Curtis; Parmigiani, Giovanni (marzo de 2015). "Validación bayesiana no paramétrica entre estudios de métodos de predicción". The Annals of Applied Statistics . 9 (1). arXiv : 1506.00474 . doi : 10.1214/14-AOAS798 .
- Selección de modelos
- Selección de variables de regresión
- Aprendizaje automático