Ventanas expansivas y móviles para validar modelos walk-forward
Compara ventanas de entrenamiento expansivas y móviles de longitud fija, separa la validación de la prueba final y elige reglas sin usar resultados futuros.
En esta guíaUn fold walk-forward tiene ventanas distintas de entrenamiento y evaluación
Resumen breve
Una ventana de entrenamiento expansiva conserva el historial elegible inicial y añade los datos nuevos a medida que se conocen. Una ventana móvil mantiene un número fijo de las observaciones elegibles más recientes y descarta las anteriores. Ambas sirven para una evaluación cronológica walk-forward; ninguna sustituye la separación entre selección del modelo y prueba final.
Un fold walk-forward tiene ventanas distintas de entrenamiento y evaluación
En el origen de una predicción, el investigador conoce algunas características y resultados pasados, ajusta o actualiza el modelo y lo evalúa en un bloque posterior. Al avanzar el origen se crean periodos sucesivos fuera de muestra. La regla de entrenamiento determina qué filas pasadas elegibles entran en cada ajuste. Las reglas de validación y prueba determinan qué resultados posteriores sirven para comparar opciones y estimar el rendimiento. Son decisiones relacionadas, pero no la misma ventana.
La regla expansiva parte de un límite histórico fijo y crece cuando se conocen nuevos resultados. La móvil desplaza ambos extremos y, tras el periodo inicial, conserva el mismo número de observaciones. Ninguna puede usar un objetivo que aún no haya terminado en el origen. Si las etiquetas abarcan varias sesiones, la fecha de la fila quizá no indique cuándo se conoció el resultado: guarda la hora de finalización de la etiqueta y respétala.
Separa también la ventana retrospectiva de las características de la ventana de entrenamiento. Una señal puede calcular la volatilidad de cada fila con un periodo reciente, mientras el modelo usa filas de varios años. Cambiar la ventana de la característica modifica los predictores; cambiar la de entrenamiento modifica las observaciones con las que se estima el modelo.
Una ventana expansiva conserva el historial inicial
Sea \(s\) el índice de la primera observación elegible y \(t\) el de la última cuyo resultado ya está completo al reajustar. El conjunto expansivo es \(\{s,s+1,\ldots,t\}\). En el siguiente origen conserva esas filas y añade las nuevas que ya son elegibles. Por tanto, la muestra crece salvo que una regla aparte filtre o elimine datos.
Más observaciones pueden reducir el ruido muestral de los parámetros si los datos antiguos aún describen el proceso. También pueden conservar episodios de mercado infrecuentes que una muestra reciente corta omitiría y evitan elegir un corte histórico arbitrario. Pero las filas antiguas no pierden influencia solo por su edad. Si cambia la relación entre predictores y rendimientos, pueden arrastrar las estimaciones hacia condiciones pasadas; además, los reajustes grandes tardan más. Conservar historia no la hace automáticamente más representativa.
Una ventana móvil descarta las observaciones fuera del tramo elegido
Para una longitud fija \(W\), el conjunto en el origen \(t\) es \(\{t-W+1,\ldots,t\}\), tras considerar el retraso de las etiquetas y cualquier hueco de frontera. En el siguiente origen avanza el extremo final y sale la fila elegible más antigua. La longitud puede expresarse en observaciones o tiempo de calendario, pero no son equivalentes si los datos son irregulares.
La ventana móvil impone una regla de actualidad: solo las observaciones del tramo elegido entran directamente en el ajuste. Puede convenir si la pregunta es cómo adaptarse a condiciones cambiantes o si la operación exige un tamaño de muestra limitado. No vuelve al modelo adaptable por sí sola. Con reajustes poco frecuentes o cambios graduales, la respuesta puede retrasarse. Un tramo corto ofrece menos información, puede volver inestables las estimaciones, omitir episodios de estrés poco comunes o dejar pocas muestras para modelos complejos; uno largo conserva más historia, pero puede diluir patrones recientes.
La unidad también importa: el mismo número de filas puede abarcar distintos periodos de calendario por festivos, datos ausentes o distinta frecuencia. En datos de panel, define si se eliminan filas o grupos de activos por fecha. Elegir \(W\) después de mirar la prueba final traslada allí la selección y deja de ser una prueba independiente.
Las dos reglas dan a cada ajuste un historial distinto
| Opción | Filas de entrenamiento en cada ajuste | Ventaja posible | Coste que conviene examinar |
|---|---|---|---|
| Expansiva | Todas las filas elegibles desde un inicio fijo | Más observaciones y episodios antiguos | Siguen influyendo regímenes pasados; los ajustes crecen |
| Móvil | El tramo fijo más reciente de filas elegibles | Límite explícito de actualidad y muestra acotada | Menos información y mayor sensibilidad a la longitud |
Para aislar la regla de ventana, mantén iguales el corte de información, las características, la familia de modelo, el objetivo de entrenamiento, las fechas de ajuste, el horizonte, los bloques de prueba y las hipótesis de ejecución. Si el modelo móvil se reajusta más a menudo o cambia otras opciones, no atribuyas la diferencia de puntuación solo a la ventana.
Estos métodos tampoco determinan el origen de predicción. Se pueden evaluar ambas ventanas con orígenes móviles: entrenar con el pasado elegible, predecir el bloque siguiente, avanzar y repetir. La revisión de Leonard Tashman sobre pruebas de predicción fuera de muestra00065-0) trata los orígenes móviles y las ventanas móviles de estimación. Uno indica cuándo se evalúa; la otra, qué filas de entrenamiento se conservan.
Un calendario hipotético muestra qué entra en cada ajuste
Las cifras y fechas son hipotéticas. Supón que el modelo se reajusta cada mes para predecir el rendimiento del mes siguiente y que el primer ajuste usa 60 observaciones elegibles hasta el mes 120. Una etiqueta solo se puede usar cuando termina su resultado. En el primer origen, las dos reglas usan las mismas 60 filas si la ventana móvil tiene longitud 60.
Cuando se conoce un nuevo resultado mensual, la muestra expansiva pasa a 61 filas; la móvil añade la nueva y elimina la más antigua, manteniendo 60. Tras 12 actualizaciones, la expansiva tiene 72 filas desde el inicio original y la móvil conserva las 60 más recientes. Las estimaciones pueden diferir porque el historial cambia, aunque todas las filas estuvieran disponibles en sus respectivos ajustes.
Reserva los últimos 24 meses como prueba externa en este ejemplo. La regla y longitud de ventana, las características y los demás ajustes deben seleccionarse en bloques de validación cronológica anteriores. Después, evalúa la selección congelada con el calendario de reajuste declarado de antemano. Cambiar la longitud al ver la prueba externa usa esos resultados para seleccionar y exagera la evidencia final.
Elige la regla dentro de una validación cronológica
Antes de comparar, formula la pregunta: ¿debe el modelo usar todo el historial disponible en cada ajuste o hay motivos para excluir ejemplos antiguos? ¿Se espera que la relación objetivo sea estable o pueden cambiar sus variables relevantes? Esto orienta los candidatos, pero no demuestra de antemano cuál rendirá mejor en un mercado concreto.
Usa datos de desarrollo anteriores para comparar pocas opciones predefinidas —por ejemplo, la expansiva y varias longitudes móviles plausibles— en los mismos bloques cronológicos y con la misma cadencia de ajuste. Define antes el objetivo: la pérdida predictiva, calibración, utilidad de cartera ajustada por rotación y caída máxima responden a preguntas distintas. Mantén constantes los costes y límites, y registra ajustes fallidos y predicciones ausentes. Si se solapan objetivos o bloques, las puntuaciones cercanas pueden compartir rendimientos; describe la dependencia y no cuentes cada fila como experimento independiente.
Reserva un periodo cronológico posterior para la comprobación final. En un diseño anidado, la validación interna elige la ventana y otros ajustes solo con datos anteriores a cada bloque de prueba externo; los resultados externos evalúan el procedimiento completo de selección. La guía de validación cruzada purgada explica los límites cuando se solapan etiquetas; el sobreajuste de modelos financieros y las pruebas múltiples cubren otros riesgos de selección.
Alinea etiquetas, preprocesamiento y reajustes con la información disponible entonces
En cada origen usa solo las características y etiquetas que ya se conocían. Un rendimiento a varios días puede seguir incompleto cerca del límite de validación aunque la fecha de decisión sea anterior. Deja un hueco o purga filas según los intervalos reales de las etiquetas cuando haga falta; un número fijo de filas solo sirve si lo justifican la frecuencia y el horizonte. Ninguna ventana corrige una característica con información futura.
Ajusta imputación, escalado, selección de características y demás preprocesamiento aprendido solo con el entrenamiento de cada fold. Si eliges un umbral o hiperparámetro, usa una validación cronológica interna del periodo de entrenamiento y congela esa decisión al puntuar el bloque posterior. La documentación oficial de scikit-learn de TimeSeriesSplit describe un conjunto de entrenamiento expansivo por defecto y max_train_size para limitar su tamaño. gap cuenta muestras; comparar duraciones equivalentes presupone observaciones equiespaciadas. Comprueba aparte los tiempos de las etiquetas y la versión de la biblioteca utilizada.
Informa el rendimiento por origen y describe los límites
Indica la regla y longitud exacta, la fecha más antigua conservada, las filas elegibles por ajuste, cuándo están disponibles las etiquetas, las fechas de validación y prueba, el horizonte y el calendario de reajuste. Presenta resultados por bloque además del agregado: la media puede ocultar que un episodio domina y los pronósticos contiguos pueden compartir resultados, así que no siempre son evidencia independiente.
La precisión de una predicción no equivale al rendimiento neto de una estrategia. La construcción de posiciones, el apalancamiento, la rotación, la liquidez, las comisiones, el diferencial, el impacto, el préstamo, la financiación y el momento de ejecución alteran el resultado. Mantén estos supuestos iguales y señala qué omite la evaluación. El estudio de Cerqueira, Torgo y Mozetič sobre estimación del rendimiento en series temporales informa que las estimaciones pueden variar entre contextos estacionarios y no estacionarios. No compara directamente políticas de ventanas financieras ni demuestra que una gane siempre.
Interpreta cada backtest como evidencia sobre un historial y proceso concretos. La expansiva puede conservar un régimen obsoleto; la móvil puede descartar información útil y aumentar el ruido. La regla elegida puede fallar en otro régimen, universo o estructura de costes. La validación reduce la incertidumbre sobre el procedimiento probado, pero no promete rendimientos futuros ni demuestra que una ventana sea óptima.
Preguntas frecuentes
Q1¿Una ventana expansiva siempre es mejor porque usa más datos?
No. Más filas pueden estabilizar las estimaciones si los datos antiguos siguen siendo pertinentes, pero los regímenes obsoletos también pueden seguir influyendo. Depende de los datos, el objetivo, las características, el estimador y el periodo.
Q2¿Una ventana móvil se adapta automáticamente a un cambio de régimen?
No. Elimina filas al salir del tramo, pero no detecta cambios ni garantiza que la nueva muestra represente el próximo régimen. Siguen importando la frecuencia de reajuste, la longitud y el diseño del modelo.
Q3¿Puedo usar el mismo periodo para ajustar la ventana e informar el resultado final?
Ese periodo formaría parte de la selección del modelo. Elige la regla con validación cronológica y evalúa el procedimiento congelado en una prueba posterior intacta. Incluso ese resultado solo describe el historial y los supuestos probados.
Fuentes
Informar de un problema
Prepararemos un correo con el enlace de este artículo. Mark recibirá el aviso cuando lo envíes
Comprobación rápida
¿Ya leíste la guía? Compruébalo con 3 preguntas
Pregunta 01
¿Qué cambia en el siguiente ajuste de una ventana de entrenamiento móvil de longitud fija?
Elige una respuesta para ver la explicación
Glosario de opciones
Relación entre el error predictivo sistemático por incompatibilidad del modelo y la inestabilidad causada por sensibilidad a la muestra de entrenamiento.
Leer la guía detalladaTasa de error familiarProbabilidad de rechazar falsamente al menos una hipótesis nula verdadera dentro de una familia de pruebas predefinida.
Leer la guía detalladaAsignaciónProceso por el que el vendedor debe cumplir la obligación del contrato tras recibir un aviso de ejercicio; puede crear o eliminar una posición en el subyacente
Leer la guía detallada