Fenêtres extensibles et glissantes pour la validation walk-forward
Comparez les fenêtres d’entraînement extensibles et glissantes de longueur fixe, séparez validation et test final, et choisissez les règles sans résultats futurs.
Dans ce guideUn fold walk-forward sépare entraînement et évaluation
Bref résumé
Une fenêtre d’entraînement extensible conserve l’historique admissible le plus ancien et ajoute les nouvelles données à mesure qu’elles sont observées. Une fenêtre glissante garde un nombre fixe des observations admissibles les plus récentes et écarte les anciennes. Les deux conviennent à une évaluation chronologique walk-forward ; aucune ne dispense de séparer le choix du modèle de la période de test final.
Un fold walk-forward sépare entraînement et évaluation
À l’origine d’une prévision, le chercheur connaît certaines caractéristiques et certains résultats passés, ajuste ou met à jour un modèle, puis l’évalue sur un bloc ultérieur. En faisant avancer l’origine, on obtient des périodes hors échantillon successives. La règle de fenêtre d’entraînement définit les lignes passées admissibles utilisées à chaque ajustement. Les règles de validation et de test définissent les résultats ultérieurs qui servent à comparer les choix et à mesurer la performance. Ces décisions sont liées, mais ne désignent pas la même fenêtre.
La règle extensible part d’une borne historique fixe et s’agrandit lorsque de nouveaux résultats sont disponibles. La règle glissante déplace les deux bornes tout en gardant un nombre fixe d’observations après la période de démarrage. Dans les deux cas, la cible doit être connue en entier à l’origine de la prévision. Si les étiquettes couvrent plusieurs séances, la date de la ligne ne suffit pas toujours à savoir quand le résultat était connu : enregistrez la fin de l’étiquette et respectez-la.
Distinguez aussi le recul des caractéristiques de la fenêtre d’entraînement. Un signal peut calculer la volatilité de chaque ligne sur une période récente, tandis que le modèle exploite des lignes couvrant plusieurs années. Modifier le recul d’une caractéristique change les prédicteurs ; modifier la fenêtre change les observations servant à estimer le modèle.
Une fenêtre extensible conserve l’historique initial
Soit \(s\) l’indice de la première observation admissible et \(t\) celui de la dernière observation dont l’étiquette est achevée à l’ajustement. L’ensemble d’entraînement est \(\{s,s+1,\ldots,t\}\). À l’origine suivante, il conserve ces lignes et ajoute les nouvelles observations admissibles. Sa taille augmente donc au fil du temps, sauf filtrage distinct.
Des observations supplémentaires peuvent réduire le bruit d’échantillonnage des paramètres si les données anciennes décrivent encore le processus étudié. Elles peuvent préserver des épisodes de marché rares et évitent de choisir une coupure historique arbitraire. En revanche, l’âge ne réduit pas à lui seul l’influence des anciennes lignes. Si le lien entre prédicteurs et rendements change, les données initiales peuvent tirer l’estimation vers des conditions dépassées ; des ajustements plus volumineux peuvent aussi ralentir. Garder l’historique ne le rend pas automatiquement plus représentatif.
Une fenêtre glissante écarte les observations hors de la durée choisie
Pour une longueur fixe \(W\), l’ensemble au point \(t\) est \(\{t-W+1,\ldots,t\}\), après prise en compte du délai d’étiquette et d’un éventuel intervalle de frontière. À l’origine suivante, la borne finale avance et la plus ancienne ligne admissible sort. La longueur peut être exprimée en observations ou en temps calendaire ; avec des données irrégulières, ces unités ne sont pas interchangeables.
La fenêtre glissante impose une règle de récence. Elle peut convenir à une question portant sur l’adaptation à des conditions changeantes ou à une contrainte opérationnelle de taille fixe. Elle ne rend pas le modèle adaptatif automatiquement : des réajustements espacés ou une évolution lente peuvent retarder la réponse. Une durée courte apporte moins d’information et peut rendre les estimations instables, omettre des épisodes de stress rares ou fournir trop peu d’exemples à un modèle complexe. Une durée longue garde plus d’historique mais peut diluer les tendances récentes.
L’unité compte également : un même nombre de lignes peut représenter des durées calendaires différentes selon les jours manquants ou la fréquence. Pour des données de panel, précisez si la fenêtre retire des lignes ou des groupes d’actifs par date. Choisir \(W\) après avoir vu le test final transforme ce test en période de sélection, et non plus en test indépendant.
Les deux règles fournissent un historique différent à chaque ajustement
| Choix | Lignes d’entraînement à l’ajustement | Avantage possible | Coût à examiner |
|---|---|---|---|
| Extensible | Toutes les lignes admissibles depuis un début fixe | Plus d’observations et d’anciens épisodes conservés | Les anciens régimes influencent toujours le fit ; ajustements plus lents |
| Glissante | La dernière durée fixe de lignes admissibles | Limite de récence explicite et échantillon borné | Moins d’information et sensibilité accrue à la durée |
Pour isoler la règle de fenêtre, maintenez constants la coupure d’information, les caractéristiques, la famille de modèles, l’objectif d’entraînement, les dates d’ajustement, l’horizon, les blocs de test et les hypothèses d’exécution. Si le modèle glissant est aussi réajusté plus souvent ou utilise d’autres choix, l’écart de score ne s’attribue pas à la fenêtre seule.
Ces règles ne déterminent pas l’origine de prévision. On peut évaluer les deux fenêtres avec des origines glissantes : entraîner sur le passé admissible, prévoir le bloc suivant, avancer et recommencer. La synthèse de Leonard Tashman sur les tests de prévision hors échantillon00065-0) aborde les origines glissantes et les fenêtres d’estimation glissantes. L’une définit quand l’évaluation se déroule, l’autre quelles lignes d’entraînement restent.
Un calendrier hypothétique montre ce qu’utilise chaque ajustement
Les dates et nombres ci-dessous sont hypothétiques. Supposons un ajustement mensuel visant le rendement du mois suivant, dont le premier ajustement utilise 60 observations admissibles se terminant au mois 120. Une étiquette n’est utilisable qu’une fois son résultat achevé. À la première origine, les deux règles utilisent les mêmes 60 lignes si la fenêtre glissante mesure 60 observations.
Après la disponibilité d’un nouveau résultat mensuel, l’ensemble extensible compte 61 lignes admissibles ; le glissant ajoute la nouvelle ligne et retire la plus ancienne, pour rester à 60. Après 12 mises à jour, l’extensible compte 72 lignes depuis le début initial, tandis que le glissant garde les 60 dernières. Les estimations peuvent alors différer, même si chaque ligne était disponible à son ajustement.
Dans cet exemple, gardez les 24 derniers mois comme test externe. Choisissez la règle, sa longueur, les caractéristiques et les autres réglages sur des blocs chronologiques antérieurs. Évaluez ensuite la sélection figée selon le calendrier de réajustement annoncé. Modifier la durée après avoir vu le test externe utilise ses résultats pour sélectionner et exagère la portée du test final.
Choisissez la règle au sein d’une validation chronologique
Formulez d’abord la question : le modèle doit-il utiliser tout l’historique disponible à chaque ajustement, ou existe-t-il une raison d’écarter les exemples anciens ? La relation cible est-elle supposée stable, ou ses entrées pertinentes peuvent-elles changer ? Ces questions orientent les options sans prouver à l’avance laquelle réussira sur un marché donné.
Avec des données de développement antérieures, comparez un petit ensemble défini à l’avance, par exemple une fenêtre extensible et quelques durées glissantes plausibles, sur les mêmes blocs de validation chronologique et avec la même fréquence d’ajustement. Fixez l’objectif avant de noter les options : erreur de prévision, calibration, utilité de portefeuille tenant compte de la rotation et baisse maximale répondent à des questions différentes. Gardez coûts et contraintes constants, et consignez les échecs d’ajustement et prévisions manquantes. Des objectifs ou blocs qui se chevauchent peuvent rendre les scores voisins dépendants ; ne comptez pas chaque ligne comme une expérience indépendante.
Gardez une période chronologique ultérieure pour le test final. Dans un plan imbriqué, la validation interne choisit la fenêtre et les autres paramètres avec les seules données antérieures à chaque bloc de test externe ; les résultats externes évaluent toute la procédure de sélection. Le guide de validation croisée purgée traite les frontières où les étiquettes se chevauchent ; le surapprentissage des modèles financiers et les tests multiples couvrent d’autres risques de sélection.
Respectez l’information disponible pour les étiquettes, le prétraitement et l’ajustement
À chaque origine, utilisez uniquement les caractéristiques et étiquettes connues à cette date. Un rendement à plusieurs séances peut être inachevé près de la frontière de validation, même si la date de décision est antérieure. Laissez une lacune ou purgez les lignes selon les intervalles réels des étiquettes si nécessaire ; un nombre fixe de lignes ne convient que si l’espacement et l’horizon le justifient. Aucune règle de fenêtre ne corrige une caractéristique contenant de l’information future.
Ajustez imputation, mise à l’échelle, sélection des caractéristiques et autres prétraitements appris uniquement sur la partie entraînement de chaque fold. Pour choisir un seuil ou un hyperparamètre, utilisez une validation chronologique interne au train, puis figez ce choix pour noter le bloc ultérieur. La documentation officielle de scikit-learn sur TimeSeriesSplit décrit un entraînement extensible par défaut et max_train_size pour en limiter la taille. gap compte les échantillons ; comparer des durées de fold suppose des observations régulièrement espacées. Vérifiez aussi les étiquettes horodatées et la version réellement utilisée.
Présentez la performance par origine et les limites de l’évaluation
Indiquez la règle et la durée exacte, la date la plus ancienne conservée, le nombre de lignes admissibles à chaque ajustement, la disponibilité des étiquettes, les dates de validation et de test, l’horizon et le calendrier d’ajustement. Présentez les résultats par bloc et en agrégé. Une moyenne peut masquer un épisode dominant, et les prévisions voisines peuvent partager les mêmes rendements.
La précision prédictive n’est pas la performance nette d’une stratégie. Construction de position, levier, rotation, liquidité, frais, spread, impact de marché, emprunt, financement et moment d’exécution comptent. Gardez ces hypothèses constantes et indiquez les éléments omis. L’étude de Cerqueira, Torgo et Mozetič sur l’estimation de performance des séries temporelles signale des différences entre contextes stationnaires et non stationnaires. Elle ne compare pas directement les politiques de fenêtres financières et ne montre pas qu’une règle gagne toujours.
Interprétez chaque backtest comme un élément de preuve sur une histoire et un processus donnés. L’extensible peut garder un régime dépassé ; la glissante peut jeter des informations utiles et devenir bruitée. Une règle peut échouer dans un autre régime, univers d’instruments ou environnement de coûts. La validation réduit l’incertitude sur le processus testé, mais ne promet pas de rendement futur et ne prouve pas l’optimalité d’une fenêtre.
Questions fréquentes
Q1Une fenêtre extensible est-elle toujours meilleure parce qu’elle utilise plus de données ?
Non. Des lignes supplémentaires peuvent stabiliser les estimations si les anciennes restent pertinentes, mais des régimes dépassés peuvent continuer à peser. Cela dépend des données, de la cible, des caractéristiques, de l’estimateur et de la période.
Q2Une fenêtre glissante s’adapte-t-elle automatiquement à un changement de régime ?
Non. Elle retire les lignes qui sortent de la durée choisie, mais ne détecte pas le changement et ne garantit pas que le nouvel échantillon représente le régime suivant. La fréquence d’ajustement, la durée et le modèle comptent toujours.
Q3Puis-je régler la fenêtre et annoncer la performance finale sur la même période ?
Cette période ferait alors partie de la sélection du modèle. Choisissez la règle par validation chronologique, puis évaluez la procédure figée sur un test ultérieur préservé. Ce résultat décrit uniquement l’histoire et les hypothèses testées.
Sources et lectures complémentaires
Signaler un problème
Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi
Vérification rapide
Guide terminé ? Vérifiez vos acquis avec 3 questions
Question 01
Que change le prochain ajustement d’une fenêtre d’entraînement glissante de longueur fixe ?
Choisissez une réponse pour voir l'explication
Glossaire des options
The relationship between systematic prediction error from model mismatch and instability caused by sensitivity to the training sample.
Lire le guide approfondiFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Lire le guide approfondiassignation d’optionProcessus qui attribue au vendeur l’obligation d’exécuter le contrat après un avis d’exercice et peut créer une livraison ou un achat d’actions.
Lire le guide approfondi