Skip to content
Tous les guides sur les options et contrats à terme
Comparaison de modèles de prévision14 min de lecture

Model Confidence Set (MCS) : comparer des prévisions sans imposer un gagnant

Découvrez comment le Model Confidence Set combine des tests séquentiels et un bootstrap tenant compte de la dépendance temporelle pour conserver des modèles que les données ne permettent pas de départager.

Dans ce guideÀ quelle question répond le Model Confidence Set ?

Bref résumé

Le Model Confidence Set (MCS) compare une famille définie de procédures de prévision et conserve les candidats dont l’infériorité ne peut pas être démontrée au regard d’une fonction de perte choisie. Si l’échantillon ne permet pas de les départager, plusieurs modèles peuvent subsister. Le résultat dépend de la famille, du dispositif de prévision, de la perte et de la méthode d’inférence.

À quelle question répond le Model Confidence Set ?

Supposons que plusieurs procédures prévoient la volatilité du lendemain. Leurs erreurs diffèrent, mais l’échantillon est peut-être trop court ou trop bruité pour savoir laquelle a la perte attendue la plus faible. Choisir simplement la procédure dont la perte moyenne est la plus basse impose un gagnant, même si l’écart peut venir de fluctuations d’échantillonnage. Le MCS apporte une réponse sous forme d’ensemble : quels candidats les données disponibles ne permettent-elles pas de qualifier d’inférieurs selon un critère de performance défini ?

Le MCS part d’un ensemble de candidats \(\mathcal M_0\), d’une fonction de perte ou d’un autre critère, et d’un niveau de confiance. Il teste successivement si les candidats encore en lice ont la même capacité prédictive. Si l’hypothèse est rejetée, une règle d’élimination retire un candidat jugé relativement faible, puis le test est répété sur l’ensemble réduit. Les candidats restants forment le MCS. Hansen, Lunde et Nason présentent cette procédure comme un ensemble de confiance contenant le ou les meilleurs modèles de la collection spécifiée, à la manière d’un intervalle de confiance qui peut conserver plusieurs valeurs lorsque les données sont imprécises (article de 2011).

« Meilleur » n’a de sens que dans cette comparaison. Cela dépend des candidats inclus, de la cible, de l’horizon de prévision, des informations disponibles à chaque origine et du critère choisi. Le MCS ne suppose pas qu’un candidat soit le véritable processus générateur des données, et plusieurs candidats peuvent avoir la même perte attendue minimale. Il n’attribue pas une probabilité bayésienne à la justesse d’un modèle conservé.

Fixer la famille de candidats et la question de prévision

Définissez \(\mathcal M_0\) avant de calculer les pertes. Un candidat peut être un modèle estimé associé à ses règles d’estimation et de mise à jour des prévisions, ou une procédure de prévision qui ne relève pas d’un modèle statistique. Le nom « GARCH » ne suffit pas si la distribution des erreurs, la taille de la fenêtre glissante, la mise à jour des paramètres ou l’horizon diffèrent : chaque combinaison définit une procédure distincte.

Tous les candidats doivent prévoir la même cible aux mêmes origines et avec les informations qui auraient été disponibles à cette date. La perte d’une prévision de variance conditionnelle à un jour et celle d’une prévision de volatilité à cinq jours ne se comparent pas forcément directement si la cible ou l’unité diffère. Utilisez un échantillon d’évaluation commun, expliquez l’alignement des observations manquantes, et consignez la version des données, la fenêtre initiale d’estimation, le calendrier récursif ou glissant et le traitement des données révisées. Des prévisions à horizons chevauchants peuvent partager des périodes réalisées même si elles proviennent d’origines différentes.

Choisissez le critère avant de consulter les résultats. L’erreur quadratique, l’erreur absolue ou une perte propre à une décision peuvent classer différemment les prévisions ponctuelles. Une prévision de variance peut nécessiter une perte adaptée à une proxy de volatilité bruitée, tandis qu’une prévision de quantile demande un score quantile. Un MCS favorable sous une perte ne l’est pas nécessairement sous une autre. Si vous réduisez la liste après avoir examiné les résultats de la même période d’évaluation, l’ensemble obtenu est conditionnel à ce filtrage non déclaré et ne reflète plus toute la recherche.

Transformer les prévisions communes en écarts de perte appariés

Soit \(y_{t+h}\) la valeur réalisée de la cible pour une prévision émise à l’origine \(t\), et \(\hat y_{i,t+h|t}\) la prévision du candidat \(i\). Avec une fonction de perte \(L\) choisie à l’avance, calculez la perte de chaque candidat à chaque origine commune :

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

Supposons qu’une perte plus faible soit préférable. L’écart apparié entre les candidats \(i\) et \(j\) est :

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

où \(P\) est le nombre d’origines communes. Avec cette convention de signe, \(\bar d_{ij}>0\) signifie que la perte moyenne de \(i\) a dépassé celle de \(j\) dans l’échantillon ; \(\bar d_{ij}<0\) favorise \(i\). L’appariement compte parce que les deux candidats ont été évalués sur les mêmes résultats réalisés. Un choc de marché commun peut accroître leurs pertes à tous deux, tandis que l’écart isole leur performance relative aux mêmes dates.

L’hypothèse nulle d’égalité de capacité prédictive pour l’ensemble actuel \(\mathcal M\) s’écrit :

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{for every } i,j\in\mathcal M \]

Il s’agit d’une hypothèse conjointe portant sur l’ensemble actuel, et non d’une série de tests deux à deux indépendants dont on retiendrait les résultats souhaités. Le cadre MCS associe un test d’équivalence de l’ensemble à une règle d’élimination pour gérer les comparaisons multiples. L’hypothèse n’affirme pas que les prévisions sont identiques à chaque date.

Tester l’ensemble actuel et définir la règle d’élimination

Le MCS alterne entre un test portant sur l’ensemble et une étape d’élimination. Commencez par \(\mathcal M=\mathcal M_0\) et testez l’égalité de capacité prédictive au seuil \(\alpha\) choisi. Si l’hypothèse n’est pas rejetée, la procédure s’arrête et l’ensemble actuel est rapporté. Si elle est rejetée, une règle d’élimination fixée à l’avance retire un candidat, puis le test est répété sur l’ensemble réduit. Sous les hypothèses de la procédure, les survivants forment le MCS au niveau \((1-\alpha)\).

L’article présente deux statistiques connues. La statistique d’étendue recherche le plus grand écart de perte pairé standardisé :

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

La règle d’élimination correspondante retire le candidat ayant le plus fort désavantage standardisé par rapport à un autre. Une seconde statistique compare chaque candidat à la performance moyenne de l’ensemble actuel :

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

Ici, \(t_{i\cdot}\) standardise la moyenne de \(d_{i\cdot,t}\) par son erreur-type. La règle associée élimine le candidat présentant le plus fort excès de perte standardisé par rapport à la moyenne de l’ensemble. La statistique et la règle d’élimination forment un couple. Choisissez-les et rapportez-les ensemble ; ne les mélangez pas après avoir vu lequel donne un ensemble plus petit. L’article MCS explique pourquoi le test et la règle déterminant le candidat éliminé doivent être cohérents (Hansen, Lunde et Nason).

Préserver la dépendance temporelle dans le bootstrap

La loi de la statistique maximale dépend de la variabilité conjointe des écarts de perte entre candidats. Traiter chaque modèle ou chaque date comme une observation indépendante peut détruire deux formes de dépendance : les pertes de dates consécutives peuvent être liées et les pertes des candidats à une même date sont appariées. Le bootstrap du MCS doit donc préserver la structure temporelle conjointe lorsqu’il approche la loi nulle de la statistique de l’ensemble.

Une possibilité consiste à rééchantillonner ensemble des blocs temporels alignés du vecteur des pertes ou des écarts de tous les candidats. Dans le bootstrap stationnaire, les blocs ont des longueurs aléatoires et le bloc suivant peut commencer à une date tirée au hasard. Politis et Romano ont proposé cette méthode pour des observations stationnaires faiblement dépendantes (article de 1994). L’annexe d’implémentation du MCS décrit un bootstrap par blocs et cite le bootstrap stationnaire comme solution de rechange. Rééchantillonner séparément la série de pertes de chaque modèle détruit l’appariement aux mêmes dates et peut modifier la comparaison.

La longueur moyenne des blocs, la variante de bootstrap, le centrage sous l’hypothèse nulle d’égalité de capacité prédictive, le nombre de répétitions et l’horizon influencent l’estimation de l’incertitude. Des horizons chevauchants à plusieurs pas peuvent prolonger la dépendance des écarts, mais aucune longueur de bloc universelle ne convient à toutes les cibles et tous les échantillons. Décrivez le dispositif et vérifiez la stabilité de la conclusion sous des choix raisonnables. Le bootstrap fournit une approximation sous ses hypothèses ; il ne corrige ni l’usage d’informations futures, ni l’inspection répétée de l’échantillon de test, ni une évolution non stationnaire des scores, ni une famille de candidats incomplète.

Suivre une comparaison hypothétique de quatre modèles

Supposons que quatre procédures A, B, C et D prévoient la même cible de volatilité à 120 origines quotidiennes communes. Leurs pertes quadratiques moyennes sont respectivement 1,20, 1,23, 1,45 et 1,90, dans des unités illustratives de points de pourcentage au carré. Ces moyennes classent A en tête et D en dernier, mais le classement seul ne dit pas si les écarts dépassent l’incertitude d’échantillonnage.

La différence moyenne de perte appariée entre A et B est \(1.20-1.23=-0.03\). Si son erreur-type tenant compte de la dépendance est \(0.04\), la statistique de cette paire est \(-0.03/0.04=-0.75\). Ce seul contraste ne démontre pas de différence statistique nette entre A et B. Le MCS ne s’arrête pas là : sa statistique d’ensemble considère les contrastes conjoints entre les quatre candidats.

Pour illustrer la séquence, supposons qu’une exécution hypothétique du MCS par blocs sur la série complète de 120 origines utilise \(T_R\), \(\alpha=0.05\) et une règle cohérente éliminant le pire candidat. Imaginons que la valeur p de l’ensemble complet soit 0.018, entraînant l’élimination de D, puis que celle de \(\{A,B,C\}\) soit 0.11. Comme 0.11 dépasse 0.05, la procédure s’arrête et le MCS hypothétique à 95 % est \(\{A,B,C\}\). C reste même si sa perte moyenne dépasse celle de A : dans cet exemple fictif, le test conjoint n’a pas établi que C était inférieur.

Ces valeurs p sont inventées pour expliquer les étapes ; elles ne sont pas déductibles des quatre pertes moyennes ni du contraste A–B. Un résultat réel exige la série complète des pertes par origine, les prévisions des candidats, le dispositif de bootstrap et l’ordre d’élimination. Conservez ces éléments et indiquez quel candidat a été retiré à chaque étape. <!-- learn:illustration -->

Plusieurs trajectoires de prévision restent proches dans une bande diffuse, tandis que les trajectoires éloignées s’estompent ; un ensemble subsiste plutôt qu’un seul gagnant
Illustration conceptuelle d’une comparaison qui conserve plusieurs candidats statistiquement indiscernables ; ni prévisions observées, ni résultats empiriques, ni signal de trading.

Interpréter l’ensemble survivant sans exagération

Sous les conditions de régularité et les hypothèses de test, un MCS à 95 % est construit pour inclure le meilleur candidat de l’ensemble spécifié avec au moins la couverture asymptotique annoncée. Cela ne signifie pas que chaque modèle conservé a 95 % de chances d’être le meilleur. La confiance concerne la couverture lors d’échantillons répétés ; ce n’est pas une distribution bayésienne sur les noms des modèles.

Ne pas rejeter l’égalité de capacité prédictive ne prouve pas que les pertes attendues sont exactement égales. La puissance peut être faible si la période d’évaluation est courte, si les écarts de perte varient beaucoup ou si plusieurs candidats sont proches. Un grand ensemble survivant peut indiquer que les données ne permettent pas de départager les solutions. Il peut aussi inclure des modèles qui sont tous mauvais en valeur absolue, puisque le MCS compare les candidats entre eux sans exiger de référence externe.

L’ensemble est également limité aux éléments initialement inclus dans \(\mathcal M_0\). Si une procédure réellement meilleure a été omise, le MCS ne peut pas la découvrir. Si un modèle est écarté après examen de la même période d’évaluation, la couverture nominale ne tient pas compte de ce filtrage non déclaré. Expliquez comment la famille a été constituée et filtrée. Si plusieurs candidats partagent la perte attendue minimale, en retenir plusieurs est conforme à la méthode et non un échec de sélection.

Distinguer le MCS des tests par paires et des tests contre un benchmark

Le test de Diebold–Mariano porte sur un écart de perte apparié entre deux procédures confrontées aux mêmes résultats. Le MCS teste un ensemble de manière séquentielle et indique les candidats qui survivent à sa procédure conjointe d’élimination. Lancer plusieurs tests DM puis conserver les paires non significatives n’équivaut pas automatiquement au MCS ; le bootstrap conjoint et la cohérence de la règle d’élimination comptent.

Le test de Clark–West traite un cas plus précis de comparaison d’erreurs quadratiques lorsque l’un des modèles inclut un modèle de référence restreint et que l’estimation affecte l’écart brut. Le MCS n’exige pas que les candidats soient emboîtés et peut utiliser une perte définie par l’utilisateur, mais il lui faut toujours un dispositif de prévision commun.

Le Reality Check de White et le SPA de Hansen demandent si au moins un membre d’une famille explorée surpasse un benchmark désigné. Le MCS n’exige pas de benchmark et décrit un ensemble de candidats relativement supérieurs au lieu de tester un benchmark unique. Toutes ces méthodes doivent tenir compte de la recherche et de la dépendance, mais leurs hypothèses nulles diffèrent. Voir le guide du Reality Check et du SPA ainsi que les articles originaux de White (2000) et Hansen (2005).

Rapporter le dispositif et séparer classement prévisionnel et intérêt pour le trading

Un compte rendu reproductible du MCS nomme chaque procédure, la cible et l’horizon communs, les règles d’information, le calendrier d’estimation, les dates d’évaluation, le traitement des valeurs manquantes, la formule de perte et le sens considéré comme meilleur. Il indique aussi le seuil de signification, la statistique et la règle d’élimination, le type de bootstrap, la longueur des blocs, le centrage, le nombre de répétitions, les valeurs p de chaque étape et la composition finale. Donnez les pertes moyennes et les écarts en contexte, sans remplacer l’inférence conjointe par un simple classement.

Pour une évaluation de volatilité, précisez la construction de la proxy observée et si elle est bruitée ou révisée. Pour les prévisions à plusieurs pas, indiquez le chevauchement des périodes cibles et le traitement de la dépendance. Si la composition change fortement selon des choix plausibles de perte, de période ou de bootstrap, montrez cette sensibilité. Une très petite valeur p sans candidats éliminés ni séquence de procédure ne permet pas de reproduire l’ensemble.

Le MCS classe des procédures de prévision selon un critère. Il n’établit ni causalité, ni modèle générateur réel, ni rentabilité d’une opération fondée sur une prévision survivante. Passer de la prévision à une position exige des seuils, un dimensionnement, du turnover, un moment d’exécution, un spread, des frais, du slippage, du financement, de l’emprunt et des limites de risque. Évaluez séparément ce processus de décision figé sur des données ultérieures adaptées et rapportez à part les résultats nets de trading. Pour les scores de volatilité avec proxies bruitées, voir le guide QLIKE ou erreur quadratique.

Questions fréquentes

Q1Le MCS choisit-il un seul meilleur modèle ?

Pas nécessairement. Un seul candidat peut rester si les données permettent de le distinguer, ou plusieurs peuvent subsister si l’infériorité d’aucun n’est établie. Choisir un survivant pour le déploiement exige une règle de décision distincte.

Q2Un modèle dans le MCS a-t-il 95 % de chances d’être correct ?

Non. Le niveau de confiance décrit la couverture, lors d’échantillons répétés, du meilleur candidat de la famille spécifiée sous les hypothèses de la méthode. Ce n’est pas une probabilité a posteriori que le modèle soit vrai.

Q3Puis-je utiliser le MCS pour autre chose que des prévisions de volatilité ?

Oui. Il peut comparer des prévisions, des modèles économétriques ou d’autres procédures si un critère commun pertinent et un dispositif d’échantillonnage adapté sont définis. Le résultat dépend toujours de l’ensemble des candidats et de la perte choisis.

Q4Le MCS prend-il automatiquement en compte tous les modèles que j’ai essayés ?

Uniquement si la recherche réelle est représentée dans la famille des candidats et dans l’évaluation. Un filtrage non déclaré ou des consultations répétées des données d’évaluation ne sont pas corrigés par un MCS calculé après coup.

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Que rapporte le Model Confidence Set ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options
Comparez deux prévisions selon leurs pertes sur les mêmes résultatsTest de Diebold–Mariano : comparer la précision des prévisionsDécouvrez ce que compare le test de Diebold–Mariano, comment les écarts de perte et l'autocorrélation entrent dans la statistique, et pourquoi la précision d'une prévision ne garantit pas un profit de trading.Comparaison de prévisions emboîtéesTest de Clark–West pour les prévisions emboîtées : formule, exemple et limitesDécouvrez pourquoi les modèles de prévision emboîtés nécessitent une comparaison du MSPE ajustée, comment fonctionne la statistique de Clark–West et ce qu’un résultat unilatéral peut ou non établir.Deux tests bootstrap pour une famille de règles évaluées simultanémentWhite Reality Check et Hansen SPA pour les règles de tradingDécouvrez comment Reality Check et Hansen SPA évaluent toute une famille de règles techniques face à un benchmark, comment leurs bootstraps diffèrent et ce que signifie une p-valeur globale.Évaluation des prévisions de volatilitéQLIKE ou erreur quadratique pour prévoir la volatilité : proxies bruitésComparez les pertes QLIKE et d’erreur quadratique pour les prévisions de volatilité, suivez un exemple d’inversion du classement et voyez quand des proxies bruités de variance réalisée préservent le classement attenduÉvaluation des prévisions directionnellesTest de Pesaran–Timmermann : une prévision directionnelle apporte-t-elle de l’information ?Découvrez comment le test de Pesaran–Timmermann compare les bonnes prévisions de direction à une référence calculée à partir des parts de hausses réelles et prévues, et pourquoi la dépendance sérielle modifie l’inférence.