Skip to content
Tous les guides sur les options et contrats à terme
Évaluation des prévisions14 min de lecture

Régression de Mincer–Zarnowitz : tester le biais et le calibrage d’une prévision

Comprenez comment la régression de Mincer–Zarnowitz teste l’ordonnée à l’origine et l’échelle d’une prévision, pourquoi une erreur moyenne nulle ne signifie pas qu’elle est calibrée et ce que le test ne prouve pas

Dans ce guideUne erreur moyenne nulle peut masquer un défaut de calibrage

Bref résumé

La régression de Mincer–Zarnowitz (MZ) vérifie, au moyen d’un diagnostic linéaire de calibrage, si les valeurs réalisées correspondent au niveau et à l’échelle des prévisions. L’hypothèse nulle habituelle impose une ordonnée à l’origine nulle et une pente de un pour la prévision. Cette restriction conjointe apporte davantage qu’une simple vérification de l’erreur moyenne, mais ne prouve pas que le prévisionniste ait bien utilisé toute l’information disponible.

Une erreur moyenne nulle peut masquer un défaut de calibrage

Supposons qu’un modèle prévoie le rendement de la prochaine période ou qu’une économiste estime la croissance du trimestre suivant. Dans l’échantillon d’évaluation, la moyenne des erreurs peut être nulle. Cela va à l’encontre d’une surestimation ou sous-estimation moyenne persistante, mais ne montre pas que les prévisions évoluent au même rythme que les résultats ultérieurs. Elles peuvent être trop extrêmes, trop comprimées ou décalées linéairement, tandis que les erreurs positives et négatives se compensent.

La régression MZ rend cette seconde question visible en régressant le résultat réalisé sur la prévision. Mincer et Zarnowitz ont introduit ce cadre en évaluant des prévisions économiques (chapitre de 1969). C’est un diagnostic pour les prévisions ponctuelles d’une cible numérique, notamment lorsqu’on vise une moyenne conditionnelle sous perte quadratique. Ce n’est pas une comparaison du modèle qui obtient la plus faible perte moyenne ; pour cette question, consultez le guide Diebold–Mariano.

Cette distinction compte aussi en recherche sur le trading. Une prévision de rendement peut avoir un faible biais moyen tout en étant mal mise à l’échelle ; une prévision de volatilité peut être trop élevée dans une plage et trop basse dans une autre. La régression peut signaler une inadéquation linéaire, mais le résultat dépend de l’échantillon, de la définition de la cible, du calendrier de disponibilité de l’information et de la méthode d’inférence. Elle ne prouve pas qu’une règle de trading tirée de la prévision sera rentable.

Aligner l’origine de prévision, la cible et la version des données

Pour chaque origine de prévision t, associez une prévision (fₜ) à la cible réalisée plus tard (yₜ) qu’elle devait prévoir. Chaque paire correspond à un horizon fixe : (fₜ) a été émise à une origine antérieure pour la cible ultérieure (yₜ) ; l’indice t sert ensuite de notation compacte pour ces paires. Les deux doivent concerner la même variable, le même horizon, les mêmes unités et la même convention temporelle. Associer une prévision de rendement à cinq jours à un rendement observé sur un jour ne teste plus le calibrage de la cible prévue.

N’utilisez que les prévisions réellement disponibles à chaque origine et conservez leur valeur, la version du modèle, la version des données et l’heure de clôture de l’information. Les premières publications macroéconomiques peuvent être révisées. Décidez si le calibrage sera évalué contre la première publication ou une valeur finale ultérieure, et gardez ce choix. Remplacer les données historiques par des valeurs révisées peut donner à l’évaluation une information indisponible au prévisionniste d’origine.

Pour les séries de trading, alignez de façon cohérente les composantes clôture à clôture, intrajournalières et overnight. Des cibles pluri-périodes qui se chevauchent rendent aussi dépendantes les erreurs adjacentes. Un échantillon commun est important : si un modèle manque surtout les dates volatiles, une différence de composition peut ressembler à un défaut de calibrage. Employez les mêmes cibles et le même calendrier d’origines pour les prévisions évaluées.

Distinguez les prévisions effectivement produites des valeurs ajustées. Si le modèle est estimé sur les observations qui entrent aussi dans la régression MZ, l’ajustement en échantillon peut donner une apparence de calibrage. Pour une affirmation sur la prévision future, construisez une séquence chronologique hors échantillon, réestimez avec les seules informations disponibles à chaque origine et gardez une période de confirmation à l’écart de toute sélection de modèle ou de seuil.

Estimer la régression de Mincer–Zarnowitz et énoncer l’hypothèse nulle

La régression en niveaux standard est

yₜ = α + β fₜ + uₜ

où (yₜ) est la cible réalisée, (fₜ) la prévision et (uₜ) le résidu de régression. La restriction conjointe de calibrage usuelle est

H₀: α = 0 et β = 1

Si les deux contraintes tiennent, la relation linéaire ajustée entre résultat et prévision est la droite d’identité. Aucun décalage constant n’est nécessaire et une hausse d’une unité de la prévision correspond à une hausse d’une unité du résultat ajusté. Estimez la régression, puis testez conjointement les deux contraintes avec un test de Wald ou F équivalent et une covariance adaptée au plan d’échantillonnage. Tester séparément l’ordonnée et la pente ne revient pas à tester leur restriction commune.

Le résidu (uₜ) n’est pas automatiquement l’erreur brute de prévision (yₜ − fₜ). Ils sont égaux sous l’hypothèse nulle conjointe ; sinon, l’ordonnée et la pente estimées absorbent un décalage et un changement d’échelle linéaires. Présentez aussi l’erreur de prévision brute pour montrer l’erreur moyenne et le lien de calibrage.

La restriction MZ est parfois appelée test d’absence de biais ou de rationalité. Précisez la définition. Une erreur inconditionnelle moyenne nulle signifie (E[yₜ − fₜ] = 0) ; imposer (α = 0, β = 1) exige une relation linéaire particulière et est généralement plus contraignant. Holden et Peel montrent que la restriction conjointe usuelle est suffisante mais pas nécessaire pour l’absence de biais dans leur formulation (1990). Ne confondez pas « sans biais » et « calibré MZ » sans nommer la restriction testée.

<!-- learn:illustration -->

Des sphères de verre bleu ardoise et ambre s’alignent le long d’un plan diagonal transparent, avec de légers écarts qui évoquent le calibrage des prévisions
Vue conceptuelle de prévisions comparées aux valeurs réalisées par rapport à une droite de calibrage ; ni données de marché, ni résultat de test, ni signal de trading.

Un petit exemple sépare le biais moyen de la restriction conjointe

Considérons trois prévisions hypothétiques et leurs résultats ultérieurs :

Prévision (fₜ)Valeur réalisée (yₜ)Erreur (yₜ − fₜ)
11.50.5
22.00.0
32.5−0.5

La moyenne des prévisions et celle des résultats valent 2, et l’erreur moyenne est nulle. Pourtant, les valeurs suivent (yₜ = 1 + 0.5 fₜ) : la régression MZ a une ordonnée (α = 1) et une pente (β = 0.5), et non (0, 1). Les erreurs se compensent en moyenne alors que la restriction linéaire échoue ; dans cet exemple construit, le résultat évolue deux fois moins que la prévision.

Il s’agit d’une illustration arithmétique fabriquée, pas de données de marché ni d’un échantillon d’inférence. Trois points sans bruit ne permettent ni une valeur p pertinente ni de conclure à l’échec d’un vrai système. Dans un échantillon réel, le test conjoint tient compte de l’incertitude d’estimation : un écart important peut être imprécis, et un petit écart peut être estimé précisément avec assez de données. L’exemple montre uniquement que l’erreur moyenne et la restriction MZ répondent à des questions différentes.

Un recalibrage tel que (1 + 0.5 fₜ) reproduirait exactement ces trois résultats, puisqu’il a été construit à partir d’eux. Cela ne prouve rien pour la suite. Si le recalibrage fait partie de la méthode, estimez-le sur un segment d’entraînement antérieur puis évaluez les prévisions ajustées sur des données ultérieures qui n’ont pas servi à fixer les coefficients.

Lire ensemble l’ordonnée, la pente et le R carré

L’ordonnée (α) est le résultat ajusté pour une prévision nulle ; son sens pratique dépend de la proximité de zéro avec la plage des prévisions. La pente (β) décrit la variation du résultat ajusté selon la prévision. À ordonnée constante, une pente inférieure à un signifie que la prévision varie davantage que le résultat ajusté par unité ; une pente supérieure à un signifie l’inverse. Aucun des deux coefficients ne décrit seul la relation lorsque l’autre est aussi libre.

Un (R²) élevé ne prouve pas le calibrage. La relation sans bruit (yₜ = 2 + 1.1 fₜ), par exemple, donne (R² = 1), mais ne respecte pas l’hypothèse nulle MZ. Le (R²) résume la part de variation expliquée par l’ajustement linéaire ; le test conjoint demande si cette droite est la droite d’identité. À l’inverse, une prévision bruitée peut avoir un faible (R²) même si la restriction n’est pas rejetée. Calibrage et précision sont liés, mais distincts.

Ne déduisez pas le résultat des deux statistiques t individuelles. L’ordonnée et la pente peuvent être corrélées, et le test de Wald/F conjoint utilise leur covariance. Indiquez α, β et leur incertitude, la statistique et la valeur p conjointes, la taille de l’échantillon et l’erreur brute moyenne. Un nuage de points ou des moyennes par groupes avec la droite d’identité peut aider ; signalez si les groupes ont été choisis après examen des données. Un test linéaire peut manquer une relation courbe, un changement de régime ou des erreurs propres aux queues.

Le calibrage est plus faible que l’efficience complète d’une prévision

Sous perte quadratique, la prévision ponctuelle optimale est l’espérance conditionnelle de la cible compte tenu de l’ensemble d’information du prévisionniste. Les informations connues à l’origine ne devraient alors pas prédire les erreurs ultérieures. La régression MZ ne vérifie qu’une relation linéaire avec la prévision et une constante ; elle ne teste pas toutes les autres variables de cet ensemble.

Un diagnostic plus exigeant peut ajouter des variables d’information (zₜ) présélectionnées à une régression des erreurs, par exemple :

yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ

Si une variable connue à l’origine prévoit les erreurs ultérieures, une information utile a peut-être été ignorée. Il faut bien respecter son calendrier et la choisir avec soin : tester de nombreux retards, états de marché et transformations crée un autre problème de recherches multiples. Ne pas trouver de prévisibilité dans une courte liste ne prouve pas l’efficience par rapport à l’ensemble complet.

Zarnowitz traite du biais, de la corrélation sérielle, de la taille des échantillons et de la puissance des tests sur les prévisions d’enquête (document de travail NBER 1070, 1983). Présentez donc MZ comme un diagnostic de calibrage linéaire ou un contrôle faible de l’efficience, jamais comme une preuve d’utilisation optimale de toute l’information. Le guide Giacomini–White examine une comparaison conditionnelle différente, fondée sur des moments de perte sélectionnés.

Tenir compte de l’estimation, du chevauchement et de l’incertitude

Les erreurs peuvent être hétéroscédastiques, autocorrélées ou se chevaucher, surtout avec des prévisions glissantes à plusieurs horizons. Les formules OLS courantes ne garantissent pas à elles seules des erreurs-types valides pour la restriction conjointe. Choisissez et décrivez une inférence justifiée par l’horizon, la dépendance et la méthode d’estimation ; ne supposez pas l’indépendance. Il n’existe pas de bande passante ou correction universelle.

Si les paramètres, un recalibrage et son test sont construits dans le même petit échantillon, l’incertitude de régression ordinaire peut ne pas refléter toute la procédure. Les prévisions emboîtées peuvent aussi conduire à des lois nulles non standard pour comparer la précision. Utilisez une méthode adaptée à la construction réelle de la prévision ou évaluez une étape de calibrage entièrement spécifiée sur un jeu de réserve ultérieur. Ne testez pas de nombreuses équations, cibles et périodes pour ensuite présenter la dernière valeur p comme confirmatoire.

Ne pas rejeter ne prouve pas le calibrage : la puissance peut être faible ou l’intervalle large. Rejeter dépend aussi de la cible, de l’échantillon, de la forme linéaire et de la covariance estimée. Examinez des choix d’évaluation raisonnables et déclarez ces vérifications à part du test défini à l’avance. C’est essentiel avec des prévisions persistantes ou peu d’épisodes indépendants.

Choisir un test adapté à la question posée

MZ teste une restriction linéaire de calibrage entre prévision et résultat. Le test Diebold–Mariano demande plutôt si deux procédures ont la même perte moyenne selon un score choisi. Une prévision peut être calibrée tout en obtenant une perte supérieure, ou être plus précise en moyenne et échouer au test MZ.

Si la question porte sur l’évolution de la précision avec l’information connue à l’origine, le test Giacomini–White évalue des moments conditionnels de perte choisis. Après avoir exploré beaucoup de prévisions ou de stratégies, le Model Confidence Set ou White Reality Check/Hansen SPA traite un autre problème de sélection. Aucun ne remplace une cible claire et des origines de prévision honnêtes.

La régression MZ standard en niveaux vise les prévisions ponctuelles d’une cible numérique. Les prévisions de quantiles, probabilités, intervalles ou densités exigent des tests et scores conçus pour ces objets. Un bon résultat pour la moyenne ne se transpose pas automatiquement au risque extrême ou à une distribution de volatilité.

Décrire le plan de calibrage pour qu’il soit reproductible

Précisez la cible, l’horizon, les unités, l’heure limite d’information, les dates d’évaluation, la version des données et le caractère réellement hors échantillon des prévisions. Donnez l’équation, la définition de l’erreur et les restrictions testées. Clarifiez si « sans biais » signifie une erreur moyenne nulle ou la restriction conjointe MZ (α = 0, β = 1).

Indiquez les coefficients, erreurs-types ou intervalles, statistique conjointe de Wald/F, degrés de liberté, valeur p, nombre d’origines, erreur moyenne et (R²) avec une interprétation prudente. Décrivez la covariance ou le rééchantillonnage, en particulier si les horizons se chevauchent ou si les erreurs sont autocorrélées. Déclarez l’estimation, le recalibrage, la sélection et les autres cibles, échantillons ou transformations essayés.

Un compte rendu transparent sépare le biais moyen, le calibrage linéaire, l’efficience informationnelle et la précision comparative. Ce sont des affirmations empiriques distinctes. Satisfaire une restriction de régression ne valide pas tous les usages d’une prévision, et son évaluation ne prouve pas la rentabilité d’une stratégie après coûts.

Questions fréquentes

Q1Le test de Mincer–Zarnowitz teste-t-il uniquement l’erreur moyenne de prévision ?

Non. L’erreur moyenne compare les moyennes de la prévision et du résultat. Le test MZ usuel impose ensemble une ordonnée nulle et une pente unitaire. Holden et Peel montrent que cette restriction est suffisante mais pas nécessaire pour l’absence de biais selon leur formulation.

Q2Réussir le test MZ prouve-t-il l’efficience d’une prévision ?

Non. Il teste une relation linéaire avec la prévision, pas l’impossibilité de prédire ses erreurs à partir de toutes les informations disponibles à l’origine. L’efficience impose une condition plus forte sur l’ensemble d’information.

Q3Puis-je utiliser la même régression pour une prévision de VaR ou de quantile ?

Pas sans adapter la définition du calibrage et l’inférence. La régression standard en niveaux concerne les prévisions ponctuelles numériques ; les quantiles et les prévisions de queue nécessitent des tests et scores appropriés.

Q4Le calibrage prouve-t-il la rentabilité d’une stratégie de trading ?

Non. Il décrit le lien entre prévisions et résultats. Une affirmation de rentabilité exige une règle de décision définie à l’avance et une évaluation hors échantillon distincte intégrant exécution, frais, financement, impact de marché et risque. Recherche primaire - Mincer et Zarnowitz, « The Evaluation of Economic Forecasts » (1969) - Holden et Peel, « On Testing for Unbiasedness and Efficiency of Forecasts » (1990) - Zarnowitz, « Rational Expectations and Macroeconomic Forecasts » (document de travail NBER 1070, 1983) - Diebold et Mariano, « Comparing Predictive Accuracy » (1995) - Giacomini et White, « Tests of Conditional Predictive Ability » (2006)

Sources et lectures complémentaires

Signaler un problème

Nous préparons un e-mail avec le lien de cet article. Mark ne reçoit le signalement qu’après son envoi

Vérification rapide

Guide terminé ? Vérifiez vos acquis avec 3 questions

Question 1 / 3

Question 01

Quelle est l’hypothèse nulle conjointe habituelle de la régression MZ ?

Choisissez une réponse pour voir l'explication

Glossaire des options

Des définitions claires des termes essentiels, des calls, puts et chaînes d’options à la volatilité implicite, aux sensibilités et à l’écart acheteur-vendeur

Parcourir le glossaire des options
Comparer la précision des prévisionsTest de Diebold–Mariano : comparer deux prévisionsDécouvrez comment le test de Diebold–Mariano compare des pertes appariées, traite les horizons qui se chevauchent et pourquoi une faible valeur p ne prouve pas une aptitude à trader.Évaluation des prévisionsTest de Giacomini–White : précision conditionnelle des prévisionsDécouvrez comment le test de Giacomini–White évalue les variations de précision selon des conditions connues, comment choisir les instruments et ce que le résultat permet de conclureComparaison de modèles de prévisionModel Confidence Set (MCS) : comparer des prévisions sans imposer un gagnantDécouvrez comment le Model Confidence Set combine des tests séquentiels et un bootstrap tenant compte de la dépendance temporelle pour conserver des modèles que les données ne permettent pas de départager.Deux tests bootstrap pour une famille de règles évaluées simultanémentWhite Reality Check et Hansen SPA pour les règles de tradingDécouvrez comment Reality Check et Hansen SPA évaluent toute une famille de règles techniques face à un benchmark, comment leurs bootstraps diffèrent et ce que signifie une p-valeur globale.Évaluation des prévisions directionnellesTest de Pesaran–Timmermann : une prévision directionnelle apporte-t-elle de l’information ?Découvrez comment le test de Pesaran–Timmermann compare les bonnes prévisions de direction à une référence calculée à partir des parts de hausses réelles et prévues, et pourquoi la dépendance sérielle modifie l’inférence.