Skip to content
Alle optiegidsen
Prognose-evaluatie14 min leestijd

Mincer–Zarnowitz-regressie: toets prognosebias en kalibratie

Lees hoe de Mincer–Zarnowitz-regressie het intercept en de schaal van een prognose toetst, waarom nul gemiddelde fout niet hetzelfde is als kalibratie en wat de toets niet bewijst

In deze gidsEen gemiddelde fout van nul kan een kalibratieprobleem verbergen

Korte samenvatting

Een Mincer–Zarnowitz-regressie (MZ) onderzoekt met een lineaire kalibratiediagnose of gerealiseerde waarden aansluiten bij het niveau en de schaal van hun prognoses. De gebruikelijke nulhypothese stelt het intercept op nul en de prognosehelling op één. Deze gezamenlijke restrictie zegt meer dan alleen de gemiddelde fout, maar bewijst niet dat de voorspeller alle beschikbare informatie goed heeft benut.

Een gemiddelde fout van nul kan een kalibratieprobleem verbergen

Stel dat een model het rendement van de volgende periode voorspelt of een econoom de groei van het volgende kwartaal raamt. De gemiddelde prognosefout kan in de evaluatiesteekproef nul zijn. Dat pleit tegen een aanhoudende gemiddelde over- of onderschatting, maar laat niet zien dat prognosewaarden één-op-één met latere uitkomsten meebewegen. Prognoses kunnen te extreem, te weinig gespreid of lineair verschoven zijn terwijl positieve en negatieve fouten elkaar opheffen.

De MZ-regressie maakt deze tweede vraag zichtbaar door de gerealiseerde uitkomst op de prognose te regresseren. Mincer en Zarnowitz introduceerden dit kader bij de evaluatie van economische prognoses (hoofdstuk uit 1969). Het is een diagnose voor puntprognoses van een numeriek doel, vooral wanneer onder kwadratisch verlies een conditioneel gemiddelde wordt geraamd. Het vergelijkt niet welk van twee modellen een lager gemiddeld verlies heeft; daarvoor is de gids over Diebold–Mariano bedoeld.

Ook in handelsanalyses is dit onderscheid belangrijk. Een rendementsprognose kan weinig gemiddelde bias hebben maar verkeerd geschaald zijn; een volatiliteitsprognose kan in het ene bereik te hoog en in het andere te laag zijn. De regressie kan een lineaire afwijking signaleren, maar de uitkomst hangt af van evaluatiesteekproef, doeldefinitie, informatietiming en inferentiemethode. De toets bewijst niet dat je van de prognose een winstgevende handelsregel kunt maken.

Stem prognosemoment, doel en gegevensversie op elkaar af

Koppel voor ieder prognosemoment t een prognose (fₜ) aan het latere gerealiseerde doel (yₜ) dat ermee voorspeld moest worden. Elk paar heeft een vaste horizon: (fₜ) is op een eerder moment uitgegeven voor het latere doel (yₜ); verderop is index t een compacte notatie voor die paren. Beide moeten dezelfde variabele, horizon, eenheden en tijdconventie hebben. Een prognose voor vijfdaags rendement koppelen aan een gerealiseerd eendaags rendement toetst de kalibratie voor het beoogde doel niet.

Gebruik prognoses die op elk moment echt beschikbaar waren en bewaar de prognosewaarde, modelversie, gegevensvintage en informatieafsluiting. Eerste macro-economische publicaties kunnen later worden herzien. Bepaal of je kalibratie toetst aan de eerste publicatie of aan de later herziene eindwaarde en houd die keuze aan. Historische invoer vervangen door herziene gegevens kan de evaluatie informatie geven die de oorspronkelijke voorspeller niet had.

Stem in handelsreeksen slot-tot-slot-, intraday- en overnight-componenten consequent af. Overlappende doelen voor meerdere perioden maken aangrenzende prognosefouten bovendien afhankelijk. Een gemeenschappelijke evaluatiesteekproef is belangrijk: als een model juist op volatiele dagen ontbreekt, kan het verschil in datumcompositie op een kalibratieprobleem lijken. Gebruik voor alle beoordeelde prognosereeksen dezelfde doelen en hetzelfde schema van prognosemomenten.

Onderscheid gegenereerde prognoses van fitted values. Als het model wordt geschat op dezelfde observaties die in de MZ-regressie zitten, kan de in-sample fit op kalibratie lijken. Voor een bewering over toekomstige prognoses maak je een chronologische out-of-sample-reeks, schat je op ieder moment opnieuw met alleen toen beschikbare informatie en houd je een definitieve bevestigingsperiode buiten model- of drempelkeuze.

Schat de Mincer–Zarnowitz-regressie en vermeld de nulhypothese

De standaardregressie in niveaus is

yₜ = α + β fₜ + uₜ

Hierin is (yₜ) het gerealiseerde doel, (fₜ) de prognose en (uₜ) het regressieresidu. De gebruikelijke gezamenlijke kalibratierestrictie is

H₀: α = 0 en β = 1

Als beide restricties gelden, is de fitted lineaire relatie tussen uitkomst en prognose de identiteitslijn. Een constante verschuiving is niet nodig en een stijging van één eenheid in de prognose hoort bij een stijging van één eenheid in de fitted uitkomst. Schat de regressie en toets beide restricties gezamenlijk met een Wald- of equivalente F-toets en een covariantiemethode die bij het steekproefontwerp past. Het intercept en de helling afzonderlijk toetsen is niet hetzelfde als hun gezamenlijke restrictie toetsen.

Het residu (uₜ) is niet automatisch de ruwe prognosefout (yₜ − fₜ). Onder de gezamenlijke nulhypothese zijn ze gelijk; daarbuiten nemen het geschatte intercept en de helling een lineaire verschuiving en herschaling op. Rapporteer daarom ook de echte prognosefout naast de regressiecoëfficiënten, zodat zowel de gemiddelde afwijking als de kalibratierelatie zichtbaar zijn.

De MZ-restrictie heet soms een toets op onbevooroordeeldheid of rationaliteit van prognoses. Definieer precies wat je bedoelt. Een voorwaardeloze gemiddelde fout van nul is (E[yₜ − fₜ] = 0); (α = 0, β = 1) legt een specifieke lineaire relatie op en is doorgaans sterker. Holden en Peel laten in hun formulering zien dat de gebruikelijke gezamenlijke restrictie voldoende maar niet noodzakelijk is voor onbevooroordeeldheid (1990). Gebruik „onbevooroordeeld” en „MZ-gekalibreerd” niet als synoniemen zonder de getoetste restrictie te benoemen.

<!-- learn:illustration -->

Leigrijze en amberkleurige glazen bollen liggen langs een helder diagonaal vlak; kleine afwijkingen verbeelden de kalibratie van voorspellingen
Conceptuele weergave van voorspellingen en gerealiseerde waarden ten opzichte van een kalibratielijn; geen marktgegevens, toetsresultaat of handelssignaal.

Een klein voorbeeld scheidt gemiddelde bias van de gezamenlijke restrictie

Bekijk drie hypothetische prognoses en latere uitkomsten:

Prognose (fₜ)Gerealiseerde waarde (yₜ)Fout (yₜ − fₜ)
11.50.5
22.00.0
32.5−0.5

Het gemiddelde van de prognoses is 2, net als dat van de uitkomsten; de gemiddelde prognosefout is nul. Toch volgen de waarden (yₜ = 1 + 0.5 fₜ), zodat het MZ-intercept (α = 1) en de helling (β = 0.5) zijn, niet (0, 1). De fouten heffen elkaar gemiddeld op terwijl de lineaire kalibratierestrictie faalt: in dit geconstrueerde voorbeeld beweegt de uitkomst maar half zo sterk als de prognose.

Dit is een handmatig gemaakte rekenillustratie, geen marktdata of inferentiesteekproef. Met drie ruisloze punten heeft het geen zin een betekenisvolle p-waarde te rapporteren of te beweren dat een echt prognosesysteem faalt. In een werkelijke steekproef houdt de gezamenlijke toets rekening met schattingsonzekerheid. Een grote coëfficiëntafwijking kan onnauwkeurig zijn; een kleine kan met voldoende waarnemingen precies worden geschat. Het voorbeeld toont alleen dat gemiddelde fout en MZ-restrictie andere vragen beantwoorden.

Een herkalibratie zoals (1 + 0.5 fₜ) zou deze drie uitkomsten exact reproduceren omdat ze ermee is geconstrueerd. Dat zegt niets over latere prestaties. Als herkalibratie onderdeel is van de methode, schat je die op een eerder trainingssegment en beoordeel je de aangepaste prognose op latere gegevens die de coëfficiënten niet hebben bepaald.

Lees intercept, helling en R-kwadraat samen

Het intercept (α) is de fitted uitkomst bij een prognose van nul; de praktische betekenis hangt af van de vraag of nul binnen of dicht bij het prognosebereik ligt. De helling (β) geeft aan hoe sterk fitted uitkomsten veranderen met prognosewaarden. Na correctie voor het intercept betekent een helling onder één dat de prognose per eenheid meer verandert dan de fitted uitkomst; boven één geldt het omgekeerde. Als ook de andere coëfficiënt vrij wordt geschat, beschrijft geen van beide alleen de hele relatie.

Een hoog (R²) bewijst geen kalibratie. Een ruisloze relatie (yₜ = 2 + 1.1 fₜ) heeft bijvoorbeeld (R² = 1), maar voldoet niet aan de MZ-nulhypothese. (R²) vat samen hoeveel variatie de lineaire fit verklaart; de gezamenlijke toets vraagt of de lijn de identiteitslijn is. Omgekeerd kan een ruisachtige prognose een laag (R²) hebben terwijl de gezamenlijke restrictie niet wordt verworpen. Kalibratie en precisie hangen samen maar zijn verschillende eigenschappen.

Leid de uitslag niet alleen af uit twee afzonderlijke t-statistieken. Intercept en helling kunnen gecorreleerd zijn, en de gezamenlijke Wald/F-statistiek gebruikt hun covariantie. Rapporteer α, β en hun onzekerheid, de gezamenlijke statistiek en p-waarde, de steekproefomvang en de gemiddelde ruwe fout. Een spreidingsdiagram met identiteitslijn of vergelijking per groep kan helpen; vermeld het als groepen zijn gekozen nadat je de gegevens bekeek. Een lineaire toets kan kromming, regimewisselingen of fouten in de staarten missen.

Kalibratie is zwakker dan volledige prognose-efficiëntie

Onder kwadratisch verlies is de optimale puntprognose de conditionele verwachting van het doel gegeven de informatie van de voorspeller. Informatie die op het prognosemoment bekend was, hoort latere fouten dus niet te voorspellen. De MZ-regressie toetst echter alleen een lineaire relatie met de prognose zelf en een constante; ze toetst niet iedere andere variabele in die informatieset.

Een strengere diagnose kan vooraf vastgelegde informatievariabelen (zₜ) aan een foutregressie toevoegen, bijvoorbeeld:

yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ

Als een variabele die op het prognosemoment bekend was latere fouten voorspelt, kan bruikbare informatie zijn genegeerd. De timing en keuze van variabelen moeten zorgvuldig zijn; veel vertragingen, markttoestanden en transformaties proberen creëert een nieuw probleem van meervoudig zoeken. Geen voorspelbaarheid vinden in een korte lijst bewijst geen efficiëntie ten opzichte van de volledige informatieset.

Zarnowitz bespreekt bias, seriële correlatie, steekproefomvang en toetskracht bij enquêteprognoses (NBER Working Paper 1070, 1983). Beschrijf MZ daarom als lineaire kalibratiediagnose of zwakke efficiëntiecheck, niet als bewijs dat alle relevante informatie optimaal is benut. De Giacomini–White-gids behandelt een andere conditionele vergelijking op basis van geselecteerde verliesmomenten.

Houd rekening met schatting, overlap en onzekerheid bij eindige steekproeven

Prognosefouten kunnen heteroskedastisch, serieel gecorreleerd of overlappend zijn, vooral bij rollende meerstapsprognoses. De gebruikelijke OLS-formules garanderen op zichzelf geen geldige standaardfouten voor de gezamenlijke restrictie. Gebruik en vermeld inferentie die past bij horizon, afhankelijkheidspatroon en schattingsschema; neem niet aan dat fouten onafhankelijk zijn. Er is geen universele bandbreedte of correctie voor elk ontwerp.

Als modelparameters, een kalibratieaanpassing en de toets daarvan in dezelfde kleine steekproef worden geschat, geeft gewone regressieonzekerheid mogelijk niet de hele procedure weer. Geneste prognoses kunnen bij nauwkeurigheidsvergelijkingen ook niet-standaard nulverdelingen geven. Gebruik een resultaat dat is afgeleid voor de feitelijke prognoseconstructie of beoordeel een volledig gespecificeerde kalibratiestap op een latere holdout. Probeer niet veel vergelijkingen, doelen en steekproeven om de laatste p-waarde daarna als bevestiging te presenteren.

Niet verwerpen bewijst geen kalibratie; de toets kan weinig kracht hebben of een breed interval opleveren. Ook verwerpen is afhankelijk van doel, steekproef, lineaire vorm en covariantiemethode. Controleer gevoeligheid voor redelijke evaluatiekeuzes, maak die controles bekend en onderscheid ze van een vooraf gespecificeerde toets. Dit is vooral belangrijk bij persistente prognoses of weinig onafhankelijke episodes.

Kies een toets die bij de prognosevraag past

MZ toetst een lineaire kalibratierestrictie tussen prognose en gerealiseerd doel. De Diebold–Mariano-toets vraagt daarentegen of twee prognoseprocedures onder een gekozen score hetzelfde gemiddelde verlies hebben. Een prognose kan gekalibreerd maar volgens die score minder nauwkeurig zijn, of gemiddeld nauwkeuriger zijn en toch de MZ-kalibratietoets niet doorstaan.

Als de vraag is of nauwkeurigheid verandert met informatie die op het prognosemoment bekend was, evalueert de Giacomini–White-toets geselecteerde conditionele verliesmomenten. Als veel prognoses of handelsregels zijn doorzocht, behandelt de Model Confidence Set of White Reality Check/Hansen SPA een ander selectieprobleem. Geen van deze methoden vervangt een duidelijk doel en eerlijke prognosemomenten.

De standaard MZ-regressie in niveaus is bedoeld voor puntprognoses van een numeriek doel. Kwantiel-, kans-, interval- en dichtheidsprognoses vereisen kalibratietoetsen en scores voor die prognoseobjecten. Een goed resultaat voor het gemiddelde geldt niet vanzelf voor een staart-risicoprognose of volatiliteitsverdeling.

Rapporteer het kalibratieontwerp zodat het reproduceerbaar is

Vermeld doel, horizon, eenheden, informatieafsluiting, evaluatiedata, gegevensvintage en of prognoses echt out-of-sample waren. Geef de regressievergelijking, de foutdefinitie en de getoetste restricties. Maak duidelijk of „onbevooroordeeld” nul gemiddelde fout of de gezamenlijke MZ-restrictie (α = 0, β = 1) betekent.

Rapporteer coëfficiënten, standaardfouten of intervallen, de gezamenlijke Wald/F-statistiek, vrijheidsgraden, p-waarde, aantal prognosemomenten, gemiddelde prognosefout en (R²) met beperkte interpretatie. Beschrijf de covariantie- of resamplingmethode, vooral bij overlappende horizons of seriële afhankelijkheid. Maak modelschatting, herkalibratie, selectie en alternatieve doelen, steekproeven of transformaties bekend.

Een transparant verslag helpt gemiddelde bias, lineaire kalibratie, informatie-efficiëntie en vergelijkende nauwkeurigheid uit elkaar te houden. Dat zijn afzonderlijke empirische claims. Eén geslaagde regressierestrictie valideert niet ieder gebruik van een prognose, en een prognose-evaluatie bewijst op zichzelf geen handelswinst na kosten.

Veelgestelde vragen

Q1Is de Mincer–Zarnowitz-toets alleen een toets van de gemiddelde prognosefout?

Nee. De gemiddelde fout vergelijkt de gemiddelden van prognose en uitkomst. De gebruikelijke MZ-toets beperkt intercept en helling gezamenlijk tot nul en één. Holden en Peel laten zien dat deze restrictie in hun formulering voldoende maar niet noodzakelijk is voor onbevooroordeeldheid.

Q2Bewijst het doorstaan van de MZ-toets dat een prognose efficiënt is?

Nee. De toets onderzoekt een lineaire relatie met de prognose, niet of alle op het prognosemoment beschikbare informatie fouten niet kan voorspellen. Efficiëntie vereist een sterkere voorwaarde voor de informatieset.

Q3Kan ik dezelfde regressie gebruiken voor een VaR- of kwantielprognose?

Niet zonder de kalibratiedefinitie en inferentie aan te passen. De standaardregressie in niveaus is bedoeld voor numerieke puntprognoses; kwantielen en staartprognoses vragen passende toetsen en scores.

Q4Bewijst kalibratie dat een handelsstrategie winstgevend is?

Nee. Kalibratie gaat over de relatie tussen prognoses en uitkomsten. Een winstclaim vraagt om een vooraf bepaalde beslisregel en aparte out-of-sample-evaluatie inclusief uitvoering, kosten, financiering, marktimpact en risico. Primair onderzoek - Mincer en Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden en Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold en Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini en White, “Tests of Conditional Predictive Ability” (2006)

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat is de gebruikelijke gezamenlijke nulhypothese in de Mincer–Zarnowitz-regressie in niveaus?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst

Heldere definities van belangrijke optiebegrippen, van calls, puts en optieketens tot IV, Greeks, open interest en max pain

Bekijk de optiewoordenlijst