Skip to content
Alle optiegidsen
Voorspellen toetsen13 min leestijd

De Giacomini–White-toets voor conditionele voorspelkracht

Lees hoe de Giacomini–White-toets controleert of voorspelprestaties samenhangen met bekende omstandigheden, hoe je instrumenten kiest en wat de uitkomst wel en niet aantoont

In deze gidsGemiddelde en conditionele nauwkeurigheid beantwoorden verschillende vragen

Korte samenvatting

Het Giacomini–White-kader (GW) vraagt of informatie die beschikbaar is wanneer een voorspelling wordt gemaakt, samenhangt met het relatieve verlies van twee voorspellingen. Zo kunnen verschillen zichtbaar worden die in een gemiddelde score verdwijnen. De uitkomst hangt wel af van de vooraf gekozen voorspelmethoden, evaluatieperiode, verliesfunctie en conditionele variabelen.

Gemiddelde en conditionele nauwkeurigheid beantwoorden verschillende vragen

Stel dat voorspelling A in een teststeekproef een lager gemiddeld verlies heeft dan voorspelling B. Dat gemiddelde kan een bruikbaar patroon verhullen: A kan beter presteren in rustige markten, terwijl B het beter doet bij hoge volatiliteit. Voor de vraag welke voorspelling gemiddeld beter was, is een onvoorwaardelijke vergelijking passend. Wil je weten of informatie die op het voorspelmoment bekend was helpt voorspellen welke methode beter zal presteren, dan gaat het om conditionele voorspelkracht.

Giacomini en White formuleren dit als een vergelijking van voorspelmethoden op basis van een bepaalde verliesfunctie en informatieverzameling. Het kader kan worden toegepast op puntschattingen, intervallen, kansen en dichtheden, mits de verliesfunctie past bij de voorspeltaak. Ook de schattingsprocedure waarmee de voorspelling wordt gemaakt, behoort tot wat je beoordeelt. Een rollend venster, vaste trainingssteekproef of weegregel is dus geen onbelangrijk detail dat je na het bekijken van de resultaten kunt aanpassen, maar een onderdeel van de voorspelmethode (Giacomini en White, 2006).

Een conditionele toets heeft een verband met een structurele-breuktoets, maar is niet hetzelfde. De conditionele toets vraagt of het relatieve verlies systematisch samenhangt met gekozen informatie. Een breuktoets onderzoekt of parameters of relaties op een onbekend of vastgelegd tijdstip veranderden. De uitleg over de Diebold–Mariano-toets behandelt een onvoorwaardelijke vergelijking van gemiddelde verliezen; voor een conditionele vraag moet je expliciet maken welke informatie je conditioneert.

Lijn voorspellingen, uitkomsten en informatietijdstip eerst uit

Noem het doel dat na het voorspelmoment (t) wordt waargenomen (Y_{t+1}). Voorspellingen ŷA,t+1 en ŷB,t+1 moeten betrekking hebben op hetzelfde doel, dezelfde horizon en eenheid en hetzelfde tijdstip waarop informatie beschikbaar kwam. Gebruik bij een verliesfunctie (L) waarbij lager beter is deze verliesdifferentiatie:

dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)

Met deze tekenafspraak betekent een positieve waarde dat A meer verlies leed en B dus op dat voorspelmoment beter was; een negatieve waarde is gunstig voor A. Gebruik één rij per voorspelmoment en beoordeel beide voorspellingen tegen dezelfde realisatie. Bewaar de voorspellingen zoals ze destijds beschikbaar waren, met de gegevensversie en modelversie. Bouw historische voorspellingen niet opnieuw op met herziene invoergegevens of informatie die pas later bekend werd.

Ook conditionele variabelen moeten op het voorspelmoment bekend zijn. Voorbeelden zijn een vertraagde volatiliteitsschatting, een vooraf aangekondigde gebeurtenisindicator, een vertraagd verschil in relatief verlies of een markttoestand die alleen met eerdere waarnemingen wordt berekend. Een variabele die na (t) is gemeten kan niet zonder look-aheadbias verklaren welke voorspelling op (t+1) beter was.

Laat de score aansluiten op het doel. Kwadratische fout is één mogelijkheid voor een voorspelling van het conditionele gemiddelde, maar past niet automatisch bij volatiliteits-, kwantiel- of dichtheidsvoorspellingen. Voorspelt het ene model variantie en het andere standaarddeviatie, zet ze dan eerst om zodat beide hetzelfde grootheid voorspellen. Een toets kan een verschil in de gestelde vraag niet herstellen.

Beoordeel volatiliteitsvoorspellingen met dezelfde definitie van gerealiseerde variantie en dezelfde steekproefperiode. Als de ene voorspelling intradayprijzen gebruikt en de andere ook overnight rendementen omvat, kan een verliesverschil het verschillende doel weerspiegelen in plaats van voorspelvaardigheid. Bepaal hoe bewegingen buiten beursuren, de steekproeffrequentie, ontbrekende waarnemingen en de gerealiseerde maat worden behandeld en pas die keuzes consequent toe. Als de gerealiseerde proxy ruis bevat, werkt die meetfout door in beide verliesscores en hoort ze bij de interpretatie.

Formuleer de conditionele nulhypothese en kies toetsfuncties

Laat (𝒢ₜ) de informatie voorstellen waarop je de vergelijking conditioneert. De geïdealiseerde nulhypothese is

H₀: E[dₜ₊₁ | 𝒢ₜ] = 0

Dat betekent dat het verwachte verliesverschil nul is, gegeven de gekozen informatie. De GW-toets voor één stap vertaalt deze conditionele uitspraak naar momenten met een vooraf gekozen vector toetsfuncties (h_t), die meetbaar zijn met informatie die op tijdstip (t) beschikbaar is:

H₀,ₕ: E[hₜ dₜ₊₁] = 0

De vector (h_t) kan een constante bevatten, die het gemiddelde verliesverschil meeneemt. Andere elementen kunnen een markttoestand, een vertraagd relatief verlies of een vooraf gekozen niet-lineaire transformatie weergeven. Is (S_t) bijvoorbeeld een binaire indicator voor hoge volatiliteit die op tijdstip (t) bekend is, dan toets je met (h_t=(1,S_t)') zowel een constant moment als de samenhang van het verliesverschil met die toestand.

Een eindige verzameling toetsfuncties toetst alleen de momenten die zij vastlegt. Verwerping betekent dat onder de toetsaannames minstens één gekozen moment niet met nul strookt; ze identificeert geen universeel beste model en bewijst niet dat elke denkbare toestandvariabele ertoe doet. Niet verwerpen bewijst niet dat de conditionele prestaties gelijk zijn. Een toets met alleen een constante vergelijkt een onvoorwaardelijk moment en doorzoekt niet breed alle mogelijke omstandigheden.

Leg de verliesfunctie, instrumenten, transformaties, steekproef en voorspelhorizon vast voordat je bekijkt welk model wint. Voeg je na het zien van de uitkomst veel toestandsindicatoren, drempels of vertragingen toe, dan ontstaat een nieuw zoekprobleem. De conditionele toets corrigeert die selectie niet vanzelf.

Leg ook vast wanneer je elke toestandvariabele construeert. Als “hoge volatiliteit” de hoogste 20 procent van de volatiliteit in de hele steekproef betekent, helpen toekomstige waarnemingen de drempel voor eerdere voorspelmomenten te bepalen. Schat de drempel alleen met informatie die op elk voorspelmoment beschikbaar was, of gebruik een regel die vóór dat moment is aangekondigd. Leg bij continue toestandsvariabelen eenheden en eventuele centrering of schaling vooraf vast. Bijna identieke indicatoren kunnen redundante momenten opleveren en de covariantiematrix moeilijk omkeerbaar maken; gebruik daarom de kleinste set die nog een duidelijke interpretatie heeft.

Bereken de Wald-statistiek en lees de referentieverdeling

Vorm bij (q) toetsfuncties de momentvector (g_{t+1}=h_t d_{t+1}). Het steekproefgemiddelde is

ḡ = (1/n) Σₜ gₜ₊₁

De GW-statistiek voor één stap heeft de volgende Wald-vorm:

GW = n ḡ′ Ω̂⁻¹ ḡ

(Ω̂) schat de covariantiematrix van de momentvector. Onder de nulhypothese en de regulariteitsvoorwaarden van het oorspronkelijke artikel volgt de statistiek asymptotisch een chi-kwadraatverdeling met (q) vrijheidsgraden. Het aantal toetsfuncties bepaalt dus de referentieverdeling en kan ook de power beïnvloeden. Veel zwakke of redundante instrumenten kunnen de covariantiematrix instabiel maken zonder veel bruikbare informatie toe te voegen.

In de éénstapssituatie impliceert de nulhypothese een martingaalverschilstructuur voor de momentvector, waardoor de oorspronkelijke toets een schatting op basis van tweede steekproefmomenten kan gebruiken. Bij andere horizons, overlappende uitkomsten of afwijkingen van deze opzet moet de variantieschatting passen bij de aannames en afhankelijkheidsstructuur van de toets. Kopieer niet automatisch een HAC-bandbreedte uit een andere toets; volg de formulering van de gekozen implementatie. Algemene HAC-covariantiemethoden, waaronder de schatter van Newey en West (1987), zijn hulpmiddelen voor situaties waarin ze nodig zijn, geen universeel bandbreedtevoorschrift voor GW. De geloofwaardigheid van de uitkomst hangt af van de covariantie- en voorspelopzet.

Controleer ook of (Ω̂) uit de gekozen momenten kan worden geschat. Bijna identieke toetsfuncties, een indicator met zeer weinig waarnemingen in één toestand of te veel interacties kunnen de matrix singulier of instabiel maken. De inverse kan dan sterk reageren op een kleine wijziging in de gegevens en de toetsstatistiek vertekenen. Elke functie moet een reden hebben die aansluit op een toestand of verschil in voorspelprestaties; rapporteer het aantal functies en de momentcovariantie. Een functie na inzage in de uitkomst verwijderen omdat die niet helpt, is opnieuw een selectiestap en moet worden vermeld.

De p-waarde is bewijs tegen de genoemde momentrestricties onder de referentieverdeling en toetsaannames. Ze is niet de kans dat A of B het ware model is en ook niet de kans dat een handelsregel winst oplevert. Rapporteer de statistiek, vrijheidsgraden, p-waarde en de exacte getoetste momenten, zodat lezers de betekenis van verwerping kunnen beoordelen.

<!-- learn:illustration -->

Drie heldere glazen panelen tonen blauwe en amberkleurige banen die afwisselend van relatieve positie wisselen; prestaties kunnen per omstandigheid veranderen
Conceptbeeld van veranderende relatieve prognoseprestaties onder verschillende omstandigheden; geen gemeten marktgegevens, testresultaat of handelssignaal

Een voorbeeld met twee toestanden laat zien wat het gemiddelde verbergt

Neem acht hypothetische voorspelmomenten voor één stap. Laat (S_t=0) een rustige toestand aanduiden en (S_t=1) een toestand met hoge volatiliteit. Stel dat de verliesverschillen (d_{t+1}=L_A-L_B) hypothetisch −2, −2, −2 en −2 zijn bij de vier rustige momenten, en +2, +2, +2 en +2 bij de vier momenten met hoge volatiliteit. Negatieve verschillen zijn gunstig voor A; positieve voor B.

Het gemiddelde over alle acht momenten is nul, dus dit kleine voorbeeld toont geen onvoorwaardelijk verschil in verlies. Het gemiddelde in de rustige toestand is −2 en dat bij hoge volatiliteit +2. De relatieve rangorde draait om afhankelijk van de toestand. Met (h_t=(1,S_t)') neem je een constant moment en een moment voor hoge volatiliteit op, die dit patroon kunnen weerspiegelen.

Deze acht waarden zijn een uitlegvoorbeeld en bieden te weinig waarnemingen voor betrouwbare gevolgtrekkingen. In echte gegevens moet je rekening houden met de manier waarop voorspellingen zijn geschat, of de toestand vooraf is vastgelegd, het aantal voorspelmomenten en de tijdsvariatie in de momenten van het verliesverschil. Alleen een grafiek met een opsplitsing naar toestand bewijst niet dat het patroon aanhoudt.

Behandel het schattingsvenster als onderdeel van de methode

De oorspronkelijke GW-asymptotiek houdt de maximale lengte van het schattingsvenster eindig terwijl het aantal voorspellingen buiten de steekproef groeit. Rollende vensters en een vaste schattingssteekproef passen bij deze kernopzet. De vensterlengte en een eventuele gegevensafhankelijke regel voor de keuze ervan maken deel uit van iedere voorspelmethode en moeten dus worden vastgelegd en gerapporteerd.

Dit is van belang wanneer voorspelmodellen opnieuw worden geschat. Een vergelijking die parameteronzekerheid negeert kan onzekerheid missen die voortkomt uit de manier waarop iedere methode van historische gegevens leert. Onder de genoemde voorwaarden kan GW voorspellingen uit geneste en niet-geneste modellen vergelijken, maar dat geldt niet automatisch voor iedere implementatie met een groeiend venster of iedere schatter. In het oorspronkelijke raamwerk voor één stap hoort een eindig venster bij de aanname; een gebruikelijk uitbreidend venster valt daarbuiten. Gebruik bij een andere voorspelconstructie een resultaat dat voor die opzet is afgeleid.

De toets kiest ook geen geschikt venster voor je. Een kort venster kan zich aanpassen aan recente omstandigheden, maar gebruikt minder waarnemingen. Een lang of uitbreidend venster kan schattingen stabiliseren, maar verouderde verbanden blijven meetellen. Vergelijk de opties met een vooraf gepland evaluatieproces en leg ook de vensterkeuze vast. Giacomini en Rossi (2010) ontwikkelden aparte toetsen voor het verloop van relatieve voorspelprestaties in instabiele omgevingen; dat is een verwante vraag, maar niet dezelfde statistiek als de basale conditionele GW-toets.

Een conditionele verwerping levert op zichzelf evenmin een handelsregel op die in realtime de beste voorspelling selecteert. Een instrument kan in de evaluatiegegevens samenhangen met het verliesverschil zonder een stabiele of bruikbare omschakelregel op te leveren. Wil je actuele informatie gebruiken om voorspellingen te kiezen, definieer de regel dan met eerdere waarnemingen en evalueer hem op een latere, ongebruikte reeks voorspelmomenten, inclusief de onzekerheid van de schatting en beslissing.

Onderscheid GW van DM, toetsen voor geneste modellen en instabiliteit

De Diebold–Mariano-toets vraagt of twee voorspellingen in de evaluatiesteekproef hetzelfde gemiddelde verlies hebben. GW vraagt of gekozen informatie samenhangt met hun relatieve verlies; een onvoorwaardelijke vergelijking is een speciaal moment in het conditionele kader. Zoals het voorbeeld met twee toestanden laat zien, kunnen de gemiddelde scores gelijk zijn terwijl de relatieve prestaties per toestand verschillen.

Komen de voorspellingen uit geneste modellen en gaat het specifiek om gelijke MSPE, dan behandelt een methode als de Clark–West-correctie een andere nulhypothese en schattingsruis. Zijn er veel handelsregels of voorspellingen doorzocht en is de vraag of een kandidaat beter voorspelt, gebruik dan een procedure op familieniveau zoals White's Reality Check of Hansen's SPA-toets. Een conditionele toets voor één geselecteerd paar maakt een bredere zoekactie niet ongedaan.

Als de onderzoeksvraag gaat over het tijdpad van relatieve nauwkeurigheid in plaats van de samenhang met gekozen instrumenten, past een toets voor lokale instabiliteit of omslagen mogelijk beter. Giacomini en Rossi (2010) bestuderen zulke voorspelvergelijkingen. Kies de methode die bij de vraag hoort en behandel een verwerping niet automatisch als bewijs voor een handelsstrategie die van regime wisselt.

Wanneer meerdere voorspelmodellen overblijven, kan een procedure op familieniveau een andere vraag beantwoorden dan de paarsgewijze conditionele toets. De uitleg over de Model Confidence Set laat zien hoe je via een iteratieve vergelijking een verzameling modellen kunt behouden die op het gekozen niveau niet van elkaar te onderscheiden zijn. Dat vervangt niet de vooraf vastgelegde keuze van de condities voor een GW-analyse.

Houd rekening met lage power en herhaalde toetsen

Voor conditionele toetsen kan veel data nodig zijn. Een steekproef opsplitsen in rustige en volatiele toestanden vermindert het aantal waarnemingen voor iedere vergelijking. Meer toetsfuncties vergroten het aantal momenten en de vrijheidsgraden. Als meerdere condities maar zwak samenhangen met het relatieve verlies, kan de toets weinig power hebben, zelfs als er conditionele verschillen bestaan.

Een werkdocument van McCracken van de Federal Reserve Bank of St. Louis onderzoekt het bestaan, de grootte en de power van de GW-toets in een eenvoudig voorbeeld met kwadratisch verlies. In de onderzochte simulaties bleef de toetsgrootte passend, maar was de power doorgaans laag (McCracken, 2020). Dat is een waarschuwing bij de interpretatie, geen universele numerieke voorspelling voor iedere toepassing. Niet verwerpen kan komen door beperkte informatie of lage power; het bewijst niet dat de voorspellingen onderling verwisselbaar zijn.

Herhaaldelijk andere toestandsdefinities, drempels, horizons, verliesfuncties en evaluatiedatums proberen vergroot de kans op een toevallige bevinding. Leg alle geteste kandidaten vast en houd verkennende analyses gescheiden van een vooraf gekozen bevestigingssteekproef. Wil je stellen dat één strategie uit een familie voorspellende waarde heeft, pas dan een passende correctie voor meervoudig toetsen of data snooping toe op die hele familie. Meer conditionele instrumenten leveren niet vanzelf sterker bewijs op.

Als meerdere modellen worden vergeleken, kan een methode op familieniveau een andere vraag beantwoorden dan een paarsgewijze conditionele toets. De uitleg over de Model Confidence Set beschrijft hoe een iteratieve vergelijking een verzameling kan behouden van modellen die op het gekozen niveau niet te onderscheiden zijn. Ook die procedure bepaalt niet vooraf welke condities je in een GW-analyse moet gebruiken.

Rapporteer het ontwerp zodat anderen het kunnen reproduceren

Noem beide voorspelmethoden en hun schattingswijze, of de modellen genest zijn, het doel en de horizon en de evaluatiedatums. Geef de verliesfunctie en de tekenafspraak voor (d_{t+1}) precies weer. Beschrijf elk element van (h_t), hoe het wordt geconstrueerd, wanneer het waarneembaar wordt en of je het vastlegde voordat je de resultaten bekeek.

Rapporteer het schema van voorspelmomenten, de regel voor het schattingsvenster, de gegevensversie, de gemeenschappelijke steekproefregel, het aantal voorspellingen buiten de steekproef, het aantal toetsfuncties, de covariantiemethode, de referentieverdeling, de toetsstatistiek, vrijheidsgraden en p-waarde. Vermeld of horizons overlappen en hoe je afhankelijkheid verwerkt. Geef naast de toetsuitkomst ook de gemiddelde verliezen en samenvattingen van de verliesverschillen.

Noem ook andere instrumenten, drempels, vensters, verliesfuncties en voorspelparen die je hebt geprobeerd. Meld het als dezelfde waarnemingen zijn gebruikt om het model of conditionele variabelen te kiezen en vervolgens te toetsen. Ook een verkennende uitkomst kan informatie geven zonder bevestigend bewijs te zijn. Transparante rapportage helpt lezers de reikwijdte te beoordelen en een afzonderlijke validatie op te zetten.

Veelgestelde vragen

Q1Is de Giacomini–White-toets hetzelfde als de Diebold–Mariano-toets?

Nee. Diebold–Mariano richt zich op gelijk gemiddeld verlies. Het GW-kader voor één stap toetst gekozen conditionele momenten en omvat een onvoorwaardelijk moment als mogelijke restrictie.

Q2Vertelt verwerping welke voorspelling in elk marktregime moet worden gebruikt?

Nee. Ze laat zien dat onder de toetsaannames minstens één gekozen moment niet met nul strookt. De uitkomst hangt af van de geselecteerde instrumenten, steekproef en verliesfunctie en garandeert geen prestaties in iedere toestand.

Q3Kan ik volatiliteitsdrempels blijven toevoegen totdat de toets verwerpt?

Dan zoek je naar geschikte conditionele variabelen. Leg variabelen waar mogelijk vooraf vast en rapporteer alle geteste specificaties. Gebruik voor een brede voorspelclaim een afzonderlijke bevestigingssteekproef of een passende correctie voor de volledige kandidaatfamilie.

Q4Betekent conditionele voorspelkracht dat een handelsstrategie winstgevend is?

Nee. De toets vergelijkt voorspelverliezen. Een handelsclaim vereist een vastgelegde beslisregel en een aparte evaluatie van uitvoering, kosten, financiering, marktimpact en risico. Belangrijkste onderzoeken - Giacomini and White, “Tests of Conditional Predictive Ability” (2006) - Giacomini and Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (Federal Reserve Bank of St. Louis Working Paper, 2020) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Newey and West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat betekent een positief verliesverschil bij dₜ₊₁ = L(A) − L(B)?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst