Skip to content
Alle optiegidsen
Vergelijking van geneste voorspellingen12 min leestijd

De Clark–West-toets voor geneste voorspellingen: formule, voorbeeld en beperkingen

Lees waarom geneste voorspellingsmodellen een aangepaste MSPE-vergelijking nodig hebben, hoe de Clark–West-statistiek werkt en wat een eenzijdige uitkomst wel en niet kan aantonen.

In deze gidsWaarom geneste voorspellingen een eigen vergelijking nodig hebben

Korte samenvatting

De Clark–West-toets corrigeert een vergelijking van gekwadrateerde fouten wanneer het ene voorspellingsmodel een kleiner referentiemodel omvat. Extra geschatte parameters kunnen ruis toevoegen aan de voorspellingen van het grotere model, ook als ze geen echte voorspellende informatie toevoegen. De correctie verandert het verliesverschil waarop de inferentie berust; ze verandert geen van beide voorspellingen en garandeert niet dat het grotere model nuttig is.

Waarom geneste voorspellingen een eigen vergelijking nodig hebben

Stel dat een beperkt model het rendement van volgende maand voorspelt met een constante, terwijl een groter model daar een waarderingsratio aan toevoegt. Het beperkte model ligt besloten in het grotere model: als de extra coëfficiënt nul is, krijg je het referentiemodel terug. Ook als die coëfficiënt werkelijk nul is, kan de schatting ervan steekproefruis toevoegen aan de voorspellingen van het grotere model. De waargenomen gemiddelde gekwadrateerde voorspellingsfout (MSPE) kan daardoor hoger zijn, zelfs wanneer beide modellen in de populatie evenveel voorspellende informatie bevatten.

De Clark–West-correctie richt zich op deze schattingsruis in een vergelijking van gekwadrateerde voorspelfouten buiten de steekproef voor geneste modellen. De toets vraagt of het grotere model binnen die opzet voorspellende waarde toevoegt ten opzichte van het beperkte referentiemodel. Dat is een beperktere vraag dan de algemene vergelijking in de Diebold–Mariano-gids, die gepaarde voorspellingsverliezen vergelijkt en bij geneste modellen niet automatisch geldig is met de gebruikelijke referentieverdeling. Clark en McCracken onderzoeken het afwijkende asymptotische en eindige-steekproefgedrag van nauwkeurigheids- en encompassing-toetsen voor geneste voorspellingen; Clark en West ontwikkelen de aangepaste MSPE-procedure en bijbehorende benaderende inferentie. Clark en McCracken (2001)00071-9); Clark en West (2007).

Stel de nesting vast en houd het ontwerp buiten de steekproef

Laat het beperkte referentiemodel hetzelfde doel (y_{t+h}) voorspellen als het grotere alternatief. Het grotere model moet de specificatie van het referentiemodel als speciaal geval bevatten, meestal door een of meer extra coëfficiënten op nul te zetten. Dat een model ingewikkelder is, meer variabelen gebruikt of beter op de steekproef past, bewijst op zichzelf niet dat het genest is.

Maak voor elke voorspelstart beide voorspellingen met alleen de informatie die op dat moment beschikbaar was. Schat de modellen op een chronologisch trainingsvenster, maak voorspellingen voor een later evaluatievenster en gebruik voor beide hetzelfde doel, dezelfde horizon, eenheden, starts en gerealiseerde waarnemingen. Een recursieve of rollende herschatting kan passend zijn; vermeld welke methode je gebruikt en bewaar de voorspellingen die op elke start daadwerkelijk zijn gemaakt. Door het evaluatievenster herhaaldelijk te bekijken om voorspellers, transformaties of horizons te kiezen, wordt dat venster onderdeel van de modelselectie in plaats van onaangeroerd bewijs. De CAViaR-gids laat zien waarom een voorspelling van een staartkwantiel ook moet worden beoordeeld met een verliesmaat die bij het doel past, in plaats van te worden opgenomen in een vergelijking van gemiddelde voorspellingen.

De Clark–West-correctie behandelt schattingsruis van parameters onder de nulhypothese voor geneste modellen; ze herstelt geen look-ahead, niet-overeenkomende steekproeven, herziene gegevens die worden behandeld alsof ze eerder bekend waren, of niet-gemelde modelzoektochten. Vermeld het eerste schattingsvenster, het aantal voorspelstarts, de horizon, de gegevensversie en eventuele rollende of recursieve updates, zodat duidelijk is wat werkelijk buiten de steekproef is getest.

Bereken het aangepaste verliesverschil

Schrijf f₀,t+h voor de beperkte voorspelling, f₁,t+h voor de voorspelling van het grotere model en eⱼ,t+h = yₜ₊ₕ − fⱼ,t+h voor voorspellingsfout j. Bij een gekwadrateerde verliesmaat is het Clark–West-aangepaste verschil per periode

dCW,t+h = (e₀,t+h)² − [(e₁,t+h)² − (f₀,t+h − f₁,t+h)²]

Dit is gelijk aan de gekwadrateerde fout van het beperkte model min die van het grotere model, plus het gekwadrateerde verschil tussen de voorspellingen. De laatste term schat de extra voorspellingsruis die onder de nulhypothese samenhangt met de extra geschatte parameters. Clark en West beschrijven de correctie als een verlaging van de steekproef-MSPE van het grotere model met deze voorspellingsterm, voordat die met het beperkte model wordt vergeleken. Clark en West (2007).

Neem het gemiddelde van de aangepaste verschillen over de gemeenschappelijke evaluatiestarts: mean(dCW) = (1/P) Σ dCW,t+h. Als uitkomsten en voorspellingen in basispunten zijn gemeten, is elke gekwadrateerde fout en aangepast verschil uitgedrukt in basispunten in het kwadraat. Een positief aangepast gemiddelde wijst volgens de conventie hierboven in het voordeel van het grotere model. Het is een aangepaste vergelijkingsscore, geen gerealiseerde MSPE van het grotere model en geen voorspelling om mee te handelen.

Leg de eenzijdige hypothese vast voordat je de uitkomst bekijkt

De gebruikelijke Clark–West-vraag is of het grotere geneste model een lagere verwachte MSPE heeft dan het beperkte referentiemodel. De nulhypothese staat voor geen extra voorspellende verbetering door het toegevoegde modelonderdeel; de eenzijdige alternatieve hypothese bevoordeelt het grotere model. Met de formule hierboven wijst een voldoende positief aangepast gemiddelde ten opzichte van de standaardfout op steun voor die alternatieve hypothese.

In de notatie voor aangepast verlies zijn de werkhypothesen H₀: E[dCW] = 0 tegenover H₁: E[dCW] > 0. De positieve richting volgt uit de keuze om het verlies van het beperkte model eerst te nemen. Keer je de aftrekking om, dan draait het teken ook om; vermeld de conventie bij de uitkomst.

De toetsingsgrootheid wordt vaak geschreven als het steekproefgemiddelde van dCW gedeeld door de geschatte standaardfout. Clark en West bevelen voor de door hen onderzochte situaties een ongeveer normale eenzijdige toets aan, met een gewone of autocorrelatieconsistente standaardfout waar dat passend is. West (1996) ontwikkelt inferentie voor momenten van gladde functies van voorspellingen en fouten buiten de steekproef, waaronder situaties waarin voorspellingen afhangen van geschatte parameters. Kies de richting voordat je de resultaten bekijkt: een positieve Clark–West-statistiek is geen reden om achteraf over te stappen op een tweezijdige of anders getekende hypothese.

De gerapporteerde p-waarde is voorwaardelijk op de nesting, de constructie van de voorspellingen, het doel, de verliesmaat, de inferentiemethode en de steekproefaannames. Ze is niet de kans dat het grotere model waar is en bewijst evenmin dat een extra voorspeller het doel veroorzaakt.

Werk een voorbeeld met vier perioden uit

Neem vier hypothetische waarnemingen in basispunten. De uitkomsten zijn [0, 1, −1, 0], de voorspellingen van het beperkte model [−1, 0, 0, 0] en de voorspellingen van het grotere geneste model [−1.5, 0.5, −0.5, 0.5]. De gekwadrateerde fouten van het beperkte model zijn [1, 1, 1, 0], met een gemiddelde MSPE van 0.75 bp². De gekwadrateerde fouten van het grotere model zijn [2.25, 0.25, 0.25, 0.25], eveneens met een gemiddelde MSPE van 0.75 bp².

De gekwadrateerde voorspellingsverschillen (f₀ − f₁)² zijn [0.25, 0.25, 0.25, 0.25]. De aangepaste formule e₀² − e₁² + (f₀ − f₁)² geeft [−1, 1, 1, 0] bp². Het steekproefgemiddelde is 0.25 bp². De ruwe MSPE’s zijn gelijk, terwijl het aangepaste gemiddelde positief is doordat de correctie rekening houdt met schattingsruis in de voorspellingen van het grotere model.

Deze vier perioden laten alleen de berekening zien. Ze zijn veel te weinig om de onzekerheid geloofwaardig te schatten of statistische significantie vast te stellen. Het positieve aangepaste gemiddelde bewijst op zichzelf geen werkelijk voorspellingsvoordeel; de getallen zijn hypothetisch en geen marktwaarnemingen. <!-- learn:illustration -->

Twee geneste, doorschijnende blauwe en amberkleurige paden lopen omhoog naar één horizon; eronder staan vier voorspelling-uitkomstparen van blauwe en amberkleurige bollen met heldere bogen ertussen
Conceptuele afbeelding zonder tekst of assen; de paren zijn schematisch, geen empirische gegevens, voorspelling of handelssignaal

Houd rekening met afhankelijke voorspellingsfouten en horizons

Ook bij voorspellingen voor één stap kunnen aangepaste verliesverschillen serieel afhankelijk zijn doordat het doel, de voorspellers of het schattingsvenster in de tijd veranderen. Bij overlappende meerstapsvoorspellingen delen naburige starts gerealiseerde doelperioden, waardoor hun aangepaste verschillen van nature gecorreleerd kunnen zijn. Een gewone standaardfout die elke start als onafhankelijk behandelt, kan de onzekerheid onderschatten.

Schat de standaardfout uit de reeks aangepaste verschillen met een inferentiemethode die het steekproefontwerp weerspiegelt, zoals een langetermijnvariantieschatting die consistent is bij heteroskedasticiteit en autocorrelatie, mits aan de voorwaarden wordt voldaan. Clark en West noemen expliciet autocorrelatieconsistente fouten voor autocorrelerende voorspelfouten. Vermeld de voorspellingshorizon, de covariantieschatter, kernel en bandbreedte indien gebruikt, plus eventuele resampling- of kritieke-waardemethode. De gids voor block-bootstrap legt uit waarom het hersamplen van afhankelijke tijdreekswaarnemingen hun volgorde moet behouden; een generieke bootstrap voert de Clark–West-nulhypothese niet automatisch uit.

De benodigde behandeling van afhankelijkheid hangt af van het ontwerp. Langere horizons, persistente doelen, herhaalde parameterschattingen en veranderingen in volatiliteit kunnen meer afhankelijkheid veroorzaken dan alleen de eenvoudige overlap. Vergelijk redelijke inferentie-instellingen en licht ze toe in plaats van de instelling met de kleinste p-waarde te kiezen.

Behandel normale kritieke waarden als benadering, niet als garantie

Voorspellingstoetsen voor geneste modellen kunnen niet-standaard nulverdelingen hebben, vooral wanneer zowel de schattings- als evaluatiesteekproef groeit. Clark en McCracken laten zien dat toetsen van gelijke nauwkeurigheid en encompassing voor geneste voorspellingen asymptotisch en in eindige steekproeven anders werken dan de bekende vergelijking voor niet-geneste modellen. Clark en West motiveren een aangepaste statistiek met bruikbare ongeveer normale inferentie in de onderzochte ontwerpen, maar dat is geen universele garantie voor eindige steekproeven. Clark en McCracken (2001)00071-9); Clark en West (2007).

Kleine evaluatiesteekproeven, veel extra parameters, verkeerd gespecificeerde referentiemodellen, datagedreven selectie van voorspellers en de keuze tussen rollende en recursieve schatting kunnen de omvang en power beïnvloeden. Als steekproef of ontwerp wezenlijk afwijkt van de situaties in de artikelen, overweeg dan kritieke waarden die bij het ontwerp passen of een zorgvuldig gespecificeerde simulatie-/bootstrapprocedure. Rapporteer de omvang van de schattings- en evaluatiesteekproeven en vermeld duidelijk welke referentieverdeling de p-waarde opleverde.

Onderscheid verwante toetsen en begrens voorspellingsclaims

De Diebold–Mariano-toets vraagt of twee reeksen voorspellingsverliezen binnen een algemene opzet met gepaarde verliezen hetzelfde verwachte verlies hebben. De Clark–West-correctie is bedoeld voor vergelijkingen van gekwadrateerde fouten waarbij het ene model in het andere is genest en extra geschatte parameters onder de nulhypothese het ruwe MSPE-verschil vertekenen. De correctie toepassen op niet-verwante, niet-geneste modellen verandert de vraag zonder rechtvaardiging. Het oorspronkelijke DM-artikel staat een breed scala aan verliesmaten toe en bespreekt voorspelfouten die niet noodzakelijk normaal of onafhankelijk zijn; het is verwant werk, geen synoniem voor de procedure voor geneste modellen. Diebold en Mariano (1995).

Geen van beide methoden lost de onderzoekersvrijheidsgraden op die ontstaan door veel doelen, horizons, referentiemodellen en sets voorspellers te proberen. Als de uiteindelijke vergelijking uit een brede zoektocht komt, leg dan de kandidaatfamilie vast en gebruik een methode die past bij de vraag op zoekniveau. De gids over White’s Reality Check en Hansen’s SPA behandelt familiebrede inferentie voor onderzochte handelsregels; alleen de Clark–West-toets maakt een geselecteerde voorspellingsvergelijking niet bevestigend.

Een significante eenzijdige uitkomst is, onder de vermelde aannames, bewijs dat het grotere model de verwachte nauwkeurigheid van gekwadrateerde voorspelfouten verbetert voor het geteste doel en evaluatieontwerp. Ze toont niet aan dat de extra voorspeller causaal is, dat een signaal stabiel blijft of dat een strategie met de voorspelling positieve rendementen oplevert. Verbeteringen kunnen te klein zijn om beslissingen te beïnvloeden, en de grootste winst kan optreden in perioden waarin handelen duur is.

Winstgevend handelen vereist een aparte regel, onaangeroerde evaluatiegegevens en realistische spreads, kosten, slippage, marktimpact, financiering, leenlasten en risicolimieten. Voor causale claims is een identificatiestrategie nodig die bij de vraag past; een voorspellingvergelijking na de steekproef is geen causaal ontwerp. Vermeld wat de Clark–West-uitkomst wel aantoont en laat andere claims over aan bewijs dat ze daadwerkelijk toetst.

Rapporteer het ontwerp zodat de vergelijking reproduceerbaar is

Noem het beperkte en het grotere model, geef de exacte restricties aan die ze genest maken en definieer het doel, de horizon, de eenheden van de gekwadrateerde fout, het schattingsvenster, de planning van voorspelstarts, evaluatiedata en de regel voor de gemeenschappelijke steekproef. Licht toe of coëfficiënten recursief of met een rollend venster opnieuw worden geschat en hoe de informatieset en gegevensversies behouden blijven.

Rapporteer beide ruwe MSPE’s, het gemiddelde Clark–West-aangepaste verschil, de tekenconventie, standaardfout, eenzijdig alternatief, referentieverdeling of kritieke waarden, p-waarde en afhankelijkheidsschatter. Maak ook het aantal extra parameters, steekproefgroottes, zoektochten naar voorspellers en horizons, keuze van het referentiemodel en eventuele invloed van het evaluatievenster op het modelontwerp bekend. Zo kunnen lezers een aangepaste toets voor geneste modellen onderscheiden van een algemene voorspellingvergelijking en de resterende onzekerheid beoordelen.

Veelgestelde vragen

Q1Vervangt de Clark–West-toets de Diebold–Mariano-toets?

Nee. Clark–West behandelt een vergelijking van gekwadrateerde MSPE’s bij geneste modellen. Diebold–Mariano is een algemeen kader voor gepaarde verliezen; de gebruikelijke referentieverdeling mag niet automatisch geschikt worden geacht voor geneste voorspellingen.

Q2Bewijst een positief aangepast gemiddelde dat het grotere model beter is?

Nee. Volgens de vermelde tekenconventie wijst het in de richting van het grotere model, maar inferentie vereist ook een geschikte standaardfout, een geloofwaardig ontwerp buiten de steekproef en voldoende waarnemingen.

Q3Kan ik Clark–West gebruiken voor modellen die niet genest zijn?

Niet zonder meer. De correctie is gemotiveerd door schattingsruis onder een nulhypothese voor geneste modellen. Kies voor een niet-geneste vergelijking een toets die bij het voorspellingsontwerp en de verliesmaat past.

Q4Betekent een significante Clark–West-uitkomst dat een handelsstrategie winstgevend is?

Nee. De toets beoordeelt de voorspellingsnauwkeurigheid voor één doel en evaluatieontwerp. Handelsresultaten hangen ook af van de beslisregel, uitvoering, kosten, financiering, risico en aanvullend bewijs buiten de steekproef. Primair onderzoek - Clark en West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Clark en McCracken, “Tests of Equal Forecast Accuracy and Encompassing for Nested Models” (2001)00071-9) - West, “Asymptotic Inference about Predictive Ability” (1996) - Diebold en Mariano, “Comparing Predictive Accuracy” (1995)

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Waarom telt de Clark–West-correctie het gekwadrateerde verschil tussen de twee voorspellingen op?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst