Skip to content
Alle optiegidsen
Prognosemodellen vergelijken14 min leestijd

Model Confidence Set (MCS): prognosemodellen vergelijken zonder een winnaar af te dwingen

Lees hoe de Model Confidence Set opeenvolgende toetsen en een bootstrap voor afhankelijke data gebruikt om prognosemodellen te behouden die op basis van het bewijs niet van elkaar te onderscheiden zijn.

In deze gidsWelke vraag beantwoordt de Model Confidence Set?

Korte samenvatting

De Model Confidence Set (MCS) vergelijkt een vooraf bepaalde familie van prognoseprocedures en geeft de kandidaten terug die volgens een gekozen verliesfunctie niet aantoonbaar inferieur zijn. Als de steekproef geen onderscheid maakt, kunnen meerdere modellen overblijven; de uitkomst hangt af van de kandidatenfamilie, prognoseopzet, verliesfunctie en inferentieprocedure.

Welke vraag beantwoordt de Model Confidence Set?

Stel dat meerdere procedures de volatiliteit van de volgende dag voorspellen. Hun fouten zijn niet gelijk, maar de steekproef kan te kort of te ruisachtig zijn om vast te stellen welke procedure het laagste verwachte verlies heeft. De procedure met het laagste gemiddelde verlies kiezen dwingt een winnaar af, ook als het verschil steekproefvariatie kan zijn. De MCS geeft een antwoord in de vorm van een verzameling: welke kandidaten blijven statistisch verenigbaar met de beste prestatie volgens een vastgelegd criterium?

De MCS begint met kandidatenverzameling \(\mathcal M_0\), een verliesfunctie of ander criterium en een betrouwbaarheidsniveau. De procedure toetst herhaaldelijk of de kandidaten die nog in aanmerking komen gelijke voorspelkracht hebben. Bij verwerping verwijdert een eliminatieregel een relatief zwakke kandidaat en wordt de toets op de kleinere verzameling herhaald. De overblijvers vormen de MCS. Hansen, Lunde en Nason introduceerden deze procedure als betrouwbaarheidsverzameling voor het beste model of de beste modellen in de opgegeven collectie, vergelijkbaar met een parameterinterval dat meerdere waarden kan bevatten als de gegevens onnauwkeurig zijn (artikel uit 2011).

“Beste” geldt alleen ten opzichte van de opgenomen kandidaten, het doel, de prognosehorizon, de informatie die per oorsprong beschikbaar was en het gekozen criterium. De MCS vereist niet dat een kandidaat het ware datagenererende proces is en kan meerdere kandidaten met dezelfde beste verwachte prestatie behouden. Het is geen posterior kans dat een behouden model correct is.

Leg de kandidatenfamilie en prognosevraag vooraf vast

Definieer \(\mathcal M_0\) voordat je verliezen berekent. Een kandidaat kan een geschat model plus regels voor schatting en prognose-update zijn, of een prognoseprocedure die niet als statistisch model is beschreven. “GARCH” is bijvoorbeeld onvoldoende gespecificeerd als volatiliteitsverdeling, rollend venster, parameterupdates en prognosehorizon kunnen verschillen. Elk van die keuzes kan een andere kandidaat opleveren.

Elke kandidaat moet hetzelfde doel op dezelfde oorsprongen en horizon voorspellen, met alleen informatie die toen beschikbaar zou zijn. Ruwe verliezen zijn geen eerlijke directe vergelijking als het ene model eendaagse variantie voorspelt en het andere vijfdaagse volatiliteit. Gebruik een gemeenschappelijke evaluatiesteekproef, lijn ontbrekende observaties expliciet uit en leg dataversie, eerste schattingsvenster, recursieve of rollende planning en verwerking van herziene inputs vast. Overlappende prognoses kunnen ertoe leiden dat verliezen van nabije oorsprongen observaties delen.

Kies het criterium voordat je de uitkomsten bekijkt. Kwadratische fout, absolute fout of een beslissingsspecifiek verlies kunnen puntprognoses anders rangschikken. Een variantieprognose kan een volatiliteitsverlies nodig hebben dat past bij een ruisachtige proxy; een kwantielprognose vereist een quantile score, geen mean squared error. Een goede MCS onder één verliesfunctie is niet automatisch goed onder een andere. Als de kandidatenlijst is verkleind na inzage in dezelfde evaluatieresultaten, is de formele verzameling afhankelijk van die niet-gerapporteerde selectie en weerspiegelt ze niet de volledige zoektocht.

Zet gemeenschappelijke prognoses om in gepaarde verliesverschillen

Laat \(y_{t+h}\) het gerealiseerde doel zijn voor een prognose vanaf oorsprong \(t\), en \(\hat y_{i,t+h|t}\) de prognose van kandidaat \(i\). Bereken voor een vooraf gekozen verliesfunctie \(L\) één verlies per kandidaat en gemeenschappelijke oorsprong:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

Neem aan dat een lager verlies beter is. Definieer voor kandidaten \(i\) en \(j\) het gepaarde verschil:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

Hier is \(P\) het aantal gemeenschappelijke prognoseoorsprongen. Met deze tekenconventie betekent een positieve \(\bar d_{ij}\) dat kandidaat \(i\) in de steekproef een hoger gemiddeld verlies had dan \(j\); een negatieve waarde is gunstig voor \(i\). Koppeling is belangrijk omdat beide kandidaten dezelfde gerealiseerde uitkomsten voorspellen. Gemeenschappelijke marktschokken kunnen beide verliezen verhogen, terwijl het verschil de relatieve prestatie isoleert.

De nulhypothese van gelijke voorspelkracht voor de huidige verzameling \(\mathcal M\) luidt:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{voor alle } i,j\in\mathcal M \]

Dit is een gezamenlijke uitspraak over de huidige verzameling, geen bundel losse paargewijze toetsen die je één voor één bekijkt. Het oorspronkelijke MCS-kader gebruikt een gezamenlijke equivalentietoets en eliminatieregel om de vergelijking van modellen te beheersen. Het vraagt niet of de prognoses op elke datum exact gelijk zijn.

Toets de huidige verzameling en bepaal de eliminatieregel

De MCS wisselt een toets op verzamelniveau af met een eliminatiestap. Begin met \(\mathcal M=\mathcal M_0\) en toets gelijke voorspelkracht op het gekozen niveau \(\alpha\). Als de nulhypothese niet wordt verworpen, stop je en rapporteer je de huidige verzameling. Bij verwerping verwijdert een vooraf vastgelegde regel één kandidaat en herhaal je de toets op de kleinere verzameling. Onder de aannames van de procedure vormen de overblijvers de \((1-\alpha)\)-MCS.

Het artikel behandelt twee bekende statistieken. De rangestatistiek zoekt het grootste gestandaardiseerde paargewijze verliesverschil:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

De bijbehorende eliminatieregel verwijdert de kandidaat met het grootste gestandaardiseerde nadeel ten opzichte van een andere kandidaat. Een tweede statistiek vergelijkt elke kandidaat met de gemiddelde prestatie van de huidige verzameling:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

Hier standaardiseert \(t_{i\cdot}\) het gemiddelde van \(d_{i\cdot,t}\); de bijbehorende regel verwijdert de kandidaat met het grootste gestandaardiseerde extra verlies ten opzichte van het groepsgemiddelde. Statistiek en eliminatieregel horen bij elkaar. Kies en rapporteer ze als één procedure; meng ze niet nadat je hebt gezien welke de kleinste verzameling oplevert. De MCS-publicatie licht toe waarom de verwerpingstoets moet passen bij de regel die de te verwijderen kandidaat aanwijst (Hansen, Lunde en Nason).

Behoud tijdsafhankelijkheid in de bootstrap

De verdeling van een maximumstatistiek hangt af van de gezamenlijke variatie in verliesverschillen van de kandidaten. Elke datum of elk model als onafhankelijk behandelen kan beide soorten afhankelijkheid verbreken: opeenvolgende verliezen kunnen serieel samenhangen en verliezen van twee kandidaten op dezelfde datum zijn gekoppeld. De MCS-bootstrap moet daarom de relevante gezamenlijke tijdreeksstructuur behouden bij het benaderen van de nulverdeling van de statistiek op verzamelniveau.

Een aanpak trekt uitgelijnde tijdblokken van de vector met kandidaatverliezen of verschillen opnieuw. Bij de stationary bootstrap zijn bloklengtes willekeurig en kan de hersamengestelde reeks opnieuw beginnen op een willekeurig gekozen datum. Politis en Romano introduceerden deze methode voor zwak afhankelijke stationaire observaties (artikel uit 1994). De MCS-auteurs beschrijven block-bootstrap-implementaties en noemen de stationary bootstrap als alternatief. Elke modelreeks afzonderlijk resamplen verbreekt de koppeling op dezelfde datum en kan de vergelijking veranderen.

De gemiddelde bloklengte, bootstrapvariant, centrering onder de nul van gelijke voorspelkracht, het aantal replicaties en de prognosehorizon beïnvloeden allemaal de onzekerheidsschatting. Langere overlappende horizons veroorzaken vaak langere afhankelijkheid in verliesverschillen, maar er bestaat geen universele bloklengte voor elk doel en elke steekproef. Licht de opzet toe en controleer of de conclusie verandert bij redelijke afhankelijkheidsinstellingen. De bootstrap is een benadering onder aannames, geen oplossing voor look-ahead, een hergebruikte holdout, niet-stationaire scores of een onvolledige kandidatenfamilie.

Reken een hypothetische vergelijking van vier modellen door

Stel dat vier procedures A, B, C en D hetzelfde volatiliteitsdoel voorspellen op 120 gemeenschappelijke dagelijkse oorsprongen. Hun gemiddelde kwadratische verliezen zijn 1,20, 1,23, 1,45 en 1,90, in illustratieve eenheden van procentpunt kwadraat. Die gemiddelden zetten A bovenaan en D onderaan, maar een ranglijst zegt niets over steekproefonzekerheid.

Voor A tegenover B is het gemiddelde gepaarde verliesverschil \(1.20-1.23=-0.03\). Als de standaardfout die rekening houdt met afhankelijkheid \(0.04\) is, bedraagt de paarstatistiek \(-0.03/0.04=-0.75\). Dit enkele verschil toont geen duidelijk statistisch verschil tussen A en B. De MCS stopt daar niet: de statistiek op verzamelniveau gebruikt de gezamenlijke verschillen tussen alle vier kandidaten.

Neem ter illustratie aan dat een block-bootstrap-MCS op de volledige verliesreeks van 120 oorsprongen \(T_R\), \(\alpha=0.05\) en een coherente regel voor eliminatie van de zwakste kandidaat gebruikt. Stel dat de p-waarde voor de volledige groep 0.018 is, D wordt verwijderd en de p-waarde voor \(\{A,B,C\}\) daarna 0.11 is. Omdat 0.11 groter is dan 0.05, stopt de procedure met \(\{A,B,C\}\) als hypothetische 95%-MCS. C blijft staan hoewel het gemiddelde verlies hoger is dan dat van A: deze hypothetische gezamenlijke toets heeft niet aangetoond dat C inferieur is.

Deze p-waarden zijn verzonnen om de stappen uit te leggen; je kunt ze niet afleiden uit de vier gemiddelde verliezen of het verschil tussen A en B. Een echt resultaat vereist de volledige reeks verliezen per oorsprong, kandidaatprognoses, bootstrapopzet en eliminatievolgorde. Bewaar die input en rapporteer elke stap en de verwijderde kandidaat. <!-- learn:illustration -->

Verschillende voorspellingspaden blijven dicht bij elkaar binnen een zachte band, terwijl verder gelegen paden vervagen; er blijft een verzameling over in plaats van één winnaar
Conceptuele weergave van een voorspellingvergelijking die meerdere statistisch niet te onderscheiden kandidaten behoudt; geen waargenomen voorspellingen, empirische uitkomsten of handelssignaal.

Interpreteer de overblijvende verzameling zonder te overdrijven

Bij een betrouwbaarheidsniveau van 95% is de MCS onder de regulariteitsvoorwaarden en toetsingsaannames ontworpen om de beste kandidaat in de opgegeven verzameling met ten minste de genoemde asymptotische dekking te bevatten. Dat betekent niet dat elk behouden model 95% kans heeft om het beste te zijn. De betrouwbaarheidsuitspraak gaat over dekking bij herhaalde steekproeven, niet over een posteriorverdeling van modelnamen.

Gelijke voorspelkracht niet verwerpen bewijst niet dat de verwachte verliezen exact gelijk zijn. De toets kan weinig onderscheidingsvermogen hebben bij een korte evaluatieperiode, sterk wisselende verliesverschillen of meerdere bijna gelijke kandidaten. Een grote overblijvende verzameling kan eerlijk laten zien dat de data de alternatieven niet scheiden. Ze kan ook modellen bevatten die allemaal absoluut slecht zijn, want MCS vergelijkt kandidaten onderling en niet met een verplicht extern niveau.

De verzameling wordt begrensd door wat in \(\mathcal M_0\) zit. Een betere prognoseprocedure die ontbreekt kan de MCS niet ontdekken. Als een model vooraf is verwijderd na inzage in dezelfde evaluatieperiode, houdt de nominale dekking geen rekening met die niet-geregistreerde zoektocht. Vermeld hoe kandidaten zijn gegenereerd en gefilterd. Als meerdere kandidaten hetzelfde beste verwachte verlies hebben, past het behouden van meer dan één bij de methode.

Onderscheid MCS van paarsgewijze en benchmarktoetsen

De Diebold–Mariano-toets richt zich op het gepaarde verliesverschil van twee prognoseprocedures. MCS toetst herhaaldelijk een verzameling en rapporteert welke kandidaten de gezamenlijke eliminatieprocedure overleven. Veel DM-toetsen uitvoeren en niet-significante paren behouden is niet automatisch gelijkwaardig aan MCS; de gezamenlijke bootstrap en coherente eliminatieregel zijn van belang.

De Clark–West-toets behandelt een beperktere vergelijking van kwadratische fouten wanneer een model een beperkt benchmarkmodel omvat en schattingsruis het ruwe verschil beïnvloedt. MCS vereist geen geneste kandidaten en kan een zelfgekozen verliesfunctie gebruiken, maar wel een gemeenschappelijk prognoseontwerp.

White’s Reality Check en Hansen’s Superior Predictive Ability-toets vragen of minstens één kandidaat uit een doorzochte familie een aangewezen benchmark verslaat. MCS is benchmarkvrij en beschrijft een verzameling relatief sterke kandidaten. Alle procedures vereisen een getrouwe beschrijving van de zoektocht en afhankelijkheid, maar toetsen verschillende nulhypothesen. Zie de gids over Reality Check en SPA en de oorspronkelijke artikelen van White (2000) en Hansen (2005).

Rapporteer de opzet en scheid prognoserangschikking van handelswaarde

Een reproduceerbaar MCS-rapport noemt elke kandidaatprocedure, het gemeenschappelijke doel en de horizon, regels voor prognoseoorsprong en informatie, schattingsschema, evaluatiedata, verwerking van ontbrekende gegevens, verliesformule en de voorkeursrichting. Vermeld significantieniveau, toetsingsstatistiek en eliminatieregel, bootstraptype, bloklengte, centrering, replicaties, p-waarden per stap en de uiteindelijke leden. Gemiddelde verliezen geven context, maar vervangen de gezamenlijke inferentie niet door een ranglijst.

Beschrijf bij volatiliteit hoe de waargenomen proxy is gemaakt en of die ruisachtig of herzien is. Maak bij meerstapsprognoses overlap tussen doelvensters en de afhankelijkheidsmethode duidelijk. Toon gevoeligheid voor redelijke veranderingen in verliesfunctie, steekproefperiode en bootstrapinstellingen wanneer die de verzameling beïnvloeden. Een kleine p-waarde zonder verwijderde kandidaten en proceduregegevens is niet genoeg om het resultaat te reproduceren.

MCS rangschikt prognoseprocedures voor één criterium. Het stelt geen causaliteit vast, identificeert niet het datagenererende model en bewijst niet dat overblijvende prognoses een winstgevende transactie opleveren. Een prognose omzetten in een positie vraagt om drempels, omvang, omzet, uitvoeringstijd, spread, kosten, slippage, financiering, lenen en risicobeperkingen. Evalueer die vaste beslisregel afzonderlijk op geschikte latere data en rapporteer netto handelsresultaten apart. Voor volatiliteitsscores met onvolmaakte proxies, zie de gids QLIKE versus kwadratische fout.

Veelgestelde vragen

Q1Kiest MCS één beste model?

Niet noodzakelijk. Er kan één kandidaat overblijven als het bewijs die onderscheidt, of er kunnen meerdere blijven als de steekproef niet aantoont welke inferieur is. Eén kandidaat kiezen voor inzet vereist een aparte beslisregel.

Q2Heeft een model in de MCS 95% kans om correct te zijn?

Nee. Het betrouwbaarheidsniveau beschrijft onder de aannames van de methode de dekking van de beste kandidaat in de opgegeven familie bij herhaalde steekproeven. Het is geen posterior kans dat een model waar is.

Q3Kan ik MCS ook voor andere prognoses dan volatiliteit gebruiken?

Ja. De methode kan prognoses, econometrische modellen of andere kandidaten vergelijken als er een zinvol gemeenschappelijk criterium en passende steekproefopzet zijn. De uitkomst blijft afhangen van kandidatenverzameling en verliesfunctie.

Q4Neemt MCS automatisch elk model mee dat ik heb geprobeerd?

Alleen als de werkelijke zoektocht is opgenomen in kandidatenfamilie en evaluatieprocedure. Niet-geregistreerde selectie of herhaald gebruik van evaluatiedata wordt niet opgelost door achteraf MCS uit te voeren.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat rapporteert de Model Confidence Set?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst

Heldere definities van belangrijke optiebegrippen, van calls, puts en optieketens tot IV, Greeks, open interest en max pain

Bekijk de optiewoordenlijst
Vergelijk twee voorspellingen aan de hand van hun verlies op dezelfde uitkomstenDe Diebold–Mariano-toets: voorspellingsnauwkeurigheid vergelijkenLees wat de Diebold–Mariano-toets vergelijkt, hoe verliesverschillen en seriële correlatie de statistiek beïnvloeden, en waarom voorspellingsnauwkeurigheid geen handelswinst is.Vergelijking van geneste voorspellingenDe Clark–West-toets voor geneste voorspellingen: formule, voorbeeld en beperkingenLees waarom geneste voorspellingsmodellen een aangepaste MSPE-vergelijking nodig hebben, hoe de Clark–West-statistiek werkt en wat een eenzijdige uitkomst wel en niet kan aantonen.Twee bootstraptoetsen voor een hele familie handelsregelsWhite Reality Check en Hansen SPA voor handelsregelsLees hoe Reality Check en Hansen SPA een volledige verzameling technische handelsregels met een benchmark vergelijken, hoe hun nulverdelingen verschillen en wat een globale p-waarde wel en niet zegt.Volatiliteitsprognoses beoordelenQLIKE en kwadratische fout voor volatiliteitsprognoses: ruis in proxy’sVergelijk QLIKE en kwadratische fout voor variantieprognoses, bekijk een voorbeeld waarin de rangorde omkeert en lees wanneer ruis in een gerealiseerde-variantieproxy de verwachte rangorde behoudtPrognose-evaluatieMincer–Zarnowitz-regressie: toets prognosebias en kalibratieLees hoe de Mincer–Zarnowitz-regressie het intercept en de schaal van een prognose toetst, waarom nul gemiddelde fout niet hetzelfde is als kalibratie en wat de toets niet bewijst