Voorspellingen combineren: gelijke of geschatte gewichten
Leer hoe combinaties van voorspellingen modeluitkomsten mengen, waarom gelijke gewichten geschatte gewichten kunnen verslaan en hoe je resultaten zonder look-ahead bias toetst
In deze gidsWat een combinatie van voorspellingen betekent
Korte samenvatting
Een combinatie van voorspellingen voegt voorspellingen voor hetzelfde doel en dezelfde horizon samen. Gelijke gewichten vormen een transparante basis; gewichten die uit eerdere voorspellingsfouten zijn geschat kunnen verschillen tussen modellen opvangen, maar schattingsruis kan ze buiten de steekproef instabiel maken
Wat een combinatie van voorspellingen betekent
Een combinatie van voorspellingen neemt twee of meer verwachtingen voor dezelfde grootheid en maakt daar één voorspelling van. Als modellen A, B en C elk de gerealiseerde variantie van morgen voorspellen, kun je hun uitkomsten middelen of verschillende gewichten geven. Het gecombineerde getal is een nieuwe voorspelling, geen stemming over welk model gelijk heeft.
De inputs moeten betrekking hebben op hetzelfde doel, voorspellingsmoment, dezelfde horizon, eenheden en informatiedeadline. Een variantievoorspelling voor één dag kun je niet rechtstreeks middelen met een volatiliteitsvoorspelling voor een maand, alleen omdat beide volatiliteit heten. Bepaal eerst een gemeenschappelijke grootheid en periode en lijn daarna de voorspellingen uit.
Combineren kan nuttig zijn als meerdere aannemelijke modellen verschillende kenmerken van een reeks vastleggen of als onduidelijk is welk model het sterkst blijft. De voorspellingen hoeven niet uit totaal verschillende algoritmen te komen. Voor de combinatie telt hoe hun fouten samen bewegen, niet hoe verschillend hun namen klinken.
In hun oorspronkelijke toepassing lieten Bates en Granger met een voorbeeld over luchtvaartpassagiers zien dat een samengestelde voorspelling een lagere gemiddelde kwadratische fout kon hebben dan beide afzonderlijke voorspellingen. Dat is een reden om combinaties te toetsen, geen garantie op verbetering voor een andere markt, doelgrootheid, periode of verliesfunctie (Bates en Granger, 1969).
Begin met een benchmark met gelijke gewichten
Voor \(K\) voorspellingen is de combinatie met gelijke gewichten
\[ \widehat{y}_{t+h\mid t}^{\,EW} = \frac{1}{K}\sum_{k=1}^{K}\widehat{y}_{k,t+h\mid t} \]
Elke component telt even zwaar mee. Voor deze regel is geen trainingssteekproef nodig om gewichten te schatten en de berekening is eenvoudig te reproduceren. Ook als de uiteindelijke methode gewichten schat of begrenst, is dit een bruikbare benchmark.
Gelijke gewichten betekenen niet dat alle voorspellingen even nauwkeurig, onafhankelijk of economisch belangrijk zijn. Het betekent alleen dat de combinatiemethode geen afzonderlijke gewichten uit eerdere prestaties schat. Als alle inputs dezelfde factor missen, kan de combinatie nog steeds die gedeelde vertekening bevatten.
Het aantal modelnamen zegt niets over de diversiteit van de informatie. Drie volatiliteitsmodellen kunnen dezelfde rendementsreeks, sessiegrens en steekproefinterval gebruiken en allemaal dezelfde nachtelijke beweging missen. Middelen lost die omissie niet automatisch op. Controleer of gearchiveerde out-of-sample fouten op een nuttige manier verschillen; neem niet aan dat verschillende namen onafhankelijke informatie opleveren.
Stel dat drie modellen de volatiliteit van de volgende sessie op 12, 15 en 20 basispunten schatten. De voorspelling met gelijke gewichten is \((12+15+20)/3 = 15,67\) basispunten. Dit rekensommetje laat zien hoe de combinatie ontstaat; met één voorspellingsmoment kun je niet bepalen of de regel nauwkeurig of winstgevend is.
Controleer bij volatiliteit of de input variantie of standaarddeviatie is. Het gemiddelde van drie variantievoorspellingen, waarna je de wortel trekt, is doorgaans niet hetzelfde als het gemiddelde van drie standaarddeviatievoorspellingen. Gebruik dezelfde definitie en eenheden als bij de latere beoordeling.
Schat gewichten uit eerdere voorspellingsfouten
Een geschatte lineaire combinatie kan zo worden geschreven:
\[ \widehat{y}_{t+h\mid t}^{\,C} = \sum_{k=1}^{K} w_k \widehat{y}_{k,t+h\mid t} \]
Een gangbaar theoretisch resultaat veronderstelt dat elke voorspellingsfout gemiddeld nul is, de voorspellingen hetzelfde doel hebben en de gewichten optellen tot één. Noem \(\Sigma_e\) de covariantiematrix van de fouten van de componentvoorspellingen. Als die matrix bekend en inverteerbaar was, zouden de gewichten met minimale variantie onder deze beperkingen zijn:
\[ w^{*} = \frac{\Sigma_e^{-1}\mathbf{1}}{\mathbf{1}'\Sigma_e^{-1}\mathbf{1}} \]
Deze formule is een referentiepunt, geen opdracht om een ruisachtige steekproefcovariantiematrix te inverteren. In de praktijk schat je \(\Sigma_e\) uit een eindig archief met voorspellingsfouten. Sterk gecorreleerde inputs kunnen de schatting bijna singulier maken, zodat kleine wijzigingen in de gegevens grote verschillen in gewichten veroorzaken.
Bij twee voorspellingen met dezelfde foutvariantie \(\sigma^2\) is de variantie van hun gemiddelde met gelijke gewichten \(\sigma^2(1+\rho)/2\), waarbij \(\rho\) de correlatie tussen de fouten is. Als beide fouten variantie 4 hebben en de correlatie nul is, heeft het gemiddelde variantie 2. Bij een correlatie van 0,90 is de variantie 3,8. De afhankelijkheid tussen de fouten, niet de modelnamen, bepaalt hoeveel variantie middelen kan wegnemen. Deze berekening gaat over foutvariantie; als de componentvoorspellingen vertekend zijn, bevat hun gemiddelde kwadratische fout ook de gekwadrateerde vertekening.
Een andere aanpak regresseert de gerealiseerde doelgrootheid op gearchiveerde componentvoorspellingen, vaak met een intercept. Granger en Ramanathan bespreken lineaire regressiemethoden waarbij de gewichten niet tot één hoeven op te tellen. Een intercept en onbegrensde gewichten kunnen de gemiddelde vertekening in een trainingssteekproef corrigeren, maar veranderen de interpretatie: de coëfficiënten zijn geschatte aanpassingen van de voorspelling, niet noodzakelijk aandelen zoals in een portefeuille (Granger en Ramanathan, 1984).
Leg beperkingen vast voordat je de uitkomst beoordeelt. Niet-negatieve gewichten die optellen tot één vormen een convex gemiddelde binnen het minimum en maximum van de componentvoorspellingen. Negatieve gewichten of een intercept kunnen uitkomsten buiten dat bereik opleveren. Dat kan passend zijn voor een gekalibreerde voorspelling, maar niet als de doelgrootheid, zoals variantie, niet-negatief moet blijven.
Reken één combinatie uit
Stel dat drie modellen hetzelfde doel voor de volgende sessie voorspellen op 12, 15 en 20 basispunten. Een gewichtsregel die op eerdere voorspellingsmomenten is geschat, kent gewichten \(0.50\), \(0.30\) en \(0.20\) toe. De combinatie wordt dan
\[ 0.50(12) + 0.30(15) + 0.20(20) = 14.5\ \text{basispunten} \]
De gewichten zijn niet-negatief en tellen op tot één, dus dit is een convexe combinatie. De uitkomst ligt tussen de componentvoorspellingen. Het verschil met de voorspelling van 15,67 basispunten met gelijke gewichten komt door de gekozen gewichten; het toont niet aan dat de gewogen voorspelling beter is.
De gewichten mogen alleen zijn geschat uit voorspellingsfouten waarvan de uitkomsten op dat moment al bekend waren. In een historische backtest mag de voorspelling van 14,5 basispunten op moment \(t\) informatie gebruiken die uiterlijk op \(t\) beschikbaar was, niet de gerealiseerde doelwaarde op \(t+1\) of later.
Zodra het doel waarneembaar wordt, leg je de componentvoorspellingen, de combinatie, de gerealiseerde proxy en het evaluatieverlies vast. Door dat op latere voorspellingsmomenten te herhalen, kun je regels op dezelfde datums vergelijken. Eén uitgewerkt voorbeeld wordt daarmee nog geen bewijs voor een blijvend voordeel.
Waarom geschatte gewichten kunnen tegenvallen
De gewichten die optimaal zijn bij bekende populatiecovarianties van fouten zijn niet hetzelfde als gewichten die uit een korte steekproef zijn geschat. Geschatte gewichten voegen een extra onzekerheidslaag toe. Als componentvoorspellingen sterk op elkaar lijken, kunnen hun fouten hoog gecorreleerd zijn en kan de optimalisatie kleine historische verschillen uitbuiten die niet blijven bestaan.
Kangs simulaties en toepassing op macro-economische voorspellingen lieten zien dat combinatiegewichten instabiel kunnen zijn en dat een eenvoudig gemiddelde in die situaties in de praktijk beter kan presteren (Kang, 1986). De bespreking van Timmermann beschrijft hoe schattingsfouten, modelinstabiliteit en afhankelijkheid tussen fouten voorspellingcombinaties beïnvloeden (Timmermann, 200601004-9)).
Latere analyses van de voorspellingscombinatiepuzzel benadrukken hetzelfde punt voor eindige steekproeven: resultaten met vaste ‘optimale’ gewichten hoeven niet ongewijzigd stand te houden wanneer die gewichten zelf worden geschat (Claeskens et al., 2016). Dat bewijst niet dat gelijke gewichten altijd winnen. Het verklaart waarom een complexere regel haar plaats met een out-of-sample vergelijking moet verdienen.
<!-- learn:illustration -->
Mogelijke reacties zijn beginnen met gelijke gewichten, het aantal inputs beperken, geschatte gewichten naar gelijke aandelen toe trekken of een eenvoudige beperking opleggen. Elke keuze is een afweging tussen flexibiliteit en schattingsruis. Kies op basis van trainingsgegevens en rapporteer de regel; selecteer niet de aantrekkelijkste variant nadat je de uiteindelijke testperiode hebt bekeken.

Bouw een archief met realtime voorspellingen
Elke gearchiveerde componentvoorspelling moet op het vermelde voorspellingsmoment gemaakt kunnen zijn. Reconstrueer elk model met alleen de gegevens die toen beschikbaar waren, bewaar het tijdstip van de voorspelling en sla de modelversie en doeldefinitie op. In-sample aanpassingen vervangen geen echte historische voorspellingen, omdat het model observaties kan hebben gebruikt die toen nog niet bekend waren.
Lijn het archief uit op doel en voorspellingsmoment. In elke rij moeten de componentvoorspellingen hetzelfde toekomstige interval betreffen en moet de trainingsinformatie op hetzelfde beslismoment stoppen. Verwijder ontbrekende voorspellingen of handel ze expliciet af voordat je de combinatie schat. Als het aantal inputs ongemerkt verandert, kan ook de betekenis van de gewichten van datum tot datum veranderen.
Houd de schatting van gewichten gescheiden van de uiteindelijke evaluatie. Een procedure met rollende oorsprong kan gewichten schatten met voorspellingen waarvan de uitkomsten vóór \(t\) bekend waren, de combinatie op \(t\) uitgeven en die scoren wanneer het doel waarneembaar is. Een uitbreidend venster gebruikt alle geschikte eerdere voorspellingsmomenten; een rollend venster vergeet oudere momenten volgens een vooraf gekozen lengte. Beide reageren anders als prestaties veranderen.
Als componentmodellen, transformaties, voorspellingshorizons, gewichtsbeperkingen of verliesfuncties zijn gekozen nadat je een holdoutperiode hebt bekeken, is die periode onderdeel van modelontwikkeling geworden. Reserveer een nieuwe testperiode of gebruik een geneste evaluatie waarbij alle selectiestappen binnen de trainingsgegevens blijven.
Vergelijk combinaties met één verliesmaat
Vergelijk de regel met gelijke gewichten, eventuele geschatte of naar elkaar toe getrokken gewichten en de afzonderlijke voorspellingen op dezelfde voorspellingsmomenten en ten opzichte van hetzelfde gerealiseerde doel. Rapporteer het evaluatieverlies en de gemeenschappelijke steekproef. Anders kan een methode sterker lijken doordat ze op eenvoudigere datums of een andere doeldefinitie is beoordeeld.
De verliesmaat moet passen bij de doelgrootheid en de vraag. Kwadratische fout straft afstand met een kwadratisch gewicht; absolute fout behandelt grote afwijkingen anders. Bij volatiliteitsvoorspellingen die worden beoordeeld tegen ruisachtige gerealiseerde maten zijn de proxyvoorwaarden en gekozen verliesmaat van belang. De gids over QLIKE en kwadratische fout licht die verschillen toe. Kies de verliesmaat niet nadat je hebt gezien welke methode ermee wordt bevoordeeld.
Een toets voor voorspellingsvergelijking kan helpen beoordelen of waargenomen verschillen in verlies verenigbaar zijn met steekproefvariatie. De gids over de Diebold–Mariano-toets behandelt gepaarde vergelijkingen en aannames die van belang zijn als voorspellingsfouten overlappen of afhankelijk blijven. Een toetsresultaat herstelt geen look-ahead bias en bewijst geen economische waarde.
Als je veel combinaties van componenten, gewichtsbeperkingen of verliesregels hebt geprobeerd en de best ogende versie uit dezelfde evaluatieperiode hebt behouden, weerspiegelt de vergelijking ook die zoektocht. De gids over de White Reality Check en de gids over de kans op backtest-overfitting behandelen selectie tussen veel handelsregels. Geen van beide vervangt een schoon voorspellingarchief of een vooraf opgesteld evaluatieplan.
Gebruik een validatieopzet die de beoogde horizon weerspiegelt. Als dagelijkse voorspellingsmomenten overlappende doelen voor meerdere dagen voorspellen, kunnen opeenvolgende verliezen afhankelijk zijn. Houd daar bij de onzekerheid rekening mee en behandel veel overlappende rijen niet als evenveel onafhankelijke experimenten.
Laat de combinatie aansluiten op de beslissing
Controleer vóór het combineren wat elk model voorspelt. Een conditioneel gemiddelde, een variantie, een kwantiel en een volledige kansverdeling zijn verschillende voorspellingstypen. Een lineair gemiddelde van puntschattingen levert niet automatisch een gekalibreerde dichtheid of betrouwbare schatting van het staart risico op.
Controleer gecombineerde waarden voordat je ze gebruikt voor grootheden die strikt niet-negatief moeten zijn, zoals variantie. Een convex gemiddelde van niet-negatieve voorspellingen blijft niet-negatief; een geschatte regressie met negatieve gewichten of een intercept mogelijk niet. Negatieve waarden op nul afkappen verandert de voorspellingsregel en moet vóór evaluatie worden vastgelegd.
Ook het aantal voorspellingen telt. Zwakke of bijna dubbele inputs toevoegen kan het aantal geschatte gewichten verhogen zonder veel nieuwe informatie op te leveren. Als het historische archief kort is in verhouding tot \(K\), kies dan liever een transparante regel met weinig dimensies en laat zien dat de conclusie niet op één component leunt.
Modelvoorspellingen combineren is iets anders dan handelsposities combineren. Een lager statistisch verlies toont niet aan dat een strategie met die voorspelling meer verdient na commissies, spread, slippage, marktimpact en risicolimieten. Voor de voorspelling en voor de handelsregel die haar gebruikt is afzonderlijk out-of-sample bewijs nodig.
Rapporteer genoeg om het resultaat te reproduceren
Een bruikbaar rapport noemt het voorspellingsdoel, de horizon, eenheden, componentmodellen, tijdstippen van voorspellingen, archiefperiode en regel voor ontbrekende gegevens. Vermeld of de gewichten gelijk, geschat, begrensd, naar elkaar toe getrokken of tijdsvariërend zijn en hoe elke afstelkeuze is gemaakt.
Toon de resultaten voor de benchmark met gelijke gewichten, de gekozen combinatie en de sterkste afzonderlijke voorspelling op dezelfde evaluatiedatums. Vermeld de verliesfunctie, methode voor onzekerheid en behandeling van overlappende uitkomsten. Als gewichten sterk veranderen tussen vensters, laat die instabiliteit zien in plaats van alleen hun eindwaarden te tonen.
Maak ten slotte onderscheid tussen de empirische conclusie en de beslissing. “Deze combinatie had in deze steekproef onder deze verliesfunctie een lager gemiddeld verlies” is specifieker en beter reproduceerbaar dan “voorspellingen combineren verbetert de handel”. De eerste uitspraak kun je met een opgeslagen voorspellingarchief toetsen; de tweede vereist een strategie, aannames over uitvoering en afzonderlijk bewijs.
Veelgestelde vragen
Q1Is een combinatie met gelijke gewichten altijd beter dan één model?
Nee. Het is een nuttige benchmark waarvoor geen gewichten hoeven te worden geschat, maar de nauwkeurigheid hangt af van de componentvoorspellingen en het doel. Vergelijk haar met elke afzonderlijke voorspelling op dezelfde out-of-sample datums.
Q2Moeten voorspellingsgewichten altijd optellen tot één?
Nee. Een begrensd gewogen gemiddelde legt die regel vaak op zodat de uitkomst als convexe combinatie kan worden geïnterpreteerd. Een regressie met intercept kan een ander soort aanpassing schatten; vermeld de gekozen specificatie en de gevolgen daarvan.
Q3Kan ik combinatiegewichten schatten uit in-sample aangepaste waarden?
Dat kan een onrealistisch archief opleveren, omdat de onderliggende modellen informatie kunnen hebben gebruikt die op historische momenten nog niet beschikbaar was. Gebruik bij voorkeur echte voorspellingen met rollende oorsprong, gemaakt met alleen gegevens die toen beschikbaar waren.
Q4Bewijst een nauwkeurigere combinatie een handelsvoordeel?
Nee. Voorspellingsnauwkeurigheid is een statistisch resultaat voor een bepaald doel, een proxy, een steekproef en een verliesmaat. Een handelsclaim vereist ook een vastgelegde strategie, uitvoeringskosten, risicobeperkingen en een aparte out-of-sample evaluatie. Primair onderzoek - Bates en Granger (1969), “The Combination of Forecasts,” *Journal of the Operational Research Society*, 20(4), 451–468. - Granger en Ramanathan (1984), “Improved Methods of Combining Forecasts,” *Journal of Forecasting*, 3(2), 197–204. - Kang (1986), “Unstable Weights in the Combination of Forecasts,” *Management Science*, 32(6), 683–695. - Timmermann (2006), “Forecast Combinations,” *Handbook of Economic Forecasting*, 1, 135–196.01004-9) - Claeskens, Magnus, Vasnev en Wang (2016), “The Forecast Combination Puzzle: A Simple Theoretical Explanation,” *International Journal of Forecasting*, 32(3), 754–762.
Bronnen en verder lezen
Probleem melden
We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt
Snelle check
De gids gelezen? Test jezelf met 3 vragen
Vraag 01
Wat moet je gelijk trekken voordat je twee modelvoorspellingen combineert?
Kies een antwoord om de uitleg te zien