Skip to content
Alle optiegidsen
Voorspellingen beoordelen10 minuten leestijd

De forecast-encompassingtoets: bevat de ene voorspelling informatie uit de andere?

Lees of een concurrerende voorspelling lineaire informatie toevoegt aan de referentievoorspelling en wat u controleert bij een encompassingtoets en evaluatie buiten de steekproef

In deze gidsWelke vraag stelt de encompassingtoets?

Korte samenvatting

De forecast-encompassingtoets vraagt of concurrerende voorspelling B informatie toevoegt die ontbreekt in referentievoorspelling A. De toets rangschikt voorspellingen niet alleen op RMSE. De uitkomst hangt af van de uitlijning, de toegestane combinatie en de aannames voor de inferentie.

Welke vraag stelt de encompassingtoets?

Stel dat A en B hetzelfde doel voorspellen. De toets vraagt of B dat doel beter helpt verklaren nadat rekening is gehouden met de informatie in A. Bij een vooraf bepaalde lineaire combinatie houdt de nulhypothese dat A B omvat in dat B geen aanvullende voorspellende informatie levert. Verwerping kan erop wijzen dat B in die specificatie wel informatie toevoegt.

Dit is niet hetzelfde als vragen: “Welke voorspelling had in deze steekproef de laagste RMSE?” De RMSE vat de omvang van de fout per voorspelling afzonderlijk samen. Encompassing onderzoekt of de ene voorspelling, of haar fout, aanvullende informatie bevat gegeven de andere voorspelling. B kan een lagere RMSE hebben maar niets toevoegen aan A; omgekeerd kan B ondanks een hogere RMSE in een bepaalde richting aanvullende informatie bevatten.

Chong en Hendry bespreken het encompassingperspectief bij de beoordeling van lineaire macro-economische modellen. De conclusie blijft beperkt tot het gekozen doel, de horizon, de informatieverzameling en de modelspecificatie. Ze bewijst niet dat A in elke betekenis juist is (Chong en Hendry, 1986). {source:chongHendry1986ForecastEncompassing}

Encompassing en een RMSE-rangschikking kunnen verschillen

RMSE is de wortel van de gemiddelde kwadratische fout (MSE) van een voorspelling. De laagste RMSE betekent een lagere gemiddelde kwadratische fout voor dat doel, die periode, steekproef en maatstaf. De encompassingtoets kijkt naar de relatie tussen voorspellingen. Zelfs als de datums overeenkomen, hoeven de uitkomsten niet hetzelfde te zijn.

Een paar grote fouten van B kunnen de RMSE verhogen, terwijl de richting van het verschil tussen B en A nog steeds informatie bevat die samenhangt met de fout van A. Omgekeerd bewijst een lagere RMSE voor B niet dat B informatie toevoegt bovenop A. Rapporteer de individuele nauwkeurigheid apart van de uitkomsten voor combinatie en encompassing.

Houd ook de vragen van verwante toetsen uit elkaar. De Diebold–Mariano-toets vergelijkt gemiddelde verliezen volgens een gekozen verliesfunctie. De Clark–West-toets corrigeert de vergelijking van MSPE buiten de steekproef voor geneste modellen. De uitleg over voorspellingen combineren gaat over middelen en geschatte gewichten. De Mincer–Zarnowitz-toets beoordeelt de kalibratie van intercept en helling. Hun hypothesen en vragen verschillen.

Maak onderscheid tussen niet-geneste voorspellingen en geneste modellen

Onder de nulhypothese kunnen de foutcorrelatie en de structuur van schattingsfouten verschillen tussen concurrerende niet-geneste voorspellingen en de situatie waarin een groot model een beperkt model omvat. Een OLS-statistiek of referentieverdeling die in de ene situatie passend is, kan niet automatisch naar de andere worden overgezet.

Harvey, Leybourne en Newbold wijzen erop dat de nulverdeling van de natuurlijke OLS-encompassingtoets niet robuust is tegen niet-normale voorspellingsfouten en bespreken alternatieven. Alleen OLS uitvoeren rechtvaardigt geen algemene p-waarde. Beschrijf de toetsprocedure, steekproefomvang, verdeling en afhankelijkheid van fouten, en de manier waarop voorspellingen zijn gemaakt (Harvey, Leybourne en Newbold, 1998). {source:harveyLeybourneNewbold1998ForecastEncompassing}

Clark en McCracken analyseren de niet-standaard asymptotische en eindige-steekproefeigenschappen van toetsen op gelijke nauwkeurigheid en encompassing voor het éénstapsontwerp buiten de steekproef met geneste lineaire modellen dat zij bestuderen. Dit geldt niet automatisch voor elk genest ontwerp of een niet-geneste vergelijking. Dat is geen automatische referentieverdeling voor een niet-geneste vergelijking; resultaten voor niet-geneste modellen horen evenmin zonder meer bij een geneste situatie (Clark en McCracken, 200100071-9)). {source:clarkMcCrackenNestedForecasts2001}

Als voorspellingen afhangen van geschatte regressiecoëfficiënten, komt schattingsonzekerheid in de vergelijking terecht. West behandelt encompassingtoetsen voor voorspellingen die afhangen van geschatte regressieparameters. Bewaar per voorspellingsmoment de schattingsprocedure en het trainingsvenster, niet alleen de uiteindelijke voorspellingenreeks (West, 2001). {source:west2001EstimatedForecastsEncompassing}

Gebruik het verschil en de fout om de intuïtie te zien

Neem doel \(y_t\), met voorspellingen \(f_{A,t}\) en \(f_{B,t}\) voor dezelfde periode en met dezelfde informatie-cutoff. Definieer de fout van de referentievoorspelling en het verschil tussen de voorspellingen als volgt:

\[ e_{A,t}=y_t-f_{A,t}, \qquad d_t=f_{B,t}-f_{A,t} \]

Een eenvoudige combinatie is \(f_{C,t}=f_{A,t}+w d_t\). Bij \(w=0\) gebruikt u alleen A; bij \(w=1\) krijgt u B. Tussenliggende waarden mengen beide voorspellingen. Een gewicht buiten 0 en 1 extrapoleert voorbij een van de voorspellingen.

Intuïtief laat de helling uit een regressie van \(e_A\) op \(d\) zien of het verschil tussen B en A lineair samenhangt met de fout van A. Een helling die van nul afwijkt kan op aanvullende informatie wijzen onder de gekozen procedure en aannames. Dit is een intuïtie, geen universele statistiek of kritieke waarde die in iedere toepassing hetzelfde is.

In een regressie met constante, \(e_{A,t}=a+w d_t+u_t\), hangt \(a\) samen met een correctie voor de gemiddelde fout en is \(w\) de helling ten opzichte van het voorspellingsverschil. Als de constante ook in de gecombineerde voorspelling wordt toegepast, luidt de correctie \(f_A+a+w d\). Zonder constante kan de schatting anders zijn. Controleer de regressievergelijking in de betreffende studie of implementatie.

In de populatie is de helling van de regressie met intercept \(\beta=\operatorname{Cov}(e_A,d)/\operatorname{Var}(d)\). Als \(\operatorname{Var}(d)>0\), betekent \(\beta=0\) dat er na correctie van de gemiddelde fout met het intercept geen lineaire covariantie is; het betekent niet dat \(e_A\) en \(d\) onafhankelijk of conditioneel onafhankelijk zijn. Een regressie zonder intercept legt het ruwe moment \(E[e_A d]=0\) op. Dat is alleen gelijk aan nulcovariantie als \(E[e_A]=0\) of \(E[d]=0\), want \(\operatorname{Cov}(e_A,d)=E[e_A d]-E[e_A]E[d]\). Het weglaten van het intercept legt dus ook \(\alpha=0\) op: er is geen correctie voor gemiddelde vertekening

<!-- learn:illustration -->

Twee doorschijnende blauwe en terracottakleurige prognosepaden kruisen elkaar; een gecombineerd pad neemt elementen van beide over
Conceptuele vergelijking van gedeelde en aanvullende signalen in twee prognoses; geen waargenomen data en geen claim dat combineren altijd beter is

Bereken de helling met zes illustratieve waarnemingen

De onderstaande waarden zijn hypothetisch en staan allemaal in basispunten (bp). Gebruik \(d=f_B-f_A\), \(e_A=y-f_A\) en zes voorspellingsmomenten.

Voorspellingsmoment\(d\) (bp)\(e_A\) (bp)
1-4-1,6
2-2-1,2
3-11,5
410,5
521,3
641,5

OLS met constante geeft een gemiddelde fout \(\bar e_A=1/3\) bp. De som van de producten met het gecentreerde verschil is \(\sum d_t(e_{A,t}-\bar e_A)=16,4\), terwijl \(\sum d_t^2=42\). De helling is dus \(16,4/42\approx0,3905\). In dit kleine rekenvoorbeeld hangt een lineaire aanpassing die ongeveer 39% van het verschil met B toevoegt samen met de foutstructuur van A.

Als de constante onderdeel is van de combinatie, is de geschatte correctie \(1/3+0,3905d_t\). Ga er niet van uit dat het gewicht in een specificatie zonder constante hetzelfde is. Zes waarnemingen laten alleen de rekenstap zien; ze onderbouwen geen p-waarde, significantie, prestatie buiten de steekproef of generalisatie.

Leg intercept, informatieverzameling en beperkingen vast

Onvoorwaardelijke en conditionele encompassing beantwoorden verschillende vragen. Vermeld of de informatieverzameling alleen de twee voorspellingen bevat of ook toestandsvariabelen, zoals economische omstandigheden of volatiliteit. Controleer of iedere variabele op elk voorspellingsmoment beschikbaar was. Informatie toevoegen die pas later bekend werd, verandert de realtime-vraag.

Bepaal of het combinatiegewicht vrij is of bijvoorbeeld aan \(0\leq w\leq1\) is gebonden. Onbeperkte OLS kan gewichten buiten dat bereik opleveren. Dat is geen rekenfout: de specificatie staat extrapolatie toe in plaats van alleen een gemiddelde van de twee voorspellingen. Begrensde en onbegrensde combinaties zijn verschillende schattingsproblemen.

Kies vooraf ook of u vertekening met een constante corrigeert of variabelen centreert. Intercept, beperkingen of conditionerende variabelen aanpassen nadat u de uitkomsten hebt gezien, vermengt specificatiekeuze met inferentie. Rapporteer nulhypothese, combinatievergelijking, gebruikte informatie, schattingssteekproef en inferentieprocedure samen.

Bewaar een archief van voorspellingen buiten de steekproef

Controleer dat \(y_t\), \(f_A\) en \(f_B\) per rij hetzelfde doel, dezelfde horizon, eenheid, oorsprong en informatie-cutoff hebben. Een voorspelling van het maandrendement is niet vanzelf vergelijkbaar met een cumulatief rendement tot het einde van de volgende maand. Leg ook publicatievertragingen en revisies van het doel vast.

Elke voorspelling moet alleen gegevens gebruiken die op dat moment beschikbaar waren. Bewaar trainingsvenster, modelversie, herschattingsschema, transformaties en keuze van hyperparameters. Als voorspellingen afhangen van geschatte regressieparameters, controleer dan dat de schattingssteekproef de evaluatieperiode of toekomstige informatie niet omvat. In-sample fitted values vervangen geen archief van voorspellingen buiten de steekproef die destijds echt zijn gemaakt.

Houd de periode waarin gewichten en modellen worden gekozen gescheiden van de uiteindelijke evaluatie. Gebruik op moment \(t\) alleen uitkomsten die vóór \(t\) bekend waren en beoordeel A en B op hetzelfde toekomstige doel. Overlappende meerstapsvoorspellingen kunnen afhankelijke fouten of verliezen opleveren; gebruik inferentie die bij het ontwerp past en behandel niet iedere rij als onafhankelijk.

Als de reeks regressiefouten heteroskedasticiteit en autocorrelatie vertoont, kunt u een HAC-covariantiematrixschatter overwegen die bij het ontwerp en de horizon past. Newey en West (1987) presenteren een positief semidefiniete covariantiematrixschatter die consistent is bij heteroskedasticiteit en autocorrelatie (Newey–West, 1987). {source:neweyWest1987} Rapporteer de schatter en de gebruikte lagregel. Een HAC-standaardfout lost problemen met de nulverdeling door niet-normaliteit of geneste modellen niet vanzelf op.

Interpreteer de uitkomst beperkt

De nulhypothese niet verwerpen bewijst niet dat de voorspellingen gelijkwaardig zijn of dat A beter is. Het betekent dat de gekozen toets geen duidelijke aanvullende informatie heeft gevonden. Lage power, een korte steekproef, sterk gecorreleerde voorspellingsfouten of een ongeschikte specificatie kunnen informatie verhullen. Een claim van gelijkwaardigheid vereist een passend ontwerp en een vooraf bepaalde marge.

De nulhypothese verwerpen bewijst evenmin dat B winst oplevert of transactiekosten overstijgt. Voorspellende informatie is iets anders dan strategieprestatie na toepassing van beslisregels, uitvoeringsprijzen, spread, commissie, marktimpact, financiering en risicolimieten. Bruikbaarheid voor een strategie moet apart worden geëvalueerd.

Voor reproduceerbare resultaten rapporteert u het doel en de voorspellingstijden, hoe beide voorspellingen zijn gegenereerd, de informatie-cutoff, intercept en beperkingen, conditionerende variabelen, steekproefperiode, omgang met ontbrekende waarden, nulhypothese, toetsstatistiek en methode voor de standaardfout. Vermeld of modellen genest zijn en welke rol geschatte parameters spelen. Presenteer RMSE als een afzonderlijke vraag.

Belangrijkste literatuur

Veelgestelde vragen

Q1Is de encompassingtoets hetzelfde als de Diebold–Mariano-toets?

Nee. Diebold–Mariano vergelijkt het gemiddelde verschil in een gekozen verliesmaat. Encompassing vraagt of de ene voorspelling informatie toevoegt bovenop de andere.

Q2Zijn voorspellingen gelijkwaardig als ik de nulhypothese niet verwerp?

Nee. Dat resultaat betekent alleen dat de gekozen toets geen voldoende duidelijke aanvullende informatie vond. Het bewijst geen gelijkwaardigheid of superioriteit.

Q3Leidt een helling die van nul afwijkt tot een winstgevende strategie?

Niet vanzelf. Voorspellende informatie is iets anders dan prestaties na handelsregels, kosten, financiering, uitvoering en risicolimieten. Winstgevendheid vereist een afzonderlijke strategie-evaluatie. Gerelateerde voorspellingstoetsen - Diebold–Mariano-toets voor voorspellingsnauwkeurigheid - Clark–West-correctie voor nauwkeurigheid van geneste voorspellingen - Voorspellingen combineren: gelijke en geschatte gewichten - Mincer–Zarnowitz-toets voor voorspellingskalibratie

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat is de kern van de nulhypothese dat A B omvat?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst