Skip to content
Alle optiegidsen
Vergelijk twee voorspellingen aan de hand van hun verlies op dezelfde uitkomsten13 min leestijd

De Diebold–Mariano-toets: voorspellingsnauwkeurigheid vergelijken

Lees wat de Diebold–Mariano-toets vergelijkt, hoe verliesverschillen en seriële correlatie de statistiek beïnvloeden, en waarom voorspellingsnauwkeurigheid geen handelswinst is.

In deze gidsDe toets vergelijkt het verwachte voorspellingsverlies

Korte samenvatting

De Diebold–Mariano-toets (DM-toets) vraagt of twee voorspelprocedures dezelfde verwachte verlieswaarde hebben voor gematchte uitkomsten. De toets werkt met een reeks verliesverschillen, waardoor de verliesfunctie, voorspelhorizon en afhankelijkheid tussen datums allemaal van invloed zijn. Verwerping van de nulhypothese ondersteunt een verschil binnen het opgegeven evaluatieontwerp; ze bewijst niet dat één model blijvend beter is of dat een handelsstrategie na kosten winstgevend zal zijn.

De toets vergelijkt het verwachte voorspellingsverlies

De Diebold–Mariano-toets vergelijkt twee voorspellingen van hetzelfde doel voor dezelfde evaluatiedatums. Op elke voorspelorigin moeten beide procedures hetzelfde gerealiseerde resultaat, dezelfde horizon en hetzelfde informatietijdstip gebruiken. Vervolgens toetst de methode of het gemiddelde verlies van de ene procedure systematisch afwijkt van dat van de andere, terwijl verliesverschillen in de tijd mogen variëren.

Diebold en Mariano formuleren de vraag voor een algemene verliesfunctie, niet alleen voor de gemiddelde kwadratische fout. Hun oorspronkelijke artikel ontwikkelt toetsen van de nulhypothese dat concurrerende voorspellingen dezelfde voorspellende nauwkeurigheid hebben (Diebold en Mariano, 1995). Hier betekent ‘nauwkeurigheid’ een lager verwacht verlies volgens de gekozen functie. Het betekent niet dat een voorspelling waar is, causaliteit verklaart, overal in de verdeling goed gekalibreerd is of voor elke beslissing nuttig is.

Stel dat model A en model B op hetzelfde moment hetzelfde toekomstige rendement voorspellen. De DM-toets onderzoekt niet of een coëfficiënt in een van beide modellen nul is. Evenmin toetst ze of de aangepaste waarden van beide modellen in de schattingssteekproef gelijk zijn. Ze vergelijkt hoe de voorspelfouten in de evaluatiesteekproef uitwerken onder de gekozen verliesfunctie.

Leg het ontwerp vast voordat je de statistiek interpreteert. Doelvariabele, voorspelorigins, horizon, verliesfunctie, behandeling van ontbrekende resultaten, herschattingsschema en eenzijdig of tweezijdig alternatief bepalen de toetsvraag. Als deze keuzes tussen de modellen verschillen, is hun verliesverschil geen vergelijking onder gelijke voorwaarden.

Definieer gematchte voorspellingen en een verliesverschil

Laat $y_t$ de gerealiseerde doelwaarde op voorspelorigin $t$ zijn en $\hat y_{A,t}$ en $\hat y_{B,t}$ de voorspellingen van model A en B. Hun fouten zijn $e_{A,t}=y_t-\hat y_{A,t}$ en $e_{B,t}=y_t-\hat y_{B,t}$. Voor verliesfunctie $L$ is het verliesverschil op datum $t$:

$$ d_t=L(e_{A,t})-L(e_{B,t}) $$

Volgens deze tekenconventie betekent een negatief gemiddelde van $d_t$ dat A een lager waargenomen verlies had; een positief gemiddelde betekent een lager verlies voor B. De populatienulhypothese is $E[d_t]=0$. Een tweezijdig alternatief vraagt of de verwachte verliezen in een van beide richtingen verschillen; een eenzijdig alternatief richt zich op een vooraf gekozen richting. Kies de richting niet pas nadat je weet welk model won.

Bij kwadratisch verlies $L(e)=e^2$ wegen grote fouten onevenredig zwaar. Bij absoluut verlies $L(e)=|e|$ wordt de rangschikking minder door één grote fout bepaald. Kwantielverlies kan passen bij een asymmetrisch voorspeldoel; andere functies richten zich op andere aspecten van voorspelprestatie. Een andere verliesfunctie kan de modelrangschikking omkeren. ‘Beste voorspelling’ heeft dus geen unieke betekenis voordat het verlies is vastgelegd. Ook Tashmans overzicht van toetsen op voorspellingen buiten de schattingssteekproef benadrukt dat de evaluatie bij de voorspelvraag moet passen (Tashman, 200000065-0)).

Gebruik voor beide modellen dezelfde voorspelorigins en uitkomsten. Als bij één model juist een moeilijke datum ontbreekt, verandert het stilzwijgend alleen daar weglaten van die datum de vergelijkingssteekproef. Wordt het model tijdens de beoogde inzet elke maand met nieuwe gegevens herschat, maak de evaluatievoorspellingen dan volgens diezelfde regel. Een voorspeloefening met vaste parameters beantwoordt een andere vraag. Een sequentiële evaluatie, zoals walk-forward-validatie, laat zien hoe latere voorspellingen zonder toekomstige gegevens tot stand komen.

Een voorbeeld met vier origins laat het gemiddelde verschil zien

Neem vier hypothetische voorspelorigins en druk doel en voorspelfouten uit in procentpunten. De fouten van model A zijn $[1,2,0,1]$ en die van model B $[2,1,1,1]$. Elk paar hoort bij hetzelfde gerealiseerde rendement en hetzelfde voorspelinterval. De getallen zijn uitsluitend verzonnen om de berekening te tonen.

Met kwadratisch verlies heeft A verliezen $[1,4,0,1]$ en een gemiddelde kwadratische fout van $(1+4+0+1)/4=1.50$ kwadraat-procentpunt. B heeft verliezen $[4,1,1,1]$ en een gemiddelde kwadratische fout van $(4+1+1+1)/4=1.75$. Voor deze vier uitkomsten is de MSE van A 0.25 kwadraat-procentpunt lager.

De verliesverschillen per datum, $d_t=L(e_{A,t})-L(e_{B,t})$, zijn $[-3,3,-1,0]$. Hun gemiddelde is $(-3+3-1+0)/4=-0.25$, hetzelfde als de gemiddelde MSE van A min die van B. Het negatieve teken bevoordeelt A volgens deze conventie. Het zegt nog niet of het verschil groter is dan steekproefruis. Vier voorspelparen vormen geen overtuigend statistisch bewijs.

Ook de verliesdefinitie verandert wat ‘beter’ betekent. In een afzonderlijk hypothetisch voorbeeld heeft model C absolute fouten $[0,0,0,3]$ en model D $[1,1,1,1]$. Bij absoluut verlies zijn de gemiddelden 0.75 voor C en 1 voor D, dus heeft C de voorkeur. Bij kwadratisch verlies zijn de gemiddelden 2.25 voor C en 1 voor D, zodat D de voorkeur krijgt. De toets kan dit verschil niet oplossen zonder te bepalen welke voorspelfouten zwaarder tellen.

<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->

De DM-statistiek schaalt het gemiddelde verliesverschil met de onzekerheid

Het steekproefgemiddelde verliesverschil is $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, waarbij $T$ het aantal gematchte voorspellingen is. De standaardfout hangt af van de langetermijnvariantie van $d_t$, niet alleen van de variantie op één datum. Een algemene vorm van de toetsstatistiek is:

$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$

$\widehat{\Omega}$ schat de langetermijnvariantie van de reeks verliesverschillen. Bij onafhankelijke datums komt deze onder de gekozen schatter neer op de variantie van $d_t$. Voorspelverliezen clusteren echter vaak: in perioden met hoge volatiliteit kunnen de fouten van beide modellen groter zijn, en bij een doel op $h$ stappen kunnen aangrenzende foutvensters gerealiseerde rendementen delen. Positieve afhankelijkheid negeren kan de standaardfout onderschatten en het bewijs sterker laten lijken.

Een gangbare HAC-berekening schat autocovarianties $\hat\gamma_k$ van de gecentreerde verliesverschillen en combineert die als $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Met Bartlettgewichten tot bandbreedte $q$ geldt $w_k=1-k/(q+1)$. Newey en West ontwikkelden een positief semidefiniete covariantieschatter die consistent is onder heteroskedasticiteit en autocorrelatie (Newey en West). Kernel en bandbreedte zijn implementatiekeuzes: maak ze bekend en laat ze aansluiten op het voorspelontwerp in plaats van op een gewenste p-waarde. De gids voor HAC-standaardfouten behandelt het bredere probleem van covariantie schatten.

Onder reguliere voorwaarden wordt de standaard DM-statistiek asymptotisch vergeleken met een standaardnormale verdeling. Een grote absolute waarde betekent dat het waargenomen gemiddelde verliesverschil groot is ten opzichte van de geschatte onzekerheid. Het teken geeft aan welk model volgens de vastgelegde volgorde het lagere verlies had; de p-waarde meet niet de omvang of economische waarde. De p-waarde is ook niet de kans dat de nulhypothese waar is of dat een voorspelling in de toekomst werkt.

Meerperiodenvoorspellingen overlappen; ook de eindige steekproef telt

Wanneer je elke periode een doel op meerdere perioden vooruit voorspelt, overlappen de evaluatievensters. Een maandvoorspelling van het cumulatieve rendement van de komende drie maanden deelt bijvoorbeeld twee van die drie maandrendementen met de voorspelling die een maand later wordt uitgebracht. Zelfs bij onafhankelijke maandrendementen kan deze overlap seriële correlatie veroorzaken in voorspelfouten en verliesverschillen.

In een eenvoudige $h$-stapsopzet hoort de variantieberekening ten minste afhankelijkheid tot en met lag $h-1$ mee te nemen. Dat is geen universele bandbreedteregel: rollende herschatting, persistente doelen, volatiliteitsclusters en de gekozen verliesfunctie kunnen extra afhankelijkheid geven. Leg horizon, afstand tussen origins en reden voor de HAC-afkaplag of een andere variantieschatter vast. Het aantal voorspelframes is niet automatisch het aantal onafhankelijke gegevenspunten.

De oorspronkelijke asymptotische toets kan in middelgrote steekproeven een onjuist werkelijk significantieniveau hebben. Harvey, Leybourne en Newbold stelden een correctie voor eindige steekproeven voor bij het vergelijken van gemiddelde kwadratische voorspelfouten (HLN, 199700719-4)). Een gebruikelijke vorm voor horizon $h$ en $T$ voorspellingen schaalt de DM-statistiek met:

$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$

De aangepaste statistiek wordt doorgaans vergeleken met een t-verdeling met $T-1$ vrijheidsgraden. Bij $T=60$ en $h=5$ is de vermenigvuldigingsfactor ongeveer $0.925$. Dit voorbeeld toont alleen de rekenkundige correctie; het zegt niet dat 60 waarnemingen voor een bepaald model voldoende zijn of dat aan de aannames is voldaan. De correctie behandelt een specifiek steekproefprobleem, maar verhelpt geen datalek, ongeldig doel, niet-gemodelleerde afhankelijkheid, herhaalde modelselectie of verkeerd gespecificeerd verlies.

Geneste modellen vragen een andere onderbouwing voor de vergelijking

Model A kan een beperkte versie van model B zijn, bijvoorbeeld als B extra voorspellers bevat. Zelfs als die extra voorspellers onder de nulhypothese geen voorspellende waarde in de populatie hebben, kunnen hun geschatte coëfficiënten ruis aan B's voorspellingen toevoegen. Het grotere model kan daardoor een hogere waargenomen MSE hebben, ook als de extra voorspellers het onderliggende voorspelproces niet verbeteren. De gebruikelijke redenering over gelijke nauwkeurigheid voor niet-geneste modellen geldt niet automatisch ongewijzigd.

Clark en West beschrijven ongeveer normale toetsen op gelijke voorspellende nauwkeurigheid bij geneste modellen en corrigeren de vergelijking van kwadratische fouten voor de schattingsruis die het grotere model toevoegt (Clark en West, 2007). Hun correctie vervangt niet elke DM-toets: ze is ontworpen voor een specifieke vraag over geneste modellen, verliesfunctie en asymptotische opzet. Stel vast of het ene model in het andere is genest en kies een toets waarvan de nulverdeling bij het ontwerp past. Neem niet aan dat een standaard-DM-p-waarde uit software iedere modelrelatie afdekt.

Ook andere verschillen zijn van belang. Een voorspelling met een lagere MSE verbetert niet noodzakelijk de intervaldekking, kanskalibratie, richtingsnauwkeurigheid of een vervolgbeslissing. Een vergelijking kan buiten de schattingssteekproef vallen en toch een ongeschikte holdout gebruiken die tijdens modelontwikkeling herhaaldelijk is bekeken. Vermeld de modelrelatie, schattingsmethode, horizon en gegevens die voor elke voorspelling beschikbaar waren.

Voorspellingsnauwkeurigheid is geen handelsvoordeel

Een DM-resultaat evalueert voorspelverlies. Een handelsbeslissing evalueert een proces van rendement en risico. Een lagere MSE voor rendementen van de volgende periode garandeert niet dat een signaal vaak genoeg de juiste kant van een positie kiest, posities passend schaalt of bestand is tegen omzet, spread, marktimpact, kosten, leenlasten, funding en uitvoeringsvertraging. Omgekeerd kan een voorspelling met iets hogere gemiddelde kwadratische fout een beslissing verbeteren als ze preciezer is wanneer de strategie sterk blootstaat. Voor die bewering moet de verliesfunctie wellicht de echte beslissing weergeven in plaats van een handige algemene voorspelmaatstaf.

Een statistisch significant verschil kan economisch heel klein zijn. Rapporteer de omvang van het gemiddelde verliesverschil in interpreteerbare eenheden met onzekerheid, niet alleen een p-waarde of winnaarlabel. Gaat de claim over portefeuilleresultaten, voer dan de volledige bevroren beslisregel opnieuw uit op geschikte latere gegevens met realistische handelsaannames en rapporteer nettresultaten apart. De DM-toets berekent zulke resultaten niet en verwerkt geen kosten, tenzij de verliesfunctie daar uitdrukkelijk voor is ontworpen.

De toets corrigeert evenmin voor het doorzoeken van veel modellen, doelen, horizons, verliesfuncties, datumbereiken of handelsregels waarna alleen de gunstigste vergelijking wordt gerapporteerd. Herhaalde paarsgewijze toetsen veroorzaken een eigen selectieprobleem. Bewaar het zoeklogboek en gebruik een methode voor meervoudig toetsen die past bij de verzameling claims. De gids voor meervoudig toetsen en false-discovery rate legt uit waarom standaardgrenzen na een brede zoektocht misleidend kunnen zijn. De DM-toets is een evaluatiemiddel, geen correctie voor datamining.

Rapporteer genoeg details om de vergelijking te reproduceren

Een helder verslag noemt doel en eenheden, informatietijdstip, voorspelorigins, horizon, herschattingsschema en de gedeelde evaluatiesteekproef. Vermeld de verliesfunctie en het teken van $d_t$, het gemiddelde verlies per model en hun gemiddelde verschil, de vooraf gekozen een- of tweezijdige hypothese, de variantieschatter, kernel, bandbreedte, toetsstatistiek, referentieverdeling, p-waarde en waar passend een betrouwbaarheidsinterval of onzekerheidsmaat.

Maak ook bekend of de modellen genest zijn, hoe ontbrekende uitkomsten en uitschieters zijn behandeld, hoeveel alternatieve specificaties zijn bekeken en of de evaluatieperiode modelkeuzes heeft beïnvloed. Toon de omvang van het verschil, niet alleen of het een grens passeerde. Een tijdreeks van $d_t$ of een grafiek van cumulatieve verliesverschillen kan regimeveranderingen tonen die in één gemiddelde verborgen blijven, al vervangt zo'n figuur geen afhankelijkheidsbewuste inferentie.

Beschrijf in kwantitatief handelen ook de stap van voorspelling naar actie: signaaldrempel, positiegrootte, herbalanceringstijdstip, risicobeheersing, uitvoeringsprijs en kostenaannames. De DM-toets vergelijkt uitsluitend de reeks voorspelverliezen die je invoert. Ze certificeert de datapijplijn niet, maakt verschillende evaluatiesteekproeven niet vergelijkbaar, bewijst geen causaliteit en garandeert niet dat historische rangordes blijven bestaan. Gebruik de toets als één transparant onderdeel van modelevaluatie, naast een tijdsordelijk voorspelontwerp en een expliciete beoordeling van de beslissingen.

Veelgestelde vragen

Q1Vergelijkt de Diebold–Mariano-toets modelcoëfficiënten?

Nee. Ze vergelijkt het verwachte verlies van voorspelfouten die twee procedures op gematchte uitkomsten produceren. Een coëfficiënttoets beantwoordt een andere vraag over een modelparameter.

Q2Kan ik de toets gebruiken voor voorspellingen meerdere perioden vooruit?

Ja, maar overlappende doelvensters kunnen opeenvolgende verliesverschillen seriële afhankelijkheid geven. Gebruik een variantieschatter en zo nodig een correctie voor eindige steekproeven die passen bij de horizon en modelopzet; leg je keuzes vast.

Q3Betekent een significant resultaat dat de betere voorspelling geld oplevert?

Nee. Het ondersteunt een verschil in het gekozen voorspelverlies binnen het evaluatieontwerp. Winstgevendheid hangt ook af van hoe voorspellingen in posities worden omgezet, het genomen risico en de werkelijk gerealiseerde uitvoering en handelskosten.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Wat is de nulhypothese bij de basisvergelijking van Diebold–Mariano?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst

Kies welke historie een financieel model gebruiktExpanding en rolling windows voor walk-forward-validatieVergelijk groeiende en vaste rollende trainingsvensters voor financiële modellen, houd validatie apart van de eindtest en kies vensterregels zonder toekomstige uitkomsten.Dezelfde coëfficiënt kan verschillende onzekerheid hebbenHeteroskedasticity, Autocorrelation, en Robuuste standaardfoutenOntdek waarom klassieke standaardfouten falen, wat White, clustered en Newey...West HAC-schattingen toestaan, hoe ze te selecteren, en waar robuuste gevolgtrekkingen stoppen in financiële gegevens.Waarom een drempel faalt als onderzoekers veel ideeën testenMeerdere tests en valse ontdekkingstochten in de financiënBegrijp meerdere vergelijkingen, familie-wijs fout, valse ontdekkingscijfer, Bonferroni, Holm, Benjamini . Hochberg, afhankelijkheid, q-waarden, factor mining, backtest selectie, en onderzoek governanceEvaluatie van richtingsvoorspellingenDe Pesaran–Timmermann-toets: voegt een richtingsvoorspelling informatie toe?Lees hoe de Pesaran–Timmermann-toets treffers in richting vergelijkt met een basislijn op grond van de feitelijke en voorspelde stijgingspercentages, en waarom seriële afhankelijkheid de gevolgtrekking verandert.Hoe vaak zakt de backtestwinnaar onder de mediaan van de groep?Probability of Backtest Overfitting (PBO) en CSCV uitgelegdLees hoe combinatorische symmetrische kruisvalidatie PBO schat, hoe OOS-rangen logits worden en waarom PBO geen voorspelling van toekomstige verliezen is