Skip to content
Alle optiegidsen
Evaluatie van richtingsvoorspellingen13 min leestijd

De Pesaran–Timmermann-toets: voegt een richtingsvoorspelling informatie toe?

Lees hoe de Pesaran–Timmermann-toets treffers in richting vergelijkt met een basislijn op grond van de feitelijke en voorspelde stijgingspercentages, en waarom seriële afhankelijkheid de gevolgtrekking verandert.

In deze gidsEen trefferspercentage van 64% kan weinig zeggen of nuttig zijn, afhankelijk van de basislijn

Korte samenvatting

De Pesaran–Timmermann-toets (PT-toets) onderzoekt of voorspellingen informatie bevatten over de richting waarin een uitkomst beweegt. Bij een binaire voorspelling omhoog/omlaag vergelijkt de toets het waargenomen trefferspercentage met het verwachte aandeel overeenkomsten op basis van de afzonderlijke aandelen werkelijke stijgingen en voorspelde stijgingen. Die basislijn is niet noodzakelijk 50%. De gebruikelijke toets berust ook op aannames over afhankelijkheid tussen voorspellingstijdstippen, en statistische significantie bewijst niet dat een handelsregel winstgevend is.

Een trefferspercentage van 64% kan weinig zeggen of nuttig zijn, afhankelijk van de basislijn

Stel dat de markt op 60% van de evaluatiedagen stijgt. Een voorspeller geeft op 70% van die dagen “omhoog” aan. Zelfs als voorspellingen en uitkomsten geen verband houden, komen ze vaak overeen: op sommige dagen geven ze beide stijging aan, op andere beide daling. Het trefferspercentage zonder meer met 50% vergelijken zou die onbalans negeren.

Het PT-kader maakt die vergelijking expliciet. Het onderzoekt of de voorspelde en gerealiseerde richting vaker overeenkomen dan op grond van hun afzonderlijke frequenties bij onafhankelijkheid te verwachten is. Dit is een toets van voorspellende informatie over richting, geen score voor de omvang van rendementen, het moment van handelen of de waarde van een volledige strategie. Pesaran en Timmermann introduceerden de toets voor voorspellende prestaties met kruistabellen; in het binaire 2×2-geval is hun toets asymptotisch gelijkwaardig aan een onafhankelijkheidstoets {source:pesaranTimmermannDirectionalTests1992}.

Plaats elke gekoppelde voorspelling in een twee-bij-twee-tabel

Neem \(Y_t=1\) als de gerealiseerde uitkomst als stijging wordt geclassificeerd en \(Y_t=0\) als deze als daling wordt geclassificeerd. Neem \(Z_t=1\) als de voorspelling omhoog aangeeft en \(Z_t=0\) als de voorspelling omlaag aangeeft. Elke evaluatieregel moet een voorspelling vanaf tijdstip \(t\) koppelen aan de uitkomst voor de horizon die die voorspelling moest voorzien.

De vier cellen tellen combinaties omhoog/omhoog, omhoog/omlaag, omlaag/omhoog en omlaag/omlaag. Als \(n_{11}\) en \(n_{00}\) de twee overeenstemmende cellen zijn en \(n\) het aantal bruikbare, gekoppelde paren is, bedraagt het waargenomen trefferspercentage in richting

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Deze opzet is binair. Bepaal vooraf hoe je omgaat met nulrendementen, nulvoorspellingen of een neutrale band. Een onderzoek kan bijvoorbeeld een rendement van nul of lager als “niet omhoog” classificeren en een voorspelling op of onder de drempel eveneens als “niet omhoog”. Gelijke waarden uitsluiten is ook mogelijk, maar verandert de steekproef en moet consequent gebeuren. Tel nul-nul niet als een derde soort overeenkomst terwijl je een basislijnformule voor twee categorieën gebruikt.

Leid de onafhankelijkheidsbasislijn af uit beide stijgingspercentages

Laat \(\hat p_y\) het steekproefaandeel zijn van gerealiseerde uitkomsten die als stijging zijn geclassificeerd en \(\hat p_z\) het steekproefaandeel van voorspellingen die stijging aangeven. Als de werkelijke en voorspelde labels onafhankelijk zijn, is het verwachte aandeel overeenkomsten

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Het eerste product is de kans op een overeenkomst omhoog/omhoog bij onafhankelijkheid; het tweede is de kans op omlaag/omlaag. De basislijn verandert dus met beide marginale aandelen en kan hoger of lager zijn dan 50%. Een model dat altijd de meest voorkomende richting voorspelt, kan een redelijk ogend trefferspercentage hebben zonder informatie toe te voegen.

Een extreem geval maakt dit duidelijk. Als een classifier elke dag “omhoog” voorspelt, geldt \(\hat p_z=1\), is het waargenomen trefferspercentage gelijk aan het werkelijke stijgingsaandeel \(\hat p_y\), en is ook de onafhankelijkheidsbasislijn \(\hat p_y\). De extra overeenstemming is per definitie nul. Zo’n constante voorspelling kan accuraat lijken wanneer stijgingen vaak voorkomen, maar maakt geen onderscheid tussen de dagen waarop de markt stijgt; bovendien kan de geschatte variantie degenereren, zodat een gebruikelijke PT-p-waarde mogelijk niet bestaat.

Neem 100 volledig hypothetische gekoppelde dagen. De werkelijke uitkomst is op 60 dagen omhoog en de voorspelling geeft op 70 dagen omhoog aan. Stel dat de tabel er zo uitziet:

Gerealiseerde richtingVoorspelling omhoogVoorspelling omlaagTotaal
Omhoog471360
Omlaag231740
Totaal7030100

Er zijn 64 overeenkomsten, dus \(\widehat P=0.64\). De onafhankelijkheidsbasislijn is \(0.60\times0.70+0.40\times0.30=0.54\). Het waargenomen trefferspercentage ligt 10 procentpunt boven die basislijn. Deze verzonnen aantallen laten alleen de berekening zien; het verschil op zichzelf is geen geldige onzekerheidsschatting of bewijs van bruikbare handelsresultaten.

Schaal het verschil in trefferspercentage met de geschatte onzekerheid

Definieer voor de standaard binaire PT-statistiek

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

en

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Dan geldt

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Onder de nulhypothese en gebruikelijke aannames voor grote steekproeven heeft deze statistiek asymptotisch een standaardnormale referentieverdeling. De teller is het aantal extra overeenkomsten boven de onafhankelijkheidsbasislijn. De noemer houdt rekening met het feit dat de basislijn uit dezelfde steekproef wordt geschat in plaats van vast op 50% te worden gezet. De formule en notatie zijn beschreven in de statsmodels-implementatie {source:statsmodelsPesaranTimmermannAPI}.

Bovenstaande uitdrukking is de belangrijkste asymptotische variant van de variantie die statsmodels documenteert. De uitgebreidere delta-variantie voor eindige steekproeven uit de oorspronkelijke behandeling voegt \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\) toe aan \(\widehat w\). Deze term van lagere orde verandert de eerste-orde-asymptotiek niet, maar kan een statistiek in een eindige steekproef verschuiven. Als resultaten van de implementatie afhangen, vermeld dan de gebruikte formule en softwareversie; vergelijk p-waarden niet alsof elk pakket dezelfde berekening voor eindige steekproeven gebruikt.

De formule herstelt geen zwak onderzoeksontwerp. Een zeer kleine steekproef, vrijwel constante voorspellingen, lege cellen of een geschatte variantie van nul of een ongeldige variantie kunnen de gebruikelijke benadering onbetrouwbaar of ongedefinieerd maken. Forceer in zulke gevallen geen p-waarde uit de formule; rapporteer de marginale aandelen en tabel en kies een inferentieprocedure die bij de gegevens en steekproefomvang past.

Voor de hypothetische tabel hierboven zijn de componenten volgens de leidende formule \(\widehat v=0.54(0.46)/100=0.002484\) en \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). De standaardfout is \(\sqrt{0.002484-0.000468}\approx0.0449\), zodat \(PT\approx0.10/0.0449=2.23\). De tweezijdige standaardnormale referentie geeft een p-waarde van ongeveer 0.026. Dit is een berekening van verzonnen aantallen met de leidende asymptotische formule; de uitgebreidere eindige-steekproefterm verandert de uitkomst iets en seriële afhankelijkheid kan de normale referentie ongeldig maken. Presenteer dit niet als empirisch resultaat.

Conceptueel 2×2-schema van voorspelde en gerealiseerde richtingen, met gekoppelde koperkleurige en groenblauwe pijlen voor overeenkomsten, verschillen en uiteenlopende marginale aandelen.
De illustratie toont hoe voorspelde en gerealiseerde richtingen overeenkomen of verschillen en hoe de marginale aandelen uiteenlopen; het is een conceptueel schema, geen empirische data.

Lees een verwerping als bewijs over richting, niet als handelsoordeel

Een positieve teller betekent dat de waargenomen richtingen vaker overeenkomen dan de onafhankelijkheidsbasislijn; een negatieve waarde betekent minder vaak. Een vooraf vastgelegde eenzijdige toets kan vragen of de overeenstemming boven de basislijn ligt. Een tweezijdige toets vraagt of de richtingsassociatie in een van beide richtingen afwijkt. Kies het alternatief en significantieniveau voordat je resultaten bekijkt.

Een kleine p-waarde is bewijs tegen de gestelde nulhypothese onder de aannames van de toets. Het is niet de kans dat de nulhypothese waar is en evenmin de kans dat de voorspelling de volgende periode goed werkt. Ook zegt de uitkomst niet dat rendementen groot genoeg waren om spread, kosten, marktimpact, funding of leenkosten te dekken. De toets corrigeert evenmin voor het proberen van veel activa, horizons, drempels, modelvarianten of voorspellingstekens en vervolgens alleen de winnaar rapporteren. Als kandidaatstrategieën zijn doorzocht, legt de gids voor de White Reality Check uit waarom de selectie in de inferentie moet meetellen.

Omgekeerd bewijst het niet verwerpen niet dat de gerealiseerde en voorspelde richtingen onafhankelijk zijn. Een korte of onevenwichtige steekproef kan weinig onderscheidingsvermogen hebben om een verband te vinden. Een negatieve PT-teller bewijst evenmin dat de voorspelling helemaal geen structuur bevat; er kan sprake zijn van systematische onenigheid. Het teken van de voorspelling omkeren nadat je dit resultaat hebt gezien, is een nieuwe modelkeuze en moet met nieuwe gegevens worden beoordeeld of in de oorspronkelijke zoekprocedure worden opgenomen.

Rapporteer samen het werkelijke stijgingsaandeel, het voorspelde stijgingsaandeel, het waargenomen trefferspercentage, de onafhankelijkheidsbasislijn, het verschil in procentpunten, de alternatieve hypothese en de methode voor de onzekerheidsschatting. Een p-waarde zonder de tabelmarges en effectgrootte maakt het lastig een kleine maar nauwkeurig geschatte stijging te onderscheiden van een grotere maar onzekere stijging.

Seriële afhankelijkheid kan de gebruikelijke referentieverdeling misleidend maken

De gewone PT-statistiek wordt vaak gepresenteerd voor seriëel onafhankelijke richtingswaarnemingen. Financiële labels kunnen echter in reeksen voorkomen. Dagwaarnemingen kunnen overlappende meerdaagse doelen delen, volatiliteitsregimes kunnen aanhouden en rollende voorspellingen kunnen vrijwel dezelfde schattingsgegevens hergebruiken. De \(n\) paren zijn dan geen \(n\) onafhankelijke informatie-eenheden. De gebruikelijke standaardfout kan te klein zijn, waardoor de nulhypothese te vaak wordt verworpen.

Pesaran en Timmermann ontwikkelden later toetsen voor afhankelijkheid tussen serieel gecorreleerde multicategorievariabelen met dynamisch uitgebreide regressies en een eindige-ordemarkovkader {source:pesaranTimmermannSerialCategories2009}. Onderzoek naar richtingsvoorspellingen vindt ook dat conventionele, op onafhankelijkheid gebaseerde PT-procedures te vaak kunnen verwerpen bij seriële correlatie en onderzoekt afhankelijkheidsrobuuste alternatieven, waaronder bootstrapmethoden {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. De juiste methode hangt af van hoe voorspellingen worden gemaakt, de voorspellingshorizon en de afhankelijkheidsstructuur; een generiek recept voor resampling is niet automatisch geldig.

Vermeld of voorspellingstijdstippen overlappen, hoe ver ze uit elkaar liggen en welke afhankelijkheidsmethode de onzekerheidsschatting levert. Als je de statistiek uit het leerboek als beschrijvende maatstaf rapporteert, label dan de onafhankelijkheidsaanname. Interpreteer een nominaal resultaat op 5% niet alsof het werkelijke percentage foutieve verwerpingen ook 5% is wanneer het ontwerp die aanname schendt.

Bouw de evaluatie op uit voorspellingen die op dat moment gemaakt hadden kunnen worden

Bewaar voor elk tijdstip de voorspelling precies zoals die toen beschikbaar was, de horizon, de informatiegrens, de gerealiseerde uitkomst en de regel die elk omzet in een label omhoog/omlaag. Lijn tijdstempels, instrumenten, prijs- of rendementsdefinities en de behandeling van ontbrekende waarden uit voordat je de tabel maakt. Een voorspelling op basis van herziene macro-economische gegevens of een signaal dat op de evaluatieperiode is afgestemd, is geen onaangeroerde out-of-samplevoorspelling.

Kies de classificatiedrempel voordat je de holdoutresultaten ziet. Als een model een kans afgeeft, zet de drempel die om in een binaire richting; drempels zoeken in dezelfde steekproef verandert de vraag en veroorzaakt selectiebias. Houd de rollen van training, validatie en eindevaluatie gescheiden. Herhaal in elke resample het volledige selectieproces wanneer de resampling modelzoekwerk moet meenemen.

De PT-vraag verschilt van het vergelijken van de omvang van voorspellingsfouten. De gids voor Diebold–Mariano vergelijkt gepaarde verliesverschillen, terwijl de gids voor Giacomini–White vraagt of relatieve voorspelkracht varieert met vooraf vastgelegde informatie. Zie voor geneste voorspellingsmodellen de gids voor de Clark–West-correctie. Deze toetsen beantwoorden verschillende vragen en mogen niet worden verwisseld alleen omdat ze vertrouwde teststatistieken opleveren.

Richtingssignificantie bewijst geen winstgevende strategie

De PT-toets reduceert elke uitkomst tot één richtingslabel. Een stijging van één tick en een grote rally tellen beide als omhoog; een kleine misser en een groot verlies tellen beide als één richtingsfout. Een voorspelling kan het trefferspercentage dus verhogen en toch geld verliezen als missers groter zijn dan winsten, het signaal na de koersbeweging komt of handelskosten het voordeel opslokken.

Stel bijvoorbeeld 100 hypothetische transacties met gelijke omvang voor: 64 juiste richtingen leveren elk gemiddeld 0,10% winst op en 36 onjuiste richtingen elk gemiddeld 0,25% verlies. De eenvoudige brutototaalberekening is \(64(0.10\%)-36(0.25\%)=-2.6\) procentpunt vóór kosten, ondanks een trefferspercentage van 64%. Deze bewust vereenvoudigde berekening negeert samengestelde groei en is geen marktgegeven; ze laat zien waarom het trefferspercentage alleen de verwachtingswaarde niet bepaalt.

Veelgestelde vragen

Q1Vergelijkt de Pesaran–Timmermann-toets de nauwkeurigheid met 50%?

Nee. De toets vergelijkt waargenomen overeenstemming met de onafhankelijkheidsbasislijn die wordt berekend uit de afzonderlijke aandelen werkelijke en voorspelde stijgingen. Die basislijn kan hoger of lager zijn dan 50%.

Q2Kan ik de gebruikelijke PT-p-waarde gebruiken als voorspellingshorizons overlappen?

Niet zonder de afhankelijkheid te verwerken. Overlappende doelen en aanhoudende richtingslabels kunnen de onafhankelijkheidsgebaseerde onzekerheidsschatting te klein maken. Gebruik een methode waarvan de aannames bij de horizon en afhankelijkheidsstructuur passen.

Q3Betekent een significante PT-uitkomst dat de handelsstrategie winstgevend is?

Nee. De toets gebruikt richtingslabels en meet geen bewegingsomvang, in- en uitstapprijzen, positiegrootte, kosten, slippage of funding. Evalueer netto out-of-samplerendementen afzonderlijk.

Bronnen en verder lezen

Probleem melden

We bereiden een e-mail met de link naar dit artikel voor. Mark ontvangt je melding pas nadat je die verstuurt

Snelle check

De gids gelezen? Test jezelf met 3 vragen

Vraag 1 / 3

Vraag 01

Als de werkelijke uitkomsten 60% van de tijd stijgen en voorspellingen 70% van de tijd omhoog aangeven, wat is dan de onafhankelijkheidsbasislijn voor overeenkomsten?

Kies een antwoord om de uitleg te zien

Optiewoordenlijst

Heldere definities van belangrijke optiebegrippen, van calls, puts en optieketens tot IV, Greeks, open interest en max pain

Bekijk de optiewoordenlijst