Skip to content
Alle Leitfäden zu Optionen und Futures
Bewertung von Richtungsprognosen13 Min. Lesezeit

Pesaran–Timmermann-Test: Liefert eine Richtungsprognose zusätzliche Information?

Erfahre, wie der Pesaran–Timmermann-Test Treffer bei Richtungsprognosen mit einer Basisrate aus tatsächlichen und prognostizierten Aufwärtsanteilen vergleicht und warum serielle Abhängigkeit die Inferenz verändert.

In diesem LeitfadenEine Trefferquote von 64 % kann je nach Basisrate wenig oder viel aussagen

Kurze Zusammenfassung

Der Pesaran–Timmermann-Test (PT-Test) fragt, ob Prognosen Informationen darüber enthalten, in welche Richtung sich ein Ergebnis bewegt. Bei einer binären Aufwärts-/Abwärtsprognose vergleicht er die beobachtete Trefferquote mit der Übereinstimmungsrate, die sich aus den jeweiligen Aufwärtsanteilen von tatsächlichen Ergebnissen und Prognosen ergibt. Diese Basisrate muss nicht 50 % betragen. Der übliche Test setzt außerdem Annahmen über die Abhängigkeit zwischen Prognosezeitpunkten voraus. Statistische Signifikanz belegt nicht, dass eine Handelsregel profitabel ist.

Eine Trefferquote von 64 % kann je nach Basisrate wenig oder viel aussagen

Angenommen, der Markt steigt an 60 % der Tage einer Evaluationsstichprobe. Eine Prognose sagt an 70 % dieser Tage „aufwärts“ voraus. Selbst wenn Prognosen und Ergebnisse unabhängig voneinander wären, würden die beiden Reihen häufig übereinstimmen: An manchen Tagen würden beide aufwärts, an anderen beide abwärts anzeigen. Wer die Trefferquote mechanisch mit 50 % vergleicht, ignoriert dieses Ungleichgewicht.

Der PT-Ansatz macht diesen Vergleich explizit. Er prüft, ob Prognose und realisierte Richtung häufiger übereinstimmen, als ihre getrennten Häufigkeiten unter Unabhängigkeit erwarten lassen. Es geht um prädiktive Information zur Richtung, nicht um die Höhe der Renditen, den Zeitpunkt eines Trades oder den Wert einer vollständigen Strategie. Pesaran und Timmermann führten den Test der Prognoseleistung mithilfe von Kontingenztafeln ein; im binären 2×2-Fall ist ihr Test asymptotisch einem Unabhängigkeitstest gleichwertig {source:pesaranTimmermannDirectionalTests1992}.

Ordne jede zugehörige Prognose in einer 2×2-Tafel ein

Sei \(Y_t=1\), wenn das realisierte Ergebnis als Aufwärtsbewegung klassifiziert wird, und \(Y_t=0\), wenn es als Abwärtsbewegung gilt. Sei \(Z_t=1\), wenn die Prognose aufwärts lautet, und \(Z_t=0\), wenn sie abwärts lautet. Jede Zeile der Auswertung sollte eine am Ursprung \(t\) erstellte Prognose mit dem Ergebnis für genau den Horizont verbinden, den sie vorhersagen sollte.

Die vier Zellen zählen Aufwärts/Aufwärts-, Aufwärts/Abwärts-, Abwärts/Aufwärts- und Abwärts/Abwärts-Paare. Wenn \(n_{11}\) und \(n_{00}\) die beiden Übereinstimmungszellen sind und \(n\) die Anzahl der zugeordneten, verwendbaren Paare bezeichnet, lautet die beobachtete Richtungstrefferquote

\[ \widehat{P}=\frac{n_{11}+n_{00}}{n}. \]

Diese Einteilung ist binär. Lege vorab fest, wie du mit einer Rendite von null, einer Prognose von null oder einer neutralen Bandbreite umgehst. Eine Studie könnte beispielsweise eine Rendite von null oder darunter als „nicht aufwärts“ und eine Prognose auf oder unter ihrem Schwellenwert ebenso klassifizieren. Gleichstände auszuschließen ist eine weitere Möglichkeit, verändert aber die Stichprobe und muss konsequent angewendet werden. Zähle „null/Null“ nicht als dritte Art der Übereinstimmung, wenn du eine Formel für eine Baseline mit zwei Kategorien verwendest.

Prognoseursprung und Zielhorizont müssen ebenfalls übereinstimmen. Sagt \(Z_t\) das Vorzeichen der Rendite der nächsten fünf Handelstage voraus, muss \(Y_t\) dieselbe Fünf-Tage-Rendite ab demselben Ursprung klassifizieren, nicht die Rendite des nächsten einzelnen Tages. Sonst vermischt die Tafel unterschiedliche Ereignisse. Tägliche Prognosen für überlappende Fünf-Tage-Ziele eignen sich für eine beschreibende Tafel, erzeugen aber das später erläuterte Abhängigkeitsproblem.

Leite die Unabhängigkeits-Baseline aus beiden Aufwärtsanteilen ab

Sei \(\hat p_y\) der Stichprobenanteil der als aufwärts klassifizierten realisierten Ergebnisse und \(\hat p_z\) der Anteil der Prognosen, die aufwärts lauten. Sind tatsächliche und prognostizierte Kategorien unabhängig, beträgt der erwartete Anteil der Übereinstimmungen

\[ \widehat{P}^{*}=\hat p_y\hat p_z+(1-\hat p_y)(1-\hat p_z). \]

Das erste Produkt ist die Wahrscheinlichkeit einer Aufwärts/Aufwärts-Übereinstimmung unter Unabhängigkeit, das zweite die einer Abwärts/Abwärts-Übereinstimmung. Die Baseline hängt daher von beiden Randanteilen ab. Sie kann über oder unter 50 % liegen. Wer stets die häufigere Richtung prognostiziert, kann eine beachtliche Trefferquote erreichen, ohne zusätzliche Information zu liefern.

Ein Extremfall macht das deutlich: Sagt ein Klassifikator an jedem Datum „aufwärts“ voraus, gilt \(\hat p_z=1\), und sowohl Trefferquote als auch Unabhängigkeits-Baseline entsprechen dem tatsächlichen Aufwärtsanteil \(\hat p_y\). Der Überschuss ist konstruktionsbedingt null. Bei häufigen Aufwärtsbewegungen kann diese konstante Prognose genau wirken, unterscheidet aber keine Tage; die Varianz kann degenerieren, sodass ein üblicher PT-p-Wert nicht existiert.

Betrachte 100 hypothetische, zugeordnete Tage. Die tatsächlichen Ergebnisse sind an 60 Tagen aufwärts, und die Prognosen sagen an 70 Tagen aufwärts voraus. Angenommen, die Tafel enthält 47 Aufwärts/Aufwärts-Paare, 13 Paare mit tatsächlichem Aufwärts und prognostiziertem Abwärts, 23 Paare mit tatsächlichem Abwärts und prognostiziertem Aufwärts sowie 17 Abwärts/Abwärts-Paare. Es gibt 64 Übereinstimmungen, also \(\widehat P=0.64\). Die Unabhängigkeits-Baseline beträgt \(0.60\times0.70+0.40\times0.30=0.54\). Die beobachtete Trefferquote liegt damit zehn Prozentpunkte über der Baseline. Diese erfundenen Zahlen veranschaulichen nur die Berechnung; die Differenz allein ist weder eine gültige Unsicherheitsschätzung noch ein Beleg für einen Handelsvorteil.

Tatsächliche RichtungPrognose aufwärtsPrognose abwärtsSumme
Aufwärts471360
Abwärts231740
Summe7030100

Skaliere die Trefferquoten-Differenz mit ihrer geschätzten Unsicherheit

Für die übliche binäre PT-Statistik definiere

\[ \widehat v=\frac{\widehat P^{*}(1-\widehat P^{*})}{n} \]

und

\[ \widehat w=\frac{(2\hat p_y-1)^2\hat p_z(1-\hat p_z)+(2\hat p_z-1)^2\hat p_y(1-\hat p_y)}{n}. \]

Dann gilt

\[ PT=\frac{\widehat P-\widehat P^{*}}{\sqrt{\widehat v-\widehat w}}. \]

Unter der Nullhypothese und den üblichen Großstichprobenannahmen wird diese Statistik asymptotisch mit der Standardnormalverteilung verglichen. Der Zähler misst die zusätzliche Übereinstimmung gegenüber der Unabhängigkeits-Baseline. Der Nenner berücksichtigt, dass die Baseline aus derselben Stichprobe geschätzt und nicht als festes 50-%-Ziel behandelt wird. Die statsmodels-Dokumentation beschreibt Formel und Notation {source:statsmodelsPesaranTimmermannAPI}.

Der Ausdruck oben ist die in statsmodels dokumentierte asymptotische Varianzform erster Ordnung. Die vollständigere Delta-Varianz für endliche Stichproben in der ursprünglichen Darstellung addiert zu \(\widehat w\) den Term \(4\hat p_y\hat p_z(1-\hat p_y)(1-\hat p_z)/n^2\). Dieser Term kleinerer Ordnung ändert die asymptotischen Ergebnisse erster Ordnung nicht, kann aber die Statistik bei endlichen Stichproben verschieben. Wenn Ergebnisse von der Implementierung abhängen, nenne die verwendete Formel und Softwareversion. Vergleiche p-Werte nicht so, als nutzten alle Pakete dieselbe Rechnung für endliche Stichproben.

Die Formel behebt kein ungeeignetes Evaluationsdesign. Eine sehr kleine Stichprobe, nahezu konstante Prognosen, leere Zellen oder eine geschätzte Varianz von null beziehungsweise mit ungültigem Wert können die übliche Approximation unzuverlässig oder undefiniert machen. Erzwinge dann keinen p-Wert aus dem Ausdruck. Berichte die Randanteile und die Tafel und wähle ein Inferenzverfahren, das zu Daten und Stichprobengröße passt.

Für die hypothetische Tafel gilt \(\widehat v=0.54(0.46)/100=0.002484\) und \(\widehat w=[0.2^2(0.7)(0.3)+0.4^2(0.6)(0.4)]/100=0.000468\). Der Standardfehler ist \(\sqrt{0.002484-0.000468}\approx0.0449\), also \(PT\approx0.10/0.0449=2.23\); zweiseitig ergibt die Standardnormal-Referenz \(p\approx0.026\). Das ist eine Rechnung mit erfundenen Werten und der asymptotischen Formel erster Ordnung. Der Term für endliche Stichproben verschiebt den Wert leicht; serielle Abhängigkeit kann die Normalreferenz ungültig machen. Kein empirisches Ergebnis.

Textfreie Konzeptgrafik mit kupferfarbenen und türkisfarbenen Pfeilpaaren in einem 2×2-Raster: tatsächliche und prognostizierte Auf- und Abwärtsrichtungen, Übereinstimmungen und Abweichungen sowie unterschiedliche Anteile; keine empirischen Daten.
Konzeptdarstellung von Übereinstimmung und Abweichung zwischen tatsächlicher und prognostizierter Richtung bei unterschiedlichen Aufwärtsanteilen; keine realen Marktdaten.

Lies eine Ablehnung als Evidenz zur Richtung, nicht als Handelsurteil

Ein positiver Zähler bedeutet, dass die beobachteten Richtungen häufiger übereinstimmen als gemäß der Unabhängigkeits-Baseline zu erwarten wäre; ein negativer bedeutet weniger Übereinstimmungen. Ein vorab festgelegter einseitiger Test kann prüfen, ob die Übereinstimmung über der Baseline liegt. Ein zweiseitiger Test fragt, ob sich der Zusammenhang in irgendeine Richtung unterscheidet. Alternative und Signifikanzniveau sollten vor der Betrachtung der Ergebnisse festgelegt werden.

Ein kleiner p-Wert ist unter den Testannahmen Evidenz gegen die formulierte Nullhypothese. Er ist weder die Wahrscheinlichkeit, dass die Nullhypothese wahr ist, noch die Wahrscheinlichkeit, dass die Prognose in der nächsten Periode funktioniert. Er besagt auch nicht, dass die Renditen groß genug waren, um Geld-Brief-Spanne, Gebühren, Markteinfluss, Finanzierung oder Leihkosten zu decken. Ebenso wenig korrigiert er dafür, viele Anlagen, Horizonte, Schwellenwerte, Modellvarianten oder Prognosevorzeichen auszuprobieren und nur den Gewinner zu berichten. Wurden Strategiekandidaten durchsucht, erklärt der Leitfaden zum White Reality Check, warum diese Auswahl in der Inferenz berücksichtigt werden muss.

Eine Nichtverwerfung beweist keine Unabhängigkeit; kurze oder unausgewogene Stichproben können wenig Teststärke haben. Ein negativer PT-Zähler kann systematische Abweichung statt Struktur-losigkeit anzeigen. Das Vorzeichen nach Sichtung umzudrehen, ist eine neue Modellwahl und muss mit frischen Daten geprüft oder in die ursprüngliche Suche aufgenommen werden.

Berichte gemeinsam tatsächlichen und prognostizierten Aufwärtsanteil, Trefferquote, Unabhängigkeits-Baseline, Abstand in Prozentpunkten, Alternativhypothese und Unsicherheitsmethode. Ein p-Wert allein zeigt Effektgröße und Präzision nicht.

Serielle Abhängigkeit kann die übliche Referenzverteilung irreführend machen

Die gewöhnliche PT-Statistik wird oft unter der Annahme vorgestellt, dass Richtungsbeobachtungen über die Zeit unabhängig sind. Finanzielle Klassifikationen treten jedoch mitunter in Serien auf. Bei täglichen Daten können sich mehrtägige Zielzeiträume überschneiden; Volatilitätsregime können anhalten; und rollierende Prognosen verwenden möglicherweise fast dieselben Schätzungsdaten erneut. Dann sind \(n\) Paare nicht gleichbedeutend mit \(n\) unabhängigen Informationseinheiten. Der übliche Standardfehler kann zu klein ausfallen, sodass die Nullhypothese zu häufig verworfen wird.

Pesaran und Timmermann entwickelten später Tests für Abhängigkeit zwischen seriell korrelierten Variablen mit mehreren Kategorien, die dynamisch augmentierte Regressionen und einen Markov-Ansatz endlicher Ordnung verwenden {source:pesaranTimmermannSerialCategories2009}. Untersuchungen zu Richtungsprognosen zeigen ebenfalls, dass herkömmliche, auf Unabhängigkeit beruhende PT-Verfahren bei serieller Korrelation zu häufig verwerfen können, und prüfen robuste Alternativen einschließlich Bootstrap-Verfahren {source:blaskowitzHerwartzDirectionalSerialCorrelation2014}. Welche Methode passt, hängt von der Erzeugung der Prognosen, dem Prognosehorizont und der Abhängigkeitsstruktur ab. Ein allgemeines Resampling-Verfahren ist nicht automatisch gültig.

Gib an, ob sich Prognoseursprünge überschneiden, wie weit sie auseinanderliegen und welche Methode für Abhängigkeit die Unsicherheitsschätzung liefert. Wenn du die Lehrbuchstatistik als beschreibenden Vergleich berichtest, kennzeichne ihre Unabhängigkeitsannahme. Interpretiere ein nominelles Ergebnis auf dem 5-%-Niveau nicht so, als läge die tatsächliche Falschverwerfungsrate bei 5 %, wenn das Design diese Annahme verletzt.

Bewerte Prognosen, die zum jeweiligen Zeitpunkt tatsächlich möglich waren

Bewahre für jeden Prognoseursprung exakt die damals verfügbare Prognose, den Prognosehorizont, den Informationsstichtag, das realisierte Ergebnis und die Regel zur Umwandlung in eine Aufwärts-/Abwärtskategorie auf. Gleiche Zeitstempel, Instrumente, Preis- oder Renditedefinitionen und den Umgang mit fehlenden Werten ab, bevor du die Tafel bildest. Eine Prognose auf Basis revidierter Makrodaten oder eines im Evaluationszeitraum abgestimmten Signals ist keine unangetastete Out-of-Sample-Prognose.

Lege den Klassifikationsschwellenwert vor Einsicht in die Holdout-Ergebnisse fest. Gibt ein Modell eine Wahrscheinlichkeit aus, wandelt der Schwellenwert sie in eine binäre Richtung um. Schwellenwerte in derselben Stichprobe zu durchsuchen, ändert die Fragestellung und erzeugt Selektionsverzerrung. Halte Training, Validierung und abschließende Evaluation getrennt. Soll ein Resampling die Modellsuche berücksichtigen, muss der gesamte Auswahlprozess darin erneut ausgeführt werden.

Der PT-Test stellt eine andere Frage als der Vergleich von Prognosefehlergrößen. Der Leitfaden zum Diebold–Mariano-Test vergleicht gepaarte Verlustdifferenzen; der Giacomini–White-Leitfaden fragt, ob sich die relative Prognosefähigkeit mit vorab festgelegten Informationen verändert. Für verschachtelte Prognosemodelle siehe den Leitfaden zur Clark–West-Anpassung. Diese Tests beantworten verschiedene Fragen und sollten nicht allein deshalb ausgetauscht werden, weil sie vertraute Teststatistiken liefern.

Signifikanz der Richtung belegt keine profitable Strategie

Der PT-Test reduziert jedes Ergebnis auf eine Richtungskategorie. Ein Anstieg um einen Tick und eine starke Rally zählen gleichermaßen als aufwärts; ein kleiner Fehlgriff und ein schwerer Verlust zählen beide als ein Richtungsfehler. Eine Prognose kann ihre Trefferquote daher verbessern und trotzdem Geld verlieren, wenn die Verluste größer als die Gewinne sind, das Signal erst nach einer Kursbewegung eintrifft oder Handelskosten den Vorteil aufzehren.

Bei 100 hypothetischen Trades gleicher Größe bringen 64 richtige Richtungen je durchschnittlich 0.10 % Gewinn, während 36 falsche je 0.25 % verlieren. Die einfache Bruttosumme vor Kosten ist \(64(0.10\%)-36(0.25\%)=-2.6\) Prozentpunkte – trotz 64 % Trefferquote. Die Rechnung ignoriert Aufzinsung und ist kein Marktnachweis; die Trefferquote allein bestimmt nicht den Erwartungswert.

Lege für die Bewertung eines Trades Einstieg und Ausstieg, Positionsgröße, Risikogrenzen und den Umgang mit nicht ausgeführten Orders fest, bevor du Renditen berechnest. Berücksichtige gegebenenfalls Geld-Brief-Spanne, Provisionen, Slippage, Markteinfluss, Finanzierung und börsenspezifische Kosten. Vergleiche Netto-Out-of-Sample-Renditen mit einer passenden Benchmark und berücksichtige dieselbe Mehrfachsuche, aus der die Regel hervorging. Das PT-Ergebnis kann ein Beleg für einen Richtungszusammenhang sein; es ersetzt keine umsetzbare Bewertung nach Kosten.

Häufige Fragen

Q1Vergleicht der Pesaran–Timmermann-Test die Genauigkeit mit 50 %?

Nein. Er vergleicht die beobachtete Übereinstimmung mit einer Unabhängigkeits-Baseline, die aus den tatsächlichen und prognostizierten Aufwärtsanteilen getrennt berechnet wird. Diese Baseline kann über oder unter 50 % liegen.

Q2Kann ich den üblichen PT-p-Wert verwenden, wenn sich Prognosehorizonte überschneiden?

Nicht ohne die Abhängigkeit zu berücksichtigen. Überlappende Ziele und anhaltende Richtungslabels können die übliche, auf Unabhängigkeit beruhende Unsicherheitsschätzung zu klein machen. Verwende eine Methode, deren Annahmen zu Prognosehorizont und Abhängigkeitsstruktur passen.

Q3Bedeutet ein signifikantes PT-Ergebnis, dass die Handelsstrategie profitabel ist?

Nein. Der Test verwendet Richtungskategorien und misst weder Bewegungsgröße noch Ein- und Ausstiegspreise, Positionsgröße, Gebühren, Slippage oder Finanzierung. Bewerte die Netto-Out-of-Sample-Renditen separat.

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Wenn die tatsächlichen Ergebnisse zu 60 % aufwärts sind und Prognosen zu 70 % aufwärts lauten, wie hoch ist die Unabhängigkeits-Baseline für Übereinstimmung?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Klare Definitionen wichtiger Begriffe — von Calls, Puts und Optionsketten bis zu impliziter Volatilität, Griechen und Geld-Brief-Spanne

Optionsglossar öffnen