Skip to content
Alle Leitfäden zu Optionen und Futures
Vergleich von Zeitreihentests15 Min. Lesezeit

ADF oder Phillips–Perron: Unterschiede bei Unit-Root-Tests

Vergleiche ADF- und Phillips–Perron-Unit-Root-Tests: gemeinsame Nullhypothese, deterministische Terme, Lag- und Bandbreitenkorrektur sowie Grenzen endlicher Stichproben

In diesem LeitfadenBeide Tests haben die Einheitswurzel als Nullhypothese

Kurze Zusammenfassung

Der augmentierte Dickey–Fuller-Test (ADF) und der Phillips–Perron-Test (PP) beginnen meist mit derselben Frage: Hat eine Zeitreihe eine Einheitswurzel? Sie unterscheiden sich vor allem darin, wie sie serielle Abhängigkeit in der Testregression behandeln. ADF nimmt verzögerte Differenzen auf; PP korrigiert die Statistik einer kürzeren Regression mithilfe einer Schätzung der langfristigen Kovarianz. Beide brauchen eine bewusst gewählte deterministische Spezifikation und nichtstandardmäßige kritische Werte. Keiner der beiden Tests ordnet automatisch eine Differenzierung an.

Beide Tests haben die Einheitswurzel als Nullhypothese

In einer autoregressiven Gleichung für das Niveau bedeutet eine Einheitswurzel, dass ein Schock im Niveau nicht abklingen muss. Schreibt man die erste Differenz als Regression auf das verzögerte Niveau, wird die Hypothese sichtbar: Ist der Koeffizient des verzögerten Niveaus null, hat der Prozess unter dem festgelegten Modell eine Wurzel bei eins. Ein negativer Koeffizient spricht unter den gewählten deterministischen Termen und den übrigen Annahmen in Richtung einer stationären Alternative.

Die Nullhypothese lautet bei üblichen ADF- und PP-Implementierungen also nicht „die Reihe ist stationär“. Sie lautet, dass eine Einheitswurzel vorliegt. Die Alternative ist Stationarität um die gewählte deterministische Komponente. Wird die Null nicht verworfen, ist damit eine Einheitswurzel nicht bewiesen. Die Stichprobe kann schlicht zu wenig Information enthalten, um sie von einem sehr persistenten stationären Prozess mit einem autoregressiven Parameter nahe eins zu unterscheiden.

Das ist etwas anderes als bei einem Test mit Stationarität als Nullhypothese, etwa KPSS, oder bei einem direkten Kointegrationstest. Der Leitfaden zu Stationarität und Einheitswurzeln erklärt die übergeordneten Begriffe; der Engle–Granger-Leitfaden behandelt den Sonderfall, dass eine lineare Kombination nichtstationärer Reihen stationär ist.

Lege deterministische Terme fest, bevor du kritische Werte liest

Eine Unit-Root-Regression kann keine deterministischen Terme, eine Konstante oder eine Konstante zusammen mit einem linearen Zeittrend enthalten. Das sind keine bloßen Schalter für die Darstellung. Eine Konstante lässt unter der Einheitswurzel-Null einen Drift und unter der stationären Alternative einen von null verschiedenen Mittelwert zu. Ein Zeittrend erlaubt, dass die stationäre Alternative um einen deterministischen Trend schwankt. Mit den Termen ändern sich das Modell und die Nullverteilung.

Ein unnötiger Trend kann die Teststärke verringern, weil zusätzliche Parameter geschätzt werden. Wird ein tatsächlich vorhandener Drift oder Trend weggelassen, können Testgröße und Interpretation verzerrt sein. Wähle die Spezifikation anhand der Frage zum Datenerzeugungsprozess und des Zeitreihenverlaufs, nenne sie ausdrücklich und verwende die dazu passenden kritischen Werte. Entscheide nicht nachträglich zugunsten der Spezifikation, die die gewünschte Ablehnung liefert.

Dasselbe gilt für Logpreise, Spreads, Zinssätze und Renditen. Ein steigender Trend kann für ein Preisniveau plausibel sein, für Renditen aber nicht. Der Test bestimmt nicht selbst, welche ökonomische Größe untersucht werden soll. Deterministische Komponenten sind Teil der Hypothese und keine versteckte Vorverarbeitung.

ADF fängt Abhängigkeit mit verzögerten Differenzen auf

Die augmentierte Dickey–Fuller-Regression lässt sich so schreiben:

Δyₜ = dₜ′δ + γyₜ₋₁ + Σᵢ₌₁ᵖ φᵢΔyₜ₋ᵢ + εₜ

Dabei enthält dₜ die gewählten deterministischen Terme; die Nullhypothese lautet H₀: γ = 0. Die zusätzlichen verzögerten Differenzen sollen dafür sorgen, dass sich die verbleibende Störgröße für die Testapproximation hinreichend gut verhält. Sie modellieren kurzfristige Dynamik parametrisch in der Regression und ergänzen keine weitere Einheitswurzelrestriktion.

Die Lag-Ordnung p ist entscheidend. Zu wenige Lags können serielle Korrelation in εₜ zurücklassen und die beabsichtigte Approximation beeinträchtigen. Zu viele kosten Freiheitsgrade und schwächen den Test, insbesondere bei kurzen Stichproben. Beginne mit einer angegebenen maximalen Lag-Zahl, vergleiche ein vertretbares Informationskriterium mit Residualdiagnostik und lege offen, ob benachbarte Lag-Wahlen das Ergebnis ändern. Ein kleiner ausgewählter Lag beweist nicht, dass verbleibende Abhängigkeit harmlos ist. Harris (1992)90022-Q) untersucht praktische Entscheidungen zur ADF-Lagstruktur, Testgröße und Teststärke.

In manchen Prozessen ist die Lag-Wahl schwierig. Ng und Perron zeigen, dass ein Moving-Average-Pol nahe −1 in den von ihnen untersuchten Unit-Root-Verfahren dazu führen kann, dass herkömmliches AIC oder BIC zu wenige Augmentierungslags wählen. Ihre modifizierten Informationskriterien sind für Unit-Root-Verfahren mit GLS-Detrending und verwandte Tests konzipiert. Das ist eine Warnung für bestimmte Dynamiken, keine allgemeine Regel, dass ein bestimmtes Kriterium oder längere Lags immer besser sind.

PP verwendet eine kürzere Regression und korrigiert die Teststatistik

Der Phillips–Perron-Test beginnt mit einer Regression nach Art des Dickey–Fuller-Tests, jedoch ohne die Summe verzögerter Differenzen des ADF:

Δyₜ = dₜ′δ + γyₜ₋₁ + uₜ

Danach korrigiert er die Teststatistik mithilfe von Schätzungen der kurzfristigen Varianz und der langfristigen Kovarianz. Eine verbreitete Form der Langfrist-Varianzschätzung ist:

Ω̂ₗ = γ̂₀ + 2Σⱼ₌₁ˡ K(j/(ℓ+1))γ̂ⱼ

Hier sind γ̂ⱼ die Residuen-Autokovarianzen, K ist ein Kernelgewicht und ℓ eine Bandbreiten- oder Trunkierungswahl. Die genaue Definition hängt von der PP-Statistik und der Softwarekonvention ab. Der konzeptionelle Unterschied bleibt: ADF ergänzt verzögerte Differenzen in der Regression; PP wendet eine nichtparametrische Abhängigkeitskorrektur auf die Statistik einer kürzeren Regression an.

PP ist nicht einfach „ADF mit robusten Standardfehlern“. Die Korrektur verändert die Unit-Root-Statistik und ihre asymptotische Behandlung; eine gewöhnliche robuste Regressionsausgabe macht die üblichen t-kritischen Werte nicht gültig. Kernel und Bandbreite bestimmen, wie viel Abhängigkeit die Korrektur erfasst. Eine zu kleine Bandbreite kann relevante Korrelation auslassen; eine zu große kann die Langfrist-Varianzschätzung verrauschen.

<!-- learn:illustration -->

Ein schwankender Zeitreihenpfad verzweigt sich in verzögerte Differenzen und eine Langfrist-Kovarianzkorrektur, die zu asymmetrischen Referenzverteilungen führen
Konzeptionelle Darstellung zweier Ansätze zum Umgang mit Abhängigkeit in Unit-Root-Tests. Keine Marktdaten, Prognose oder Handelssignal.

Die Referenzverteilungen sind keine gewöhnlichen t-Verteilungen

Unter der Einheitswurzel-Null entsteht das verzögerte Niveau aus einem stochastischen Trend und nicht aus einem stationären Regressor. Deshalb haben DF-Statistiken nichtstandardmäßige Grenzverteilungen. Auch bei großen Stichproben ist die übliche t-Tabelle nicht die passende Referenz. Kritische Werte hängen davon ab, ob Konstante und Zeittrend enthalten sind, sowie von Statistik und Implementierung.

PP-Statistiken werden zwar um Abhängigkeit korrigiert, aber die Einheitswurzel-Null wird weiterhin mit dem passenden nichtstandardmäßigen Referenzgesetz bewertet. Nutze kritische Werte oder p-Werte einer anerkannten Implementierung, die zu deterministischen Termen und Statistik passen. Vergleiche keinen ADF-Wert aus einer Spezifikation mit PP-Kritischen einer anderen und lies einen angezeigten Koeffizienten-t-Wert nicht wie eine gewöhnliche Student-t-Statistik.

Asymptotische Kalibrierung garantiert kein gutes Verhalten in jeder endlichen Stichprobe. Schwerts Monte-Carlo-Untersuchung berichtet, dass Unit-Root-Verfahren empfindlich auf Modellspezifikationsfehler reagieren und sich im endlichen Sample unterschiedlich verhalten. Beurteile einen p-Wert deshalb zusammen mit Stichprobenlänge, Abhängigkeitsstruktur, Lag- oder Bandbreitenwahl und Regression.

Entscheidungen im endlichen Sample können Größe und Stärke ändern

Die Testgröße ist die Wahrscheinlichkeit, eine wahre Einheitswurzel-Null abzulehnen; die Teststärke ist die Wahrscheinlichkeit der Ablehnung unter einer festgelegten stationären Alternative. Ist die Testgröße bei der tatsächlichen Abhängigkeitsstruktur falsch, kann ein Ergebnis überzeugend aussehen und dennoch fehlleiten. ADF-Lags und PP-Langfristkorrektur behandeln verwandte Abhängigkeitsprobleme mit unterschiedlichen Approximationen. Das Ergebnis des einen bestätigt daher nicht automatisch die Robustheit des anderen.

Prüfe beim ADF, ob nach der Laganpassung noch Residuenautokorrelation besteht und ob ein zusätzlicher Lag die Inferenz merklich verändert. Berichte bei PP Kernel und Bandbreitenregel und untersuche vertretbare Alternativen. Das sind Sensitivitätsprüfungen, keine Erlaubnis, viele Spezifikationen auszuprobieren und nur den günstigsten p-Wert zu behalten. Ng und Perron zeigen außerdem, dass Lag-Wahl mit Störprozess und deterministischem Detrending zusammenwirkt; ein mechanisches Informationskriterium löst nicht jedes Design.

Gegen sehr persistente stationäre Alternativen können beide Tests geringe Teststärke haben. Eine Nichtverwerfung liefert keinen positiven Beleg dafür, dass Differenzierung erforderlich ist. Bei kurzen Stichproben, einer Wurzel nahe eins oder einer für das Modell zentralen Schlussfolgerung solltest du ergänzende Evidenz und Verfahren mit klar benannten Annahmen heranziehen, statt ADF und PP als unabhängige Stimmen zu zählen.

Strukturbrüche und Transformationen erschweren die Einheitswurzeldeutung

Ein Niveausprung, Trendwechsel, Politikregime, Wechselkursbindung oder Marktstrukturwechsel kann eine Reihe persistent erscheinen lassen, obwohl stationäre Abschnitte um einen veränderlichen deterministischen Pfad angemessener sein können. Perrons Analyse großer historischer Veränderungen zeigt, dass die Einheitswurzel-Schlussfolgerung davon abhängen kann, ob ein Bruch zugelassen wird. Standard-ADF und -PP entdecken nicht automatisch jeden Strukturbruch.

Stelle die Reihe grafisch dar, dokumentiere bekannte institutionelle Änderungen und prüfe, ob ein bruchbewusster Test oder ein segmentiertes Modell die Frage trifft. Eine nachträgliche Suche nach einem Bruch in derselben Stichprobe kann die Inferenz beeinflussen. Verwende deshalb ein Verfahren mit kritischen Werten für diese Suche oder kennzeichne die Analyse als explorativ. Der Bai–Perron-Leitfaden behandelt die Schätzung von Regressionsbrüchen, nicht eine direkte Korrektur des unveränderten ADF oder PP.

Auch die Transformation ist wichtig. Preisniveau, Logpreis, Preisspread und Rendite sind ökonomisch verschiedene Variablen. Die Differenzierung eines vermutlich unit-root-behafteten Niveaus kann eine stabilere Reihe ergeben; die Differenzierung eines stationären Niveaus kann Information verwerfen und eine unnötig verrauschte Spezifikation erzeugen. In Paarstrategien kann Kointegrationsanalyse getrennte stochastische Trends von einem möglicherweise stationären Spread unterscheiden. Keine dieser Diagnosen allein belegt eine profitable Strategie.

Eine gemeinsame Gleichung zeigt, was sich ändert und was nicht

Angenommen, ein hypothetisches Niveau folgt:

yₜ = yₜ₋₁ + μ + εₜ

Dabei ist μ ein konstanter Drift und εₜ kann seriell abhängige Innovationen enthalten. Zieht man yₜ₋₁ ab, erhält man Δyₜ = μ + εₜ; der Koeffizient γ des verzögerten Niveaus ist in der entsprechenden Differenzregression null. Das ist die algebraische Form der Einheitswurzel-Null. Sie liefert keinen p-Wert: Das Referenzgesetz bleibt nichtstandardmäßig und hängt von deterministischen Termen und Abhängigkeitsbehandlung ab.

Bei ADF versuchen verzögerte Differenzen, kurzfristige Abhängigkeit in der Regression darzustellen. Bei PP bleibt die Basisgleichung kürzer und die Statistik erhält eine geschätzte Langfrist-Kovarianzkorrektur. Hat die Reihe stattdessen einen Bruch im deterministischen Trend, können beide Standardimplementierungen falsch spezifiziert sein, selbst wenn die Software eine scheinbar präzise Statistik meldet.

Der Vergleich hat also drei Ebenen: die inhaltliche Null, die Regressions- und Deterministikspezifikation sowie die Korrektur für verbleibende Abhängigkeit. Werden die ersten beiden festgehalten, sind ADF und PP nützliche alternative Diagnosen. Alle drei Ebenen so lange zu verändern, bis ein Test verwirft, ist kein Robustheitstest. Abweichende Ergebnisse sind ein Anlass, Annahmen und Einstellungen zu prüfen, nicht ein Wettbewerb, dessen Gewinner das Modell automatisch bestimmt.

Berichte die Spezifikation und nutze das Ergebnis als Evidenz, nicht als Befehl

Nenne Variable und Transformation, Stichprobenzeitraum, Frequenz, deterministische Terme und die ADF-Lagregel samt ausgewählter Ordnung oder bei PP Statistik, Kernel und Bandbreite. Gib Null und Alternative, Statistik, passenden kritischen Wert oder p-Wert sowie Prüfungen auf Residuenautokorrelation und Brüche an. Wenn das Ergebnis auf vertretbare Einstellungen empfindlich reagiert, gehört das in den Bericht; zeige nicht nur die Spezifikation, die eine bevorzugte Erzählung stützt.

Ein sinnvoller Ablauf beginnt mit Zielgröße und ökonomischem Modell, legt die deterministischen Terme fest, schätzt einen passend spezifizierten ADF- oder PP-Test, prüft Abhängigkeit und mögliche Brüche und vergleicht das Ergebnis mit ergänzender Evidenz. Der Varianzquotiententest-Leitfaden untersucht eine andere Implikation des Random Walks. Er hat nicht dieselbe Nullhypothese und ersetzt keinen Unit-Root-Test.

Weder ADF noch PP befiehlt eine Differenzierung, sobald ein p-Wert einen Schwellenwert überschreitet. Differenzierung ist eine Modellentscheidung, die von Reihe und Frage abhängt: Prognose von Veränderungen, Schätzung einer langfristigen Beziehung, Test eines Handelsspreads oder Erhalt von Niveauinformation können verschiedene Entscheidungen nahelegen. Ein Test unterstützt diese Entscheidung; die Transformation sollte außerdem Datenerzeugung, Stabilität, Prognoseziel und mögliche Kointegrationsstruktur berücksichtigen.

Häufige Fragen

Q1Testen ADF und PP dieselbe Nullhypothese?

Meistens ja: Beide testen eine Einheitswurzel gegen eine stationäre Alternative, die durch die gewählten deterministischen Terme bestimmt wird. Sie behandeln serielle Abhängigkeit unterschiedlich, aber Spezifikation und kritische Werte müssen jeweils passen.

Q2Ist PP einfach ADF mit robusten Standardfehlern?

Nein. PP verändert die Unit-Root-Statistik mit einer nichtparametrischen Langfrist-Kovarianzschätzung. Ein generischer robuster Standardfehler bildet diese Korrektur nicht nach und macht die gewöhnliche t-Verteilung nicht passend.

Q3Welchem Test sollte ich vertrauen, wenn die Ergebnisse voneinander abweichen?

Keiner gewinnt automatisch. Prüfe deterministische Terme, ADF-Lag, PP-Kernel und -Bandbreite, verbleibende Abhängigkeit, Stichprobengröße und mögliche Brüche. Berichte die Sensitivität und nutze ergänzende Evidenz, die zur Frage passt.

Q4Bedeutet Nichtverwerfung, dass ich die Reihe differenzieren sollte?

Nein. Sie ist ein Hinweis auf Persistenz unter einem bestimmten Modell. Wähle Transformationen nach Variable, Ziel, Stabilität und langfristiger Beziehung; Überdifferenzierung kann nützliche Information verwerfen. Primärforschung - Dickey and Fuller, “Distribution of the Estimators for Autoregressive Time Series with a Unit Root” (1979) - Harris, “Testing for Unit Roots Using the Augmented Dickey–Fuller Test: Some Issues Relating to the Size, Power and the Lag Structure of the Test” (1992)90022-Q) - Phillips and Perron, “Testing for a Unit Root in Time Series Regression” (1988) - Schwert, “Tests for Unit Roots: A Monte Carlo Investigation” (1989) - Ng and Perron, “Lag Length Selection and the Construction of Unit Root Tests with Good Size and Power” (2001) - Perron, “The Great Crash, the Oil Price Shock, and the Unit Root Hypothesis” (1989)

Quellen und weiterführende Lektüre

Problem melden

Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden

Schnelltest

Fertig gelesen? Prüfe dich mit 3 Fragen

Frage 1 / 3

Frage 01

Was ist die übliche gemeinsame Nullhypothese von ADF und PP?

Wähle eine Antwort, um die Erklärung zu sehen

Optionsglossar

Klare Definitionen wichtiger Begriffe — von Calls, Puts und Optionsketten bis zu impliziter Volatilität, Griechen und Geld-Brief-Spanne

Optionsglossar öffnen
Ein Stationaritätstest für ZeitreihenKPSS-Stationaritätstest: Nullhypothese, Statistik und BandbreiteErfahre, was der KPSS-Test voraussetzt, wie seine Partialsumme-Statistik berechnet wird, worin sich Niveau- und Trendfall unterscheiden und warum die Bandbreite das Ergebnis beeinflusst.Wie Residuen eine langfristige Beziehung erkennen lassenEngle–Granger-Kointegrationstest: Residuen und FehlerkorrekturErfahren Sie, wie der zweistufige Engle–Granger-Kointegrationstest funktioniert, warum Residuen-Unit-Root-Tests besondere kritische Werte benötigen und wie ein Fehlerkorrekturmodell zu interpretieren ist.Mehrere unbekannte Änderungen einer Regressionsbeziehung schätzenBai–Perron-Tests für mehrere Strukturbrüche in RegressionenErfahre, wie Bai–Perron-Verfahren eine unbekannte Zahl und Lage von Regressionsbrüchen durchsuchen, wie Trimming und kritische Werte wirken und was sich aus den Schätzungen nicht ableiten lässt.Prüfen, ob die Renditevarianz mit der Zeit wächstVarianzquotiententest: Random Walks, Horizonte und TradingErfahren Sie, wie ein Varianzquotient Einperioden- und Mehrperiodenrenditen vergleicht, was Werte über oder unter eins nahelegen und warum der Test keinen Handelsvorteil belegt.Ein Einheitswurzeltest mit einem StrukturbruchZivot–Andrews-Test: Einheitswurzel mit einem unbekannten BruchErfahre, wie der Zivot–Andrews-Test in einer Einheitswurzelregression nach einem unbekannten Bruch sucht, warum die Minimumstatistik eigene kritische Werte braucht und was die Nullhypothese auslässt.