Engle–Ng-Tests auf Vorzeichen- und Größenbias in Volatilitätsmodellen
So prüfen die Engle–Ng-Tests, ob ein geschätztes Volatilitätsmodell Muster vergangener Schocks übersieht
In diesem LeitfadenWarum Schockvorzeichen und -größe nach der Schätzung prüfen?
Kurze Zusammenfassung
Die Engle–Ng-Tests prüfen, ob ein geschätztes Volatilitätsmodell in quadrierten standardisierten Residuen vorhersehbare Muster hinterlässt. Sie diagnostizieren ausgewählte Formen einer Fehlspezifikation; sie belegen weder Kausalität noch einen Handelsvorteil.
Warum Schockvorzeichen und -größe nach der Schätzung prüfen?
Ein Volatilitätsmodell kann Cluster in Renditegrößen erfassen und dennoch übersehen, dass verschiedene Schocks die künftige Varianz unterschiedlich beeinflussen. Ein symmetrisches GARCH-Modell weist gleich großen positiven und negativen Innovationen denselben Varianzeffekt zu. Bleiben danach unterschiedliche Muster in den standardisierten Residuen, kann diese Einschränkung für die Stichprobe zu stark sein.
Engle und Ng behandeln dies als Diagnose nach der Schätzung: Erklären Vorzeichen oder Größe der vorherigen Innovation das heutige quadrierte normalisierte Residuum? Die Originalarbeit definiert die News-Impact-Kurve und vergleicht Modelle anhand täglicher japanischer Aktienrenditen. Diese Rangfolge gilt für jene Stichprobe, nicht für alle Märkte (Engle und Ng, 1993).
„Bias“ bezeichnet hier ein nicht erklärtes Muster nach Vorzeichen oder Größe, keine statistische Verzerrung der Parameterschätzung. Bestimmen Sie zuerst ein GARCH-Modell und prüfen Sie dann, ob seine Schockreaktion zum Zweck und zur Stichprobe passt.
Innovation und standardisiertes Residuum definieren
Schreiben Sie die Rendite als:
\[ r_t = \mu_t + \epsilon_t, \]
Dabei ist \(\mu_t\) der bedingte Mittelwert und \(\epsilon_t\) die Innovation nach der Schätzung des Mittelwertmodells. \(h_t\) ist die geschätzte bedingte Varianz; das standardisierte Residuum setzt die Innovation ins Verhältnis zur vom Modell vorhergesagten Varianzskala.
\[ h_t=\operatorname{Var}(\epsilon_t\mid\mathcal F_{t-1}), \qquad \hat z_t=\frac{\hat\epsilon_t}{\sqrt{\hat h_t}}. \]
Bei passender Varianzspezifikation sollte \(\hat z_t^2\) nach bestimmten vergangenen Schocks nicht systematisch höher oder niedriger sein, als das beibehaltene Modell erklärt. Die Standardisierung entfernt die vorhergesagte Skala; quadrierte Rohresiduen können gewöhnliches Volatilitätsclustering behalten. Legen Sie Mittelwertgleichung, Residuum, Varianz, Stichprobe und Einheiten fest, bevor Sie p-Werte deuten.
Vorzeichen- und Größenregressoren bilden
Definieren Sie den Indikator einer negativen vorherigen Innovation und sein Komplement:
\[ S^-_{t-1}=\mathbf 1(\hat\epsilon_{t-1}<0), \qquad S^+_{t-1}=1-S^-_{t-1}. \]
Der Vorzeichentest verwendet \(S^-\), der Test negativer Größen \(S^-\hat\epsilon\), der Test positiver Größen \(S^+\hat\epsilon\). Sie beantworten verschiedene Fragen: zählt nur das Vorzeichen, und liefert die Größe innerhalb eines Zweigs zusätzliche Information? Legen Sie fest, wie eine Innovation von null eingeordnet wird und welche Einheiten gelten; Größenkoeffizienten hängen von den Einheiten ab.
Die News-Impact-Kurve zeigt, wie eine Modellspezifikation bei festgehaltenen Zustandsgrößen einen neuen Schock auf die nächste bedingte Varianz überträgt. Die symmetrische GARCH-Kurve ist um null symmetrisch; asymmetrische Spezifikationen lockern die Einschränkung. Das ist eine Modelleigenschaft, keine direkt gemessene kausale Marktreaktion.
\(\mathbf z_{ot}^*\) ist der Vektor der normalisierten Ableitungen der beibehaltenen bedingten Varianz nach den Störparametern, ausgewertet unter der Nullhypothese. Es sind Score-/Ableitungsterme und nicht zwingend die ursprünglichen Varianzregressoren. Jede Hilfsregression ergänzt einen Vorzeichen- oder Größenregressor und hält diese Terme fest.
Vorzeichenbias: bleibt nach negativen Schocks ein Muster?
Der Test fragt, ob das Vorzeichen der vorherigen Innovation das heutige quadrierte standardisierte Residuum vorhersagt. Eine einfache Hilfsregression lautet:
\[ \hat z_t^2=a+b_s S^-_{t-1}+\boldsymbol{\beta}^{\top}\mathbf z_{ot}^*+v_t. \]
Die individuelle Nullhypothese lautet \(b_s=0\). In der vollständigen Implementierung bleiben die in der Testvorschrift vorgesehenen Modellterme enthalten; geprüft wird der zusätzliche Erklärungsbeitrag des Indikators. Ein signifikanter Koeffizient zeigt bedingt auf das geschätzte Modell unterschiedliche Residualvarianz-Muster nach negativen und nichtnegativen Schocks.
Das bedeutet nicht, dass negative Renditen stets die Volatilität erhöhen. Der Test identifiziert weder einen kausalen Mechanismus noch jede mögliche nichtlineare Reaktion. Eine Zurückweisung ist ein Anlass, Modell und Daten zu prüfen.
Bias negativer Größen: liefert die Größe negativer Schocks Zusatzinformation?
Dieser Test betrachtet den negativen Zweig und fragt, ob die Größe der Innovation ein verbleibendes Muster erklärt:
\[ \hat z_t^2=a+b_- S^-_{t-1}\hat\epsilon_{t-1}+\boldsymbol{\beta}^{\top}\mathbf z_{ot}^*+v_t. \]
Die individuelle Nullhypothese ist \(b_-=0\). Da die Innovation bei Indikatorwert eins negativ ist, hängt die Koeffizienteninterpretation von Vorzeichenkonvention und Einheit ab. Der Test prüft, ob die Größe negativer Schocks über das Modell hinaus Information liefert; er beweist weder einen Kausaleffekt schlechter Nachrichten noch bessere Prognosen.
Die Hilfsregressoren können korreliert sein; deshalb lässt sich der Beitrag einzelner Terme mitunter schwer isolieren. Interpretieren Sie Einzeltests zusammen mit der vollständigen Testgleichung und dem gemeinsamen Test.
Asymmetrische Varianzmodelle wie GJR werden in verwandten Arbeiten verglichen; deren empirische Aussage gilt jedoch nur unter den jeweiligen Daten und Annahmen (Glosten, Jagannathan und Runkle, 1993).
<!-- learn:illustration -->

Bias positiver Größen: zählt auch die Größe positiver Schocks?
Der entsprechende Test untersucht positive Innovationen:
\[ \hat z_t^2=a+b_+ S^+_{t-1}\hat\epsilon_{t-1}+\boldsymbol{\beta}^{\top}\mathbf z_{ot}^*+v_t. \]
Die Nullhypothese lautet \(b_+=0\). Dieser Test kann signifikant sein, auch wenn der Vorzeichentest es nicht ist: Innerhalb eines Zweigs kann sich die Reaktion nach Größe unterscheiden, ohne dass sich die durchschnittlichen Muster nach Vorzeichen unterscheiden.
„Bias positiver Größen“ heißt nicht, dass positive Renditen die Volatilität notwendigerweise erhöhen oder senken. Nelsons EGARCH und Zakoïans Schwellenmodell erlauben asymmetrische Dynamiken; sie sind zu prüfende Alternativen, keine automatische Korrektur oder stets überlegene Modelle.
(Nelson, 1991; Zakoian, 199490039-6)).
Gemeinsamer Test: fehlt einer der drei Terme?
Alle drei Regressoren lassen sich in einer Hilfsregression gemeinsam testen:
\[ \hat z_t^2=a+b_1S^-_{t-1}+b_2S^-_{t-1}\hat\epsilon_{t-1}+b_3S^+_{t-1}\hat\epsilon_{t-1}+\boldsymbol{\beta}^{\top}\mathbf z_{ot}^*+v_t. \]
Die gemeinsame Nullhypothese lautet \(b_1=b_2=b_3=0\). Unter der beibehaltenen Spezifikation und üblichen Großstichprobenbedingungen wird die LM-Statistik asymptotisch mit einer Chi-Quadrat-Verteilung mit drei Freiheitsgraden verglichen. Eine gängige Form ist \(LM=M R^2\), wobei \(M\) die verwendeten Zeilen und \(R^2\) das Bestimmtheitsmaß der angegebenen Regression bezeichnet. Folgen Sie der konkreten Implementierung und ihren Regeln für endliche Stichproben.
Engle und Ng merken an: Ohne \(\mathbf z_{ot}^*\) ist der gemeinsame Test konservativ; seine Größe überschreitet das nominale Niveau nicht, seine Teststärke kann aber sinken.
Rein hypothetisch: Bei \(M=400\) und \(R^2=0.012\) ergibt sich \(LM=4.8\). Der 5%-kritische Wert für Chi-Quadrat mit drei Freiheitsgraden liegt bei ungefähr 7.81; hier wird also nicht verworfen. Diese Zahlen sind kein empirisches Ergebnis und beweisen keine Symmetrie.
Ergebnisse mit Blick auf Teststärke und Kollinearität deuten
Ein kleiner p-Wert begründet die Prüfung eines bestimmten Restmusters, wählt aber kein Ersatzmodell aus und beweist weder einen strukturellen Leverage-Mechanismus noch ökonomischen Prognosewert. Ein großer p-Wert zeigt nur, dass der Test das ausgewählte Muster in dieser Stichprobe nicht gefunden hat.
Die Hilfsregressoren können korreliert sein, besonders Vorzeichenindikator und Term negativer Größe; das kann die Teststärke einzelner Tests mindern. Stichprobengröße, Schätzung und beibehaltene Spezifikation zählen ebenfalls. Viele Kombinationen aus Assets, Modellen, Lags und Zeitfenstern erhöhen die Chance zufällig kleiner p-Werte.
Ausreißer, Sprünge, Strukturbrüche, ein ausgelassener bedingter Mittelwert oder inkonsistente Innovationseinheiten können Ergebnisse verändern. Dokumentieren Sie Renditedefinition, Schätzfenster, Vorzeichenregel und Inferenzverfahren; nennen Sie Grenzen asymptotischer Näherungen und erwägen Sie geeignetes Resampling.
Diagnosen zusammen mit anderen Modellprüfungen verwenden
Der ARCH-LM-Test fragt, ob verzögerte quadrierte Residuen das aktuelle quadrierte Residuum erklären; siehe den ARCH-LM-Leitfaden. Engle–Ng prüft bestimmte Vorzeichen- und Zweiggrößenterme. Der Ljung–Box-Test untersucht Residuenautokorrelation und beantwortet eine andere Frage.
Nach einer Zurückweisung können Sie ein asymmetrisches Modell wie GJR-GARCH, EGARCH oder ein Schwellenmodell schätzen, Residuen erneut prüfen und Prognosen separat bewerten. QLIKE und quadratischer Fehler bewerten Prognosen nach ihrer Erstellung und ersetzen keine Residualdiagnose.
Wird die Volatilitätsprognose in einer Handelsregel verwendet, prüfen Sie sie außerhalb der Stichprobe mit Gebühren, Spread, Markteinfluss, Finanzierung und Risikolimits. Der Vorzeichen- und Größentest ist kein Kauf- oder Verkaufssignal.
Häufige Fragen
Q1Messen Vorzeichen- und Größenbias-Tests die Verzerrung geschätzter GARCH-Koeffizienten?
Nein. „Bias“ meint ein verbleibendes Muster in quadrierten standardisierten Residuen, nicht statistische Verzerrung der Parameterschätzung.
Q2Beweist ein nicht signifikanter gemeinsamer Test, dass das Volatilitätsmodell symmetrisch ist?
Nein. Der Test hat ausgewählte Terme in dieser Stichprobe nicht gefunden; geringe Teststärke, Kollinearität und kleine Stichproben bleiben relevant.
Q3Ist der Engle–Ng-Test dasselbe wie der ARCH-LM-Test?
Nein. ARCH LM prüft Abhängigkeit quadrierter Residuen von ihren Lags; Engle–Ng prüft ausgewählte Vorzeichen- und Zweiggrößenterme.
Q4Bedeutet eine Zurückweisung, dass negative Renditen ein profitables Handelssignal sind?
Nein. Es ist eine Diagnose nach der Schätzung und belegt weder die Renditerichtung noch Profitabilität nach Ausführungskosten.
Quellen und weiterführende Lektüre
Problem melden
Wir bereiten eine E-Mail mit dem Link zu diesem Artikel vor. Mark erhält den Hinweis erst nach dem Senden
Schnelltest
Fertig gelesen? Prüfe dich mit 3 Fragen
Frage 01
Was prüft der Vorzeichenbias-Test nach der Schätzung eines Volatilitätsmodells?
Wähle eine Antwort, um die Erklärung zu sehen
Optionsglossar
A time-series model that updates conditional variance from past squared shocks and prior variance; it models volatility persistence, not return direction.
Detaillierten Leitfaden lesenIV rankThe current IV's position between a lookback-period low and high; one outlier can distort it, so it should not be read as a standalone signal.
Detaillierten Leitfaden lesen