Skip to content
Wszystkie przewodniki po opcjach
Ocena trafności prognoz14 min czytania

Test Diebolda–Mariano: jak porównywać trafność prognoz

Dowiedz się, jak test Diebolda–Mariano porównuje sparowane straty prognoz, uwzględnia nakładające się horyzonty i dlaczego niska wartość p nie dowodzi umiejętności w tradingu.

W tym przewodnikuNiższy błąd backtestu nie dowodzi jeszcze lepszej prognozy

Krótkie podsumowanie

Test Diebolda–Mariano porównuje dwie prognozy, analizując różnicę ich strat dla tych samych zrealizowanych wyników. Rezultat zależy od funkcji straty, próby ewaluacyjnej, horyzontu prognozy i sposobu szacowania niepewności. Niższy błąd w próbie nie stanowi automatycznie dowodu lepszej oczekiwanej trafności, a większa trafność prognozy nie oznacza zyskownej strategii handlowej.

Niższy błąd backtestu nie dowodzi jeszcze lepszej prognozy

Załóżmy, że dwa modele prognozują tę samą stopę zwrotu, zmienność albo wielkość ekonomiczną dla tych samych dat. W próbie ewaluacyjnej średni błąd modelu A jest mniejszy niż modelu B. Opisuje to próbę, lecz nie mówi, czy A jest wiarygodnie trafniejszy, czy zaobserwowana różnica wynika ze zwykłej zmienności dat, które akurat znalazły się w teście.

Test Diebolda–Mariano (DM) ujmuje to porównanie jako sparowany szereg czasowy. Dla każdego momentu prognozy zestawia obie prognozy z tym samym zrealizowanym wynikiem, ocenia je za pomocą ustalonej wcześniej funkcji straty, a następnie bada szereg różnic strat. Sparowanie ma znaczenie: dzień dużej zmienności na rynku może zwiększyć straty obu modeli, a porównanie sprawdza, który z nich zwykle traci mniej w te same dni.

Oryginalne podejście nie ogranicza się do błędu kwadratowego ani do błędów prognozy o rozkładzie normalnym. Może porównywać różne funkcje straty, także asymetryczne, jeśli ich oceny pasują do pytania prognostycznego. Potrzebny jest jednak uzasadniony projekt ewaluacji i oszacowanie niepewności średniej różnicy strat. Diebold i Mariano (1995) przedstawili test równej trafności predykcyjnej; Harvey, Leybourne i Newbold (1997)00719-4) przeanalizowali modyfikację dla małej próby.

Przed obliczeniem statystyki porównaj prognozy na tych samych zasadach

Każdy wiersz powinien odpowiadać porównywalnemu momentowi prognozy. Oba modele muszą prognozować tę samą zmienną docelową i ten sam horyzont, korzystając z informacji dostępnych w danym momencie. Przed porównaniem strat dopasuj zrealizowane wyniki, znaczniki czasu, walutę lub jednostkę, wersję danych i zasady dotyczące brakujących obserwacji. Jeśli jeden model prognozuje jutrzejszą cenę zamknięcia, a drugi średnią z pięciu dni, ich błędy odpowiadają na różne pytania.

Używaj prognoz utworzonych bez zaglądania w przyszłość. Chronologiczny zbiór odłożony lub kroczący schemat pseudo-out-of-sample może w tym pomóc, ale sam podział nie wystarczy, jeżeli ten sam zbiór wielokrotnie służył do dostrajania cech, progów albo wariantów modelu. Zachowaj prognozę faktycznie utworzoną w każdym historycznym momencie oraz wersję danych i modelu, które ją wygenerowały. Zrewidowane dane makroekonomiczne, filtry eliminujące błąd przeżywalności lub korekty uwzględniające przyszłe działania spółek mogą zmienić ewaluację po fakcie.

Oceniaj oba modele na tym samym zbiorze momentów prognozy. Pominięcie trudnych dat dla jednego modelu, ale nie drugiego, narusza sparowane porównanie. Jeśli brakuje prognoz, ustal wspólną próbę albo uzasadnij sposób potraktowania braków; nie pozwalaj po cichu, by modele mierzyły się z różnymi fazami rynku. Daty początku i końca wybierz przed sprawdzeniem, która próba daje preferowany wynik.

Funkcja straty określa, co znaczy „większa trafność”

Niech yₜ oznacza zrealizowaną wartość w momencie t, a ŷA,ₜ i ŷB,ₜ prognozy modeli A i B. Błędy to eA,ₜ = yₜ − ŷA,ₜ oraz eB,ₜ = yₜ − ŷB,ₜ. Funkcja straty L zamienia każdy błąd na ocenę, w której niższa wartość jest lepsza. Strata kwadratowa L(e) = e² mocniej karze duże pomyłki. Strata bezwzględna L(e) = |e| rośnie liniowo wraz z wielkością błędu. Prognoza kwantylowa może wykorzystywać asymetryczną stratę pinball, ponieważ zaniżenie i zawyżenie prognozy mają różne koszty.

Wybrana ocena może zmienić to, który model wydaje się lepszy. Rozważmy dwie hipotetyczne pary błędów w tych samych jednostkach: błędy modelu A to 0 i 2, a modelu B to 1 i 1. Przy stracie kwadratowej średnie straty wynoszą odpowiednio 2 i 1, więc lepszą ocenę ma B. Przy stracie bezwzględnej średnia obu modeli wynosi 1. Żadne z tych obliczeń nie jest uniwersalnie poprawne; każde odpowiada na inne pytanie o to, które błędy są istotne.

W prognozowaniu stóp zwrotu strata kwadratowa może być przydatna dla prognozy średniej warunkowej. Prognoza zmienności wymaga oceny dopasowanej do zmiennej docelowej, a prognoza Value-at-Risk — oceny kwantylowej albo backtestu przeznaczonego do ryzyka. Wybór funkcji straty po zobaczeniu, który model wygrywa, zamienia test w kolejne poszukiwanie. Zapisz ocenę i kierunek „lepiej” przed obejrzeniem porównania.

Prognoza VaR dotyczy kwantyla ogona rozkładu, a nie zwykłej prognozy punktowej. Przewodnik po backteście VaR wyjaśnia, jak częstość i moment naruszeń oceniają tę odrębną prognozę ryzyka.

Oblicz sparowane różnice strat i określ hipotezę zerową

Dla funkcji straty, w której mniejsza wartość jest lepsza, zdefiniuj różnicę dla okresu t jako

dₜ = L(eA,ₜ) − L(eB,ₜ)

Przy tej konwencji znaku dodatnie dₜ oznacza, że strata A była większa, a więc w danym momencie niższą stratę miał model B; wartość ujemna przemawia za A. Średnia z próby to d̄ = (1/n) Σ dₜ. Hipoteza zerowa równej bezwarunkowej trafności to E[dₜ] = 0. Dwustronna hipoteza alternatywna pyta, czy oczekiwane straty różnią się w którymkolwiek kierunku. Jednostronna hipoteza określona z góry może dotyczyć tego, czy wskazany model ma niższą oczekiwaną stratę.

Podstawowa statystyka ma postać

DM = d̄ / √(Ŝd / n)

Ŝd szacuje tu długookresową wariancję szeregu różnic strat, a nie tylko wariancję błędów prognozy jednego z modeli. Przy hipotezie zerowej i odpowiednich warunkach regularności statystyka ma asymptotycznie standardowy rozkład normalny. Duże wartości dodatnie przemawiają za B, a duże ujemne za A zgodnie z powyższą konwencją znaku. Wartość p mierzy zgodność danych z określoną hipotezą zerową i założeniami dotyczącymi próbkowania, a nie prawdopodobieństwo, że któryś model jest prawdziwy.

Sparowanie usuwa nieistotne różnice w ogólnej skali błędów dwóch modeli tylko w takim zakresie, w jakim ujmują je różnice dla poszczególnych momentów prognozy. Nie czyni szeregu strat niezależnym, nie eliminuje automatycznie niepewności wynikającej z estymacji parametrów i nie koryguje przeszukiwania wielu zmiennych docelowych ani specyfikacji. Te kwestie należą do projektu badania i obliczania niepewności.

Przykład jednego kroku odróżnia różnicę w próbie od dowodu

Załóżmy, że mamy 100 sparowanych, hipotetycznych prognoz na jeden krok. Średnia strata kwadratowa modelu A wynosi 0.26, a modelu B 0.23, w jednostkach kwadratowych punktów procentowych. Średnia różnica wynosi więc d̄ = 0.26 − 0.23 = 0.03, co w próbie przemawia za B. Dla uproszczenia przyjmijmy, że oszacowana długookresowa wariancja dₜ wynosi 0.04 i nie ma kowariancji szeregowej między momentami prognozy.

Oszacowany błąd standardowy średniej różnicy to √(0.04 / 100) = 0.02. Statystyka bez korekty wynosi 0.03 / 0.02 = 1.50. Dla h = 1 i T = 100 czynnik korekty dla małej próby Harveya–Leybourne’a–Newbolda wynosi √[(T + 1 − 2h + h(h − 1)/T) / T] = √0.99 ≈ 0.995. Po pomnożeniu otrzymujemy statystykę skorygowaną bliską 1.49; przy przybliżonym rozkładzie t₉₉ dwustronna wartość p wynosi około 0.14.

B ma niższy zaobserwowany średni błąd kwadratowy, ale ten przykład nie daje mocnych podstaw do odrzucenia równej oczekiwanej trafności przy typowych progach istotności. Brak odrzucenia nie dowodzi, że modele są równie trafne; odrzucenie również zależałoby od wybranej oceny, momentów prognozy i założeń. Wartość wariancji i wszystkie straty to hipotetyczne dane do wyjaśnienia obliczeń, a nie wyniki empiryczne.

Pierwiastki ze średnich strat kwadratowych to błędy RMSE równe w przybliżeniu 0.510 i 0.480 punktu procentowego; opisowa różnica wynosi 0.030. Statystyka DM testuje jednak sparowane różnice strat kwadratowych, a nie różnicę tych dwóch pierwiastków testem t.

Schemat koncepcyjny w trzech panelach: dwie linie prognoz na tle tej samej zrealizowanej ścieżki, sparowane oznaczenia strat dla kolejnych momentów prognozy oraz słupki różnic strat ze znakiem wokół średniej i pasma niepewności.
Ilustracja koncepcyjna porównania dwóch prognoz dla tej samej zrealizowanej ścieżki i podsumowania sparowanych różnic strat. To nie są dane rynkowe ani empiryczny wynik testu.

Nakładające się horyzonty powodują zależność różnic strat

Jeżeli prognozy pięciodniowe są publikowane codziennie, sąsiednie prognozy obejmują cztery z tych samych pięciu dni docelowych. Ich błędy, straty i różnice strat mogą więc poruszać się razem. Potraktowanie 100 dziennych momentów prognozy jako 100 niezależnych porównań może zaniżyć niepewność i zawyżyć statystykę.

Długookresowa wariancja uwzględnia kowariancję szeregową dₜ. Popularny estymator odporny na heteroskedastyczność i autokorelację (HAC) ma postać

Ŝd = γ̂₀ + 2 Σₖ₌₁ᵐ wₖ γ̂ₖ

gdzie γ̂ₖ jest próbną autokowariancją d dla opóźnienia k, wₖ wagą jądra, a m wybraną szerokością pasma. Newey i West (1987) przedstawili dodatnio półokreślony estymator macierzy kowariancji HAC. Dla idealnych prognoz na h kroków, przy odpowiednich założeniach, nakładanie się horyzontów często powoduje zależność co najmniej do opóźnienia h − 1; pierwotna metoda DM omawia estymator obcięty dla takiego przypadku. W rzeczywistych danych zależność może być dłuższa z powodu trwałych zmiennych docelowych, estymacji kroczącej lub konstrukcji strategii, więc h − 1 nie jest uniwersalną regułą doboru pasma.

Podaj horyzont, jądro, szerokość pasma i ewentualną korektę dla małej próby. Pokaż, czy wnioski zmieniają się przy rozsądnych założeniach o zależności, zamiast dobierać szerokość pasma pod preferowaną wartość p. Jeśli momenty oceny są od siebie oddalone, by uniknąć nakładania się okresów, wyjaśnij ten wybór i wskaż, jaką informację albo liczebność próby poświęcasz. Niepewność uwzględniająca zależności jest częścią testu, a nie opcjonalnym ustawieniem prezentacji.

Modele zagnieżdżone i zmienna trafność wymagają innych pytań

Zwykłe porównanie DM najłatwiej interpretować, gdy prognozy nie są zagnieżdżone przy hipotezie zerowej równej trafności. Jeśli większy model zawiera mniejszy model referencyjny, dodatkowe estymowane współczynniki mogą zwiększać szum prognozy, nawet gdy ich prawdziwe wartości wynoszą zero. Przy tej hipotezie zerowej różnica średnich kwadratowych błędów prognozy może mieć niestandardowy rozkład. Przy porównywaniu MSPE modeli zagnieżdżonych poza próbą metoda taka jak korekta Clarka–Westa uwzględnia ten efekt szumu estymacji; nie zastępuje ogólnie testu DM w każdym projekcie modelu. Zobacz Clarka i Westa (2007).

Zwykła hipoteza zerowa DM dotyczy bezwarunkowej średniej straty w całej próbie ewaluacyjnej. Może ukryć zmiany w czasie: A może wypadać lepiej w spokojnych okresach, a B w okresach wysokiej zmienności, mimo podobnych średnich łącznych. Jeśli pytanie dotyczy tego, czy względna trafność zależy od informacji znanych w momencie prognozy, testy warunkowej zdolności prognostycznej łączą różnice strat z instrumentami określonymi z góry. Giacomini i White (2006) opracowali takie podejście. Założenia i projekt okna ewaluacyjnego mają znaczenie, więc dodawanie dowolnych wskaźników po obejrzeniu wyników nie jest prawidłowym skrótem.

Wybór testu powinien wynikać ze struktury porównania: niezależne prognozy, modele zagnieżdżone, zmienna trafność warunkowa i rodzina wybrana spośród wielu kandydatów to różne przypadki. W tym ostatnim przewodnik po White Reality Check i teście Hansen SPA wyjaśnia korektę na poziomie całej rodziny po przeszukaniu wielu reguł handlowych.

Niższa strata prognozy nie dowodzi zyskowności strategii

Prognoza może być statystycznie trafniejsza, a mimo to nie poprawiać wyniku netto w handlu. Strategia musi przełożyć prognozę na pozycję, określić moment transakcji i uwzględnić spread, prowizje, poślizg cenowy, wpływ rynkowy, finansowanie, koszty pożyczki oraz limity ryzyka. Niewielka poprawa średniego kwadratowego błędu prognozy zwrotu może nie mieć znaczenia dla decyzji, a model o nieco większym średnim błędzie może lepiej identyfikować zdarzenie ogonowe istotne dla konkretnej reguły.

Oddziel ocenę prognozy od oceny portfela. Najpierw testuj prognozę względem zmiennej docelowej i funkcji straty dopasowanych do deklarowanego zadania. Następnie oceń w pełni określoną regułę handlową na danych niewykorzystanych do wyboru prognozy, przy realistycznych założeniach dotyczących realizacji transakcji i finansowania. Wartość p z testu prognozy nie jest stopą zwrotu z backtestu, wskaźnikiem Sharpe’a ani prawdopodobieństwem przyszłego zysku.

Wielokrotne próby z modelami, zmiennymi docelowymi, horyzontami, funkcjami straty i oknami próby powodują błąd selekcji, nawet jeśli każde pojedyncze obliczenie DM jest poprawne. Zapisz cały proces poszukiwań i użyj metody dla całej rodziny, gdy pytanie badawcze dotyczy tego, czy przetrwał choć jeden kandydat. Przewodnik po block bootstrapie omawia niepewność z zachowaniem zależności dla ustalonej wcześniej statystyki; sam w sobie nie koryguje nieudokumentowanego przeszukiwania modeli.

Podaj szczegóły pozwalające innemu badaczowi odtworzyć analizę

Wymień oba modele, ich relację do modelu referencyjnego, zmienną docelową, horyzont, harmonogram momentów prognozy, daty oceny, zbiór informacji, wersję danych i zasadę doboru wspólnej próby. Zdefiniuj matematycznie funkcję straty i zaznacz, czy dodatnie dₜ przemawia za A, czy za B. Podaj n, średnią stratę każdego modelu, d̄, estymator długookresowej wariancji, jądro i szerokość pasma HAC, korektę dla małej próby, rozkład referencyjny, kierunek testu i wartość p.

Określ również, czy modele są zagnieżdżone, jak estymowano parametry, czy porównanie ustalono przed obejrzeniem wyników, oraz jakie inne warianty sprawdzono. Jeśli próba służyła do wyboru modelu, opisz test jako część tego procesu, a nie jako nienaruszony dowód out-of-sample. Przejrzysty raport pozwala zobaczyć, co dokładnie porównano i które problemy niepewności lub selekcji pozostają poza zakresem testu.

Częste pytania

Q1Czy test Diebolda–Mariano wymaga normalnego rozkładu błędów prognozy?

Nie. Metoda może uwzględniać błędy prognozy o rozkładzie innym niż normalny. Nadal wymaga jednak odpowiedniego oszacowania wariancji różnic strat i warunków regularności dla rozkładu referencyjnego.

Q2Czy mogę porównać dwa modele prognozujące różne horyzonty?

Nie jako porównywalny test trafności prognoz. Najpierw dopasuj zmienną docelową i horyzont; w przeciwnym razie każdy model odpowiada na inne pytanie prognostyczne.

Q3Czy istotny wynik DM wystarczy, by wybrać model handlowy?

Nie. To dowód dotyczący oczekiwanej straty prognozy w określonym porównaniu. Nadal trzeba uwzględnić poszukiwanie modeli, reguły decyzyjne, koszty realizacji zleceń, finansowanie i wyniki strategii out-of-sample. Główne publikacje - Diebold i Mariano, “Comparing Predictive Accuracy” (1995) - Harvey, Leybourne i Newbold, “Testing the Equality of Prediction Mean Squared Errors” (1997)00719-4) - Giacomini i White, “Tests of Conditional Predictive Ability” (2006) - Clark i West, “Approximately Normal Tests for Equal Predictive Accuracy in Nested Models” (2007) - Newey i West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Przy definicji dₜ = L(eA,ₜ) − L(eB,ₜ), któremu modelowi sprzyja dodatnia średnia z próby?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji

Jasne definicje najważniejszych pojęć, od call, put i łańcucha opcji po IV, greki, open interest i max pain

Przeglądaj słownik opcji
Dwa testy bootstrap dla rodziny reguł sprawdzanych równocześnieWhite Reality Check i Hansen SPA dla reguł tradingowychPoznaj sposób, w jaki Reality Check i Hansen SPA porównują całą rodzinę reguł technicznych z benchmarkiem, czym różnią się ich rozkłady bootstrap i jak interpretować globalną wartość p.Jak niepewna jest oszacowana stopa zwrotu?Bootstrap blokowy i przedziały ufności dla strategii tradingowychDowiedz się, jak ruchomy i stacjonarny bootstrap blokowy zachowują zależność w czasie przy szacowaniu niepewności średniej stopy zwrotu lub wskaźnika Sharpe’a.Sprawdź częstotliwość i czas przekroczeń VaRBacktesting VaR: testy Kupieca i Christoffersena wyjaśnioneDowiedz się, jak test POF Kupieca i testy pokrycia warunkowego Christoffersena oceniają przekroczenia VaR, jak czytać przykład 250 dni oraz dlaczego brak odrzucenia nie dowodzi trafności.Porównywanie modeli prognostycznychModel Confidence Set (MCS): porównywanie prognoz bez wymuszania jednego zwycięzcyDowiedz się, jak Model Confidence Set wykorzystuje testy sekwencyjne i bootstrap zachowujący zależności, aby pozostawić modele prognostyczne, których nie da się odróżnić na podstawie danych.Porównaj dwie prognozy na podstawie strat dla tych samych wynikówTest Diebolda–Mariano: porównanie trafności prognozDowiedz się, co porównuje test Diebolda–Mariano, jak różnice strat i korelacja szeregowa wpływają na statystykę oraz dlaczego trafność prognozy nie oznacza zyskowności transakcji.