Skip to content
Wszystkie przewodniki po opcjach
Porównaj dwie prognozy na podstawie strat dla tych samych wyników13 min czytania

Test Diebolda–Mariano: porównanie trafności prognoz

Dowiedz się, co porównuje test Diebolda–Mariano, jak różnice strat i korelacja szeregowa wpływają na statystykę oraz dlaczego trafność prognozy nie oznacza zyskowności transakcji.

W tym przewodnikuTest porównuje oczekiwaną stratę prognoz

Krótkie podsumowanie

Test Diebolda–Mariano (DM) sprawdza, czy dwie procedury prognozowania mają taką samą oczekiwaną stratę dla sparowanych wyników. Opiera się na szeregu różnic strat, więc na wynik wpływają funkcja straty, horyzont prognozy i zależność między datami. Odrzucenie hipotezy zerowej wskazuje na różnicę w ramach określonego schematu oceny; nie dowodzi, że jeden model pozostanie lepszy ani że strategia przyniesie zysk po kosztach.

Test porównuje oczekiwaną stratę prognoz

Test Diebolda–Mariano porównuje dwie prognozy tej samej zmiennej docelowej dla tych samych dat oceny. W każdym momencie sporządzenia prognozy obie procedury muszą dotyczyć tego samego zrealizowanego wyniku, horyzontu i granicznego momentu dostępności informacji. Test ocenia następnie, czy średnia strata jednej procedury systematycznie różni się od straty drugiej, dopuszczając zmienność różnic w czasie.

Diebold i Mariano sformułowali test dla ogólnej funkcji straty, a nie tylko dla średniego błędu kwadratowego. Ich oryginalna praca opisuje testy hipotezy zerowej o równej trafności konkurencyjnych prognoz (Diebold i Mariano, 1995). „Trafność” oznacza tu niższą oczekiwaną stratę według funkcji wybranej do porównania. Nie oznacza, że prognoza jest prawdziwa, wyjaśnia przyczynowość, jest dobrze skalibrowana w całym rozkładzie ani że przydaje się do każdej decyzji.

Załóżmy, że modele A i B w tym samym momencie prognozują tę samą przyszłą stopę zwrotu. Test DM nie sprawdza, czy współczynnik któregoś modelu wynosi zero ani czy wartości dopasowane obu modeli są takie same w próbie estymacyjnej. Porównuje, jak błędy prognoz przekładają się na wybraną stratę w próbie oceny.

Przed interpretacją statystyki określ schemat badania: cel, momenty prognozowania, horyzont, funkcję straty, sposób traktowania brakujących wyników, harmonogram ponownej estymacji oraz jednostronną lub dwustronną hipotezę alternatywną. Te decyzje definiują pytanie testu. Jeśli różnią się między modelami, różnica strat nie jest porównaniem na równych warunkach.

Zdefiniuj sparowane prognozy i różnicę strat

Niech $y_t$ oznacza zrealizowaną wartość zmiennej docelowej w momencie prognozowania $t$, a $\hat y_{A,t}$ i $\hat y_{B,t}$ będą prognozami modeli A i B. Błędy wynoszą $e_{A,t}=y_t-\hat y_{A,t}$ oraz $e_{B,t}=y_t-\hat y_{B,t}$. Dla funkcji straty $L$ różnica strat w dacie $t$ jest równa:

$$ d_t=L(e_{A,t})-L(e_{B,t}) $$

Przy tej konwencji ujemna średnia $d_t$ oznacza, że obserwowana strata modelu A była niższa; dodatnia wskazuje na niższą stratę B. Hipoteza zerowa dla populacji to $E[d_t]=0$. Alternatywa dwustronna sprawdza różnicę w dowolnym kierunku, a jednostronna — kierunek określony wcześniej. Nie wybieraj kierunku dopiero po zobaczeniu, który model wygrał.

Przy stracie kwadratowej $L(e)=e^2$ duże pomyłki mają nieproporcjonalnie duży wpływ. Przy stracie bezwzględnej $L(e)=|e|$ pojedynczy duży błąd w mniejszym stopniu dominuje ranking. Strata kwantylowa może odpowiadać asymetrycznemu celowi prognozy; inne funkcje mierzą inne aspekty jakości przewidywania. Zmiana funkcji może odwrócić ranking modeli, więc pojęcie „najlepszej prognozy” nie jest jednoznaczne bez wskazania straty. Przegląd Tashmana dotyczący testów prognoz poza próbą również podkreśla, że metoda oceny powinna odpowiadać problemowi prognozowania (Tashman, 200000065-0)).

Używaj tych samych momentów prognozowania i tych samych wyników dla obu modeli. Jeśli w jednym modelu brakuje prognozy dla trudnej daty, ciche usunięcie tylko tej daty zmienia próbę porównawczą. Jeśli model ma być w praktyce estymowany ponownie co miesiąc na nowych danych, prognozy oceny również twórz według tej reguły; prognoza ze stałymi parametrami odpowiada na inne pytanie. Walidacja walk-forward opisuje sekwencyjne prognozowanie bez używania przyszłych danych.

Przykład z czterema momentami prognozy pokazuje średnią różnicę

Rozważ cztery hipotetyczne momenty prognozowania, a cel i błędy wyraź w punktach procentowych. Błędy A to $[1,2,0,1]$, a B to $[2,1,1,1]$. Każda para odnosi się do tej samej zrealizowanej stopy zwrotu i tego samego okresu prognozy. Liczby są fikcyjne i służą wyłącznie do pokazania rachunku.

Przy stracie kwadratowej straty A wynoszą $[1,4,0,1]$, a średni błąd kwadratowy to $(1+4+0+1)/4=1.50$ kwadratowego punktu procentowego. Straty B wynoszą $[4,1,1,1]$, a średni błąd kwadratowy to $(4+1+1+1)/4=1.75$. W tych czterech przypadkach MSE modelu A jest niższe o 0.25 kwadratowego punktu procentowego.

Różnice strat w kolejnych datach, $d_t=L(e_{A,t})-L(e_{B,t})$, wynoszą $[-3,3,-1,0]$. Ich średnia to $(-3+3-1+0)/4=-0.25$, czyli różnica średniego MSE A minus średniego MSE B. Ujemny znak sprzyja A przy tej konwencji, ale nie mówi jeszcze, czy różnica przewyższa szum próbkowania. Cztery pary prognoz nie stanowią przekonującego dowodu statystycznego.

Definicja straty zmienia też znaczenie słowa „lepszy”. W osobnym przykładzie C ma błędy bezwzględne $[0,0,0,3]$, a D — $[1,1,1,1]$. Przy stracie bezwzględnej średnie wynoszą 0.75 dla C i 1 dla D, więc lepszy jest C. Przy stracie kwadratowej średnie to 2.25 dla C i 1 dla D, więc lepszy jest D. Test nie rozstrzygnie tego sporu bez określenia, które błędy są ważniejsze.

<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->

Statystyka DM odnosi średnią różnicę strat do jej niepewności

Średnia różnica strat w próbie wynosi $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, gdzie $T$ jest liczbą sparowanych wyników prognoz. Jej błąd standardowy zależy od długookresowej wariancji $d_t$, a nie tylko od wariancji w pojedynczej dacie. Ogólna postać statystyki to:

$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$

$\widehat{\Omega}$ szacuje długookresową wariancję szeregu różnic strat. Przy niezależnych datach, według wybranego estymatora, sprowadzałaby się do wariancji $d_t$. Straty prognoz często jednak występują w skupieniach: w okresie wysokiej zmienności błędy obu modeli mogą rosnąć, a cel na $h$ kroków naprzód może powodować nakładanie się okien i wspólne zrealizowane stopy zwrotu. Pominięcie dodatniej zależności może zaniżyć błąd standardowy i zawyżyć siłę dowodów.

Częsta konstrukcja HAC szacuje autokowariancje $\hat\gamma_k$ wycentrowanej różnicy strat i łączy je jako $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Przy wagach Bartletta do pasma $q$ mamy $w_k=1-k/(q+1)$. Newey i West zaproponowali dodatnio półokreślony estymator kowariancji zgodny przy heteroskedastyczności i autokorelacji (Newey i West). Jądro i pasmo to wybory implementacyjne: podaj je i dobieraj do schematu prognozowania, a nie do pożądanego p-value. Szersze zagadnienie opisuje przewodnik po błędach standardowych HAC.

Przy regularnych warunkach standardową statystykę DM porównuje się asymptotycznie ze standardowym rozkładem normalnym. Duża wartość bezwzględna wskazuje, że zaobserwowana średnia różnica jest duża względem oszacowanej niepewności. Znak informuje, który model miał niższą stratę według przyjętej kolejności; p-value nie mierzy wielkości ani wartości ekonomicznej różnicy. Nie jest też prawdopodobieństwem prawdziwości hipotezy zerowej ani przyszłego sukcesu prognozy.

Prognozy wielookresowe nakładają się, więc liczy się korekta dla małej próby

Gdy w każdym okresie prognozuje się cel obejmujący kilka przyszłych okresów, okna oceny się nakładają. Miesięczna prognoza skumulowanej stopy zwrotu z kolejnych trzech miesięcy współdzieli dwie z tych trzech stóp z prognozą opublikowaną miesiąc później. Nawet przy niezależnych stopach miesięcznych takie nakładanie może powodować korelację szeregową błędów prognoz i różnic strat.

W podstawowym schemacie $h$-krokowym naturalne jest uwzględnienie w wariancji co najmniej zależności do opóźnienia $h-1$. Nie jest to uniwersalna reguła doboru pasma: krocząca estymacja parametrów, trwałe cele, skupianie zmienności i funkcja straty mogą wprowadzić dalszą zależność. Zapisz horyzont, odstęp między momentami prognozy i uzasadnienie dla odcięcia HAC lub innego estymatora wariancji. Liczba wierszy prognoz nie jest automatycznie liczbą niezależnych informacji.

Oryginalny test asymptotyczny może mieć niewłaściwy rzeczywisty poziom istotności przy umiarkowanej próbie. Harvey, Leybourne i Newbold zaproponowali korektę dla skończonej próby przy porównywaniu średnich błędów kwadratowych prognoz (HLN, 199700719-4)). Częsta postać dla horyzontu $h$ i $T$ prognoz mnoży statystykę DM przez:

$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$

Skorygowaną statystykę zazwyczaj porównuje się z rozkładem t o $T-1$ stopniach swobody. Przy $T=60$ i $h=5$ mnożnik wynosi około $0.925$. To wyłącznie przykład rachunku korekty; nie oznacza, że 60 obserwacji wystarczy dla konkretnego modelu ani że założenia są spełnione. Korekta rozwiązuje określony problem małej próby, ale nie naprawia przecieku informacji, niewłaściwego celu, nieuwzględnionej zależności, powtarzanej selekcji modeli ani błędnej funkcji straty.

Modele zagnieżdżone wymagają innego uzasadnienia porównania

Model A może być ograniczoną wersją modelu B, na przykład gdy B dodaje predyktory. Nawet gdy dodatkowe zmienne nie mają populacyjnej wartości prognostycznej pod hipotezą zerową, ich oszacowane współczynniki mogą wprowadzać szum do prognoz B. Większy model może więc uzyskać wyższe obserwowane MSE, mimo że dodatkowe predyktory nie ulepszają procesu prognozowania. Standardowe rozumowanie o równej trafności modeli niezagnieżdżonych nie stosuje się automatycznie bez zmian.

Clark i West opracowali przybliżone testy normalne równej trafności prognostycznej dla modeli zagnieżdżonych oraz skorygowali porównanie błędów kwadratowych o szum estymacji większego modelu (Clark i West, 2007). Ta korekta nie zastępuje wszystkich testów DM; dotyczy określonego pytania o modele zagnieżdżone, funkcję straty i schemat asymptotyczny. Ustal, czy jeden model zawiera się w drugim, i wybierz test z rozkładem zerowym dopasowanym do projektu. Nie zakładaj, że standardowe p-value DM z programu obsługuje każdą relację modeli.

Ważne są też inne różnice. Niższe MSE nie musi poprawiać pokrycia przedziałów, kalibracji prawdopodobieństw, trafności kierunku ani późniejszej decyzji. Porównanie poza próbą może nadal korzystać z nieodpowiedniej próby odłożonej, wielokrotnie oglądanej podczas rozwoju modelu. Podaj relację między modelami, metodę estymacji, horyzont i zakres danych dostępnych przy tworzeniu każdej prognozy.

Trafność prognozy nie jest przewagą w handlu

Wynik DM ocenia stratę prognostyczną; decyzja handlowa dotyczy procesu zwrotu i ryzyka. Niższe MSE prognozy kolejnego okresu nie gwarantuje, że sygnał wystarczająco często wskaże właściwy kierunek, dobierze odpowiedni rozmiar pozycji albo przetrwa obrót, spread, wpływ rynkowy, prowizje, koszty pożyczki, funding i opóźnienia realizacji. Z kolei prognoza z nieco wyższym średnim błędem kwadratowym może poprawić decyzję, jeśli jest dokładniejsza w chwilach dużej ekspozycji strategii. Funkcja straty dla takiego twierdzenia może odzwierciedlać rzeczywistą decyzję zamiast wygodnej, ogólnej miary prognozy.

Różnica istotna statystycznie może być bardzo mała ekonomicznie. Podaj wielkość średniej różnicy strat w zrozumiałych jednostkach wraz z niepewnością, a nie tylko p-value lub etykietę zwycięzcy. Jeśli twierdzenie dotyczy wyniku portfela, odtwórz kompletną, ustaloną regułę decyzyjną na odpowiednich późniejszych danych z realistycznymi założeniami handlowymi i osobno przedstaw wynik netto. DM nie oblicza takich wyników ani nie uwzględnia kosztów, chyba że funkcja straty została do tego wyraźnie skonstruowana.

Test nie koryguje też przeszukiwania wielu modeli, celów, horyzontów, funkcji straty, zakresów dat i reguł handlowych, po którym raportowane jest tylko najkorzystniejsze porównanie. Powtarzane testy parami tworzą własny problem selekcji. Zachowaj rejestr przeszukiwania i zastosuj metodę wielokrotnego testowania odpowiednią do zestawu twierdzeń. Przewodnik po wielokrotnym testowaniu i odsetku fałszywych odkryć wyjaśnia, dlaczego zwykłe progi mogą mylić po szerokim przeszukiwaniu. DM to narzędzie oceny, a nie korekta na data snooping.

Podaj szczegóły wystarczające do odtworzenia porównania

Jasny raport określa cel i jednostki, moment odcięcia informacji, momenty prognoz, horyzont, harmonogram ponownej estymacji oraz wspólną próbę oceny. Podaje funkcję straty i znak $d_t$, średnią stratę każdego modelu i ich średnią różnicę, wcześniej wybraną hipotezę jednostronną lub dwustronną, estymator wariancji, jądro, pasmo, statystykę, rozkład odniesienia, p-value oraz — gdy to właściwe — przedział ufności lub miarę niepewności.

Ujawnij również, czy modele są zagnieżdżone, jak potraktowano braki danych i wartości skrajne, ile alternatywnych specyfikacji sprawdzono oraz czy okres oceny wpłynął na wybór modelu. Pokaż wielkość różnicy, nie tylko to, czy przekroczyła próg. Szereg $d_t$ lub wykres skumulowanych różnic strat może ujawnić zmiany reżimu ukryte przez średnią ogólną, ale wykres nie zastępuje wnioskowania uwzględniającego zależność.

W handlu ilościowym opisz też przejście od prognozy do działania: próg sygnału, wielkość pozycji, moment rebalansowania, kontrolę ryzyka, cenę realizacji i założenia kosztowe. Test DM porównuje tylko podany szereg strat prognostycznych. Nie certyfikuje potoku danych, nie czyni różnych prób oceny porównywalnymi, nie dowodzi przyczynowości i nie gwarantuje trwałości historycznych rankingów. Używaj go jako przejrzystego elementu oceny modeli, razem z poprawnym czasowo projektem prognozy i jawną oceną na poziomie decyzji.

Częste pytania

Q1Czy test Diebolda–Mariano porównuje współczynniki modeli?

Nie. Porównuje oczekiwaną stratę błędów prognoz wytworzonych przez dwie procedury dla sparowanych wyników. Test współczynnika dotyczy innego pytania o parametr modelu.

Q2Czy mogę stosować test do prognoz na kilka okresów naprzód?

Tak, ale nakładające się okna celu mogą powodować szeregową zależność kolejnych różnic strat. Użyj estymatora wariancji i, w razie potrzeby, korekty dla skończonej próby dopasowanych do horyzontu i konstrukcji modelu; opisz wybory.

Q3Czy istotny wynik oznacza, że lepsza prognoza przyniesie zysk?

Nie. Wskazuje na różnicę w wybranej stracie prognozy w ramach schematu oceny. Rentowność zależy również od sposobu zamiany prognoz na pozycje, przyjętego ryzyka oraz faktycznej realizacji i kosztów transakcyjnych.

Źródła i dalsza lektura

Zgłoś problem

Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu

Szybki test

Przeczytano? Sprawdź się w 3 pytaniach

Pytanie 1 / 3

Pytanie 01

Jaka jest hipoteza zerowa w podstawowym porównaniu Diebolda–Mariano?

Wybierz odpowiedź, aby zobaczyć wyjaśnienie

Słownik opcji

Wybierz historię, z której uczy się model finansowyOkna expanding i rolling w walidacji walk-forwardPorównaj rosnące i stałej długości ruchome okna treningowe dla modeli finansowych, oddziel walidację od testu końcowego i wybierz regułę bez używania przyszłych wyników.Ten sam współczynnik może wiązać się z inną niepewnościąHeteroskedastyczność, autokorelacja i odporne błędy standardoweDowiedz się, dlaczego klasyczne błędy standardowe zawodzą, co umożliwiają estymatory White’a, klastrowe i HAC Neweya–Westa, jak je dobierać oraz gdzie kończy się odporne wnioskowanie w danych finansowych.dlaczego nae threshold fils kiedy reserchers test mny idesMultiple Testwg i Flse Djestcovery Rte w FwnceUndersti multiple comprjestnas, fmily-wjeste errlub, flse djestcovery rte, Bnaferrnai, Holm, byćnjmwi–Hochbyćrg, dependence, q-wartośćs, fctlub mwwg, bcktest selectina, i reserch governnceOcena prognoz kierunkuTest Pesaran–Timmermanna: czy prognoza kierunku wnosi dodatkową informację?Dowiedz się, jak test Pesaran–Timmermanna porównuje trafność kierunku z poziomem bazowym wynikającym z udziału rzeczywistych i prognozowanych wzrostów oraz dlaczego zależność szeregowa zmienia wnioskowanie.Jak często zwycięzca backtestu spada poniżej mediany grupyPrawdopodobieństwo przeuczenia backtestu (PBO) i CSCVDowiedz się, jak kombinatoryczna symetryczna walidacja krzyżowa szacuje PBO, przekształca rangi OOS w logity i dlaczego nie prognozuje przyszłych strat