Regresja Mincera–Zarnowitza: testowanie obciążenia i kalibracji prognozy
Dowiedz się, jak regresja Mincera–Zarnowitza testuje wyraz wolny i skalę prognozy, dlaczego zerowy średni błąd nie oznacza kalibracji oraz czego test nie dowodzi
W tym przewodnikuZerowy średni błąd może ukrywać problem z kalibracją
Krótkie podsumowanie
Regresja Mincera–Zarnowitza (MZ) to liniowa diagnostyka kalibracji: sprawdza, czy zrealizowane wartości odpowiadają poziomowi i skali prognoz. Standardowa hipoteza zerowa zakłada zerowy wyraz wolny i jednostkowe nachylenie prognozy. To łączne ograniczenie mówi więcej niż sam średni błąd, ale nie dowodzi, że prognosta dobrze wykorzystał wszystkie dostępne informacje.
Zerowy średni błąd może ukrywać problem z kalibracją
Załóżmy, że model prognozuje zwrot w następnym okresie albo ekonomistka przewiduje wzrost w kolejnym kwartale. Średnia błędów prognozy w próbie oceniającej może wynosić zero. To przesłanka przeciw trwałemu, przeciętnemu przeszacowaniu lub niedoszacowaniu, ale nie pokazuje, że wartości prognoz zmieniają się jeden do jednego z późniejszymi wynikami. Prognozy mogą być zbyt skrajne, zbyt skompresowane lub liniowo przesunięte, a dodatnie i ujemne błędy nadal będą się znosić.
Regresja MZ ujawnia drugie pytanie, regresując zrealizowany wynik względem prognozy. Mincer i Zarnowitz przedstawili tę metodę w pracy o ocenie prognoz gospodarczych (rozdział z 1969 r.). To diagnostyka prognoz punktowych dla liczbowego celu, zwłaszcza gdy pod stratą kwadratową prognozowana jest średnia warunkowa. Metoda nie porównuje, który z dwóch modeli ma niższą średnią stratę; temu pytaniu poświęcono przewodnik Diebolda–Mariano.
Rozróżnienie ma znaczenie także w badaniach tradingowych. Prognoza stóp zwrotu może mieć małe średnie obciążenie, a mimo to nieprawidłową skalę; prognoza zmienności może być za wysoka w jednym zakresie, a za niska w innym. Regresja może wskazać niedopasowanie liniowe, ale wynik zależy od próby oceniającej, definicji celu, dostępności informacji w czasie i metody wnioskowania. Test nie dowodzi, że z prognozy da się zbudować zyskowną regułę handlową.
Dopasuj moment prognozy, cel i wersję danych
Dla każdego momentu prognozy t połącz prognozę (fₜ) z późniejszą zrealizowaną wartością celu (yₜ), którą miała przewidywać. Każda para ma stały horyzont: (fₜ) została wydana wcześniej dla późniejszego celu (yₜ); w dalszych równaniach indeks t jest skrótowym oznaczeniem takich par. Obie wartości muszą dotyczyć tej samej zmiennej, horyzontu, jednostek i konwencji czasu. Połączenie prognozy pięciodniowego zwrotu z jednodniowym wynikiem nie sprawdza kalibracji zamierzonego celu.
Używaj prognoz rzeczywiście dostępnych w każdym momencie i zachowuj ich wartości, wersję modelu, wersję danych oraz godzinę graniczną informacji. Pierwsze publikacje danych makroekonomicznych bywają później rewidowane. Ustal, czy kalibrację oceniasz względem pierwszego odczytu, czy późniejszej wartości ostatecznej, i trzymaj się tego wyboru. Zastąpienie historycznych danych wejściowych wartościami po rewizji może dostarczyć ocenie informacji, których pierwotny prognosta nie miał.
W szeregach tradingowych spójnie dopasuj składniki close-to-close, intraday i overnight. Nakładające się cele wielookresowe powodują też zależność między sąsiednimi błędami prognozy. Ważna jest wspólna próba oceniająca: jeśli prognoza jednego modelu wypada akurat w dniach dużej zmienności, różny skład dat może wyglądać jak problem kalibracji. Dla wszystkich ocenianych prognoz stosuj ten sam cel i harmonogram momentów prognozy.
Odróżniaj prognozy faktycznie wygenerowane od wartości dopasowanych. Jeśli model oszacowano na tych samych obserwacjach, które wchodzą do regresji MZ, dopasowanie w próbie może sprawiać wrażenie kalibracji. Aby wyciągać wnioski o przyszłych prognozach, zbuduj chronologiczny szereg out-of-sample, w każdym momencie estymuj model wyłącznie na podstawie dostępnych wtedy informacji i pozostaw końcowy okres potwierdzający poza wyborem modelu lub progu.
Oszacuj regresję Mincera–Zarnowitza i podaj hipotezę zerową
Standardowa regresja poziomów ma postać
yₜ = α + β fₜ + uₜ
gdzie (yₜ) to zrealizowany cel, (fₜ) prognoza, a (uₜ) reszta regresji. Typowe łączne ograniczenie kalibracji to
H₀: α = 0 oraz β = 1
Jeśli oba warunki są spełnione, dopasowana zależność liniowa między wynikiem a prognozą jest linią tożsamości. Nie potrzeba stałego przesunięcia, a jednostkowa zmiana prognozy odpowiada jednostkowej zmianie dopasowanego wyniku. Oszacuj regresję, a następnie przetestuj oba ograniczenia łącznie testem Walda lub równoważnym testem F, używając macierzy kowariancji odpowiedniej do schematu próbkowania. Oddzielne testy wyrazu wolnego i nachylenia nie są tym samym co test ograniczenia łącznego.
Reszta (uₜ) nie jest automatycznie surowym błędem prognozy (yₜ − fₜ). Są równe przy łącznej hipotezie zerowej; poza nią oszacowany wyraz wolny i nachylenie pochłaniają liniowe przesunięcie i zmianę skali. Podaj również rzeczywisty błąd prognozy obok współczynników, aby pokazać średnie odchylenie i relację kalibracji.
Ograniczenie MZ bywa nazywane testem nieobciążoności lub racjonalności prognozy. Trzeba precyzyjnie zdefiniować te pojęcia. Zerowy bezwarunkowy średni błąd oznacza (E[yₜ − fₜ] = 0); warunki (α = 0, β = 1) narzucają konkretną relację liniową i zwykle są silniejsze. Holden i Peel pokazują, że w ich ujęciu standardowe ograniczenie łączne wystarcza do nieobciążoności, ale nie jest konieczne (1990). Nie używaj „nieobciążona” i „skalibrowana MZ” zamiennie bez wskazania testowanego ograniczenia.
<!-- learn:illustration -->

Prosty przykład oddziela średnie obciążenie od ograniczenia łącznego
Rozważmy trzy hipotetyczne prognozy i późniejsze wyniki:
| Prognoza (fₜ) | Zrealizowana wartość (yₜ) | Błąd (yₜ − fₜ) |
|---|---|---|
| 1 | 1.5 | 0.5 |
| 2 | 2.0 | 0.0 |
| 3 | 2.5 | −0.5 |
Średnia prognoz wynosi 2, średnia wyników również 2, a średni błąd prognozy to zero. Mimo to wartości spełniają (yₜ = 1 + 0.5 fₜ), więc regresja MZ ma wyraz wolny (α = 1) i nachylenie (β = 0.5), a nie (0, 1). Błędy znoszą się średnio, chociaż liniowy warunek kalibracji nie jest spełniony: w tym skonstruowanym przykładzie wynik zmienia się tylko o połowę tak mocno jak prognoza.
To ręcznie przygotowana ilustracja arytmetyczna, nie dane rynkowe ani próba do wnioskowania. Na podstawie trzech bezszumowych punktów nie należy podawać miarodajnej wartości p ani twierdzić, że rzeczywisty system prognoz zawiódł. W prawdziwej próbie test łączny uwzględnia niepewność estymacji. Duże odchylenie współczynnika może być oszacowane nieprecyzyjnie, a małe — precyzyjnie przy dostatecznej liczbie obserwacji. Przykład pokazuje tylko, że średni błąd i ograniczenia MZ odpowiadają na różne pytania.
Rekalibracja w rodzaju (1 + 0.5 fₜ) odtworzyłaby dokładnie te trzy wyniki, bo skonstruowano ją na ich podstawie. Nie dowodzi to, że zadziała później. Jeśli rekalibracja jest częścią procedury prognozowania, oszacuj ją na wcześniejszym segmencie treningowym i oceń skorygowane prognozy na późniejszych danych, które nie wyznaczały tych współczynników.
Interpretuj łącznie wyraz wolny, nachylenie i R-kwadrat
Wyraz wolny (α) to dopasowany wynik przy prognozie równej zero; jego znaczenie praktyczne zależy od tego, czy zero znajduje się w zakresie prognoz lub blisko niego. Nachylenie (β) opisuje, jak silnie dopasowane wyniki zmieniają się wraz z prognozą. Po uwzględnieniu wyrazu wolnego nachylenie poniżej jedności oznacza, że prognoza zmienia się bardziej na jednostkę niż dopasowany wynik; powyżej jedności — odwrotnie. Jeśli drugi współczynnik również jest swobodny, żaden z nich sam nie opisuje całej zależności.
Wysokie (R²) nie dowodzi kalibracji. Na przykład bezszumowa zależność (yₜ = 2 + 1.1 fₜ) ma (R² = 1), ale jej wyraz wolny i nachylenie nie spełniają hipotezy zerowej MZ. (R²) podsumowuje część zmienności próby wyjaśnioną przez dopasowanie liniowe; test łączny pyta, czy dopasowana prosta jest linią tożsamości. Z kolei zaszumiona prognoza może mieć niskie (R²), nawet gdy ograniczenie łączne nie zostanie odrzucone. Kalibracja i precyzja są powiązane, ale odrębne.
Nie wyciągaj wniosków z dwóch osobnych statystyk t. Oszacowania wyrazu wolnego i nachylenia mogą być skorelowane, dlatego łączna statystyka Walda/F wykorzystuje ich kowariancję. Podaj α, β i ich niepewność, łączną statystykę oraz wartość p, liczebność próby i średni surowy błąd. Przydatny może być wykres rozrzutu z linią tożsamości lub porównanie w grupach; ujawnij, jeśli grupy wybrano po obejrzeniu danych. Test liniowy może przeoczyć nieliniowe niedopasowanie, zmianę reżimu lub błędy w ogonach rozkładu.
Kalibracja jest słabsza niż pełna efektywność prognoz
Przy stracie kwadratowej optymalna prognoza punktowa to warunkowa wartość oczekiwana celu względem zbioru informacji prognosty. Wynika z tego, że informacje znane w momencie prognozy nie powinny przewidywać późniejszych błędów. Regresja MZ sprawdza jednak tylko zależność liniową obejmującą samą prognozę i stałą, a nie każdą inną zmienną ze zbioru informacji.
Bardziej wymagająca diagnostyka może dodać do regresji błędu wcześniej określone zmienne informacyjne (zₜ), na przykład:
yₜ − fₜ = δ₀ + δ₁ zₜ + vₜ
Jeśli zmienna znana w momencie prognozy przewiduje późniejsze błędy, prognosta mógł pominąć użyteczną informację. Trzeba prawidłowo ustalić moment dostępności zmiennych i starannie je wybrać; testowanie wielu opóźnień, stanów rynku i transformacji tworzy kolejny problem wielokrotnego poszukiwania. Brak przewidywalności na krótkiej liście nie dowodzi efektywności względem całego zbioru informacji.
Zarnowitz omawia obciążenie, autokorelację, wielkość próby i moc testów prognoz ankietowych (NBER Working Paper 1070, 1983). Dlatego opisuj MZ jako diagnostykę kalibracji liniowej lub słabą kontrolę efektywności, a nie dowód optymalnego wykorzystania wszystkich istotnych informacji. Przewodnik Giacomini–White omawia inną, warunkową ocenę opartą na wybranych momentach straty.
Uwzględnij estymację, nakładanie się horyzontów i niepewność
Błędy prognoz mogą być heteroskedastyczne, skorelowane szeregowo lub nakładać się na siebie, szczególnie przy kroczących prognozach wielookresowych. Standardowe wzory OLS nie gwarantują same z siebie poprawnych błędów standardowych dla ograniczenia łącznego. Dobierz i opisz wnioskowanie uzasadnione horyzontem, strukturą zależności i schematem estymacji; nie zakładaj niezależności błędów. Nie ma jednej uniwersalnej szerokości pasma ani korekty dla każdego projektu.
Jeśli parametry modelu, korekta kalibracji i jej test są wyznaczane w tej samej krótkiej próbie, standardowa niepewność regresji może nie obejmować całej procedury. Zagnieżdżone prognozy mogą też prowadzić do niestandardowego rozkładu zerowego w porównaniach dokładności. Zastosuj wynik wyprowadzony dla faktycznej konstrukcji prognozy albo oceń w pełni określony etap kalibracji na późniejszym zbiorze odłożonym. Nie testuj wielu równań, celów i prób, by ostatnią wartość p przedstawić jako potwierdzającą.
Brak odrzucenia nie dowodzi kalibracji; przyczyną może być niska moc albo szeroki przedział. Odrzucenie również zależy od celu, próby, postaci liniowej i oszacowania kowariancji. Sprawdź wrażliwość na rozsądne wybory oceny, ujawnij te analizy i oddziel je od testu określonego wcześniej. Jest to szczególnie ważne przy silnie trwałych prognozach lub niewielu niezależnych epizodach.
Wybierz test odpowiadający pytaniu o prognozę
MZ testuje liniowy warunek kalibracji między prognozą a zrealizowanym celem. Test Diebolda–Mariano pyta natomiast, czy dwie procedury prognozowania mają taką samą średnią stratę przy wybranej funkcji oceny. Prognoza może być skalibrowana, a mimo to wypadać gorzej według tej funkcji, albo być przeciętnie dokładniejsza, lecz nie spełniać kalibracji MZ.
Jeśli pytanie dotyczy zmiany dokładności wraz z informacją znaną w momencie prognozy, test Giacomini–White ocenia wybrane warunkowe momenty straty. Jeśli przeszukano wiele prognoz lub reguł handlowych, Model Confidence Set albo White Reality Check/Hansen SPA dotyczy innego problemu selekcji kandydatów. Żadna z tych metod nie zastępuje jasno zdefiniowanego celu i uczciwych momentów prognozy.
Standardowa regresja MZ w poziomach dotyczy prognoz punktowych liczbowego celu. Prognozy kwantylowe, probabilistyczne, przedziałowe i gęstości wymagają testów kalibracji oraz funkcji oceny dopasowanych do danego obiektu. Dobrego wyniku dla średniej nie można automatycznie przenosić na prognozę ryzyka skrajnego ani rozkład zmienności.
Opisz projekt kalibracji tak, by można go było odtworzyć
Podaj cel, horyzont, jednostki, graniczny moment informacji, daty oceny, wersję danych oraz to, czy prognozy rzeczywiście powstały poza próbą. Zamieść równanie, definicję błędu prognozy i testowane ograniczenia. Wyjaśnij, czy „nieobciążona” oznacza zerowy średni błąd, czy łączne ograniczenie MZ (α = 0, β = 1).
Podaj oszacowania współczynników, błędy standardowe lub przedziały ufności, łączną statystykę Walda/F, stopnie swobody, wartość p, liczbę momentów prognozy, średni błąd i (R²) z ograniczoną interpretacją. Opisz metodę kowariancji lub resamplingu, szczególnie gdy horyzonty się nakładają lub błędy są skorelowane szeregowo. Ujawnij estymację modelu, rekalibrację, selekcję i alternatywne cele, próby lub transformacje, które sprawdzono.
Przejrzysty raport pozwala odróżnić średnie obciążenie, kalibrację liniową, efektywność informacyjną i dokładność porównawczą. To różne twierdzenia empiryczne. Spełnienie jednego ograniczenia regresji nie uzasadnia każdego użycia prognozy, a sama ocena prognozy nie dowodzi zyskowności handlu po kosztach.
Częste pytania
Q1Czy test Mincera–Zarnowitza sprawdza tylko średni błąd prognozy?
Nie. Średni błąd porównuje średnie prognozy i wyniku. Standardowy test MZ łącznie ogranicza wyraz wolny do zera, a nachylenie do jedności. Holden i Peel pokazują, że w ich ujęciu warunek ten jest wystarczający, ale niekonieczny dla nieobciążoności.
Q2Czy przejście testu MZ dowodzi efektywności prognozy?
Nie. Testuje liniową zależność uwzględniającą prognozę, a nie to, czy żadna informacja dostępna w chwili prognozy nie potrafi przewidzieć błędów. Efektywność wymaga silniejszego warunku względem zbioru informacji.
Q3Czy tej samej regresji można użyć dla prognozy VaR lub kwantyla?
Nie bez zmiany definicji kalibracji i wnioskowania. Standardowa regresja poziomów dotyczy liczbowych prognoz punktowych; kwantyle i prognozy ogonowe wymagają odpowiednich testów i funkcji oceny.
Q4Czy kalibracja dowodzi, że strategia handlowa jest zyskowna?
Nie. Kalibracja opisuje relację prognoz z wynikami. Twierdzenie o zyskowności wymaga ustalonej wcześniej reguły decyzyjnej i odrębnej oceny poza próbą z uwzględnieniem wykonania, opłat, finansowania, wpływu na rynek i ryzyka. Badania źródłowe - Mincer i Zarnowitz, “The Evaluation of Economic Forecasts” (1969) - Holden i Peel, “On Testing for Unbiasedness and Efficiency of Forecasts” (1990) - Zarnowitz, “Rational Expectations and Macroeconomic Forecasts” (NBER Working Paper 1070, 1983) - Diebold i Mariano, “Comparing Predictive Accuracy” (1995) - Giacomini i White, “Tests of Conditional Predictive Ability” (2006)
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Jaka jest standardowa łączna hipoteza zerowa w regresji MZ w poziomach?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie
Słownik opcji
Jasne definicje najważniejszych pojęć, od call, put i łańcucha opcji po IV, greki, open interest i max pain
Przeglądaj słownik opcji