Model Confidence Set (MCS): porównywanie prognoz bez wymuszania jednego zwycięzcy
Dowiedz się, jak Model Confidence Set wykorzystuje testy sekwencyjne i bootstrap zachowujący zależności, aby pozostawić modele prognostyczne, których nie da się odróżnić na podstawie danych.
W tym przewodnikuNa jakie pytanie odpowiada Model Confidence Set?
Krótkie podsumowanie
Model Confidence Set (MCS) porównuje z góry określoną rodzinę procedur prognostycznych i zwraca kandydatów, których niższości nie udało się wykazać przy użyciu wybranej funkcji straty. Jeśli próba nie pozwala ich rozróżnić, może pozostać kilka modeli; wynik zależy od rodziny kandydatów, projektu prognozowania, straty i procedury wnioskowania.
Na jakie pytanie odpowiada Model Confidence Set?
Załóżmy, że kilka procedur prognozuje zmienność na następny dzień. Ich błędy są różne, ale próba może być zbyt krótka lub zaszumiona, by ustalić, która procedura ma najmniejszą oczekiwaną stratę. Wybór procedury o najniższej średniej stracie wymusiłby zwycięzcę, nawet gdy różnica wynika z losowości próby. MCS daje odpowiedź w postaci zbioru: którzy kandydaci pozostają statystycznie zgodni z najlepszym wynikiem według określonego kryterium?
MCS zaczyna od zbioru kandydatów \(\mathcal M_0\), straty lub innego kryterium oraz poziomu ufności. Wielokrotnie testuje, czy kandydaci pozostający w analizie mają równą zdolność predykcyjną. Jeśli test odrzuci hipotezę, reguła eliminacji usuwa kandydata uznanego za relatywnie słabego, a test jest powtarzany dla mniejszego zbioru. Pozostali kandydaci tworzą MCS. Hansen, Lunde i Nason przedstawili tę procedurę jako zbiór ufności dla najlepszego modelu lub modeli w określonej kolekcji, podobnie jak przedział ufności parametru może obejmować kilka wartości przy nieprecyzyjnych danych (artykuł z 2011 r.).
„Najlepszy” oznacza najlepszy w ramach porównania: względem uwzględnionych kandydatów, celu, horyzontu prognozy, informacji dostępnych w każdym momencie prognozowania i kryterium oceny. MCS nie zakłada, że któryś kandydat jest prawdziwym procesem generującym dane, i może zachować kilka modeli o tej samej najlepszej oczekiwanej skuteczności. Nie jest to prawdopodobieństwo a posteriori, że zachowany model jest poprawny.
Ustal rodzinę kandydatów i pytanie prognostyczne
Przed obliczeniem strat określ \(\mathcal M_0\). Kandydatem może być oszacowany model wraz z regułami estymacji i aktualizacji prognoz albo procedura prognostyczna nieopisana modelem statystycznym. Sama etykieta „GARCH” nie wystarcza, jeśli mogą się zmieniać rozkład zmienności, okno kroczące, aktualizacje parametrów i horyzont; każda taka decyzja może tworzyć odrębnego kandydata.
Każdy kandydat musi prognozować ten sam cel dla tych samych momentów i horyzontu, używając tylko informacji dostępnych w danym czasie. Surowych strat nie można uczciwie porównywać, jeśli jeden model prognozuje wariancję jednodniową, a drugi zmienność pięciodniową. Użyj wspólnej próby oceny, jawnie dopasuj brakujące obserwacje i zapisz wersję danych, początkowe okno estymacji, harmonogram rekurencyjny lub kroczący oraz sposób traktowania zrewidowanych danych. Nakładające się prognozy mogą sprawić, że straty dla sąsiednich momentów będą współdzielić obserwacje.
Wybierz kryterium przed obejrzeniem wyników. Błąd kwadratowy, bezwzględny lub strata właściwa dla decyzji mogą inaczej uszeregować prognozy punktowe. Prognoza wariancji może wymagać funkcji straty dla zmienności dostosowanej do zaszumionego proxy, a prognoza kwantylowa — quantile score zamiast średniego błędu kwadratowego. Dobre MCS dla jednej straty nie oznacza dobrego MCS dla innej. Jeśli listę kandydatów zawężono po sprawdzeniu tych samych wyników oceny, formalny zbiór jest warunkowy względem nieujawnionej selekcji i nie odzwierciedla całego przeszukiwania.
Zamień wspólne prognozy na sparowane różnice strat
Niech \(y_{t+h}\) oznacza zrealizowany cel dla prognozy z momentu \(t\), a \(\hat y_{i,t+h|t}\) prognozę kandydata \(i\). Dla wybranej wcześniej funkcji straty \(L\) oblicz stratę każdego kandydata w każdym wspólnym momencie:
\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]
Przyjmijmy, że niższa strata jest lepsza. Dla kandydatów \(i\) i \(j\) zdefiniujmy sparowaną różnicę:
\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]
Tutaj \(P\) jest liczbą wspólnych momentów prognozowania. Przy tej konwencji dodatnie \(\bar d_{ij}\) oznacza, że średnia strata kandydata \(i\) była w próbie wyższa niż kandydata \(j\); wartość ujemna przemawia za \(i\). Sparowanie ma znaczenie, ponieważ obaj kandydaci prognozowali te same zrealizowane wyniki. Wspólne szoki rynkowe mogą zwiększyć obie straty, a różnica izoluje ich względną skuteczność.
Hipotezę zerową o równej zdolności predykcyjnej dla bieżącego zbioru \(\mathcal M\) można zapisać tak:
\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{dla wszystkich } i,j\in\mathcal M \]
To wspólne twierdzenie o bieżącym zbiorze, a nie kolekcja niezależnych testów parami oglądanych po kolei. Oryginalne ramy MCS wykorzystują łączny test równoważności oraz regułę eliminacji, by kontrolować porównywanie modeli. Nie pytają, czy prognozy były identyczne każdego dnia.
Testuj bieżący zbiór i określ regułę eliminacji
Procedura MCS na przemian wykonuje test dla zbioru i krok eliminacji. Zacznij od \(\mathcal M=\mathcal M_0\) i przetestuj równą zdolność predykcyjną na wybranym poziomie \(\alpha\). Jeśli nie ma podstaw do odrzucenia hipotezy, zatrzymaj procedurę i zgłoś bieżący zbiór. Jeśli hipoteza zostanie odrzucona, zastosuj wcześniej ustaloną regułę, usuń jednego kandydata i powtórz test dla mniejszego zbioru. Przy założeniach procedury pozostali tworzą MCS \((1-\alpha)\).
Artykuł przedstawia dwie znane statystyki. Statystyka range szuka największej standaryzowanej różnicy straty między parami:
\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]
Powiązana reguła eliminacji usuwa kandydata o największej standaryzowanej niekorzyści względem innego. Druga statystyka porównuje każdego kandydata ze średnią skutecznością bieżącego zbioru:
\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]
Tutaj \(t_{i\cdot}\) standaryzuje średnią \(d_{i\cdot,t}\); odpowiadająca mu reguła usuwa kandydata o największej standaryzowanej nadwyżce straty względem średniej zbioru. Statystyka i reguła eliminacji tworzą parę. Należy je wybrać i raportować razem, a nie mieszać po zobaczeniu, która daje mniejszy zbiór. Artykuł MCS wyjaśnia, dlaczego test odrzucenia musi być zgodny z regułą wskazującą kandydata do usunięcia (Hansen, Lunde i Nason).
Zachowaj zależność czasową w bootstrapie
Rozkład statystyki maksimum zależy od łącznej zmienności różnic strat kandydatów. Traktowanie każdego modelu lub dnia jako niezależnej obserwacji może zniszczyć oba rodzaje zależności: kolejne straty mogą być szeregowo skorelowane, a straty kandydatów z tego samego dnia są sparowane. Bootstrap MCS powinien więc zachować odpowiednią wspólną strukturę szeregów czasowych, przybliżając rozkład zerowy statystyki dla całego zbioru.
Jednym podejściem jest ponowne losowanie wyrównanych bloków czasu z wektora strat lub różnic kandydatów. W stationary bootstrap długości bloków są losowe, a resamplowany szereg może zaczynać się od losowo wybranej daty. Politis i Romano zaproponowali tę metodę dla słabo zależnych obserwacji stacjonarnych (artykuł z 1994 r.). Autorzy MCS opisują implementacje block bootstrapu i wskazują stationary bootstrap jako alternatywę. Niezależne losowanie szeregu strat każdego modelu niszczy sparowanie w obrębie dnia i może zmienić porównanie.
Średnia długość bloku, wariant bootstrapu, centrowanie przy hipotezie równej zdolności, liczba replikacji i horyzont prognozy wpływają na oszacowanie niepewności. Nakładające się prognozy wielookresowe często zwiększają zależność różnic strat, ale nie ma jednej długości bloku odpowiedniej dla każdego celu i próby. Opisz projekt i sprawdź, czy wnioski zmieniają się przy rozsądnych ustawieniach. Bootstrap jest przybliżeniem opartym na założeniach, a nie sposobem na naprawę look-ahead, ponownego wykorzystania holdoutu, niestacjonarnych wyników czy niepełnej rodziny kandydatów.
Oblicz hipotetyczne porównanie czterech modeli
Załóżmy, że cztery procedury A, B, C i D prognozują ten sam cel zmienności dla 120 wspólnych dziennych momentów. Ich średnie straty kwadratowe wynoszą 1.20, 1.23, 1.45 i 1.90 w przykładowych jednostkach kwadratu punktów procentowych. Średnie stawiają A na pierwszym, a D na ostatnim miejscu, ale sama kolejność nie opisuje niepewności próby.
Średnia sparowana różnica straty między A i B wynosi \(1.20-1.23=-0.03\). Jeśli błąd standardowy uwzględniający zależność wynosi \(0.04\), statystyka dla tej pary to \(-0.03/0.04=-0.75\). Ta różnica nie wskazuje na wyraźną różnicę statystyczną między A i B. MCS idzie dalej: statystyka dla zbioru uwzględnia wspólne różnice między wszystkimi czterema kandydatami.
Dla ilustracji załóżmy, że block-bootstrap MCS na pełnym szeregu strat z 120 momentów używa \(T_R\), \(\alpha=0.05\) i spójnej reguły eliminacji najgorszego kandydata. Niech p-value dla pełnego zbioru wynosi 0.018, po czym usunięto D, a następnie dla \(\{A,B,C\}\) otrzymano 0.11. Ponieważ 0.11 przekracza 0.05, procedura kończy się hipotetycznym 95-procentowym MCS \(\{A,B,C\}\). C pozostaje mimo wyższej średniej straty niż A: to hipotetyczne testowanie łączne nie wykazało, że C jest gorszy.
Te wartości p wymyślono na potrzeby objaśnienia kroków; nie można ich odtworzyć z czterech średnich strat ani z różnicy A–B. Rzeczywisty wynik wymaga pełnego szeregu strat dla każdego momentu, prognoz kandydatów, projektu bootstrapu i kolejności eliminacji. Zachowaj te dane i raportuj pełną sekwencję. <!-- learn:illustration -->

Interpretuj pozostały zbiór bez przesady
Przy poziomie ufności 95%, warunkach regularności i założeniach testu MCS jest skonstruowany tak, by zawierać najlepszego kandydata z określonego zbioru z co najmniej deklarowanym pokryciem asymptotycznym. Nie oznacza to, że każdy zachowany model ma 95% prawdopodobieństwa bycia najlepszym. To stwierdzenie dotyczy pokrycia przy powtarzanych próbach, a nie rozkładu a posteriori etykiet modeli.
Brak podstaw do odrzucenia równej zdolności predykcyjnej nie dowodzi, że oczekiwane straty są dokładnie równe. Moc testu może być ograniczona przy krótkim okresie oceny, dużej zmienności różnic strat lub kilku podobnych kandydatach. Duży zbiór może uczciwie oznaczać, że dane nie rozróżniają wariantów. Mogą w nim pozostać także modele słabe bezwzględnie, ponieważ MCS porównuje kandydatów ze sobą, a nie z wymaganym zewnętrznym standardem.
Zbiór jest ograniczony do kandydatów w \(\mathcal M_0\). Jeśli pominięto procedurę wyraźnie lepszą, MCS jej nie odnajdzie. Jeżeli model usunięto po wcześniejszym obejrzeniu tych samych wyników oceny, nominalne pokrycie nie uwzględnia tej nieudokumentowanej selekcji. Podaj historię tworzenia i filtrowania kandydatów. Zachowanie kilku kandydatów o tej samej najlepszej oczekiwanej stracie jest zgodne z metodą, a nie oznaką braku wyboru.
Odróżnij MCS od testów parami i testów benchmarkowych
Test Diebolda–Mariano koncentruje się na sparowanej różnicy strat dwóch procedur prognostycznych. MCS wielokrotnie testuje zbiór i informuje, którzy kandydaci przechodzą wspólną procedurę eliminacji. Wykonanie wielu testów DM i zachowanie nieistotnych par nie jest automatycznie równoważne MCS; znaczenie mają bootstrap łączny i spójna reguła eliminacji.
Test Clark–West dotyczy węższego porównania błędów kwadratowych, gdy jeden model obejmuje ograniczony benchmark, a szum estymacji wpływa na surową różnicę. MCS nie wymaga modeli zagnieżdżonych i pozwala wybrać funkcję straty, ale nadal wymaga wspólnego projektu prognozowania.
Reality Check White’a i test Superior Predictive Ability Hansena pytają, czy co najmniej jeden członek przeszukiwanej rodziny pokonuje wskazany benchmark. MCS nie wymaga benchmarku i opisuje zbiór relatywnie lepszych kandydatów. Wszystkie procedury wymagają wiernego opisu przeszukiwania i zależności, lecz testują różne hipotezy zerowe. Zobacz przewodnik po Reality Check i SPA oraz oryginalne prace White’a (2000) i Hansena (2005).
Opisz projekt i oddziel ranking prognoz od wartości handlowej
Odtwarzalny raport MCS wymienia procedury kandydatów, wspólny cel i horyzont, reguły dotyczące momentu prognozy i informacji, harmonogram estymacji, daty oceny, sposób traktowania braków, wzór straty i kierunek preferowany. Podaj poziom istotności, statystykę i regułę eliminacji, rodzaj bootstrapu, długość bloku, centrowanie, liczbę replikacji, p-value dla każdego kroku i końcowy skład. Średnie straty są kontekstem, ale nie zastępują wnioskowania łącznego tabelą rankingową.
W ocenie zmienności wyjaśnij, jak utworzono obserwowane proxy i czy jest zaszumione lub rewidowane. Przy prognozach wielookresowych ujawnij nakładanie się okien celu i metodę uwzględniania zależności. Pokaż wrażliwość na rozsądne zmiany funkcji straty, okresu próby i ustawień bootstrapu, gdy wpływają na skład zbioru. Mała wartość p bez informacji o usuniętych kandydatach i szczegółach procedury nie wystarcza do odtworzenia wyniku.
MCS szereguje procedury prognostyczne według jednego kryterium. Nie ustala przyczynowości, nie identyfikuje procesu generującego dane i nie dowodzi, że pozostałe prognozy przynoszą zysk. Zamiana prognozy na pozycję wymaga progów, wielkości pozycji, obrotu, czasu realizacji, spreadu, opłat, poślizgu, finansowania, pożyczania i ograniczeń ryzyka. Oceniaj zamrożoną regułę decyzyjną osobno na odpowiednich późniejszych danych i osobno raportuj wynik netto. Przy niedoskonałych proxy zmienności zobacz przewodnik QLIKE a strata kwadratowa.
Częste pytania
Q1Czy MCS wybiera jeden najlepszy model?
Niekoniecznie. Może pozostać jeden kandydat, gdy dane go wyróżniają, albo kilka, gdy próba nie wykazuje, który jest gorszy. Wybór jednego do wdrożenia wymaga odrębnej reguły decyzyjnej.
Q2Czy model w MCS ma 95% szans na poprawność?
Nie. Poziom ufności opisuje pokrycie najlepszego kandydata z określonej rodziny przy powtarzanych próbach i założeniach metody. Nie jest prawdopodobieństwem a posteriori, że model jest prawdziwy.
Q3Czy można użyć MCS do czegoś więcej niż prognozy zmienności?
Tak. Metoda może porównywać prognozy, modele ekonometryczne i inne procedury, jeśli określono sensowne wspólne kryterium i odpowiedni projekt próby. Wynik nadal zależy od wybranych kandydatów i straty.
Q4Czy MCS automatycznie uwzględnia każdy model, który testowałem?
Tylko jeśli rzeczywiste przeszukiwanie odzwierciedlono w rodzinie kandydatów i procedurze oceny. Nieudokumentowana selekcja ani wielokrotne użycie danych oceny nie zostaną skorygowane samym późniejszym uruchomieniem MCS.
Źródła i dalsza lektura
Zgłoś problem
Przygotujemy e-mail z linkiem do tego artykułu. Mark otrzyma zgłoszenie dopiero po jego wysłaniu
Szybki test
Przeczytano? Sprawdź się w 3 pytaniach
Pytanie 01
Co przedstawia Model Confidence Set?
Wybierz odpowiedź, aby zobaczyć wyjaśnienie
Słownik opcji
Jasne definicje najważniejszych pojęć, od call, put i łańcucha opcji po IV, greki, open interest i max pain
Przeglądaj słownik opcji