Skip to content
Semua panduan opsi dan kontrak berjangka
Perbandingan model ramalan14 menit

Model Confidence Set (MCS): Membandingkan Model Ramalan Tanpa Memaksakan Pemenang

Pelajari bagaimana Model Confidence Set memakai pengujian berurutan dan bootstrap yang mempertahankan dependensi untuk menyisakan model ramalan yang belum dapat dibedakan oleh bukti.

Dalam panduan iniPertanyaan apa yang dijawab Model Confidence Set?

Ringkasan singkat

Model Confidence Set (MCS) membandingkan keluarga prosedur ramalan yang ditentukan sebelumnya, lalu mengembalikan kandidat yang belum terbukti lebih buruk menurut fungsi loss yang dipilih. Beberapa model dapat tetap bertahan jika sampel tidak mampu membedakannya; hasil bergantung pada keluarga kandidat, rancangan ramalan, loss, dan prosedur inferensi.

Pertanyaan apa yang dijawab Model Confidence Set?

Misalkan beberapa prosedur meramalkan volatilitas hari berikutnya. Kesalahan mereka berbeda, tetapi sampelnya mungkin terlalu pendek atau berisik untuk memastikan prosedur mana yang memiliki expected loss terendah. Memilih rata-rata loss terkecil akan memaksakan satu pemenang, sekalipun selisihnya mungkin hanya variasi sampel. MCS memberi jawaban berbentuk himpunan: kandidat mana yang tetap kompatibel secara statistik dengan status terbaik menurut kriteria kinerja tertentu?

MCS dimulai dari himpunan kandidat \(\mathcal M_0\), suatu loss atau kriteria lain, serta tingkat kepercayaan. Prosedur ini berulang kali menguji apakah kandidat yang masih dipertimbangkan memiliki kemampuan prediksi setara. Jika hipotesis ditolak, aturan eliminasi membuang kandidat yang dinilai relatif lemah lalu pengujian diulang pada himpunan yang lebih kecil. Kandidat yang tersisa membentuk MCS. Hansen, Lunde, dan Nason memperkenalkan prosedur ini sebagai himpunan kepercayaan bagi model terbaik dalam koleksi yang ditentukan, mirip interval kepercayaan parameter yang dapat memuat beberapa nilai ketika data tidak presisi (makalah 2011).

“Terbaik” hanya berlaku relatif terhadap kandidat yang disertakan, target, horizon ramalan, informasi yang tersedia pada tiap origin, dan kriteria penilaian. MCS tidak mensyaratkan satu kandidat sebagai proses pembangkit data yang sebenarnya, dan dapat mempertahankan beberapa kandidat dengan expected performance terbaik yang sama. Ini bukan probabilitas posterior bahwa model yang bertahan adalah benar.

Tetapkan keluarga kandidat dan pertanyaan ramalan

Sebelum menghitung loss, tetapkan \(\mathcal M_0\). Kandidat dapat berupa model terestimasi beserta aturan estimasi dan pembaruan ramalannya, atau prosedur ramalan yang tidak dinyatakan sebagai model statistik. Sebutan “GARCH” belum cukup jika distribusi volatilitas, rolling window, pembaruan parameter, dan horizon ramalan masih dapat berbeda; tiap pilihan dapat menghasilkan kandidat tersendiri.

Setiap kandidat harus meramalkan target yang sama pada origin dan horizon yang sama, hanya memakai informasi yang tersedia saat itu. Perbandingan raw loss tidak adil jika satu model meramalkan variance satu hari dan model lain volatilitas lima hari. Gunakan sampel evaluasi bersama, selaraskan observasi yang hilang secara eksplisit, serta catat vintage data, jendela estimasi awal, jadwal recursive atau rolling, dan perlakuan terhadap input yang direvisi. Forecast yang saling tumpang tindih dapat membuat loss pada origin berdekatan berbagi observasi.

Pilih kriteria sebelum melihat hasil. Squared error, absolute error, atau loss khusus keputusan dapat memberi peringkat berbeda untuk point forecast. Forecast variance dapat memakai loss volatilitas yang sesuai dengan proxy berisik; forecast kuantil memerlukan quantile score, bukan mean squared error. MCS yang baik menurut satu loss belum tentu baik menurut loss lain. Jika daftar kandidat dipersempit setelah hasil evaluasi yang sama diperiksa, set formal hanya bersyarat pada penyaringan yang tidak dilaporkan itu, bukan seluruh pencarian.

Ubah ramalan bersama menjadi selisih loss berpasangan

Misalkan \(y_{t+h}\) adalah target terealisasi untuk ramalan dari origin \(t\), dan \(\hat y_{i,t+h|t}\) adalah ramalan kandidat \(i\). Untuk fungsi loss \(L\) yang telah dipilih, hitung satu loss bagi setiap kandidat dan origin bersama:

\[ L_{i,t}=L(y_{t+h},\hat y_{i,t+h|t}) \]

Anggap loss yang lebih rendah lebih baik. Untuk kandidat \(i\) dan \(j\), tentukan selisih berpasangan berikut:

\[ d_{ij,t}=L_{i,t}-L_{j,t}, \qquad \bar d_{ij}=\frac{1}{P}\sum_{t=1}^{P}d_{ij,t} \]

Di sini \(P\) adalah jumlah origin ramalan bersama. Dengan konvensi tanda ini, \(\bar d_{ij}\) positif berarti kandidat \(i\) memiliki rata-rata loss sampel yang lebih tinggi daripada \(j\); nilai negatif menguntungkan \(i\). Pairing penting karena kedua kandidat menghadapi hasil terealisasi yang sama. Guncangan pasar bersama dapat menaikkan kedua loss, sementara selisihnya mengisolasi kinerja relatif.

Hipotesis nol kemampuan prediksi setara untuk himpunan saat ini \(\mathcal M\) dapat ditulis:

\[ H_{0,\mathcal M}:\quad \mu_{ij}=E[d_{ij,t}]=0 \quad \text{untuk setiap } i,j\in\mathcal M \]

Ini pernyataan bersama tentang himpunan saat ini, bukan kumpulan uji berpasangan yang tidak terkait untuk diperiksa satu per satu. Kerangka MCS asli memakai uji kesetaraan bersama dan aturan eliminasi untuk mengelola pencarian antarmodel. Uji ini tidak menanyakan apakah forecast persis sama pada setiap tanggal.

Uji himpunan saat ini dan tetapkan aturan eliminasi

MCS bergantian menjalankan uji tingkat himpunan dan langkah eliminasi. Mulai dengan \(\mathcal M=\mathcal M_0\), lalu uji kemampuan prediksi setara pada tingkat \(\alpha\) yang dipilih. Jika hipotesis tidak ditolak, berhenti dan laporkan himpunan saat ini. Jika ditolak, gunakan aturan eliminasi yang sudah ditetapkan untuk membuang satu kandidat dan ulangi uji pada himpunan yang lebih kecil. Dengan asumsi prosedurnya, himpunan yang bertahan adalah MCS \((1-\alpha)\).

Makalah tersebut membahas dua statistik yang umum. Statistik range mencari selisih loss berpasangan terstandardisasi terbesar:

\[ T_{R,\mathcal M}=\max_{i,j\in\mathcal M}|t_{ij}|, \qquad t_{ij}=\frac{\bar d_{ij}}{\widehat{\mathrm{se}}(\bar d_{ij})} \]

Aturan eliminasi pasangannya membuang kandidat dengan kerugian relatif terstandardisasi terbesar terhadap kandidat lain. Statistik kedua membandingkan setiap kandidat dengan kinerja rata-rata himpunan saat ini:

\[ T_{\max,\mathcal M}=\max_{i\in\mathcal M}t_{i\cdot}, \qquad d_{i\cdot,t}=\frac{1}{|\mathcal M|}\sum_{j\in\mathcal M}d_{ij,t} \]

Di sini \(t_{i\cdot}\) menstandardisasi rata-rata \(d_{i\cdot,t}\); aturan terkait membuang kandidat dengan excess loss terstandardisasi terbesar terhadap rata-rata himpunan. Statistik dan aturan eliminasi merupakan satu pasangan. Pilih serta laporkan keduanya sebagai prosedur sebelum melihat hasil, jangan mencampurnya setelah tahu mana yang menghasilkan himpunan lebih kecil. Makalah MCS menjelaskan mengapa uji penolakan harus selaras dengan aturan penentuan kandidat yang dikeluarkan (Hansen, Lunde, dan Nason).

Pertahankan dependensi waktu dalam bootstrap

Distribusi statistik maksimum bergantung pada variasi bersama selisih loss para kandidat. Menganggap setiap model atau tanggal sebagai observasi independen dapat merusak dua jenis dependensi: loss berurutan mungkin berkorelasi serial, dan loss dua kandidat pada tanggal yang sama berpasangan. Karena itu bootstrap MCS perlu mempertahankan struktur time-series bersama yang relevan saat mendekati distribusi nol statistik tingkat himpunan.

Salah satu cara adalah mengambil ulang blok waktu yang selaras dari vektor loss atau selisih kandidat. Dalam stationary bootstrap, panjang blok acak dan rangkaian hasil resampling dapat dimulai lagi dari tanggal yang dipilih secara acak; Politis dan Romano memperkenalkan metode ini untuk observasi stasioner yang bergantung lemah (makalah 1994). Penulis MCS menjelaskan implementasi block bootstrap dan mencatat stationary bootstrap sebagai alternatif. Mengambil ulang deret loss tiap model secara terpisah merusak pairing pada tanggal yang sama dan dapat mengubah perbandingan.

Panjang blok rata-rata, varian bootstrap, centering di bawah null kemampuan setara, jumlah replikasi, dan horizon ramalan memengaruhi estimasi ketidakpastian. Horizon panjang yang tumpang tindih sering memperpanjang dependensi selisih loss, tetapi tidak ada satu panjang blok universal untuk semua target dan sampel. Jelaskan desain dan periksa apakah kesimpulan berubah pada pengaturan dependensi yang wajar. Output bootstrap adalah aproksimasi di bawah asumsi; ia tidak memperbaiki look-ahead, holdout yang dipakai ulang, perilaku skor nonstasioner, atau keluarga kandidat yang tidak lengkap.

Hitung perbandingan hipotetis empat model

Misalkan prosedur A, B, C, dan D meramalkan target volatilitas yang sama pada 120 origin harian bersama. Rata-rata squared-error loss mereka, dalam satuan ilustratif kuadrat poin persentase, adalah 1.20, 1.23, 1.45, dan 1.90. Rata-rata itu menempatkan A di urutan pertama dan D terakhir, tetapi peringkat saja tidak menunjukkan ketidakpastian sampel.

Untuk A dibanding B, mean paired loss difference adalah \(1.20-1.23=-0.03\). Jika standard error yang memperhitungkan dependensi adalah \(0.04\), statistik berpasangannya \(-0.03/0.04=-0.75\). Selisih tunggal ini tidak menunjukkan perbedaan statistik yang jelas antara A dan B. MCS tidak berhenti di sana: statistik tingkat himpunan mempertimbangkan selisih bersama di antara keempat kandidat.

Sebagai ilustrasi, anggap MCS block bootstrap pada deret loss lengkap 120 origin memakai \(T_R\), \(\alpha=0.05\), dan aturan eliminasi kandidat terburuk yang koheren. Misalkan p-value himpunan penuh 0.018, D dikeluarkan, lalu p-value untuk \(\{A,B,C\}\) menjadi 0.11. Karena 0.11 melebihi 0.05, prosedur berhenti dengan \(\{A,B,C\}\) sebagai MCS hipotetis 95%. C tetap ada meski rata-rata loss-nya lebih tinggi dari A: uji bersama hipotetis ini belum menetapkan bahwa C inferior.

P-value di sini dikarang untuk menunjukkan langkah-langkahnya; nilainya tidak dapat dihitung kembali dari empat rata-rata loss atau selisih A–B. Hasil nyata memerlukan seluruh deret loss per origin, forecast kandidat, rancangan bootstrap, dan urutan eliminasi. Simpan input tersebut dan laporkan seluruh urutan agar pembaca tahu kandidat mana yang keluar pada tiap penolakan. <!-- learn:illustration -->

Beberapa jalur prakiraan tetap berdekatan dalam pita lembut, sementara jalur yang lebih jauh memudar sehingga tersisa satu kelompok, bukan satu pemenang
Ilustrasi konseptual perbandingan prakiraan yang mempertahankan beberapa kandidat yang tidak dapat dibedakan secara statistik; bukan prakiraan teramati, hasil empiris, atau sinyal perdagangan.

Tafsirkan himpunan yang bertahan tanpa klaim berlebihan

Pada tingkat kepercayaan 95%, dengan kondisi regularitas dan pengujian prosedurnya, MCS dirancang agar memuat kandidat terbaik dalam himpunan yang ditentukan dengan setidaknya cakupan asimtotik yang disebutkan. Ini tidak berarti setiap model yang bertahan memiliki peluang 95% untuk menjadi yang terbaik. Pernyataan kepercayaan berkaitan dengan prosedur pada sampel berulang, bukan distribusi posterior atas label model.

Gagal menolak kemampuan prediksi setara bukan bukti bahwa expected loss para kandidat persis sama. Daya uji dapat terbatas, khususnya ketika periode evaluasi singkat, selisih loss sangat volatil, atau beberapa kandidat hampir seri. Himpunan bertahan yang besar dapat secara jujur menunjukkan data tidak mampu memisahkan alternatif. Himpunan itu juga dapat memuat model yang semuanya buruk secara absolut karena MCS membandingkan kandidat satu sama lain, bukan dengan standar eksternal wajib.

Cakupan himpunan juga dibatasi kandidat yang masuk ke \(\mathcal M_0\). Jika prosedur ramalan yang sungguh lebih baik tidak disertakan, MCS tidak dapat menemukannya. Jika model dikeluarkan sebelum analisis karena hasil evaluasi yang sama sebelumnya membuatnya tampak lemah, cakupan nominal tidak memperhitungkan pencarian yang tidak tercatat itu. Laporkan riwayat pembuatan dan penyaringan kandidat. Jika beberapa kandidat berbagi expected loss terbaik, mempertahankan lebih dari satu sesuai metode, bukan kegagalan memilih.

Bedakan MCS dari uji berpasangan dan uji benchmark

Uji Diebold–Mariano berfokus pada selisih loss berpasangan bagi dua prosedur ramalan. MCS menguji sebuah himpunan berulang kali dan melaporkan kandidat yang bertahan dari eliminasi bersama. Menjalankan banyak uji DM lalu mempertahankan pasangan yang tidak signifikan tidak otomatis setara dengan MCS; bootstrap bersama dan aturan eliminasi yang koheren penting.

Uji Clark–West menangani perbandingan squared error yang lebih khusus ketika satu model memuat benchmark terbatas dan noise estimasi memengaruhi selisih mentah. MCS tidak mensyaratkan kandidat bersarang dan dapat memakai loss pilihan pengguna, tetapi tetap memerlukan rancangan ramalan bersama.

White’s Reality Check dan Hansen’s Superior Predictive Ability menguji apakah setidaknya satu anggota keluarga yang ditelusuri mengungguli benchmark tertentu. MCS bebas benchmark dan menggambarkan himpunan kandidat yang relatif superior, bukan menguji satu benchmark. Semua prosedur memerlukan catatan pencarian dan dependensi yang akurat, tetapi hipotesis nolnya berbeda. Lihat panduan Reality Check dan SPA, serta makalah asli White (2000) dan Hansen (2005).

Laporkan rancangan dan pisahkan peringkat ramalan dari nilai trading

Laporan MCS yang dapat direproduksi menyebutkan setiap prosedur kandidat, target dan horizon bersama, aturan origin ramalan dan informasi, jadwal estimasi, tanggal evaluasi, perlakuan data hilang, rumus loss, serta arah yang dianggap lebih baik. Cantumkan tingkat signifikansi, statistik uji dan aturan eliminasi, jenis bootstrap, pilihan panjang blok, metode centering, jumlah replikasi, p-value tiap tahap, dan anggota akhir. Rata-rata loss dan selisih boleh menjadi konteks, tetapi jangan mengganti inferensi bersama dengan tabel peringkat.

Untuk evaluasi volatilitas, jelaskan bagaimana proxy observasi dibuat dan apakah berisik atau direvisi. Untuk prediksi beberapa langkah, ungkapkan overlap jendela target dan metode dependensi. Tunjukkan sensitivitas terhadap perubahan wajar pada loss, periode sampel, dan pengaturan bootstrap ketika pilihan tersebut memengaruhi keanggotaan. Satu p-value kecil tanpa kandidat yang dieliminasi dan detail prosedur tidak cukup untuk mereproduksi himpunan.

MCS memberi peringkat prosedur ramalan menurut satu kriteria. MCS tidak menetapkan struktur kausal, mengidentifikasi model pembangkit data, atau membuktikan bahwa forecast yang tersisa menghasilkan trading menguntungkan. Mengubah forecast menjadi posisi menambahkan ambang, ukuran posisi, turnover, waktu eksekusi, spread, biaya, slippage, pendanaan, pinjaman, dan batas risiko. Evaluasi proses keputusan yang dibekukan itu pada data kemudian yang sesuai dan laporkan hasil trading bersih secara terpisah. Untuk skor volatilitas dengan proxy yang tidak sempurna, lihat panduan QLIKE versus squared-error loss.

Pertanyaan umum

Q1Apakah MCS memilih satu model terbaik?

Belum tentu. Satu kandidat dapat tersisa jika bukti memisahkannya, atau beberapa tetap ada ketika sampel belum dapat menetapkan mana yang inferior. Memilih satu untuk diterapkan memerlukan aturan keputusan terpisah.

Q2Apakah model dalam MCS memiliki peluang 95% untuk benar?

Tidak. Tingkat kepercayaan menjelaskan cakupan sampel berulang bagi kandidat terbaik dalam keluarga yang dinyatakan, di bawah asumsi metode. Itu bukan probabilitas posterior bahwa sebuah model benar.

Q3Bisakah MCS digunakan selain untuk forecast volatilitas?

Bisa. MCS dapat membandingkan forecast, model ekonometrika, atau kandidat lain jika kriteria bersama yang bermakna dan rancangan sampel yang sesuai ditetapkan. Hasilnya tetap bergantung pada himpunan kandidat dan loss yang dipilih.

Q4Apakah MCS otomatis memperhitungkan semua model yang pernah saya coba?

Hanya jika pencarian sebenarnya tercermin dalam keluarga kandidat dan prosedur evaluasi. Penyaringan yang tidak dicatat atau pemakaian berulang data evaluasi tidak dikoreksi hanya dengan menjalankan MCS setelahnya.

Sumber dan bacaan lanjutan

Laporkan masalah

Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya

Cek cepat

Sudah membaca panduannya? Uji diri dengan 3 pertanyaan

Pertanyaan 1 / 3

Pertanyaan 01

Apa yang dilaporkan Model Confidence Set?

Pilih jawaban untuk melihat penjelasannya

Glosarium opsi

Definisi jelas untuk istilah inti, dari call, put, dan rantai opsi hingga IV, Greeks, serta spread bid-ask

Lihat glosarium opsi