Uji Giacomini–White: Akurasi Prakiraan Bersyarat
Pelajari cara uji Giacomini–White menilai apakah akurasi prakiraan berubah menurut kondisi yang diketahui, cara memilih instrumen, dan batas kesimpulan dari hasilnya
Dalam panduan iniAkurasi rata-rata dan akurasi bersyarat menjawab pertanyaan berbeda
Ringkasan singkat
Kerangka Giacomini–White (GW) menanyakan apakah kerugian relatif dua prakiraan berhubungan dengan informasi yang tersedia saat prakiraan dibuat. Kerangka ini dapat menunjukkan perbedaan yang tersembunyi di balik skor rata-rata, tetapi hasilnya bergantung pada prakiraan, jendela evaluasi, fungsi kerugian, dan variabel pengondisi yang ditentukan sebelumnya.
Akurasi rata-rata dan akurasi bersyarat menjawab pertanyaan berbeda
Misalkan prakiraan A memiliki kerugian rata-rata yang lebih rendah daripada B pada sampel uji. Rata-rata itu mungkin menyembunyikan pola yang berguna: A dapat lebih baik di pasar yang tenang, sedangkan B lebih baik ketika volatilitas tinggi. Jika pertanyaannya adalah prakiraan mana yang lebih baik secara rata-rata, perbandingan tak bersyarat sesuai. Jika pertanyaannya apakah informasi yang diketahui pada tanggal prakiraan membantu memperkirakan prakiraan mana yang akan berkinerja lebih baik, yang diuji adalah kemampuan prediksi bersyarat.
Giacomini dan White merumuskan masalah ini sebagai perbandingan metode prakiraan berdasarkan fungsi kerugian dan himpunan informasi tertentu. Kerangkanya dapat digunakan untuk prakiraan titik, interval, probabilitas, atau densitas selama fungsi kerugian sesuai dengan tugasnya. Prosedur estimasi yang menghasilkan setiap prakiraan juga merupakan bagian dari metode. Jendela bergerak, sampel pelatihan tetap, atau aturan pembobotan termasuk dalam objek yang dievaluasi, bukan rincian yang bebas diubah setelah hasil terlihat (Giacomini dan White, 2006).
Pertanyaan ini berkaitan dengan uji patahan struktural, tetapi keduanya tidak sama. Uji bersyarat menanyakan apakah kerugian relatif prakiraan secara sistematis terkait dengan informasi yang dipilih. Uji patahan menanyakan apakah parameter atau suatu hubungan berubah pada waktu yang tidak diketahui atau sudah ditentukan. Panduan Diebold–Mariano membahas perbandingan tak bersyarat atas kerugian rata-rata; pertanyaan bersyarat memerlukan informasi pengondisi yang dinyatakan secara eksplisit.
Selaraskan prakiraan, hasil, dan informasi terlebih dahulu
Misalkan (Y_{t+1}) adalah sasaran yang diamati setelah titik asal prakiraan (t). Prakiraan ŷA,t+1 dan ŷB,t harus merujuk pada sasaran, horizon, satuan, dan batas informasi yang sama. Untuk fungsi kerugian (L) yang nilainya lebih rendah lebih baik, definisikan selisih kerugian sebagai:
dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)
Dengan konvensi tanda ini, nilai positif berarti A menanggung kerugian lebih besar sehingga B lebih baik pada titik asal tersebut; nilai negatif menguntungkan A. Gunakan satu baris untuk setiap titik asal dan nilai kedua prakiraan terhadap realisasi yang sama. Simpan prakiraan sebagaimana tersedia pada saat itu, versi data, dan versi modelnya. Jangan membangun ulang prakiraan historis menggunakan input yang telah direvisi atau informasi yang baru tersedia kemudian.
Variabel pengondisi juga harus diketahui pada titik asal prakiraan. Contohnya mencakup estimasi volatilitas tertunda, indikator peristiwa yang telah diumumkan, selisih kerugian tertunda, atau variabel keadaan pasar yang dihitung hanya dari pengamatan sebelumnya. Variabel yang diukur setelah (t) tidak dapat menjelaskan prakiraan mana yang lebih baik pada (t+1) tanpa bias informasi masa depan.
Ukuran skor harus cocok dengan sasaran. Kesalahan kuadrat merupakan salah satu pilihan untuk prakiraan rata-rata bersyarat, tetapi tidak otomatis cocok untuk prakiraan volatilitas, kuantil, atau densitas. Jika satu model memprakirakan varians dan model lain simpangan baku, ubah keduanya lebih dahulu agar memprakirakan besaran yang sama. Uji statistik tidak dapat memperbaiki ketidakcocokan dalam pertanyaan yang dinilai.
Untuk prakiraan volatilitas, nilai keduanya menggunakan definisi varians terealisasi dan interval pengambilan sampel yang sama. Jika satu prakiraan mencakup harga intraday sementara yang lain juga mencakup imbal hasil semalam, selisih kerugian dapat mencerminkan sasaran yang berbeda, bukan kemampuan prakiraan. Tentukan cara memperlakukan pergerakan saat pasar tutup, frekuensi sampel, pengamatan yang hilang, serta ukuran terealisasi, lalu terapkan pilihan yang sama. Jika proksi terealisasi mengandung derau, kesalahan pengukuran itu memengaruhi kedua skor kerugian dan perlu disertakan dalam interpretasi.
Nyatakan hipotesis nol bersyarat dan pilih fungsi uji
Misalkan (mathcal{G}_t) adalah himpunan informasi yang digunakan untuk mengondisikan perbandingan. Hipotesis nol idealnya adalah:
H₀: E[dₜ₊₁ | 𝒢ₜ] = 0
Artinya, selisih kerugian yang diharapkan adalah nol jika informasi yang ditentukan telah diketahui. Uji GW satu langkah mengubah pernyataan bersyarat ini menjadi sekumpulan momen dengan vektor fungsi uji (h_t) yang dipilih sebelumnya. Setiap fungsi harus dapat diukur menggunakan informasi yang tersedia pada waktu (t):
H₀,ₕ: E[hₜ dₜ₊₁] = 0
Konstanta dalam (h_t) mencakup selisih kerugian rata-rata. Elemen lain dapat mewakili keadaan pasar, kerugian relatif tertunda, atau transformasi nonlinier yang dipilih sebelum hasil diperiksa. Misalnya, (h_t=(1,S_t)'), dengan (S_t) indikator biner volatilitas tinggi yang sudah diketahui pada (t), menguji momen konstanta sekaligus hubungan selisih kerugian dengan keadaan tersebut.
Himpunan fungsi uji yang terbatas hanya menguji momen yang ditentukannya. Penolakan hipotesis nol menunjukkan bahwa setidaknya satu momen pilihan tidak konsisten dengan nol menurut asumsi uji; hasil ini tidak menemukan model yang selalu terbaik dan tidak membuktikan bahwa setiap variabel keadaan yang mungkin relevan. Gagal menolak juga tidak membuktikan kesamaan kinerja bersyarat. Jika hanya konstanta yang digunakan, yang dibandingkan adalah momen tak bersyarat, bukan semua kondisi yang mungkin.
Tentukan fungsi kerugian, instrumen, transformasi, sampel, dan horizon prakiraan sebelum melihat model mana yang menang. Menambahkan banyak indikator keadaan, ambang, dan lag setelah hasil terlihat menimbulkan masalah pencarian tambahan. Uji bersyarat tidak dengan sendirinya mengoreksi seleksi tersebut.
Tetapkan juga kapan setiap variabel keadaan dibentuk. Jika “volatilitas tinggi” berarti 20 persen nilai volatilitas tertinggi dalam seluruh sampel, pengamatan masa depan ikut menentukan ambang bagi titik asal di masa lalu. Estimasikan ambang hanya dari informasi yang tersedia pada setiap titik asal atau gunakan aturan yang diumumkan sebelum tanggal tersebut. Untuk variabel keadaan kontinu, tentukan satuan serta pemusatan atau penskalaannya sejak awal. Indikator yang hampir sama dapat membuat kondisi momen redundan dan matriks kovarians sulit diinversi, jadi gunakan himpunan sekecil mungkin yang tetap mudah ditafsirkan.
Bentuk statistik Wald dan tafsirkan distribusi acuannya
Untuk (q) fungsi uji, bentuk vektor momen (g_{t+1}=h_t d_{t+1}). Rata-rata sampelnya adalah:
ḡ = (1/n) Σₜ gₜ₊₁
Statistik GW satu langkah berbentuk statistik Wald:
GW = n ḡ′ Ω̂⁻¹ ḡ
Di sini, (hatOmega) mengestimasi matriks kovarians vektor momen. Di bawah hipotesis nol dan kondisi regularitas dalam makalah, statistik ini secara asimtotik mengikuti distribusi acuan chi-kuadrat dengan (q) derajat kebebasan. Karena itu, jumlah fungsi uji memengaruhi distribusi acuan dan dapat memengaruhi daya uji. Banyak instrumen yang lemah atau redundan dapat membuat estimasi kovarians tidak stabil tanpa menambah informasi berguna.
Dalam kerangka satu langkah, hipotesis nol mengimplikasikan struktur beda martingal pada vektor momen, sehingga uji aslinya dapat memakai estimasi momen kedua sampel. Untuk horizon lain, hasil yang tumpang tindih, atau penyimpangan dari kerangka tersebut, estimator varians harus sesuai dengan asumsi dan struktur dependensi uji yang dipilih. Ikuti formulasi implementasi yang digunakan alih-alih menyalin bandwidth HAC dari uji lain secara otomatis. Metode kovarians HAC umum, termasuk estimator Newey dan West (1987), adalah alat untuk situasi yang memang memerlukannya, bukan ketentuan bandwidth universal bagi GW. Kredibilitas hasil juga bergantung pada estimasi kovarians dan rancangan prakiraan.
Periksa pula apakah (Ω̂) dapat diestimasi dari momen yang dipilih. Fungsi uji yang hampir duplikat, indikator dengan sangat sedikit pengamatan di salah satu keadaan, atau terlalu banyak interaksi dapat membuat matriks singular atau tidak stabil. Inversnya bisa berubah tajam setelah revisi data kecil dan mendistorsi statistik uji. Setiap fungsi harus punya alasan yang terkait kondisi atau perbedaan kinerja; laporkan jumlahnya dan kovarians momen. Menghapus fungsi yang dianggap tidak berguna setelah melihat hasil juga merupakan langkah seleksi dan perlu diungkapkan.
Nilai p adalah bukti terhadap pembatasan momen yang dinyatakan berdasarkan distribusi acuan. Nilai ini bukan probabilitas bahwa A atau B merupakan model yang benar, dan bukan peluang sebuah aturan perdagangan akan menghasilkan laba. Laporkan statistik, derajat kebebasan, nilai p, dan momen yang tepat diuji agar makna penolakan jelas.
<!-- learn:illustration -->

Contoh dua keadaan menunjukkan hal yang dapat tersembunyi dalam rata-rata
Pertimbangkan delapan titik asal hipotetis untuk prakiraan satu langkah. Misalkan (S_t=0) menunjukkan keadaan tenang dan (S_t=1) keadaan volatilitas tinggi. Anggap selisih kerugian (d_{t+1}=L_A-L_B) adalah −2, −2, −2, dan −2 pada empat titik asal yang tenang, lalu +2, +2, +2, dan +2 pada empat titik asal dengan volatilitas tinggi. Selisih negatif menguntungkan A; selisih positif menguntungkan B.
Rata-rata di seluruh delapan titik asal adalah nol, jadi contoh kecil ini tidak menunjukkan selisih kerugian tak bersyarat. Rata-rata pada keadaan tenang adalah −2, sedangkan pada keadaan volatilitas tinggi +2. Peringkat relatif berbalik menurut keadaan. Uji dengan (h_t=(1,S_t)') memuat momen konstanta dan momen volatilitas tinggi yang dapat mencerminkan pola ini.
Delapan nilai tersebut merupakan ilustrasi perhitungan, bukan jumlah pengamatan yang cukup untuk inferensi andal. Pada data nyata, perhitungkan cara prakiraan diestimasi, apakah variabel keadaan ditetapkan sebelumnya, jumlah titik asal yang tersedia, serta perubahan momen selisih kerugian dari waktu ke waktu. Pembagian keadaan secara visual saja bukan bukti bahwa pola akan bertahan.
Perlakukan jendela estimasi sebagai bagian dari metode
Asimtotik GW asli mempertahankan ketidakpastian estimasi prakiraan dengan menjaga ukuran maksimum jendela estimasi tetap terbatas sementara jumlah prakiraan di luar sampel bertambah. Jendela bergerak dan sampel estimasi tetap sesuai dengan kerangka inti tersebut. Ukuran jendela dan setiap aturan pemilihan jendela yang bergantung pada data merupakan bagian dari metode prakiraan dan harus ditetapkan serta dilaporkan.
Hal ini penting ketika model prakiraan diestimasi ulang. Perbandingan yang mengabaikan estimasi parameter dapat melewatkan ketidakpastian dari cara setiap metode belajar memakai data lampau. GW dapat menangani prakiraan dari model bersarang maupun tidak bersarang dalam kondisi yang dinyatakan, tetapi tidak menjamin hasil yang sama untuk setiap implementasi jendela yang terus meluas atau setiap estimator. Dalam kerangka satu langkah asli, jendela yang terus meluas secara konvensional berada di luar asumsi jendela terbatas. Jika rancangan berbeda, gunakan hasil yang diturunkan untuk pembentukan prakiraan yang sebenarnya.
Uji ini juga tidak memilihkan jendela yang sesuai. Jendela pendek dapat menyesuaikan diri dengan kondisi terkini, tetapi memakai lebih sedikit pengamatan; jendela panjang atau yang terus meluas dapat menstabilkan estimasi sambil mempertahankan hubungan yang sudah usang. Bandingkan pilihan tersebut melalui evaluasi yang direncanakan sebelumnya dan catat proses pemilihan jendelanya. Giacomini dan Rossi (2010) mengembangkan uji tersendiri untuk perubahan kinerja prakiraan relatif dari waktu ke waktu di lingkungan yang tidak stabil. Pertanyaan tentang jalur waktu ini terkait, tetapi statistiknya berbeda dari uji bersyarat GW dasar.
Penolakan bersyarat saja juga tidak menghasilkan aturan perdagangan yang memilih prakiraan tepat secara real time. Instrumen dapat berkaitan dengan selisih kerugian pada data evaluasi tanpa menghasilkan aturan pergantian yang stabil atau dapat diterapkan. Untuk memilih prakiraan dengan informasi saat ini, tetapkan aturan menggunakan pengamatan masa lalu dan uji pada rangkaian titik asal berikutnya yang belum dipakai, termasuk ketidakpastian estimasi dan keputusan.
Bedakan GW dari DM, uji model bersarang, dan uji ketidakstabilan
Uji Diebold–Mariano menanyakan apakah dua prakiraan memiliki kerugian rata-rata yang sama selama sampel evaluasi. GW menanyakan apakah informasi terpilih berkaitan dengan kerugian relatif keduanya, dengan perbandingan tak bersyarat sebagai salah satu pembatasan momen yang mungkin. Contoh dua keadaan menunjukkan bahwa dua model dapat memiliki skor rata-rata sama, tetapi kinerja relatif yang bergantung pada kondisi.
Jika prakiraan berasal dari model bersarang dan pertanyaannya secara khusus adalah kesamaan mean squared prediction error, metode model bersarang seperti penyesuaian Clark–West membahas hipotesis nol dan masalah derau estimasi yang berbeda. Jika banyak aturan perdagangan atau prakiraan telah dicari dan pertanyaannya apakah satu kandidat pun memiliki kemampuan prediksi superior, gunakan prosedur untuk seluruh keluarga kandidat seperti Reality Check White atau uji SPA Hansen. Uji bersyarat pada satu pasangan terpilih tidak membatalkan pencarian yang lebih luas.
Terakhir, bukti bahwa akurasi relatif berubah sepanjang waktu tidak menentukan tanggal patahan tertentu. Uji ketidakstabilan lokal atau pembalikan mungkin lebih sesuai jika pertanyaan penelitian menyangkut jalur kinerja relatif, bukan hubungannya dengan instrumen pilihan. Giacomini dan Rossi (2010) mempelajari perbandingan prakiraan seperti itu. Pilih metode yang sesuai dengan pertanyaan; jangan menganggap setiap penolakan sebagai bukti strategi perdagangan yang berganti menurut rezim.
Perhitungkan daya uji rendah dan pengujian berulang
Uji bersyarat dapat memerlukan banyak data. Membagi sampel menjadi keadaan tenang dan volatil mengurangi jumlah pengamatan bagi setiap perbandingan. Menambah fungsi meningkatkan jumlah momen dan derajat kebebasan. Jika beberapa kondisi hanya sedikit berhubungan dengan kerugian relatif, daya uji bisa rendah meskipun ada perbedaan bersyarat.
Makalah kerja Federal Reserve Bank of St. Louis karya McCracken mempelajari keberadaan, ukuran, dan daya uji GW dalam contoh sederhana dengan kerugian kuadratik. Simulasinya menemukan bahwa ukuran uji dapat terjaga dengan baik, sementara daya ujinya umumnya rendah pada kondisi yang diteliti (McCracken, 2020). Ini peringatan untuk menafsirkan hasil, bukan prakiraan angka universal bagi setiap penerapan. Gagal menolak dapat mencerminkan informasi terbatas atau daya uji rendah; jangan menyebutnya bukti bahwa prakiraan dapat dipertukarkan.
Berulang kali mencoba definisi keadaan, ambang, horizon, fungsi kerugian, dan tanggal evaluasi alternatif meningkatkan peluang temuan kebetulan. Catat semua pengujian kandidat dan pisahkan analisis eksploratif dari sampel konfirmasi yang telah ditentukan sebelumnya. Jika klaimnya adalah satu strategi dari suatu keluarga memiliki kemampuan prediksi, terapkan metode pengujian berganda atau data snooping yang sesuai pada seluruh keluarga. Instrumen bersyarat tambahan tidak otomatis menghasilkan bukti yang lebih meyakinkan.
Saat membandingkan beberapa model prakiraan, prosedur tingkat keluarga menjawab pertanyaan berbeda dari uji bersyarat berpasangan. Panduan Model Confidence Set menjelaskan bagaimana perbandingan iteratif dapat mempertahankan sekumpulan model yang tak dapat dibedakan pada tingkat yang dipilih; prosedur itu tidak menggantikan penentuan kondisi terlebih dahulu dalam analisis GW.
Laporkan rancangan agar dapat direplikasi
Sebutkan kedua metode prakiraan, cara masing-masing diestimasi, apakah modelnya bersarang, sasaran dan horizon, serta tanggal evaluasi. Tuliskan fungsi kerugian dan konvensi tanda untuk (d_{t+1}). Jelaskan setiap elemen (h_t), cara pembentukannya, kapan dapat diamati, dan apakah dipilih sebelum hasil dilihat.
Laporkan jadwal titik asal prakiraan, aturan jendela estimasi, versi data, aturan sampel bersama, jumlah titik asal di luar sampel, jumlah fungsi uji, estimator kovarians, distribusi acuan, statistik uji, derajat kebebasan, dan nilai p. Nyatakan apakah horizon saling tumpang tindih dan bagaimana dependensi ditangani. Sertakan kerugian rata-rata dan ringkasan selisih kerugian, bukan hanya hasil uji.
Daftarkan instrumen, ambang, jendela, fungsi kerugian, dan pasangan prakiraan lain yang dicoba. Jika pengamatan yang sama digunakan untuk memilih model atau variabel pengondisi lalu mengujinya, nyatakan hal itu. Hasil dapat informatif tanpa menjadi konfirmatif; pelaporan transparan membantu pembaca menilai cakupannya dan merancang validasi terpisah.
Pertanyaan umum
Q1Apakah uji Giacomini–White sama dengan uji Diebold–Mariano?
Tidak. Diebold–Mariano berfokus pada kesamaan kerugian rata-rata. Kerangka GW satu langkah menguji momen bersyarat yang dipilih dan mencakup momen tak bersyarat sebagai salah satu pembatasan yang mungkin.
Q2Apakah penolakan menunjukkan prakiraan mana yang harus digunakan pada setiap rezim pasar?
Tidak. Penolakan menunjukkan bahwa setidaknya satu momen pilihan tidak konsisten dengan nol berdasarkan asumsi uji. Hasilnya bergantung pada instrumen, sampel, dan fungsi kerugian, serta tidak menjamin kinerja di setiap keadaan.
Q3Bolehkah saya terus menambahkan ambang volatilitas sampai uji menolak?
Tindakan itu merupakan pencarian di antara variabel pengondisi. Tentukan variabel sebelumnya bila memungkinkan, laporkan semua spesifikasi yang dicoba, dan gunakan sampel konfirmasi terpisah atau koreksi tingkat keluarga yang sesuai untuk klaim prediktif yang luas.
Q4Apakah kemampuan prediksi bersyarat berarti strategi perdagangan menguntungkan?
Tidak. Uji ini membandingkan kerugian prakiraan. Klaim perdagangan memerlukan aturan keputusan yang ditetapkan serta evaluasi terpisah atas eksekusi, biaya, pendanaan, dampak pasar, dan risiko. Riset utama - Giacomini dan White, “Tests of Conditional Predictive Ability” (2006) - Giacomini dan Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (makalah kerja Federal Reserve Bank of St. Louis, 2020) - Diebold dan Mariano, “Comparing Predictive Accuracy” (1995) - Newey dan West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Dengan dₜ₊₁ = L(A) − L(B), apa arti selisih kerugian yang positif?
Pilih jawaban untuk melihat penjelasannya