Skip to content
Semua panduan opsyen
Pengujian ramalan13 min bacaan

Ujian Giacomini–White: ketepatan ramalan bersyarat

Ketahui cara ujian Giacomini–White memeriksa sama ada ketepatan ramalan berubah mengikut maklumat yang diketahui, cara memilih instrumen dan batas kesimpulannya

Dalam panduan iniKetepatan purata dan ketepatan bersyarat menjawab soalan yang berbeza

Ringkasan ringkas

Rangka kerja Giacomini–White (GW) bertanya sama ada maklumat yang tersedia ketika ramalan dibuat berkait dengan kerugian relatif dua ramalan. Ia boleh mendedahkan perbezaan yang tersembunyi dalam skor purata, tetapi hasilnya bergantung pada kaedah ramalan, tempoh penilaian, fungsi kerugian dan pemboleh ubah bersyarat yang ditetapkan terlebih dahulu.

Ketepatan purata dan ketepatan bersyarat menjawab soalan yang berbeza

Andaikan ramalan A mempunyai purata kerugian yang lebih rendah daripada ramalan B dalam sampel ujian. Purata itu mungkin menyembunyikan corak yang berguna: A mungkin lebih baik ketika pasaran tenang, sementara B lebih baik ketika turun naik tinggi. Jika soalannya ramalan mana yang lebih baik secara purata, perbandingan tanpa syarat sesuai digunakan. Jika soalannya sama ada maklumat yang diketahui pada masa ramalan membantu meramalkan ramalan mana yang akan lebih baik, sasaran yang dikaji ialah keupayaan ramalan bersyarat.

Giacomini dan White merumuskan perkara ini sebagai perbandingan kaedah ramalan berdasarkan fungsi kerugian dan set maklumat tertentu. Rangka kerja ini boleh digunakan untuk ramalan titik, selang, kebarangkalian atau ketumpatan jika kerugian ditakrifkan mengikut tugas ramalan. Kaedah anggaran yang menghasilkan setiap ramalan turut menjadi sebahagian daripada perkara yang dinilai. Oleh itu, tetingkap bergerak, sampel latihan tetap atau peraturan pemberat bukan butiran remeh yang boleh diubah selepas melihat hasil; semuanya sebahagian daripada kaedah ramalan yang dibandingkan (Giacomini dan White, 2006).

Ujian bersyarat berkait dengan ujian perubahan struktur, tetapi kedua-duanya tidak sama. Ujian bersyarat bertanya sama ada kerugian relatif berkait secara sistematik dengan maklumat yang dipilih. Ujian perubahan struktur pula menilai sama ada parameter atau hubungan berubah pada masa yang tidak diketahui atau ditetapkan. Panduan ujian Diebold–Mariano membincangkan perbandingan tanpa syarat berdasarkan kerugian purata; soalan bersyarat memerlukan maklumat yang hendak dijadikan syarat dinyatakan dengan jelas.

Selaraskan ramalan, hasil sebenar dan masa maklumat terlebih dahulu

Anggap (Y_{t+1}) ialah sasaran yang diperhatikan selepas titik asal ramalan (t). Ramalan ŷA,t+1 dan ŷB,t+1 perlu merujuk kepada sasaran, ufuk, unit dan waktu tutup maklumat yang sama. Bagi fungsi kerugian (L) yang lebih rendah adalah lebih baik, takrifkan perbezaan kerugian seperti berikut:

dₜ₊₁ = L(Yₜ₊₁, ŷA,ₜ₊₁) − L(Yₜ₊₁, ŷB,ₜ₊₁)

Dengan konvensyen tanda ini, nilai positif bermaksud A mengalami kerugian lebih besar lalu B lebih baik pada titik ramalan tersebut; nilai negatif memihak kepada A. Gunakan satu baris bagi setiap titik asal ramalan dan nilai kedua-dua ramalan terhadap realisasi yang sama. Simpan ramalan seperti yang tersedia pada masa itu berserta versi data dan model. Jangan bina semula ramalan sejarah menggunakan input yang telah disemak semula atau maklumat yang hanya muncul kemudian.

Pemboleh ubah bersyarat juga mesti diketahui pada titik asal ramalan. Contohnya termasuk anggaran turun naik tertangguh, penunjuk peristiwa yang diumumkan lebih awal, perbezaan kerugian relatif tertangguh atau pemboleh ubah keadaan pasaran yang hanya dikira daripada pemerhatian terdahulu. Pemboleh ubah yang diukur selepas (t) tidak boleh menerangkan ramalan mana yang lebih baik pada (t+1) tanpa menimbulkan bias pandang ke hadapan.

Padankan skor dengan sasaran. Ralat kuasa dua ialah satu pilihan untuk ramalan min bersyarat, tetapi ia tidak semestinya sesuai untuk ramalan turun naik, kuantil atau ketumpatan. Jika satu model meramal varians dan satu lagi sisihan piawai, tukarkan dahulu supaya kedua-duanya meramal kuantiti yang sama. Ujian tidak boleh membetulkan ketidakpadanan pada soalan yang sedang dinilai.

Bagi ramalan turun naik, nilai kedua-duanya menggunakan takrif varians terealisasi dan sela pensampelan yang sama. Jika satu ramalan menyasarkan harga intrahari sedangkan satu lagi turut memasukkan pulangan semalaman, perbezaan kerugian mungkin mencerminkan sasaran yang berbeza dan bukannya kemahiran ramalan. Tentukan cara mengendalikan pergerakan ketika pasaran tutup, kekerapan pensampelan, pemerhatian hilang dan ukuran terealisasi, kemudian gunakan pilihan itu secara konsisten. Jika proksi terealisasi mempunyai hingar, ralat pengukuran tersebut mempengaruhi kedua-dua skor kerugian dan patut diambil kira dalam tafsiran.

Nyatakan hipotesis nol bersyarat dan pilih fungsi ujian

Biarkan (𝒢ₜ) mewakili maklumat yang digunakan untuk syarat perbandingan. Hipotesis nol yang ideal ialah

H₀: E[dₜ₊₁ | 𝒢ₜ] = 0

Maksudnya, perbezaan kerugian yang dijangka ialah sifar apabila dipertimbangkan bersama maklumat yang dinyatakan. Ujian GW satu langkah menukar pernyataan bersyarat ini kepada beberapa momen menggunakan vektor fungsi ujian (h_t) yang dipilih terlebih dahulu dan boleh dibentuk daripada maklumat yang tersedia pada masa (t):

H₀,ₕ: E[hₜ dₜ₊₁] = 0

Vektor (h_t) boleh mengandungi pemalar, yang merangkumi purata perbezaan kerugian. Unsur lain boleh mewakili keadaan pasaran, kerugian relatif tertangguh atau transformasi bukan linear yang ditentukan sebelum keputusan diperiksa. Misalnya, jika (S_t) ialah penunjuk binari turun naik tinggi yang diketahui pada (t), tetapkan (h_t=(1,S_t)') untuk menguji momen pemalar serta perkaitan kerugian dengan keadaan itu.

Set fungsi ujian yang terhingga hanya menguji momen yang ditakrifkannya. Penolakan menunjukkan sekurang-kurangnya satu momen terpilih tidak selaras dengan sifar di bawah andaian ujian; ia tidak mengenal pasti model yang terbaik secara universal atau membuktikan bahawa setiap pemboleh ubah keadaan yang mungkin itu penting. Gagal menolak juga tidak membuktikan prestasi bersyarat adalah sama. Ujian yang hanya menggunakan pemalar ialah perbandingan momen tanpa syarat, bukannya carian luas merentasi semua keadaan.

Tetapkan fungsi kerugian, instrumen, transformasi, sampel dan ufuk ramalan sebelum melihat model mana yang menang. Menambah banyak penunjuk keadaan, ambang dan lat terselaras selepas melihat hasil mewujudkan masalah carian yang lain. Ujian bersyarat itu sendiri tidak membetulkan pemilihan tersebut.

Tetapkan juga masa pembentukan setiap pemboleh ubah keadaan. Jika “turun naik tinggi” ditakrifkan sebagai 20 peratus teratas turun naik dalam keseluruhan sampel, pemerhatian masa depan membantu menentukan ambang bagi titik ramalan lampau. Anggarkan ambang menggunakan maklumat yang tersedia setakat setiap titik ramalan atau gunakan peraturan yang diumumkan sebelum tarikh itu. Bagi pemboleh ubah keadaan berterusan, tentukan unit serta kaedah pemusatan atau penskalaan terlebih dahulu. Beberapa penunjuk yang hampir sama boleh menghasilkan momen berlebihan dan menyukarkan penyongsangan matriks kovarians. Pilih set sekecil mungkin yang masih jelas maksudnya.

Bentuk statistik Wald dan tafsirkan taburan rujukan

Bagi (q) fungsi ujian, bentuk vektor momen (g_{t+1}=h_t d_{t+1}). Purata sampelnya ialah

ḡ = (1/n) Σₜ gₜ₊₁

Statistik GW satu langkah mempunyai bentuk Wald berikut:

GW = n ḡ′ Ω̂⁻¹ ḡ

(Ω̂) menganggarkan matriks kovarians vektor momen. Di bawah hipotesis nol dan syarat ketetapan dalam kertas asal, statistik ini mempunyai taburan rujukan khi kuasa dua asimptotik dengan darjah kebebasan (q). Oleh itu, bilangan fungsi ujian menentukan taburan rujukan dan boleh mempengaruhi kuasa ujian. Banyak instrumen yang lemah atau berlebihan boleh menjadikan anggaran kovarians tidak stabil tanpa menambah maklumat yang berguna.

Dalam tetapan satu langkah, hipotesis nol membayangkan struktur beza martingal bagi vektor momen, lalu ujian asal boleh menggunakan anggaran momen kedua sampel. Bagi ufuk lain, hasil yang bertindih atau penyimpangan daripada tetapan itu, anggaran varians perlu sepadan dengan andaian dan struktur kebergantungan ujian berkenaan. Jangan menyalin jalur lebar HAC daripada ujian lain secara automatik; ikut rumusan bagi pelaksanaan yang dipilih. Kaedah kovarians HAC umum, termasuk penganggar Newey dan West (1987), ialah alat untuk keadaan yang memerlukannya dan bukannya arahan jalur lebar sejagat bagi GW. Kebolehpercayaan hasil bergantung pada anggaran kovarians dan reka bentuk ramalan.

Periksa juga sama ada (Ω̂) boleh dianggarkan daripada momen yang dipilih. Fungsi ujian yang hampir pendua, penunjuk dengan terlalu sedikit pemerhatian dalam sesuatu keadaan atau terlalu banyak interaksi boleh menjadikan matriks singular atau tidak stabil. Songsangannya boleh berubah ketara akibat sedikit perubahan data lalu memesongkan statistik ujian. Setiap fungsi patut mempunyai alasan yang berkait dengan keadaan atau perbezaan prestasi ramalan yang jelas; laporkan bilangan fungsi dan kovarians momen. Menggugurkan fungsi yang tidak membantu selepas melihat keputusan juga merupakan satu langkah pemilihan dan perlu dinyatakan.

Nilai p ialah bukti terhadap sekatan momen yang dinyatakan di bawah taburan rujukan. Ia bukan kebarangkalian bahawa A atau B model sebenar, dan bukan kebarangkalian peraturan dagangan akan menguntungkan. Laporkan statistik, darjah kebebasan, nilai p dan momen tepat yang diuji supaya pembaca tahu maksud penolakan.

<!-- learn:illustration -->

Tiga panel kaca jernih menunjukkan laluan biru dan ambar yang silih berganti dari segi kedudukan relatif; prestasi ramalan boleh berubah mengikut keadaan
Ilustrasi konsep perubahan prestasi relatif ramalan merentas keadaan; bukan data pasaran terukur, keputusan ujian atau isyarat dagangan

Contoh dua keadaan menunjukkan perkara yang disembunyikan oleh purata

Pertimbangkan lapan titik ramalan satu langkah. Biarkan (S_t=0) menandakan keadaan tenang dan (S_t=1) keadaan turun naik tinggi. Katakan perbezaan kerugian hipotesis (d_{t+1}=L_A-L_B) ialah −2, −2, −2 dan −2 pada empat titik tenang, serta +2, +2, +2 dan +2 pada empat titik turun naik tinggi. Perbezaan negatif memihak kepada A; perbezaan positif memihak kepada B.

Purata bagi lapan titik itu ialah sifar, maka contoh kecil ini tidak menunjukkan perbezaan kerugian tanpa syarat. Namun, purata dalam keadaan tenang ialah −2 dan purata dalam keadaan turun naik tinggi ialah +2. Kedudukan relatif bertukar mengikut keadaan. Ujian dengan (h_t=(1,S_t)') merangkumi momen pemalar dan momen turun naik tinggi yang boleh menangkap corak ini.

Lapan nilai ini sekadar ilustrasi pembelajaran dan terlalu sedikit untuk inferens yang boleh dipercayai. Dalam data sebenar, pertimbangkan cara ramalan dianggarkan, sama ada pemboleh ubah keadaan ditetapkan lebih awal, bilangan titik ramalan, serta perubahan momen perbezaan kerugian dari semasa ke semasa. Pembahagian visual mengikut keadaan sahaja bukan bukti bahawa corak itu akan berterusan.

Anggap tetingkap anggaran sebagai sebahagian daripada kaedah

Asimptotik asal GW mengekalkan saiz maksimum tetingkap anggaran pada nilai terhingga sementara bilangan ramalan luar sampel bertambah. Tetingkap bergerak dan sampel anggaran tetap menepati tetapan teras ini. Saiz tetingkap dan sebarang peraturan pemilihan tetingkap berasaskan data ialah sebahagian daripada setiap kaedah ramalan, maka tetapkan dan laporkan semuanya.

Perkara ini penting apabila model ramalan dianggarkan semula. Perbandingan yang mengabaikan anggaran parameter boleh terlepas ketidakpastian daripada cara setiap kaedah belajar menggunakan data lampau. GW boleh digunakan untuk ramalan daripada model bersarang atau tidak bersarang di bawah syarat yang dinyatakan, tetapi hal itu bukan jaminan bagi setiap pelaksanaan tetingkap berkembang atau setiap penganggar. Dalam rangka kerja satu langkah asal, tetingkap anggaran terhingga ialah andaian teras; tetingkap berkembang biasa berada di luar andaian itu. Jika reka bentuk sebenar berbeza, gunakan hasil yang diterbitkan untuk pembinaan ramalan tersebut.

Ujian ini juga tidak memilih tetingkap yang sesuai untuk anda. Tetingkap pendek boleh menyesuaikan diri dengan keadaan terkini tetapi menggunakan lebih sedikit pemerhatian; tetingkap panjang atau berkembang boleh menstabilkan anggaran sambil mengekalkan hubungan yang sudah lapuk. Bandingkan pilihan ini melalui penilaian yang dirancang terlebih dahulu dan catat proses pemilihan tetingkap. Giacomini dan Rossi (2010) membangunkan ujian berasingan untuk laluan prestasi ramalan relatif dalam persekitaran tidak stabil; soalan itu berkait, tetapi statistiknya bukan ujian bersyarat GW asas yang sama.

Penolakan bersyarat juga tidak dengan sendirinya menghasilkan peraturan dagangan yang memilih ramalan terbaik secara masa nyata. Instrumen mungkin berkait dengan perbezaan kerugian dalam data penilaian tanpa menghasilkan peraturan pertukaran yang stabil atau boleh digunakan. Jika maklumat semasa hendak digunakan untuk memilih ramalan, takrifkan peraturannya dengan pemerhatian terdahulu dan nilai pada rangkaian titik ramalan seterusnya yang belum digunakan, termasuk ketidakpastian anggaran dan keputusan.

Bezakan GW daripada DM, ujian model bersarang dan ujian ketidakstabilan

Ujian Diebold–Mariano bertanya sama ada purata kerugian dua ramalan sama dalam sampel penilaian. GW bertanya sama ada maklumat terpilih berkait dengan kerugian relatif, dengan perbandingan tanpa syarat sebagai satu sekatan momen khas. Model boleh mendapat skor purata yang sama tetapi mempunyai prestasi relatif yang bergantung pada keadaan, seperti dalam contoh dua keadaan.

Jika ramalan datang daripada model bersarang dan soalan khususnya ialah kesamaan MSPE, kaedah seperti pelarasan Clark–West mengendalikan hipotesis nol dan isu hingar anggaran yang berbeza. Jika banyak peraturan dagangan atau ramalan telah dicuba dan soalannya sama ada mana-mana calon mempunyai keupayaan ramalan lebih baik, gunakan prosedur peringkat keluarga seperti White Reality Check atau ujian SPA Hansen. Ujian bersyarat bagi satu pasangan terpilih tidak memadamkan carian yang lebih luas.

Akhir sekali, bukti bahawa ketepatan relatif berubah dari semasa ke semasa tidak menentukan tarikh perubahan tertentu. Ujian ketidakstabilan setempat atau pembalikan mungkin lebih sesuai jika persoalannya mengenai laluan prestasi, bukannya perkaitan dengan instrumen pilihan. Giacomini dan Rossi (2010) mengkaji perbandingan ramalan sedemikian. Pilih kaedah mengikut soalan dan jangan anggap setiap penolakan sebagai bukti strategi dagangan berasaskan pertukaran rejim.

Apabila beberapa model ramalan masih dibandingkan, prosedur peringkat keluarga menjawab soalan yang berbeza daripada ujian bersyarat berpasangan. Panduan Model Confidence Set menerangkan perbandingan berulang yang mengekalkan satu set model yang tidak dapat dibezakan pada aras terpilih. Kaedah itu tetap tidak menggantikan penetapan awal syarat dalam analisis GW.

Pertimbangkan kuasa rendah dan pengujian berulang

Ujian bersyarat mungkin memerlukan banyak data. Membahagikan sampel kepada keadaan tenang dan turun naik tinggi mengurangkan bilangan pemerhatian bagi setiap perbandingan. Menambah fungsi ujian pula menambah momen dan darjah kebebasan. Jika beberapa keadaan hanya berkait lemah dengan kerugian relatif, ujian mungkin berkuasa rendah walaupun perbezaan bersyarat benar-benar wujud.

Kertas kerja McCracken daripada Federal Reserve Bank of St. Louis mengkaji kewujudan, saiz dan kuasa ujian GW dalam contoh kerugian kuadratik mudah. Simulasinya mendapati saiz ujian boleh dikawal dengan tepat, tetapi kuasanya lazimnya rendah dalam tetapan yang dikaji (McCracken, 2020). Ini amaran tentang tafsiran, bukannya ramalan berangka sejagat untuk setiap aplikasi. Kegagalan menolak mungkin mencerminkan maklumat yang terhad atau kuasa rendah; ia bukan bukti bahawa ramalan boleh saling menggantikan.

Mencuba definisi keadaan, ambang, ufuk, fungsi kerugian dan tarikh penilaian yang berbeza berulang kali meningkatkan peluang penemuan kebetulan. Catat semua ujian calon dan asingkan analisis penerokaan daripada sampel pengesahan yang ditetapkan terlebih dahulu. Jika dakwaannya ialah satu daripada sekumpulan strategi mempunyai kuasa ramalan, gunakan pembetulan ujian berganda atau kaedah data snooping yang sesuai untuk seluruh kumpulan. Lebih banyak instrumen bersyarat tidak semestinya memberikan bukti yang lebih meyakinkan.

Apabila beberapa model masih dibandingkan, prosedur peringkat keluarga boleh menjawab soalan lain daripada ujian bersyarat berpasangan. Panduan Model Confidence Set menerangkan cara perbandingan berulang mengekalkan set model yang tidak dapat dibezakan pada aras terpilih. Prosedur itu tidak menggantikan penetapan awal syarat untuk analisis GW.

Laporkan reka bentuk supaya pembaca lain boleh mengulanginya

Namakan kedua-dua kaedah ramalan, cara anggaran setiap satunya, sama ada model bersarang, sasaran dan ufuk, serta tarikh penilaian. Berikan fungsi kerugian dan konvensyen tanda bagi (d_{t+1}) dengan tepat. Terangkan setiap unsur (h_t), cara unsur itu dibina, masa ia boleh diperhatikan dan sama ada ia ditetapkan sebelum hasil diperiksa.

Laporkan jadual titik asal ramalan, peraturan tetingkap anggaran, versi data, aturan sampel bersama, bilangan titik luar sampel, bilangan fungsi ujian, penganggar kovarians, taburan rujukan, statistik ujian, darjah kebebasan dan nilai p. Nyatakan sama ada ufuk bertindih dan cara kebergantungan dikendalikan. Sertakan purata kerugian serta ringkasan perbezaan kerugian, bukan hasil ujian sahaja.

Senaraikan instrumen, ambang, tetingkap, fungsi kerugian dan pasangan ramalan lain yang turut dicuba. Jika pemerhatian yang sama digunakan untuk memilih model atau pemboleh ubah bersyarat sebelum mengujinya, nyatakan perkara itu. Hasil penerokaan masih boleh memberi maklumat tanpa menjadi pengesahan. Pelaporan telus membolehkan pembaca menilai skopnya dan merancang pengesahan berasingan.

Soalan lazim

Q1Adakah ujian Giacomini–White sama dengan ujian Diebold–Mariano?

Tidak. Diebold–Mariano menumpukan kesamaan kerugian purata. Rangka kerja GW satu langkah menguji momen bersyarat terpilih dan memasukkan momen tanpa syarat sebagai satu sekatan yang mungkin.

Q2Adakah penolakan mengenal pasti ramalan yang patut digunakan dalam setiap rejim pasaran?

Tidak. Ia menunjukkan sekurang-kurangnya satu momen terpilih tidak selaras dengan sifar di bawah andaian ujian. Hasilnya bergantung pada instrumen, sampel dan kerugian yang dipilih, serta tidak menjamin prestasi dalam setiap keadaan.

Q3Bolehkah saya terus menambah ambang turun naik sehingga ujian menolak?

Itu mewujudkan carian terhadap pemboleh ubah bersyarat. Tetapkan pemboleh ubah lebih awal jika boleh dan laporkan semua spesifikasi yang dicuba. Untuk dakwaan ramalan yang luas, gunakan sampel pengesahan berasingan atau pembetulan yang sesuai bagi seluruh kumpulan calon.

Q4Adakah keupayaan ramalan bersyarat bermaksud strategi dagangan menguntungkan?

Tidak. Ujian ini membandingkan kerugian ramalan. Dakwaan dagangan memerlukan peraturan keputusan yang ditakrifkan serta penilaian berasingan terhadap pelaksanaan pesanan, yuran, pembiayaan, impak pasaran dan risiko. Penyelidikan utama - Giacomini and White, “Tests of Conditional Predictive Ability” (2006) - Giacomini and Rossi, “Forecast Comparisons in Unstable Environments” (2010) - McCracken, “Tests of Conditional Predictive Ability: Existence, Size, and Power” (Federal Reserve Bank of St. Louis Working Paper, 2020) - Diebold and Mariano, “Comparing Predictive Accuracy” (1995) - Newey and West, “A Simple, Positive Semi-Definite, Heteroskedasticity and Autocorrelation Consistent Covariance Matrix” (1987)

Sumber dan bacaan lanjut

Laporkan masalah

Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya

Semakan pantas

Sudah membaca panduan? Uji diri dengan 3 soalan

Soalan 1 / 3

Soalan 01

Jika dₜ₊₁ = L(A) − L(B), apakah maksud perbezaan kerugian yang positif?

Pilih jawapan untuk melihat penjelasan

Glosari opsyen