Ujian Diebold–Mariano: Membandingkan Ketepatan Ramalan
Ketahui perkara yang dibandingkan oleh ujian Diebold–Mariano, cara perbezaan kerugian dan korelasi bersiri mempengaruhi statistik, serta sebab ketepatan ramalan tidak sama dengan keuntungan dagangan.
Dalam panduan iniUjian ini membandingkan kerugian jangkaan ramalan
Ringkasan ringkas
Ujian Diebold–Mariano (DM) menilai sama ada dua prosedur ramalan mempunyai kerugian jangkaan yang sama untuk hasil yang dipadankan. Ujian ini menggunakan siri perbezaan kerugian, maka fungsi kerugian, ufuk ramalan dan kebergantungan antara tarikh mempengaruhi hasil. Penolakan hipotesis nol menyokong adanya perbezaan di bawah reka bentuk penilaian yang dinyatakan; ia tidak membuktikan satu model akan terus unggul atau strategi dagangan akan menguntungkan selepas kos.
Ujian ini membandingkan kerugian jangkaan ramalan
Ujian Diebold–Mariano membandingkan dua ramalan bagi sasaran yang sama pada tarikh penilaian yang sama. Pada setiap titik ramalan, kedua-dua prosedur perlu menggunakan hasil sebenar, ufuk dan masa pemotongan maklumat yang sama. Kemudian ujian menilai sama ada purata kerugian satu prosedur berbeza secara sistematik daripada prosedur lain, sambil membenarkan perbezaan itu berubah mengikut masa.
Diebold dan Mariano mengemukakan persoalan ini untuk fungsi kerugian umum, bukan sekadar min ralat kuasa dua. Makalah asal mereka membina ujian hipotesis nol bahawa ramalan yang bersaing mempunyai ketepatan ramalan yang sama (Diebold dan Mariano, 1995). Di sini, “ketepatan” bermaksud kerugian jangkaan yang lebih rendah menurut fungsi yang dipilih. Ia tidak bermaksud ramalan itu benar, menerangkan sebab-akibat, terkalibrasi dengan baik di seluruh taburan atau berguna untuk semua keputusan.
Katakan model A dan B meramalkan pulangan masa depan yang sama pada masa yang sama. Ujian DM tidak memeriksa sama ada pekali model sama dengan sifar atau nilai terlaras kedua-dua model sama dalam sampel anggaran. Ujian membandingkan bagaimana ralat ramalan bertukar menjadi kerugian yang dipilih dalam sampel penilaian.
Tentukan reka bentuk sebelum mentafsir statistik. Sasaran, titik ramalan, ufuk, fungsi kerugian, pengendalian hasil yang hilang, jadual anggaran semula, serta hipotesis satu atau dua hala menentukan soalan ujian. Jika pilihan ini berbeza antara model, perbezaan kerugian bukan lagi perbandingan pada syarat yang sama.
Takrifkan ramalan berpasangan dan perbezaan kerugian
Biarkan $y_t$ ialah nilai sasaran sebenar pada titik ramalan $t$, dan $\hat y_{A,t}$ serta $\hat y_{B,t}$ ialah ramalan model A dan B. Ralatnya ialah $e_{A,t}=y_t-\hat y_{A,t}$ dan $e_{B,t}=y_t-\hat y_{B,t}$. Bagi fungsi kerugian $L$, perbezaan kerugian pada tarikh tersebut ialah:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Dengan konvensyen tanda ini, purata $d_t$ yang negatif bermaksud kerugian teramati A lebih rendah; purata positif bermaksud B lebih rendah. Hipotesis nol populasi ialah $E[d_t]=0$. Alternatif dua hala mencari perbezaan dalam mana-mana arah, manakala alternatif satu hala menguji arah yang ditetapkan lebih awal. Jangan memilih arah selepas melihat model yang menang.
Kerugian kuasa dua $L(e)=e^2$ memberikan kesilapan besar kesan yang tidak seimbang. Kerugian mutlak $L(e)=|e|$ kurang dikuasai oleh satu kesilapan besar. Kerugian kuantil boleh sepadan dengan sasaran tidak simetri, sementara fungsi lain mengukur aspek ramalan yang berlainan. Fungsi yang berbeza boleh membalikkan kedudukan model, jadi “ramalan terbaik” tidak mempunyai maksud tunggal sebelum kerugian ditentukan. Ulasan Tashman tentang ujian ramalan luar sampel turut menekankan kesesuaian kaedah penilaian dengan masalah ramalan (Tashman, 200000065-0)).
Gunakan titik ramalan dan hasil sebenar yang sama untuk kedua-dua model. Jika satu model tiada ramalan bagi tarikh yang sukar, menggugurkan tarikh itu secara senyap untuk model tersebut mengubah sampel perbandingan. Jika model sebenar akan dianggar semula setiap bulan menggunakan data baharu, hasilkan ramalan penilaian dengan peraturan yang sama; ramalan parameter tetap menjawab soalan lain. Pengesahan walk-forward menerangkan cara menghasilkan ramalan berurutan tanpa menggunakan data masa depan.
Contoh empat titik ramalan menunjukkan maksud perbezaan purata
Pertimbangkan empat titik ramalan hipotetikal dan ukur sasaran serta ralat dalam mata peratusan. Ralat A ialah $[1,2,0,1]$ dan ralat B ialah $[2,1,1,1]$. Setiap pasangan merujuk kepada pulangan sebenar dan selang ramalan yang sama. Angka ini direka semata-mata untuk menunjukkan pengiraan.
Dengan kerugian kuasa dua, kerugian A ialah $[1,4,0,1]$, maka min ralat kuasa duanya ialah $(1+4+0+1)/4=1.50$ mata peratusan kuasa dua. Kerugian B ialah $[4,1,1,1]$, dengan min ralat kuasa dua $(4+1+1+1)/4=1.75$. Bagi empat hasil ini, MSE A lebih rendah sebanyak 0.25 mata peratusan kuasa dua.
Perbezaan harian $d_t=L(e_{A,t})-L(e_{B,t})$ ialah $[-3,3,-1,0]$. Puratanya $(-3+3-1+0)/4=-0.25$, sama dengan MSE purata A tolak MSE purata B. Tanda negatif memihak kepada A mengikut konvensyen ini, tetapi belum menunjukkan perbezaan itu lebih besar daripada hingar pensampelan. Empat pasangan ramalan bukan bukti statistik yang meyakinkan.
Takrif kerugian turut mengubah maksud “lebih baik”. Dalam contoh hipotesis berasingan, ralat mutlak C ialah $[0,0,0,3]$ dan D ialah $[1,1,1,1]$. Dengan kerugian mutlak, purata C ialah 0.75 dan D 1, maka C diutamakan. Dengan kerugian kuasa dua, purata C ialah 2.25 dan D 1, jadi D pula diutamakan. Ujian tidak boleh menyelesaikan perbezaan ini tanpa keputusan tentang kesilapan yang lebih penting.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
Statistik DM menskalakan perbezaan purata mengikut ketidakpastiannya
Perbezaan kerugian purata sampel ialah $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, dengan $T$ bilangan hasil ramalan berpasangan. Ralat piawainya bergantung pada varians jangka panjang $d_t$, bukan hanya varians pada satu tarikh. Bentuk umum statistik ini ialah:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ menganggarkan varians jangka panjang siri perbezaan kerugian. Jika tarikh saling bebas, mengikut penganggar yang dipilih nilainya menghampiri varians $d_t$. Namun kerugian ramalan sering berkumpul: semasa turun naik tinggi, ralat kedua-dua model boleh meningkat; sasaran $h$ langkah pula boleh menyebabkan tetingkap ralat bersebelahan berkongsi pulangan sebenar. Mengabaikan kebergantungan positif boleh mengecilkan ralat piawai dan membesar-besarkan bukti.
Binaan HAC yang lazim menganggar autokovarians $\hat\gamma_k$ bagi perbezaan kerugian yang dipusatkan, kemudian menggabungkannya sebagai $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Dengan pemberat Bartlett sehingga lebar jalur $q$, $w_k=1-k/(q+1)$. Newey dan West membangunkan penganggar kovarians semidefinit positif yang konsisten terhadap heteroskedastisiti dan autokorelasi (Newey dan West). Kernel dan lebar jalur ialah pilihan pelaksanaan: nyatakan dan sesuaikan dengan reka bentuk ramalan, bukan untuk mendapatkan p-value yang disukai. Panduan ralat piawai HAC membincangkan masalah anggaran kovarians yang lebih umum.
Di bawah syarat keteraturan, statistik DM piawai dibandingkan secara asimptotik dengan taburan normal piawai. Nilai mutlak yang besar bermaksud perbezaan purata yang diperhatikan besar berbanding ketidakpastian anggaran. Tandanya menunjukkan model yang mempunyai kerugian lebih rendah menurut susunan yang ditetapkan; p-value tidak mengukur magnitud atau nilai ekonomi perbezaan. Ia juga bukan kebarangkalian hipotesis nol benar atau ramalan akan berjaya pada masa depan.
Ramalan berbilang langkah bertindih, maka rawatan sampel terhingga juga penting
Apabila ramalan bagi sasaran beberapa tempoh ke depan dibuat setiap tempoh, tetingkap penilaian bertindih. Contohnya, ramalan bulanan pulangan terkumpul tiga bulan akan datang berkongsi dua daripada tiga pulangan bulanan dengan ramalan yang diterbitkan sebulan kemudian. Walaupun pulangan bulanan bebas, pertindihan boleh menghasilkan korelasi bersiri dalam ralat ramalan dan perbezaan kerugian.
Dalam persediaan asas $h$ langkah, pengiraan varians sewajarnya mengambil kira kebergantungan sekurang-kurangnya hingga lag $h-1$. Ini bukan peraturan lebar jalur sejagat: anggaran parameter bergulir, sasaran berterusan, pengelompokan turun naik dan fungsi kerugian boleh menimbulkan kebergantungan tambahan. Catat ufuk, jarak antara titik ramalan serta sebab memilih pemotongan HAC atau penganggar varians lain. Bilangan baris ramalan tidak secara automatik menjadi bilangan bukti bebas.
Ujian asimptotik asal boleh mempunyai aras keertian sebenar yang tidak tepat dalam sampel sederhana. Harvey, Leybourne dan Newbold mencadangkan pelarasan sampel terhingga untuk membandingkan min ralat kuasa dua ramalan (HLN, 199700719-4)). Bentuk lazim bagi ufuk $h$ dan $T$ ramalan mendarab statistik DM dengan:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
Statistik terlaras lazimnya dibandingkan dengan taburan $t$ dengan $T-1$ darjah kebebasan. Untuk $T=60$ dan $h=5$, pengalinya kira-kira $0.925$. Contoh ini hanya menunjukkan aritmetik pelarasan; ia tidak mengatakan 60 pemerhatian mencukupi bagi model tertentu atau andaian dipenuhi. Pelarasan mengatasi masalah sampel kecil tertentu, tetapi tidak membetulkan kebocoran maklumat, sasaran tidak sah, kebergantungan yang tidak dimodelkan, pemilihan model berulang atau fungsi kerugian yang tersalah spesifikasi.
Model bersarang memerlukan hujah perbandingan ramalan yang berbeza
Model A mungkin versi terkekang model B; contohnya, B menambah peramal pada A. Walaupun peramal tambahan tiada nilai ramalan populasi di bawah hipotesis nol, pekali anggarannya boleh menambahkan hingar pada ramalan B. Model yang lebih besar mungkin mencatat MSE lebih tinggi walaupun peramal tambahan tidak memperbaik proses ramalan asas. Hujah kesamaan ketepatan untuk model tidak bersarang tidak boleh digunakan begitu sahaja.
Clark dan West membangunkan ujian hampir normal bagi ketepatan ramalan yang sama dalam model bersarang serta melaraskan perbandingan ralat kuasa dua untuk hingar anggaran daripada model lebih besar (Clark dan West, 2007). Pelarasan ini bukan pengganti sejagat bagi semua ujian DM; ia direka untuk soalan, fungsi kerugian dan persediaan asimptotik tertentu. Tentukan sama ada satu model bersarang dalam model lain dan pilih ujian yang taburan nolnya sepadan dengan reka bentuk. Jangan anggap p-value DM piawai perisian merangkumi setiap hubungan model.
Perbezaan lain turut penting. Ramalan dengan MSE lebih rendah belum tentu memperbaik liputan selang, kalibrasi kebarangkalian, ketepatan arah atau keputusan susulan. Perbandingan luar sampel juga boleh menggunakan set pegangan yang tidak sah jika diperiksa berulang kali semasa pembangunan model. Nyatakan hubungan model, kaedah anggaran, ufuk dan data yang tersedia untuk setiap ramalan.
Ketepatan ramalan bukan kelebihan dagangan
Keputusan DM menilai kerugian ramalan; keputusan dagangan menilai proses pulangan dan risiko. MSE yang lebih rendah bagi pulangan tempoh seterusnya tidak menjamin isyarat kerap memilih arah yang betul, menentukan saiz posisi yang sesuai atau mengatasi pusing ganti, spread, impak pasaran, yuran, kos pinjaman, pendanaan dan kelewatan pelaksanaan. Sebaliknya, ramalan dengan min ralat kuasa dua sedikit lebih tinggi mungkin membantu keputusan jika lebih tepat ketika strategi mempunyai pendedahan besar. Bagi dakwaan itu, fungsi kerugian mungkin perlu mencerminkan keputusan sebenar, bukan metrik ramalan umum yang mudah.
Perbezaan signifikan secara statistik boleh sangat kecil dari segi ekonomi. Laporkan magnitud perbezaan purata dalam unit yang boleh ditafsir bersama ketidakpastian, bukan hanya p-value atau label pemenang. Jika dakwaan berkaitan pulangan portfolio, gunakan semula keseluruhan peraturan keputusan yang telah dibekukan pada data susulan yang sesuai dengan andaian dagangan realistik, dan laporkan hasil bersih secara berasingan. DM tidak mengira hasil itu atau mengambil kira kos melainkan fungsi kerugian direka khusus untuknya.
Ujian ini juga tidak membetulkan carian terhadap banyak model, sasaran, ufuk, fungsi kerugian, julat tarikh atau peraturan dagangan yang diikuti laporan perbandingan paling memihak. Ujian pasangan berulang mewujudkan masalah pemilihan tersendiri. Simpan rekod carian dan gunakan kaedah ujian berbilang yang sesuai dengan kelompok dakwaan. Panduan ujian berbilang dan kadar penemuan palsu menerangkan sebab ambang biasa boleh mengelirukan selepas carian luas. DM ialah alat penilaian, bukan pembetulan pengintipan data.
Laporkan butiran yang mencukupi supaya perbandingan boleh dihasilkan semula
Laporan yang jelas menyatakan sasaran dan unit, titik potong maklumat, titik ramalan, ufuk, jadual anggaran semula dan sampel penilaian bersama. Nyatakan fungsi kerugian dan tanda $d_t$, purata kerugian setiap model serta perbezaan purata, hipotesis satu atau dua hala yang dipilih lebih awal, penganggar varians, kernel, lebar jalur, statistik ujian, taburan rujukan, p-value dan, jika sesuai, selang keyakinan atau ukuran ketidakpastian.
Dedahkan juga sama ada model bersarang, cara hasil hilang dan nilai ekstrem ditangani, bilangan spesifikasi alternatif yang dikaji serta sama ada tempoh penilaian mempengaruhi pilihan model. Tunjukkan magnitud perbezaan, bukan sekadar sama ada ambang dilepasi. Siri $d_t$ atau carta perbezaan kerugian terkumpul boleh mendedahkan perubahan rejim yang terlindung oleh purata keseluruhan, tetapi carta tidak menggantikan inferens yang mengambil kira kebergantungan.
Dalam dagangan kuantitatif, terangkan laluan ramalan kepada tindakan: ambang isyarat, saiz posisi, masa pengimbangan semula, kawalan risiko, harga pelaksanaan dan andaian kos. DM hanya membandingkan siri kerugian ramalan yang diberikan. Ia tidak mengesahkan saluran data, menjadikan sampel penilaian berbeza setara, membuktikan sebab-akibat atau menjamin kedudukan sejarah kekal. Gunakannya sebagai satu bahagian telus dalam penilaian model, bersama reka bentuk ramalan mengikut tertib masa dan penilaian eksplisit pada peringkat keputusan.
Soalan lazim
Q1Adakah ujian Diebold–Mariano membandingkan pekali model?
Tidak. Ia membandingkan kerugian jangkaan bagi ralat yang dihasilkan dua prosedur ramalan pada hasil berpasangan. Ujian pekali menjawab soalan lain tentang parameter model.
Q2Bolehkah ujian ini digunakan untuk ramalan beberapa tempoh ke depan?
Ya, tetapi tetingkap sasaran yang bertindih boleh menjadikan perbezaan kerugian berturutan bergantung secara bersiri. Gunakan anggaran varians dan, jika sesuai, pelarasan sampel terhingga yang sepadan dengan ufuk dan reka bentuk model; catat pilihan anda.
Q3Adakah hasil signifikan bermaksud ramalan yang lebih baik akan menghasilkan wang?
Tidak. Ia menyokong perbezaan dalam kerugian ramalan pilihan di bawah reka bentuk penilaian. Keuntungan turut bergantung pada cara ramalan ditukar kepada posisi, risiko yang diambil, serta kos dan pelaksanaan sebenar.
Sumber dan bacaan lanjut
Laporkan masalah
Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya
Semakan pantas
Sudah membaca panduan? Uji diri dengan 3 soalan
Soalan 01
Apakah hipotesis nol dalam perbandingan asas Diebold–Mariano?
Pilih jawapan untuk melihat penjelasan
Glosari opsyen
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Baca panduan terperinciFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Baca panduan terperinci