Uji Diebold–Mariano: Membandingkan Akurasi Ramalan
Pelajari hal yang dibandingkan dalam uji Diebold–Mariano, dampak selisih kerugian dan korelasi serial pada statistiknya, serta alasan akurasi ramalan tidak sama dengan laba trading.
Dalam panduan iniUji ini membandingkan kerugian ekspektasian ramalan
Ringkasan singkat
Uji Diebold–Mariano (DM) menilai apakah dua prosedur peramalan memiliki kerugian ekspektasian yang sama atas hasil berpasangan. Uji ini memakai deret selisih kerugian, sehingga fungsi kerugian, horizon, dan dependensi antartanggal memengaruhi hasil. Penolakan hipotesis nol mendukung adanya perbedaan dalam rancangan evaluasi yang ditetapkan; hasil itu tidak membuktikan satu model akan terus unggul atau strategi trading akan untung setelah biaya.
Uji ini membandingkan kerugian ekspektasian ramalan
Uji Diebold–Mariano membandingkan dua ramalan atas target yang sama pada tanggal evaluasi yang sama. Pada setiap titik awal ramalan, kedua prosedur harus menggunakan hasil aktual, horizon, dan batas informasi yang sama. Uji menilai apakah kerugian rata-rata satu prosedur berbeda secara sistematis dari yang lain, sambil mengizinkan selisihnya berubah seiring waktu.
Diebold dan Mariano mengembangkan pengujian untuk fungsi kerugian umum, bukan hanya mean squared error. Artikel aslinya menguji hipotesis nol bahwa ramalan yang bersaing memiliki akurasi prediktif yang sama (Diebold dan Mariano, 1995). Di sini, “akurasi” berarti kerugian ekspektasian lebih rendah menurut fungsi yang dipilih. Ini tidak berarti ramalan benar, menjelaskan kausalitas, terkalibrasi baik pada seluruh distribusi, atau berguna untuk setiap keputusan.
Misalkan model A dan B meramalkan imbal hasil masa depan yang sama pada waktu yang sama. Uji DM tidak memeriksa apakah suatu koefisien sama dengan nol atau apakah nilai hasil pemodelan kedua model sama pada sampel estimasi. Uji membandingkan bagaimana kesalahan ramalan berubah menjadi kerugian pilihan pada sampel evaluasi.
Tetapkan rancangan sebelum menafsirkan statistik: target, titik awal ramalan, horizon, fungsi kerugian, penanganan hasil hilang, jadwal estimasi ulang, serta hipotesis satu atau dua sisi. Jika pilihan-pilihan ini berbeda antarmodel, selisih kerugian bukan perbandingan yang setara.
Definisikan ramalan berpasangan dan selisih kerugian
Misalkan $y_t$ adalah nilai target aktual di titik ramalan $t$, dan $\hat y_{A,t}$ serta $\hat y_{B,t}$ adalah ramalan A dan B. Kesalahannya $e_{A,t}=y_t-\hat y_{A,t}$ dan $e_{B,t}=y_t-\hat y_{B,t}$. Untuk fungsi kerugian $L$, selisih pada tanggal itu adalah:
$$ d_t=L(e_{A,t})-L(e_{B,t}) $$
Dengan konvensi tanda ini, rata-rata $d_t$ negatif berarti A memiliki kerugian teramati lebih rendah; rata-rata positif berarti B lebih rendah. Hipotesis nol populasi adalah $E[d_t]=0$. Alternatif dua sisi mencari perbedaan ke arah mana pun, sedangkan alternatif satu sisi menguji arah yang ditentukan sebelumnya. Jangan memilih arah setelah melihat pemenangnya.
Kerugian kuadrat $L(e)=e^2$ memberi bobot besar pada kesalahan besar; kerugian absolut $L(e)=|e|$ lebih tahan terhadap satu kesalahan ekstrem. Kerugian kuantil dapat cocok untuk sasaran asimetris. Karena fungsi berbeda dapat membalik urutan model, “ramalan terbaik” belum berarti apa-apa tanpa fungsi yang ditentukan. Tinjauan Tashman tentang uji ramalan di luar sampel juga menekankan kecocokan metode evaluasi dengan masalahnya (Tashman, 200000065-0)).
Gunakan titik awal dan hasil yang sama bagi kedua model. Jika satu model tidak memiliki ramalan pada tanggal sulit, menghapus tanggal itu hanya dari model tersebut mengubah sampel pembanding. Jika model akan diestimasi ulang tiap bulan dalam penggunaan nyata, buat ramalan evaluasi menurut aturan yang sama; parameter tetap menjawab pertanyaan lain. Validasi walk-forward menjelaskan peramalan berurutan tanpa data masa depan.
Contoh empat titik ramalan menjelaskan selisih rata-rata
Pertimbangkan empat titik ramalan hipotetis; target dan kesalahan diukur dalam poin persentase. Kesalahan A ialah $[1,2,0,1]$, sedangkan B $[2,1,1,1]$. Setiap pasangan merujuk pada imbal hasil aktual dan interval yang sama. Angka hanya untuk ilustrasi.
Dengan kerugian kuadrat, kerugian A ialah $[1,4,0,1]$ dan MSE-nya $(1+4+0+1)/4=1.50$ poin persentase kuadrat. Kerugian B ialah $[4,1,1,1]$, dengan MSE $(4+1+1+1)/4=1.75$. Pada empat hasil tersebut, MSE A lebih rendah 0.25 poin persentase kuadrat.
Selisih harian $d_t=L(e_{A,t})-L(e_{B,t})$ adalah $[-3,3,-1,0]$. Rata-ratanya $(-3+3-1+0)/4=-0.25$, sama dengan MSE rata-rata A dikurangi MSE B. Tanda negatif mendukung A menurut definisi ini, tetapi belum menunjukkan bahwa selisih melampaui noise sampel. Empat pasangan ramalan bukan bukti statistik yang meyakinkan.
Definisi kerugian juga mengubah arti “lebih baik”. Dalam contoh lain, kesalahan absolut C ialah $[0,0,0,3]$, sedangkan D $[1,1,1,1]$. Dengan kerugian absolut, rata-rata C 0.75 dan D 1, jadi C lebih baik. Dengan kerugian kuadrat, rata-rata C 2.25 dan D 1, jadi D lebih baik. Uji tak menyelesaikan perbedaan ini sebelum kita memutuskan kesalahan mana yang lebih penting.
<!-- Illustration placement: after this section; text-free conceptual scene showing two forecast paths against one realized path, with visibly different miss distances and no labels or numerical claims. -->
Statistik DM menstandarkan selisih rata-rata dengan ketidakpastiannya
Rata-rata sampel selisih kerugian ialah $\bar d=T^{-1}\sum_{t=1}^{T}d_t$, dengan $T$ jumlah hasil ramalan berpasangan. Galat bakunya bergantung pada varians jangka panjang $d_t$, bukan hanya varians di satu tanggal. Bentuk umum statistiknya:
$$ DM=\frac{\bar d}{\sqrt{\widehat{\Omega}/T}} $$
$\widehat{\Omega}$ mengestimasi varians jangka panjang deret selisih kerugian. Jika tanggal independen, nilainya akan mendekati varians $d_t$. Namun kerugian ramalan sering berkelompok: volatilitas tinggi dapat memperbesar kesalahan kedua model; target $h$ langkah dapat membuat jendela kesalahan berdekatan memakai imbal hasil aktual yang sama. Mengabaikan dependensi positif dapat mengecilkan galat baku dan melebih-lebihkan bukti.
Konstruksi HAC yang umum mengestimasi autokovarians $\hat\gamma_k$ dari selisih kerugian yang dipusatkan, lalu menggabungkannya sebagai $\widehat{\Omega}=\hat\gamma_0+2\sum_{k=1}^{q}w_k\hat\gamma_k$. Dengan bobot Bartlett hingga bandwidth $q$, $w_k=1-k/(q+1)$. Newey dan West mengembangkan estimator kovarians semidefinit positif yang konsisten terhadap heteroskedastisitas dan autokorelasi (Newey dan West). Kernel dan bandwidth adalah pilihan implementasi: ungkapkan dan sesuaikan dengan rancangan ramalan, bukan demi p-value yang disukai. Panduan galat baku HAC membahas masalah kovarians yang lebih luas.
Dalam kondisi reguler, statistik DM standar dibandingkan secara asimtotik dengan distribusi normal standar. Nilai absolut yang besar menunjukkan bahwa selisih rata-rata yang diamati besar relatif terhadap ketidakpastian estimasi. Tandanya menunjukkan model yang kerugiannya lebih rendah menurut urutan yang ditetapkan; p-value tidak mengukur besar atau nilai ekonomi selisih. P-value juga bukan peluang hipotesis nol benar atau ramalan berhasil kelak.
Ramalan beberapa langkah saling tumpang tindih, jadi sampel terbatas juga penting
Ramalan beberapa periode ke depan yang dibuat tiap periode memiliki jendela evaluasi tumpang tindih. Ramalan bulanan imbal hasil kumulatif tiga bulan ke depan berbagi dua dari tiga imbal hasil dengan ramalan yang dibuat sebulan kemudian. Tumpang tindih dapat menimbulkan korelasi serial pada kesalahan dan selisih kerugian, meskipun imbal hasil bulanan independen.
Dalam rancangan dasar $h$ langkah, perhitungan varians sebaiknya mencakup dependensi setidaknya hingga lag $h-1$. Ini bukan aturan bandwidth universal: estimasi ulang bergulir, target persisten, pengelompokan volatilitas, dan fungsi kerugian dapat menambah dependensi. Catat horizon, jarak antartitik ramalan, serta alasan memilih pemotongan HAC atau estimator lain. Jumlah baris ramalan bukan otomatis jumlah bukti independen.
Uji asimtotik asli mungkin tidak memiliki tingkat signifikansi aktual yang tepat pada sampel sedang. Harvey, Leybourne, dan Newbold mengusulkan koreksi sampel terbatas untuk membandingkan MSE ramalan (HLN, 199700719-4)). Untuk horizon $h$ dan $T$ ramalan, bentuk lazimnya mengalikan statistik DM dengan:
$$ DM_{HLN}=DM\sqrt{\frac{T+1-2h+h(h-1)/T}{T}} $$
Statistik yang dikoreksi biasanya dibandingkan dengan distribusi $t$ berderajat bebas $T-1$. Pada $T=60$, $h=5$, pengalinya kira-kira $0.925$. Contoh hanya menunjukkan hitungan koreksi; bukan berarti 60 pengamatan cukup bagi model tertentu atau asumsi terpenuhi. Koreksi ini tidak memperbaiki kebocoran informasi, target yang keliru, dependensi tak termodelkan, seleksi model berulang, atau fungsi kerugian yang salah.
Model bersarang memerlukan alasan perbandingan yang berbeda
Model A dapat menjadi versi terbatas dari B, misalnya B menambahkan prediktor. Walau prediktor tambahan tidak bernilai secara populasi di bawah hipotesis nol, koefisien estimasinya dapat menambah noise pada ramalan B. Model lebih besar dapat mencatat MSE lebih tinggi walau prediktor tambahan tak memperbaiki proses dasar. Logika akurasi setara untuk model yang tidak bersarang tidak berlaku otomatis.
Clark dan West mengembangkan uji yang kira-kira normal untuk akurasi prediktif yang sama pada model bersarang serta menyesuaikan perbandingan kesalahan kuadrat terhadap noise estimasi dari model yang lebih besar (Clark dan West, 2007). Ini bukan pengganti semua uji DM, melainkan metode untuk pertanyaan, kerugian, dan pengaturan asimtotik tertentu. Tentukan apakah model bersarang, lalu pilih uji dengan distribusi nol yang sesuai. Jangan anggap p-value DM standar dari perangkat lunak berlaku pada semua hubungan model.
MSE lebih rendah belum tentu memperbaiki cakupan interval, kalibrasi probabilitas, akurasi arah, atau keputusan lanjutan. Perbandingan luar sampel pun dapat memakai holdout yang tidak layak bila diperiksa berulang kali saat pengembangan. Laporkan hubungan model, metode estimasi, horizon, dan data yang tersedia untuk setiap ramalan.
Akurasi ramalan tidak sama dengan keunggulan trading
DM menilai kerugian ramalan; keputusan trading menilai proses imbal hasil dan risiko. MSE imbal hasil berikutnya yang lebih rendah tidak menjamin sinyal sering memilih arah benar, menentukan ukuran posisi yang sesuai, atau mengatasi turnover, spread, dampak pasar, biaya, pinjaman, funding, dan jeda eksekusi. Ramalan dengan rata-rata kesalahan kuadrat sedikit lebih tinggi masih dapat memperbaiki keputusan jika lebih tepat saat eksposur strategi tinggi. Fungsi kerugian untuk klaim itu mungkin perlu mencerminkan keputusan nyata, bukan ukuran umum yang praktis.
Perbedaan signifikan secara statistik dapat kecil secara ekonomi. Laporkan ukuran selisih rata-rata dalam satuan yang mudah ditafsirkan beserta ketidakpastian, bukan hanya p-value atau label pemenang. Jika klaimnya tentang kinerja portofolio, jalankan ulang seluruh aturan keputusan yang dibekukan pada data lanjutan dengan asumsi realistis dan laporkan hasil bersih secara terpisah. DM tak menghitungnya atau memasukkan biaya kecuali fungsi kerugian memang dirancang untuk itu.
Uji ini juga tidak memperbaiki pencarian banyak model, target, horizon, fungsi kerugian, rentang tanggal, atau aturan trading lalu hanya melaporkan perbandingan yang paling menguntungkan. Uji pasangan berulang menimbulkan masalah seleksi tersendiri. Simpan catatan pencarian dan gunakan metode pengujian berganda yang sesuai. Panduan pengujian berganda dan false-discovery rate menjelaskan mengapa ambang umum dapat menyesatkan setelah pencarian luas. DM adalah alat evaluasi, bukan koreksi data snooping.
Laporkan rincian agar perbandingan dapat direproduksi
Laporan yang jelas mencantumkan target dan satuan, batas informasi, titik awal, horizon, jadwal estimasi ulang, serta sampel evaluasi bersama. Sebutkan fungsi kerugian dan tanda $d_t$, kerugian rata-rata tiap model dan selisihnya, hipotesis satu atau dua sisi yang dipilih sebelumnya, estimator varians, kernel, bandwidth, statistik uji, distribusi acuan, p-value, serta interval keyakinan atau ukuran ketidakpastian yang sesuai.
Jelaskan pula apakah model bersarang, bagaimana hasil hilang dan nilai ekstrem ditangani, jumlah spesifikasi alternatif, dan apakah masa evaluasi memengaruhi pemilihan model. Tunjukkan besar perbedaan, bukan sekadar apakah melewati ambang. Deret $d_t$ atau grafik selisih kerugian kumulatif dapat mengungkap perubahan rezim, tetapi bukan pengganti inferensi yang memperhitungkan dependensi.
Dalam trading kuantitatif, terangkan cara mengubah ramalan menjadi tindakan: ambang sinyal, ukuran posisi, waktu rebalance, kontrol risiko, harga eksekusi, dan asumsi biaya. DM hanya membandingkan deret kerugian ramalan yang diberikan. Uji ini tidak mengesahkan alur data, menyetarakan sampel evaluasi berbeda, membuktikan kausalitas, atau menjamin peringkat historis bertahan. Gunakan bersama rancangan ramalan yang menjaga urutan waktu dan penilaian eksplisit pada tingkat keputusan.
Pertanyaan umum
Q1Apakah uji Diebold–Mariano membandingkan koefisien model?
Tidak. Uji ini membandingkan kerugian ekspektasian dari kesalahan yang dihasilkan dua prosedur ramalan atas hasil berpasangan. Uji koefisien menjawab pertanyaan lain tentang parameter model.
Q2Dapatkah uji ini digunakan untuk ramalan beberapa periode ke depan?
Bisa, tetapi jendela target yang tumpang tindih dapat membuat selisih kerugian berurutan bergantung secara serial. Gunakan estimasi varians dan, bila sesuai, koreksi sampel terbatas yang cocok dengan horizon dan rancangan model; catat pilihannya.
Q3Apakah hasil signifikan berarti ramalan lebih baik pasti menghasilkan uang?
Tidak. Hasil itu mendukung perbedaan pada kerugian ramalan terpilih dalam rancangan evaluasi. Profitabilitas juga bergantung pada cara ramalan menjadi posisi, risiko yang diambil, serta biaya dan eksekusi aktual.
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Apa hipotesis nol dalam perbandingan dasar Diebold–Mariano?
Pilih jawaban untuk melihat penjelasannya
Glosarium opsi
Variation in the conditional error variance across regressor values or states, invalidating an equal-variance covariance formula.
Baca panduan lengkapFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Baca panduan lengkap