White’s Reality Check untuk data snooping pada backtest strategi
Pelajari cara White’s Reality Check membandingkan strategi terbaik dari pencarian dengan benchmark melalui maksimum bootstrap yang mempertahankan dependensi
Dalam panduan iniUji ini menanyakan apakah pemenang pencarian mengungguli benchmark pilihan
Ringkasan singkat
White’s Reality Check menilai apakah kandidat dengan kinerja terbaik dalam pencarian yang ditetapkan mengungguli benchmark tertentu setelah memperhitungkan bahwa kandidat itu dipilih sebagai nilai maksimum. Uji ini melakukan bootstrap atas selisih kinerja bersama yang bergantung pada waktu, lalu membandingkan maksimum yang teramati dengan distribusi nol maksimum bootstrap. Nilai p tersesuaikan yang kecil menjadi bukti terhadap hipotesis nol bersama bahwa tidak ada kandidat dalam keluarga tersebut yang unggul atas benchmark itu; nilai tersebut bukan ramalan profitabilitas saat trading langsung.
Uji ini menanyakan apakah pemenang pencarian mengungguli benchmark pilihan
Peneliti dapat mencoba puluhan jendela moving average, aturan breakout, periode holding, pasar, dan filter, lalu melaporkan strategi dengan skor backtest tertinggi. Pemenang itu bukan kandidat tunggal biasa: proses pencarian memberinya banyak peluang untuk tampak luar biasa. Mengujinya sendirian seolah-olah sudah ditentukan sebelum data dilihat berarti mengabaikan proses seleksi.
White’s Reality Check memasukkan seleksi ke dalam uji. Pertanyaannya: apakah ada kandidat dalam keluarga yang diteliti dengan kinerja ekspektasian lebih baik daripada benchmark yang ditetapkan? White merumuskan hipotesis nol sebagai irisan perbandingan satu arah: kinerja ekspektasian setiap kandidat relatif terhadap benchmark paling tinggi nol. Hipotesis alternatif menyatakan bahwa setidaknya satu kandidat memiliki keunggulan ekspektasian positif. Benchmark dapat berupa buy-and-hold, aturan prediksi sederhana, atau aturan pembanding lain, tetapi harus sesuai dengan pertanyaan riset dan ditetapkan sebelum hasil dilihat. Kerangka formalnya ada di makalah asli White.
Pertanyaan ini berlaku untuk seluruh keluarga, bukan jaminan bagi strategi yang kebetulan menang. Menolak hipotesis nol berarti keluarga yang tercatat memberikan bukti keunggulan berdasarkan statistik dan asumsi yang dipilih. Itu tidak membuktikan bahwa semua kandidat berguna, pemenang akan tetap terbaik, atau keunggulannya bertahan dalam rezim pasar baru.
Nyatakan setiap kandidat sebagai selisih kinerja yang sebanding
Misalkan d[k,t] adalah kinerja kandidat k dikurangi kinerja benchmark pada periode yang sama t; nilai yang lebih tinggi harus selalu menguntungkan kandidat. Untuk membandingkan return, definisinya dapat berupa return bersih kandidat dikurangi return bersih benchmark. Untuk membandingkan kerugian ramalan, gunakan kerugian benchmark dikurangi kerugian kandidat. Konvensi tanda harus konsisten sehingga nilai positif berarti kandidat lebih unggul.
Setiap baris harus mewakili interval waktu yang sama bagi semua kandidat. Gunakan mata uang, konvensi return, perlakuan pendanaan, dan kebijakan biaya yang sama. Jika klaim menyangkut return strategi yang dapat dieksekusi, kurangi komisi, spread, slippage, funding, dan biaya pinjam yang relevan sebelum menghitung d[k,t]. Menguji return bruto lalu hanya menyebut biaya dalam catatan kaki menjawab pertanyaan lain.
Rata-rata sampel untuk kandidat k adalah d̄[k] = (1/T) Σ_t d[k,t]. Hipotesis nol bersama ialah H0: max_k E[d[k,t]] ≤ 0, sedangkan alternatifnya H1: max_k E[d[k,t]] > 0. Benchmark berlaku bagi seluruh keluarga dan semua kandidat memakai kriteria yang sama. Jika tanggal yang hilang atau frekuensi observasi berbeda antar kandidat, tentukan sampel perbandingan bersama yang dapat dipertanggungjawabkan sebelum menghitung selisih; jangan diam-diam memberikan satu kandidat jendela yang lebih menguntungkan.
Sertakan seluruh keluarga kandidat dalam klaim riset
Keluarga ini mencakup aturan kandidat yang hasilnya dapat memengaruhi pemilihan pemenang yang dilaporkan: lookback yang diuji, ambang masuk, kombinasi sinyal, semesta aset, periode holding, batasan portofolio, dan asumsi eksekusi. Varian manual yang dicoba lalu dibuang setelah hasil dilihat juga termasuk. Dalam artikel tahun 2000, White menggunakan istilah “specification search” secara luas: proses pemilihan, bukan hanya tabel akhir, menimbulkan masalah seleksi.
Ada dua kesalahan yang berlawanan. Menghilangkan eksperimen yang membantu memilih strategi akan membuat uji tersesuaikan terlalu optimistis karena bootstrap melihat pencarian yang lebih kecil daripada yang sebenarnya dilakukan. Menambahkan banyak aturan arbitrer dan tidak terkait setelahnya dapat membuat uji terlalu konservatif dan menurunkan kemampuannya mendeteksi kandidat yang berguna. Definisikan keluarga dari proses seleksi yang benar-benar terjadi dan simpan log riset agar batasnya dapat diaudit.
Uji ini tidak dapat menebak eksperimen yang tidak dicatat. Catatan yang hanya berisi parameter pemenang tidak cukup untuk merekonstruksi pencarian. Simpan registri kandidat, versi data, tanggal evaluasi, tujuan, asumsi biaya, dan keputusan seleksi secara bersamaan. Jika keluarga berubah setelah hasil diperiksa, jelaskan apa yang berubah dan alasannya; jangan menyajikan keluarga yang disusun setelah kejadian seolah sudah ditentukan sebelumnya.
Statistik maksimum membawa langkah seleksi ke distribusi nol
Hitung kinerja relatif rata-rata setiap kandidat, lalu ambil nilai terbesar. Statistik tanpa studentisasi yang umum ialah Vobs = √T × max_k d̄[k]. Maksimum ini penting karena mewakili operasi “pilih yang terbaik” yang menghasilkan pemenang semu. Jika hanya kolom pemenang yang diuji, operasi seleksi hilang dari distribusi acuan.
Bootstrap memperkirakan seberapa besar maksimum yang dapat muncul akibat variasi sampel jika hipotesis nol bersama tentang tidak adanya keunggulan benar. Pada replikasi bootstrap b, ambil ulang vektor selisih semua kandidat yang diindeks waktu, lalu hitung statistik terpusat seperti V*b = √T × max_k(d̄*[k,b] − d̄[k]). Pemusatan menempatkan rata-rata kandidat pada batas nol yang paling tidak menguntungkan, saat keunggulan ekspektasian nol, sementara operasi maksimum tetap mempertahankan seleksi antar kandidat. Makalah White mengembangkan distribusi bootstrap maksimum dan membandingkannya dengan statistik yang teramati.
Ulangi proses berkali-kali. Nilai p tersesuaikan adalah proporsi maksimum bootstrap yang setidaknya sebesar Vobs. Untuk B replikasi, estimasi Monte Carlo yang umum ialah (1 + count{V*b ≥ Vobs})/(B + 1). Implementasi dapat berbeda dalam studentisasi atau rincian model estimasi; dokumentasikan statistik dan konvensi pemusatan di bawah hipotesis nol. Hal utamanya adalah menghitung ulang maksimum keluarga pada setiap replikasi, bukan hanya mengevaluasi pemenang yang teramati.
Pertahankan dependensi saat mengambil ulang riwayat kandidat
Observasi keuangan tersusun menurut waktu. Pengacakan independen dapat menghapus dependensi serial, pengelompokan volatilitas, dan rangkaian untung-rugi yang berkorelasi. Pengacakan juga dapat merusak hubungan strategi yang cenderung bereaksi terhadap hari pasar yang sama. Karakteristik tersebut memengaruhi ekor statistik maksimum; mengambil ulang tiap kandidat secara terpisah atau memilih tanggal tunggal dengan pengembalian dapat menghasilkan distribusi acuan yang keliru.
White menguraikan metode untuk data dependen, seperti moving-block bootstrap, dan menganalisis stationary bootstrap dari Politis dan Romano. Dalam metode itu, blok sampel biasanya berlanjut ke observasi waktu berikutnya; ketika restart acak terjadi, blok dimulai dari tanggal sampel lain. Panjang blok mengikuti distribusi geometris dengan rata-rata yang dipilih. Dengan asumsi dan pengaturan yang sesuai, metode ini menjaga urutan jangka pendek lebih baik daripada sampel i.i.d. Lihat makalah Politis dan Romano tentang stationary bootstrap.
Untuk keluarga strategi, ambil satu urutan indeks waktu bersama dan terapkan ke seluruh vektor baris (d[1,t], …, d[K,t]). Ini mempertahankan urutan di dalam blok dan dependensi serentak antar kandidat. Pilih panjang blok dengan mempertimbangkan horizon strategi dan diagnostik dependensi, lalu laporkan sensitivitas hasil terhadap pilihan lain yang masuk akal. Jika prosedur riset mencakup estimasi ulang parameter, tentukan apakah langkah itu bagian dari sasaran inferensi dan ulangi di setiap sampel bila perlu. Mengambil ulang hanya return hasil fitting tetap dapat mengondisikan dan menghilangkan sebagian prosedur.
Contoh bootstrap hipotetis mengubah interpretasi
Misalkan peneliti membandingkan tiga strategi dengan benchmark selama T = 252 hari perdagangan. Rata-rata selisih kinerja harian setelah biaya masing-masing +2.0, +1.0, dan −0.5 basis poin. Rata-rata pemenang adalah 2.0 basis poin dan statistik teramati √252 × 2.0 bp ≈ 31.75 bp·√hari perdagangan. Skala ini bagian dari statistik uji; ini bukan statistik t karena tidak dibagi dengan standard error estimasian.
Anggap ada 9.999 replikasi stationary bootstrap yang memakai tanggal sampel sama untuk ketiga kandidat. Dalam hasil hipotetis ini, 1.199 maksimum replikasi sama atau lebih besar dari 31.75. Estimasi Monte Carlo dengan koreksi plus satu adalah (1 + 1,199)/(9,999 + 1) = 0.12. Uji terpisah untuk pemenang saja mungkin menghasilkan 0.03, tetapi mengabaikan pencarian terhadap tiga kandidat. Nilai p Reality Check memakai perbandingan seluruh keluarga; pada ambang 5%, hipotesis nol bersama tidak ditolak dalam contoh ini.
Angka ini dibuat untuk menjelaskan perhitungan, bukan kinerja pasar terukur atau hasil dari makalah White. Nilai p 0.12 tidak berarti strategi memiliki peluang rugi 12%. Artinya, di bawah bootstrap dan konstruksi nol yang ditetapkan, maksimum sebesar itu atau lebih besar tidak cukup langka untuk ditolak pada tingkat yang dipilih. Rata-rata sampel juga tidak menjelaskan apakah return bernilai ekonomis setelah mempertimbangkan risiko, kapasitas, dan dampak eksekusi.
Tafsirkan nilai p tersesuaikan sebagai bukti tentang keluarga tertentu
Nilai p Reality Check yang kecil merupakan bukti melawan klaim bahwa tak satu pun anggota keluarga yang disertakan mengungguli benchmark pilihan dalam kinerja ekspektasian, berdasarkan asumsi uji. Karena hipotesis nolnya bersama, penolakan tidak otomatis menunjukkan kandidat mana yang memiliki keunggulan berkelanjutan. Identitas pemenang dapat berubah antar sampel, dan bukti untuk strategi tertentu dapat lemah walau hipotesis tingkat keluarga ditolak.
Nilai p besar berarti gagal menolak hipotesis nol, bukan bukti semua strategi setara dengan benchmark. Sampel pendek, kinerja berisik, keluarga sangat luas, pengukuran buruk, atau daya uji rendah dapat menjelaskannya. Nilai p juga bukan peluang bahwa hipotesis nol benar. Itu adalah probabilitas ekor dalam distribusi acuan yang bergantung pada set kandidat, ukuran kinerja, benchmark, rancangan bootstrap, dan data teramati.
Pertanyaan White bersifat relatif. Aturan dapat mengungguli benchmark lemah namun tetap merugi; aturan lain dapat kalah dari benchmark kuat tetapi tetap memberi return positif. Laporkan hasil absolut dan relatif bersama ketidakpastian, turnover, drawdown, kapasitas, dan biaya realistis. Bukti statistik tentang superioritas prediktif relatif dan kelayakan ekonomi untuk berinvestasi adalah dua penilaian berbeda.
Periksa asumsi dan keterbatasan sebelum mengandalkan hasilnya
Teori asli mengandalkan kondisi regularitas untuk proses selisih kinerja dan distribusi limit-nya. Kerangka White mencakup deret waktu stasioner yang strongly mixing; bootstrap dependen juga memerlukan rangkaian panjang blok yang sesuai. Dalam sampel terbatas, perubahan rezim, structural break, dependensi jangka panjang, lompatan langka, dan volatilitas tak stabil dapat membuat pendekatan resampling stasioner diragukan. Block bootstrap menjaga sebagian dependensi lokal, tetapi tidak merekonstruksi rezim masa depan yang tidak diketahui.
Uji ini juga mewarisi kesalahan pada data dan evaluasi strategi. Kebocoran informasi masa depan, survivorship bias, data revisi, fill yang tidak realistis, biaya yang terlewat, perlakuan corporate action yang keliru, dan benchmark yang dipilih setelah hasil dilihat dapat membatalkan selisih kinerja. Jika periode holding tumpang tindih, return dapat dependen karena konstruksi; unit resampling dan panjang blok harus mewakili dependensi tersebut. Jika metrik akhir nonlinear, seperti Sharpe ratio, hitung ulang metrik di setiap replikasi alih-alih menganggap bootstrap return rata-rata otomatis mengujinya.
Implementasi Reality Check dapat konservatif, terutama jika keluarga kandidat besar berisi banyak alternatif yang jelas buruk. Distribusi maksimum yang lebar dapat menyulitkan penolakan meski ada kandidat bagus. Uji Superior Predictive Ability Hansen adalah metode bootstrap terkait dengan perlakuan berbeda terhadap alternatif lemah; ini bukan pengganti universal dan asumsi-asumsinya juga perlu ditinjau. Bandingkan metode berdasarkan pertanyaan riset dan laporkan sensitivitas, bukan memilih metode yang menghasilkan jawaban yang diinginkan.
Gunakan bersama validasi kronologis dan alat seleksi lain
White’s Reality Check membahas apakah keluarga pencarian yang tercatat memuat kandidat dengan kinerja relatif terhadap benchmark yang unggul setelah seleksi diperhitungkan. Ini tidak menggantikan holdout kronologis atau evaluasi walk-forward atas strategi yang sudah dibekukan. Uji ini juga tidak dengan sendirinya mengatasi tumpang tindih label atau kebocoran. PBO berbeda: metrik itu merangkum seberapa sering pemenang in-sample berada di bawah median kandidat dalam pembagian kombinatorial; makalah asli PBO merumuskan diagnostik risiko seleksi tersebut. Prosedur false discovery menargetkan proporsi kesalahan yang diharapkan di antara beberapa penolakan. Deflated Sharpe Ratio menyesuaikan penilaian signifikansi berbasis Sharpe atas seleksi dan return non-normal. Lanjutkan dengan panduan multiple testing dan false discovery rate di keuangan, PBO dan CSCV, validasi walk-forward, serta purged cross-validation dan embargo.
Dalam tinjauan praktis, tetapkan benchmark dan definisi kinerja, rekonstruksi keluarga kandidat yang benar-benar digunakan, hitung selisih berpasangan per periode, pilih serta jelaskan rancangan resampling yang mempertahankan dependensi, lalu laporkan statistik maksimum dan probabilitas ekor bootstrap. Setelah itu, uji proses seleksi yang dibekukan pada data kronologis yang lebih baru dan nilai biaya serta kelayakan eksekusi secara terpisah. Penerapan Sullivan, Timmermann, dan White pada aturan trading teknikal menunjukkan pentingnya seluruh semesta aturan: kesimpulan dapat berubah ketika seluruh pencarian, bukan hanya pemenang yang dilaporkan, masuk ke inferensi. Reality Check mengoreksi masalah seleksi tertentu; ia bukan sertifikat bahwa backtest akan bertahan dalam trading langsung.
Pertanyaan umum
Q1Apa yang diuji White’s Reality Check?
Uji ini menilai apakah kandidat terbaik dari keluarga pencarian yang ditetapkan memiliki kinerja ekspektasian lebih tinggi daripada benchmark pilihan, dengan memperhitungkan seleksi antar kandidat.
Q2Apakah nilai p Reality Check yang kecil membuktikan strategi akan menguntungkan?
Tidak. Nilai itu menjadi bukti melawan hipotesis nol bersama tentang tidak adanya keunggulan, berdasarkan benchmark, metrik, data, dan asumsi bootstrap yang dipilih. Nilai itu tidak menjamin return masa depan atau laba bersih.
Q3Mengapa memakai block bootstrap alih-alih mengambil sampel hari secara independen?
Blok dapat mempertahankan sebagian dependensi serial lokal; tanggal bersama untuk semua kandidat juga menjaga hubungan serentak antar strategi. Rancangan blok tetap perlu sesuai dengan data dan pertanyaan riset.
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Apa arti hipotesis nol bersama White?
Pilih jawaban untuk melihat penjelasannya
Glosarium opsi
Definisi jelas untuk istilah inti, dari call, put, dan rantai opsi hingga IV, Greeks, serta spread bid-ask
Lihat glosarium opsi