Skip to content
Semua panduan opsi dan kontrak berjangka
Seberapa sering pemenang backtest turun di bawah median kelompok14 menit membaca

Penjelasan probability of backtest overfitting (PBO) dan CSCV

Pelajari cara combinatorially symmetric cross-validation mengestimasi PBO, mengubah peringkat OOS menjadi logit, dan mengapa metrik ini bukan ramalan kerugian mendatang

Dalam panduan iniPBO mengukur proses seleksi, bukan strategi secara terpisah

Ringkasan singkat

Probability of backtest overfitting (PBO) mengukur seberapa sering strategi yang terpilih sebagai terbaik di dalam sampel (IS) berada di bawah median kumpulan kandidat di luar sampel (OOS). Combinatorially symmetric cross-validation (CSCV) mengestimasi frekuensi ini dengan berulang kali menggunakan separuh blok waktu berukuran sama untuk memilih dan separuh lainnya untuk mengevaluasi. PBO adalah diagnosis bersyarat pada pencarian, skor, dan matriks kinerja historis tertentu; bukan probabilitas strategi live akan merugi.

PBO mengukur proses seleksi, bukan strategi secara terpisah

Tim riset dapat mencoba beragam lookback, ambang masuk, periode holding, universe, asumsi biaya, dan batasan portofolio, lalu mempertahankan varian dengan skor backtest tertinggi. Hasil terpilih itu mendapat banyak kesempatan untuk menyesuaikan diri dengan kekhasan sampel. PBO merangkum salah satu konsekuensi pencarian tersebut: pada partisi IS/OOS yang ditentukan, seberapa sering pemenang IS jatuh di bawah median OOS dari kandidat yang sama?

Bailey, Borwein, López de Prado, dan Zhu memperkenalkan PBO sebagai kerangka untuk menilai risiko pemilihan strategi serta mengusulkan CSCV sebagai salah satu cara estimasinya. Definisi ini membahas prosedur memilih di antara konfigurasi yang diuji, bukan sekadar apakah persamaan prediksi tunggal memiliki terlalu banyak parameter. Pada tiap partisi, IS adalah subset untuk memilih kandidat; periodenya tidak harus sama dengan periode estimasi semua model penyusunnya. Formulasi formal tersedia di makalah PBO asli.

Satu strategi dapat memiliki rasio Sharpe tinggi pada seluruh sampel, tetapi tetap menjadi kandidat paling beruntung dari keluarga riset yang lemah. Sebaliknya, proses seleksi dapat sering memilih kandidat berperingkat di atas median OOS walau imbal hasil semua kandidat negatif. PBO membandingkan peringkat relatif di dalam kumpulan kandidat yang diberikan; metrik ini sendiri tidak menguji apakah expected return positif.

PBO menjawab pertanyaan berbeda dari alat validasi lain

Holdout kronologis atau pengujian walk-forward menanyakan kinerja proses riset yang ditetapkan pada observasi selanjutnya yang tidak dipakai untuk keputusan sebelumnya. Purged cross-validation menangani overlap antara interval label pelatihan dan hasil pengujian; embargo dapat menambahkan jeda terpisah dengan alasan yang jelas. Langkah-langkah itu sendiri tidak mengukur seberapa sering pemenang pencarian strategi yang luas turun di bawah median kandidat OOS. Lihat panduan purged cross-validation dan embargo.

PBO juga berbeda dari penyesuaian multiple testing. White’s Reality Check memakai bootstrap untuk menguji apakah aturan terbaik dalam suatu keluarga mengungguli benchmark setelah memperhitungkan data snooping. Deflated Sharpe Ratio menyesuaikan perhitungan signifikansi berbasis Sharpe terhadap efek seleksi dan imbal hasil yang tidak normal. PBO merangkum peringkat OOS kandidat pilihan IS di berbagai partisi. Statistik dan asumsinya berbeda sehingga metode-metode ini tidak otomatis saling menggantikan. Baca makalah asli White tentang Reality Check dan karya Bailey serta López de Prado tentang Deflated Sharpe Ratio.

Mulailah dengan matriks kinerja yang lengkap dan tersinkronisasi

Misalkan M adalah matriks T kali N. Setiap kolom mewakili satu strategi atau konfigurasi kandidat, sedangkan setiap baris mewakili interval observasi yang sama untuk semua kandidat. Satu baris dapat berisi imbal hasil harian setelah biaya perdagangan terkait. Jika frekuensi transaksi kandidat berbeda, tentukan indeks waktu bersama terlebih dahulu dan agregasikan kinerja secara konsisten. Membandingkan imbal hasil harian satu strategi dengan total bulanan strategi lain per baris tidak membentuk matriks yang bermakna.

Kumpulan kandidat harus mencerminkan peluang seleksi sebenarnya: varian yang ditolak dalam grid search, perubahan manual setelah melihat hasil, universe alternatif, serta aturan lain yang memengaruhi pilihan akhir. PBO hanya menilai kandidat dan riwayat kinerja yang diberikan. Jika setelah pencarian jauh lebih luas tim hanya mencatat finalis, estimasi akan meremehkan pencarian yang sebenarnya.

Gunakan konvensi imbal hasil, mata uang, perlakuan leverage, dan kriteria kinerja yang sama. Jika seleksi memakai Sharpe neto, masukkan biaya, spread, pembiayaan, funding, biaya pinjam, dan asumsi eksekusi yang relevan ke setiap kolom sebelum menghitungnya. Metrik itu juga harus dapat dihitung pada subset berikutnya. Makalah asli mensyaratkan baris yang tersinkronisasi dan metrik yang dapat diestimasi di setiap sub-sampel; untuk frekuensi berbeda, makalah tersebut menyarankan indeks bersama.

CSCV memasangkan setiap separuh sampel dengan komplemennya

Pilih bilangan genap S untuk blok waktu yang saling lepas dan berukuran sama. Pertahankan urutan waktu di dalam setiap blok. Untuk setiap pilihan S/2 blok, gabungkan blok itu menjadi set in-sample (IS), lalu gunakan S/2 blok sisanya sebagai out-of-sample (OOS). Untuk metrik yang bergantung pada lintasan, pertahankan urutan asli blok terpilih dan jelaskan arti penyambungannya.

Jumlah penetapan IS adalah C(S,S/2). Dengan empat blok A, B, C, dan D, ada enam penetapan: AB, AC, AD, BC, BD, dan CD; setiap komplemen juga dihitung sebagai penetapan tersendiri. Jika S = 16, C(16,8) = 12.870. Ini adalah kombinasi deterministik dari riwayat yang sama, bukan 12.870 eksperimen pasar independen.

“Simetris” berarti komplemen digunakan kembali sebagai set seleksi dalam kombinasi lain: pada satu pembagian AB adalah IS dan CD OOS, sedangkan pada pembagian lain sebaliknya. “Kombinatorial” berarti semua pilihan separuh blok dihitung, bukan hanya mengambil satu pembagian acak. Prosedur ini bukan simulasi kronologis. Set terpilih dapat berisi blok awal dan akhir sementara komplemennya berisi blok tengah. Jadi, OOS di sini tidak berarti “masa depan setelah periode pelatihan”.

Blok data berurutan waktu berulang kali dibagi menjadi separuh pelatihan dan pengujian; sebagian pemenang in-sample berada di bawah titik tengah saat dirangking out-of-sample
Ilustrasi konseptual pembagian simetris dan peringkat CSCV; bukan data nyata atau simulasi perdagangan kronologis

Ubah peringkat OOS kandidat terpilih menjadi logit

Untuk partisi c, terapkan aturan seleksi riset pada subset IS dan pilih kandidat terbaik n*(c). Lalu hitung metrik kinerja yang sama untuk seluruh N kandidat di subset OOS komplemen. Tetapkan r(c) sebagai peringkat OOS kandidat terpilih: 1 paling buruk dan N paling baik. Tentukan penanganan nilai seri terlebih dahulu dan gunakan aturan yang sama di semua partisi.

Ubah peringkat menjadi peringkat relatif: ω(c) = r(c)/(N+1). Penyebut N+1 menjaga nilai tetap di antara nol dan satu, bahkan pada peringkat terendah atau tertinggi. Logitnya adalah λ(c) = ln(ω(c)/(1−ω(c))). Nilainya negatif jika kandidat terpilih berada di bawah median OOS, nol di median, dan positif di atasnya. Estimasi PBO adalah proporsi penetapan CSCV dengan λ(c) ≤ 0.

Satu nilai PBO merangkum seberapa sering pemenang IS berada setinggi-tingginya pada median OOS. Distribusi logit lengkap juga menunjukkan apakah kandidat terpilih biasanya dekat tengah, sering jatuh jauh di bawah, atau cenderung berada di atas median. Logit adalah transformasi peringkat relatif, bukan probabilitas transaksi live tertentu atau ramalan imbal hasil mendatang yang terkalibrasi.

Contoh hipotetis empat blok menghasilkan PBO 66,7%

Misalkan terdapat empat blok historis berukuran sama dan empat aturan kandidat R1 sampai R4. Tabel menunjukkan enam penetapan IS. Kolom peringkat OOS menunjukkan posisi aturan pilihan IS di antara keempat aturan pada blok komplemen. Semua nilai bersifat hipotetis dan hanya menggambarkan perhitungan.

Blok ISPemenang ISPeringkat OOS rPeringkat relatif ω = r/5Logit ln(ω/(1−ω))Median atau di bawahnya?
ABR110,20−1,386Ya
ACR340,80+1,386Tidak
ADR220,40−0,405Ya
BCR110,20−1,386Ya
BDR430,60+0,405Tidak
CDR320,40−0,405Ya

Empat dari enam aturan terpilih memiliki peringkat relatif OOS paling tinggi satu per dua. Jadi PBO empiris = 4/6 ≈ 0,667, atau sekitar 66,7%. Contohnya, peringkat 2 menghasilkan ω = 2/(4+1) = 0,4 dan λ = ln(0,4/0,6) ≈ −0,405. Peringkat 3 memberi ω = 0,6 dan logit berlawanan sekitar +0,405.

Ini bukan berarti peluang rugi bulan depan adalah 66,7%. Artinya, dalam matriks hipotetis dan konvensi peringkat ini, pemenang IS berada pada atau di bawah median kandidat OOS dalam empat dari enam partisi. Dua pemenang lainnya pun mungkin memiliki imbal hasil OOS absolut negatif meskipun mengungguli rekan-rekannya.

Perlakukan PBO sebagai diagnosis bersyarat yang terbatas

PBO bergantung pada keluarga kandidat, matriks kinerja yang diamati, metrik seleksi, blok waktu, dan aturan nilai seri. Eksperimen yang tidak dicatat berada di luar cakupannya. “Bebas model” berarti perhitungan dapat memakai riwayat kinerja kandidat tanpa mengetahui persamaan prediksinya; bukan berarti bebas dari pilihan desain, mutu data, atau asumsi.

CSCV menggabungkan blok ke subset simetris berukuran sama, tetapi set OOS biasanya bukan satu periode kronologis belakangan yang berurutan. Penggabungan ulang dapat mengganggu dependensi jangka panjang, pola musiman, atau urutan rezim ekonomi. S menentukan jumlah kombinasi sekaligus durasi setiap blok; pilih dan catat S berdasarkan horizon serta struktur strategi yang relevan. Banyak kombinasi bukan berarti sebanyak itu observasi independen karena blok yang sama dipakai berulang kali.

Statistik ini mewarisi bias pada imbal hasil sumber. Survivorship bias, data yang direvisi, fitur yang saat itu belum tersedia, eksekusi yang tidak realistis, biaya terlewat, dan universe yang dipilih belakangan dapat membuat seluruh riwayat kandidat menyesatkan. CSCV tidak otomatis membuang interval label yang tumpang tindih, mengestimasi ulang seluruh pipeline model di tiap partisi, atau mencegah kebocoran dari preprocessing. Terapkan langkah tersebut secara eksplisit sesuai pertanyaan riset. Untuk perlindungan kronologis, lihat dokumentasi resmi TimeSeriesSplit dan panduan purged validation.

Metrik yang bergantung pada lintasan seperti maximum drawdown memerlukan kehati-hatian ekstra: menyambung blok yang tidak bersebelahan mengubah lintasan dan dapat mengubah metrik. Makalah PBO mencatat bahwa urutan observasi penting untuk beberapa ukuran, berbeda dari Sharpe. Jelaskan penanganan urutan, jeda, observasi hilang, dan compounding sebelum menafsirkan peringkat.

Laporkan PBO bersama bukti kronologis dan catatan pencarian lengkap

Sebelum menghitung, simpan registri kandidat, setiap perubahan setelah hasil dilihat, matriks kinerja, metrik seleksi, dan aturan nilai seri. Laporkan T, N, S, konstruksi blok, C(S,S/2), konvensi peringkat OOS, estimasi PBO, dan distribusi logit. Sertakan kinerja OOS absolut, biaya, turnover, drawdown, dan jumlah kandidat yang rugi; peringkat saja tidak menunjukkan apakah semua kandidat lemah.

Gunakan walk-forward atau holdout kronologis yang benar-benar terpisah untuk menilai proses riset yang dibekukan pada data berikutnya. Jangan buka periode terakhir saat memilih model dan ambang; memeriksanya berulang kali menjadikannya set seleksi tambahan. Alat berurutan waktu seperti TimeSeriesSplit membentuk fold kronologis menurut asumsi terdokumentasi, sedangkan PBO mengukur sifat peringkat lain dari keluarga kandidat yang dicari.

Karena itu, PBO melengkapi tetapi tidak menggantikan kontrol overlap label, analisis multiple testing, pemodelan eksekusi realistis, evaluasi prospektif, dan pemantauan live. Baca juga multiple testing dan false discovery rate dalam keuangan serta penyesuaian Sharpe untuk korelasi serial. Tidak ada satu statistik yang mengubah peringkat historis menjadi bukti keunggulan trading yang bertahan.

Pertanyaan umum

Q1Apakah PBO berarti strategi memiliki probabilitas rugi sebesar itu?

Tidak. PBO mengestimasi seberapa sering kandidat pilihan IS berada pada atau di bawah median OOS di partisi yang ditentukan. Ini bukan probabilitas kerugian mendatang atau ramalan imbal hasil live yang terkalibrasi.

Q2Apakah CSCV sama dengan pengujian walk-forward?

Tidak. CSCV memasangkan tiap separuh blok dengan komplemennya sehingga OOS dapat memuat blok lebih awal dan lebih akhir. Walk-forward mempertahankan training sebelum tiap periode uji berikutnya untuk memeriksa lintasan kronologis yang menyerupai penerapan.

Q3Apakah PBO rendah membuktikan strategi terpilih punya keunggulan?

Tidak. Pemenang dapat mengungguli kelompok yang lemah tetapi tetap rugi secara absolut. Nilai imbal hasil neto, ketidakpastian, biaya, kebocoran, dan hasil pada data yang benar-benar lebih baru secara terpisah.

Sumber dan bacaan lanjutan

Laporkan masalah

Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya

Cek cepat

Sudah membaca panduannya? Uji diri dengan 3 pertanyaan

Pertanyaan 1 / 3

Pertanyaan 01

Kejadian apa yang berkontribusi pada estimasi PBO?

Pilih jawaban untuk melihat penjelasannya

Glosarium opsi