Skip to content
Semua panduan opsyen
Mengapa pemenang carian strategi perlu diuji pada peringkat keseluruhan keluarga13 minit membaca

White’s Reality Check untuk data snooping dalam backtest strategi

Ketahui cara White’s Reality Check membandingkan strategi terbaik daripada carian dengan penanda aras melalui maksimum bootstrap yang mengekalkan kebergantungan

Dalam panduan iniUjian ini bertanya sama ada pemenang carian mengatasi penanda aras pilihan

Ringkasan ringkas

White’s Reality Check menguji sama ada calon terbaik dalam carian yang ditetapkan mengatasi penanda aras tertentu selepas mengambil kira bahawa calon itu dipilih sebagai nilai maksimum. Ujian ini melakukan bootstrap terhadap perbezaan prestasi bersama yang bergantung pada masa, kemudian membandingkan maksimum yang diperhatikan dengan taburan nol bagi maksimum bootstrap. Nilai p terlaras yang kecil ialah bukti menentang hipotesis nol bersama bahawa tiada calon dalam keluarga itu mengatasi penanda aras berkenaan; ia bukan ramalan keuntungan dalam dagangan sebenar.

Ujian ini bertanya sama ada pemenang carian mengatasi penanda aras pilihan

Penyelidik mungkin mencuba berpuluh-puluh tempoh purata bergerak, peraturan penembusan, tempoh pegangan, pasaran dan penapis, kemudian melaporkan strategi dengan skor backtest tertinggi. Pemenang itu bukan calon tunggal biasa: carian memberi banyak peluang untuknya kelihatan luar biasa baik. Menguji pemenang sahaja seolah-olah ia telah dipilih sebelum data dilihat bermakna langkah pemilihan diabaikan.

White’s Reality Check memasukkan pemilihan ke dalam ujian. Ia bertanya sama ada mana-mana calon dalam keluarga yang dikaji mempunyai prestasi jangkaan lebih baik daripada penanda aras yang ditakrifkan. White merumuskan hipotesis nol sebagai persilangan perbandingan sehala: prestasi jangkaan setiap calon berbanding penanda aras adalah paling tinggi sifar. Hipotesis alternatif menyatakan sekurang-kurangnya satu calon mempunyai kelebihan jangkaan positif. Penanda aras boleh berupa beli-dan-simpan, peraturan ramalan ringkas atau peraturan perbandingan lain, tetapi mesti selaras dengan soalan penyelidikan dan ditetapkan sebelum hasil dilihat. Rangka formal terdapat dalam makalah asal White.

Ini soalan tentang seluruh keluarga, bukan jaminan bagi strategi yang kebetulan menang. Penolakan hipotesis nol menunjukkan keluarga yang direkodkan mempunyai bukti keunggulan menurut statistik dan andaian yang dipilih. Ia tidak membuktikan semua calon berguna, pemenang akan kekal terbaik atau kelebihannya bertahan dalam rejim pasaran baharu.

Ungkapkan setiap calon sebagai perbezaan prestasi yang boleh dibandingkan

Takrifkan d[k,t] sebagai prestasi calon k tolak prestasi penanda aras dalam tempoh t yang sama; nilai lebih tinggi mesti sentiasa memihak kepada calon. Untuk perbandingan pulangan, misalnya, gunakan pulangan bersih calon tolak pulangan bersih penanda aras. Jika yang dibandingkan ialah kerugian ramalan, terbalikkan arah: kerugian penanda aras tolak kerugian calon. Konvensyen tanda mestilah memastikan nilai positif memihak kepada calon.

Setiap baris perlu merujuk kepada sela masa yang sama bagi semua calon. Gunakan mata wang, konvensyen pulangan, layanan pembiayaan dan dasar kos yang seragam. Jika tuntutan melibatkan pulangan strategi yang boleh dilaksanakan, tolak komisen, spread, gelinciran, funding dan kos pinjaman berkaitan sebelum mengira d[k,t]. Menguji pulangan kasar dan menyebut kos dalam nota kaki sahaja menjawab soalan yang berbeza.

Purata sampel calon k ialah d̄[k] = (1/T) Σ_t d[k,t]. Hipotesis nol bersama ialah H0: max_k E[d[k,t]] ≤ 0; alternatifnya ialah H1: max_k E[d[k,t]] > 0. Penanda aras yang sama digunakan untuk seluruh keluarga dan semua calon dinilai menggunakan kriteria yang sama. Jika tarikh yang hilang atau kekerapan pemerhatian berbeza, tentukan sampel perbandingan bersama yang munasabah sebelum mengira perbezaan; jangan diam-diam memberikan calon tertentu tempoh yang lebih menguntungkan.

Masukkan seluruh keluarga calon dalam tuntutan penyelidikan

Keluarga ini merangkumi peraturan calon yang hasilnya boleh mempengaruhi pemenang yang dilaporkan, seperti tempoh lihat ke belakang yang diuji, ambang kemasukan, gabungan isyarat, semesta aset, tempoh pegangan, kekangan portfolio dan andaian pelaksanaan. Ia turut merangkumi variasi manual yang dicuba tetapi dibuang selepas hasil dilihat. Dalam makalah tahun 2000, White menggunakan “specification search” secara luas: proses pemilihan, bukan jadual akhir sahaja, mewujudkan masalah pemilihan.

Terdapat dua kesilapan yang bertentangan. Mengecualikan eksperimen yang membantu memilih strategi yang dilaporkan menjadikan ujian terlaras terlalu optimistik kerana bootstrap melihat carian yang lebih kecil daripada yang sebenarnya dilakukan. Menambah banyak peraturan rawak yang tidak berkaitan selepas itu boleh menjadikan ujian terlalu konservatif dan mengurangkan keupayaan mengesan calon yang berguna. Takrifkan keluarga daripada proses pemilihan sebenar dan simpan log penyelidikan yang membolehkan sempadannya diaudit.

Ujian tidak boleh meneka eksperimen yang tidak direkodkan. Buku nota yang hanya menyimpan parameter pemenang tidak mencukupi untuk membina semula carian. Simpan daftar calon, versi data, tarikh penilaian, objektif, andaian kos dan keputusan pemilihan bersama-sama. Jika keluarga berubah selepas hasil diperiksa, nyatakan perubahan dan sebabnya; jangan gambarkan keluarga yang disusun selepas kejadian seolah-olah telah ditetapkan awal.

Statistik maksimum membawa langkah pemilihan ke dalam taburan nol

Kira purata prestasi relatif setiap calon, kemudian ambil nilai yang tertinggi. Statistik lazim tanpa studentisasi ialah Vobs = √T × max_k d̄[k]. Maksimum ini penting kerana ia mewakili operasi “pilih yang terbaik” yang menghasilkan pemenang kelihatan. Jika hanya lajur pemenang diuji, operasi itu hilang daripada taburan rujukan.

Bootstrap menganggar saiz maksimum yang mungkin muncul akibat variasi sampel jika hipotesis nol bersama tentang tiada keunggulan benar. Bagi ulangan bootstrap b, sampelkan semula vektor perbezaan semua calon yang diindeks masa dan kira statistik terpusat seperti V*b = √T × max_k(d̄*[k,b] − d̄[k]). Pemusatan meletakkan purata calon pada sempadan nol yang paling tidak memihak, iaitu apabila kelebihan jangkaan sifar; operasi maksimum pula mengekalkan pemilihan antara calon. Makalah White membangunkan taburan bootstrap maksimum dan membandingkannya dengan statistik pemerhatian.

Ulang proses ini banyak kali. Nilai p terlaras ialah bahagian maksimum bootstrap yang sekurang-kurangnya sebesar Vobs. Dengan B ulangan, anggaran Monte Carlo lazim ialah (1 + count{V*b ≥ Vobs})/(B + 1). Pelaksanaan mungkin berbeza dalam studentisasi atau butiran model anggaran; dokumentasikan statistik dan konvensyen pemusatan di bawah hipotesis nol. Perkara utamanya ialah mengira semula maksimum seluruh keluarga pada setiap ulangan, bukan menilai pemenang yang diperhatikan sahaja.

Kekalkan kebergantungan apabila menyampel semula sejarah calon

Pemerhatian kewangan tersusun mengikut masa. Pengacakan bebas boleh memadam kebergantungan bersiri, kelompok turun naik dan rentetan untung rugi yang berkorelasi. Ia juga boleh memesongkan hubungan antara strategi yang bertindak balas terhadap hari pasaran yang sama. Ciri-ciri itu mempengaruhi ekor statistik maksimum. Oleh itu, menyampel setiap calon secara berasingan atau mengambil tarikh tunggal secara rawak dengan penggantian boleh menghasilkan taburan rujukan yang salah.

White menghuraikan kaedah untuk data bergantung, seperti moving-block bootstrap, dan menganalisis stationary bootstrap oleh Politis dan Romano. Dalam kaedah itu, blok yang disampel biasanya bersambung ke pemerhatian masa berikutnya; apabila mula semula secara rawak berlaku, blok bermula pada tarikh sampel lain. Panjang blok mengikut taburan geometri dengan purata yang dipilih. Dengan andaian dan tetapan kaedah yang sesuai, ia mengekalkan urutan jangka pendek lebih baik daripada sampel i.i.d. Lihat makalah Politis dan Romano tentang stationary bootstrap.

Bagi keluarga strategi, sampelkan satu urutan indeks masa yang dikongsi dan gunakannya pada keseluruhan vektor baris (d[1,t], …, d[K,t]). Ini mengekalkan susunan masa dalam blok serta kebergantungan serentak antara calon. Pilih panjang blok dengan mempertimbangkan horizon strategi dan diagnostik kebergantungan, serta laporkan kepekaan terhadap pilihan alternatif yang munasabah. Jika prosedur penyelidikan menganggar semula parameter, tentukan sama ada langkah itu termasuk dalam sasaran inferens dan ulangi dalam setiap sampel apabila perlu. Menyampel semula hanya pulangan tetap yang telah dianggar mungkin menetapkan syarat pada sebahagian prosedur lalu mengabaikannya.

Contoh bootstrap hipotesis mengubah tafsiran

Katakan penyelidik membandingkan tiga strategi dengan penanda aras selama T = 252 hari dagangan. Purata perbezaan prestasi harian selepas kos ialah +2.0, +1.0 dan −0.5 mata asas. Purata pemenang ialah 2.0 mata asas, lalu statistik pemerhatian ialah √252 × 2.0 bp ≈ 31.75 bp·√hari dagangan. Skala ini sebahagian daripada statistik ujian; ia bukan statistik-t kerana tidak dibahagikan dengan ralat piawai anggaran.

Sekarang andaikan terdapat 9,999 ulangan stationary bootstrap yang menggunakan tarikh sampel sama untuk ketiga-tiga calon. Dalam hasil hipotesis ini, 1,199 maksimum ulangan menyamai atau melebihi 31.75. Anggaran Monte Carlo dengan pembetulan tambah satu ialah (1 + 1,199)/(9,999 + 1) = 0.12. Ujian berasingan bagi pemenang sahaja mungkin memberikan 0.03, tetapi mengabaikan carian antara tiga calon. Nilai p Reality Check membandingkan seluruh keluarga dan dalam contoh ini tidak menolak hipotesis nol bersama pada aras 5%.

Angka ini direka untuk menunjukkan pengiraan; ia bukan prestasi pasaran yang diukur atau hasil daripada makalah White. Nilai p 0.12 tidak bermaksud strategi mempunyai kebarangkalian 12% untuk rugi. Maksudnya, di bawah bootstrap dan pembinaan nol yang ditetapkan, maksimum sekurang-kurangnya sebesar itu tidak cukup jarang untuk ditolak pada aras yang dipilih. Purata sampel juga tidak menunjukkan sama ada pulangan itu bernilai dari segi ekonomi selepas risiko, kapasiti dan kesan pelaksanaan.

Tafsirkan nilai p terlaras sebagai bukti tentang keluarga yang ditetapkan

Nilai p Reality Check yang kecil ialah bukti menentang dakwaan bahawa tiada ahli keluarga yang disertakan mengatasi penanda aras pilihan dari segi prestasi jangkaan, tertakluk pada andaian ujian. Oleh sebab hipotesis nolnya bersama, penolakan tidak mengenal pasti secara automatik calon yang mempunyai kelebihan berkekalan. Identiti pemenang boleh berubah antara sampel, dan bukti bagi satu strategi mungkin lemah walaupun hipotesis pada peringkat keluarga ditolak.

Nilai p yang besar bermakna hipotesis nol gagal ditolak, bukannya bukti bahawa semua strategi setara dengan penanda aras. Sampel pendek, prestasi bising, keluarga yang terlalu luas, ukuran lemah atau kuasa ujian rendah boleh menerangkannya. Nilai p juga bukan kebarangkalian hipotesis nol itu benar. Ia ialah kebarangkalian ekor di bawah taburan rujukan yang bergantung pada set calon, ukuran prestasi, penanda aras, reka bentuk bootstrap dan data yang diperhatikan.

Soalan White bersifat relatif. Sesuatu peraturan boleh mengatasi penanda aras lemah tetapi masih rugi, atau tidak mengatasi penanda aras kukuh tetapi tetap memperoleh pulangan positif. Laporkan hasil mutlak dan relatif bersama ketidakpastian, pusing ganti, susut nilai maksimum, kapasiti dan kos realistik. Bukti statistik bagi keunggulan ramalan relatif dan kes ekonomi untuk melabur ialah keputusan berasingan.

Semak andaian dan batasan sebelum bergantung pada hasil

Teori asal bergantung pada syarat keteraturan untuk proses perbezaan prestasi dan taburan hadnya. Rangka White merangkumi siri masa stasioner yang strongly mixing; bootstrap bergantung juga memerlukan jujukan panjang blok yang sesuai. Dalam sampel terhingga, perubahan rejim pasaran, structural break, kebergantungan jangka panjang, lonjakan jarang dan turun naik tidak stabil boleh menjadikan penghampiran resampling stasioner diragui. Bootstrap blok mengekalkan sebahagian kebergantungan setempat, tetapi tidak mencipta semula rejim masa depan yang tidak diketahui.

Ujian ini turut mewarisi kesilapan dalam data dan penilaian strategi. Kebocoran maklumat masa depan, bias survivorship, data yang disemak semula, fill tidak realistik, kos tertinggal, pelarasan corporate action yang salah dan penanda aras yang dipilih selepas hasil dilihat boleh membatalkan perbezaan prestasi. Apabila tempoh pegangan bertindih, pulangan boleh bergantung secara semula jadi; unit resampling dan panjang blok mesti mewakili kebergantungan itu. Jika metrik akhir tidak linear seperti Sharpe ratio, kirakan semula metrik bagi setiap ulangan, bukannya menganggap bootstrap purata pulangan mengujinya secara automatik.

Pelaksanaan Reality Check boleh bersifat konservatif, khususnya jika keluarga besar mengandungi banyak alternatif yang jelas lemah. Taburan maksimum yang luas boleh menyukarkan penolakan walaupun ada calon yang baik. Ujian Superior Predictive Ability Hansen ialah kaedah bootstrap berkaitan yang mengendalikan alternatif lemah secara berlainan; ia bukan pengganti universal dan andaian kaedah itu juga perlu disemak. Bandingkan kaedah menurut soalan kajian dan laporkan kepekaan, bukan memilih yang memberikan jawapan pilihan.

Gunakannya bersama pengesahan kronologi dan alat pemilihan lain

White’s Reality Check menilai sama ada keluarga carian yang direkodkan mengandungi calon yang mengatasi penanda aras selepas kesan pemilihan diambil kira. Ia tidak menggantikan holdout kronologi atau penilaian walk-forward bagi strategi yang telah dibekukan. Ia juga tidak menyelesaikan pertindihan label atau kebocoran dengan sendiri. PBO berbeza: ia merumuskan kekerapan pemenang dalam sampel berada di bawah median calon dalam pembahagian kombinatorial; makalah asal PBO memformalkan diagnostik risiko pemilihan itu. Prosedur false discovery menyasarkan bahagian jangkaan hasil palsu dalam beberapa penolakan. Deflated Sharpe Ratio pula melaraskan penilaian keertian berasaskan Sharpe untuk pemilihan dan pulangan tidak normal. Teruskan dengan panduan tentang ujian berbilang dan kadar false discovery dalam kewangan, PBO dan CSCV, pengesahan walk-forward dan cross-validation terpurge serta embargo.

Dalam semakan praktikal, tetapkan benchmark dan takrif prestasi, bina semula keluarga calon yang benar-benar digunakan, hitung perbezaan berpasangan bagi setiap tempoh, pilih dan berikan alasan untuk reka bentuk resampling yang mengekalkan kebergantungan, lalu laporkan statistik maksimum dan kebarangkalian ekor bootstrap. Kemudian uji proses pemilihan yang dibekukan pada data kronologi yang lebih lewat dan nilai kos serta kebolehlaksanaan secara berasingan. Aplikasi Sullivan, Timmermann dan White pada peraturan dagangan teknikal menunjukkan kepentingan keseluruhan set peraturan: kesimpulan boleh berubah apabila carian lengkap, bukan sekadar pemenang yang dilaporkan, dimasukkan dalam inferens. Reality Check membetulkan masalah pemilihan tertentu; ia bukan sijil bahawa backtest akan bertahan dalam dagangan sebenar.

Soalan lazim

Q1Apakah yang diuji oleh White’s Reality Check?

Ia menguji sama ada calon terbaik dalam keluarga carian yang ditetapkan mempunyai prestasi jangkaan lebih tinggi daripada penanda aras pilihan, dengan mengambil kira pemilihan antara calon.

Q2Adakah nilai p Reality Check yang kecil membuktikan strategi akan untung?

Tidak. Ia merupakan bukti menentang hipotesis nol tiada keunggulan pada peringkat keluarga di bawah penanda aras, metrik, data dan andaian bootstrap yang dipilih. Ia tidak menjamin pulangan masa depan atau keuntungan bersih.

Q3Mengapa gunakan bootstrap blok dan bukannya menyampel hari secara bebas?

Blok boleh mengekalkan sebahagian kebergantungan bersiri setempat; penggunaan tarikh bersama bagi semua calon juga mengekalkan hubungan serentak mereka. Reka bentuk blok masih perlu sesuai dengan data dan soalan penyelidikan.

Sumber dan bacaan lanjut

Laporkan masalah

Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya

Semakan pantas

Sudah membaca panduan? Uji diri dengan 3 soalan

Soalan 1 / 3

Soalan 01

Apakah maksud hipotesis nol bersama White?

Pilih jawapan untuk melihat penjelasan

Glosari opsyen

Takrif jelas istilah opsyen penting, daripada call, put dan rantaian opsyen kepada IV, Greeks, faedah terbuka dan max pain

Lihat glosari opsyen