White Reality Check dan Hansen SPA untuk Peraturan Dagangan
Fahami perbezaan Reality Check dan SPA apabila memilih peraturan dagangan daripada banyak calon, termasuk bootstrap, andaian dan hadnya.
Dalam panduan iniMengapa pemenang backtest perlu diuji dengan cara lain
Ringkasan ringkas
White Reality Check dan ujian Superior Predictive Ability (SPA) Hansen bertanya sama ada sekurang-kurangnya satu peraturan dalam keluarga calon yang dicari mengatasi penanda aras yang ditetapkan lebih awal, menurut satu ukuran prestasi. Kedua-duanya mengambil kira pemilihan calon terbaik selepas keputusan dilihat, tetapi tidak mengesahkan peraturan tertentu atau menjamin keuntungan pada masa hadapan.
Mengapa pemenang backtest perlu diuji dengan cara lain
Jika satu strategi ditetapkan sebelum sampel dilihat, ujian perbandingan tunggal mungkin sesuai untuk menjawab soalan yang terhad. Namun, jika banyak peraturan dan tetapan dicuba, keputusannya diperiksa, lalu hanya pemenang diuji seolah-olah ia satu-satunya calon sejak awal, proses carian itu diabaikan. Walaupun tiada peraturan mempunyai kelebihan sebenar, anggaran terbesar daripada banyak anggaran yang bising boleh menjadi positif secara kebetulan.
Reality Check, atau RC, dan ujian SPA menilai soalan pada peringkat keluarga: selepas carian dalam set alternatif yang ditakrifkan diambil kira, adakah bukti bahawa sekurang-kurangnya satu strategi mempunyai jangkaan prestasi yang lebih baik daripada penanda aras? Keluarga itu boleh merangkumi peraturan teknikal, model ramalan atau strategi lain. White memperkenalkan rangka kerja ujian data snooping pada 2000; Sullivan, Timmermann dan White menggunakannya pada 1999 untuk keluarga besar peraturan dagangan teknikal. Makalah White dan kajian penggunaan pada peraturan dagangan ialah sumber primer. Masukkan alternatif yang membawa kepada pilihan akhir, bukan pemenang sahaja.
Tetapkan penanda aras, keluarga calon dan arah perbezaan
Andaikan k mewakili satu peraturan calon dalam keluarga yang diuji K, manakala t mewakili tarikh penilaian yang sama bagi calon dan penanda aras. Untuk contoh berasaskan pulangan, takrifkan perbezaan bagi setiap tempoh seperti berikut:
d(k,t) = pulangan bersih calon k pada masa t − pulangan bersih penanda aras
Nilai positif memihak kepada calon. Jika membandingkan ketepatan ramalan, songsangkan susunan kerugian: kerugian penanda aras ditolak kerugian calon, supaya nilai positif bermakna calon mengurangkan kerugian. Jangan tukar arah penolakan antara calon atau tarikh.
Takrifkan μ(k) = E[d(k,t)] sebagai perbezaan jangkaan prestasi calon k. Hipotesis keluarga ialah:
H0: nilai maksimum μ(k) bagi semua calon dalam K tidak melebihi sifar H1: terdapat sekurang-kurangnya satu calon dalam K dengan μ(k) > 0
H0 tidak bermaksud perbezaan jangkaan setiap peraturan mestilah tepat sifar; peraturan yang dijangka lebih buruk daripada penanda aras juga termasuk dalam hipotesis nol. Ini satu ujian bersama terhadap prestasi relatif maksimum keluarga, bukannya beberapa ujian berasingan yang boleh ditafsir satu demi satu. Oleh itu, tetapkan penanda aras, tarikh, takrif pulangan, set calon dan kriteria prestasi dengan jelas. Jika persoalannya ialah prestasi terlaras risiko, perbezaan pulangan purata sahaja tidak mentakrifkan kriteria itu.
Reality Check mengambil nilai maksimum seluruh keluarga
Tulis d̄(k) sebagai purata perbezaan calon k sepanjang n tempoh penilaian. Dalam tetapan mudah yang menggunakan purata perbezaan, statistik RC ialah:
T_RC = nilai maksimum sqrt(n) × d̄(k) merentas semua k dalam K
RC mengambil hasil sampel terbaik dalam kalangan calon dan membandingkannya dengan taburan bootstrap di bawah hipotesis nol. Bagi hipotesis komposit ini, White menggunakan konfigurasi nol yang paling tidak memihak kepada hipotesis alternatif: taburan nol menganggap perbezaan jangkaan setiap calon ialah sifar, sedangkan calon dengan perbezaan jangkaan negatif juga memenuhi H0. Maka nilai kritikal boleh meningkat apabila keluarga calon mengandungi banyak alternatif yang lemah.
Nilai maksimum itu penting. Soalannya bukan “Adakah pemenang dalam sampel lulus ujian satu peraturan?” Soalannya ialah “Jika carian yang sama dibuat dalam keluarga yang ditetapkan, berapa jarang untuk mendapat maksimum sekurang-kurangnya sebesar ini?” Menguji pemenang sahaja dengan taburan rujukan bagi peraturan yang ditetapkan lebih awal menjawab soalan pertama tetapi mengabaikan pemilihan. Ujian tunggal yang dikira dengan betul sekalipun tidak membetulkan kesan pemilihan selepas keputusan dilihat.
Contoh 240 varian hipotetikal menunjukkan skala carian
Untuk aritmetik sahaja, andaikan seorang penyelidik mencuba 12 tempoh lookback, 4 penapis kemasukan dan 5 tetapan keluar. Jika semua gabungan diuji, hasilnya ialah 12 × 4 × 5 = 240 varian peraturan dagangan hipotetikal. Ini kiraan gabungan semata-mata, bukannya keputusan kajian yang diterbitkan atau dakwaan pulangan sebenar. Jangan reka nilai p atau tuntutan keuntungan berdasarkan contoh ini.
Jika gabungan terbaik dipilih selepas meneliti keputusan 240 varian, ujian terlaras perlu mengulangi pencarian maksimum yang sama dalam setiap sampel bootstrap. Dalam setiap replikasi, kira semula ukuran prestasi bagi semua varian dan ambil nilai tertingginya. Kemudian bandingkan maksimum sampel sebenar dengan taburan maksimum bootstrap. Jika hanya statistik pemenang dikira semula bagi setiap replikasi, soalan yang dijawab berubah kerana pemilihan daripada 240 keputusan tidak lagi diwakili.
Pembetulan hanya berguna jika huraian keluarga sepadan dengan proses penyelidikan sebenar. Jika tetapan, pasaran, tempoh pegangan atau peraturan keluar mempengaruhi pilihan tetapi tidak dimasukkan, kesan cariannya tidak dikira. Sebaliknya, menambah alternatif yang tidak berkaitan selepas melihat keputusan juga tidak wajar. Rekodkan keluarga carian yang menghasilkan pilihan itu dengan lengkap, termasuk calon yang tidak menang.
Sampel semula keseluruhan vektor masa secara bersama
Pada tarikh yang sama, peraturan berkongsi maklumat pasaran, maka perbezaan prestasinya mungkin berkorelasi. Kebergantungan bersiri juga boleh berlaku antara pemerhatian masa yang berdekatan. Bootstrap sepatutnya menyampel semula vektor perbezaan semua calon bagi setiap tarikh secara bersama, sambil mengekalkan segmen masa yang berurutan. Ini mengekalkan hubungan serentak antara peraturan dan sebahagian struktur masa dalam setiap replikasi. Menyampel semula setiap peraturan secara berasingan merosakkan kovarians antara peraturan dan mengubah taburan maksimum; mengocok hari satu demi satu juga boleh menghapuskan kebergantungan masa.
Kaedah blok seperti stationary bootstrap boleh digunakan untuk RC dan SPA. Kaedah ini membentuk siri contoh dengan menyambungkan blok pemerhatian berurutan yang panjangnya berubah-ubah; dalam binaan standard Politis dan Romano, panjang blok mengikut taburan geometri dan min jangkaannya dipilih lebih awal. Makalah stationary bootstrap mereka ialah sumber primer bagi kaedah tersebut. Penggunaan indeks masa yang sama untuk semua strategi mengekalkan pergerakan pasaran harian yang dikongsi.
Pensampelan semula tidak menjadikan semua siri sesuai secara automatik. Keputusan asimptotik memerlukan syarat keteraturan seperti proses yang stabil dan kebergantungan yang cukup lemah. Perubahan struktur atau ketakpegunan yang kuat tidak boleh dipulihkan oleh bootstrap. Blok terlalu pendek mungkin memotong persistensi penting, manakala blok terlalu panjang meninggalkan sedikit segmen yang benar-benar berbeza. Nyatakan kaedah dan panjang blok, kemudian semak sama ada kesimpulan berubah pada tetapan munasabah yang lain. Taburan nol bootstrap juga perlu mewakili hipotesis yang diuji, dan maksimum dikira semula bagi setiap replikasi. Block bootstrap bagi selang keyakinan satu statistik tetap untuk strategi yang sudah dipilih tidak secara automatik membetulkan carian seluruh keluarga. Panduan block bootstrap pulangan strategi membincangkan soalan berbeza tentang ketidakpastian statistik tetap dan kebergantungan masa.

SPA menyeragamkan statistik dan menggunakan nol yang bergantung pada sampel
SPA mengekalkan hipotesis nol peringkat keluarga dan perbezaan prestasi berbanding penanda aras, tetapi mengubah dua bahagian prosedur. Pertama, purata perbezaan setiap calon didarab dengan sqrt(n), kemudian diskalakan dengan anggaran sisihan piawai jangka panjang bagi siri perbezaannya:
T_SPA = max(0, max_k [sqrt(n) × d̄(k) / ω̂(k)])
ω̂(k) ialah anggaran sisihan piawai jangka panjang bagi siri perbezaan calon k, d(k,t); secara setara, ia ialah sisihan piawai asimptotik bagi sqrt(n) × d̄(k). Nilai ini bukan sisihan piawai atau ralat piawai bagi purata sampel tanpa skala. Penyebut tersebut menangkap kebolehubahan jangka panjang siri, termasuk kebergantungan bersiri. Maka, calon dibandingkan pada skala ketidakpastian purata yang setara, sementara kovarians antara calon masih penting apabila taburan maksimum dibentuk.
Kedua, SPA menggunakan taburan nol yang bergantung pada maklumat sampel. Dalam versi konsisten, purata sampel negatif bagi calon yang kelihatan cukup lemah berbanding penanda aras dikekalkan dalam pemusatan nol. Calon yang mungkin masih berada dekat dengan sempadan nol dipusatkan pada sifar. Dengan cara ini, pengaruh alternatif lemah dikurangkan mengikut bukti sampel tanpa membuang calon itu begitu sahaja. Jangan memilih calon untuk dikekalkan selepas melihat keputusan kerana hal itu boleh menjejaskan kesahan taburan nol.
Makalah Hansen pada 2005 menerangkan kedua-dua perubahan: statistik studentized dan taburan nol yang bergantung pada sampel. Dalam reka bentuk tertentu, kedua-duanya boleh meningkatkan kuasa dan mengurangkan kepekaan terhadap alternatif lemah atau tidak relevan, tetapi SPA tidak semestinya mengatasi RC. Hansen menyatakan bahawa tiada satu ujian yang mendominasi ujian lain secara seragam. Sesetengah pelaksanaan melaporkan p-value SPA bawah, konsisten dan atas; nyatakan versi dan pelaksanaan yang digunakan. Makalah Hansen ialah sumber primer untuk statistik, pemusatan dan butiran bootstrap.
Penolakan peringkat keluarga tidak mengenal pasti peraturan pemenang
Jika hipotesis nol keluarga ditolak, kesimpulan terhad yang disokong ialah, di bawah kriteria prestasi dan andaian yang ditetapkan, terdapat bukti bahawa sekurang-kurangnya satu calon dalam keluarga yang dinyatakan mempunyai prestasi jangkaan lebih baik daripada penanda aras. Hal ini tidak membuktikan bahawa semua peraturan menguntungkan, pemenang sampel mempunyai kesignifikanan individu yang terlaras, atau peraturan itu akan terus menjadi yang terbaik dalam dagangan langsung.
Kegagalan menolak hipotesis nol juga tidak membuktikan bahawa semua peraturan tidak berguna atau setara. Maksudnya, sampel dan prosedur ini belum memberikan bukti peringkat keluarga yang mencukupi bagi keunggulan mana-mana calon pada aras yang dipilih. Sampel mungkin pendek atau sangat berubah-ubah, perbezaan antara calon mungkin kecil, atau kelebihan sebenar mungkin lemah. “Belum ada bukti yang mencukupi untuk kelebihan” berbeza daripada “terbukti tiada kelebihan.”
Ujian maksimum omnibus ini tidak memberikan kedudukan terlaras bagi setiap calon dan tidak memberitahu anda peraturan mana yang patut dipilih. Dakwaan terlaras tentang peraturan tertentu memerlukan kaedah inferens peringkat calon atau berperingkat, kemudian pengesahan berasingan menggunakan data yang tidak membantu pemilihan. Jangan ubah penolakan peringkat keluarga menjadi saranan pelaburan atau dakwaan bahawa hasil backtest akan berulang.
Tetapkan kriteria dan keluarga calon sebelum melihat keputusan
Pembetulan hanya terpakai pada keluarga calon yang dimasukkan. Catat lookback, penapis, pasaran, tempoh pegangan dan variasi keluar yang mempengaruhi pemilihan, termasuk percubaan yang gagal. Jika beberapa penanda aras, takrif pulangan atau tetingkap sampel dicuba lalu yang disukai dipilih selepas keputusan dilihat, rekodkan carian itu juga. Proses penyelidikan yang tidak direkodkan berada di luar pelarasan formal.
Selaraskan pulangan semua calon pada tarikh yang sama. Sebelum mentakrifkan perbezaan prestasi, tetapkan cara komisen, spread bida-tawar, gelinciran, pembiayaan, pinjaman dan kos rollover dikira. Pilih kriteria sebelum menentukan pemenang. Min pulangan bersih, skor utiliti dan ukuran terlaras risiko ialah soalan yang berlainan; ujian bagi satu ukuran tidak menjawab ukuran lain secara automatik. Bagi perbandingan ramalan bersarang atau reka bentuk khas lain, andaian tentang anggaran parameter dan taburan nol mungkin berbeza, jadi jangan gunakan resipi RC/SPA umum secara mekanikal.
Bezakan juga kaedah ini daripada false discovery rate (FDR). FDR mengawal bahagian penemuan palsu yang dijangka dalam beberapa keputusan individu; RC dan SPA menguji maksimum satu keluarga calon berbanding penanda aras. Kedua-duanya juga berbeza daripada panduan block bootstrap untuk statistik tetap, yang menganggar ketidakpastian statistik yang telah ditetapkan tetapi tidak mengulangi carian maksimum seluruh keluarga dengan sendirinya. Panduan multiple testing dan FDR dalam kewangan menerangkan jenis pembetulan yang berbeza.
Laporkan hasil bersama andaian dan batasannya
Laporan yang berguna menyatakan penanda aras, keluarga calon, kriteria prestasi, julat tarikh, kekerapan pemerhatian, kos yang dimasukkan, kaedah bootstrap, panjang blok, bilangan replikasi, statistik dan jenis p-value yang tepat. Simpan fail calon supaya penyemak boleh memastikan keluarga yang menghasilkan pilihan itu diwakili. Jika anda menggunakan holdout kronologi yang belum disentuh selepas ujian, jangan laraskan peraturan menggunakan holdout tersebut lalu terus melabelnya belum disentuh.
P-value RC atau SPA ialah bukti tentang hipotesis nol peringkat keluarga yang bersyarat pada data, keluarga carian, statistik dan andaian. Ia bukan kebarangkalian sesuatu strategi akan menghasilkan wang, ramalan pulangan masa hadapan atau jaminan bahawa prestasi backtest kekal selepas kos dan perubahan rejim. Ujian ini tidak membetulkan kebocoran masa hadapan, bias survivorship, ralat data, kesan pasaran atau rekod carian yang tidak lengkap. Panduan purged time-series cross-validation membincangkan masalah berbeza, iaitu kebocoran maklumat antara latihan dan ujian.
Soalan lazim
Q1Adakah SPA sentiasa lebih berkuasa daripada Reality Check?
Tidak. Perubahan Hansen boleh meningkatkan kuasa dan mengurangkan pengaruh alternatif lemah dalam reka bentuk tertentu, tetapi satu ujian tidak mengatasi yang lain dalam semua keadaan.
Q2Adakah keputusan SPA yang signifikan memberitahu saya peraturan dagangan mana patut digunakan?
Tidak. Keputusan itu menyokong kesimpulan peringkat keluarga bahawa sesuatu calon mungkin mengatasi penanda aras menurut kriteria yang ditetapkan. Ia tidak mengenal pasti peraturan khusus; prosedur peringkat calon dan pengesahan berasingan masih diperlukan.
Q3Bolehkah variasi backtest yang rugi digugurkan daripada keluarga?
Jika variasi itu mengambil bahagian dalam carian yang menghasilkan peraturan akhir, menggugurkannya mengubah soalan dan boleh mengecilkan kesan pemilihan. Tetapkan dan simpan keluarga yang berkaitan sebelum mentafsir keputusan terlaras.
Sumber dan bacaan lanjut
Laporkan masalah
Kami akan menyediakan e-mel dengan pautan artikel ini. Mark menerima laporan hanya selepas anda menghantarnya
Semakan pantas
Sudah membaca panduan? Uji diri dengan 3 soalan
Soalan 01
Selepas banyak variasi strategi dicuba, calon mana perlu dimasukkan dalam ujian peringkat keluarga?
Pilih jawapan untuk melihat penjelasan
Glosari opsyen
The probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Baca panduan terperinciAssignmentThe process that requires an option writer to fulfill the contract after an exercise notice is allocated; it can create or remove an underlying position.
Baca panduan terperinci