Deflated Sharpe Ratio: pengujian berganda dan pemilihan backtest
Pelajari bagaimana Deflated Sharpe Ratio menyesuaikan bukti Sharpe setelah strategi dipilih, dengan memperhitungkan pengujian berganda dan imbal hasil nonnormal melalui contoh hipotetis serta batasan yang jelas.
Dalam panduan iniDSR menaikkan ambang Sharpe setelah pencarian
Ringkasan singkat
Deflated Sharpe Ratio (DSR) menanyakan apakah estimasi Sharpe dari strategi terpilih melampaui ambang yang mencerminkan pencarian di antara berbagai alternatif sekaligus bentuk distribusi imbal hasil. Metode ini menerapkan perhitungan Sharpe probabilistik terhadap tolok ukur yang disesuaikan untuk seleksi. DSR adalah diagnosis statistik bersyarat: DSR tidak mengubah backtest menjadi bukti keuntungan di masa depan dan tidak memperbaiki percobaan yang dihilangkan, biaya yang tidak realistis, atau kebocoran data lintas waktu.
DSR menaikkan ambang Sharpe setelah pencarian
Peneliti dapat mencoba beragam definisi sinyal, periode lihat-balik, ambang masuk, universe aset, lama kepemilikan, dan asumsi biaya, lalu melaporkan versi dengan rasio Sharpe tertinggi. Walaupun tidak ada kandidat yang benar-benar memiliki keahlian, estimasinya tetap berbeda karena derau sampel. Makin luas pencarian, makin tinggi kecenderungan estimasi maksimumnya. Hasil terpilih itu berbeda dari penilaian atas satu strategi yang ditetapkan sebelum data dilihat.
Deflated Sharpe Ratio yang diusulkan Bailey dan López de Prado menangani dua sumber inflasi Sharpe terpilih: pengujian berganda dan imbal hasil nonnormal. Pengujian berganda menaikkan tolok ukur yang harus dilewati hasil; ketidaknormalan mengubah ketidakpastian estimasi Sharpe. Makalah asli menjelaskan DSR sebagai Probabilistic Sharpe Ratio yang dihitung terhadap ambang yang disesuaikan dengan seleksi. Makalah asli menguraikan penurunan rumus dan estimasi jumlah percobaan.
Penjelasan ini mencegah kekeliruan yang umum. DSR tidak secara mekanis mengurangi Sharpe yang dilaporkan dengan penalti tetap untuk menghasilkan rasio kinerja baru. DSR mengestimasi seberapa jauh Sharpe yang diamati melampaui ambang yang terkait dengan pencarian, panjang sampel, dan momen imbal hasil. Estimasi titik Sharpe dapat tetap sama sementara DSR turun karena buktinya lebih lemah. Untuk memahami arti Sharpe itu sendiri, lihat juga penjelasan asli Sharpe.
Nilai terbaik dari banyak estimasi yang bising biasanya sangat tinggi
Anggap semua aturan yang diuji memiliki Sharpe sejati yang sama, tetapi setiap estimasi bervariasi karena berasal dari sampel terbatas. Memilih estimasi terbesar juga berarti memilih galat pengukuran yang menguntungkan. Inilah kutukan pemenang: saat dinilai dengan data baru, estimasi terpilih diperkirakan kembali mendekati nilai tipikal kelompok.
Jumlah percobaan penting, begitu juga perbedaan di antara estimasi-estimasi itu. Jika kandidat menghasilkan imbal hasil yang hampir sama, estimasi Sharp-nya saling terkait erat dan memberi lebih sedikit peluang independen untuk memperoleh maksimum karena keberuntungan dibandingkan kumpulan kandidat tak terkait dengan ukuran yang sama. Jadi, jumlah baris dalam kisi parameter tidak otomatis sama dengan jumlah percobaan independen.
Catatan pencarian dapat memuat keputusan di luar kisi formal: ambang yang diubah secara manual, pasar yang dikeluarkan, atau asumsi biaya yang direvisi sehingga memengaruhi hasil yang dipertahankan. DSR yang hanya dihitung dari kandidat final tidak dapat memperhitungkan eksperimen yang tidak dicatat atau tidak diberikan sebagai masukan.
Probabilistic Sharpe Ratio menghitung ketidakpastian sampel
Probabilistic Sharpe Ratio (PSR) mengestimasi apakah Sharpe sampel melampaui tolok ukur yang dipilih, dengan memperhitungkan jumlah observasi imbal hasil serta estimasi skewness dan kurtosis. DSR menggunakan perhitungan dasar yang sama, tetapi memilih tolok ukur yang mencerminkan Sharpe maksimum yang diharapkan dari pencarian.
Untuk salah satu pendekatan PSR yang umum, perhitungan yang disesuaikan dengan seleksi adalah:
$$ \mathrm{DSR}=\Phi\!\left( \frac{(\widehat{SR}-SR_0)\sqrt{T-1}} {\sqrt{1-\widehat{\gamma}_3\widehat{SR} +\frac{\widehat{\gamma}_4-1}{4}\widehat{SR}^{\,2}}} \right) $$
Di sini, $\Phi$ adalah fungsi distribusi kumulatif normal standar, $\widehat{SR}$ adalah Sharpe teramati per observasi imbal hasil, $SR_0$ adalah ambang yang disesuaikan dengan seleksi dalam satuan yang sama, dan $T$ adalah jumlah observasi. $\widehat{\gamma}_3$ adalah skewness sampel. $\widehat{\gamma}_4$ adalah kurtosis Pearson, yang bernilai 3 untuk distribusi normal. Penyebutnya mencerminkan bagaimana skewness dan kurtosis mengubah ketidakpastian estimasi Sharpe.
Ekspresi ini sensitif terhadap konvensi yang dipakai. Gunakan imbal hasil berlebih pada satu frekuensi, hitung Sharpe dan ambang pada frekuensi yang sama, dan definisikan kurtosis secara konsisten. Jika hanya satu besaran yang disetahunkan, perbandingannya berubah. Rumus yang lazim juga bergantung pada asumsi tentang keterkaitan observasi imbal hasil; dependensi serial perlu ditangani secara terpisah, bukan diam-diam disisipkan ke $T$.
Ambang maksimum harapan bergantung pada kelompok kandidat
Untuk $N$ estimasi Sharpe independen dengan distribusi yang kira-kira normal, Bailey dan López de Prado menggunakan pendekatan nilai ekstrem untuk maksimum harapan:
$$ SR_0 \approx \mu_{SR}+\sigma_{SR} \left[(1-\gamma_E)\Phi^{-1}\!\left(1-\frac{1}{N}\right) +\gamma_E\Phi^{-1}\!\left(1-\frac{1}{Ne}\right)\right] $$
$\mu_{SR}$ dan $\sigma_{SR}$ menggambarkan rata-rata dan simpangan baku estimasi Sharpe para kandidat; $\Phi^{-1}$ adalah fungsi kuantil normal standar, $e$ adalah bilangan Euler, dan $\gamma_E \approx 0,5772$ adalah konstanta Euler–Mascheroni. Ekspresi ini memperkirakan seberapa tinggi estimasi terbaik dapat naik hanya karena seleksi dalam model percobaan yang dipilih. Ini bukan ambang universal untuk setiap pencarian strategi.
Jika hasil kandidat saling berkorelasi, menganggap setiap variasi independen dapat melebih-lebihkan jumlah percobaan efektif. Makalah tersebut membahas cara mengestimasi jumlah percobaan independen dari dependensi antarkandidat, tetapi estimasi itu sendiri adalah pilihan pemodelan lain. Korelasi hanyalah salah satu bentuk dependensi; estimasi dari banyak kandidat dengan riwayat imbal hasil pendek dapat tidak stabil. Laporkan jumlah kandidat mentah, metode untuk menghitung jumlah efektif, dan sensitivitas terhadap alternatif yang masuk akal.
Perhitungan hipotetis memisahkan ambang dari Sharpe teramati
Anggap pencarian yang sengaja disederhanakan terdiri atas 20 strategi kandidat independen. Di bawah hipotesis nol, gunakan rata-rata estimasi Sharpe 0 dan simpangan baku 0,20 dalam satuan bulanan. Pendekatan maksimum harapan menghasilkan ambang seleksi sekitar $SR_0=0,380$ per bulan. Masukan ini adalah asumsi untuk menunjukkan aritmetika, bukan pengamatan pasar atau tolok ukur yang disarankan.
Sekarang anggap satu strategi terpilih memiliki 60 observasi bulanan imbal hasil berlebih, estimasi Sharpe bulanan 0,50, skewness sampel 0, dan kurtosis Pearson 3. Komponen PSR membandingkan 0,50 dengan 0,380, bukan dengan nol:
$$ z=\frac{(0.50-0.380)\sqrt{59}}{\sqrt{1+((3-1)/4)(0.50)^2}} \approx 0.868,\qquad \mathrm{DSR}=\Phi(z)\approx 0.807 $$
Dengan asumsi sederhana ini, DSR yang dihasilkan sekitar 80,7%. Angka ini bukan probabilitas 80,7% bahwa strategi akan menghasilkan uang bulan depan dan bukan pula prakiraan imbal hasil bulan depan. Ini adalah estimasi bukti bahwa Sharpe yang mendasari melampaui ambang seleksi yang dipilih, bersyarat pada model dan masukannya. Jumlah percobaan, estimasi dependensi, sampel, atau bentuk imbal hasil yang berbeda dapat mengubah hasil.
Sensitivitas terhadap sebaran estimasi antarpercobaan cukup besar. Jika hanya simpangan baku asumsi estimasi Sharpe kandidat berubah dari 0,20 menjadi 0,10, pencarian 20 percobaan yang sama menghasilkan ambang sekitar 0,190 dan DSR sekitar 98,8%. Jika simpangan bakunya 0,30, ambangnya sekitar 0,570 dan DSR sekitar 30,6%. Sharpe teramati 0,50, 60 observasi, skewness, dan kurtosis tidak berubah. Sensitivitas hipotetis ini menunjukkan mengapa metode untuk mengestimasi sebaran percobaan dan dependensi kandidat penting; seluruh nilai tetap memakai satuan bulanan dan model sederhana yang sama.
Skewness dan kurtosis mengubah ketidakpastian, bukan sekadar narasi
Dua strategi dapat melaporkan Sharpe sampel dan panjang sampel yang sama, tetapi memiliki distribusi imbal hasil berbeda. Ekor kiri yang menonjol, asimetri, atau observasi ekstrem yang jauh lebih sering dapat mengubah ketidakpastian sampel pada penyebut PSR. Penyesuaian ini dihitung dari momen yang diukur; penyesuaian tidak menganggap semua distribusi nonnormal sama buruknya dan tidak menjamin bahwa beberapa momen sampel sepenuhnya menjelaskan perilaku ekor.
Perhitungan juga bergantung pada apa yang dianggap sebagai satu observasi. Data harian, mingguan, dan bulanan menghasilkan nilai berbeda untuk $T$, Sharpe, skewness, dan kurtosis. Imbal hasil periode kepemilikan yang tumpang tindih dapat membuat baris berdekatan saling bergantung. Penilaian yang dihaluskan atau sudah usang dapat tampak kurang bervariasi dibandingkan risiko ekonomi yang mendasarinya. Jelaskan frekuensi dan konstruksi sampel, bukan hanya mengandalkan Sharpe tahunan.
DSR dan metode validasi lain menjawab pertanyaan berbeda
PBO menggunakan Combinatorially Symmetric Cross-Validation untuk menanyakan seberapa sering pemenang in-sample berada pada peringkat median kandidat atau di bawahnya di blok-blok pelengkap. DSR mengestimasi apakah Sharpe terpilih melampaui ambang yang disesuaikan untuk pencarian dan ketidaknormalan. Hasil dan asumsi resampling keduanya berbeda; yang satu tidak menggantikan yang lain. Lihat juga panduan PBO dan CSCV dan pengujian berganda di keuangan. Bailey dan rekan penulis merumuskan diagnosis seleksi ini secara formal dalam makalah PBO asli.
White’s Reality Check menggunakan bootstrap untuk menguji apakah aturan terbaik dalam kelompok kandidat mengungguli tolok ukur yang ditentukan setelah memperhitungkan data snooping. Pertanyaannya berpusat pada tolok ukur, sedangkan DSR memakai ambang berbasis Sharpe. Evaluasi walk-forward kronologis atau holdout akhir menanyakan bagaimana proses yang dibekukan bekerja pada periode selanjutnya. Metode-metode ini dapat saling melengkapi karena menilai bagian berbeda dari klaim riset. Metode ini dijelaskan dalam makalah asli White tentang Reality Check.
Laporkan pencarian dan asumsi bersama DSR
Laporan yang dapat direproduksi menyebutkan universe kandidat, setiap keputusan terdokumentasi yang memengaruhi seleksi, jumlah percobaan mentah, metode untuk menghitung jumlah efektif, seri imbal hasil, panjang dan frekuensi sampel, definisi Sharpe, skewness, konvensi kurtosis, dan ambang yang disesuaikan dengan seleksi. Jelaskan apakah imbal hasil bruto atau bersih setelah spread, komisi, dampak pasar, funding, biaya pinjam, dan biaya lain. Tampilkan Sharpe teramati dan DSR bersama-sama agar pembaca melihat perubahannya.
Rumus konvensional mengasumsikan model sampel yang mungkin tidak cocok bagi observasi dengan korelasi serial. Karya Lo tentang statistik rasio Sharpe menjelaskan mengapa agregasi waktu dan dependensi memengaruhi inferensi Sharpe. Jika imbal hasil tumpang tindih atau menunjukkan korelasi serial, gunakan prosedur inferensi yang menangani struktur itu dan jelaskan asumsi-asumsinya. Mengalikan Sharpe bulanan dengan $\sqrt{12}$ tidak memperbaiki autokorelasi. Untuk evaluasi yang memperhatikan waktu, lihat pula panduan jendela walk-forward expanding dan rolling.
DSR tidak dapat menemukan pencarian yang tidak terdokumentasi, menghilangkan look-ahead leakage, membuat data dengan bias survivorship menjadi representatif, memvalidasi eksekusi, memperkirakan kapasitas, atau menjamin kestabilan di rezim baru. DSR juga bukan pengganti penalaran ekonomi atau bukti kronologis setelahnya. Perlakukan DSR sebagai satu diagnosis terdokumentasi dalam proses riset dan simpan riwayat kandidat serta pipeline data agar dapat direproduksi.
Pertanyaan umum
Q1Apakah Deflated Sharpe Ratio adalah rasio Sharpe setelah dikurangi penalti?
Bukan. DSR adalah statistik bernuansa probabilistik yang dibangun dari Sharpe terpilih, ambang yang disesuaikan dengan seleksi, panjang sampel, skewness, dan kurtosis. Estimasi titik Sharpe yang dilaporkan tidak diganti dengan rasio yang dikurangi secara mekanis.
Q2Haruskah setiap kombinasi parameter dihitung sebagai percobaan independen?
Tidak. Kandidat serupa dapat memiliki imbal hasil berkorelasi, sehingga ukuran mentah kisi parameter mungkin tidak sama dengan jumlah efektif peluang independen untuk memilih estimasi tinggi. Simpan catatan pencarian secara lengkap dan ungkapkan metode dependensi serta ketidakpastiannya.
Q3Apakah DSR tinggi membuktikan strategi trading akan berhasil?
Tidak. DSR bersyarat pada kelompok kandidat, data, konstruksi imbal hasil, asumsi percobaan, dan model sampel. DSR tidak memperbaiki eksperimen yang dihilangkan, kesalahan eksekusi, kebocoran, perubahan rezim, atau ketidakpastian masa depan.
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Apa yang berubah ketika perhitungan Probabilistic Sharpe menjadi dasar DSR?
Pilih jawaban untuk melihat penjelasannya