Multiple Testing dan False Discovery Rate dalam Keuangan
Pahami perbandingan berganda, family-wise error, false discovery rate, Bonferroni, Holm, Benjamini–Hochberg, dependensi, q-value, penambangan faktor, seleksi backtest, dan tata kelola riset
Jawaban langsung
Multiple testing muncul ketika banyak hipotesis, strategi, faktor, aset, horizon, atau spesifikasi dicari bersama. Bahkan p-value individual yang valid kemudian dapat menghasilkan pemenang karena kebetulan. Family-wise error rate mengendalikan probabilitas setidaknya satu penolakan palsu, sedangkan false discovery rate mengendalikan porsi palsu ekspektasian di antara penolakan di bawah asumsi tertentu. Keluarga riset, bukan hanya tabel final, menentukan masalahnya
Lebih banyak uji menciptakan lebih banyak pemenang kebetulan
Jika m hipotesis nol benar yang independen masing-masing diuji pada level α, probabilitas setidaknya satu penolakan palsu adalah 1−(1−α)^m
Pada α=0.05 dan m=20, probabilitas tersebut sekitar 64%, meskipun setiap uji individual memiliki tingkat penolakan palsu nominal 5%
Dependensi mengubah perhitungan persisnya, tetapi tidak membenarkan anggapan bahwa hanya pemenang yang dilaporkan yang diuji
Keluarga menentukan pertanyaan galat
Keluarga uji dapat mencakup semua faktor, transformasi, semesta, lag, horizon, filter, pilihan model, dan pengulangan yang dipertimbangkan untuk satu klaim riset
Menentukan keluarga setelah melihat hasil meremehkan multiplicity dan memungkinkan peneliti memisahkan percobaan terkait sampai koreksinya menjadi tidak berarti
Keluarga yang dapat dipertahankan mengikuti proses keputusan dan peluang seleksi, bukan hanya baris yang bertahan masuk ke makalah atau dashboard
FWER dan FDR mengendalikan kerugian berbeda
Family-wise error rate adalah probabilitas membuat setidaknya satu penolakan palsu dalam keluarga
False discovery rate adalah E[V/max(R,1)], dengan V sebagai jumlah penolakan palsu dan R sebagai jumlah seluruh penolakan
FWER lebih ketat ketika klaim palsu apa pun mahal; FDR sering lebih kuat ketika penyaringan banyak kandidat dapat menoleransi porsi palsu yang terkendali
Prosedur memerlukan asumsinya sendiri
Bonferroni menguji setiap hipotesis pada α/m dan mengendalikan FWER tanpa memerlukan independensi, meskipun dapat bersifat konservatif
Metode step-down Holm juga mengendalikan FWER dan tidak pernah kurang kuat daripada aturan penolakan Bonferroni dasar
Benjamini–Hochberg mengurutkan p-value dan mengendalikan FDR di bawah independensi serta dependensi positif tertentu; struktur dependensi lain memerlukan metode yang dibenarkan
Nilai yang disesuaikan bukan probabilitas kebenaran posterior
P-value yang disesuaikan adalah level galat keluarga terkecil ketika suatu hipotesis akan ditolak di bawah prosedur yang dipilih
Q-value umumnya ditafsirkan sebagai estimasi ambang FDR minimum untuk menyebut hasil sebagai penemuan, bergantung pada metode dan asumsi
Tidak satu pun dari kedua kuantitas itu otomatis merupakan probabilitas bahwa strategi terpilih salah; hal tersebut memerlukan model dan pernyataan kondisional yang berbeda
Keuangan menyembunyikan keluarga adaptif yang besar
Penambangan faktor, aturan teknikal, sinyal opsi, data alternatif, kendala portofolio, dan asumsi biaya menciptakan ribuan percobaan yang berkorelasi
Faktor yang diterbitkan dipilih dari pencarian masa lalu, sehingga mengevaluasi faktor baru terhadap statistik t terisolasi yang mendekati dua mengabaikan tekanan penemuan yang terakumulasi
Aset dan periode yang sama membuat uji dependen, sementara perubahan rezim berarti koreksi seleksi tidak dapat menjamin kinerja ekonomi masa depan
Tata kelola harus menjaga catatan pencarian
Catat setiap hipotesis, versi kode, semesta, outcome, transformasi, keterlambatan, biaya, dan pilihan penghentian dengan pengenal riset yang stabil
Pisahkan penemuan, konfirmasi, dan pemantauan live; bekukan aturan konfirmatori dan gunakan data yang benar-benar tidak disentuh atau evaluasi prospektif
Laporkan bukti mentah dan yang disesuaikan, definisi keluarga, asumsi dependensi, ukuran efek, biaya, stabilitas, gagasan yang ditolak, dan penurunan live
Pertanyaan umum
Apa itu masalah multiple testing?
Masalah ini adalah peningkatan false discovery yang disebabkan oleh pengujian dan seleksi di antara banyak hipotesis sambil menilai pemenang seolah-olah tiap uji berdiri sendiri
Apa perbedaan FWER dan FDR?
FWER mengendalikan probabilitas setidaknya satu penolakan palsu; FDR mengendalikan proporsi palsu ekspektasian di antara semua penolakan
Bagaimana Benjamini–Hochberg bekerja?
Metode ini mengurutkan p-value, membandingkannya dengan ambang yang bergantung pada peringkat, lalu menolak hingga peringkat terbesar yang memenuhi syarat berdasarkan asumsi yang dinyatakan
Apakah pengendalian FDR membuat strategi perdagangan andal?
Tidak. FDR menangani galat seleksi dalam keluarga uji yang ditentukan, bukan perubahan rezim, biaya, kebocoran, risiko model, atau profitabilitas masa depan