Jendela expanding dan rolling untuk validasi model walk-forward
Bandingkan jendela pelatihan expanding dan rolling berdurasi tetap, pisahkan validasi dari pengujian akhir, dan pilih aturan tanpa memakai hasil masa depan.
Dalam panduan iniFold walk-forward memiliki jendela pelatihan dan evaluasi yang terpisah
Ringkasan singkat
Jendela pelatihan expanding mempertahankan riwayat layak yang paling awal lalu menambahkan data baru saat tersedia. Jendela rolling menyimpan sejumlah tetap observasi layak terbaru dan membuang baris yang lebih lama. Keduanya bisa dipakai dalam evaluasi walk-forward secara kronologis, tetapi tidak menggantikan pemisahan pemilihan model dari periode uji akhir.
Fold walk-forward memiliki jendela pelatihan dan evaluasi yang terpisah
Pada titik awal prakiraan, peneliti mengetahui sebagian fitur dan hasil masa lalu, memasang atau memperbarui model, lalu mengevaluasinya pada blok berikutnya. Menggeser titik itu ke depan menghasilkan periode di luar sampel yang berurutan. Aturan jendela pelatihan menentukan baris lampau yang layak untuk setiap pemasangan; aturan validasi dan pengujian menentukan hasil berikutnya yang dipakai untuk membandingkan pilihan dan mengukur kinerja. Keputusan ini terkait, tetapi bukan jendela yang sama.
Aturan expanding berawal dari batas historis tetap dan bertambah ketika hasil baru diketahui. Aturan rolling menggeser kedua ujungnya, tetapi menjaga jumlah observasi tetap setelah masa pemanasan. Jangan gunakan target yang belum selesai pada titik prakiraan. Jika label mencakup beberapa sesi, tanggal baris mungkin tidak menunjukkan kapan hasilnya diketahui; simpan waktu akhir label dan patuhi batas itu.
Pisahkan juga jangka lihat-balik fitur dari jendela pelatihan. Sebuah sinyal dapat menghitung volatilitas tiap baris dari periode terkini, sementara model memakai baris dari beberapa tahun. Mengubah jangka fitur mengubah prediktor; mengubah jendela pelatihan mengubah observasi untuk mengestimasi model.
Jendela expanding mempertahankan riwayat awal
Misalkan \(s\) adalah indeks observasi layak pertama dan \(t\) observasi terbaru yang labelnya telah lengkap saat model dipasang ulang. Set pelatihan expanding adalah \(\{s,s+1,\ldots,t\}\). Pada titik berikutnya, baris itu tetap digunakan dan baris layak baru ditambahkan. Ukurannya bertambah seiring waktu kecuali ada aturan terpisah yang menyaring atau menghapus data.
Lebih banyak observasi dapat mengurangi derau sampling pada estimasi parameter jika data lama masih menjelaskan proses yang diteliti. Data itu juga dapat mempertahankan kondisi pasar langka yang mungkin tidak muncul dalam sampel terkini yang pendek, sekaligus menghindari pemilihan batas historis secara sewenang-wenang. Namun, baris lama tidak otomatis kehilangan pengaruh hanya karena usianya. Jika hubungan fitur dan imbal hasil berubah, data awal dapat menarik estimasi ke kondisi yang sudah tidak serupa. Pemasangan yang makin besar juga bisa lebih lambat; menyimpan riwayat tidak otomatis membuatnya lebih representatif.
Jendela rolling membuang observasi di luar rentang yang dipilih
Untuk panjang tetap \(W\), set pelatihan pada titik \(t\) adalah \(\{t-W+1,\ldots,t\}\), setelah memperhitungkan jeda label atau jarak batas. Pada titik berikutnya, ujung akhirnya maju dan baris layak tertua keluar. Panjang dapat dinyatakan dalam jumlah observasi atau waktu kalender, tetapi keduanya tidak setara jika data tidak teratur.
Jendela rolling menetapkan aturan kebaruan. Ini dapat sesuai untuk pertanyaan tentang adaptasi terhadap kondisi yang berubah atau kebutuhan operasional akan ukuran pelatihan tetap. Namun, model tidak otomatis adaptif: pemasangan ulang yang jarang atau perubahan bertahap dapat memperlambat respons. Rentang pendek memberi lebih sedikit informasi, membuat estimasi tidak stabil, menghilangkan periode tekanan yang jarang, atau menyisakan terlalu sedikit contoh untuk model kompleks. Rentang panjang menjaga lebih banyak riwayat tetapi dapat mengaburkan pola terbaru.
Satuan jendela juga berpengaruh. Jumlah baris yang sama dapat mencakup waktu kalender berbeda karena hari tanpa data atau frekuensi yang berbeda. Untuk data panel, tentukan apakah jendela membuang baris atau kelompok aset berdasarkan tanggal. Jika \(W\) dipilih setelah melihat tes akhir, periode itu ikut menjadi data seleksi dan bukan lagi pengujian independen.
Kedua aturan memberi riwayat berbeda pada setiap pemasangan
| Pilihan | Baris pelatihan saat dipasang | Potensi manfaat | Biaya yang perlu diperiksa |
|---|---|---|---|
| Expanding | Semua baris layak dari awal tetap hingga titik itu | Observasi lebih banyak dan episode lama tetap terwakili | Rezim lama tetap berpengaruh; pemasangan dapat melambat |
| Rolling | Rentang tetap terbaru dari baris layak | Batas kebaruan jelas dan ukuran sampel terbatas | Informasi lebih sedikit; hasil lebih peka terhadap panjang rentang |
Agar perbandingan mengisolasi aturan jendela, samakan batas informasi, fitur, kelas model, tujuan pelatihan, tanggal pemasangan ulang, horizon prakiraan, blok uji, dan asumsi eksekusi. Jika model rolling juga lebih sering dipasang ulang atau menggunakan pilihan lain, selisih skor tidak bisa dikaitkan dengan jendela saja.
Aturan ini juga bukan cara memilih titik prakiraan. Kedua jendela dapat dievaluasi dengan titik asal bergulir: latih pada masa lalu yang layak, prakirakan blok berikutnya, maju, lalu ulangi. Ulasan Leonard Tashman tentang uji prakiraan di luar sampel00065-0) membahas titik asal bergulir dan jendela estimasi bergulir. Yang pertama menentukan kapan evaluasi berlangsung; yang kedua menentukan baris pelatihan yang tetap digunakan.
Linimasa hipotetis menunjukkan data yang masuk ke tiap pemasangan
Semua angka dan tanggal berikut hipotetis. Misalkan model dipasang ulang setiap bulan untuk memprakirakan imbal hasil bulan berikutnya. Pemasangan pertama memakai 60 observasi layak yang berakhir pada bulan 120. Label baru boleh dipakai setelah hasilnya lengkap. Pada titik prakiraan pertama, kedua aturan memakai 60 baris yang sama jika panjang rolling adalah 60.
Setelah hasil satu bulan baru diketahui, expanding memiliki 61 baris layak. Rolling menambahkan baris baru dan membuang yang tertua sehingga tetap memiliki 60. Setelah 12 pembaruan, expanding mencakup 72 baris sejak awal, sedangkan rolling menyimpan 60 baris terbaru. Estimasi dapat berbeda karena riwayatnya berbeda, meski setiap baris tersedia pada waktu pemasangannya.
Dalam contoh ini, sisihkan 24 bulan terakhir sebagai uji luar. Aturan dan panjang jendela, fitur, serta pengaturan lain harus dipilih pada periode validasi kronologis yang lebih awal. Lalu nilai pilihan yang telah dibekukan sesuai jadwal pemasangan ulang yang ditetapkan sebelumnya. Mengubah panjang setelah melihat hasil uji luar berarti menggunakan tes untuk seleksi dan melebih-lebihkan bukti akhirnya.
Pilih aturan jendela dalam validasi kronologis
Tentukan pertanyaan sebelum membandingkan: apakah model harus memakai semua riwayat yang tersedia pada setiap pemasangan, atau ada alasan untuk mengeluarkan contoh lama? Apakah hubungan target diperkirakan stabil, atau masukan relevan dapat berubah? Pertanyaan ini membantu menentukan kandidat, tetapi tidak membuktikan mana yang akan lebih baik di pasar tertentu.
Gunakan data pengembangan yang lebih awal untuk membandingkan sejumlah kecil opsi yang ditetapkan sebelumnya, misalnya expanding dan beberapa panjang rolling yang masuk akal, pada blok validasi kronologis dan frekuensi pemasangan yang sama. Tentukan tujuan sebelum menilai: galat prakiraan, kalibrasi, utilitas portofolio setelah memperhitungkan turnover, dan drawdown menjawab pertanyaan berbeda. Samakan biaya dan batasan, serta catat pemasangan gagal dan prakiraan yang hilang. Target atau blok yang tumpang tindih dapat membuat skor berdekatan berbagi imbal hasil; jelaskan ketergantungan itu, bukan menghitung setiap baris sebagai eksperimen independen.
Sisihkan periode kronologis yang lebih baru untuk tes akhir. Dalam desain bersarang, validasi dalam memilih jendela dan pengaturan lain hanya dari data sebelum tiap blok uji luar; hasil luar menilai seluruh prosedur pemilihan. Panduan purged cross-validation membahas batas tumpang tindih label, sedangkan overfitting model keuangan dan pengujian berganda membahas risiko seleksi terkait.
Selaraskan label, prapemrosesan, dan waktu pemasangan dengan informasi saat itu
Pada setiap titik gunakan hanya fitur dan label yang memang sudah diketahui. Imbal hasil ke depan selama beberapa sesi mungkin belum selesai di dekat batas validasi meskipun tanggal keputusan lebih awal. Sisakan jeda atau buang baris berdasarkan interval label sebenarnya jika perlu; jumlah baris tetap hanya layak bila frekuensi data dan horizon hasil mendukungnya. Aturan jendela tidak memperbaiki fitur yang berisi informasi masa depan.
Pasang imputasi, penskalaan, pemilihan fitur, dan prapemrosesan terpelajar lainnya hanya pada bagian pelatihan tiap fold. Jika ambang atau hiperparameter perlu dipilih, gunakan validasi kronologis di dalam periode pelatihan lalu bekukan pilihan itu saat menilai blok berikutnya. Dokumentasi resmi scikit-learn untuk TimeSeriesSplit menjelaskan bahwa set pelatihan bertambah secara default dan max_train_size membatasi ukurannya. gap dihitung dalam jumlah sampel; durasi fold yang sebanding mengasumsikan jarak observasi sama. Periksa juga waktu label keuangan dan versi pustaka yang digunakan.
Laporkan kinerja per titik asal dan jelaskan batas evaluasi
Laporkan aturan dan panjang jendela yang tepat, tanggal paling awal yang dipertahankan, jumlah baris layak di setiap pemasangan, aturan ketersediaan label, tanggal validasi dan tes akhir, horizon prakiraan, serta jadwal pemasangan ulang. Tampilkan hasil per blok uji selain agregat. Rata-rata dapat menyamarkan satu episode pasar yang dominan, sementara prakiraan berdekatan mungkin berbagi hasil dan bukan bukti independen.
Akurasi prakiraan bukan kinerja perdagangan bersih. Pembentukan posisi, leverage, turnover, likuiditas, biaya, spread, dampak pasar, pinjaman, pendanaan, dan waktu eksekusi memengaruhi hasil. Samakan asumsi tersebut dan sebutkan apa yang tidak disertakan. Studi Cerqueira, Torgo, dan Mozetič tentang estimasi kinerja deret waktu melaporkan bahwa estimasi dapat berbeda pada kondisi stasioner dan nonstasioner. Studi itu tidak membandingkan langsung kebijakan jendela keuangan dan tidak menyatakan satu aturan selalu unggul.
Pandang setiap backtest sebagai bukti tentang riwayat dan proses tertentu. Expanding dapat mempertahankan rezim usang; rolling dapat membuang informasi berguna dan menjadi bising. Aturan terpilih bisa gagal pada rezim, semesta aset, atau struktur biaya berbeda. Validasi mengurangi ketidakpastian tentang prosedur yang diuji, tetapi tidak menjanjikan imbal hasil masa depan ataupun membuktikan satu jendela optimal.
Pertanyaan umum
Q1Apakah jendela expanding selalu lebih baik karena memakai lebih banyak data?
Tidak. Baris tambahan dapat menstabilkan estimasi jika data lama masih relevan, tetapi rezim usang bisa terus memengaruhi model. Hasilnya bergantung pada data, target, fitur, estimator, dan periode evaluasi.
Q2Apakah jendela rolling otomatis menyesuaikan diri terhadap perubahan rezim pasar?
Tidak. Jendela ini membuang baris yang keluar dari rentang, tetapi tidak mendeteksi perubahan atau menjamin sampel baru mewakili rezim berikutnya. Frekuensi pemasangan ulang, panjang jendela, dan desain model tetap penting.
Q3Bolehkah memakai periode yang sama untuk menyetel jendela dan melaporkan kinerja akhir?
Periode itu berarti telah menjadi bagian dari pemilihan model. Pilih aturan melalui validasi kronologis, lalu nilai prosedur yang dibekukan pada tes berikutnya yang belum disentuh. Hasil itu pun hanya menggambarkan riwayat dan asumsi yang diuji.
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Apa yang berubah pada pemasangan berikutnya di jendela pelatihan rolling berdurasi tetap?
Pilih jawaban untuk melihat penjelasannya
Glosarium opsi
The relationship between systematic prediction error from model mismatch and instability caused by sensitivity to the training sample.
Baca panduan lengkapFamily-wise error rateThe probability of falsely rejecting at least one true null hypothesis within a predefined family of tests.
Baca panduan lengkapAssignment opsiProses ketika kewajiban memenuhi kontrak setelah pemberitahuan exercise dialokasikan kepada penjual opsi dan dapat menimbulkan penyerahan atau pembelian saham.
Baca panduan lengkap