Transformasi integral probabilitas: kalibrasi ramalan densitas
Pelajari cara PIT mengevaluasi ramalan densitas kontinu dan diskret, informasi dari histogram, serta alasan keseragaman saja tidak cukup
Dalam panduan iniMengapa ramalan densitas perlu lebih dari galat titik
Ringkasan singkat
Ramalan densitas menetapkan probabilitas bagi rentang hasil yang mungkin. Probability integral transform (PIT) mengubah setiap hasil aktual menjadi probabilitas kumulatif menurut ramalan. Nilai PIT yang uniform berguna sebagai diagnostik dengan asumsi tertentu, tetapi histogram yang tampak rata tidak membuktikan kalibrasi kondisional atau independensi waktu.
Mengapa ramalan densitas perlu lebih dari galat titik
Ramalan titik mungkin menyebut imbal hasil besok sebesar 0,2%. Ramalan densitas memberi probabilitas pada seluruh rentang imbal hasil, dari pergerakan biasa sampai kejadian ekstrem. Evaluasinya menanyakan apakah distribusi yang diterbitkan sebelum hasil terlihat sesuai dengan realisasi berikutnya. Panduan Mincer–Zarnowitz membahas kalibrasi linear untuk ramalan angka titik, pertanyaan yang berbeda.
PIT mengukur probabilitas kumulatif yang ditempatkan ramalan sampai nilai aktual. Ini adalah peringkat probabilitas, bukan imbal hasil, sinyal trading, atau ukuran profit. Panduan Diebold–Mariano membandingkan kerugian ramalan rata-rata menurut skor yang dipilih; itu bukan uji kalibrasi densitas.
Transformasikan ramalan kontinu melalui CDF
Misalkan hasil setelah origin ramalan (t) adalah (Y_{t+1}), dengan cumulative distribution function (CDF) ramalan (F_{t+1}(y\mid\mathcal I_t)) berdasarkan informasi (\mathcal I_t) yang tersedia saat itu. Untuk distribusi kontinu, hitung
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ)
CDF adalah probabilitas nilai yang tidak lebih besar dari (y). Jika CDF ramalan merupakan distribusi kondisional yang benar, teorema PIT memberi
Pr(Uₜ₊₁ ≤ u | 𝓘ₜ) = u, for 0 ≤ u ≤ 1
Jadi PIT dari ramalan satu-langkah kontinu yang ideal uniform secara kondisional. Dalam deret berurutan yang informasinya memuat masa lalu, PIT ideal juga independen antar-origin di bawah asumsi yang sesuai. Rosenblatt membahas transformasi ini; Diebold, Gunther, dan Tay menerapkannya untuk evaluasi ramalan densitas (1952; 1998).
Contoh yang bisa diperiksa: ramalan (N(0,1)) dan hasil (y=1) memberi PIT (Phi(1)\approx0.8413), berarti sekitar 84,13% probabilitas ditempatkan pada nilai sampai 1. Satu nilai tidak menguji kalibrasi; diperlukan deret observasi.
Acakkan transformasi untuk hasil diskret
CDF diskret meloncat pada hasil yang mungkin. Karena itu (F(Y)) biasa hanya mengambil tingkat tertentu dan umumnya tidak uniform, sekalipun ramalannya benar. PIT acak mengisi setiap interval lompatan:
Uₜ₊₁ = Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ) + Vₜ₊₁ [Fₜ₊₁(Yₜ₊₁ | 𝓘ₜ) − Fₜ₊₁(Yₜ₊₁⁻ | 𝓘ₜ)]
(F(y^-)) adalah limit kiri, yakni probabilitas nilai yang strikt lebih kecil dari (y); (V) adalah undian Uniform(0,1) independen yang hanya dipakai untuk evaluasi. Pada distribusi kontinu, lompatan nol sehingga rumus menjadi (F(Y)). Brockwell membuktikan transformasi acak untuk distribusi umum, termasuk kasus diskret dan campuran (2007). Untuk data hitungan berurutan, Czado, Gneiting, dan Held juga membahas PIT tanpa randomisasi dan diagram kalibrasi marginal; jangan menilai PIT diskret seolah-olah (F(Y)) kontinu-uniform (2009).
Contoh hipotetis Bernoulli: (P(Y=1)=0.20), (P(Y=0)=0.80). PIT biasa bernilai 0,80 saat (Y=0) dan 1,00 saat (Y=1), sehingga tidak uniform. Dengan randomisasi, (Y=0) menghasilkan (0.80V) pada ([0,0.80]); (Y=1) menghasilkan (0.80+0.20V) pada ([0.80,1]). Setelah dibobot dengan probabilitas kejadian masing-masing, kepadatan gabungan uniform di ([0,1]). Undian ini alat evaluasi, bukan bagian ramalan.
Pisahkan keseragaman marginal dari independensi dan kalibrasi kondisional
Distribusi marginal PIT yang uniform diperlukan untuk ramalan kontinu ideal, tetapi belum cukup. Kesalahan berlawanan pada beberapa rezim dapat saling meniadakan saat data digabung, sehingga histogram tampak rata. Gneiting, Balabdaoui, dan Raftery menunjukkan bahwa PIT yang hampir uniform dapat muncul bersamaan dengan ramalan individual yang bias (2007).
Urutan juga penting: histogram uniform dapat menyembunyikan dependensi serial, misalnya kelompok nilai atau rangkaian panjang. Ramalan kondisional ideal menyiratkan lebih dari keseragaman gabungan. Untuk horizon yang tumpang tindih, distribusi acuan dan syarat independensi perlu mencerminkan overlap; uji iid belum tentu cocok.
Periksa distribusi PIT, urutan waktu, lag, variabel origin, dan rezim yang ditetapkan sebelumnya. Plot kelompok atau uji kondisional bisa menemukan pola tersembunyi, tetapi pilihan kelompok dan keterbatasan sampel harus diperhitungkan. Tidak ada kumpulan uji terbatas yang membuktikan kalibrasi bagi semua variabel kondisional.
Baca histogram PIT sebagai petunjuk, bukan vonis
Bentuk U sering konsisten dengan ramalan yang terlalu terkonsentrasi atau kurang tersebar; puncak tengah sering konsisten dengan ramalan yang terlalu lebar. Ketimpangan kiri-kanan dapat menandakan bias lokasi. Itu heuristik, bukan diagnosis tunggal: dependensi, campuran rezim, hasil diskret, binning, dan sampel kecil dapat menyesatkan.
Histogram menghapus urutan, jadi tidak menunjukkan kapan masalah muncul, pengelompokan nilai besar, atau subkelompok yang salah kalibrasi. Bin lebar dan sampel terbatas bisa tampak datar; bin sempit bisa tampak bergerigi karena noise. Laporkan jumlah ramalan, batas bin, dan ketidakpastian bila memungkinkan. Kerangka Diebold–Gunther–Tay dan uji Berkowitz punya asumsi yang harus sesuai desain. Berkowitz mentransformasikan PIT interior menjadi (Z_t=\Phi^{-1}(U_t)) dan menguji null gabungan nilai normal standar independen melawan alternatif dinamis yang ditentukan, misalnya AR(1). Ini bukan sertifikat universal (2001).
<!-- learn:illustration -->

Perhitungkan estimasi dan evaluasi di luar sampel
Hasil uniformitas mengasumsikan CDF adalah hukum kondisional yang benar. Dalam praktik, parameter diestimasi, keluarga distribusi dipilih, dan threshold/fitur dapat dituning. Jadi ramalan (F_{t+1}(\cdot;\hat\theta_t)) adalah bagian dari prosedur peramalan. Memakai hasil periode evaluasi untuk menyesuaikan model lalu menyebut PIT-nya bukti out-of-sample yang utuh berarti terjadi kebocoran informasi.
Pada evaluasi bergulir, gunakan hanya informasi yang tersedia di setiap origin. Catat jendela estimasi, frekuensi estimasi ulang, vintage data, versi model, dan langkah seleksi. Jendela berdekatan sering berbagi observasi; horizon yang overlap menambah dependensi.
Ukuran dan daya uji bergantung pada estimator, sampel, dan prosedur. Histogram PIT tidak menangani ketidakpastian parameter; acuan iid buku teks tidak berlaku untuk setiap desain yang diestimasi atau overlap. Untuk inferensi penting, pilih uji yang sesuai atau simulasikan/bootstrap null dengan mengulang seluruh pipeline estimasi-ramalan. Simpan sampel evaluasi akhir yang tidak dipakai untuk seleksi model bila diperlukan.
Bedakan kalibrasi dari sharpness
Kalibrasi menyangkut hubungan ramalan dan hasil: apakah peristiwa yang diberi peluang tertentu terjadi pada frekuensi yang sesuai? Sharpness menggambarkan konsentrasi distribusi ramalan tanpa melihat hasil. Gneiting, Balabdaoui, dan Raftery memandang sharpness diinginkan dengan syarat ramalan terkalibrasi, bukan sebagai penggantinya.
Ramalan lebar bisa terkalibrasi tetapi kurang informatif. Ramalan sempit bisa tampak presisi, tetapi buruk kalibrasinya bila hasil terlalu sering jatuh di luar massa probabilitasnya. PIT menguji konsistensi distribusi; ringkasan sharpness menunjukkan penyebaran/lebar. Melaporkan hanya salah satunya tidak cukup.
PIT gabungan yang rata bisa menyembunyikan kesalahan menurut rezim volatilitas atau horizon. Tentukan kondisi penting sebelumnya. Ini terkait tetapi berbeda dari regresi ramalan titik dan uji kemampuan prediktif kondisional Giacomini–White, yang membandingkan loss kondisional pada informasi terpilih.
Bandingkan ramalan penuh dengan skor proper pada hasil yang sama
PIT terutama diagnostik, bukan pemeringkat tunggal ramalan densitas. Log score dan continuous ranked probability score (CRPS) memberi loss skalar pada setiap ramalan-hasil; menurut definisinya, expected loss minimum saat distribusi prediksi benar dilaporkan. Rata-rata satu sampel tidak membuktikan model benar. Panduan Model Confidence Set membahas perbandingan berbasis himpunan. Terapkan skor yang didefinisikan untuk distribusi penuh pada outcome out-of-sample yang sama.
Sebutkan target, horizon, tanggal bersama, konvensi loss, dan benchmark. Log score sangat sensitif terhadap densitas yang sangat kecil pada observasi; CRPS membandingkan CDF dengan sensitivitas berbeda. Ketidakpastian perbedaan skor perlu memperhitungkan dependensi serial, estimasi, dan pencarian model. Gunakan plot PIT bersama skor untuk tujuan berbeda.
Kalibrasi atau skor yang lebih baik tidak membuktikan profit trading. Klaim trading perlu aturan keputusan, waktu informasi, ukuran posisi, biaya transaksi dan pendanaan, serta evaluasi return out-of-sample yang terpisah. Statistik evaluasi ramalan bukan return backtest.
Gunakan alur kerja PIT yang dapat direproduksi
Tetapkan target, horizon, waktu origin, vintage hasil, dan apakah distribusi kontinu, diskret, atau campuran. Simpan setiap CDF atau informasi untuk merekonstruksinya bersama hasil dan information set. Hitung (F_t(Y_t)) untuk distribusi kontinu; untuk lompatan gunakan PIT acak yang didokumentasikan atau diagnostik diskret yang sesuai.
Periksa distribusi marginal dan urutan waktu. Nyatakan bin, jumlah sampel, penanganan ties, serta seed atau prosedur pengacakan berulang. Tambahkan uji independensi/kondisional untuk pertanyaan yang ditetapkan sebelumnya dan inferensi sesuai desain bergulir, overlap, atau estimasi. Bandingkan model secara terpisah dengan skor proper pada outcome held-out yang sama. Kesimpulan berlaku bagi ramalan dan kondisi yang didefinisikan, bukan jaminan kalibrasi masa depan atau profit.
Pertanyaan umum
Q1Apakah PIT uniform membuktikan ramalan densitas benar?
Tidak. PIT uniform adalah kondisi diagnostik yang diperlukan untuk ramalan kontinu yang benar, tetapi uniformitas gabungan tidak membuktikan independensi atau kalibrasi kondisional. Periksa dependensi waktu dan variabel kondisi yang relevan.
Q2Perlukah PIT acak untuk ramalan diskret?
Gunakan bila menginginkan acuan continuous-uniform di bawah distribusi diskret yang benar. Undian tambahan menyebarkan hasil pada lompatan CDF. Catat metode dan seed; diagnostik khusus diskret bisa dipilih jika randomisasi dihindari.
Q3Apa arti histogram PIT berbentuk U?
Sering konsisten dengan ramalan yang terlalu terkonsentrasi; puncak tengah sering konsisten dengan ramalan terlalu menyebar. Anggap pola sebagai petunjuk, lalu periksa dependensi, rezim, sampel, dan bin.
Q4Apakah histogram PIT yang lebih baik sama dengan skor ramalan lebih baik?
Tidak. PIT mendiagnosis perilaku distribusi; skor proper membandingkan ramalan di bawah loss dan target tertentu. Laporkan keduanya pada outcome out-of-sample yang sama dan jangan menafsirkannya sebagai profit trading. Riset primer - Rosenblatt, “Remarks on a Multivariate Transformation” (1952) - Diebold, Gunther, and Tay, “Evaluating Density Forecasts with Applications to Financial Risk Management” (1998) - Berkowitz, “Testing Density Forecasts, with Applications to Risk Management” (2001) - Gneiting, Balabdaoui, and Raftery, “Probabilistic Forecasts, Calibration and Sharpness” (2007) - Brockwell, “Universal Residuals: A Multivariate Transformation” (2007) - Czado, Gneiting, and Held, “Predictive Model Assessment for Count Data” (2009)
Sumber dan bacaan lanjutan
Laporkan masalah
Kami akan menyiapkan email berisi tautan artikel ini. Mark menerima laporan setelah Anda mengirimkannya
Cek cepat
Sudah membaca panduannya? Uji diri dengan 3 pertanyaan
Pertanyaan 01
Apa implikasi teorema PIT untuk ramalan kondisional kontinu yang benar?
Pilih jawaban untuk melihat penjelasannya